От мониторинга до управляемого DevOps.

Три тарифа. Одна цель: уверенность в серверах.

Алерты плюс фиксы с подтверждением

Режим Watchdog

Watchdog запускает настроенные проверки и отправляет алерты. Поддерживаемые действия кнопками следуют runtime policy; AI для этого режима не нужен.

Для DevOps, SRE и команд, которым нужен контроль

  • Мониторинг статусаCPU, RAM, диск, сервисы — всегда на виду
  • Алерты о паденияхПолучай алерт, когда настроенная проверка обнаружит поддерживаемый сбой
  • Фиксы в один тапПодтверждай рестарт или repair-действия для типовых сервисов из чата
  • Управление DockerЖизненный цикл контейнеров из чата
  • ТриггерыЕсли X случилось, делай Y. Ты задаёшь правила.
  • PlaybooksПоддерживаемые скрипты создают approval-required actions
  • ДашбордВеб-интерфейс для обзора всех серверов
  • Audit logsЗаписанные approval-решения, поддерживаемые действия и результаты
БесплатноНачать с Watchdog
AI-Powered
Твой AI-напарник

Deployment Bro

Говори с серверами на обычном языке. Bro собирает контекст, диагностирует поддерживаемые проблемы и запускает поддерживаемые действия по runtime policy.

Для вайб-кодеров и тех, кто быстро шипит

  • Естественный язык«Почему приложение тормозит?» — получи реальный ответ
  • Контекст-awareBro помнит твою конфигурацию и историю
  • Умная диагностика9 рецептов — читает логи, находит причину, объясняет просто
  • Git-деплои«Задеплой мои изменения» — готово, с авто-откатом для поддерживаемых режимов
  • Investigation ModeЯвно авторизованная bounded execute_command session для AI-клиентов
  • Дашборд аномалий9 детекторов с auto-mute и rate limiting
  • 40 MCP-инструментовПолный доступ из Claude Code, Cursor, Codex
  • BYOKИспользуй свой API-ключ OpenAI/Anthropic
  • Всё из WatchdogВсе алерты и действия с подтверждением включены

LAYER 4: Investigation Mode (для AI-клиентов)

Явно авторизованный server-scoped bypass только для execute_command в AI-assisted incident session.

Problem: Per-action 2FA ломает поток AI. Дебаг-сессия — это 5–10 exec-действий, каждое требует пуш и подтверждение. AI-ассистенты (Claude Code, Cursor, Codex) теряют контекст между апрувами; оператор устает.

Solution: Явно авторизуй Investigation session — после этого mttrly_execute_command может выполняться в пределах выбранного сервера, inactivity timeout, hard cap и action limit. Bypass закрывается при достижении лимита или отзыве пользователем.

  • Server-scoped — bypass на одном сервере не действует на другой
  • Atomic action counter — параллельные вызовы не превысят max_actions
  • Bypass применяется только к mttrly_execute_command. mttrly_execute_script, запись файлов, repair и update агента остаются per-action approval-required
  • Тюнингуется на acquire — inactivity 1–120 мин, max actions 1–100
  • Hard cap не настраивается (2ч) — защищает от случайного открытия bypass на 24 часа

Сделано специально под Claude Code / Cursor / Codex воркфлоу. Доступно на Deployment Bro и выше.

Управление аномалиями

Проактивный мониторинг с auto-mute, rate-limit и дашбордом, которым реально пользуются.

Детекторы, которые работают сейчас

systemd_pm2_mismatchСервис под PM2 без systemd unit (или наоборот)
port_service_mismatchСлушающий порт без определения сервиса
kernel_errorОшибки dmesg — OOM kills, hardware faults, segfaults
stale_backupsБэкапы не выполняются по расписанию
systemd_unit_driftUnit-файл изменился относительно known-good
incident_spikeРезкий кластер инцидентов на сервере
deploy_failure_clusterНесколько деплоев валятся подряд
investigation_churnОдна и та же проблема расследуется снова и снова без решения
agent_update_staleВерсия агента устарела

Как это работает на практике

  • FP-budget auto-mute — повторные ложные срабатывания на правиле автоматически приглушают его
  • Notification rate limiter — никаких пейдж-штормов в 3 ночи
  • Acknowledge proactive events — отметь как принято или ложное срабатывание
  • Дашборд аномалий — обзор, ack и mute с одного экрана
  • Morning brief — проактивные находки + свежие knowledge в одном дайджесте

Быстрое сравнение

ВозможностьWatchdogDeployment BroDeployment Crew
Как взаимодействоватьКнопки и /командыОбычный языкОбычный язык
Серверы13 (+1500₽/доп.)9 (+1500₽/доп.)
Порог входаНулевойНулевойНулевой
Алерты о падениях + фиксы с подтверждением
Алерты
Дашборд
Естественный язык
Умная диагностика (9 рецептов)
Bounded execute_command Investigation
Дашборд аномалий
Проактивный мониторинг
Фиксы с подтверждениемТиповые сервисыПростые проблемыПростые проблемы
Git-деплои
Пайплайн деплоя✓ + webhooks (soon)
Командный доступComing Soon
Provisioning
MCP-инструментыСтартовый доступ4040
ПоддержкаCommunityEmailПриоритет

Feature Deep Dive

Further Reading

Site Reliability Engineering: How Google Runs Production Systems

Betsy Beyer, Chris Jones, Jennifer Petoff, Niall Richard Murphy · Book (Free Online)

The foundational SRE text defining MTTR, monitoring, alerting, and incident response practices used by Google and adopted industry-wide.

Accelerate: The Science of Lean Software and DevOps

Nicole Forsgren, Jez Humble, Gene Kim · Book

Research-backed evidence that MTTR is one of the four key metrics predicting software delivery performance and organizational outcomes.

Observability Engineering: Achieving Production Excellence

Charity Majors, Liz Fong-Jones, George Miranda · Book

Modern observability practices that reduce MTTR by improving detection and diagnosis — moving beyond traditional monitoring.

Подключите один сервер и проверьте реальный workflow.

Регистрация начинается с email. Для внутренней диагностики нужен outbound-агент; approval-required действия обычно ждут вас, а bounded Investigation и настроенная preauthorization остаются аудированными исключениями.