От мониторинга до управляемого DevOps.
Три тарифа. Одна цель: уверенность в серверах.
Режим Watchdog
Watchdog запускает настроенные проверки и отправляет алерты. Поддерживаемые действия кнопками следуют runtime policy; AI для этого режима не нужен.
Для DevOps, SRE и команд, которым нужен контроль
- Мониторинг статуса — CPU, RAM, диск, сервисы — всегда на виду
- Алерты о падениях — Получай алерт, когда настроенная проверка обнаружит поддерживаемый сбой
- Фиксы в один тап — Подтверждай рестарт или repair-действия для типовых сервисов из чата
- Управление Docker — Жизненный цикл контейнеров из чата
- Триггеры — Если X случилось, делай Y. Ты задаёшь правила.
- Playbooks — Поддерживаемые скрипты создают approval-required actions
- Дашборд — Веб-интерфейс для обзора всех серверов
- Audit logs — Записанные approval-решения, поддерживаемые действия и результаты
Deployment Bro
Говори с серверами на обычном языке. Bro собирает контекст, диагностирует поддерживаемые проблемы и запускает поддерживаемые действия по runtime policy.
Для вайб-кодеров и тех, кто быстро шипит
- Естественный язык — «Почему приложение тормозит?» — получи реальный ответ
- Контекст-aware — Bro помнит твою конфигурацию и историю
- Умная диагностика — 9 рецептов — читает логи, находит причину, объясняет просто
- Git-деплои — «Задеплой мои изменения» — готово, с авто-откатом для поддерживаемых режимов
- Investigation Mode — Явно авторизованная bounded execute_command session для AI-клиентов
- Дашборд аномалий — 9 детекторов с auto-mute и rate limiting
- 40 MCP-инструментов — Полный доступ из Claude Code, Cursor, Codex
- BYOK — Используй свой API-ключ OpenAI/Anthropic
- Всё из Watchdog — Все алерты и действия с подтверждением включены
LAYER 4: Investigation Mode (для AI-клиентов)
Явно авторизованный server-scoped bypass только для execute_command в AI-assisted incident session.
Problem: Per-action 2FA ломает поток AI. Дебаг-сессия — это 5–10 exec-действий, каждое требует пуш и подтверждение. AI-ассистенты (Claude Code, Cursor, Codex) теряют контекст между апрувами; оператор устает.
Solution: Явно авторизуй Investigation session — после этого mttrly_execute_command может выполняться в пределах выбранного сервера, inactivity timeout, hard cap и action limit. Bypass закрывается при достижении лимита или отзыве пользователем.
- ✓Server-scoped — bypass на одном сервере не действует на другой
- ✓Atomic action counter — параллельные вызовы не превысят max_actions
- ✓Bypass применяется только к mttrly_execute_command. mttrly_execute_script, запись файлов, repair и update агента остаются per-action approval-required
- ✓Тюнингуется на acquire — inactivity 1–120 мин, max actions 1–100
- ✓Hard cap не настраивается (2ч) — защищает от случайного открытия bypass на 24 часа
Сделано специально под Claude Code / Cursor / Codex воркфлоу. Доступно на Deployment Bro и выше.
Управление аномалиями
Проактивный мониторинг с auto-mute, rate-limit и дашбордом, которым реально пользуются.
Детекторы, которые работают сейчас
systemd_pm2_mismatch — Сервис под PM2 без systemd unit (или наоборот)port_service_mismatch — Слушающий порт без определения сервисаkernel_error — Ошибки dmesg — OOM kills, hardware faults, segfaultsstale_backups — Бэкапы не выполняются по расписаниюsystemd_unit_drift — Unit-файл изменился относительно known-goodincident_spike — Резкий кластер инцидентов на сервереdeploy_failure_cluster — Несколько деплоев валятся подрядinvestigation_churn — Одна и та же проблема расследуется снова и снова без решенияagent_update_stale — Версия агента устарелаКак это работает на практике
- ✓FP-budget auto-mute — повторные ложные срабатывания на правиле автоматически приглушают его
- ✓Notification rate limiter — никаких пейдж-штормов в 3 ночи
- ✓Acknowledge proactive events — отметь как принято или ложное срабатывание
- ✓Дашборд аномалий — обзор, ack и mute с одного экрана
- ✓Morning brief — проактивные находки + свежие knowledge в одном дайджесте
Быстрое сравнение
| Возможность | Watchdog | Deployment Bro | Deployment Crew |
|---|---|---|---|
| Как взаимодействовать | Кнопки и /команды | Обычный язык | Обычный язык |
| Серверы | 1 | 3 (+1500₽/доп.) | 9 (+1500₽/доп.) |
| Порог входа | Нулевой | Нулевой | Нулевой |
| Алерты о падениях + фиксы с подтверждением | ✓ | ✓ | ✓ |
| Алерты | ✓ | ✓ | ✓ |
| Дашборд | — | ✓ | ✓ |
| Естественный язык | — | ✓ | ✓ |
| Умная диагностика (9 рецептов) | — | ✓ | ✓ |
| Bounded execute_command Investigation | — | ✓ | ✓ |
| Дашборд аномалий | — | ✓ | ✓ |
| Проактивный мониторинг | — | ✓ | ✓ |
| Фиксы с подтверждением | Типовые сервисы | Простые проблемы | Простые проблемы |
| Git-деплои | — | ✓ | ✓ |
| Пайплайн деплоя | — | ✓ | ✓ + webhooks (soon) |
| Командный доступ | — | — | Coming Soon |
| Provisioning | — | ✓ | ✓ |
| MCP-инструменты | Стартовый доступ | 40 | 40 |
| Поддержка | Community | Приоритет |
Feature Deep Dive
Further Reading
Site Reliability Engineering: How Google Runs Production Systems ↗
Betsy Beyer, Chris Jones, Jennifer Petoff, Niall Richard Murphy · Book (Free Online)
The foundational SRE text defining MTTR, monitoring, alerting, and incident response practices used by Google and adopted industry-wide.
Accelerate: The Science of Lean Software and DevOps
Nicole Forsgren, Jez Humble, Gene Kim · Book
Research-backed evidence that MTTR is one of the four key metrics predicting software delivery performance and organizational outcomes.
Observability Engineering: Achieving Production Excellence
Charity Majors, Liz Fong-Jones, George Miranda · Book
Modern observability practices that reduce MTTR by improving detection and diagnosis — moving beyond traditional monitoring.
Подключите один сервер и проверьте реальный workflow.
Регистрация начинается с email. Для внутренней диагностики нужен outbound-агент; approval-required действия обычно ждут вас, а bounded Investigation и настроенная preauthorization остаются аудированными исключениями.