Если ты работаешь с LLM-агентами, рано или поздно сталкиваешься с одной и той же проблемой: агент ведёт себя странно, но ты узнаёшь об этом последним. PandaProbe пытается это исправить.
Что это такое
Open source платформа для трассировки, оценки и мониторинга агентов. Позиционируется как «agent engineering platform» — то есть не просто логгер, а полноценный инструмент для инженерной работы с агентным поведением.
Трассировка
Основа всего — захват полных траекторий агента: каждый вызов инструмента, каждый LLM-хоп, каждая ветка решений. Из коробки:
- Инструментирование в одну строку для всех популярных фреймворков
- Работает с любым LLM-провайдером
- Автоматически захватывает spans и метаданные
Метрики и оценка
Здесь заявлен SOTA-уровень: метрики, основанные на исследованиях и заточенные под долгие агентные сессии. Не просто «один вызов — один скор», а оценка целых жизненных циклов.
- Детектирование неопределённости агента на длинных траекториях
- LLM-as-judge с структурированной обратной связью
- Оценка полных сессий, а не изолированных трейсов
Мониторинг
Можно настроить регулярные прогоны eval’ов на продакшн-трафике — по расписанию (daily, hourly или кастомный cron). Алерты срабатывают при регрессиях по метрикам между версиями агента.
Agent Native
Интересная фича — платформа сделана так, чтобы с ней работали сами coding-агенты. Есть:
- SKILL.md — готовый скилл для агента, чтобы управлять трейсами и eval’ами через естественный язык, без дашборда
- PandaProbe CLI — полный доступ к API из терминала, удобно для CI/CD
pandaprobe traces list
pandaprobe evals runs create
pandaprobe evals scores list
То есть Claude Code, Cursor или Codex могут сами управлять мониторингом — без ручных API-вызовов.
Интеграции и цена
Python SDK с поддержкой популярных агентных фреймворков и LLM-провайдеров, плюс кастомная инструментация. Есть бесплатный Hobby-план — без кредитки, с возможностью расти дальше.

