Проблема скрытых ошибок ИИ-агентов

Традиционные инструменты мониторинга программного обеспечения настроены на поиск явных сбоев: падений приложения, ошибок в коде или задержек в работе серверов. Однако ИИ-агенты создают новый тип проблем. Они могут успешно завершить все технические этапы задачи, но при этом неверно понять инструкции пользователя, использовать неправильные данные или зациклиться на бесполезном действии.

Такие ошибки называют семантическими. С точки зрения обычной системы мониторинга запрос выглядит корректным, но по факту агент может выдать устаревший отчет или использовать выдуманную информацию. Это становится критической проблемой по мере того, как ИИ-агенты переходят от простых чат-ботов к сложным многошаговым процессам, взаимодействующим с базами данных и внешними сервисами.

Новый уровень наблюдаемости

Компания Lemma разрабатывает слой наблюдаемости, специально предназначенный для отслеживания путей выполнения ИИ-агентов. Система превращает каждое действие агента в структурированный след (trace), который включает в себя вызовы языковых моделей, использование инструментов, входные и выходные данные, а также временные метки. Это позволяет инженерам видеть не только финальный ответ, но и всё дерево выполнения задачи.

Платформа анализирует эти данные на соответствие инструкциям агента и группирует повторяющиеся ошибки в закономерности. Это помогает командам находить скрытые проблемы, которые иначе было бы невозможно заметить среди тысяч отдельных взаимодействий. При обнаружении серьезных сбоев система может отправлять уведомления в Slack.

Ускорение процесса исправления ошибок

Lemma стремится сократить время между обнаружением проблемы и её решением. Когда платформа находит повторяющуюся ошибку, она анализирует контекст и предлагает вероятную причину сбоя. Это позволяет инженерам не восстанавливать каждое взаимодействие вручную, а сразу вносить изменения в промпты, логику приложения или рабочие процессы агента.

Разработчики могут использовать данные Lemma непосредственно в привычных инструментах, таких как Cursor или Claude Desktop. Это позволяет проводить отладку в той же среде, где создается агент. После внесения исправлений система может превратить реальный сбой в автоматический тест, чтобы убедиться, что подобная ошибка больше не повторится.

Инвестиции и цели компании

Основатели Джерри Чжанг и Коул Говин создали Lemma, столкнувшись с трудностями при внедрении ИИ-агентов в реальные рабочие процессы. Они отмечают, что простого улучшения базовых языковых моделей недостаточно, так как поведение агента зависит от множества факторов: промптов, интеграций и поведения пользователей.

Привлеченные $2,3 млн в раунде pre-seed, в котором участвовали Y Combinator и представители OpenAI, xAI и Meta*, будут направлены на развитие инструментов обнаружения ошибок. Основное внимание уделят стартапам, которые уже используют ИИ-агентов в реальных задачах.

Что это значит

По мере того как ИИ-системы переходят от демонстрационных моделей к автономному выполнению сложных задач, традиционного мониторинга становится недостаточно. Развитие инструментов вроде Lemma позволит превращать реальные ошибки из эксплуатации в систематические тесты, помогая агентам обучаться на основе своего опыта в реальном мире.

* Деятельность Meta (соцсети Facebook и Instagram) запрещена в России как экстремистская.