Как я учил инфраструктурного LLM-агента не врать: 44 из 45 сценариев пройдены
Автор делится опытом создания внутреннего read-only LLM-агента для инфраструктурных расследований. Инженер задаёт вопрос на естественном языке, а агент собирает доказательства из Kubernetes, метрик, логов, GitLab, Grafana и других источников. Реальный кейс показал, что простого промпта недостаточно: edge-сервер вернул 502, хотя приложение для того же request_id записало успешный редирект 302.
Чтобы найти причину и не придумать удобное объяснение, агенту пришлось научиться связывать источники, удерживать время и scope, различать факты, гипотезы и отсутствующие данные. В статье разбирается архитектура на Go, DeepSeek, Qwen и MCP: планирование по evidence, контракты tools, память треда, подключение командных skills через n8n и evaluation на реальных сценариях. В последнем полном прогоне прошли 44 из 45 сценариев, включая все 29 обязательных.