Шесть поломок LLM-конвейера за два месяца: проблема не в промптах
Внутренняя система ищет закупки для ИТ-компании: раз в час читает ленты 14 площадок через платный агрегатор, ещё две — напрямую. Каждое извещение проходит жёсткий фильтр по названию, затем дешёвая LLM (Claude Haiku 4.5) ставит предварительный вердикт. Для кандидатов система выкачивает документацию, средняя LLM (Claude Sonnet 5) собирает единое ТЗ и оценивает закупку по 18 критериям (14 — LLM, 4 — код). Решение принимает человек.
С июля по начало сентября система завела 4452 карточки закупок. Из них 3890 отсеял предскоринг (жёсткие правила + дешёвая LLM). 580 стали кандидатами, 198 отклонил человек на гейте, 270 закрыты как отменённые или просроченные, 23 превратились в заявки. 75% отказов человека — по коду «не наш профиль», что авторы считают сознательной слабостью дешёвой ступени.
К началу сентября журнал разработки насчитывал почти 300 записей об ошибках конвейера в проде. Авторы выделили шесть типовых мест поломок — и почти все оказались вне промптов: проблемы с парсингом документации, нестабильность агрегатора, логика фильтрации, неверные форматы данных, тайм-ауты LLM и человеческие ошибки на гейте. Вывод: надёжность конвейера упирается не в промпт-инжиниринг, а в инфраструктуру и процессы.