Тесты и бенчмарки
LLM против базы на 253 таблицы: какой способ подключения победил в реальном бенчмарке
В отделе поспорили, как эффективнее подключать LLM к базе данных с 253 таблицами: через MCP-инструменты, закладывая схему прямо в промт, или комбинированным способом. Чтобы разрешить спор, собрали бенчмарк из 29 реальных вопросов аналитиков и замерили execution accuracy, стоимость и задержку.
Победил подход, за который изначально не голосовал никто из участников. Самое неожиданное: чаще всех ошибался не LLM, а сам составитель бенчмарка — трижды, и один раз модель сама поправила его вопрос. В статье подробно разобраны четыре дефекта харнесса, которые выдавали правдоподобные числа вместо реальных падений, и объяснено, почему семантика, зашитая в код, остаётся потолком для любого подхода.
Источник: habr.com