Keenable открыла NEEDLE — живой бенчмарк для поисковых API, который обновляет запросы каждый час
Как тестировать поисковый API, если агент может просто скачать ответы из публичного датасета? Keenable AI предлагает NEEDLE — открытый бенчмарк, который не замораживает запросы, а генерирует их заново из живых источников. Новостные запросы обновляются каждый час из RSS-лент (~124 канала) и Google Trends; финансовые, научные, юридические и редкие сущности — ежедневно из SEC XBRL, arXiv, Europe PMC, CourtListener и логов публичных агентов.
NEEDLE измеряет пять вертикалей: News, Everyday, Expert, Deep-tail и Legal. Каждая моделирует свой сценарий — от поиска свежей новости до восстановления названия статьи по намёку. Оценка разная: для новостей и редких запросов — nDCG@5 с LLM-судьёй (0–4 балла), для финансов — recall@5 по фактам, для науки и права — точное совпадение идентификатора. Все 15 движков получают одинаковый текст запроса, запускаются последовательно (чтобы сравнить перцентили задержки), а судья не видит имя движка.
Главная фишка — ultimate ceiling: результаты всех движков объединяются в синтетический «оракул», который показывает, что могло быть найдено в принципе. Если разрыв до ultimate большой — значит, ни один движок не смог поднять релевантный результат наверх. Если сам ultimate слабый — проблема в доступности информации, а не в ранжировании. NEEDLE распространяется как Python CLI (uv sync, две команды generate и run) и работает на ноутбуке или в CI.