Волна ИИПодписаться
← Назад
Модели и агенты

Jev на тестах: 22 эксперимента, 160k запросов и границы доверия к System One модели

01.10.2026 · habr.com ↗

С 19 по 30 сентября 2026 года было проведено 22 эксперимента и отправлено около 160 тысяч запросов к модели Jev версии 1.13.0 и контрольным моделям OpenAI. Все тесты запускались через API раннего доступа и обошлись примерно в $18. Цель — не столько проверить скорость и цену, сколько найти границы практического применения Jev как System One модели.

Исследовались ключевые вопросы: точность Jev по сравнению с небольшими GPT-моделями, надёжность её confidence-оценок (можно ли на их основе строить автоматический роутинг), поведение при расширении списка классов, длинном контексте, «грязном» входе и тексте на другом языке. Также проверялись известные эффекты LLM, такие как lost in the middle и склонность уверенно ошибаться.

Результаты тестирования позволяют заранее знать, где Jev можно доверять, а где требуется дополнительная проверка. Автор поделился данными, чтобы сообщество могло учитывать эти ограничения при интеграции.

Источник: habr.com
← Все новости AI Wave