Инструменты
Как выбрать LLM для работы: опыт тестирования Claude, GPT и Gemini
Новая LLM может блестяще писать код, но справится ли с ошибкой в вашем репозитории? А модель, хорошо анализирующая документы, — с таблицами, где возвраты в отдельном файле, а правила расчёта выручки менялись трижды? Игорь Зуриев, автор канала «Нейросетка» и преподаватель Karpov.Courses, рассказывает, как проверить LLM на реальных рабочих задачах.
Он предлагает начать с опубликованных тестов, чтобы отсеять явных аутсайдеров, а затем выбрать 2–4 кандидата. Главное — сформулировать собственную задачу и чёткие условия приёмки: что должно получиться, как проверить результат и сколько ручной работы допустимо. На примере Fable 5.1, Stitch и Sonnet 5 автор показывает, что качество кода и объём доработок — разные метрики.
Источник: habr.com