Волна ИИПодписаться
← Назад
Фичи и апдейты

Anthropic выпустила Plugin Evals для Claude Code: шесть типов проверок и CI-шлюз для скиллов

11.09.2026 · marktechpost.com ↗

Anthropic выпустила Plugin Evals для Claude Code — рабочий процесс, который позволяет разработчикам плагинов (скиллов) проверить, как их плагин ведёт себя на реальных промптах. Команда `claude plugin eval` прогоняет плагин, оценивает ответы Claude и сравнивает с запуском без плагина. Таким образом можно узнать, срабатывает ли скилл, выживает ли он после правок или смены модели, и даёт ли он прирост по сравнению с голой моделью.

Тесты живут в директории `evals/` внутри плагина. Каждый кейс — это подпапка с `prompt.md` и папкой `graders/`. В промпт можно добавить frontmatter: `max_turns`, `timeout_seconds`, `model`, `tags` и `allowed_tools`. Доступны шесть типов проверок: четыре дешёвых (regex, tool_used, tool_order, file_exists) считаются по транскрипту без дополнительных затрат, и два (llm и baseline) вызывают модель-судью и идут в счёт.

Ключевая метрика — Δ: разница между запуском с плагином (with-arm) и без него (without-arm). Если оба запуска дают 1.0, плагин не нужен. В документации приведён пример: один кейс получил WITH 1.00, W/OUT 0.33, Δ +0.67 за 6 запусков, $0.41 и 74 секунды. Если `tool_used: Skill` не срабатывает при естественной формулировке промпта, Δ оказывается около нуля — это та проблема, которую не ловит стандартная валидация манифеста.

Plugin Evals можно интегрировать в CI: команда `claude plugin eval . --trust-plugin --json results.json --threshold 0.8` и другие флаги. Результаты сохраняются в `evals/results/<timestamp>/report.html`, а при поддержке аккаунта публикуются на `claude.ai`. Разработчику нужен установленный Claude Code и ключ API. Новинка доступна в Claude Code v2.1.269 и выше.

Источник: marktechpost.com
← Все новости AI Wave