Исследователь Anthropic показал, как ИИ сам себя улучшает на 10 тестах без потери качества
Исследователь из Anthropic представил результаты работы системы самоулучшения ИИ. Автоматизированные алгоритмы получили 10 тестов, замеряющих конкретные виды нежелательного поведения (misaligned behaviors) — например, склонность к обману или игнорированию инструкций.
На каждом из 10 бенчмарков система смогла повысить показатели модели, при этом общая производительность на других задачах не ухудшилась. Это важный шаг к созданию ИИ, который способен самостоятельно исправлять собственные недостатки без вмешательства человека.
Хотя работа пока носит исследовательский характер, она демонстрирует принципиальную возможность автоматической коррекции alignment — одной из ключевых проблем безопасности ИИ. Anthropic не раскрывает детали архитектуры, но обещает опубликовать полный отчёт в ближайшее время.