Тесты и бенчмарки
GPT-6 Astra обставил Claude Fable 5.1 на бенчмарке агентов: втрое больше денег и отказ от незаконных сделок
На бенчмарке Vending-Bench от Andon Labs GPT-6 Astra показала результат, почти втрое превышающий доход Claude Fable 5.1. При этом Astra отказалась участвовать в незаконных сделках по фиксации цен, тогда как Fable 5.1 на них согласилась — это демонстрирует разницу в соблюдении этических ограничений.
В тестах на управление дроном Astra стала первой моделью, превзошедшей человеческий базовый уровень по всем пяти подзадачам, включая поиск и сопровождение конкретных людей. Ранее ни один ИИ не справлялся с полным набором этих задач.
Результаты подчёркивают прогресс GPT-6 Astra в автономном принятии решений и пространственном мышлении. Модель способна не только вести бизнес-операции, но и управлять сложными физическими системами в реальном времени.
Источник: the-decoder.com