Волна ИИПодписаться
← Назад
Модели и агенты

Beam от Reflection AI: 501B параметров, 23B активных — открытая MoE-модель для кодинга и агентов

05.10.2026 · marktechpost.com ↗

Reflection AI выпустила свою первую открытую модель Beam — разреженную MoE (Mixture-of-Experts) с 501 миллиардом параметров, из которых активны только 23 миллиарда на токен. Модель создана с нуля для корпоративных задач кодинга, рассуждений и агентных нагрузок. Разработчики заявляют, что Beam напрямую конкурирует с более крупными открытыми моделями вроде GLM 5.2, при этом тратит в 3–4 раза меньше вычислительных ресурсов на инференс в бенчмарках рассуждений. Пока модель не доступна для самостоятельного хостинга — она проходит финальное красно-командное тестирование, а ранний доступ открыт по вайтлисту на платформе Reflection.

Предобучение Beam прошло на 23,8 триллиона токенов из веба, публичных и лицензированных источников. Курация отсеяла около 95% сырых токенов, но сохранила примерно 1,8 триллиона высококачественных, которые обычные фильтры отбраковали. Архитектура чередует локальное и глобальное внимание с мелкозернистыми маршрутизированными экспертами, а балансировка нагрузки основана на методе DeepSeek-V3 без вспомогательных потерь. Обучение заняло менее 4 недель на 6 144 GPU NVIDIA GB300 NVL72 с полезной производительностью 92,3%. Затем модель дообучили до контекста в 1 миллион токенов.

Ключевой этап — Reinforcement Learning на 10 500 GPU GB300 в течение 4 недель, сгенерировавший более 100 миллионов развёртываний. Максимальный контекст развёртывания — 256K токенов. Для обучения и оценки использовалось около 1,3 миллиарда песочниц в почти миллионе сред кодинга, агентов и STEM. Reflection применила полностью асинхронные градиенты политики, где каждый токен помечен версией политики. Новые алгоритмы сохраняли стабильность обучения даже при отставании в 107 версий весов. Система выдерживала в среднем 110 тысяч одновременных развёртываний, а новые веса достигали инференс-парка в медиане за 12 секунд.

На бенчмарках Beam показывает: SWE-bench Verified — 80,9% (против 70,7% у Nemotron 3 Ultra), Terminal Bench v2.1 — 80,1 (близко к GLM 5.2 с 81,0). Лидеры — DeepSeek V4.1 Flash (90,6) и Kimi K3 (88,3). Reflection подчёркивает, что Beam выигрывает эффективностью, а не сырой мощностью. Модель поддерживает регулируемый параметр усилия рассуждения: низкие значения дают короткие ответы, высокие — глубокие размышления над сложными задачами. Безопасность обеспечивается отдельным учителем выравнивания, обученным с deliberative alignment.

Источник: marktechpost.com
← Все новости AI Wave