Вышла Inkling-Small: 276B параметров, 12B активных, открытые веса и запуск на одной B300
Thinking Machines Lab представила Inkling-Small — открытую MoE-модель с 276B параметров, из которых активны 12B. Это примерно вчетверо меньше старшей модели Inkling (975B/41B). Веса опубликованы под лицензией Apache 2.0 на Hugging Face. Модель обучалась на кластере NVIDIA GB300 NVL72 и поддерживает контекст до 1M токенов. Ключевая особенность — возможность запуска на одной видеокарте B300 в режиме NVFP4 (W4A4) или на двух H200 (W4A16). Для BF16-версии требуется не менее 600 ГБ видеопамяти (4× B300 или 8× H200).
Архитектура: 42-слойный decoder-only трансформер со спарсным MoE (6 из 256 экспертов на токен + 2 общих эксперта). Внимание гибридное — локальные и глобальные слои. Модель энкодер-фри, мультимодальность встроена нативно: изображения делятся на патчи 40×40 пикселей и обрабатываются четырёхслойным hMLP, аудио — через спектрограммы dMel. Поддерживаются форматы BF16, MXFP8 и NVFP4. Аудиовход — WAV 16 кГц (до 2 минут), выход — только текст.
По бенчмаркам Inkling-Small превосходит Inkling на ряде тестов: Humanity's Last Exam (31,6% против 29,7%), SWE-bench Verified (80,2% против 77,6%), Terminal-Bench 2.1 (64,7%), Toolathlon Verified (54,4% против 45,5%), GPQA Diamond (89,5%), AIME 2026 (95,5%), ARC-AGI-2 (40,1% против 36,5%). Однако уступает на SimpleQA Verified (20,6% против 43,9%) и Tau 3 Banking (15,5% против 23,7%). Мультимодальные результаты близки к Inkling при меньших затратах: MMMU Pro 74,0%, CharXiv RQ 77,4% (81,3% с Python-инструментами).
По эпистемике модель обучена с RL на реальных прогнозных вопросах: ForecastBench без поиска даёт Brier Index 61,3 ± 0,46 (у Inkling 60,1). Показатели безопасности: StrongREJECT 98,4%, FORTRESS adversarial 71,6%, FORTRESS benign 96,9%. В лаборатории заключили, что модель не создаёт существенного прироста рисков за пределами существующих открытых моделей, и рекомендуют дополнить её защитными слоями при развёртывании.