Aleph Alpha выпустила Kolibri: 78 млрд параметров, но активны только 3,5 — модель для суверенного ИИ в Европе
Aleph Alpha выпустила Kolibri — bilingual MoE-трансформер, обученный «с нуля» в Германии и Финляндии. У модели 78,1 млрд параметров, но на каждый токен активируется лишь 3,46 млрд (4,4%). Контекст — до 1 048 576 токенов, а пользователь может регулировать уровень reasoning на запрос. Модель уже доступна на Hugging Face под лицензией Apache 2.0.
Архитектура: 50 блоков, ширина 2560, 384 эксперта с sigmoid-роутером (top-6 + 1 общий эксперт). Балансировка — Exact Quantile Balancing и Load-Error Injection. Внимание — гибридное: каждые 5 блоков — полное внимание без позиционного кодирования, остальные 40 — sliding-window на 512 токенов с RoPE. Это позволяет при равных вычислительных затратах обрабатывать последовательности в 4 раза длиннее, чем full-attention модель.
Токенизатор на 128 000 токенов (UniBPE) специально заточен под немецкий: на немецком тексте даёт 4,90 байта на токен против 4,35 у GPT-5 (на 11,2% меньше токенов). На английском — 4,58 против 4,67 у GPT-5. Предобучение прошло на 20 трлн токенов (768 NVIDIA B200), затем 3,44 трлн на последовательностях 65 536, и финальный long-context этап — 201 млрд токенов на окне 262 144. Более 2 трлн немецких токенов собраны или сгенерированы синтетически.
Пост-тренинг: SFT + MergeMix + RL на 1,2 млн внутренних задач. Протокол Merlin-Arthur учит модель воздерживаться от ответа, если контекст не подтверждает факты. Kolibri нацелена на суверенное развёртывание в регулируемых секторах (госадминистрация, промышленность, аэрокосмос). Чекпоинт в FP8 весит ~78 ГБ и работает на одном B200, B300, H200 или двух H100 SXM5 через vLLM с кастомными парсерами для reasoning и вызова инструментов. Модель соответствует EU AI Act, GDPR и Кодексу практики общего назначения ИИ.