Волна ИИПодписаться
← Назад
Инструменты

Prime Inference: платформа для открытых моделей, которая уже молотит триллион токенов в день

03.10.2026 · marktechpost.com ↗

Prime Intellect представила Prime Inference — платформу для запуска открытых моделей в проде. До публичного релиза она обрабатывала почти триллион токенов в день: трафик давали RL-прогоны, генерация синтетики, оценки и длительные агентские сессии. Доступны два режима — serverless для пиковой нагрузки и reserved-мощности для постоянных потоков, с автоматическим фейловером между дата-центрами.

Это serving-слой открытого тренировочного стека Prime: компания уже поставляла посттрейнинговые инструменты (prime-rl, верификаторы, песочницы), теперь к ним добавился инференс. Стек собран на NVIDIA Dynamo, vLLM, Mooncake и FlashInfer, правки уходят в апстрим. Архитектура разделяет prefill и decode на разные группы GPU, использует кэш-ориентированную маршрутизацию и второй уровень KV-кэша в DRAM — это снижает задержки и поднимает утилизацию железа.

Prime приводит цифры для GLM-5.3 на GB200 NVL72: при цели 100 токенов/с на пользователя система держит 101 токен/с при 66 сессиях на prefill-группу (соотношение prefill/decode 1:4). Сжатие KV-кэша в NVFP4 увеличило число кэшируемых токенов на декодер с 1,09M до 1,63M. Для надёжных tool calls добавлен структурный конструктор тегов в Dynamo и токен-маскирование через xgrammar, чтобы агенты не получали битые вызовы инструментов.

API совместим с OpenAI SDK: достаточно указать https://api.pinference.ai/api/v1. Цены пока публикуются не полностью, но заявлен единый биллинг с трекингом по командам. Железо — NVIDIA Blackwell, дальше обещают Vera Rubin. Платформа заточена под агентные сценарии: типичный цикл агента добавляет около 6K токенов к контексту в 140K.

Источник: marktechpost.com
← Все новости AI Wave