NVIDIA представила Groq 3 LPX: инференс для ИИ-агентов в 4 раза быстрее конкурентов
NVIDIA расширяет платформу Vera Rubin для задач инференса в агентных системах. На конференции Hot Chips компания объявила о начале полномасштабного производства Groq 3 LPX — стойки, оптимизированной для генерации токенов с минимальной задержкой. В бенчмарке Artificial Analysis с открытой агентной моделью Gemma 4 31B система показала 3400 выходных токенов в секунду при длине контекста 100 000 токенов, что в 4 раза превосходит ближайшую конкурирующую платформу.
Партнёры уже внедряют решения на базе Vera Rubin. SpaceXAI объявила, что будет использовать NVIDIA Vera CPUs для агентного ИИ — от ЦОДов на Земле до орбитальных спутников. CoreWeave запустил в продакшн сеть Spectrum-X Multiplane, соединяющую стойки Vera Rubin через несколько параллельных коммутаторов с высокой пропускной способностью. Nebius стал первым AI-облаком, внедрившим Groq 3 LPX, что даёт разработчикам доступ к сверхбыстрой генерации токенов для интерактивных агентов.
NVIDIA делает ставку на «экстремальный кодезайн»: оптимизацию не отдельных компонентов, а всей фабрики ИИ — от вычислений и сети до ускорения инференса. По мере перехода ИИ от обучения к рассуждению и агентным сценариям, растёт объём генерируемых токенов и размер контекстных окон. Groq 3 LPX в связке с Vera Rubin NVL72 призвана обеспечить экономичную инфраструктуру для таких нагрузок.