Модели и агенты
Nvidia запускает Groq 3 LPX: 3400 токенов/сек, но для скорости нужно 64 чипа против 1-2 у Cerebras
Nvidia переводит свой инференс-чип Groq 3 LPX в массовое производство и отчиталась о производительности: 3400 токенов в секунду на модели Gemma 4 31B. По заявлению компании, это в четыре раза быстрее, чем у Cerebras. Однако, как отмечает The Register, цифры не отражают полной картины.
Дело в том, что Nvidia для достижения такого результата использует как минимум 64 ускорителя Groq 3 LPX, тогда как Cerebras обходится одним или двумя. Кроме того, остаётся открытым вопрос, как архитектура масштабируется на большие MoE-модели — для этой задачи нужны отдельные тесты.
Источник: the-decoder.com