NVIDIA Vera Rubin NVL72: в 30 раз больше работы на ватт для ИИ-агентов
Агентные ИИ-нагрузки потребляют в 15 раз больше токенов, чем простой чат: каждый шаг агента накапливает контекст, а суб-агенты порождают новые запросы. NVIDIA измерила производительность Vera Rubin NVL72 на бенчмарке SemiAnalysis AgentX, который воспроизводит реальные сессии кодирования с ростом контекста, вызовами инструментов и порождением суб-агентов.
Результаты: Vera Rubin NVL72 показывает до 30× более высокую пропускную способность на мегаватт по сравнению с GB300 NVL72 на модели DeepSeek V4 Pro. Для энергоограниченных AI-фабрик это означает 30× больше агентной работы при том же энергопотреблении. Стоимость миллиона токенов снижается до 35 раз.
NVIDIA также применяет технологию DSX MaxLPS, которая управляет питанием на уровне GPU, стойки и рабочей нагрузки, позволяя разместить до 40% больше GPU в том же энергобюджете. В Vera Rubin реализован экстремальный codesign всех уровней платформы для многократного прироста эффективности инференса.