Intel сформулировала пять практических уроков для enterprise-агентов: плотность, латентность и масштабирование
Intel расширила бенчмарк Terminal-Bench для профилирования агентных ИИ-нагрузок и выяснила, что корпоративные агенты — это не просто инференс LLM, а комплексная системная задача. В экспериментах использовался детерминированный запись-воспроизведение ответов LLM, чтобы устранить вариативность модели и измерить чистую производительность инфраструктуры.
Пять ключевых выводов: (1) Планируйте ёмкость по плотности агентов на vCPU, а не по их общему числу — одинаковые значения плотности дают предсказуемое поведение на разных системах. (2) Не зацикливайтесь на средней загрузке CPU — измеряйте латентность выполнения задач. (3) Для систем с агентами по умолчанию используйте горизонтальное масштабирование (scale-out); вертикальное (scale-up) — только для задач с тяжёлыми вычислениями на агента. (4) Важны шесть метрик: процент успеха, стоимость задачи, время задачи, пропускная способность, плотность и латентность. (5) Развёртывание делится на три фазы: планирование, наблюдаемость и масштабирование.
Рекомендации уже протестированы на смешанной нагрузке из компиляции, тестирования SQL, трассировки лучей, сжатия и машинного обучения, что делает их применимыми к реальным enterprise-средам.