NVIDIA srt-slurm: валидируем бенчмарки LLM-сервинга через YAML и парето-фронтьер
NVIDIA опубликовала детальный туториал по фреймворку srt-slurm — инструменту для превращения декларативных YAML-конфигураций в воспроизводимые SLURM-бенчмарки распределённого LLM-сервинга. Основная утилита srtctl позволяет задавать кластерные настройки, контейнеры, пути к моделям и автоматически генерировать sbatch-скрипты. В туториале разбирают установку, архитектуру репозитория и создание конфига srtslurm.yaml для симуляции кластера внутри Google Colab.
Особый интерес представляет моделирование disaggregated-развёртывания (prefill + decode) для DeepSeek-R1 с генерацией параметрических sweep'ов и анализом имитированных результатов. Вместо реального SLURM-кластера Colab используется как среда для разработки и валидации рецептов — от dry-run до построения парето-границ throughput/latency. Фреймворк поддерживает движки SGLang, TRT-LLM, vLLM и встроенный мокер, а также включает готовые рецепты для H100, B200, GB200 и других платформ.
Туториал завершается демонстрацией анализатора логов srtlog и Streamlit-дашборда с парето-фронтьерами. Это practical-руководство для инженеров, которые хотят стандартизировать нагрузочное тестирование LLM-инференса и переносить бенчмарки между средами без потери воспроизводимости.