Исследования
Разбор AI-инфраструктуры 2026: почему 70B-модель влезает в память, но всё равно лагает
Казалось бы, если 70B-модель помещается в память видеокарты, она должна работать быстро. На практике узким местом оказывается не ёмкость памяти, а пропускная способность HBM, объём KV-кэша и разделение фаз prefill и decode.
Автор разбирает инфраструктуру по слоям: от чипа до целого кластера. Рассказывает, как NVLink и InfiniBand соединяют GPU, чем tensor parallelism отличается от pipeline, как архитектура MoE и подсистема CPU-RAM-NVMe влияют на итоговую производительность.
Главный вывод — производительность GPU-кластера упирается не в сами чипы, а в инфраструктуру вокруг них: память, сеть и балансировку нагрузки. Это объясняет, почему большие модели тормозят даже при достаточном объёме VRAM.
Источник: habr.com