Волна ИИПодписаться
← Назад
Инструменты

Как выжать 40 токенов/с из двух RTX 3060 для Qwen3.8–27B: пошаговый гайд

25.09.2026 · habr.com ↗

Владелец двух RTX 3060 12 ГБ на платформе Z97 смог превратить их в полноценный локальный backend для модели Qwen3.8–27B (OpenCode). Изначально на длинном контексте скорость составляла всего 9 токенов/с, но после серии оптимизаций удалось достичь около 40 токенов/с в реальной агентной сессии с контекстом за 100K — без уменьшения модели и без отказа от 128K.

Ключевые приёмы: tensor split без поддержки CUDA P2P, использование Q8 KV‑cache, встроенный MTP (Multi-Token Prediction), подбор параметра n-max. Автор также делится неудачными экспериментами с NCCL и shared buffers. В статье приведены реальные long‑context тесты и проверка качества на coding‑задачах.

Источник: habr.com
← Все новости AI Wave