Волна ИИПодписаться
← Назад
Фичи и апдейты

Локальный LLM-сервис за два дня: инженерный разбор с кейсом на DGX Spark и AMD GPU

11.09.2026 · habr.com ↗

Когда абстрактные вопросы про инференс и локальное развёртывание превратились в практическую задачу, инженер прошёл путь от теории до production: поднял две LLM на DGX Spark, отдельную распознающую речь модель на AMD GPU, и интеграцию с мультиагентной платформой. Статья — честный лог того, что пошло не так и как это чинили.

Ключевые инсайты: файл модели — это ещё не сервис, длинный контекст немедленно упирается в конкуренцию с KV-кэшем и параллелизмом, а метрика tokens/sec обманчива — реальная пользовательская задержка сильно отличается. Иногда приходится откатывать более быструю модель обратно из-за падения качества ответов.

Источник: habr.com
← Все новости AI Wave