Фичи и апдейты
Локальный LLM-сервис за два дня: инженерный разбор с кейсом на DGX Spark и AMD GPU
Когда абстрактные вопросы про инференс и локальное развёртывание превратились в практическую задачу, инженер прошёл путь от теории до production: поднял две LLM на DGX Spark, отдельную распознающую речь модель на AMD GPU, и интеграцию с мультиагентной платформой. Статья — честный лог того, что пошло не так и как это чинили.
Ключевые инсайты: файл модели — это ещё не сервис, длинный контекст немедленно упирается в конкуренцию с KV-кэшем и параллелизмом, а метрика tokens/sec обманчива — реальная пользовательская задержка сильно отличается. Иногда приходится откатывать более быструю модель обратно из-за падения качества ответов.
Источник: habr.com