Волна ИИПодписаться
← Назад
Фичи и апдейты

Perplexity раскрыла внутреннюю архитектуру GPU-инференса эмбеддингов: Ivy, Tulip и ROSE

06.09.2026 · marktechpost.com ↗

Perplexity показала, как устроен её стек для инференса эмбеддингов. Вместо отдельного движка инженеры переиспользовали ядра prefill и decode из LLM-стека — это позволило унифицировать инфраструктуру для батчевой (переиндексация) и онлайн-обработки (короткие запросы). Три сервиса делят работу: Ivy отвечает за CPU-часть (JSON, токенизация, разбивка батчей), Tulip — за планирование и диспетчеризацию, а ROSE — за собственно инференс на GPU.

Ключевое упрощение — планировщик работает по принципу first-come, first-served. Для небольших эмбеддинг-моделей вычислительная стоимость плотных слоёв доминирует над квадратичной сложностью внимания, поэтому латентность линейно зависит от числа токенов, а не от числа последовательностей. При насыщении GPU (~512 токенов на субмиллиардной модели) добавление новых последовательностей не повышает эффективность.

Для мелких батчей Perplexity использует CUDA-графы на всю модель, захватывая все запуски в один вызов драйвера. Чтобы обойти ограничения некоторых реализаций внимания, инженеры доработали FlashInfer. Графы захватываются по конфигурациям с паддингом до кратных 64 или 256 токенов — это даёт тысячи графов и минуты захвата на модель. Решение — ленивый захват: первый запрос прогревает, второй — захватывает и воспроизводит. LazyTensor, в свою очередь, позволяет не блокировать step() на устройстве, а возвращать асинхронный объект, с которым параллельно работает Rust-задача.

Источник: marktechpost.com
← Все новости AI Wave