Почему DeepSeek догоняет OpenAI: внутренние модели и дистилляция знаний
У OpenAI и других фронтир-лабораторий нет одной единственной «лучшей модели». На деле это фабрика: research-чекпоинты, экспериментальные модели, reward-модели, модели-учителя, генераторы синтетических данных, evaluators, дистиллированные студенты — и только последний элемент цепочки попадает в продукт. Внутренняя research-модель максимизирует возможности, а production-модель одновременно вынуждена балансировать intelligence, latency, стоимость GPU, throughput, reliability и safety.
Дистилляция знаний — стандартная практика, которую OpenAI даже официально предлагает разработчикам через Model Distillation workflow. Суть: дорогая модель-учитель (GPT-4o или o1-preview) генерирует качественные ответы, траектории рассуждений и синтетические данные, а на них обучается компактный студент. Он не воспроизводит учителя целиком, но переносит нужные возможности при существенно меньшей стоимости каждого запроса.
Именно эта асимметрия объясняет, почему DeepSeek и другие игроки догоняют OpenAI: они могут использовать дистилляцию на мощных открытых или доступных моделях, сокращая разрыв в intelligence. При этом лучшая research-модель OpenAI остаётся недосягаемой — но на конкретных задачах хорошо дистиллированный студент может показать сопоставимый результат за копейки.