Почему дети учат язык в сто тысяч раз эффективнее ИИ: разрыв в данных остаётся загадкой
Дети учат родной язык практически без усилий, услышав около 100 миллионов слов к подростковому возрасту. Современные языковые модели вроде Llama 3.1 потребляют 15 триллионов токенов на предобучение — в сто тысяч раз больше. Эта пропасть называется разрывом в эффективности данных, и она remains одним из главных вызовов для AI-индустрии.
Когнитивист Майкл Фрэнк из Стэнфорда отмечает: «Мы сжигаем лес и выскребаем всю сумму человеческих знаний, чтобы воспроизвести то, что происходит в наших гостиных за год». Исследователи надеются, что понимание механизмов детского обучения позволит создавать гораздо более экономичные модели — особенно актуально на фоне исчерпания интернет-данных к 2030-м годам.
Если напечатать все слова, на которых обучалась современная LLM, стопка бумаги достанет до МКС. У ребёнка — 20 метров. Вопрос в том, возможно ли в принципе обучить ИИ на таком же объёме, или детский мозг использует врождённые языковые инстинкты. Эксперименты с воспроизведением детского опыта в моделях могут дать ответы на фундаментальные вопросы о природе языка и мышления.
Пока же ясно одно: дети по-прежнему превосходят самые передовые LLM в эффективности усвоения языка. Разгадка этого парадокса может изменить как подходы к построению AI, так и наше понимание человеческого разума.