Исследования
Пост-тренинг убивает стиль LLM: модели пишут одинаково из-за ограничений безопасности
Брэдли Эми, CTO компании Pangram, заявил, что LLM пишут в узнаваемом стиле не потому, что не могут лучше, а из-за пост-тренинга и guardrails. По его словам, базовые модели без этих ограничений демонстрируют гораздо более широкий диапазон выразительности, сравнимый с человеческим.
Эми утверждает, что именно этапы пост-тренинга — RLHF, инструктивная настройка и фильтры безопасности — резко сужают экспрессивный диапазон моделей. В результате тексты разных LLM становятся похожими и легко детектируются как машинные, хотя потенциал для естественного письма у моделей есть.
Источник: the-decoder.com