Строим детектор ИИ-текста с нуля: туториал на DistilBERT, который научит отличать человека от нейросети
Себастьян Рашка (Sebastian Raschka), известный автор книг по машинному обучению, выпустил практическое руководство по созданию AI-детектора текста с нуля. Поводом стало появление в Substack встроенной функции обнаружения AI-контента. Рашка решил совместить два интереса: объяснить механику AI-детекторов и показать, как небольшие языковые модели (SLM) могут решать полезные задачи на локальном железе.
В основе туториала — дообучение DistilBERT на задачу бинарной классификации (человек vs AI). Модель возвращает оценку от 0 до 100, где высокий балл указывает на AI-генерированный текст. Автор подчёркивает, что это учебный проект, а не production-ready инструмент: AI-детекторы — это вечная игра в кошки-мышки, и любой из них легко обойти следующей версией LLM.
Итог проекта — локально работающий API для детекции (с веб-интерфейсом), который может использоваться как человеком, так и агентами. Рашка также планирует применить этот детектор в качестве verifier для обучения SLM избегать обнаружения — показывая таким образом пример использования scorer-модели за пределами стандартных reasoning-задач.
Важное примечание: метод, описанный в гайде, похож на то, что стоит за AI-детектором Substack (так называемые Pangram-модели). Но сама статья — не про коммерческий продукт, а про то, как разобрать механику таких систем и получить hands-on опыт.