🧠 Raschka собрал ИИ-детектор на DistilBERT с нуля ИИ-детектор текста — это не магический арбитр авторства, а обычный классификатор, обученный с учителем. Себастьян Рашка собрал полный проект: сбор датасета, дообучение DistilBERT, локальное развертывание API и веб-интерфейс. По данным Ahead of AI, модель возвращает оценку от 0 до 100. Отличие принципиальное: это не «вероятность, что текст написан ИИ» в бытовом смысле, а оценка принадлежности к классу текстов, созданных ИИ, относительно обучающего распределения. Тот же текст на другом датасете может получить другую оценку. Метод повторяет подход Pangram, который, насколько известно автору, стоит за ИИ-детектором Substack. Внутри нет генеративной LLM — компактный DistilBERT работает быстрее и дешевле локального запуска большой генеративной модели. Отдельный сценарий из статьи: проверять свои тексты после проверки грамматики, чтобы автозамена не «переполировала» их до типичного ИИ-стиля. Детектор также используют как проверяющий модуль в цикле RLVR (обучение с верифицируемым вознаграждением) для малой модели, которая учится обходить этот фильтр. Ограничение здесь не в точности, а в природе самой задачи. Детекторы ловят закономерности текущего поколения LLM, и следующая модель может случайно или намеренно их не воспроизвести. Отсюда ложные срабатывания: человеческий текст иногда получает высокую оценку. Рашка прямо называет ИИ-детекторы игрой в кошки-мышки и строит проект как способ изучить этот предел в небольшом масштабе, без претензии на универсальный детектор. Для русскоязычного ML-сообщества это готовый шаблон проверить ложные срабатывания на собственных текстах до внедрения в продукт, а не после жалоб пользователей. Самый честный сценарий из проекта — не ловить чужие тексты, а проверять свои после проверки грамматики. Детектор в роли фильтра для собственной писанины полезнее, чем в роли арбитра на входе. #AIдетектор #DistilBERT #RLVR #локальныйинференс