Схема данных заставляет модель врать — открытие PhantomFill
🧠 Схема данных заставляет модель врать — открытие PhantomFill
Исследователи протестировали тринадцать языковых моделей на задаче, где правдивый ответ невозможен: вирусный пост с лайками, но без комментариев, или обращение в поддержку без расшифровки звонка. Когда модель отвечает свободным текстом, GPT-5.5 честно сообщает об отсутствии данных в 98% случаев. Но стоит потребовать заполнить обязательное JSON-поле для тональности — и та же модель выдумывает ответ 40 раз из 40 попыток. Форма диктует ложь.
Эффект воспроизводится с пугающей силой: обязательные поля доводят частоту выдумок до 100% у десяти из тринадцати моделей. Добавление явной опции «недостаточно данных» спасает только передовые модели — все девять открытых моделей её игнорируют. Прямая инструкция «не додумывай тональность» переопределяется схемой в четырёх случаях из шести. Выдумки прячутся там, где невозможно вставить оговорку: в enum-полях и массивах с минимальной длиной. Авторы собрали это в бенчмарк PhantomFill с двумя метриками — Coerced Fabrication Rate и Escape Utilization Rate. По данным arXiv.
→ GPT-5.5: 98% честности в свободном тексте → 100% выдумок при обязательном поле
→ 10 из 13 моделей дают 100% ложных ответов на обязательные поля
→ Все 9 открытых моделей игнорируют опцию «недостаточно данных»
→ Нелинейность масштаба: маленькая модель отказывается, средняя — выдумывает, большая — снова отказывается
Мы годами оптимизировали подсказки, а проблема оказалась на уровень ниже — в самом контракте между моделью и форматом ответа. PhantomFill даёт метрику, которую можно встроить в конвейер непрерывной интеграции уже сегодня, и это первый бенчмарк, измеряющий не способности, а честность под давлением схемы. Интересно, что ни одна из команд, с которыми я работал, никогда не тестировала модели на принудительную выдумку — мы просто молча принимали вымысел как плату за структурированный вывод.
#PhantomFill #галлюцинации #structured_output #бенчмарк #LLM