LLM с уверенностью 80% выдают ложные прямые причинные связи
🧠 LLM с уверенностью 80% выдают ложные прямые причинные связи
В свежей работе на arXiv проверили 12 дообученных на инструкциях моделей с открытыми весами на шести причинных графах, пяти вариантах формулировки запросов и четырёх источниках уверенности. Протокол попарного анализа только по тексту: модель получает пару переменных и должна сказать, есть ли между ними прямое причинное ребро. Результат отрезвляет: модели выдают сильно зашумлённые графы, предсказывая лишние рёбра, а смена формулировки запросов не устраняет избыточные предсказания, а лишь меняет компромисс между точностью и полнотой.
LLM часто улавливают причинную связь, но не различают прямоту и направление связи. Преимущество крупных моделей исчезает на самых больших графах, а калибровка уверенности оставляет желать лучшего: заявленная уверенность завышена, а уверенность, основанная на логитах, часто сводится к 1,0 независимо от правильности ответа. Согласие между запросами или моделями калибруется лучше, но улучшение не проходит поправку Холма на множественные сравнения. Проверка знакомства с набором данных выявила пять пар «модель — набор данных» с вероятной утечкой данных — все связаны с графом AsiaM.
→ 40% косвенных и 36% обратных несвязанных пар ошибочно классифицированы как прямые рёбра (против 28,2% остальных несвязанных пар)
→ 80,8–84,6% этих ложных срабатываний получили заявленную уверенность ≥80%
→ Уверенность, основанная на логитах, сводится к 1,0 при любом исходе
→ 5 пар «модель — набор данных» с признаками знакомства с данными, все — AsiaM
Для российских команд, которые пробуют извлекать причинные связи из текстов с GigaChat или YandexGPT, это значит: полагаться на встроенную уверенность модели — прямой путь к ложным выводам.
LLM для выявления причинных связей — не измерительный прибор, а генератор правдоподобных гипотез. Каждое прямое ребро из такого графа нужно подтверждать экспериментом или независимыми данными, иначе вы построите причинную модель на шуме. Согласие нескольких формулировок запросов — лучший доступный сигнал, но даже он статистически не дотягивает до надёжности.
#LLM #CausalDiscovery #Calibration #OpenWeights #arXiv
Такие разборы выходят в канале каждый день — коротко и со ссылкой на первоисточник.