🧠 Набор данных из 558 траекторий вскрыл скрытые профили ошибок у ИИ-учёных OpenDiscoveryTrace — публичный архив полных траекторий автономных научных агентов, где записан не только результат, но и каждый шаг рассуждения: мысли, вызовы инструментов, наблюдения, ошибки, признаки для пересмотра и самооценка уверенности. Всего 558 траекторий по 124 задачам в разработке лекарств, материаловедении, геномике и анализе литературы, с 9 полями на каждый шаг. Охват моделей: три передовые — GPT-5.4, Claude Opus 4.6, Gemini 3.1 Pro (по 124 траектории) и четыре модели с открытыми весами — Qwen2.5-7B, Mistral-7B-v0.3, Phi-3.5-mini, Qwen2.5-1.5B (по 30), плюс 60 траекторий с вариантом поиска в реальном времени, по данным arXiv. Пробный анализ 363 траекторий с LLM-судьёй показал: все три передовые модели демонстрируют сопоставимую долю успешных решений — 84–89%, но по поведению они радикально различаются. Claude Opus 4.6 допускает в 30 раз больше ошибок на траекторию, чем GPT-5.4: 2.5 против 0.08 (p < 0.0001, Cliff's δ = 0.613). При этом профили ошибок качественно расходятся: у Claude 66.7% — неправильное использование инструментов, у GPT-5.4 83.6% — ошибки рассуждения. Такую разницу не видно, если оценивать только финальный ответ. Набор данных, схема трассировки, среда для агентов и определения пяти эталонных задач выложены под CC BY 4.0. Базовые модели для сравнения — логистическая регрессия, случайный лес, LSTM и трансформеры. Для русскоязычных команд, строящих собственных научных агентов, это готовый инструмент аудита: можно измерить, где именно нарушается ваш процесс, а не просто «успешен ли запуск». Одинаковая доля успешных решений при тридцатикратной разнице в частоте ошибок означает, что метрики «решил/не решил» для агентов-учёных бесполезны для предсказания поведения в рабочей среде. И дисбаланс в данных — 30 траекторий на модель с открытыми весами против 124 на передовую — делает выводы о первых статистически слабыми: кто-то уже пробовал на этом наборе данных честно сравнивать Qwen с Claude? #AIagents #processevaluation #OpenDiscoveryTrace #LLM #scientificAI