J-пространство Claude: Anthropic научилась читать невысказанные мысли модели
🧠 J-пространство Claude: Anthropic научилась читать невысказанные мысли модели
Исследователи Anthropic обнаружили внутри Claude небольшой набор нейронных паттернов, который работает как «глобальное рабочее пространство» — модель думает словами до того, как произнести их вслух. Метод J-линзы через якобиан позволил сопоставить внутренние активации конкретным словам из словаря и показал: когда Claude читает ошибочный код, в J-пространстве возникает «ОШИБКА», при распознавании попытки манипуляции — «injection» и «fake», а при многошаговых вычислениях — промежуточные результаты. Это не пассивная запись, а действующий механизм: точечная замена паттерна «футбол» на «регби» заставила модель изменить ответ, даже если исходное решение принималось до вмешательства.
Эксперименты также выявили, что модель способна сознательно модулировать J-пространство по запросу — например, удерживать в уме «апельсин» или вычислять 3²–2, параллельно переписывая посторонний текст. При этом именно через это рабочее пространство проходят сложные рассуждения: если его заблокировать, модель сохраняет беглую речь и простые факты, но теряет способность к многошаговым умозаключениям. Важно, что J-пространство не было спроектировано — оно возникло само в ходе обучения.
Исследование (оригинальная статья от 6 июля 2026) — не философский курьёз, а операционный инструмент. Открытый код и интеграция с Neuronpedia для моделей с открытыми весами превращают интерпретируемость из лабораторной дисциплины в практику аудита: теперь можно не просто ловить скрытые цели, но и целенаправленно править их. Вопрос в том, сколько времени пройдёт до появления атак, нацеленных именно на J-пространство — ведь если модель полагается на внутренний монолог, компрометация этого монолога становится вектором влияния.
Habr (перевод)
#Anthropic #Claude #интерпретируемость #Jпространство #безопасность