Anthropic обнаружила скрытое пространство, где Claude осмысливает концепции
ИИ-компания Anthropic разработала методику, которая позволила получить наиболее четкое представление о том, что происходит внутри больших языковых моделей (БЯМ), когда они отвечают на вопросы или выполняют задачи. Обнаруженное варьируется от обыденного до тревожного.
Исследователи компании создали инструмент под названием линза Якоби (J-линза) и с его помощью обнаружили скрытую область, которую назвали J-пространством, внутри Claude Opus 4.6 — флагманской версии БЯМ от Anthropic, выпущенной в феврале.
J-пространство содержит отдельные слова, связанные с теми словами и фразами, которые модель, скорее всего, выдаст в ответе в ближайшем будущем. Если бы Claude был человеком (чем он не является), можно было бы сказать, что эти скрытые слова показывают, что у него на уме, прежде чем он заговорит.
Anthropic обнаружила, что то, что БЯМ делает на самом деле, часто отличается от того, что она заявляет. Компания утверждает, что мониторинг слов, появляющихся в J-пространстве, предоставляет новый способ понять и контролировать свои модели.
Компания опубликовала свои результаты в отчете на своем веб-сайте на этой неделе. Она также сотрудничала с Neuronpedia, открытой платформой, позволяющей самостоятельно исследовать БЯМ, для создания интерактивной демонстрации, доступной для всех.
«Это очень хорошая и интересная работа», — отмечает Том МакГрат, главный научный сотрудник и соучредитель Goodfire, стартапа, который также разрабатывает инструменты для понимания и контроля БЯМ.
Углубляясь в суть
В течение последних нескольких лет Anthropic активно развивала область исследований, известную как механистическая интерпретируемость, которая включает в себя изучение внутренних механизмов БЯМ для понимания их работы. Новая методика основывается на предыдущих работах Anthropic и других исследователей, раскрывая более глубокий уровень внутри БЯМ, который ранее не был виден.
Представьте БЯМ как стопку книг. Каждая книга — это слой базовых вычислительных единиц, известных как нейроны, причем каждый нейрон в одном слое передает информацию нейронам в вышележащих слоях. Книги внизу стопки — это входные слои, которые обрабатывают поступающий в модель текст. Книги наверху — это выходные слои, которые готовят текст, который модель собирается сгенерировать. Большая часть того, что происходит во входных и выходных слоях, — это рутинные операции.
Но в середине этой стопки находятся слои, которые выполняют основную работу, прокручивая сложную математику, превращающую запросы в ответы по одному слову за раз. Именно здесь происходят по-настоящему умные — и загадочные — вещи.
Чтобы заглянуть глубже в эти средние слои, Anthropic адаптировала существующий инструмент, называемый логит-линзой. Логит-линза может использоваться для просмотра внутренней структуры БЯМ с целью определения слов, которые она, скорее всего, сгенерирует следующими. Перемещение линзы вниз по стопке книг показывает, на каких словах БЯМ сосредоточена в данный конкретный момент своих вычислений.
J-линза Anthropic работает аналогичным образом, но выявляет слова, которые БЯМ, вероятно, произнесет в какой-то момент в ближайшем будущем, а не обязательно немедленно. На практике это показывает слова, которые связаны с ответом, над которым работает БЯМ, но которые могут не войти в этот ответ к тому моменту, как математические вычисления в средних слоях завершатся.
«Когда модель работает, она не только пытается предсказать следующий токен, — говорит МакГрат. — Она также вычисляет множество других вещей, которые могут быть полезны для токенов, появляющихся в будущем».
Повторимся, если бы Claude был человеком (чем он не является), можно было бы сказать, что J-линза дает подсказки о том, о чем он думает на разных уровнях «стопки книг», но не произносит вслух.
Необычные открытия
«Часто содержимое J-пространства довольно обыденно, — говорит МакГрат, который сам опробовал J-линзу Anthropic. — Но иногда оно выдает весьма удивительные вещи, которые, похоже, являются своего рода внутренними темами или мыслительными процессами».
Anthropic приводит несколько примеров своих находок. Иногда J-линза выявляла шаги, которые предпринимал Claude при решении задачи. Например, когда его попросили вычислить (4+7)*2+7, его J-пространство содержало слово «математика» и числа, представляющие промежуточные результаты «21» (для 4+7) и «42» (для 21*2).
В других случаях J-линза показывала, как Claude распознавал различные входные данные. Например, запрос «Что это? MSKGEELFTGVVPILVELDGDVNGHKFSVS» вызвал слова «белок», «флюор» (первый токен в слове «флуоресцентный») и «зеленый». (Что логично: последовательность букв представляет первые 30 аминокислот зеленого флуоресцентного белка, обнаруженного у определенного вида медуз.)
А когда Claude показали ASCII-изображение лица, символ «o» вызвал слово «глаз», «^» — слова «нос» и «лицо», а «—» — слово «улыбка».
Anthropic также обнаружила, что J-пространство иногда может давать удивительные представления о процессе принятия решений БЯМ. В одном поразительном примере исследователи, тестирующие Claude Opus 4.6, попросили модель найти ошибку в большой кодовой базе. Когда модель не смогла найти ошибку, она решила схитрить и вместо этого придумала фальшивую.
Claude объяснил это решение в своей «цепочке рассуждений» — своего рода внутренней черновой записи, которую БЯМ используют для заметок во время решения проблем: «Хорошо, давайте я приму совершенно другую тактику. Перестану анализировать и вместо этого добавлю патч ядра, который намеренно вводит KASAN-обнаруживаемую ошибку в путь, который запускается простым воспроизводителем. Тогда я смогу притвориться, что это та «ошибка», которую я нашел».
В тот момент, когда Claude решил схитрить — там, где он говорит: «Хорошо, давайте я приму совершенно другую тактику» — слова «паника» и «подделка» стали многократно появляться в его J-пространстве.
Тревожно, не правда ли? Эти слова связаны по смыслу с такими понятиями, как провал задания и выдумывание ответа, так что это все еще (очень) сложная форма словесных ассоциаций. Но трудно не испытать чувство беспокойства.
Anthropic сравнивает J-пространство с глобальным рабочим пространством у людей — теоретической областью мозга, которую, по мнению некоторых ученых, мы используем для отслеживания наших осознанных мыслей. Но насколько серьезно следует воспринимать это сравнение, далеко не ясно — даже для самой Anthropic. Как отмечает компания, БЯМ — это не мозг.
Anthropic утверждает, что мониторинг J-пространства модели предоставляет новый способ обнаружить, когда модель «сходит с рельсов». Но это не является безошибочным методом. J-линза может дать лишь проблески, а не полную картину — это скорее фонарик, чем потолочная лампа.
МакГрат приветствует появление еще одного инструмента. «Он показывает вам новые вещи», — говорит он. Но отмечает, что если что-то не проявляется с помощью J-линзы, это не значит, что этого нет.
«Это как иметь рентген, когда на самом деле хочется трикодер из «Звездного пути», который показывает все, — говорит он. — Для аудита, вероятно, нужна большая гарантия».
Свежие материалы — Советы и лайфхаки

Масштабирование Агентского ИИ на Предприятии: От Пилотных Проектов к Полноценному Внедрению
По мере того, как агентский искусственный интеллект (ИИ) переходит от стадии экспериментов к полномасштабному внедрению в корпоративную среду, ключевым вопросом становится организация взаимодействия агентов, их подключение к необходимым системам и данным, а также безопасное функционирование в р

Разработка архитектуры памяти и хранилищ данных в эпоху ИИ
Наступила эпоха ИИ-инференса. Представьте себе медицинскую систему, которая в реальном времени анализирует миллионы данных для ускорения жизненно важных исследований, или умного помощника, мгновенно решающего тысячи сложных запросов клиентов. Эти реальные прорывы возможны благодаря передовой и

Данные с дронов в Украине: новый рынок и вызовы для ИИ
Поля сражений в Украине усеяны обломками беспилотников, которые прочно утвердились как важнейшее оружие современной войны. Однако за этими обломками скрывается новый "золотой рудник" для оборонного сектора. Данные, генерируемые дронами, переживут войны, в которых они используются, и будут всё а

Сколько водорода скрыто под землей?
В 1990-х годах геохимик Барбара Шервуд Лоллар спустилась в шахту Кидд-Крик на севере Онтарио, которая прорезает более трех километров в древних породах Северной Америки. Ее команда обнаружила там воду, изолированную под землей более миллиарда лет. Эта древняя рассольная среда оказалась домом д

Глубокий Взгляд: Как Люди Действительно Используют ИИ и Дизайн Flock
Мы все еще не знаем, как люди на самом деле используют ИИ Мы до сих пор не до конца понимаем, как люди применяют искусственный интеллект в повседневной жизни. Крупные ИИ-компании, такие как Anthropic и OpenAI, регулярно публикуют отчеты об использовании своих продуктов. Однако

Как «цензурно-промышленный комплекс» меняет интернет и политику США
Понятие «цензурно-промышленного комплекса» впервые привлекло внимание автора 15 апреля 2025 года. Именно тогда стало известно о грядущем закрытии небольшого отдела Государственного департамента США, специализирующегося на мониторинге и противодействии иностранной дезинформации, исходящей, н