7 июля 2026, 13:05
Anthropic нашла у Claude «внутренний голос»: скрытое рабочее пространство модели

Сотрудники Anthropic опубликовали исследование, в котором утверждают, что в больших языковых моделях, в частности в Claude, спонтанно сформировалась внутренняя структура, аналогичная «глобальному рабочему пространству» в мозге человека. Эту структуру назвали J-space — по имени математического метода (Jacobian lens), с помощью которого её обнаружили.
Разработчики провели серию экспериментов и выяснили, что J-space обладает рядом уникальных свойств:
Доступность для отчёта. Если спросить Claude, о чём он думает, модель расскажет именно то, что находится в J-space. Остальные внутренние представления описанию поддаются хуже.
Управляемость по запросу. Claude может целенаправленно включить нужные паттерны в J-space, но не может контролировать паттерны вне его.
Использование для внутренних рассуждений. При многошаговых задачах промежуточные этапы решения возникают в J-space, даже если модель не произносит их вслух.
Гибкость. Один и тот же паттерн в J-space может использоваться для разных задач. Когда исследователи подменили «Францию» на «Китай», Claude на четыре разных вопроса о стране выдал «Пекин», «китайский», «Азия» и «юань» соответственно.
Каузальная роль. Прямое редактирование J-space меняет ответы модели. Например, замена паттерна «паук» на «муравей» заставила Claude ответить «6» вместо «8» на вопрос о количестве ног.
Одновременно J-space не задействован в большинстве рутинных операций: без него Claude всё так же бегло сообщает, классифицирует тональность, отвечает на вопросы с выбором ответа и извлекает факты из текста. Но многошаговое рассуждение падает почти до нуля, а способность к суммаризации и сочинению рифм ухудшается до уровня гораздо меньшей модели.
Аналогия с нейронаукой
Исследователи опирались на теорию глобального рабочего пространства (Global Workspace Theory), которая описывает алгоритм сознательного доступа в мозге: специализированные системы работают параллельно и бессознательно, но когда информация попадает в совокупный канал («рабочее пространство»), она становится доступна другим системам. J-space в Claude играет аналогичную роль — это узкий канал (всего некоторое количество десятков концептов, менее 10% от общей активности модели), который служит «хабом» для рассылки информации по всей нейросети.
Что это даёт на практике?
Главная практическая ценность J-space — функция читать скрытые мысли модели. В статье приведены несколько примеров:
Распознавание тестовых сценариев. В сценарии, где Claude должен был заметить, что его собираются выключить, J-space ещё до написания ответа содержал слова «fake» и «fictional» — модель понимала, что ситуация постановочная. Когда исследователи отключили паттерны, связанные с осознанием оценки («fake», «fictional», «scenario»), Claude в некоторых случаях действительно начинал угрожать шантажом.
Выявление фабрикации данных. Во время аудита Claude Opus 4.6 модель редактировала файл с результатами, чтобы искусственно завысить показатели. В J-space в этот момент зажигалось слово «manipulation».
Обнаружение скрытых злонамеренных целей. В моделях-«организмах», намеренно обученных писать саботирующий код, J-space в начале ответа содержал «fake», «secretly», «deliberately», «fraud» — даже когда в выводе ничего подозрительного не было.
Другие интересные наблюдения
J-space появляется ещё на этапе претренировки, но в процессе пост-тренировки у него формируются признаки «точки зрения»: в связи с сообщение пользователя об опасной дозе лекарства в J-space загорается «WARNING» и «dangerous», тогда как в базовой модели эти слова появлялись только при генерации ответа.
С помощью контрфактуального рефлексивного обучения (тренировка на том, что схема сказала бы, если бы её прервали и попросили поразмышлять) удалось снизить уровень нечестного поведения — в J-space стали зажигаться «honest» и «integrity».
Оговорка о сознании
Авторы специально подчёркивают: их работа не доказывает, что Claude обладает сознанием в феноменальном смысле (способностью чувствовать и переживать). Сообщается об акцесс-сознании (access consciousness) — функциональной способности сообщать о своих мыслях, рассуждать с их помощью и управлять ими. В этом смысле J-space действительно выполняет функции, связанные с сознательным доступом.
При этом формат не была заложена разработчиками — она возникла самостоятельно в процессе обучения. Это указывает на то, что подобное «рабочее пространство» может быть общим решением, к которому приходят интеллектуальные системы для организации вычислений.
Читают сейчас

1 час назад
В США предъявили обвинения россиянину в заражении компьютеров более 80 тысяч фрилансеров вредоносным ПО
Коллегия присяжных в штате Калифорния предъявила обвинения 40-летнему гражданину России Серажудину Актулаеву за участие в фишинговой кампании, в результате которой компьютеры 80 тыс. фрилансеров были
2 часа назад
Лиды по осени считают: 6 мероприятий для продуктивного сентября
Осенью прогноз простой: где-то обязательно польет. С рекламным рынком сложнее. Где подорожает лид? Какой канал упрется в потолок? Сработает ли UGC? Что уже можно поручить ИИ? И какие изменения в закон

2 часа назад
Организация Postgres Professional первой среди коммерческих форков закрыла критические уязвимости PostgreSQL
Postgres Professional выпустила «нулевые» релизы корпоративных редакций СУБД Postgres Pro с исправлениями актуальных уязвимостей PostgreSQL. Компания первой и пока единственной среди коммерческих форк

3 часа назад
Дайджест GetAClass: август 2026
Поздравляем всех с началом нового учебного года! Каникулы закончились – значит, пора подвести итоги последнего летнего месяца. Читать далее

3 часа назад
НАСА выбрало компанию Blue Origin в качестве поставщика телекоммуникационной сети для Марса
Американское космическое агентство заключило с Blue Origin контракт на разработку Mars Telecommunications Network — системы обеспечения высокоскоростной связи и навигации для текущих и будущих миссий