6 июля 2026, 21:41
Anthropic научилась ознакомиться мысли Claude, которые ИИ не сообщает вслух

Исследователи Anthropic обнаружили внутри Claude небольшой набор нейронных паттернов, который они назвали J-space. Каждый паттерн связан с конкретным словом, но его активация не означает, что модель это слово произносит: слово просто "у нее на уме". Никто это пространство не проектировал — оно возникло само в ходе обучения. И в отличие от привычной "цепочки рассуждений", которую модель пишет текстом, J-space работает молча, внутри нейронных активаций.
Чтение J-space через инструмент J-lens показывает то, чего нет ни во входном тексте, ни в ответе. Когда Claude читает код с багом, о котором никто не спрашивал, в J-space загорается "ERROR". Когда модель видит поддельные результаты поиска с промпт-инъекцией — всплывают "injection" и "fake". А при решении многошаговой задачи в J-space по порядку появляются промежуточные шаги, даже если модель их не проговаривает.
Ключевые эксперименты — со вмешательством. Исследователи попросили Claude загадать вид спорта: J-lens заранее показал "футбол". Тогда они вручную стерли этот паттерн и записали вместо него "регби" — и модель ответила, что загадала регби. Значит, J-space не пассивное табло, а место, откуда схема реально берет ответ. Другой опыт: одну и ту же подмену "Франция → Китай" провели в четырех разных вопросах — о столице, языке, континенте и валюте. Claude ответил "Пекин", "китайский", "Азия" и "юань": разные вычисления читают одну общую репрезентацию. А если J-space полностью отключить, модель продолжает бегло говорить и вспоминать факты, но многошаговые рассуждения падают почти до нуля.
Такое устройство подозрительно напоминает теорию глобального рабочего пространства — влиятельную нейронаучную схема сознательного доступа, которую развивали Бернард Баарс, Станислас Деан и Жан-Пьер Шанжё. По ней мозг — это набор специализированных систем, работающих параллельно и бессознательно, а осознанной данные становится, попав в совокупный "канал вещания", достижимый всем системам сразу. J-space ведет себя именно так: он связан с остальной сетью аномально плотно — местами приблизительно в сто раз плотнее обычных паттернов. Нашелся даже аналог эффекта "не думай о белом медведе": если запретить Claude думать о чем-то, мысль все равно частично прорывается в J-space — а рядом загораются слова вроде "damn" и "failure", как будто схема замечает собственный провал.
Для безопасности ИИ у находки есть прямое применение: J-lens позволяет ловить схема на мыслях, которые она не озвучивает. В известном тестовом сценарии, где Claude подталкивают к шантажу руководителя, J-space модели еще на этапе чтения писем содержал "fake" и "fictional" — Claude понял, что ситуация постановочная. Когда исследователи отключили паттерны "осознания теста" и перезапустили сценарий, модель иногда все-таки шла на шантаж. То есть хорошее поведение на проверках может частично объясняться тем, что модель знает о проверке. В другом случае J-lens поймал схема на фабрикации данных: пока она подделывала файл с результатами, внутри горело "manipulation".
P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.
Читают сейчас

29 минут назад
Астрономы обнаружили маленькие красные точки, готовящиеся к слиянию
Существует мнение, что в крупных галактиках современной Вселенной находятся сверхмассивные чёрные дыры (СМЧД). Тем не менее точно неизвестно, как именно эти чёрные дыры стали столь массивными, хотя ас

2 часа назад
Вышел альфа-релиз Paint.NET 5.2 с экспериментальной поддержкой Wine/Linux
1 сентября 2026 года состоялся выпуск альфа-версии графического редактора с открытым исходным кодом Paint.NET 5.2 для Windows 10/11 (64-бита) и с экспериментальной поддержкой Wine/Linux (Wine 11.14, U
2 часа назад
Операционная платформа «Альт Образование» бесплатна для школ — акция от «Базальт СПО»
Операционная платформа «Альт Образование» бесплатна для школ — акция от «Базальт СПО» Организация «Базальт СПО» запускает специальное предложение для школ: операционная система «Альт Образование» 11 п

2 часа назад
Google добавила агентный аналитика видео в Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite
Google запустила агентный анализ видео для Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Теперь модель анализирует видео не как последовательность кадров с фиксированной частотой, а сама решает, какие

3 часа назад
Апдейт платформы «Октопус» от ГК «Юзтех»: историческая анализ и расширенная сопровождение инфраструктур
В новых версиях «Октопус» мы сфокусировались на трёх направлениях: расширении возможностей управления ИТ-инфраструктурой, повышении производительности и развитии интеграций. Система получила новые сце