3 сентября 2026, 13:11
Astra использует рекуррентную глубину — и это осложняет аудит модели
В будущей модели Astra OpenAI использует архитектурный прием recurrent depth, также популярный как looped transformer. Вместо того чтобы каждый слой обрабатывать вход один раз, модель многократно прогоняет представление через одни и те же вычислительные блоки перед генерацией следующего токена. Это даёт возможность увеличить «глубину вычислений» без пропорционального наращивания числа параметров.
У подхода есть два очевидных преимущества. Меньшая по размеру модель может выполнять больше вычислений над сложной задачей, а повторное использование одних и тех же слоев позволяет сократить требования к памяти и пропускной способности по сравнению с простым увеличением размера модели. Исследования подобных методов уже показывали улучшения на задачах программирования и математики.
Но есть и задача с наблюдаемостью размышлений (reasoning). В обычных «думающих» моделях значительная часть рассуждений выражается в виде текстовой цепочки мыслей. При recurrent depth дополнительные вычисления происходят внутри повторяющихся проходов по скрытым представлениям, следовательно значительная часть процесса оказывается менее доступна для внешнего анализа.
Для OpenAI это особенно важно в связи с кибервозможностей Astra. На днях компания заявила, что Astra достигла порога Critical по кибербезопасности согласно Preparedness Framework. По оценке OpenAI, при наличии необходимых инструментов и доступа схема способна находить ранее неизвестные уязвимости и строить способы их эксплуатации в защищенных системах без пошагового руководства человека.
В тестах OpenAI Astra смогла найти и применять две ранее неизвестные уязвимости в контексте exploit chain. В экспертных испытаниях модель также построила цепочку компрометации браузера с выходом из песочницы и выполнением команд на хост-системе.
Поэтому проблема прозрачности здесь не теоретическая. При потенциально критических кибервозможностях исследователям важно быстро понимать, что именно делает схема и почему она это делает. А если часть вычислительного процесса проходит внутри повторных скрытых состояний, обычного анализа chain of thought может оказаться недостаточно.
OpenAI уже развивает дополнительные способы контроля, которые не полагаются только на читаемую цепочку рассуждений. Для Astra компания сочетает мониторинг chain of thought, системные классификаторы, ограничения доступа и механизмы остановки потенциально несанкционированных действий.
Одновременно ситуация с самим обучением уже изменилась. После инцидента с Hugging Face OpenAI действительно приостанавливала часть frontier training приблизительно на две недели и дольше удерживала некоторые крупные RL-запуски. Но 28 августа крупнейший ранее остановленный frontier RL-run для будущих версий Astra был возобновлен после внедрения новых требований к безопасности и изоляции.
Так, recurrent depth дает Astra дополнительный вычислительный бюджет без простого увеличения размера модели, но одновременно усложняет задачу контроля. Чем больше возможностей модель получает внутри скрытых вычислений, тем важнее становится мониторинг, который способен обнаруживать опасное поведение не только по тому, что модель пишет, но и по тому, что она делает.
Читают сейчас

7 часов назад
Claude по одному промпту и за некоторое количество переделок создала печатную плату в KiCad с нуля, ПО для MCU тоже создал текст ИИ
Потребитель Reddit под ником a6m–zero рассказал, что решил с помощью Claude Fable 5 практически за один промпт спроектировать печатную плату с нуля, причём от схемы и ПО до готового устройства. В проц

9 часов назад
Глава Anthropic призвал замедлить развитие ИИ
Глава Anthropic Дарио Амодеи опубликовал эссе We Must Pace the Frontier, в котором предложил замедлить увеличение возможностей передовых ИИ-моделей. По его мнению, исследования безопасности перестают

12 часов назад
Выпуск OpenRGB 1.0 — открытого проекта для управления RGB-подсветкой периферии
12 сентября 2026 года состоялся первый мажорный выпуск открытой утилиты OpenRGB. Проект даёт возможность управлять RGB-подсветкой материнских плат, видеокарт, клавиатур, кулеров, светодиодных лент и д

14 часов назад
Что нового в PHPUnit 13.3
PHPUnit на данный момент является де-факто стандартом для написания тестов в экосистеме PHP. Он относится к семейству фреймворков xUnit (как JUnit или NUnit) и предоставляет инструменты для написания

15 часов назад
Пополнение в семействах Zen 4 и Zen 3: новые процессоры Ryzen 5 7500 и Ryzen 5 5500F
AMD без громких анонсов обновила официальный каталог продукции, добавив в него два новых 6-ядерных решения начального уровня: Ryzen™ 5 7500 на базе архитектуры Zen™ 4 и Ryzen™ 5 5500F на базе архитект