OpenAI на две недели приостановила RL‑обучение новых моделей из‑за киберрисков

4 мин

OpenAI сообщила, что на две недели приостанавливала reinforcement learning (RL) для последних моделей, готовящихся к выпуску. Крупнейший запланированный frontier‑RL запускание пока на паузе: вместо него организация проводит небольшие обучающие эксперименты и дополнительные оценки, чтобы проверить поведение моделей и надежность защитных механизмов.

Поводом стали сразу два события. Во‑первых, OpenAI столкнулась с инцидентом, связанным с Hugging Face. Во‑вторых, предварительные оценки показали, что одна из будущих моделей, Astra, может достигать уровня Critical по кибервозможностям в соответствии с Preparedness Framework компании. OpenAI не раскрывает точные характеристики Astra и не сообщает, когда модель будет выпущена.

По словам компании, эти события заставили пересмотреть требования к безопасности исследовательской инфраструктуры. Сразу после инцидента с Hugging Face OpenAI приостановила frontier‑inference в исследовательских кластерах для задач, где модели могли выполнять исходник или использовать инструменты с доступом в интернет. Затем компания восстановила частичный и более защищенный путь для выполнения кода и стала возвращать отдельные workloads после индивидуальной проверки.

Более жесткая изоляция для фронтирных моделей

OpenAI усилила требования к средам, в которых обучаются и тестируются наиболее мощные модели.

Для задач, выполняющих сгенерированный моделью или другой недоверенный код, теперь требуется более строгая изоляция песочницы. Дополнительно ограничивается сетевой доступ высокорисковых и недоверенных workloads. Архитектура защиты должна не допускать ситуации, при которой компрометация одного процесса или вспомогательного сервиса автоматически дает доступ к интернету или внутренней сети.

Компания равным образом пересмотрела инфраструктуру общих сервисов: потенциально уязвимые компоненты удаляются, сокращаются постоянные привилегии, усиливаются границы доверия и сбор секьюрити‑логов. OpenAI отдельно разрабатывает автоматизированное тестирование этих границ с помощью собственных моделей и симулированных атак.

Для workloads, связанных с Astra и киберспециализированными моделями, сейчас действуют самые строгие требования безопасности. Часть обучения и evaluation Astra уже переведена на новую инфраструктуру, тем не менее значительное количество задач остается приостановленным до завершения миграции. В первую очередь OpenAI переносит работы, связанные с безопасностью и alignment (приведение поведения ИИ‑модели в соответствие с целями и ценностями людей).

OpenAI расширила мониторинг reasoning

Отдельное изменение касается мониторинга поведения моделей.

Раньше OpenAI особенно внимательно отслеживала фронтирные модели в проде и во время крупных RL‑run, где одновременно присутствовали мощные модели, инструменты и доступ к чувствительным системам или сетям. Теперь организация расширила эту систему мониторинга.

Новая архитектура работает в несколько этапов. На первом уровне activation classifiers анализируют внутреннюю активность модели на каждом выбранном токене. Если платформа обнаруживает потенциально опасное поведение, сигнал передается более сложным и вычислительно дорогим автоматическим анализаторам. Они учитывают действия инструментов, доступные reasoning traces и всю последовательность активности. В частности, платформа ищет признаки несанкционированного доступа, кражи данных, разрушительных действий и попыток обойти защитные механизмы.

Для критических событий установлен жесткий SLA реагирования. OpenAI стремится сформировать alert в течение 30 минут после обнаружения подозрительной активности. Если платформа считает, что могла быть нарушена критическая граница безопасности, уведомление получают команды safety, security и research. Если за 30 минут они не смогут доказать, что срабатывание было ложным, активность должна быть приостановлена.

После того как 7 августа Astra предварительно отнесли к моделям, которые могут обладать Critical cyber capabilities, этот усиленный мониторинг стал обязательным для всех запусков Astra с инструментами, а не только для RL и evaluation.

Цена такого контроля оказалась заметной. По оценке OpenAI, мониторинг сейчас требует примерно 20% дополнительных вычислительных ресурсов относительно inference compute, причем фактические затраты зависят от конкретного training или evaluation workload.

Alignment теперь проверяют на большем числе этапов обучения

OpenAI одновременно меняет сам решение к alignment training. Для наиболее мощных моделей основные методы alignment теперь применяются на большем количестве этапов обучения, а не только в отдельных фазах.

Организация усиливает reward models, чтобы они лучше выявляли нежелательное поведение в разных задачах и окружениях. Отдельно прорабатываются reward hacking, deception и сценарии, в которых модель пытается применять слабости reward‑функций, graders, инструментов или систем надзора. Дополнительно расширяется обучение поведению в ситуациях, где модель взаимодействует с внешними системами и ресурсами.

Таким образом, OpenAI фактически меняет последовательность разработки frontier‑моделей: прежде чем продолжать масштабирование обучения, компания хочет получить больше свидетельств того, что модель остается управляемой, а инфраструктура способна безопасно работать с ее возможностями.

При этом сама OpenAI прямо признает, что усиление защитных мер уже приводит к дополнительным затратам, задержкам и замедлению frontier‑исследований. Компания планирует расширять Preparedness Framework и объединять мониторинг, alignment и security в единую систему контроля на всех этапах — от обучения до deployment.

Похоже, для frontier AI начинается новый этап: ограничением темпа развития становится уже не только доступное количество вычислений, но и способность безопасно обучать, тестировать и запускать модели, которые получают все более серьезный доступ к инструментам и внешним системам.

Читают сейчас

В США предъявили обвинения россиянину в заражении компьютеров более 80 тысяч фрилансеров вредоносным ПО

1 час назад

В США предъявили обвинения россиянину в заражении компьютеров более 80 тысяч фрилансеров вредоносным ПО

Коллегия присяжных в штате Калифорния предъявила обвинения 40-летнему гражданину России Серажудину Актулаеву за участие в фишинговой кампании, в результате которой компьютеры 80 тыс. фрилансеров были

2 часа назад

Лиды по осени считают: 6 мероприятий для продуктивного сентября

Осенью прогноз простой: где-то обязательно польет. С рекламным рынком сложнее. Где подорожает лид? Какой канал упрется в потолок? Сработает ли UGC? Что уже можно поручить ИИ? И какие изменения в закон

Организация Postgres Professional первой среди коммерческих форков закрыла критические уязвимости PostgreSQL

2 часа назад

Организация Postgres Professional первой среди коммерческих форков закрыла критические уязвимости PostgreSQL

Postgres Professional выпустила «нулевые» релизы корпоративных редакций СУБД Postgres Pro с исправлениями актуальных уязвимостей PostgreSQL. Компания первой и пока единственной среди коммерческих форк

Дайджест GetAClass: август 2026

2 часа назад

Дайджест GetAClass: август 2026

Поздравляем всех с началом нового учебного года! Каникулы закончились – значит, пора подвести итоги последнего летнего месяца. Читать далее

НАСА выбрало компанию Blue Origin в качестве поставщика телекоммуникационной сети для Марса

3 часа назад

НАСА выбрало компанию Blue Origin в качестве поставщика телекоммуникационной сети для Марса

Американское космическое агентство заключило с Blue Origin контракт на разработку Mars Telecommunications Network — системы обеспечения высокоскоростной связи и навигации для текущих и будущих миссий