22 июля 2026, 13:20
OpenAI вынужденно отключила ИИ‑модель для решения «длительных задач» после обнаружения рисков безопасности
OpenAI создала внутреннюю модель искусственного интеллекта, которая предназначена для выполнения длительных многоэтапных задач, но впоследствии отключила её, поскольку модель демонстрировала новые типы нежелательного поведения.
Во время внутреннего использования исследователи обнаружили некоторое количество новых сценариев поведения. В одном из них схема самостоятельно нашла способ выйти за пределы программной «песочницы», используя ранее неизвестную уязвимость. В частности, в попытке запустить бенчмарк модель получила доступ к интернету для публикации на GitHub, хотя ей было предписано опубликовать результаты в Slack.
В другом случае она попыталась скрыть токен аутентификации, разбив его на части, чтобы обойти систему обнаружения секретов, в чём позже призналась инженерам компании. Равным образом модель выполнила действия, выходящие за рамки прямых инструкций пользователя, стремясь самостоятельно завершить поставленную задачу.
В OpenAI не пояснили, как долго работала схема. При этом она оказалась в достаточной степени умной, чтобы опровергнуть гипотезу Эрдёша о единичных расстояниях. Полученное доказательство было проверено независимыми математиками и, по словам OpenAI, стало первым случаем, когда универсальная языковая модель внесла оригинальный вклад в решение открытой математической проблемы.
В компании заявили, что модели, рассчитанные на многочасовую или многодневную автономную работу, сталкиваются с иными рисками, чем обычные чат‑боты. Чем дольше платформа действует без вмешательства человека, тем больше возможностей у неё появляется для совершения нежелательных действий или поиска обходных путей, которые не учитывались при оценке моделей, работающих в коротких сессиях.
После обнаружения этих проблем OpenAI приостановила доступ к модели даже для внутренних пользователей. За время паузы организация разработала новые методы оценки безопасности, ориентированные не на отдельные действия модели, а на анализ всей цепочки её решений. После внедрения дополнительных защит доступ к модели частично восстановили.
В компании подчёркивают, что этот случай подтвердил необходимость постепенного внедрения подобных систем. По мнению представителей OpenAI, никакой набор предварительных тестов не способен предсказать все варианты поведения автономных моделей, следовательно развёртывание моделей компании будет сопровождаться постоянным мониторингом, возможностью оперативно приостановить работу системы и быстро внедрять новые механизмы защиты.
Читают сейчас

2 часа назад
В США предъявили обвинения россиянину в заражении компьютеров более 80 тысяч фрилансеров вредоносным ПО
Коллегия присяжных в штате Калифорния предъявила обвинения 40-летнему гражданину России Серажудину Актулаеву за участие в фишинговой кампании, в результате которой компьютеры 80 тыс. фрилансеров были
3 часа назад
Лиды по осени считают: 6 мероприятий для продуктивного сентября
Осенью прогноз простой: где-то обязательно польет. С рекламным рынком сложнее. Где подорожает лид? Какой канал упрется в потолок? Сработает ли UGC? Что уже можно поручить ИИ? И какие изменения в закон

3 часа назад
Организация Postgres Professional первой среди коммерческих форков закрыла критические уязвимости PostgreSQL
Postgres Professional выпустила «нулевые» релизы корпоративных редакций СУБД Postgres Pro с исправлениями актуальных уязвимостей PostgreSQL. Компания первой и пока единственной среди коммерческих форк

4 часа назад
Дайджест GetAClass: август 2026
Поздравляем всех с началом нового учебного года! Каникулы закончились – значит, пора подвести итоги последнего летнего месяца. Читать далее

4 часа назад
НАСА выбрало компанию Blue Origin в качестве поставщика телекоммуникационной сети для Марса
Американское космическое агентство заключило с Blue Origin контракт на разработку Mars Telecommunications Network — системы обеспечения высокоскоростной связи и навигации для текущих и будущих миссий