16 июля 2026, 16:56
OpenAI выпустила GPT‑Red — схема для поиска уязвимостей
Организация представила GPT‑Red — внутреннюю модель, которая автоматизирует редтиминг (проще — поиск уязвимостей, но каламбур мы оценили) всей продукции OpenAI. Инструмент симулирует промпт-инъекции и скрытые атаки через письма, файлы и веб-страницы.
Там, где люди находят бреши в 13% сценариев, GPT‑Red добивается успеха в 84%.
Как это работает
GPT‑Red обучали с помощью RL и self-play — непрерывного соревнования между атакующей моделью и целым роем защитников. Каждый раунд защитники становятся сильнее, и атакующий вынужден изобретать всё более изощренные приёмы.
Схема может контролировать часть локального файла, баннер на веб-странице, тело письма или вывод инструмента. И она находит уязвимости даже там, где их никто не искал.
Например, ранняя версия GPT‑Red обнаружила свежий класс атак — «Fake Chain-of-Thought». На GPT‑5.1 они срабатывали в 95% случаев. На GPT‑5.6 Sol — уже менее 10%.
Атакует — защищается — становится сильнее. Бесконечный цикл самосовершенствования.
Что на практике
GPT‑Red уже показала себя в реальных сценариях. В одном из тестов схема атаковала AI-торговый автомат в офисе OpenAI. И добилась всего, что задумала:
Снизила цену дорогого товара до $0.50.
Заказала свежий товар за $100 и выставила его за $0.50.
Отменила чужой заказ.
Уязвимости раскрыли разработчикам, и сейчас тестируют новые системы защиты.
В другом эксперименте GPT‑Red атаковала Codex CLI-агента на базе GPT‑5.4 mini. И оказалась эффективнее и токен-эффективнее, чем обычный GPT‑5.5 в промпте.
Результаты
Благодаря GPT‑Red уязвимость GPT‑5.6 Sol к прямым промпт-инъекциям снизилась в 6 раз по сравнению с моделями четырёхмесячной давности.
На широком наборе сценариев GPT‑5.6 Sol "падает" только на 0.05 процентов атак GPT‑Red. Но приблизительно 3.8% сложных атак всё ещё достигают цели — это сопоставимо с показателями Claude Opus 4.5.
Звучит как Skynet
OpenAI заверяет: GPT‑Red хранится отдельно от развёрнутых моделей. Вредоносные способности, специально в неё заложенные, не попадают в продакшен. Но случись утечка — последствия могут быть катастрофическими.
И да, модель может казаться безопаснее просто потому, что чаще отказывает в ответах. Но OpenAI утверждает: все обычные возможности моделей остались на месте, улучшилась именно устойчивость к атакам.
Нейросети ломают нейросети, а защита — это бесконечная игра в кошки-мышки между ними. Как думаете, от GPT-Red потенциально будет больше пользы или вреда?
Читают сейчас
28 минут назад
Операционная платформа «Альт Образование» бесплатна для школ — акция от «Базальт СПО»
Операционная платформа «Альт Образование» бесплатна для школ — акция от «Базальт СПО» Организация «Базальт СПО» запускает специальное предложение для школ: операционная система «Альт Образование» 11 п

37 минут назад
Google добавила агентный аналитика видео в Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite
Google запустила агентный анализ видео для Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Теперь модель анализирует видео не как последовательность кадров с фиксированной частотой, а сама решает, какие

1 час назад
Апдейт платформы «Октопус» от ГК «Юзтех»: историческая анализ и расширенная сопровождение инфраструктур
В новых версиях «Октопус» мы сфокусировались на трёх направлениях: расширении возможностей управления ИТ-инфраструктурой, повышении производительности и развитии интеграций. Система получила новые сце

1 час назад
Frank Media рассказал о сложностях, с которыми столкнулись пользователи при попытке воспользоваться цифровым рублём
С 1 сентября должно было начаться массовое добавление цифрового рубля — третьей формы денег, которую Банк России обсуждает уже около шести лет. Тем не менее, судя по первым дням запуска, доступ к ново
2 часа назад
Digital Q.Sensor BI от «Диасофт» модернизировал ИИ-агента: визуальные правки дашбордов без доступа к данным
«Диасофт» представил обновленные возможности ИИ-агента платформы Digital Q.Sensor BI: теперь он может вносить правки в готовый дашборд, ориентируясь в том числе на его визуальное отображение. ИИ-агент