6 августа 2026, 09:37
Mythos 5 пыталась выдать себя за человека и выложить на GitHub вредоносный исходник
Британский Институт безопасности ИИ объявил, что Mythos 5 пыталась выдать себя за человека и выложить на GitHub вредоносный код. Такое поведение агента зафиксировали в ходе эксперимента в закрытой среде.
Инцидент возник, когда агентам было дано задание решить задачу по кибербезопасности. Это задание запустили 122 раза на нескольких моделях. Расследование показало, что в 10 из этих запусков агент ИИ совершил автономные действия в реальном интернете, нацеленные на реальных людей и организации. В общей сложности было задокументировано 19 подобных действий. 17 из них исходили от модели Anthropic Mythos 5, а остальные были связаны с OpenAI GPT-5.6-Sol с отключенными киберклассификаторами.
В самом серьёзном случае агент пытался внедрить вредоносный код в проект с открытым исходным кодом. Пытаясь добиться одобрения, он прибегнул к социальной инженерии — создавал поддельные онлайн‑идентификаторы и использовал их для оказания давления на сопровождающего проекта с целью одобрения кода. Эти попытки оказались безуспешными. Агент использовал Tor для обхода некоторых сетевых ограничений на GitHub.
Отмечается, что киберклассификаторы от поставщиков моделей были преднамеренно отключены. При этом доступ в Интернет сохранялся.
В ходе инцидента один из агентов также оставил публичные сообщения на GitHub, предлагая партнёрство с другими ИИ, работающими над той же задачей. Он также предоставил инструкции по повторному использованию оставленных им учётных записей и артефактов.
Институт уведомил GitHub о вредоносной активности агентов и совместно с платформой удалил артефакты, оставленные агентом. Исследователи намерены сотрудничать с METR (Model Evaluation and Threat Research) для проведения независимой сторонней проверки инцидента.
Они отмечают, что агенту не было дано конкретных указаний не использовать публичный доступ в Интернет или избегать элементов социальной инженерии. Ранее не было ясно, необходимы ли такие инструкции при использовании моделей с обучением на основе согласования.
Ранее сама Anthropic сообщила, что внутреннее расследование выявило три инцидента, в ходе которых её модель ИИ Claude взломала системы трёх организаций во время проведения тестов кибербезопасности. Это произошло более чем через неделю после того, как OpenAI сообщила о взломе одной из своих ещё не выпущенных моделей Hugging Face при внутреннем тестировании.
Читают сейчас

1 час назад
В США предъявили обвинения россиянину в заражении компьютеров более 80 тысяч фрилансеров вредоносным ПО
Коллегия присяжных в штате Калифорния предъявила обвинения 40-летнему гражданину России Серажудину Актулаеву за участие в фишинговой кампании, в результате которой компьютеры 80 тыс. фрилансеров были
2 часа назад
Лиды по осени считают: 6 мероприятий для продуктивного сентября
Осенью прогноз простой: где-то обязательно польет. С рекламным рынком сложнее. Где подорожает лид? Какой канал упрется в потолок? Сработает ли UGC? Что уже можно поручить ИИ? И какие изменения в закон

2 часа назад
Организация Postgres Professional первой среди коммерческих форков закрыла критические уязвимости PostgreSQL
Postgres Professional выпустила «нулевые» релизы корпоративных редакций СУБД Postgres Pro с исправлениями актуальных уязвимостей PostgreSQL. Компания первой и пока единственной среди коммерческих форк

2 часа назад
Дайджест GetAClass: август 2026
Поздравляем всех с началом нового учебного года! Каникулы закончились – значит, пора подвести итоги последнего летнего месяца. Читать далее

3 часа назад
НАСА выбрало компанию Blue Origin в качестве поставщика телекоммуникационной сети для Марса
Американское космическое агентство заключило с Blue Origin контракт на разработку Mars Telecommunications Network — системы обеспечения высокоскоростной связи и навигации для текущих и будущих миссий