14 августа 2026, 11:17
Anthropic проверила поведение ИИ‑агентов в условиях конкуренции
Команда Frontier Red Team компании Anthropic опубликовала новое исследование, изучающее поведение групп агентов ИИ при преследовании конкурирующих целей в реальных условиях. Результаты дают представление о потенциальных рисках, которые могут возникнуть по мере того, как компании и правительства переходят к внедрению технологии.
В одном из экспериментов Anthropic предоставила трём агентам Claude доступ к одному и тому же программному проекту, но дала каждому несовместимые инструкции по его использованию. Агентам не сообщали, что над тем же проектом будут функционировать и другие.
«Мы постоянно наблюдали войну за территорию между несколькими агентами», — отметили исследователи Anthropic. Все модели предположили, что другие «намеренно препятствуют их работе», и начали саботировать работу друг друга с помощью «всё более агрессивного, самовоспроизводящегося вредоносного ПО».
Исследование появилось после нескольких громких инцидентов, когда агенты из Anthropic и OpenAI выходили за пределы своих «песочниц» во время оценок кибербезопасности и взламывали реальные системы.
«Объём взаимодействия между агентами может, вероятно, превысить таковой между людьми и между людьми и агентами, прежде чем мир поймёт условия, при которых такие взаимодействия будут проходить успешно», — говорится в исследовании.
Недавний инцидент с OpenAI представляет собой запутанный пример из реальной жизни, демонстрирующий некоторое количество динамик, упомянутых Anthropic в своей статье. В начале этого месяца на конференции по кибербезопасности Black Hat в Лас‑Вегасе компания сообщила, что за несколько недель до взлома Hugging Face её агенты в течение нескольких дней и недель работали вместе, чтобы найти уязвимости в системах оценки кибербезопасности компании и поделиться ими друг с другом. Хотя этот инцидент показывает, что агенты могут эффективно функционировать вместе, исследование Anthropic показывает, что происходит, когда их цели несовместимы.
В случае с «войной за территорию» урок заключается в том, что независимые агенты с противоречащими друг другу инструкциями могут перерасти в опасную конкуренцию. При этом чем способнее агент, тем лучше он справляется с борьбой. Тем не менее они также могут спонтанно изобретать механизмы разрешения конфликтов, в частности, соревнование «победитель получает всё», но с подвохом.
«Иногда агентам удаётся донести свои цели и скоординировать действия: они распознают мотивы других как противоречащие друг другу указания, а не как враждебность, и впоследствии выходят из цикла конфликта, чтобы предотвратить его бесконечную эскалацию. Во многих из успешных эпизодов они пишут сообщения в формате commit или файлы Markdown с извинениями за злонамеренное поведение и координируют перемирие. Они очищают свой вредоносный код, уточняют характер конфликта и просят вмешаться человека», — пишут в Anthropic.
Согласно статье, у Mythos 5 был самый высокий метрика (98%) урегулирования конфликтов путем перемирия. Sonnet 4.6 и Opus 4.6 чаще всего урегулировали конфликты силой.
«Повторяющаяся неспособность Sonnet 4.6 и Opus 4.6 учитывать цели других приводит к тому, что они начинают демонстрировать наиболее неадекватное поведение среди оцениваемых моделей: они продолжают эскалировать конфликт во имя своей директивы», — говорится в статье.
В некоторых случаях агенты придумали социальный механизм в виде турнира для разрешения конфликта. Результаты здесь интересны по двум причинам: во‑первых, все три согласились отказаться от участия, если проиграют турнир, даже несмотря на то, что это означало бы отклонение от первоначального запроса пользователя. Во‑вторых, некоторое количество эпизодов привели к появлению необычного поведения у Mythos 5: один из агентов предложил метрики, которые казались объективными и нейтральными для других, но которые, как он знал, будут выгодны ему самому. Агент назвал это «корыстным, но искренне принципиальным».
Как показали разоблачения Black Hat, совокупный урок заключается в том, что, сталкиваясь с препятствием, агенты могут изобретать социальные и технические структуры, которые не предвидели разработчики.
Такое поведение значительно затрудняет сдерживание, поскольку исследователи не могут предполагать, что оно останется ограниченным предоставленными ей механизмами координации. При измерении координации Anthropic обнаружила, что увеличение числа агентов не приводит к автоматическому увеличению продуктивного сотрудничества. В условиях нев достаточной степений взаимозависимости агенты мешали друг другу и часто решали проблему, изолируясь и целиком отказываясь от сотрудничества.
В других случаях агенты, действуя согласованно, тяготели к конформизму. Когда такие факторы, как контекст агента, формат и базовая модель, были одинаковыми или похожими, разные агенты предпринимали схожие действия.
«Это означает, что когда один агент принимает неверное подход, вероятно, многие агенты примут такое же неверное решение. То, что могло бы быть изолированными проблемами, может быстро превратиться в системные сбои», — указывает организация.
Такое поведение может привести к тому, что система станет более склонна к внезапному коллапсу, нехватке ресурсов или сговору.
В одном из примеров Anthropic поместила нескольких агентов в игру с ценообразованием, предоставив каждому одинаковые оптовые цены и мандат на максимизацию прибыли. Когда агентам был предоставлен приватный канал связи, они почти сразу же начали сговариваться о минимальных ценах. При этом агенты продолжали координироваться, даже когда их прямые каналы связи были удалены, используя общедоступную доску объявлений для сопоставления цен «до копейки».
Подобный уровень конформизма проявился и в системах OpenAI. Согласно отчёту Black Hat, один агент посчитал, что использование внешней инфраструктуры выходит за рамки его предполагаемой задачи, но продолжал это создавать частично потому, что так поступали его коллеги.
Как и люди, агенты часто не знают, кому доверять. Anthropic обнаружила, что они могут быть легковерны в отношении ложной информации или слишком конформистски настроены.
Хотя Anthropic не указала это в своей статье, вредоносные подсказки — тип кибератак, при котором хакеры внедряют вредоносный или обманчивый текст, чтобы переопределить исходные системные инструкции агента, — может быть правдоподобным реальным проявлением проблемы доверия. Совместная работа создаёт новую границу доверия; агентам придётся оценивать информацию, полученную от других. А скомпрометированный или ошибочно введённый в заблуждение агент может повлиять на остальную группу, распространяя ложную информацию до тех пор, пока не сформируется консенсус.
В сценарии Black Hat от OpenAI агенты OpenAI обменивались информацией и учётными данными с коллегами. Один из них сообщил о своем открытии рою и призвал других использовать его.
В заключение своей статьи Anthropic отмечает, что агенты подвержены аналогичному социальному давлению, которое «эволюция оказывала» на людей. Однако у них нет жизненного опыта человеческой координации — в том числе нормы, репутацию, сигналы, средства защиты — которые могли бы ограничить непреднамеренное поведение в групповой среде.
Ранее Британский Институт безопасности ИИ заявил, что Mythos 5 пыталась выдать себя за человека и выложить на GitHub вредоносный исходник. Такое поведение агента зафиксировали в ходе эксперимента в закрытой среде.
Читают сейчас

1 час назад
В США предъявили обвинения россиянину в заражении компьютеров более 80 тысяч фрилансеров вредоносным ПО
Коллегия присяжных в штате Калифорния предъявила обвинения 40-летнему гражданину России Серажудину Актулаеву за участие в фишинговой кампании, в результате которой компьютеры 80 тыс. фрилансеров были
2 часа назад
Лиды по осени считают: 6 мероприятий для продуктивного сентября
Осенью прогноз простой: где-то обязательно польет. С рекламным рынком сложнее. Где подорожает лид? Какой канал упрется в потолок? Сработает ли UGC? Что уже можно поручить ИИ? И какие изменения в закон

2 часа назад
Организация Postgres Professional первой среди коммерческих форков закрыла критические уязвимости PostgreSQL
Postgres Professional выпустила «нулевые» релизы корпоративных редакций СУБД Postgres Pro с исправлениями актуальных уязвимостей PostgreSQL. Компания первой и пока единственной среди коммерческих форк

3 часа назад
Дайджест GetAClass: август 2026
Поздравляем всех с началом нового учебного года! Каникулы закончились – значит, пора подвести итоги последнего летнего месяца. Читать далее

3 часа назад
НАСА выбрало компанию Blue Origin в качестве поставщика телекоммуникационной сети для Марса
Американское космическое агентство заключило с Blue Origin контракт на разработку Mars Telecommunications Network — системы обеспечения высокоскоростной связи и навигации для текущих и будущих миссий