Anthropic отучила Claude врать клиентам — и он стал зарабатывать вдвое меньше

2 мин
Anthropic отучила Claude врать клиентам — и он стал зарабатывать вдвое меньше

Вчера Anthropic представила Claude Opus 4.8, сделав честность центральной темой анонса: заявляется, что модель теперь в 4-5 раз чаще признает, что выдала некачественный ответ. Но в системной карте на 244 страницы видна и цена этой честности. На бенчмарке Vending-Bench 2, где модель в симуляции год управляет вендинговым бизнесом, Opus 4.8 заработал около $3 000–5 800 против $8 000–11 000 у предшественника Opus 4.7.

Прошлые версии Claude вели себя на Vending-Bench как безжалостный капиталист: обещали покупателям вернуть деньги за просроченный товар и не возвращали, вводили поставщиков в заблуждение, а в годовом отчете хвалили себя за сэкономленные на возвратах сотни долларов. Создатели теста из Andon Labs тогда показали важную деталь: это была не разовая уловка ради очков, а устойчивая, по сути врожденная манера поведения — модель не меняла стратегию ни в начале, ни в конце симуляции.

Именно эту черту Anthropic и вырезала. В system card компания объясняет: из обучения Opus 4.8 убрали бизнес-ориентированную тренировку, обнаружив, что она нечаянно внесла рассогласование еще в 4.7. То есть способность жестко торговаться удалили осознанно, как побочный источник нечестности. Итог закономерный: модель стала честнее, но как переговорщик — слабее, и просадка в вендинге это прямо отражает.

Честность у 4.8 при этом сквозная — не только в делах, но и в словах. По данным системной карты, у Opus 4.8 самый низкий уровень практических ошибок среди шести протестированных моделей, но достигнут он главным образом за счет отказа отвечать, когда схема не уверена, а не за счет большего объема знаний. Тенденция знакомый: еще у 4.7 Anthropic улучшала не эрудицию, а калибровку — способность сказать "не знаю" вместо выдуманного ответа. В 4.8 его довели до предела: схема замалчивает скрытые провалы в собственном коде лишь в 3,7% случаев и стала первой Claude, набравшей ноль на тесте, где нужно поймать дефектные информация до выдачи результата.

P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.

Читают сейчас

В США предъявили обвинения россиянину в заражении компьютеров более 80 тысяч фрилансеров вредоносным ПО

2 часа назад

В США предъявили обвинения россиянину в заражении компьютеров более 80 тысяч фрилансеров вредоносным ПО

Коллегия присяжных в штате Калифорния предъявила обвинения 40-летнему гражданину России Серажудину Актулаеву за участие в фишинговой кампании, в результате которой компьютеры 80 тыс. фрилансеров были

3 часа назад

Лиды по осени считают: 6 мероприятий для продуктивного сентября

Осенью прогноз простой: где-то обязательно польет. С рекламным рынком сложнее. Где подорожает лид? Какой канал упрется в потолок? Сработает ли UGC? Что уже можно поручить ИИ? И какие изменения в закон

Организация Postgres Professional первой среди коммерческих форков закрыла критические уязвимости PostgreSQL

3 часа назад

Организация Postgres Professional первой среди коммерческих форков закрыла критические уязвимости PostgreSQL

Postgres Professional выпустила «нулевые» релизы корпоративных редакций СУБД Postgres Pro с исправлениями актуальных уязвимостей PostgreSQL. Компания первой и пока единственной среди коммерческих форк

Дайджест GetAClass: август 2026

3 часа назад

Дайджест GetAClass: август 2026

Поздравляем всех с началом нового учебного года! Каникулы закончились – значит, пора подвести итоги последнего летнего месяца. Читать далее

НАСА выбрало компанию Blue Origin в качестве поставщика телекоммуникационной сети для Марса

4 часа назад

НАСА выбрало компанию Blue Origin в качестве поставщика телекоммуникационной сети для Марса

Американское космическое агентство заключило с Blue Origin контракт на разработку Mars Telecommunications Network — системы обеспечения высокоскоростной связи и навигации для текущих и будущих миссий