3 часа назад
Тестирование показало, что AI Overviews от Google выдаёт миллионы ложных ответов в час

Опция AI Overviews (ИИ-обзоры) в поисковой системе Google Search выдаёт миллионы ложных ответов в час, показало тестирование New York Times. Запущенный в 2024 году средство использует несколько компонентов, включая языковые модели Gemini.
NYT указывает, что ИИ-обзоры точны в 90% случаев. Газета провела анализ функции совместно со стартапом Oumi, который сам разрабатывает модели искусственного интеллекта. Организация использовала для проверки AI Overviews бенчмарк SimpleQA от OpenAI, а также собственные ИИ-инструменты. Тест производительности включает более 4 тыс. вопросов с проверяемыми ответами, чтобы оценить выдачу модели.
Oumi начала тестирование в прошлом году, когда актуальной моделью Google была Gemini 2.5. Тогда тест представил точность в 85%. Когда испытание провели после релиза Gemini 3, AI Overviews отвечала правильно на 91% вопросов. Если связать этот процент со всеми запросами в поисковике Google, то станет ясно, что ИИ-обзоры генерируют десятки миллионов неверных ответов ежедневно.
В одном из примеров у AI Overviews попросили назвать дату, когда дом музыканта Боба Марли стал музеем. Функция сослалась на три страницы, две из которых не содержали этой даты. На последней странице, из «Википедии», есть два противоречащие другу года, но инструмент выбрал неверный.
Пресс-секретарь Google Нед Адрианс заявил, что SimpleQA содержит неверную информацию. Часто модели оценивают на аналогичном тесте под названием SimpleQA Verified, который использует меньший набор вопросов, прошедших более тщательную проверку. В исследовании NYT и Oumi есть серьёзные недостатки, оно не отражает того, что люди ищут в Google на самом деле, подчеркнул Адрианс.
Издание Ars Technica указывает, что оценка новых ИИ-моделей больше напоминает искусство, чем науку — это представляет собой проблему. У каждой компании есть свой предпочтительный метод демонстрации возможностей модели, а недетерминированная природа генеративного ИИ способна затруднить проверку. Oumi использует ИИ-инструменты для оценки, а модели в их основе также могут галлюцинировать.
В дополнение к этого, AI Overviews — это не монолитная модель. Google сообщила, что использует «правильную схема» для каждого запроса. ИИ-обзоры выдавали бы наилучшие ответы, если бы постоянно использовали Gemini 3.1 Pro, но это медленно и затратно. Для быстрой загрузки информации на страницу поиска опция применяет более быстрые модели Gemini Flash.
Год назад кулинарные блогеры обвинили AI Overviews в снижении трафика на свои сайты. ИИ-обзоры генерировали бессмысленные рецепты и ремиксы реальных рецептов, сопровождая их сгенерированными изображениями блюд. В некоторых случаях ИИ-обзоры содержали ссылки на реальные рецепты, но сам ответ содержал множество неточностей.
Читают сейчас

36 минут назад
ИИ-энергосеть под ИИ отключает свет беднякам — MIT научился это находить
Представьте автономную ИИ-систему, которая управляет городской энергосетью: она минимизирует издержки, держит напряжение стабильным и выглядит идеально по всем техническим метрикам. А потом выясняется
38 минут назад
«Лаборатория Касперского» выпустила обучающие видео о кибербезопасности для школьников в рамках «Виртуальный ликбез»
Организация «Лаборатория Касперского» в контексте инициативы «Цифровой ликбез» наряду с АНО «Цифровая экономика» при поддержке Минпросвещения РФ и Минцифры РФ подготовила два обучающих видео про кибер
1 час назад
Ведущий аналитик Mobile Research Эльдар Муртазин: крупные площадки будут тратить по 15 млрд рублей в год на борьбу с VPN
Крупные IT-площадки в РФ будут тратить по 15 млрд в год на борьбу с VPN, сообщил СМИ ведущий аналитик Mobile Research Эльдар Муртазин. Бизнес всеми силами старается оттянуть запрет на работу сервисов

1 час назад
Бывший техлид Kling собрал в Alibaba видеомодель, которая порвала лидерборд
Видеомодель HappyHorse-1.0, которую некоторое количество дней назад обнаружили на анонимной видео-арене Artificial Analysis, возглавила лидерборд в категории генерации видео по тексту без аудио с рейт
1 час назад
Учёные ЮУрГУ и Института психологии РАН научили нейросеть определять уровень креативности человека
Специалисты Южно‑Уральского государственного университета (ЮУрГУ) совместно с коллегами из Института психологии РАН научили нейросеть анализировать уровень креативности человека. Об этом сообщило изда