7 марта 2026, 11:21
GPT-5.4 стал лучшим ИИ для вайб-кодинга

GPT-5.4 занял первое место на Vibe Code Bench v1.1 с результатом 67,42% — на 5,7 п.п. выше предыдущего лидера GPT-5.3 Codex (61,77%). Третье место — у Claude Opus 4.6 без режима рассуждений с 57,57%. Бенчмарк измеряет не умение дописать функцию или починить баг, а способность модели собрать работающее веб-приложение целиком — от пустой папки до развернутого сервиса — по текстовому описанию.
Набор включает 100 промптов на приложения, разделенных на публичную и тестовую части. Каждая задача предполагает, что схема с нуля строит программа в изолированной среде с доступом к браузеру, терминалу и типичным продакшен-сервисам — аутентификации, базам данных, платежным системам и почте arXiv. Среди заданий — аналоги популярных сервисов (например, социальная сеть Zeeter, напоминающая X), трекеры привычек и порталы управления классом. На каждое приложение модели дается до пяти часов. Готовый результат проверяет отдельный агент-оценщик: он пытается пользоваться приложением как человек и выставляет балл по числу работающих функций.
Отдельный занимательный срез — стоимость одной попытки. Vals AI приводят кривые "точность — стоимость" и "точность — задержка": больше денег и времени повышают итог, но с убывающей отдачей. Одновременно Claude Opus 4.6 добирается до результатов, близких к топу, при меньших затратах и задержках, чем GPT-5.3 Codex и GPT-5.4. Иными словами, лидерство GPT-5.4 по точности не означает лидерство по эффективности — для разработчиков, считающих токены, это значимый нюанс.
Но даже у лидера картина далека от "вайб-кодинг решен". Приблизительно треть решений у GPT-5.4 все еще проваливается, а распределение результатов по приложениям следующее: они либо работают хорошо (87–100 процентов тестов), либо не работают почти полностью (0–12,5%). Однако скорость прогресса в бенчмарке впечатляет — еще полгода назад лучший итог был вдвое ниже.
P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.
Читают сейчас

3 часа назад
Глава Microsoft объяснил, почему ИИ не обесценит людей
Гендиректор Microsoft Сатья Наделла опубликовал в X программную статью о будущем компаний в экономике, которой управляет ИИ. Его основной вывод звучит так: чем мощнее становится искусственный интеллек

5 часов назад
Отчет KPMG про агентный ИИ создал текст ИИ. Он похвалил сам себя и наврал почти во всех ссылках
Аудиторская организация KPMG, одна из "крупный четверки", отозвала свой отчет о пользе агентного ИИ — после того как стало известно, что сам документ оказался наглядной демонстрацией главной проблемы

6 часов назад
Google отключил оператор inurl
Ранее Google ограничил количество результатов поиска по оператору site, а теперь полностью отключил и inurl — поисковый оператор, который позволял находить документы содержащие нужную последовательнос

7 часов назад
Вышло апдейт мультиплатформенного проекта RevPDF 4.5 — альтернатива Adobe Acrobat
13 июня 2026 года состоялся версия мультиплатформенного проекта RevPDF 4.5. Это маленький, бесплатный, работающий в автономном режиме редактор PDF-файлов с возможностью редактирования текста, скрытия

9 часов назад
Microsoft выпустила версию PowerToys 0.100.0
Организация Microsoft выпустила PowerToys версии 0.100.0. Выпуск содержит исправления и улучшения для нескольких модулей, а наиболее важные изменения касаются повышения производительности, уменьшения