9 июня 2026, 23:49
Выпущен тест производительности FrontierCode для оценки ИИ-моделей по «качеству пулл-реквестов»


Организация Cognition выпустила новый бенчмарк FrontierCode для измерения «способности ИИ-моделей выдерживать стандарты качества реальных кодовых баз». Согласно заявлению его создателей, обычно кодинговые бенчмарки для LLM оценивают лишь формальное выполнение задач, а теперь пора задаваться более сложным вопросом: «могут ли модели писать качественный исходник?»
Чтобы оценить это, они оттолкнулись от другого вопроса: «Если бы действия модели были реальным пулл-реквестом, то смерджил бы мейнтейнер его или нет?»
Как признают создатели, здесь существуют как объективные критерии (возможно выделить «блокеры», с которыми точно не будет смерджен), так и более сложная субъективная составляющая. Для создания тестовых заданий и критериев оценки они обратились к мейнтейнерам ряда реальных репозиториев.
Получившаяся система оценки результатов учитывает ряд критериев:
Behavioural correctness: решает ли код от машины поставленную задачу?
Regression safety: не ломает ли он при этом что-то другое в кодовой базе?
Mechanical cleanliness: проходит ли он проверки проекта вроде lint check?
Test correctness: будут ли тесты, созданные LLM для проверки своего решения, падать без него?
Scope: затрагивает ли решение «лишние» места в коде, не требующиеся для этой задачи?
Code quality: соответствует ли решение конвенциям кодовой базы, следует ли паттернам проектирования, остаётся ли читабельным?
Там, где для оценки этого возможно использовать стандартные бинарные средства вроде юнит-тестов, бенчмарк обращается к ним. Но в более сложных вопросах (вроде идиоматичности и читаемости кода) для оценки прибегают к LLM.
Всего в бенчмарке 150 задач, и 50 наиболее сложных из них выделены в отдельную подгруппу «Diamond». При выходе бенчмарка даже лидирующая в нём модель Opus 4.8 набирала лишь 13.8%, что куда ниже, чем у известных бенчмарков вроде SWE-bench. Но почти сразу за ним последовал выпуск модели Fable 5 (вероятно, события были заранее согласованы), и в его анонсе приводится новый рекордный результат в 29.3%.
Точные задачи публично не раскрываются, чтобы избежать проблемы contamination, когда модели уже знают из обучающего датасета, как проходить проверка. Среди доступной информации сообщается, что разделение задач между языками программирования разнообразнее, чем у бенчмарков SWE-bench Pro и DeepSWE:

В IT-сообществе многие поддержали основную идею «оценивать качество кода от LLM», соглашаясь, что в 2026 году это насущный вопрос. Тем не менее к конкретной реализации возникают и уточнения: например, «Насколько вопроизводимы результаты, не получаются ли при перезапуске бенчмарка значимо отличающиеся числа?»
Читают сейчас
33 минуты назад
Операционная платформа «Альт Образование» бесплатна для школ — акция от «Базальт СПО»
Операционная платформа «Альт Образование» бесплатна для школ — акция от «Базальт СПО» Организация «Базальт СПО» запускает специальное предложение для школ: операционная система «Альт Образование» 11 п

43 минуты назад
Google добавила агентный аналитика видео в Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite
Google запустила агентный анализ видео для Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Теперь модель анализирует видео не как последовательность кадров с фиксированной частотой, а сама решает, какие

1 час назад
Апдейт платформы «Октопус» от ГК «Юзтех»: историческая анализ и расширенная сопровождение инфраструктур
В новых версиях «Октопус» мы сфокусировались на трёх направлениях: расширении возможностей управления ИТ-инфраструктурой, повышении производительности и развитии интеграций. Система получила новые сце

1 час назад
Frank Media рассказал о сложностях, с которыми столкнулись пользователи при попытке воспользоваться цифровым рублём
С 1 сентября должно было начаться массовое добавление цифрового рубля — третьей формы денег, которую Банк России обсуждает уже около шести лет. Тем не менее, судя по первым дням запуска, доступ к ново
2 часа назад
Digital Q.Sensor BI от «Диасофт» модернизировал ИИ-агента: визуальные правки дашбордов без доступа к данным
«Диасофт» представил обновленные возможности ИИ-агента платформы Digital Q.Sensor BI: теперь он может вносить правки в готовый дашборд, ориентируясь в том числе на его визуальное отображение. ИИ-агент