JetBrains протестировали скилл Ponytail: объём кода сократился на 15%, а расходы на 10%

4 мин
JetBrains протестировали скилл Ponytail: объём кода сократился на 15%, а расходы на 10%

JetBrains опубликовали результаты тестирования Ponytail — скилла для coding-агентов, который должен бороться с оверинжинирингом. Он предлагает агенту сначала поискать самое простое подход и только после этого писать новый исходник.

Разработчики Ponytail заявляют о сокращении объёма генерируемого кода на 54 процентов, количества токенов — на 22%, расходов — на 20%, а времени выполнения задач — на 27 процентов. В независимом тесте JetBrains показатели оказались скромнее, но скилл действительно сработал.

Как работает Ponytail

Перед реализацией задачи Ponytail заставляет агента пройти своеобразную «лестницу минимализма»:

  • нужна ли эта реализация вообще;

  • нет ли подходящего решения уже в проекте;

  • можно ли применять стандартную библиотеку;

  • поддерживает ли это сама система;

  • есть ли нужная возможность в уже установленной зависимости;

  • можно ли решить задачу одной строкой;

  • какой минимальный объём нового кода действительно необходим.

При этом правила скилла не должны сокращать валидацию, обработку ошибок, безопасность и доступность интерфейсов.

В частности, вместо установки отдельной библиотеки и создания компонента для выбора даты агент может применять типовой HTML-элемент <input type="date">, если его возможностей достаточно для задачи.

Как проходило тестирование

JetBrains сравнили обычный Claude Code и Claude Code с Ponytail на 80 парных задачах из SkillsBench. В обоих случаях использовалась модель Claude Sonnet 5.

Правила Ponytail принудительно добавлялись в контекст агента. Это важная деталь: когда исследователи просто установили SKILL.md и оставили подход об активации модели, Claude Code не воспользовался скиллом ни в одной из десяти тестовых сессий.

Полноценная версия Ponytail решает эту проблему с помощью плагина и хука SessionStart, который автоматически добавляет инструкции в начало каждой сессии.

Обещания и результаты

В тестах JetBrains Ponytail сократил объём написанного агентом кода примерно на 15% вместо заявленных 54%.

Общее потребление токенов снизилось около на 8%, стоимость выполнения задач — на 10%, а время работы — около на 11%. Сильнее всего сократился именно текст, который генерирует модель.

Итак, все показатели изменились в заявленную сторону, но фактическая экономия составила приблизительно от четверти до половины от обещанной.

Заявленные показатели Ponytail и результаты тестирования JetBrains.
Заявленные показатели Ponytail и результаты тестирования JetBrains.

Итог зависит от размера задачи

Наибольший эффект Ponytail показал в задачах, где у агента было пространство для оверинжиниринга.

В крупных задачах объём кода сокращался приблизительно на 31%. В реализациях среднего размера — приблизительно на 21%, в небольших — на 12%. Если обычный агент и без скилла писал минимальное количество кода, Ponytail почти ничего не менял.

JetBrains отмечает, что заявленные разработчиками Ponytail 54% были получены на 12 специально выбранных задачах с характерными ловушками для coding-агентов. В таких сценариях модель могла устанавливать лишние зависимости, создавать дополнительные абстракции или писать собственную реализацию вместо использования возможностей платформы.

Чем больше кода писал обычный агент, тем заметнее был эффект Ponytail
Чем больше кода писал обычный агент, тем заметнее был эффект Ponytail

Качество выполнения задач не изменилось

Из 80 парных задач 65 получили одинаковую оценку с Ponytail и без него. В шести случаях релиз со скиллом показала лучший итог, в девяти — худший. JetBrains не обнаружила заметного влияния на итоговое качество выполнения задач.

Одновременно тесты SkillsBench проверяли, справился ли агент с заданием, но не проводили отдельный аудит безопасности, валидации или доступности. Поэтому результаты не подтверждают заявление разработчиков Ponytail о полном сохранении защитных механизмов.

В большинстве задач оценка с Ponytail и без него совпала
В большинстве задач оценка с Ponytail и без него совпала

Вывод

Ponytail не обеспечил заявленного сокращения кода на 54%, но всё же показал измеримый итог: около на 15% меньше кода и на 10% ниже расходы без заметного ухудшения качества.

Польза скилла зависит от поведения самого агента. Если схема уже предлагает компактные решения, разница будет маленький. Если она склонна разрабатывать лишние абстракции, подключать библиотеки и превращать небольшие задачи в отдельные подсистемы, эффект Ponytail становится заметнее.

Это третье исследование JetBrains в серии тестов инструментов для экономии ресурсов coding-агентов. Ранее организация проверила Caveman, сокращающий текстовые ответы, и RTK, сжимающий вывод командной строки. Ponytail стал первым инструментом серии, который представил убедительное падение расходов на полном наборе задач.

Источник: JetBrains AI Blog.

Русскоязычное сообщество про AI в разработке

Друзья! Эту новость подготовила команда ТГК «AI for Devs» — канала, где мы рассказываем про AI-агентов, плагины для IDE, делимся практическими кейсами и свежими новостями из мира ИИ. Подписывайтесь, чтобы быть в курсе и ничего не упустить!

Читают сейчас

В США предъявили обвинения россиянину в заражении компьютеров более 80 тысяч фрилансеров вредоносным ПО

2 часа назад

В США предъявили обвинения россиянину в заражении компьютеров более 80 тысяч фрилансеров вредоносным ПО

Коллегия присяжных в штате Калифорния предъявила обвинения 40-летнему гражданину России Серажудину Актулаеву за участие в фишинговой кампании, в результате которой компьютеры 80 тыс. фрилансеров были

2 часа назад

Лиды по осени считают: 6 мероприятий для продуктивного сентября

Осенью прогноз простой: где-то обязательно польет. С рекламным рынком сложнее. Где подорожает лид? Какой канал упрется в потолок? Сработает ли UGC? Что уже можно поручить ИИ? И какие изменения в закон

Организация Postgres Professional первой среди коммерческих форков закрыла критические уязвимости PostgreSQL

2 часа назад

Организация Postgres Professional первой среди коммерческих форков закрыла критические уязвимости PostgreSQL

Postgres Professional выпустила «нулевые» релизы корпоративных редакций СУБД Postgres Pro с исправлениями актуальных уязвимостей PostgreSQL. Компания первой и пока единственной среди коммерческих форк

Дайджест GetAClass: август 2026

3 часа назад

Дайджест GetAClass: август 2026

Поздравляем всех с началом нового учебного года! Каникулы закончились – значит, пора подвести итоги последнего летнего месяца. Читать далее

НАСА выбрало компанию Blue Origin в качестве поставщика телекоммуникационной сети для Марса

3 часа назад

НАСА выбрало компанию Blue Origin в качестве поставщика телекоммуникационной сети для Марса

Американское космическое агентство заключило с Blue Origin контракт на разработку Mars Telecommunications Network — системы обеспечения высокоскоростной связи и навигации для текущих и будущих миссий