16 марта 2026, 17:47
OpenClaw-RL обучает ИИ-агентов в реальном времени, просто говоря с ними

До недавнего времени все взаимодействия с нейросетью использовались только как контекст для следующего шага – и тут же забывались. Команда ученых из Принстона посчитала такой подход системной ошибкой и разработала архитектуру, которая превращает эти мимолетные сигналы в тренировочный материал. Каркас не делает различий между личной перепиской, работой в командной строке, задачами по разработке ПО или вызовами инструментов – все стекается в один конвейер для улучшения единой модели.

Согласно заявлению исследователей, в этих постсигналах скрыты два типа информации, которые ранее игнорировались. Первый – оценочный. Если потребитель переспрашивает то же самое, схема фиксирует неудовлетворенность. Если автоматический проверка проходит – действие было верным. Сигналы становятся естественной оценкой качества каждого шага без необходимости ручной разметки. Прежние методы в лучшем случае использовали такие данные постфактум, выуживая их из заранее собранных датасетов.
Второй тип – направляющий. Когда человек пишет “Надо было сначала проверить файл”, эта реплика содержит не просто оценку (“плохо”), а конкретное указание, что именно следовало сделать иначе. Обычные системы обучения с подкреплением сжимают такую обратную связь в обычное число (награду), теряя по дороге всю содержательную часть.

Архитектура OpenClaw-RL разбита на четыре несвязанных блока: один обслуживает запросы к модели, второй управляет окружениями, третий оценивает качество ответов, а четвертый занимается непосредственно тренировкой весов. Ни один из них не ждет другой: модель отвечает на второй запрос пользователя в тот момент, когда модель-оценщик анализирует предыдущий ответ, а тренировочный модуль параллельно обновляет веса.
Исследователи проверили OpenClaw-RL на модели Qwen3-4B в двух симулированных сценариях. В первом языковая схема играла студента, который использует OpenClaw для домашних заданий, но не хочет, чтобы его распознали как ИИ. Во втором – преподавателя, которому нужен определённый фидбек по работам.

В сценарии со студентом метрика персонализации подскочил с 0,17 до 0,76 всего за восемь шагов обучения при комбинированном методе. Binary RL в одиночку достиг только 0,25, и OPD в одиночку равным образом представил 0,25 после восьми шагов, но догнал до 0,72 после 16 шагов. В сценарии с учителем оценка выросла с 0,22 до 0,90.
Для общих агентов каркас протестировали с разными версиями Qwen3 на задачах с командной строкой, графическим интерфейсом, разработкой ПО и вызовом инструментов. И здесь интеграция добавочных оценок помогла. В сценарии с вызовами инструментов точность выросла с 0,17 до 0,30, а для графического интерфейса – с 0,31 до 0,33.

Исследователи утверждают, что их каркас – первая платформа, объединяющая несколько одновременных потоков взаимодействия (от личных разговоров до задач разработки) в едином тренировочном цикле. Исходный код доступен на GitHub.
Хотя принстонский проект использует название популярного открытого AI-агента OpenClaw и опирается на его инфраструктуру, это независимое исследование, уже не связанное напрямую с основной командой платформы. Основатель OpenClaw Питер Штайнбергер передал проект в фонд и перешел в OpenAI для работы над следующим поколением персональных AI-агентов.
Читают сейчас

11 минут назад
Google отключил оператор inurl
Ранее Google ограничил количество результатов поиска по оператору site, а теперь полностью отключил и inurl — поисковый оператор, который позволял находить документы содержащие нужную последовательнос

54 минуты назад
Вышло апдейт мультиплатформенного проекта RevPDF 4.5 — альтернатива Adobe Acrobat
13 июня 2026 года состоялся версия мультиплатформенного проекта RevPDF 4.5. Это маленький, бесплатный, работающий в автономном режиме редактор PDF-файлов с возможностью редактирования текста, скрытия

3 часа назад
Microsoft выпустила версию PowerToys 0.100.0
Организация Microsoft выпустила PowerToys версии 0.100.0. Выпуск содержит исправления и улучшения для нескольких модулей, а наиболее важные изменения касаются повышения производительности, уменьшения

4 часа назад
Апдейт Telegram: форматирование ботов и Markdown-файлы
Telegram опубликовал крупное обновление с десятками новых функций, в том числе с поддержкой мессенджера на смарт-часах, в том числе с Wear OS, а также опциями для ботов, групп и встроенного браузера.

4 часа назад
Shutterstock станет «творческой платформой на основе ИИ»
В Shutterstock анонсировали следующую ступень развития платформы, объединяющую библиотеку созданных людьми медиа с растущим набором инструментов на основе ИИ. Цель состоит в том, чтобы помочь пользова