6 марта 2026, 15:59
OpenAI готовит к релизу двунаправленную аудиомодель

Компания OpenAI ведет разработку инновационной двунаправленной (BiDi) аудиомодели, которая сделает диалог с искусственным интеллектом максимально похожим на человеческий. В отличие от текущих систем, новая техника позволяет ИИ обрабатывать речь непрерывно и мгновенно реагировать на изменения в процессе беседы.
ТТехника BiDi: конец эпохи пошаговых диалогов
Суть новой двунаправленной (BiDi) обработки звука заключается в непрерывном анализе входящего аудиопотока. В отличие от существующих пошаговых систем, где искусственный интеллект ожидает окончания фразы пользователя, BiDi-модель адаптируется к изменениям в режиме реального времени. Подобная архитектура даёт возможность алгоритму мгновенно корректировать ответ, если собеседник перебивает его или меняет тему разговора. Исследователи OpenAI отмечают, что текущие аудиомодели уступают текстовым решениям в точности и скорости, из-за чего большинство пользователей ChatGPT предпочитает текстовый оболочку голосовому.
Проблемы разработки и новые сроки запуска
В процессе тестирования прототипов инженеры столкнулись с техническими сбоями: схема начинает работать некорректно спустя несколько минут диалога. По этой причине запускание технологии перенесли с первого квартала 2026 года на следующий квартал или более поздний дедлайн. Данная задержка продолжает историю сложностей OpenAI с аудиопродуктами. Ранее добавление режима Advanced Voice Mode для GPT-4o откладывалось для доработки инфраструктуры и систем безопасности. В процессе ранних тестов специалисты фиксировали ошибки, включая имитацию голоса пользователя и неожиданные выкрики системы. Сегодня разработчики сосредоточены на способности модели обнаруживать и отклонять нежелательный контент.
Аппаратное будущее и экосистема устройств OpenAI
РСоздание новой модели является частью стратегии OpenAI по выходу на сегмент потребительской электроники. Компания планирует представить персональное аудиоустройство на протяжении года, а в дальнейшем расширить портфель за счет умных колонок и очков. Для интеграции в гаджеты и автомобили ведется создание облегченных моделей, способных обрабатывать аудио локально. Это позволит снизить затраты по сравнению с облачными вычислениями, следуя примеру Google, использующей схема Gemini Nano в смартфонах Pixel. Для ускорения работ руководство OpenAI объединило команды инженеров, исследователей и продуктологов в единую группу, сфокусированную на аудиорешениях.
Читают сейчас

1 час назад
Вышел альфа-релиз Paint.NET 5.2 с экспериментальной поддержкой Wine/Linux
1 сентября 2026 года состоялся выпуск альфа-версии графического редактора с открытым исходным кодом Paint.NET 5.2 для Windows 10/11 (64-бита) и с экспериментальной поддержкой Wine/Linux (Wine 11.14, U
1 час назад
Операционная платформа «Альт Образование» бесплатна для школ — акция от «Базальт СПО»
Операционная платформа «Альт Образование» бесплатна для школ — акция от «Базальт СПО» Организация «Базальт СПО» запускает специальное предложение для школ: операционная система «Альт Образование» 11 п

1 час назад
Google добавила агентный аналитика видео в Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite
Google запустила агентный анализ видео для Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Теперь модель анализирует видео не как последовательность кадров с фиксированной частотой, а сама решает, какие

2 часа назад
Апдейт платформы «Октопус» от ГК «Юзтех»: историческая анализ и расширенная сопровождение инфраструктур
В новых версиях «Октопус» мы сфокусировались на трёх направлениях: расширении возможностей управления ИТ-инфраструктурой, повышении производительности и развитии интеграций. Система получила новые сце

2 часа назад
Frank Media рассказал о сложностях, с которыми столкнулись пользователи при попытке воспользоваться цифровым рублём
С 1 сентября должно было начаться массовое добавление цифрового рубля — третьей формы денег, которую Банк России обсуждает уже около шести лет. Тем не менее, судя по первым дням запуска, доступ к ново