13 августа 2026, 09:17
Google DeepMind выпустила ML‑модель для перевода жестового языка в текст

Google DeepMind представила SL2T — модель для перевода американского жестового языка в текст. Нейросеть интегрировали в Gboard и Live Transcribe на Pixel 11: пользователи могут вводить текст, показывая жесты на камеру. В будущем технологию планирую добавить на другие устройства и расширят поддерживаемые языки.
В Gboard функция работает как голосовая диктовка: пользователь направляет камеру устройства на себя и начинает жестикулировать, а система преобразует жесты в текст на английском языке. Так можно писать сообщения, набирать документы, вводить поисковые запросы или общаться с Gemini. В Live Transcribe техника позволяет отвечать жестами во время разговора с человеком, использующим устную речь.
Схема SL2T построена на базе трансформера и генерирует перевод авторегрессионно. На вход модель получает не изображение с камеры, а последовательность координат 130 ключевых точек лица, тела и рук. Это отличает SL2T от других систем, которые пытаются сопоставлять отдельные жесты со словами. Это важно, так как смысл фраз на жестовом языке часто передаётся не только руками, но и движениями корпуса, головы и лица.

Google отмечает, что система локально обрабатывает видео с камеры и сразу удаляет, а на сервера компании попадают только координаты. Это даёт больше приватности и снижает требования к передаче данных, но накладывает несколько ограничений. Например, SL2T не может отслеживать движение языка, не видит окружающие объекты и не получает информацию о глубине.
Для обучения Google собрала более 100 тысяч часов данных на более чем 50 жестовых языках, около четверть датасета приходится на ASL. Компания отмечает, что обучение сразу на нескольких языках помогло улучшить качество перевода американского жестового языка. Дополнительно разработчики имитировали сценарии использования смартфона одной рукой и зеркально отражали движение, чтобы платформа хорошо работала с левшами.
В тесте FLEURS‑ASL схема получила 70 баллов в режиме zero‑shot, а на версии теста с жестами одной рукой — 74 балла. Точность распознавания по FSboard составляет 64%. В целом схема может хуже справляться с распознаванием региональных вариантов жестов и сложных грамматических конструкций, ошибаться при передаче смысла через мимику и генерировать перевод, когда пользователь не показывает жестов.
В ранних версиях у SL2T прослеживались ошибки, характерные для других языковых моделей. В частности, телефонный код 207 система распознавала как 2007. Часть подобных проблем Google исправила перед релизом, но галлюцинации всё ещё встречаются.
Равным образом система пока может обрабатывать фрагменты продолжительностью не более 60 секунд и не хранит историю реплик. Она не учитывает приложение, в котором активируют распознавание, и не поддерживает внедрение пользовательских жестов в словарь. Команды «удалить», «новая строка» или «отправить» пока тоже не поддерживаются.
Читают сейчас
28 минут назад
Операционная платформа «Альт Образование» бесплатна для школ — акция от «Базальт СПО»
Операционная платформа «Альт Образование» бесплатна для школ — акция от «Базальт СПО» Организация «Базальт СПО» запускает специальное предложение для школ: операционная система «Альт Образование» 11 п

38 минут назад
Google добавила агентный аналитика видео в Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite
Google запустила агентный анализ видео для Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Теперь модель анализирует видео не как последовательность кадров с фиксированной частотой, а сама решает, какие

1 час назад
Апдейт платформы «Октопус» от ГК «Юзтех»: историческая анализ и расширенная сопровождение инфраструктур
В новых версиях «Октопус» мы сфокусировались на трёх направлениях: расширении возможностей управления ИТ-инфраструктурой, повышении производительности и развитии интеграций. Система получила новые сце

1 час назад
Frank Media рассказал о сложностях, с которыми столкнулись пользователи при попытке воспользоваться цифровым рублём
С 1 сентября должно было начаться массовое добавление цифрового рубля — третьей формы денег, которую Банк России обсуждает уже около шести лет. Тем не менее, судя по первым дням запуска, доступ к ново
2 часа назад
Digital Q.Sensor BI от «Диасофт» модернизировал ИИ-агента: визуальные правки дашбордов без доступа к данным
«Диасофт» представил обновленные возможности ИИ-агента платформы Digital Q.Sensor BI: теперь он может вносить правки в готовый дашборд, ориентируясь в том числе на его визуальное отображение. ИИ-агент