Gboard сможет понимать язык жестов через камеру смартфона
Клавиатура Google Gboard стремится помочь вам превращать мысли в слова на экране максимально просто. У нас уже есть множество способов сделать это: от традиционного набора букв до удобного свайп-ввода Glide и голосового набора. Но теперь Google может серьёзно повысить уровень доступности: Gboard готовится понимать язык жестов.
Исследователи Google DeepMind уже некоторое время разрабатывают инструменты для интерпретации языка жестов с помощью ИИ. В последнем обновлении Gboard мы видим, что клавиатура готовится принимать ввод Sign-to-Text (преобразование жестов в текст). Механизмы конфиденциальности будут обрабатывать видео на устройстве, отправляя в облачные ИИ Google только данные о raw-жестах.
Возможность автоматического преобразования жестов языка жестов в письменный текст звучит почти фантастически, но благодаря прогрессу в машинном зрении и ИИ-обработке звёзды наконец сходятся, чтобы сделать эту задачу не просто возможной, но и практичной. В прошлом году Google DeepMind представила модель SignGemma для интерпретации языка жестов, и теперь мы, возможно, видим одно из её первых крупных применений.
Судя по обнаруженным текстовым строкам в приложении, Google строит гибридную локально-облачную модель: видео обрабатывается на устройстве для извлечения жестов, после чего данные отправляются в Google для анализа и преобразования в текст. Это обеспечивает конфиденциальность, не передавая само видео. Пока неясно, какие именно версии языка жестов будут поддерживаться — американский язык жестов (ASL) или британский (BSL). Тем не менее, это именно то решение, которое идеально подходит для смартфонов и может открыть новые возможности для общения тем, кто в этом больше всего нуждается.
По материалам Android Authority
