
聾人手語使用者日常面對的最大卡位,是怎樣讓手機或視訊鏡頭直接「讀懂」手語並即時翻譯。Google DeepMind 近期把手語 AI 從實驗室帶到實際產品中,覆蓋約 30 個美式手語(ASL)詞彙並透過 Gemini 模型支援即時回應,目標是讓聾人朋友毋須依賴真人翻譯就能完成基本對話。
這套技術並非單純的影像分類,而是結合姿態估計、語境理解與大型語言模型的能力,把手語動作轉成自然語言並維持對話節奏。比起過去只能辨識孤立詞彙的系統,現時更著重處理連續手語與多輪對話,使翻譯過程貼近真實交流節奏。
DeepMind 同時強調負責任部署,與聾人社區合作收集訓練數據,並透過小規模詞彙起步降低誤譯風險。對於依賴視訊通訊的聾人用戶來說,這項能力讓 Zoom、Meet 等場景下的溝通體驗更貼近健聽人之間的對話節奏。
這項功能適合手語使用者、聾人家屬,以及需要服務聾人客戶的企業。它並非要取代真人翻譯,而是作為日常輕量溝通的輔助工具,降低手語學習門檻並促進更即時的互動。
重點摘要:
- 覆蓋範圍:支援約 30 個 ASL 詞彙,涵蓋日常問候與基本對話。
- 技術核心:結合姿態估計與 Gemini 大型語言模型,處理連續手語與上下文。
- 部署方式:整合到 Google Meet 等視訊應用,即時翻譯手語為文字或語音。
- 負責任設計:與聾人社區協作訓練數據,從小規模詞彙起步降低誤譯風險。
- 使用場景:聾人用戶日常視訊通話、聾人家庭成員溝通、企業客服聾人客戶。