SL2T: Google DeepMind ra mắt AI dịch ngôn ngữ ký hiệu sang văn bản
Google DeepMind giới thiệu SL2T, mô hình dịch 50+ ngôn ngữ ký hiệu sang văn bản, đã tích hợp Gboard và Live Transcribe trên Pixel 11.

70 triệu người bị AI bỏ quên
Vài chục năm qua, AI xử lý ngôn ngữ nói đã tiến rất xa: dịch tự động, gõ bằng giọng nói, trợ lý hội thoại — tất cả đều mượt với người nghe được. Nhưng hơn 200 ngôn ngữ ký hiệu trên thế giới, thứ ngôn ngữ chính của khoảng 70 triệu người Điếc và khiếm thính, gần như đứng ngoài cuộc cách mạng này.
Ngày 12/8, Google DeepMind công bố SL2T (sign-language-to-text) — mô hình dịch ngôn ngữ ký hiệu sang văn bản quy mô lớn, được đưa thẳng vào sản phẩm tiêu dùng thay vì nằm trong phòng lab. SL2T đã có mặt trong Gboard và Live Transcribe trên Pixel 11, bắt đầu với cặp Ngôn ngữ ký hiệu Mỹ (ASL) sang tiếng Anh.
Cơ chế dùng tương tự việc gõ bằng giọng nói: người dùng có thể ra dấu để tìm kiếm, soạn tin nhắn, hỏi Gemini, hoặc trả lời trong cuộc hội thoại qua Live Transcribe — không cần gõ tay qua lại. Theo nhóm thử nghiệm nội bộ, ra dấu ASL nhanh và tự nhiên hơn gõ tiếng Anh.
Vì sao dịch ngôn ngữ ký hiệu khó hơn nhận diện giọng nói
Bài toán này khó hơn phiên âm giọng nói ở hai điểm cốt lõi.
- Phiên âm giọng nói chỉ là ánh xạ tuần tự từ âm sang chữ trong cùng một ngôn ngữ. Ngôn ngữ ký hiệu là ngôn ngữ tự nhiên độc lập, có ngữ pháp và từ vựng riêng — nên cần dịch máy thực sự, không phải chuyển đổi ký hiệu sang từ theo trình tự.
- Mô hình phải 'nhìn' và hiểu chuyển động vật lý: tay, cánh tay, thân, đầu và biểu cảm mặt cùng lúc mang nghĩa. Theo dõi chính xác các chuyển động này ở tốc độ khung hình cao là bài toán computer vision nặng.
Đây cũng là lý do các giải pháp sớm như găng tay cảm biến ngôn ngữ ký hiệu thất bại về bản chất: ngôn ngữ ký hiệu không phải 'tiếng Anh viết bằng tay'. Nó cần cả nhận thức thị giác chi tiết toàn thân và khả năng dịch ngôn ngữ đầy đủ — hai thứ mà găng tay không giải quyết được.
SL2T hoạt động như thế nào
SL2T được huấn luyện trên hơn 100.000 giờ dữ liệu, trải rộng hơn 50 ngôn ngữ ký hiệu, trong đó khoảng một phần tư dữ liệu là ASL. Việc huấn luyện đồng thời trên nhiều ngôn ngữ, phương ngữ và trình độ ký hiệu khác nhau giúp mô hình học được cấu trúc chung, cho kết quả tốt hơn các mô hình đơn ngữ trong thử nghiệm của DeepMind.
Về quyền riêng tư, SL2T không xử lý video thô. Một mô hình chạy trên máy (MediaPipe Holistic) theo dõi các điểm mốc trên cơ thể người ký hiệu, chỉ tọa độ hình học này được gửi lên server để dịch — video gốc bị xóa ngay sau đó.
Điểm kỹ thuật đáng chú ý: SL2T dịch trực tiếp từ chuỗi tọa độ sang văn bản, bỏ qua bước trung gian gọi là gloss (chú giải ký hiệu) mà các nghiên cứu trước đây thường dùng. Gloss không nắm bắt được các yếu tố phi tuyến tính như biểu cảm không dùng tay hoặc cấu trúc không gian trong ngôn ngữ ký hiệu. Dịch trực tiếp từ điểm mốc giúp bỏ giới hạn từ vựng nhân tạo và cho phép chất lượng dịch tăng theo lượng dữ liệu.
Chất lượng dịch và những bài toán thực tế
Trên benchmark FLEURS-ASL (sd-test) đánh giá dịch ASL sang tiếng Anh, SL2T đạt điểm zero-shot 70 BLEURT — cao hơn đáng kể so với mọi kết quả công bố trước đó.
Nhưng điểm benchmark cao không đồng nghĩa dùng tốt ngoài thực tế. DeepMind cho biết đã xử lý thêm các vấn đề vận hành: giảm độ trễ khi streaming, chặn hiện tượng mô hình 'bịa' kết quả khi đầu vào không phải ký hiệu, đảm bảo công bằng cho 10% người ký hiệu thuận tay trái, và cải thiện hiệu suất khi ký hiệu một tay — tình huống phổ biến khi người dùng đang cầm điện thoại bằng tay còn lại.
Các ví dụ từ benchmark cho thấy SL2T dịch tốt câu ASL phức tạp thành tiếng Anh trôi chảy, nhưng vẫn còn lỗi ở ký hiệu hiếm, đánh vần ngón tay nhanh (nhầm 'prey' thành 'grey'), câu bị động, các cấu trúc phân loại (bỏ sót từ như 'claws'), và thời gian ngữ pháp khi thiếu ngữ cảnh ('kicked off' dịch thành 'start').
Ai được lợi trước, ai còn phải chờ
Người hưởng lợi trực tiếp nhất là người dùng ASL sở hữu Pixel 11 — SL2T ra mắt độc quyền trên dòng máy này trước khi mở rộng sang thiết bị khác. Đây là chiến lược quen thuộc của Google: dùng tính năng phần cứng độc quyền để tạo lý do mua Pixel, thay vì phát hành đồng loạt trên mọi nền tảng.
Cộng đồng ngôn ngữ ký hiệu khác — hơn 150 ngôn ngữ chưa nằm trong 50+ ngôn ngữ được hỗ trợ, và cả những ngôn ngữ đã có trong dữ liệu huấn luyện nhưng chưa được triển khai vào sản phẩm — sẽ phải chờ các đợt mở rộng tiếp theo. ASL chiếm khoảng một phần tư dữ liệu huấn luyện nhưng là ngôn ngữ duy nhất ra mắt ở giai đoạn đầu, phản ánh quy mô thị trường Anh ngữ vẫn được ưu tiên.
Về mặt phát triển sản phẩm, DeepMind nhấn mạnh cách làm 'cùng cộng đồng, không chỉ vì cộng đồng': dự án khởi xướng từ Sam Sepah, một kỹ sư Điếc tại Google, có sự tham gia của đối tác Điếc trong thu thập dữ liệu, đánh giá người dùng và đánh giá tác động. Google cũng lập Ủy ban Cố vấn AI Ngôn ngữ Ký hiệu (AISLAC) gồm nhiều tổ chức Điếc toàn cầu để định hướng triển khai, và công bố báo cáo tác động chung cho phiên bản SL2T 1.0.
Câu hỏi còn để mở
Việc gắn tính năng accessibility vào một dòng máy cụ thể đặt ra nghịch lý: công nghệ giúp thu hẹp khoảng cách giao tiếp lại tạm thời tạo ra khoảng cách tiếp cận mới, giữa người có Pixel 11 và người không có. Nếu SL2T thực sự hiệu quả như số liệu benchmark cho thấy, câu hỏi đáng theo dõi không phải là công nghệ có tốt hay không, mà là Google sẽ mở rộng nó sang Android nói chung, iOS, và các ngôn ngữ ký hiệu ngoài ASL nhanh đến mức nào — hay đây vẫn chủ yếu là con bài bán phần cứng khoác áo accessibility.
Related in AI

iPhone 17 Pro Max sau 11 tháng: Ceramic Shield 2 bảo vệ tốt, nhưng chưa miễn nhiễm hư hại

Mất 250.000 Bảng Vì Lừa Đảo AI Giả Mạo Chuyên Gia Tài Chính

Vì sao giới trẻ Việt Nam quan tâm: Samsung 'cướp' người dùng iPhone trẻ tuổi trước giờ G của iPhone Fold
