Моделът гледа точките на тялото, не видеото, и превръща американския жестов език в текст направо на устройството. Самият кадър се изхвърля веднага.
- На 12 август DeepMind обяви модела SL2T в Gboard и Live Transcribe на Pixel 11.
- Обучен е върху над 100 000 часа материал от над 50 жестомимични езика.
- Първо тръгва американският жестов език към английски; следват други.
Първо ме спря решението, не самата новина. Моделът не гледа видеото ти, а следи къде са ставите на ръцете и тялото.
Дребният технически ход тук е и решението за поверителност. Щом към обработката тръгват координати вместо лице, целият спор какво става с кадъра се стопява. По думите на Google самото видео се изхвърля веднага след като точките са отчетени.
Работи на един телефон, за един език, в две приложения. Толкова е засега.