சைகை மொழியை உரையாக மாற்றும் AI: Pixel 11 மொபைலில் Google DeepMind அறிமுகம்
அமெரிக்க சைகை மொழியை (ASL) ஆங்கில உரையாக மாற்றும் Google DeepMind நிறுவனத்தின் புதிய SL2T மாதிரி, Pixel 11 ஃபோனில் அறிமுகமாகியிருக்கிறது; காது கேளாதோர் தட்டச்சு செய்யும் இடங்களில் எல்லாம் இப்போது சைகை காட்டி மொபைலிடம் 'பேச' முடியும்.
படிப்படியாக
- 1
பயனர் ஃபோன் காமிராவுக்கு சைகை காட்டுகிறார்
- 2
மீடியாபைப் உடல் புள்ளிகளைப் பதிவு செய்கிறது
- 3
ஆயத்தொலைவுகள் மட்டுமே சர்வருக்குச் செல்கின்றன
- 4
புள்ளிகளை SL2T நேரடியாக உரையாக மாற்றுகிறது
- 5
உரை Gboard அல்லது Live Transcribe செயலியில் தோன்றுகிறது
சைகை மொழியை நேரடியாக உரையாக மாற்றும் ஒரு புதிய AI மாதிரியை Google DeepMind அறிமுகம் செய்திருக்கிறது. 'SL2T' (sign-language-to-text) என்று பெயரிடப்பட்ட இந்த மாதிரி முதன்முறையாக நுகர்வோர் சாதனங்களுக்கு வந்திருக்கிறது. Pixel 11 மொபைலில் Gboard விசைப்பலகையிலும் Live Transcribe செயலியிலும் சைகை-டிக்டேஷன் வசதி இதனால் தொடங்குகிறது; அமெரிக்க சைகை மொழியிலிருந்து (ASL) ஆங்கிலம் என்பதில் தொடக்கம். மேலும் சாதனங்களுக்கும் மொழிகளுக்கும் விரிவுபடுத்தப்படும் என்கிறது நிறுவனம். காது கேளாதோரும் செவித்திறன் குறைந்தோரும் தட்டச்சு செய்யும் எந்த இடத்திலும் இப்போது ஃபோனுக்குச் சைகை காட்டி உள்ளீடு செய்யலாம்.
உலகில் 200-க்கும் மேற்பட்ட சைகை மொழிகள் இருக்கின்றன; ஏறத்தாழ 7 கோடி காது கேளாதோர் மற்றும் செவித்திறன் குறைந்தோர் அவற்றைப் பயன்படுத்துகிறார்கள். ஆனால் பேச்சு மொழி செயலாக்கத்திற்கு ஈடாக சைகை மொழி செயலாக்கம் வளரவில்லை. இதற்கு இரண்டு காரணங்கள். சைகை மொழிகள் தமக்கே உரிய இலக்கணத்தையும் சொற்களஞ்சியத்தையும் கொண்ட தனித்தன்மையான மொழிகள்; ஆகவே ஒலியிலிருந்து உரைக்கான நேரடி மாற்றமல்ல இது. மேலும் கை, புயம், உடல், தலை, முகம் ஆகியவற்றின் ஒரே நேரத்திலான நுட்பமான அசைவுகளை மாதிரி துல்லியமாகக் கண்காணிக்க வேண்டும் — இது கம்ப்யூட்டர் பார்வையின் மிகக் கடினமான பணி.
50-க்கும் மேற்பட்ட சைகை மொழிகளில் இருந்து 1 லட்சம் மணி நேரத்திற்கும் அதிகமான தரவுகளைக் கொண்டு SL2T பயிற்றுவிக்கப்பட்டிருக்கிறது; அதில் கால் பங்கு ASL. பல மொழிகளையும் கிளை மொழிகளையும் பல அளவிலான புலமையினரையும் ஒன்றாகப் பயிற்றுவித்ததால், மாதிரி பொதுவான உள்கட்டமைப்பைக் கற்றுக்கொண்டது; ஒரே மொழிக்கான தனித்தனி மாதிரிகளை விட இது சிறப்பாகச் செயல்பட்டதாக அவர்களது சோதனைகள் காட்டுகின்றன. மூலக் காமிரா காட்சியை நேரடியாக அனுப்புவதற்குப் பதிலாக, 'MediaPipe Holistic' என்ற சாதன உள்ளிணைந்த மாதிரி சைகை காட்டுபவரின் உடலில் குறிப்பிட்ட புள்ளிகளின் நிலைகளைப் பதிவு செய்கிறது; அந்த ஆயத்தொலைவுகள் மட்டுமே சர்வருக்கு அனுப்பப்படுகின்றன. மூல வீடியோ உடனடியாக நீக்கப்படுவதால் பயனாளர் தனியுரிமை பாதுகாக்கப்படுகிறது.
முந்தைய சைகை மொழி மொழிபெயர்ப்பு அமைப்புகள் 'glosses' எனப்படும் இடையிலான குறியீடுகளைப் பயன்படுத்தின; SL2T அவற்றைத் தவிர்த்து புள்ளிகளின் வரிசையை நேரடியாக உரையாக மொழிபெயர்க்கிறது. Glosses கை அசைவல்லாத குறிப்பான்களையும் இட அமைப்புகளையும் பிடிக்கத் தவறுகின்றன என்கிறது DeepMind. ASL-ல் இருந்து ஆங்கிலம் மொழிபெயர்ப்பை மதிப்பிடும் FLEURS-ASL பரிசோதனையில், SL2T '' முறையில் 70 என்ற எண்ணை எட்டியிருக்கிறது; இதற்கு முன் எந்த மாதிரியும் அப்படி எட்டியதில்லை என்கிறது குழு.
நடைமுறை பிரச்சினைகளிலும் குழு பணியாற்றியிருக்கிறது — ஸ்ட்ரீமிங் தாமதத்தைக் குறைப்பது, சைகை காட்டப்படாத போது மாதிரி பொய்யாக ஏதேனும் சொல்லாமல் இருக்கச் செய்வது, சைகை காட்டுவோரில் இடதுகை பயன்படுத்தும் 10 சதவீதம் பேருக்கும் சரிசமமான செயல்பாட்டை உறுதி செய்வது, ஒரு கையில் ஃபோனை வைத்திருக்கும்போது மற்றொரு கையால் மட்டும் காட்டும் ஒற்றைக்கை சைகைகளை அடையாளம் காண்பது ஆகியவை அவற்றில் அடங்கும்.
சொல் விளக்கம்
இதுவரை நடந்தது
- முழு உடல் இயக்கம், பல ரோபோ கூட்டு வேலை: Google DeepMind-ன் Gemini Robotics 2
- பார்வையற்றோரின் சமையல் திறன் ஆய்வு: திறமையிருந்தும் தொடரும் சமையலறை தடைகள்
- சைகை மொழியை உரையாக மாற்றும் AI: Pixel 11 மொபைலில் Google DeepMind அறிமுகம்
