சயின்ஸ் டெக் பல்ஸ்
Read in English
செயற்கை நுண்ணறிவு

12 மொழி பேசும் திறந்த மூல TTS மாதிரி: NVIDIA-யின் Magpie Multilingual அறிமுகம்

NVIDIA வெளியிட்ட Magpie Multilingual TTS, 12 மொழிகளை ஆதரிக்கும் 364 மில்லியன் அளவுள்ள திறந்த மூல உரையிலிருந்து பேச்சு (text-to-speech) மாதிரி; ஒற்றை GPU நீரோட்டத்தில் 32 மில்லி வினாடிக்குள்ளேயே முதல் ஒலியை வழங்கும் திறன் கொண்டது.

Read in English

12 மொழிகளை ஆதரிக்கும் 364 மில்லியன் அளவுள்ள திறந்த மூல உரையிலிருந்து பேச்சு (text-to-speech, TTS) மாதிரியை NVIDIA வெளியிட்டுள்ளது. Magpie Multilingual TTS என்ற இந்த வெளியீடு குறைந்த தாமத (low latency) குரல் செயலிகளுக்காக வடிவமைக்கப்பட்டுள்ளது. முந்தைய பட்டியலில் இருந்த ஆங்கிலம், ஸ்பானிஷ், ஃபிரெஞ்ச், ஜெர்மன், இத்தாலியன், வியட்நாமிய, மாண்டரின், ஹிந்தி, ஜப்பானிய மொழிகளுடன், இப்போது Modern Standard Arabic, கொரிய மற்றும் பிரேசிலிய போர்ச்சுகீஸ் மொழிகள் புதிதாகச் சேர்க்கப்பட்டுள்ளன. முந்தைய மொழிகளிலும் புதிய பயிற்சி தரவால் தரம் மேம்பட்டிருக்கிறது.

ஒவ்வொரு மொழிக்கும் ஆண் மற்றும் பெண் குரல்கள் — பொதுவான பன்மொழி பேச்சாளர் பிரதிநிதித்துவம் மூலம் — இந்த வெளியீட்டில் அளிக்கப்படுகின்றன. ஹிந்தி, ஜப்பானிய மொழிகளுக்கான 'code-switching' ஆதரவும் மேம்பட்டிருக்கிறது; IPA grapheme-to-phoneme செயலாக்கம் மற்றும் தனிப்பயன் உச்சரிப்பு அகராதிகள் மூலம் பெயர்கள், தொழில்நுட்பச் சொற்கள், கலப்பு மொழி உள்ளடக்கம் போன்றவற்றைத் துல்லியமாக உச்சரிக்க முடியும் என்கிறது NVIDIA.

குரல் தொடர்பியல் பாதையில் (voice pipeline) பயனாளர் ஏதேனும் ஒலியைக் கேட்பதற்கு முன் நிகழும் கடைசி படி TTS-தான். ஆகவே பேச்சு உருவாக்கம் தொடங்கிய பிறகு முதல் ஒலி கிடைக்கும் தாமதம் — 'Time to First Audio' அல்லது TTFA — மிக முக்கியமான தாமத அளவீடு. Magpie-யின் ஒற்றை-நீரோட்ட TTFA: B200 GPU-வில் 32 மில்லி வினாடிகள்; H100-ல் 47; DGX Spark-ல் 53; A100-ல் 79. 64 இணை நீரோட்டங்களில், B200 அளவீடு 239 மில்லி வினாடிகளாக ஏறினாலும், நேர அடிப்படையில் 320 மடங்கு வேகத்தில் ஒலியை உருவாக்குகிறது.

இந்தக் குறைந்த தாமதத்திற்கு இரண்டு கட்டமைப்பு மாற்றங்கள் காரணம் என்கிறது NVIDIA. முதலாவது 'Frame stacking' — டீக்கோடர் ஒரே படியில் இரு ஒலி சட்டங்களை (audio frames) முன்னறிவிக்கிறது, ஒன்றுக்குப் பதிலாக. இதனால் டீக்கோடர் மறுசுழற்சிகளின் எண்ணிக்கை பாதியாகக் குறைகிறது. ஆனால் இது ஒரே நேரத்தில் உருவாக்கப்படும் codebook டோக்கன்களுக்கிடையே சார்புகளை உருவாக்கி ஒலித் தரத்தைக் குறைக்கும்; அதற்காக ஒரு 'local transformer' இந்த சார்புகளை மாதிரியிட்டு வெளியீட்டைச் செம்மைப்படுத்துகிறது.

ஆய்வு மற்றும் நுணுக்கமான கட்டமைப்புக்கு உரிய திறந்த எடைகளாக Hugging Face-ல் மாதிரி கிடைக்கிறது; தயாரிப்புப் பயன்பாடுகளுக்கு NVIDIA NIM என்ற உள்ளுரு-மேம்படுத்திய கொள்கலனாகவும் கிடைக்கிறது. இரண்டுமே டெவலப்பரின் சொந்த வன்பொருளில் இயங்குவதால், அளக்கப்படும் தாமதம் நிர்வகிக்கப்படும் சேவையின் வழி-தாமதம் அல்ல; டெவலப்பரால் அதைத் தேவைக்கேற்பச் சரிசெய்ய முடியும் என்கிறது நிறுவனம்.

#nvidia#magpie tts#text to speech#multilingual#voice ai#open weights
இச்செய்திக்கு மதிப்பிடுங்கள்

தொடர்புடைய செய்திகள்