12 மொழி பேசும் திறந்த எடை TTS மாதிரி: NVIDIA-யின் Magpie Multilingual அறிமுகம்
NVIDIA வெளியிட்ட Magpie Multilingual TTS, 12 மொழிகளை ஆதரிக்கும் 364 மில்லியன் பாராமீட்டர்கள் கொண்ட திறந்த எடை (open-weight) உரையிலிருந்து பேச்சு (text-to-speech) மாதிரி; ஒற்றை GPU ஸ்ட்ரீமில் 32 மில்லி வினாடிக்குள்ளேயே முதல் ஒலியை வழங்கும் திறன் கொண்டது.
படிப்படியாக
- 1
உரை மாதிரிக்குள் அளிக்கப்படுகிறது
- 2
டீக்கோடர் ஒரு படியில் இரு ஒலிச் சட்டகங்களை முன்னறிவிக்கிறது
- 3
லோக்கல் டிரான்ஸ்ஃபார்மர் வெளியீட்டைச் செம்மைப்படுத்துகிறது
- 4
32 மில்லி வினாடியில் முதல் ஒலி கிடைக்கிறது
12 மொழிகளை ஆதரிக்கும் 364 மில்லியன் பாராமீட்டர்கள் கொண்ட திறந்த எடை (open-weight) உரையிலிருந்து பேச்சு (text-to-speech, TTS) மாதிரியை NVIDIA வெளியிட்டுள்ளது. Magpie Multilingual TTS என்ற இந்த வெளியீடு குறைந்த தாமத (low latency) குரல் செயலிகளுக்காக வடிவமைக்கப்பட்டுள்ளது. முந்தைய பட்டியலில் இருந்த ஆங்கிலம், ஸ்பானிஷ், ஃபிரெஞ்ச், ஜெர்மன், இத்தாலியன், வியட்நாமிய, மாண்டரின், ஹிந்தி, ஜப்பானிய மொழிகளுடன், இப்போது நவீன செந்தர அரபு, கொரிய மற்றும் பிரேசிலிய போர்ச்சுகீஸ் மொழிகள் புதிதாகச் சேர்க்கப்பட்டுள்ளன. முந்தைய மொழிகளிலும் புதிய பயிற்சி தரவால் தரம் மேம்பட்டிருக்கிறது.
ஒவ்வொரு மொழிக்கும் ஆண் மற்றும் பெண் குரல்கள் — பொதுவான பன்மொழி பேச்சாளர் பிரதிநிதித்துவம் மூலம் — இந்த வெளியீட்டில் அளிக்கப்படுகின்றன. ஹிந்தி, ஜப்பானிய மொழிகளுக்கான '' ஆதரவும் மேம்பட்டிருக்கிறது; IPA grapheme-to-phoneme செயலாக்கம் மற்றும் தனிப்பயன் உச்சரிப்பு அகராதிகள் மூலம் பெயர்கள், தொழில்நுட்பச் சொற்கள், கலப்பு மொழி உள்ளடக்கம் போன்றவற்றைத் துல்லியமாக உச்சரிக்க முடியும் என்கிறது NVIDIA.
குரல் தொடர்பியல் பாதையில் (voice pipeline) பயனாளர் ஏதேனும் ஒலியைக் கேட்பதற்கு முன் நிகழும் கடைசி படி TTS-தான். ஆகவே பேச்சு உருவாக்கம் தொடங்கிய பிறகு முதல் ஒலி கிடைக்கும் தாமதம் — 'Time to First Audio' அல்லது TTFA — மிகவும் கவனிக்கப்படும் தாமத அளவீடுகளில் ஒன்று. Magpie-யின் ஒற்றை-ஸ்ட்ரீம் TTFA: B200 GPU-வில் 32 மில்லி வினாடிகள்; H100-ல் 47; DGX Spark-ல் 53; A100-ல் 79. 64 இணை ஸ்ட்ரீம்களில், B200 அளவீடு 239 மில்லி வினாடிகளாக ஏறினாலும், நிகழ்நேரத்தை விட 320 மடங்கு வேகத்தில் ஒலியை உருவாக்குகிறது.
இந்தக் குறைந்த தாமதத்திற்கு இரண்டு கட்டமைப்பு மாற்றங்கள் காரணம் என்கிறது NVIDIA. முதலாவது 'Frame stacking' — டீக்கோடர் ஒரே படியில் இரு ஒலி சட்டங்களை (audio frames) முன்னறிவிக்கிறது, ஒன்றுக்குப் பதிலாக. இதனால் டீக்கோடர் செயல்படிகளின் எண்ணிக்கை பாதியாகக் குறைகிறது. ஆனால் இது ஒரே நேரத்தில் உருவாக்கப்படும் codebook டோக்கன்களுக்கிடையே சார்புகளை உருவாக்கி ஒலித் தரத்தைக் குறைக்கும்; அதற்காக ஒரு 'local transformer' இந்த சார்புகளை மாதிரியிட்டு வெளியீட்டைச் செம்மைப்படுத்தி, frame stacking-ஆல் இழக்கப்படும் ஒலித் தரத்தை மீட்டுத் தருகிறது.
ஆய்வுக்கும் கூடுதல் பயிற்சிக்கும் (fine-tuning) உரிய திறந்த எடைகளாக Hugging Face-ல் மாதிரி கிடைக்கிறது; தயாரிப்புப் பயன்பாடுகளுக்கு NVIDIA NIM என்ற மேம்படுத்தப்பட்ட சேவைக் கொள்கலனாகவும் கிடைக்கிறது. இரண்டுமே டெவலப்பரின் சொந்த வன்பொருளில் இயங்குவதால், அளக்கப்படும் தாமதம் நிர்வகிக்கப்படும் சேவையின் வழி-தாமதம் அல்ல; டெவலப்பரால் அதைத் தேவைக்கேற்பச் சரிசெய்ய முடியும் என்கிறது நிறுவனம்.
சொல் விளக்கம்
இதுவரை நடந்தது
- மொபைலிலேயே இயங்கக்கூடிய 3 பில்லியன் பாராமீட்டர் பார்வை-மொழி மாடல்: Liquid AI-யின் LFM2.5-VL-3B
- 12 மொழி பேசும் திறந்த எடை TTS மாதிரி: NVIDIA-யின் Magpie Multilingual அறிமுகம்
