AI-யை விட குழந்தைகள் மொழியை வேகமாகக் கற்பது ஏன்?
மனிதக் குழந்தைகள், பெரிய மொழி மாடல்களுக்குத் தேவைப்படும் சொற்களில் மிகச் சிறு பகுதியிலேயே சரளமாகப் பேசக் கற்றுக்கொள்கின்றன. இதை ஆராய்ச்சியாளர்கள் 'தரவு திறன் இடைவெளி' என்கிறார்கள்; இதை ஆய்வு செய்வதன் மூலம் குறைந்த தரவில் கற்கும் AI மாடல்களை உருவாக்க முடியும்…
க்ளாட், டீப்சீக், OpenAI நிறுவனத்தின் ஜிபிடி மாடல்கள் போன்ற சாட்பாட்களுக்குப் பின்னணியில் இருக்கும் AI அமைப்புகளான பெரிய மொழி மாடல்கள் (Large Language Models, LLM), எந்த மனிதனும் கேட்கும் சொற்களை விட மிக அதிகமான சொற்களைக் கொண்டு பயிற்சி பெற்ற பிறகே சரளமாகப் பேச முடிகிறது. இரண்டு ஆண்டுகளுக்கு முன் வெளியான மெட்டாவின் ஓப்பன்-வெயிட் மொழி மாடலான லாமா 3.1, 15 டிரில்லியன் டோக்கன்களில் (மொழியின் சொல் அளவிலான துண்டுகள்) பயிற்சி பெற்றது. இதைவிட 10 மடங்கு அதிக தரவில் இன்றைய முன்னணி மாடல்கள் பயிற்சி பெறக்கூடும் என்று ஜார்ஜ்டவுன் பல்கலைக்கழக அறிவாற்றல் விஞ்ஞானியும் மொழியியலாளருமான ஈதன் காட்லீப் வில்காக்ஸ் தெரிவிக்கிறார்.
இதற்கு நேர்மாறாக, ஒரு மனிதக் குழந்தை, சுமார் 1 கோடி முதல் 3 கோடி (10 மில்லியன் முதல் 30 மில்லியன்) சொற்களைக் கேட்ட பிறகே இலக்கணப்படி சரியான வாக்கியங்களைப் பேசத் தொடங்குகிறது. மொழி வளமான வீட்டில் வளரும் ஒரு பதின்பருவத்துக்கு முந்தைய குழந்தை, 20 வயதுக்குள் சுமார் 10 கோடி (100 மில்லியன்) சொற்களைக் கேட்டிருக்கலாம்; வாசிப்பையும் சேர்த்தால் இது 30 கோடி (300 மில்லியன்) சொற்கள் வரை உயரலாம். குழந்தைகளுக்கும் இயந்திரங்களுக்கும் இடையேயான இந்த இடைவெளியை ஆராய்ச்சியாளர்கள் 'தரவு திறன் இடைவெளி' () என அழைக்கிறார்கள். 'ஒரு தலைமுறையில் ஒரு நகரம் முழுவதும் அனுபவிக்கும் அளவு மொழியை க்ளாட் ஏற்கெனவே கண்டுள்ளது' என்று வில்காக்ஸ் தெரிவித்தார்.
AI-யில் சமீபத்திய முன்னேற்றம் இருந்தபோதிலும், 'நம் வீட்டு அறையில் ஓராண்டில் நிகழும் இந்த மைல்கல்லை மீண்டும் உருவாக்க, ஒரு காட்டையே எரித்து, மனிதகுல அறிவு முழுவதையும் சேகரிக்க வேண்டியிருக்கிறது' என்று ஸ்டான்ஃபோர்ட் பல்கலைக்கழக அறிவாற்றல் விஞ்ஞானி மைக்கேல் சி. ஃபிராங்க் தெரிவித்தார். ஒரு குழந்தை கேட்கும் சுமார் 3 கோடி (30 மில்லியன்) சொற்களில் ஜிபிடி-2 போன்ற மாடலைப் பயிற்றுவித்தால், அது ஒரு குழந்தையை அல்ல, ஒரு 'அர்த்தமற்ற சொல் உற்பத்தியாளரை' உருவாக்கும் என அவர் மேலும் கூறினார்.
இவ்வளவு குறைந்த தரவில் குழந்தைகள் எப்படி மொழியைக் கற்கிறார்கள் என்பதை ஃபிராங்க், வில்காக்ஸ் உள்ளிட்ட விஞ்ஞானிகள் தலைகீழாக ஆராய்ந்து புரிந்துகொள்ள முயல்கிறார்கள். இதிலிருந்து கிடைக்கும் நுண்ணறிவுகள், வீடியோவில் AI-க்குப் பயிற்சி அளிக்கவும், சிறுபான்மை மொழிகளுக்கான சாட்பாட்களை உருவாக்கவும் பயன்படக்கூடிய, குறைந்த தரவில் கற்கும் AI மாடல்களுக்கு வழிவகுக்கும் என அவர்கள் நம்புகிறார்கள். மனிதர்கள் இலக்கணம் குறித்த உள்ளார்ந்த அறிவுடன் பிறக்கிறார்களா (மொழியியலாளர் நோம் சாம்ஸ்கி முன்வைத்த கருத்து), அல்லது அனுபவம் மூலமே மொழியைக் கற்கிறார்களா (உளவியலாளர் பி.எஃப். ஸ்கின்னர் வாதிட்ட கருத்து) என்ற நீண்டகால விவாதத்தையும் இது தீர்க்க உதவக்கூடும்.
சொல் விளக்கம்
இதுவரை நடந்தது
- பேரிடர் முன்னறிவிப்பை விரைவுபடுத்த நாசாவின் 100 பெட்டாபைட் தரவை சூப்பர் கம்ப்யூட்டரில் இணைத்த ETH சூரிக்
- போர்க்களத்தில் பயன்படும் ஏஐ-வழிகாட்டும் மின்தூக்கக்கூடிய அல்ட்ராசவுண்ட் கருவிக்கு தொழில்நுட்ப மாற்றப் பரிசு
- மார்பக புற்றுநோய்க்கு சரியான மருந்தைக் கணிக்கும் AI கருவி புரோட்டீன்டாக்ஸ்
- 400,000 ரெடிட் பதிவுகள் வழியே ஒசெம்பிக் மருந்துகளின் மறைமுக பக்க விளைவுகளை கண்டறிந்த AI
- வாரக்கணக்கில் ஆகும் 3D செல் சவ்வு வரைபடத்தை சில மணிநேரங்களில் முடிக்கும் AI கருவி
- ஜீனோம் மடிப்பில் அல்சைமரின் மறைந்திருந்த அடுக்கைக் கண்டறிந்த விஞ்ஞானிகள்
- AI-யை விட குழந்தைகள் மொழியை வேகமாகக் கற்பது ஏன்?
