பெரிய மொழி மாடல்களைச் சுருக்குதல்: ஒற்றை GPU-க்குள் நினைவகத்தைக் கொண்டு வரும் புதிய முறை
பெரிய 'ஆசிரிய' மொழி மாடலில் இருந்து சிறிய 'மாணவ' மாதிரியைப் பயிற்றுவிக்கத் தேவைப்படும் GPU நினைவகத்தை ஒற்றை H200-க்குள் கொண்டு வரும் இரண்டு அமைப்பு நிலை மாற்றங்களை Multiverse Computing நிறுவனம் ஒரு ஆய்வுக் கட்டுரையில் வெளியிட்டுள்ளது.
படிப்படியாக
- 1
ஆசிரிய மாதிரி ஒருமுறை இயக்கம்
- 2
டாப்-100 கணிப்புகள் முன்கூட்டியே சேமிப்பு
- 3
சேமிப்பை நோக்கி மாணவ மாதிரி பயிற்சி
- 4
இழப்பு சிறு துண்டுகளாகக் கணக்கீடு
- 5
ஒற்றை H200 நினைவகத்துக்குள் அடக்கம்
'Efficient Knowledge Distillation for LLMs: Offline Top-K and a Fused Chunked KL Loss' என்ற ஆய்வுக் கட்டுரையை Multiverse Computing வெளியிட்டுள்ளது. பெரிய 'ஆசிரிய' (teacher) மாதிரியின் திறனை ஒரு சிறிய 'மாணவ' (student) மாதிரி எட்டப் பயிற்றுவிக்கத் தேவைப்படும் GPU நினைவகத்தைப் பெரிதும் குறைக்கும் இரண்டு மாற்றங்கள் இதில் முன்வைக்கப்படுகின்றன. இதனால் நீண்ட சூழல் கொண்ட வடித்தல் ஒற்றை GPU-க்குள் சாத்தியமாகிறது; பரந்த சோதனைகளுக்கு போதுமான மலிவும் ஆகிறது என்று நிறுவனம் தெரிவிக்கிறது. வழக்கமான அணுகுமுறை நூற்றுக்கணக்கான GPU-க்களையும், நுண்ணிய tensor-parallelism உத்திகளையும் தேவைப்படுத்தும்.
(knowledge distillation) என்பது, ஒரு பெரிய மாதிரியின் வெளியீட்டு விநியோகத்தை ஒரு சிறிய மாதிரி பிரதி எடுக்கப் பயிற்றுவிக்கப்படும் தொழில்நுட்பம். இது மிகப்பெரிய மொழி மாடல்களை அவற்றின் திறனை இழக்காமல் சுருக்குவதற்கான வழக்கமான வழி. சமீபத்திய உதாரணங்களில் NVIDIA-வின் Nemotron 3 Puzzle 75B, Multiverse Computing-ன் சொந்த Hypernova 60B ஆகியவை அடங்கும். வழக்கமான 'online' முறையில் ஆசிரியரும் மாணவரும் ஒரே நேரத்தில் ஏற்றப்படுகின்றனர்; ஒவ்வொரு பயிற்சி படியிலும் ஆசிரியர் ஒரு முழுமையான ஃபார்வர்ட் பாஸ் (forward pass) கணக்கீட்டை நடத்துகிறார். ஒரு டோக்கன் இடத்திற்கு இரண்டு முழு-சொற்களஞ்சிய நிகழ்தகவு டென்சர்கள் உருவாகின்றன — இதுவே இந்தச் செயல்முறையின் மிகச் செலவு மிக்க பகுதி.
gpt-oss-120b-ன் சொற்களஞ்சியத்தை (2,01,088 டோக்கன்கள்) கொண்ட ஒரு ஆசிரியருக்கு, 32,000 வரிசை நீளத்திலும் 4 என்ற தொகுப்பு அளவிலும், ஆசிரியர்-நிகழ்தகவு டென்சருக்கு மட்டுமே bfloat16-ல் ஏறத்தாழ 50 GB நினைவகம் தேவை. அத்துடன் சாய்வுகள், ஆக்டிவேஷன்கள், மாதிரி எடைகள், optimizer நிலைகள் ஆகியவற்றைச் சேர்த்தால், ஒரு பயிற்சிச் சுழல் ஏறத்தாழ 250 GB-ஐ எட்டலாம் — H200 GPU-வின் 141 GB கொள்ளளவை மீறி.
முதல் மாற்றம் 'offline distillation'. ஆசிரியர் ஒரே ஒரு முறை ஓட்டப்படுகிறார்; ஒவ்வொரு இடத்திற்கும் அவரது top-100 மிக சாத்தியமான டோக்கன்கள் சேமிக்கப்படுகின்றன. மாணவர் அந்தச் சேமிப்பை நோக்கிப் பயிற்சி பெறுகிறார்; ஆசிரிய மாதிரியை மாணவருடன் சேர்த்து நினைவகத்தில் வைத்திருக்க வேண்டியதே இல்லை. இரண்டாவது ஒரு 'fused, chunked KL-divergence loss'. முழு சொற்களஞ்சிய-வரிசை ஒப்பீட்டு அணியை ஒரே தடவையில் கட்டாமல், வரிசை இடங்களை ஒரு துண்டு ஒரு துண்டாகக் கணக்கிட்டு இழப்பு உருவாகிறது; மாதிரியின் வெளியீட்டு projection நேரடியாக இழப்பில் இணைக்கப்படுகிறது, மாணவரின் சொந்த முழு logits அணியும் ஒருபோதும் உருவாக்கப்படுவதே இல்லை.
ஆய்வுக் கட்டுரையின் சோதனைகளில், fused chunked இழப்பு ஏறத்தாழ 128 GB என்ற உச்சத்தில் மட்டுமே நிற்கிறது — ஒற்றை H200-ன் நினைவகத்திற்கு உள்ளேயே. வழக்கமான dense KL செயல்முறை ஏறத்தாழ 250 GB வரை உயர்கிறது. பேக்வர்ட் பாஸ் (backward pass) கணக்கீட்டின் போது ஒவ்வொரு துண்டும் சேமிக்கப்படாமல் மறுபடி கணக்கிடப்படுகிறது; அதனால் projection வேலை இரட்டிப்பாகிறது, ஆனால் நினைவகம் வரிசை நீளத்தோடு நேரடி விகிதத்தில் மட்டுமே ஏறுகிறது.
சொல் விளக்கம்
இதுவரை நடந்தது
- திறந்த AI மாதிரிகள்: பெரிய அளவில் சீன ஆய்வகங்களே முன்னிலை என்கிறது Hugging Face
- பெரிய மொழி மாடல்களைச் சுருக்குதல்: ஒற்றை GPU-க்குள் நினைவகத்தைக் கொண்டு வரும் புதிய முறை
