பெரிய மொழி மாதிரிகளைச் சுருக்குதல்: ஒற்றை GPU-க்குள் நினைவகத்தைக் கொண்டு வரும் புதிய முறை
பெரிய 'ஆசிரிய' மொழி மாதிரியில் இருந்து சிறிய 'மாணவ' மாதிரியைப் பயிற்றுவிக்கத் தேவைப்படும் GPU நினைவகத்தை ஒற்றை H200-க்குள் கொண்டு வரும் இரண்டு அமைப்பு நிலை மாற்றங்களை Multiverse Computing நிறுவனம் ஒரு ஆய்வுக் கட்டுரையில் வெளியிட்டுள்ளது.
'Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss' என்ற ஆய்வுக் கட்டுரையை Multiverse Computing வெளியிட்டுள்ளது. பெரிய 'ஆசிரிய' (teacher) மாதிரியின் திறனை ஒரு சிறிய 'மாணவ' (student) மாதிரி எட்டப் பயிற்றுவிக்கத் தேவைப்படும் GPU நினைவகத்தைப் பெரிதும் குறைக்கும் இரண்டு மாற்றங்கள் இதில் முன்வைக்கப்படுகின்றன. இதனால் நீண்ட சூழல் கொண்ட வடிகட்டல் ஒற்றை GPU-க்குள் சாத்தியமாகிறது; பரந்த சோதனைகளுக்கு போதுமான மலிவும் ஆகிறது என்று நிறுவனம் தெரிவிக்கிறது. வழக்கமான அணுகுமுறை நூற்றுக்கணக்கான GPU-க்களையும், நுண்ணிய tensor-parallelism உத்திகளையும் கேட்கும்.
அறிவு வடிகட்டல் (knowledge distillation) என்பது, ஒரு பெரிய மாதிரியின் வெளியீட்டு விநியோகத்தை ஒரு சிறிய மாதிரி பிரதி எடுக்கப் பயிற்றுவிக்கப்படும் தொழில்நுட்பம். இது மிகப்பெரிய மொழி மாதிரிகளை அவற்றின் திறனை இழக்காமல் சுருக்குவதற்கான வழக்கமான வழி. சமீபத்திய உதாரணங்களில் NVIDIA-வின் Nemotron 3 Puzzle 75B, Multiverse Computing-ன் சொந்த Hypernova 60B ஆகியவை அடங்கும். வழக்கமான 'online' முறையில் ஆசிரியரும் மாணவரும் ஒரே நேரத்தில் ஏற்றப்படுகின்றனர்; ஒவ்வொரு பயிற்சி படியிலும் ஆசிரியர் ஒரு முழுமையான முன்னோக்கு கடத்தலை நடத்துகிறார். ஒரு டோக்கன் இடத்திற்கு இரண்டு முழு-சொற்களஞ்சிய சாத்தியக் கிடையாக்கிகள் உருவாகின்றன — இதுவே பாதையின் மிக விலையுயர்ந்த பகுதி.
gpt-oss-120b-ன் சொற்களஞ்சியத்தை (2,01,088 டோக்கன்கள்) கொண்ட ஒரு ஆசிரியருக்கு, 32,000 வரிசை நீளத்திலும் 4 என்ற தொகுப்பு அளவிலும், ஆசிரியர்-சாத்தியக் கிடையாக்கிக்கு மட்டுமே bfloat16-ல் ஏறத்தாழ 50 GB நினைவகம் தேவை. அத்துடன் சாய்வுகள், செயல்பாட்டுச் சேமிப்புகள், மாதிரி எடைகள், optimizer நிலைகள் ஆகியவற்றைச் சேர்த்தால், ஒரு பயிற்சிச் சுழல் ஏறத்தாழ 250 GB-ஐ எட்டலாம் — H200 GPU-வின் 141 GB கொள்ளளவை மீறி.
முதல் மாற்றம் 'offline distillation'. ஆசிரியர் ஒரே ஒரு முறை ஓட்டப்படுகிறார்; ஒவ்வொரு இடத்திற்கும் அவரது top-100 மிக சாத்தியமான டோக்கன்கள் சேமிக்கப்படுகின்றன. மாணவர் அந்தச் சேமிப்பை நோக்கிப் பயிற்சி பெறுகிறார்; ஆசிரியர் நினைவகத்தில் அவருடன் அமர வேண்டியதே இல்லை. இரண்டாவது ஒரு 'fused, chunked KL-divergence loss'. முழு சொற்களஞ்சிய-வரிசை ஒப்பீட்டுக் கிடையாக்கியை ஒரே தடவையில் கட்டாமல், வரிசை இடங்களை ஒரு துண்டு ஒரு துண்டாகக் கணக்கிட்டு இழப்பு உருவாகிறது; மாதிரியின் வெளியீட்டு projection நேரடியாக இழப்பில் இணைக்கப்படுகிறது, மாணவரின் சொந்த முழு logits கிடையாக்கியும் ஒருபோதும் உருவாக்கப்படுவதே இல்லை.
ஆய்வுக் கட்டுரையின் சோதனைகளில், fused chunked இழப்பு ஏறத்தாழ 128 GB என்ற உச்சத்தில் மட்டுமே நிற்கிறது — ஒற்றை H200-ன் நினைவகத்திற்கு உள்ளேயே. வழக்கமான dense KL செயல்முறை ஏறத்தாழ 250 GB வரை உயர்கிறது. பின்னோக்கு கடத்தலின் போது ஒவ்வொரு துண்டும் சேமிக்கப்படாமல் மறுபடி கணக்கிடப்படுகிறது; அதனால் projection வேலை இரட்டிப்பாகிறது, ஆனால் நினைவகம் வரிசை நீளத்தோடு நேரடி விகிதத்தில் மட்டுமே ஏறுகிறது.
