சயின்ஸ் டெக் பல்ஸ்
AI மாடல்கள்

சுருக்கப்பட்ட AI மாடல் தன் முழு-அளவு மூலத்தையே மிஞ்சும் புதிய முறை

QAH எனப்படும் புதிய முறை, 4-பிட் அளவுக்குச் சுருக்கப்பட்ட AI மாடல் ஒன்று, அது உருவான முழு-துல்லிய பெரிய மாடலையே செயல்திறனில் மிஞ்சச் செய்கிறது என புதிய ஆய்வுக் கட்டுரை தெரிவிக்கிறது.

படிப்படியாக

  1. 1

    லேயர்கள், ஹெட்கள், நியூரான்களைக் குறைத்தல்

  2. 2

    மீதமுள்ள எடைகளை 4-பிட்டாக குவாண்டைஸ் செய்தல்

  3. 3

    QAH அசல் மாடலிடமிருந்தே நேரடியாக டிஸ்டில் செய்யும்

  4. 4

    சுருக்கப்பட்ட மாடல் அசல் மாடலையே மிஞ்சும்

ஒரு பெரிய மொழி மாடலை மலிவாக இயக்கும் வகையில் சுருக்குவது எப்போதுமே ஏதோ ஒரு இழப்பை ஏற்படுத்தும். பொதுவான முறை என்னவெனில், முதலில் மாடலின் அமைப்பை சுருக்குவது. லேயர்கள், அட்டென்ஷன் ஹெட்கள், நியூரான்களின் எண்ணிக்கையைக் குறைப்பது இதில் அடங்கும். பின்னர் மீதமுள்ள எடைகளை குவாண்டைஸ் செய்வர். அதாவது ஒவ்வொரு எடையையும் 16 பிட்டுக்குப் பதிலாக வெறும் 4 பிட்டில் சேமிப்பது. இதனால் நினைவகம், கணக்கீட்டுத் தேவை மேலும் குறையும். இரண்டு படிகளும் வளங்களை மிச்சப்படுத்தினாலும், சேர்ந்து அவை பொதுவாக மாடலின் தர்க்கம், கணிதம், கோடிங் திறனைக் குறைக்கின்றன. எனவே சுருக்கப்பட்ட மாடலை உற்பத்திக்குள் அனுப்பும் முன், "ஹீலிங்" எனப்படும் மீட்பு கட்டத்தை டெவலப்பர்கள் சேர்க்கின்றனர்.

QAH எனப்படும் புதிய ஹீலிங் முறையை விவரிக்கும் ஆய்வுக் கட்டுரை ஒன்று வெளியாகியுள்ளது. GPT-OSS 120B எனும் ஓப்பன்-வெயிட் மாடலை 60 பில்லியன் பாராமீட்டர்களாகச் (பயிற்சியின்போது மாடல் கற்றுக்கொள்ளும் உள்ளக மதிப்புகள்) சுருக்கினர். பின்னர் MXFP4 எனும் 4-பிட் வடிவமைப்பில் குவாண்டைஸ் செய்தனர். QAH முறை மூலம் அந்த மாடல் தன்னுடைய சொந்த முழு-துல்லிய, 16-பிட் பதிப்பையே 9 அளவீடுகளில் 7-இல் மிஞ்சியது. அதே நேரம் அது சிறியதாகவும், இயக்க செலவு குறைவாகவும் இருந்தது.

வழக்கமான ஹீலிங் முறையான QAT, சுருக்கப்பட்ட மாடலை அதன் அசல் பயிற்சி இலக்கின் அடிப்படையிலேயே தொடர்ந்து ஃபைன்-டியூன் செய்கிறது. இது செலவு அதிகம், மேலும் நிலைகுலையக்கூடும். QAD எனும் புதிய முறை, அதே அமைப்பின் முழு-துல்லிய "டீச்சர்" பதிப்பின் வெளியீட்டை நகலெடுக்கச் சுருக்கப்பட்ட மாடலைப் பயிற்றுவிக்கிறது. ஆனால் ஒரு மாடலின் லேயர்கள் அல்லது நியூரான்களும் நீக்கப்பட்டிருந்தால், அந்த சிறிய அமைப்புக்கு உண்மையான முழு-துல்லியப் பதிப்பே இல்லை. அது டீச்சராக இருக்க முடியாது. QAH இதை வேறு வழியில் தீர்க்கிறது: சுருக்கப்படுவதற்கு முந்தைய அசல் மாடலிடமிருந்தே நேரடியாக டிஸ்டில் செய்கிறது. டீச்சரும் சுருக்கப்பட்ட மாணவனும் ஒரே அமைப்பைக் கூடப் பகிரவில்லை. ஆனால் டீச்சரின் வெளியீட்டு அமைப்பு மாடலின் அளவு அல்லது வடிவத்தைச் சாராதது. எனவே அது இன்னும் மாணவனுக்கு வழிகாட்ட முடிகிறது.

மாணவனை நிலையான டீச்சர் வெளியீட்டுடன் இணைப்பது பயிற்சியை இன்னும் நிலையானதாக ஆக்குகிறது என்று ஆய்வாளர்கள் கூறுகின்றனர். வழக்கமான பயிற்சி இழப்பு உருவாக்கும் தொடர்ச்சியான விலகல் அழுத்தத்தை இது நீக்குகிறது. AA-LCR நீண்ட-சூழல் தர்க்க அளவீட்டில், QAH மாடல் 42.7 மதிப்பெண் பெற்றது. வழக்கமான மீட்கப்பட்ட மாடல் 35.3 பெற்றது. AIME 2025 கணிதப் போட்டி அளவீட்டில், QAH மாடல் 76.3 பெற்றது, மற்றொன்று 70.7 பெற்றது.

சொல் விளக்கம்

#AI models#quantization#model compression#open-weight AI
இச்செய்திக்கு மதிப்பிடுங்கள்

தொடர்புடைய செய்திகள்