AI பாதுகாப்பில் முழு தலைப்பையும் அல்ல, தீங்கான பகுதியை மட்டும் மறுக்க வேண்டும்: ஆய்வு
அரசியல் போன்ற முழு தலைப்பையும் பாதுகாப்பற்றது என மறுப்பதற்குப் பதிலாக, அதற்குள் உள்ள தீங்கான குறிப்பிட்ட பகுதியை மட்டும் AI மறுக்க வேண்டும் என புதிய ஆய்வு வாதிடுகிறது.
படிப்படியாக
- 1
தலைப்புக்குள் தீங்கான துணைக்குழுவை வரையறுத்தல்
- 2
மறுப்புப் பயிற்சித் தரவின் இடைவெளிகளை சரிசெய்தல்
- 3
ஆபத்தானதாகத் தோன்றும் பாதுகாப்பான கோரிக்கைகளைச் சேர்த்தல்
- 4
மறுப்பு, தேவையற்ற மறுப்பு இரண்டையும் ஒன்றாக அளத்தல்
பெரும்பாலான AI பாதுகாப்பு அமைப்புகள் ஒரு அடிப்படைத் தவறு செய்கின்றன என புதிய ஆய்வு ஒன்று வாதிடுகிறது. அரசியல் போன்ற முழு தலைப்புகளையும் முழுமையாக பாதுகாப்பானது அல்லது பாதுகாப்பற்றது என அவை நடத்துகின்றன. ஆனால் உண்மையில் மறுக்க வேண்டியது அந்தத் தலைப்பின் ஒரு சிறிய பகுதி மட்டுமே. 'சேஃப்டி ஃபார் ஹூம்?' எனும் இந்த ஆய்வுக் கட்டுரையை மல்டிவெர்ஸ் கம்ப்யூட்டிங் நிறுவன ஆராய்ச்சியாளர்கள் ஹக்கிங் ஃபேஸ் வலைப்பதிவில் வெளியிட்டுள்ளனர்.
பாதுகாப்பற்ற கேள்விகளை வடிகட்ட பயன்படுத்தப்படும் லாமாகார்ட்-3 போன்ற காவல் மாடல்கள், பொதுவாக தலைப்பு அளவிலான வகைப்பாட்டை பின்பற்றுகின்றன. ஒரு கோரிக்கை அரசியல், ஆயுதங்கள் அல்லது மோசடி போன்ற பரந்த வகையில் அடங்கினால் அது பாதுகாப்பற்றது என குறிக்கப்படுகிறது. ஆனால் ஒரே AI உதவியாளர், அதன் பயன்பாட்டைப் பொறுத்து, ஒரே தலைப்பிற்குள் வெவ்வேறு நடத்தையைக் காட்ட வேண்டியிருக்கலாம் என ஆராய்ச்சியாளர்கள் சுட்டிக்காட்டுகின்றனர். எடுத்துக்காட்டாக, ஒரு குடிமையியல் ஆசிரியரும், ஒரு அரசுத் துறை உதவியாளரும் தேர்தல் குறித்த உண்மையான கேள்விகளுக்குப் பதிலளிக்க வேண்டும். ஆனால் இலக்குவைக்கப்பட்ட அரசியல் தந்திரோபாய கோரிக்கையை அரசுத் துறை உதவியாளர் மட்டுமே மறுக்க வேண்டியிருக்கலாம். லாமாகார்ட்-3, தேர்தல்களை தவறான தகவல் தொடர்பான வகையாக மட்டுமே உள்ளடக்குவதால், இந்த வேறுபாட்டைக் காட்ட முடியாது.
ஆராய்ச்சியாளர்கள் அரசியல் கோரிக்கைகளை ஒரு சோதனை நிலையாகப் பயன்படுத்தினர். தந்திரோபாய வற்புறுத்தல் கோரிக்கைகளை உள்ளடக்கிய 'இலக்கு-தீங்கான துணைக்குழு' ஒன்றை அவர்கள் வரையறுத்தனர்; இதை ஒரு பயன்பாடு மறுக்க வேண்டும், ஆனால் அரசியல் தலைப்பின் மற்ற பகுதிகளுக்கு பதிலளிக்க வேண்டும். மாடலை தானாக மறுப்பு உதாரணங்களை உருவாக்கும் வழக்கமான முறையில் பயிற்றுவிக்கும்போது, ஒரே ஒரு முயற்சி எப்போதும் ஏற்றுக்கொள்ளத்தக்க மறுப்பை உருவாக்காததால், சுமார் 20% கோரிக்கைகள் கைவிடப்படுவதாக அவர்கள் கண்டறிந்தனர். அவர்களின் ஆய்வுத் தொகுப்பில் இது 19.88%, அதாவது 8,009 கோரிக்கைகள். தோல்வியுற்ற கோரிக்கைகளை மேலும் வலுவான வழிகாட்டலுடன் மீண்டும் மீண்டும் முயற்சிக்கும் ஒரு படிப்படியான மறுமுயற்சி உத்தி, இந்த தோல்வி விகிதத்தை 0.20% ஆக, அதாவது 79 கோரிக்கைகளாகக் குறைத்தது. இதனால் 40,293 பயன்படுத்தக்கூடிய தீங்கான பயிற்சிக் கோரிக்கைகள் மீதமாயின.
பாதுகாப்பானதாக இருந்தும் ஆபத்தானதாகத் தோன்றும் சொற்களைக் கொண்ட கோரிக்கைகளையும் மாடல் தவறாக மறுக்காமல் இருக்க, 18 சொற்பொருள் வகைகளில் 11,955 பாதுகாப்பான கோரிக்கைகளின் தொகுப்பையும் ஆராய்ச்சியாளர்கள் உருவாக்கினர். ஒட்டுமொத்த மறுப்பு விகிதத்தை மட்டும் அளக்காமல், ஒரே தலைப்பில் தீங்கானது எது, பாதுகாப்பானது எது என்பதை மாடல் எவ்வளவு துல்லியமாக வேறுபடுத்துகிறது என்பதையும் அவர்கள் அளக்க விரும்பினர். இதற்காக, எல்லைக்கு இருபுறமும் 1,539 தீங்கான-பாதுகாப்பான ஜோடிகளை அவர்கள் தனியாக ஒதுக்கி வைத்தனர்.
அரசியல் மறுப்புத் தரவில் பயிற்சி அளிப்பது ஒரு குறுகிய அர்த்தத்தில் வெற்றியளித்தது: க்வென்3-8பி மாடலில், தலைப்புக்குள் அரசியல் மறுப்பு 9.47% லிருந்து 84.75% ஆக உயர்ந்தது. மூன்று பரந்த பாதுகாப்பு அளவுகோல்களில் சராசரி பாதுகாப்பற்ற பதில் விகிதம் மிகவும் வலுவான அமைப்பில் 26.26% லிருந்து 0.14% ஆகக் குறைந்தது. ஆனால் அதே கட்டத்தில், XSTest அளவுகோலில் தெளிவாக பாதுகாப்பான கோரிக்கைகளுக்கான தேவையற்ற மறுப்பு விகிதம் 2.00% லிருந்து 74.00% ஆக உயர்ந்தது. இதை ஆராய்ச்சியாளர்கள் 'பாதுகாப்பான மாடல் அல்ல, ஒரு மொத்தமான மறுப்பு இயந்திரம்' என விவரிக்கின்றனர். ஒரு மாடலின் தீங்கான-மறுப்பு விகிதத்தையும், தேவையற்ற-மறுப்பு விகிதத்தையும் ஒன்றாகவே தெரிவிக்க வேண்டும் என அவர்கள் முடிவு செய்கின்றனர். ஏனெனில் தரவு கலவையே ஒரு மாடல் இந்த இரண்டிற்கும் இடையில் எங்கு நிற்கிறது என்பதை நிர்ணயிக்கிறது.
சொல் விளக்கம்
இதுவரை நடந்தது
- ஏமாற்ற பயிற்சி பெற்ற ஓப்பன் AI ஏஜென்ட்கள் ஹக்கிங் ஃபேஸை ஹேக் செய்தது எப்படி?
- AI மாடல் மோசடியை தடுக்க டீப்மைண்ட் நடத்திய முதல் 'இரட்டை-மறைவு' சோதனை
- AI கண்காணிப்பாளர்களை ஏமாற்றும் அப்பாவியான சிந்தனை: புதிய ஆய்வு எச்சரிக்கை
- AI பாதுகாப்பில் முழு தலைப்பையும் அல்ல, தீங்கான பகுதியை மட்டும் மறுக்க வேண்டும்: ஆய்வு
