साइंस टेक पल्स
एआई मॉडल

AI बेंचमार्क असल में क्या मापते हैं? BenchMIRT टूल

सुरक्षा बेंचमार्क BBQ और WMDP असल में सुरक्षा से ज़्यादा सामान्य तर्कशक्ति मापते हैं, यह एलन इंस्टीट्यूट फॉर AI के BenchMIRT टूल ने पाया है।

हर अलग सवाल के स्तर पर AI बेंचमार्क असल में क्या माप रहे हैं, यह जांचने वाला BenchMIRT नाम का नया तरीका एलन इंस्टीट्यूट फॉर AI (AI2) ने पेश किया है। बेंचमार्क एक मानकीकृत परीक्षण है जो यह मापता है कि कोई AI मॉडल सुरक्षा या सामान्य तर्कशक्ति जैसी किसी खास क्षमता में कितना अच्छा प्रदर्शन करता है। AI2 ने पाया कि किसी बेंचमार्क के अंदर के अलग-अलग सवाल उसके बताए गए मकसद से कहीं ज़्यादा कारकों पर निर्भर हो सकते हैं। बहुत अलग तरह के सवालों को एक ही स्कोर में औसत निकाल देना यह छिपा सकता है कि असल में उसे क्या तय कर रहा है।

BenchMIRT आइटम रिस्पॉन्स थ्योरी नाम की तकनीक पर आधारित है, जो साइकोमेट्रिक्स यानी परीक्षण उत्तरों के पैटर्न से क्षमताओं को मापने वाले क्षेत्र से आई है। यह इस विचार पर बनी है कि हर सवाल जांचे जा रहे मॉडल के बारे में उतनी ही जानकारी नहीं देता। AI2 ने इसे बहुआयामी रूप में विस्तार दिया, जो एक ही सवालों के सेट में मापी जा रही कई क्षमताओं को अलग कर सकता है। शोधकर्ताओं ने BenchMIRT को 100 बड़े भाषा मॉडलों के 16 बेंचमार्क और 34,000 से ज़्यादा सवालों के नतीजों पर प्रशिक्षित किया, बिना यह बताए कि कौन-सा बेंचमार्क कौन-सी क्षमता मापने के लिए है। इस टूल ने खुद ही, बार-बार, दो प्रमुख आयाम पहचाने: सुरक्षा और सामान्य तर्कशक्ति।

ज़्यादातर बेंचमार्क के लिए, BenchMIRT ने उनका इरादा सही साबित किया। तर्कशक्ति वाले बेंचमार्क तर्कशक्ति क्षमता से मेल खाते थे, और जेलब्रेक या हानिकारक सामग्री से इनकार की जांच करने वाले बेंचमार्क सुरक्षा से मेल खाते थे। लेकिन कुछ मामलों में तस्वीर उलझ गई। BBQ, जो यह जांचता है कि मॉडल सामाजिक रूढ़ियों पर भरोसा करते हैं या नहीं, आमतौर पर सुरक्षा जांच में गिना जाता है, लेकिन यह सामान्य तर्कशक्ति से ज़्यादा मेल खाता पाया गया। इसका मतलब है कि वहां कम स्कोर आंशिक रूप से असुरक्षित व्यवहार के बजाय सवाल को समझने में कठिनाई दिखा सकता है। जीव विज्ञान, रसायन विज्ञान और साइबर सुरक्षा जैसे क्षेत्रों में खतरनाक दोहरे-उपयोग वाले ज्ञान की जांच करने वाला WMDP बेंचमार्क भी सुरक्षा के बजाय तर्कशक्ति से ज़्यादा मेल खाता था। इसकी वजह यह थी कि ज़्यादा तर्कशक्ति वाले मॉडल ऐसे सवालों को पहचानकर जवाब देने से मना करने में बेहतर थे।

BenchMIRT ने यह भी पाया कि एक ही बेंचमार्क कई अलग-अलग संकेत मिला सकता है। HarmBench में, जो यह जांचता है कि मॉडल हानिकारक अनुरोध मान लेता है या नहीं, ज़्यादातर सवाल सुरक्षा से मेल खाते थे। लेकिन गाने के बोल जैसी कॉपीराइट सामग्री दोबारा बनाने से जुड़े सवाल इसके बजाय सामान्य तर्कशक्ति से मेल खाते थे। शोधकर्ताओं ने कहा कि इसका मतलब यह नहीं कि बेंचमार्क में खामी है। लेकिन एक बेंचमार्क का स्कोर कई अलग-अलग संकेतों को मिला सकता है, जिन्हें BenchMIRT अलग करके समझने में मदद कर सकता है।

शब्दों की व्याख्या

अब तक की कहानी

  1. छात्रों को ह्यूमनॉइड रोबोट सौंपने वाली दक्षिण कोरियाई कंपनी रोबोटिस
  2. AI ने खोजा रास्ता: अल्फा सेंटॉरी के लिए यान भेजने की योजना
  3. AI बेंचमार्क असल में क्या मापते हैं? BenchMIRT टूल
#ai#LLM benchmarks#Allen Institute for AI#AI2
इस खबर को रेटिंग दें

संबंधित खबरें