साइंस टेक पल्स
एआई मॉडल

टेक्स्ट और तस्वीरें एक ही नेटवर्क में पढ़ने वाला नया AI मॉडल NeoMME

Hcompany ने NeoMME नाम से ओपन-सोर्स AI एन्कोडर मॉडल जारी किए हैं, जो टेक्स्ट और तस्वीरों को एक ही नेटवर्क से प्रोसेस करते हैं; कंपनी के मुताबिक छोटा मॉडल एक सेकंड में करीब 51 दस्तावेज़ पन्ने पढ़ सकता है।

Hcompany ने NeoMME नाम से दो ओपन-सोर्स एन्कोडर AI मॉडल जारी किए हैं। एक मॉडल में 260 मिलियन पैरामीटर हैं और दूसरे में 800 मिलियन पैरामीटर हैं। इन्हें टेक्स्ट और तस्वीरों, दोनों को एक साझा गणितीय प्रारूप — जिसे एम्बेडिंग कहा जाता है — में बदलने के लिए बनाया गया है, ताकि कंप्यूटर उनकी तुलना और खोज कर सके। ज्यादातर मौजूदा AI सिस्टम अलग इमेज-पहचान मॉड्यूल और अलग टेक्स्ट-जनरेट करने वाले लैंग्वेज मॉडल को जोड़ते हैं। इसके उलट, NeoMME एक ही ट्रांसफॉर्मर नेटवर्क से टेक्स्ट टोकन और तस्वीर के हिस्सों को एक साथ प्रोसेस करता है। ट्रांसफॉर्मर एक तरह का न्यूरल नेटवर्क ढांचा है जो ज्यादातर आधुनिक AI सिस्टम के मूल में होता है। इस मॉडल को शुरू से 'मास्क्ड डिस्क्रीट डिफ्यूजन' तकनीक से प्रशिक्षित किया गया, जिसमें मॉडल टेक्स्ट के जान-बूझकर छिपाए गए शब्दों का अनुमान लगाकर सीखता है।

डेवलपर्स ने NeoMME को 'विजुअल डॉक्यूमेंट रिट्रीवल' के लिए फाइन-ट्यून किया है, यानी पहले से निकाले गए टेक्स्ट के बजाय पन्ने के असली रूप — लेआउट, टेबल, चार्ट और फॉन्ट — के आधार पर सही दस्तावेज़ पन्ना खोजना। NeoMME-Retriever नाम के इस टास्क में दोनों मॉडल आकार एक दस्तावेज़-खोज बेंचमार्क के 'पैरेटो फ्रंटियर' पर आते हैं। यह वह वक्र है जो किसी दिए गए मॉडल आकार के लिए हासिल की जा सकने वाली सबसे अच्छी सटीकता दिखाता है। 2048x2048 पिक्सेल के रिज़ॉल्यूशन पर एनवीडिया L40S जीपीयू पर परखने पर, 260 मिलियन पैरामीटर वाला मॉडल एक सेकंड में करीब 51 दस्तावेज़ पन्ने एन्कोड कर सकता है। यह ColModernVBERT नाम के एक तुलनीय मॉडल से करीब दोगुनी रफ्तार है।

ये मॉडल दस्तावेज़ की जानकारी को सहेजने का तरीका भी छोटा कर सकते हैं। 'हायरार्किकल टोकन पूलिंग' और 'असिमेट्रिक क्वांटाइज़ेशन' नाम की तकनीकों का इस्तेमाल कर, NeoMME एक पन्ने के लिए जरूरी स्टोरेज को करीब 1.5 मेगाबाइट से घटाकर लगभग 6 किलोबाइट कर देता है। यह 255 गुना छोटा है। इसके बावजूद यह मूल खोज सटीकता का 95% से ज्यादा हिस्सा बरकरार रखता है।

NeoMME 16,384 टोकन तक की संदर्भ लंबाई को सपोर्ट करता है, जो एक साथ दो मानक 4K रिज़ॉल्यूशन तस्वीरों को प्रोसेस करने के लिए काफी है। इसे 131,000 शब्दों की शब्दावली का इस्तेमाल कर, तस्वीरों के साथ बहुभाषी टेक्स्ट पर भी प्रशिक्षित किया गया। हर मॉडल ने कुल मिलाकर करीब 524 बिलियन टोकन के प्रशिक्षण डेटा को प्रोसेस किया, जिसमें से 290 बिलियन टोकन सिर्फ टेक्स्ट वाले उदाहरणों से आए। यह पुराने ModernBERT मॉडल में इस्तेमाल हुए 2 ट्रिलियन टोकन से कहीं छोटा प्रशिक्षण बजट है। Hcompany ने इन मॉडल चेकपॉइंट्स को Apache 2.0 ओपन-सोर्स लाइसेंस के तहत हगिंग फेस ट्रांसफॉर्मर्स पर जारी किया है।

शब्दों की व्याख्या

अब तक की कहानी

  1. OpenAI एजेंटों ने धोखा देना सीखा, फिर हगिंग फेस को हैक किया
  2. ओपन ASR लीडरबोर्ड में पहली बार हिंदी और भारतीय अंग्रेज़ी के लिए मूल्यांकन शामिल
  3. OpenAI मॉडल से 11 गुना सस्ता नया AI मॉडल BDH-CQ
  4. टेनसेंट ने जारी किया 770 अरब पैरामीटर वाला ओपन-सोर्स एआई मॉडल Hy4 प्रीव्यू
  5. हगिंग फेस ने ब्राउज़र में AI चलाने के लिए 207 WebGPU कर्नल जारी किए
  6. टेक्स्ट और तस्वीरें एक ही नेटवर्क में पढ़ने वाला नया AI मॉडल NeoMME
#NeoMME#Hcompany#AI model#Hugging Face#multimodal AI
इस खबर को रेटिंग दें

संबंधित खबरें