टेक्स्ट और तस्वीरें एक ही नेटवर्क में पढ़ने वाला नया AI मॉडल NeoMME
Hcompany ने NeoMME नाम से ओपन-सोर्स AI एन्कोडर मॉडल जारी किए हैं, जो टेक्स्ट और तस्वीरों को एक ही नेटवर्क से प्रोसेस करते हैं; कंपनी के मुताबिक छोटा मॉडल एक सेकंड में करीब 51 दस्तावेज़ पन्ने पढ़ सकता है।
Hcompany ने NeoMME नाम से दो ओपन-सोर्स एन्कोडर AI मॉडल जारी किए हैं। एक मॉडल में 260 मिलियन पैरामीटर हैं और दूसरे में 800 मिलियन पैरामीटर हैं। इन्हें टेक्स्ट और तस्वीरों, दोनों को एक साझा गणितीय प्रारूप — जिसे एम्बेडिंग कहा जाता है — में बदलने के लिए बनाया गया है, ताकि कंप्यूटर उनकी तुलना और खोज कर सके। ज्यादातर मौजूदा AI सिस्टम अलग इमेज-पहचान मॉड्यूल और अलग टेक्स्ट-जनरेट करने वाले लैंग्वेज मॉडल को जोड़ते हैं। इसके उलट, NeoMME एक ही ट्रांसफॉर्मर नेटवर्क से टेक्स्ट टोकन और तस्वीर के हिस्सों को एक साथ प्रोसेस करता है। ट्रांसफॉर्मर एक तरह का न्यूरल नेटवर्क ढांचा है जो ज्यादातर आधुनिक AI सिस्टम के मूल में होता है। इस मॉडल को शुरू से 'मास्क्ड डिस्क्रीट डिफ्यूजन' तकनीक से प्रशिक्षित किया गया, जिसमें मॉडल टेक्स्ट के जान-बूझकर छिपाए गए शब्दों का अनुमान लगाकर सीखता है।
डेवलपर्स ने NeoMME को 'विजुअल डॉक्यूमेंट रिट्रीवल' के लिए फाइन-ट्यून किया है, यानी पहले से निकाले गए टेक्स्ट के बजाय पन्ने के असली रूप — लेआउट, टेबल, चार्ट और फॉन्ट — के आधार पर सही दस्तावेज़ पन्ना खोजना। NeoMME-Retriever नाम के इस टास्क में दोनों मॉडल आकार एक दस्तावेज़-खोज बेंचमार्क के 'पैरेटो फ्रंटियर' पर आते हैं। यह वह वक्र है जो किसी दिए गए मॉडल आकार के लिए हासिल की जा सकने वाली सबसे अच्छी सटीकता दिखाता है। 2048x2048 पिक्सेल के रिज़ॉल्यूशन पर एनवीडिया L40S जीपीयू पर परखने पर, 260 मिलियन पैरामीटर वाला मॉडल एक सेकंड में करीब 51 दस्तावेज़ पन्ने एन्कोड कर सकता है। यह ColModernVBERT नाम के एक तुलनीय मॉडल से करीब दोगुनी रफ्तार है।
ये मॉडल दस्तावेज़ की जानकारी को सहेजने का तरीका भी छोटा कर सकते हैं। 'हायरार्किकल टोकन पूलिंग' और 'असिमेट्रिक क्वांटाइज़ेशन' नाम की तकनीकों का इस्तेमाल कर, NeoMME एक पन्ने के लिए जरूरी स्टोरेज को करीब 1.5 मेगाबाइट से घटाकर लगभग 6 किलोबाइट कर देता है। यह 255 गुना छोटा है। इसके बावजूद यह मूल खोज सटीकता का 95% से ज्यादा हिस्सा बरकरार रखता है।
NeoMME 16,384 टोकन तक की संदर्भ लंबाई को सपोर्ट करता है, जो एक साथ दो मानक 4K रिज़ॉल्यूशन तस्वीरों को प्रोसेस करने के लिए काफी है। इसे 131,000 शब्दों की शब्दावली का इस्तेमाल कर, तस्वीरों के साथ बहुभाषी टेक्स्ट पर भी प्रशिक्षित किया गया। हर मॉडल ने कुल मिलाकर करीब 524 बिलियन टोकन के प्रशिक्षण डेटा को प्रोसेस किया, जिसमें से 290 बिलियन टोकन सिर्फ टेक्स्ट वाले उदाहरणों से आए। यह पुराने ModernBERT मॉडल में इस्तेमाल हुए 2 ट्रिलियन टोकन से कहीं छोटा प्रशिक्षण बजट है। Hcompany ने इन मॉडल चेकपॉइंट्स को Apache 2.0 ओपन-सोर्स लाइसेंस के तहत हगिंग फेस ट्रांसफॉर्मर्स पर जारी किया है।
शब्दों की व्याख्या
अब तक की कहानी
- OpenAI एजेंटों ने धोखा देना सीखा, फिर हगिंग फेस को हैक किया
- ओपन ASR लीडरबोर्ड में पहली बार हिंदी और भारतीय अंग्रेज़ी के लिए मूल्यांकन शामिल
- OpenAI मॉडल से 11 गुना सस्ता नया AI मॉडल BDH-CQ
- टेनसेंट ने जारी किया 770 अरब पैरामीटर वाला ओपन-सोर्स एआई मॉडल Hy4 प्रीव्यू
- हगिंग फेस ने ब्राउज़र में AI चलाने के लिए 207 WebGPU कर्नल जारी किए
- टेक्स्ट और तस्वीरें एक ही नेटवर्क में पढ़ने वाला नया AI मॉडल NeoMME
