மொபைலிலேயே இயங்கக்கூடிய 3 பில்லியன் பாராமீட்டர் பார்வை-மொழி மாடல்: Liquid AI-யின் LFM2.5-VL-3B
பயனாளர் சொந்த வன்பொருளிலேயே இயங்கும் ஓபன்-வெயிட் பார்வை-மொழி மாடல் LFM2.5-VL-3B-ஐ Liquid AI நிறுவனம் வெளியிட்டுள்ளது; திரை புரிதல், பொருள் அடையாளம், பல படங்களைச் சேர்த்து ஆய்வு செய்தல், கருவி அழைப்பு ஆகியவற்றில் இது முந்தைய பதிப்பை விட மேம்பட்டதாகும்.
பயனாளர் சொந்த வன்பொருளிலேயே இயங்கும்படி வடிவமைக்கப்பட்ட 3.1 பில்லியன் பாராமீட்டர்கள் கொண்ட ஓபன்-வெயிட் பார்வை- (vision-language model) Liquid AI நிறுவனம் வெளியிட்டிருக்கிறது. LFM2.5-VL-3B என்ற இந்த மாதிரி, அந்த அளவில் தங்களால் இதுவரை உருவாக்கப்பட்ட மிகச்சிறந்த மாதிரி என்று நிறுவனம் கூறுகிறது. முந்தைய LFM2-VL-3B-ஐ விட நான்கு முக்கிய முன்னேற்றங்கள் உள்ளன: பல்வேறு சாதனங்களின் திரைகளையும் பயனர் இடைமுகங்களையும் புரிந்துகொள்ளும் திறன் அதிகரிப்பு, இயற்கை மொழி வினாக்களிலிருந்து பொருள்களை அடையாளம் காணும் மேம்பாடு, பல படங்களைச் சேர்த்து சிந்திக்கும் திறன், உரை-மட்டும் மற்றும் உரை-பார்வை சூழல்களில் மிக மேம்பட்ட ''.
மாதிரி SigLIP2 400M NaFlex என்ற பார்வை என்கோடரையும், தங்களது LFM2.5-2.6B உரை மாதிரியின் அதே பயிற்றுவிக்கப்பட்ட அடிப்படையையும் இணைத்துக் கொள்கிறது. ஏறத்தாழ 34 டிரில்லியன் டோக்கன்களைக் கொண்டு முன்பயிற்சி செய்யப்பட்டிருக்கிறது; முந்தைய பதிப்பை விட நான்கு மடங்கு அதிகமான பார்வை தரவு பயன்படுத்தப்பட்டிருக்கிறது. லத்தீன் அல்லாத எழுத்துவகைகளை ஆதரிக்க, சொற்களஞ்சியம் 128,000 ஆக இரட்டிப்பாக்கப்பட்டிருக்கிறது — முழுவதுமாக மறுபயிற்சி செய்யாமல் டோக்கனைசர் நீட்டிக்கப்பட்டதன் மூலம். பயிற்சிக்குப் பிறகு இரு கட்டச் செயல்முறை: பெரிய ஆசிரிய மாதிரியில் இருந்து அறிவு பரிமாற்றத்துடன் மேற்பார்வையுடன் கூடிய நுண்சீரமைப்பு (ஃபைன்-டியூனிங்); பிறகு பல-வெகுமதி வலுவூட்டல் கற்றல்.
திரையிலுள்ள கூறுகளை வாசிக்கும் ScreenSpot-v2 என்ற பரிசோதனையில், LFM2.5-VL-3B கணினியில் 78.7, மொபைலில் 81.2, வலைப்பக்கத்தில் 82.2 என்ற எண்களை எட்டியிருக்கிறது; Liquid AI-யின் மதிப்பீட்டு அட்டவணையில் இது பெரும்பாலான 2B வகுப்பு மாதிரிகளையும், சில 4B வகுப்பு மாதிரிகளையும் மிஞ்சுகிறது. RefCOCO grounding மதிப்பீட்டில் 87.9 — முந்தைய பதிப்பு பெற்ற 57.1-லிருந்து பெரும் தாவல். வழிமுறை பின்பற்றுதல் மற்றும் கருவி பயன்பாட்டு எண்களும் கணிசமாக மேம்பட்டுள்ளன; ஆனால் பொது வழிமுறை பின்பற்றுதலில் சில பெரிய போட்டியாளர்களுக்குப் பின்னாலேயே நிற்கிறது.
இயக்க வேகம் குறித்து Liquid AI கூறுவது: M5 Max கணினியில் ஒரு நொடிக்கு 228 டோக்கன்கள், Ryzen AI Max+ 395-ல் நொடிக்கு 116 டோக்கன்கள், Galaxy S26 Ultra ஸ்மார்ட்போனில் நொடிக்கு 20 டோக்கன்கள் — முழுவதும் சாதனத்திலேயே இயங்கும் அளவுக்கு. நினைவகத் தேவை ஏறத்தாழ 3 GB. GPU-க்களில், பல படங்கள் உள்ளிடும் சூழலில் தாங்கள் சோதித்த மாதிரிகள் அனைத்திலும் இதுவே வேகமானது என்றும், ஒரு H100-ல் அதிக பல-பயனாளர் நிலைமையில் நொடிக்கு ஏறத்தாழ 11,000 டோக்கன்கள் வெளியிடும் என்றும் நிறுவனம் தெரிவிக்கிறது.
llama.cpp, MLX, vLLM, SGLang, ONNX மற்றும் சமீபத்திய Transformers நூலகம் ஆகிய அனைத்திலும் முதல் நாள் ஆதரவுடன் மாதிரி வெளியாகியிருக்கிறது. நீண்ட சிந்தனை மூலம் இல்லாமல் நேரடியாகவே பதிலளிக்கும் வகையில் இது வடிவமைக்கப்பட்டுள்ளது; அதனால் நிகழ்நேர மற்றும் சாதனத்திலேயே இயங்கும் செயலிகளில் பதில்கள் விரைவாக வருகின்றன.
சொல் விளக்கம்
இதுவரை நடந்தது
- 12 மொழி பேசும் திறந்த எடை TTS மாதிரி: NVIDIA-யின் Magpie Multilingual அறிமுகம்
- மொபைலிலேயே இயங்கக்கூடிய 3 பில்லியன் பாராமீட்டர் பார்வை-மொழி மாடல்: Liquid AI-யின் LFM2.5-VL-3B
