சயின்ஸ் டெக் பல்ஸ்
Read in English
செயற்கை நுண்ணறிவு

மொபைலிலேயே இயங்கக்கூடிய 3 பில்லியன் அளவு பார்வை-மொழி மாதிரி: Liquid AI-யின் LFM2.5-VL-3B

பயனாளர் சொந்த வன்பொருளிலேயே இயங்கும் திறந்த மூல பார்வை-மொழி மாதிரி LFM2.5-VL-3B-ஐ Liquid AI நிறுவனம் வெளியிட்டுள்ளது; திரை புரிதல், பொருள் அடையாளம், பல படங்களைச் சார்பாக ஆய்வு செய்தல், கருவி அழைப்பு ஆகியவற்றில் இது முந்தைய பதிப்பை விட மேம்பட்டதாகும்.

Read in English

பயனாளர் சொந்த வன்பொருளிலேயே இயங்கும்படி வடிவமைக்கப்பட்ட 3.1 பில்லியன் அளவுள்ள திறந்த மூல பார்வை-மொழி மாதிரியை (vision-language model) Liquid AI நிறுவனம் வெளியிட்டிருக்கிறது. LFM2.5-VL-3B என்ற இந்த மாதிரி, அந்த அளவில் தங்களால் இதுவரை உருவாக்கப்பட்ட மிகச்சிறந்த மாதிரி என்று நிறுவனம் கூறுகிறது. முந்தைய LFM2-VL-3B-ஐ விட நான்கு முக்கிய முன்னேற்றங்கள் உள்ளன: பல்வேறு சாதனங்களின் திரைகளையும் பயனர் இடைமுகங்களையும் புரிந்துகொள்ளும் திறன் அதிகரிப்பு, இயற்கை மொழி வினாக்களிலிருந்து பொருள்களை அடையாளம் காணும் மேம்பாடு, பல படங்களைச் சேர்த்து சிந்திக்கும் திறன், உரை-மட்டும் மற்றும் உரை-பார்வை சூழல்களில் மிக மேம்பட்ட 'function calling'.

மாதிரி SigLIP2 400M NaFlex என்ற பார்வை என்கோடரையும், தங்களது LFM2.5-2.6B உரை மாதிரியின் அதே பயிற்றுவிக்கப்பட்ட அடிப்படையையும் இணைத்துக் கொள்கிறது. ஏறத்தாழ 34 டிரில்லியன் டோக்கன்களைக் கொண்டு முன்பயிற்சி செய்யப்பட்டிருக்கிறது; முந்தைய பதிப்பை விட நான்கு மடங்கு அதிகமான பார்வை தரவு பயன்படுத்தப்பட்டிருக்கிறது. லத்தீன் அல்லாத எழுத்துவகைகளை ஆதரிக்க, சொற்களஞ்சியம் 128,000 ஆக இரட்டிப்பாக்கப்பட்டிருக்கிறது — முழுவதுமாக மறுபயிற்சி செய்யாமல் டோக்கனைசர் நீட்டிக்கப்பட்டதன் மூலம். பயிற்சிக்குப் பிறகு இரு கட்டச் செயல்முறை: பெரிய ஆசிரிய மாதிரியில் இருந்து அறிவு பரிமாற்றத்துடன் மேற்பார்வையிடப்பட்ட நுணுக்கமான கட்டமைப்பு; பிறகு பல-வெகுமதி வலுவூட்டல் கற்றல்.

திரையிலுள்ள கூறுகளை வாசிக்கும் ScreenSpot-v2 என்ற பரிசோதனையில், LFM2.5-VL-3B கணினியில் 78.7, மொபைலில் 81.2, வலைப்பக்கத்தில் 82.2 என்ற எண்களை எட்டியிருக்கிறது; Liquid AI-யின் மதிப்பீட்டு அட்டவணையில் இது பெரும்பாலான 2B வகுப்பு மாதிரிகளையும், சில 4B வகுப்பு மாதிரிகளையும் மிஞ்சுகிறது. RefCOCO grounding மதிப்பீட்டில் 87.9 — முந்தைய பதிப்பு பெற்ற 57.1-லிருந்து பெரும் தாவல். வழிமுறை பின்பற்றுதல் மற்றும் கருவி பயன்பாட்டு எண்களும் கூர்மையாக மேம்பட்டுள்ளன; ஆனால் பொது வழிமுறை பின்பற்றுதலில் சில பெரிய போட்டியாளர்களுக்குப் பின்னாலேயே நிற்கிறது.

இயக்க வேகம் குறித்து Liquid AI கூறுவது: M5 Max கணினியில் ஒரு நொடிக்கு 228 டோக்கன்கள், Ryzen AI Max+ 395-ல் நொடிக்கு 116 டோக்கன்கள், Galaxy S26 Ultra ஸ்மார்ட்போனில் நொடிக்கு 20 டோக்கன்கள் — முழுவதும் சாதனத்திலேயே இயங்கும் அளவுக்கு. நினைவகத் தேவை ஏறத்தாழ 3 GB. GPU-க்களில், பல படங்கள் உள்ளிடும் சூழலில் தாங்கள் சோதித்த மாதிரிகள் அனைத்திலும் இதுவே வேகமானது என்றும், ஒரு H100-ல் அதிக பல-பயனாளர் நிலைமையில் நொடிக்கு ஏறத்தாழ 11,000 டோக்கன்கள் வெளியிடும் என்றும் நிறுவனம் தெரிவிக்கிறது.

llama.cpp, MLX, vLLM, SGLang, ONNX மற்றும் சமீபத்திய Transformers நூலகம் ஆகிய அனைத்திலும் முதல் நாள் ஆதரவுடன் மாதிரி வெளியாகியிருக்கிறது. நீண்ட சிந்தனை மூலம் இல்லாமல் நேரடியாகவே பதிலளிக்கும் வகையில் இது வடிவமைக்கப்பட்டுள்ளது; அதனால் நேரடி மற்றும் சாதனத்திலேயே இயங்கும் செயலிகளில் பதில்கள் விரைவாக வருகின்றன.

#liquid ai#vision language model#on device ai#lfm2#open weights
இச்செய்திக்கு மதிப்பிடுங்கள்

தொடர்புடைய செய்திகள்