Hugging Face वरील सर्वाधिक डाउनलोड केलेले मॉडेल कोणतेही चॅट-बॉट नाही – ते २०२१ मधील २२-मिलियन-पॅरामीटर असलेले sentence-embedding मॉडेल आहे, जे २५६ दशलक्ष वेळा डाउनलोड केले गेले आहे. हे आकडे एक साधी गोष्ट सांगतात: बहुतेक वास्तविक जगातील AI वर्कलोड्स हे हेडलाईनमध्ये येणाऱ्या लार्ज लँग्वेज मॉडेल्सवर (LLMs) नाही, तर लहान आणि CPU-फ्रेंडली मॉडेल्सवर चालतात.

प्रोडक्शनमध्ये वर्चस्व गाजवणारी तीन मॉडेल्स

all-MiniLM-L6-v2 – २५६ दशलक्ष डाउनलोड्स

हे २२ M-पॅरामीटर मॉडेल मजकुराचा एक तुकडा 'dense vector' मध्ये रूपांतरित करते. साम्य मोजण्यासाठी या वेक्टरची इतर वेक्टर्सशी तुलना केली जाऊ शकते, ज्यामुळे सिमेंटिक सर्च (semantic search), रेकमेंडेशन इंजिन्स आणि डुप्लिकेट-डिटेक्शन पाइपलाइन्सना बळ मिळते.

ते सर्वत्र का आहे:

  • CPU वर चालते – महागड्या GPU ची गरज नाही.
  • बॅच प्रोसेसिंगसाठी वेगवान – काही मिनिटांत लाखो वाक्यांचे एम्बेडिंग करू शकते.
  • स्थानिक पातळीवर (locally) होस्ट करणे मोफत – क्लाउड-सर्व्हिस फी आणि डेटा-प्रायव्हसीच्या समस्या दूर करते.

cross-encoder/ms-marco-MiniLM-L6-v2 – ८७ दशलक्ष डाउनलोड्स

हे मॉडेल 'reranker' म्हणून काम करते. हे एक क्वेरी आणि एक संभाव्य दस्तऐवज (candidate document) एकत्र घेते आणि त्याचा 'relevance score' देते. एका सामान्य RAG स्टॅक मध्ये वर्कफ्लो असा दिसतो:

१. वेगवान टप्पा (Fast stage) – MiniLM टॉप-५० संभाव्य पर्याय निवडते. २. अचूक टप्पा (Accurate stage) – क्रॉस-एन्कोडरद्वारे त्या ५० गोष्टींचे पुन्हा स्कोअरिंग केल्यामुळे उत्तराचा दर्जा सुधारतो.

मॉडेल पेजवरील कमी "like" संख्या हे दर्शवते की बहुतेक वापरकर्ते हबवर ब्राउझ करण्याऐवजी प्रोग्रामॅटिकली (programmatically) याचा वापर करतात, परंतु डाउनलोडची संख्या हे सिद्ध करते की प्रोडक्शन पाइपलाइन्समध्ये अचूकता वाढवण्यासाठी हे एक 'de-facto' साधन आहे.

amazon/chronos-2 – ३५ दशलक्ष डाउनलोड्स

Chronos-2 टाइम-सीरीज डेटाला मजकुराप्रमाणे हाताळते, ज्यामुळे एकच फाउंडेशन मॉडेल कोणत्याही विशिष्ट प्रशिक्षणाशिवाय विक्री, सर्व्हर लोड किंवा कोणत्याही संख्यात्मक सिग्नलचा अंदाज (forecast) लावू शकते. एका विशेष फोरकास्टरसाठी (forecaster) दशलक्षोंमध्ये असलेले डाउनलोड्स हे "एकदा प्रशिक्षित करा, कुठेही चालवा" (train once, run anywhere) अशा सोल्यूशन्सची मोठी मागणी दर्शवतात, विशेषतः अशा संस्थांमध्ये ज्यांना अन्यथा प्रत्येक मेट्रिकसाठी वेगवेगळी मॉडेल्स हाताळावी लागली असती.

AI टीम्ससाठी या आकड्यांचा अर्थ काय?

डाउनलोड चार्ट्स मीडियामधील गाजावाजा आणि ऑपरेशनल वास्तव यातील तफावत स्पष्ट करतात. प्रेस रिलीजमध्ये LLMs चे वर्चस्व असते, परंतु सेवा प्रत्यक्षात चालू ठेवण्याचे मुख्य काम खालील मॉडेल्स करतात:

  • Embedding मॉडेल्स जे कच्च्या मजकुराचे शोधण्यायोग्य वेक्टर्समध्ये रूपांतर करतात.
  • Cross-encoders जे त्या वेक्टर्सना अचूक रँकिंगमध्ये सुधारित करतात.
  • Foundation forecasters जे अनेक संख्यात्मक सिरीजसाठी एकच मॉडेल लागू करतात.

निष्कर्ष स्पष्ट आहे: जर तुम्ही मोठ्या प्रमाणावर (at scale) चालणारे AI तयार करत असाल, तर केवळ गाजावाजाकडे न बघता त्यापलीकडे पहा. Hugging Face च्या डाउनलोड चार्टवर वर्चस्व गाजवणारी मॉडेल्स प्रोडक्शन सिस्टम्स सुरळीत ठेवतात आणि वास्तविक AI खर्च कुठे खर्च केला जाईल, हे ठरवण्यात त्यांची भूमिका कायम राहील.