Hugging Face 'ਤੇ ਸਭ ਤੋਂ ਵੱਧ ਡਾਊਨਲੋਡ ਕੀਤਾ ਗਿਆ ਮਾਡਲ ਕੋਈ ਚੈਟ-ਬੋਟ ਨਹੀਂ ਹੈ – ਇਹ 2021 ਦਾ ਇੱਕ 22-ਮਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ ਵਾਲਾ sentence-embedding ਮਾਡਲ ਹੈ ਜਿਸ ਨੂੰ 256 ਮਿਲੀਅਨ ਵਾਰ ਡਾਊਨਲੋਡ ਕੀਤਾ ਗਿਆ ਹੈ। ਇਹ ਅੰਕੜੇ ਇੱਕ ਸਧਾਰਨ ਕਹਾਣੀ ਦੱਸਦੇ ਹਨ: ਜ਼ਿਆਦਾਤਰ ਅਸਲ-ਦੁਨੀਆ ਦੇ AI ਵਰਕਲੋਡ ਛੋਟੇ, CPU-ਅਨੁਕੂਲ ਮਾਡਲਾਂ 'ਤੇ ਚੱਲਦੇ ਹਨ, ਨਾ ਕਿ ਸੁਰਖੀਆਂ ਖਿੱਚਣ ਵਾਲੇ ਵੱਡੇ ਲੈਂਗੂਏਜ ਮਾਡਲਾਂ (LLMs) 'ਤੇ।

ਉਹ ਤਿੰਨ ਮਾਡਲ ਜੋ ਪ੍ਰੋਡਕਸ਼ਨ 'ਤੇ ਹਾਵੀ ਹਨ

all-MiniLM-L6-v2 – 256 ਮਿਲੀਅਨ ਡਾਊਨਲੋਡਸ

ਇਹ 22 M-ਪੈਰਾਮੀਟਰ ਵਾਲਾ ਮਾਡਲ ਟੈਕਸਟ ਦੇ ਇੱਕ ਹਿੱਸੇ ਨੂੰ ਇੱਕ ਡੈਂਸ ਵੈਕਟਰ (dense vector) ਵਿੱਚ ਬਦਲ ਦਿੰਦਾ ਹੈ। ਸਮਾਨਤਾ ਨੂੰ ਮਾਪਣ ਲਈ ਇਸ ਵੈਕਟਰ ਦੀ ਤੁਲਨਾ ਦੂਜਿਆਂ ਨਾਲ ਕੀਤੀ ਜਾ ਸਕਦੀ ਹੈ, ਜੋ ਕਿ semantic search, ਰੈਕੋਮੈਂਡੇਸ਼ਨ ਇੰਜਣਾਂ ਅਤੇ ਡੁਪਲੀਕੇਟ-ਡਿਟੈਕਸ਼ਨ ਪਾਈਪਲਾਈਨਾਂ ਨੂੰ ਸ਼ਕਤੀ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ।

ਇਹ ਹਰ ਜਗ੍ਹਾ ਕਿਉਂ ਹੈ:

  • CPU 'ਤੇ ਚੱਲਦਾ ਹੈ – ਕਿਸੇ ਮਹਿੰਗੇ GPU ਦੀ ਲੋੜ ਨਹੀਂ।
  • ਬੈਚ ਪ੍ਰੋਸੈਸਿੰਗ ਲਈ ਤੇਜ਼ – ਮਿੰਟਾਂ ਵਿੱਚ ਲੱਖਾਂ ਵਾਕਾਂ ਨੂੰ embed ਕਰ ਸਕਦਾ ਹੈ।
  • ਲੋਕਲ ਹੋਸਟਿੰਗ ਲਈ ਮੁਫ਼ਤ – ਕਲਾਉਡ-ਸਰਵਿਸ ਫੀਸਾਂ ਅਤੇ ਡਾਟਾ-ਪ੍ਰਾਈਵੇਸੀ ਦੀਆਂ ਚਿੰਤਾਵਾਂ ਨੂੰ ਖਤਮ ਕਰਦਾ ਹੈ।

cross-encoder/ms-marco-MiniLM-L6-v2 – 87 ਮਿਲੀਅਨ ਡਾਊਨਲੋਡਸ

ਇਹ ਮਾਡਲ ਇੱਕ reranker ਵਜੋਂ ਕੰਮ ਕਰਦਾ ਹੈ। ਇਹ ਇੱਕ ਕੁਐਰੀ (query) ਅਤੇ ਇੱਕ ਉਮੀਦਵਾਰ ਦਸਤਾਵੇਜ਼ (candidate document) ਨੂੰ ਇਕੱਠੇ ਲੈਂਦਾ ਹੈ ਅਤੇ ਇੱਕ ਪ੍ਰਸੰਗਿਕਤਾ ਸਕੋਰ (relevance score) ਵਾਪਸ ਕਰਦਾ ਹੈ। ਇੱਕ ਆਮ RAG ਸਟੈਕ ਵਿੱਚ ਵਰਕਫਲੋਅ ਇਸ ਤਰ੍ਹਾਂ ਹੁੰਦਾ ਹੈ:

  1. ਤੇਜ਼ ਪੜਾਅ (Fast stage) – MiniLM ਚੋਟੀ ਦੇ 50 ਉਮੀਦਵਾਰਾਂ ਨੂੰ ਚੁਣਦਾ ਹੈ।
  2. ਸਹੀ ਪੜਾਅ (Accurate stage) – cross-encoder ਦੁਆਰਾ ਉਹਨਾਂ 50 ਆਈਟਮਾਂ ਦੀ ਦੁਬਾਰਾ ਰਿਸਕੋਰਿੰਗ (rescoring) ਕਰਨ ਨਾਲ ਜਵਾਬ ਦੀ ਗੁਣਵੱਤਾ ਵਿੱਚ ਸੁਧਾਰ ਹੁੰਦਾ ਹੈ।

ਮਾਡਲ ਪੇਜ 'ਤੇ ਘੱਟ "like" ਕਾਊਂਟ ਇਹ ਦਰਸਾਉਂਦਾ ਹੈ ਕਿ ਜ਼ਿਆਦਾਤਰ ਉਪਭੋਗਤਾ ਹੱਬ (hub) ਨੂੰ ਬ੍ਰਾਊਜ਼ ਕਰਨ ਦੀ ਬਜਾਏ ਇਸਨੂੰ ਪ੍ਰੋਗਰਾਮੈਟਿਕ ਤੌਰ 'ਤੇ ਵਰਤਦੇ ਹਨ, ਪਰ ਡਾਊਨਲੋਡ ਦੀ ਮਾਤਰਾ ਇਸਨੂੰ ਪ੍ਰੋਡਕਸ਼ਨ ਪਾਈਪਲਾਈਨਾਂ ਵਿੱਚ ਸਟੀਕਤਾ ਵਧਾਉਣ ਲਈ ਇੱਕ ਅਸਲ (de-facto) ਟੂਲ ਵਜੋਂ ਪੁਸ਼ਟੀ ਕਰਦੀ ਹੈ।

amazon/chronos-2 – 35 ਮਿਲੀਅਨ ਡਾਊਨਲੋਡਸ

Chronos-2 time-series ਡਾਟਾ ਨੂੰ ਟੈਕਸਟ ਵਾਂਗ ਮੰਨਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਇੱਕ ਸਿੰਗਲ foundation ਮਾਡਲ ਕਿਸੇ ਖਾਸ ਟਾਸਕ ਦੀ ਟ੍ਰੇਨਿੰਗ ਤੋਂ ਬਿਨਾਂ ਵਿਕਰੀ, ਸਰਵਰ ਲੋਡ ਜਾਂ ਕਿਸੇ ਵੀ ਨੰਬਰਕਲ ਸਿਗਨਲ ਦੀ ਭਵਿੱਖਬਾਣੀ ਕਰ ਸਕਦਾ ਹੈ। ਇੱਕ ਵਿਸ਼ੇਸ਼ ਫੋਰਕਾਸਟਰ (forecaster) ਲਈ ਦਸਾਂ ਮਿਲੀਅਨਾਂ ਵਿੱਚ ਡਾਊਨਲੋਡ ਕਾਊਂਟ "ਇੱਕ ਵਾਰ ਟ੍ਰੇਨ ਕਰੋ, ਕਿਤੇ ਵੀ ਚਲਾਓ" (train once, run anywhere) ਵਾਲੇ ਹੱਲਾਂ ਦੀ ਭਾਰੀ ਮੰਗ ਦਾ ਸੰਕੇਤ ਦਿੰਦਾ ਹੈ, ਖਾਸ ਕਰਕੇ ਉਹਨਾਂ ਸੰਸਥਾਵਾਂ ਵਿੱਚ ਜੋ ਨਹੀਂ ਤਾਂ ਹਰੇਕ ਮੈਟ੍ਰਿਕ ਲਈ ਵੱਖ-ਵੱਖ ਮਾਡਲਾਂ ਦਾ ਇੱਕ ਸਮੂਹ ਰੱਖਦੀਆਂ ਹਨ।

AI ਟੀਮਾਂ ਲਈ ਇਹ ਅੰਕੜਿਆਂ ਦਾ ਕੀ ਮਤਲਬ ਹੈ

ਡਾਊਨਲੋਡ ਚਾਰਟ ਮੀਡੀਆ ਹਾਈਪ ਅਤੇ ਕਾਰਜਸ਼ੀਲ ਅਸਲੀਅਤ ਵਿਚਕਾਰਲੇ ਪਾੜੇ ਨੂੰ ਉਜਾਗਰ ਕਰਦੇ ਹਨ। ਪ੍ਰੈਸ ਰਿਲੀਜ਼ਾਂ ਵਿੱਚ LLMs ਦਾ ਦਬਦਬਾ ਹੁੰਦਾ ਹੈ, ਪਰ ਉਹ ਮਿਹਨਤੀ ਮਾਡਲ (workhorses) ਜੋ ਅਸਲ ਵਿੱਚ ਸੇਵਾਵਾਂ ਨੂੰ ਆਨਲਾਈਨ ਰੱਖਦੇ ਹਨ, ਉਹ ਹਨ:

  • Embedding ਮਾਡਲ ਜੋ ਕੱਚੇ ਟੈਕਸਟ ਨੂੰ ਸਰਚ ਕਰਨ ਯੋਗ ਵੈਕਟਰਾਂ ਵਿੱਚ ਬਦਲਦੇ ਹਨ।
  • Cross-encoders ਜੋ ਉਹਨਾਂ ਵੈਕਟਰਾਂ ਨੂੰ ਸਹੀ ਰੈਂਕਿੰਗ ਵਿੱਚ ਬਦਲਦੇ ਹਨ।
  • Foundation forecasters ਜੋ ਕਈ ਨੰਬਰਕਲ ਸੀਰੀਜ਼ਾਂ ਵਿੱਚ ਇੱਕ ਸਿੰਗਲ ਮਾਡਲ ਲਾਗੂ ਕਰਦੇ ਹਨ।

ਸਿੱਟਾ ਸਪੱਸ਼ਟ ਹੈ: ਜੇਕਰ ਤੁਸੀਂ ਅਜਿਹਾ AI ਬਣਾ ਰਹੇ ਹੋ ਜੋ ਵੱਡੇ ਪੱਧਰ 'ਤੇ ਚੱਲਣਾ ਹੈ, ਤਾਂ ਹਾਈਪ ਤੋਂ ਪਰੇ ਦੇਖੋ। ਉਹ ਮਾਡਲ ਜੋ Hugging Face ਦੇ ਡਾਊਨਲੋਡ ਚਾਰਟਾਂ 'ਤੇ ਹਾਵੀ ਹਨ, ਉਹ ਪ੍ਰੋਡਕਸ਼ਨ ਸਿਸਟਮਾਂ ਨੂੰ ਸੁਚਾਰੂ ਰੱਖਦੇ ਹਨ, ਅਤੇ ਉਹ ਇਹ ਨਿਰਧਾਰਤ ਕਰਦੇ ਰਹਿਣਗੇ ਕਿ ਅਸਲ AI ਖਰਚਾ ਕਿੱਥੇ ਹੋ ਰਿਹਾ ਹੈ।