Vercel ਦੀ ਜੂਨ ਦੀ ਟੋਕਨ-ਸ਼ੇਅਰ ਰਿਪੋਰਟ ਤੋਂ ਪਤਾ ਲੱਗਦਾ ਹੈ ਕਿ ਓਪਨ-ਵੇਟ ਮਾਡਲ ਗੇਟਵੇ ਟੋਕਨਾਂ ਦਾ 29% ਸੰਭਾਲ ਰਹੇ ਹਨ, ਜੋ ਕਿ ਅਪ੍ਰੈਲ ਵਿੱਚ 11% ਸੀ, ਜਿਸ ਵਿੱਚ ਇਕੱਲੇ DeepSeek ਦਾ ਹਿੱਸਾ 22.6% ਹੈ। ਇਹ ਉਛਾਲ ਇੱਕ ਤੇਜ਼ੀ ਨਾਲ ਹੋ ਰਹੇ ਬਦਲਾਅ ਦਾ ਸੰਕੇਤ ਦਿੰਦਾ ਹੈ: ਡਿਵੈਲਪਰ ਇੱਕ ਇਕੱਲੇ "ਸਭ ਤੋਂ ਵਧੀਆ" ਮਾਡਲ ਤੋਂ ਦੂਰ ਜਾ ਰਹੇ ਹਨ ਅਤੇ AI ਮਾਡਲਾਂ ਨੂੰ ਰੂਟੇਬਲ ਇਨਫਰਾਸਟ੍ਰਕਚਰ ਵਜੋਂ ਵਰਤ ਰਹੇ ਹਨ।

ਡਿਵੈਲਪਰ ਮਾਡਲਾਂ ਨੂੰ ਇਨਫਰਾਸਟ੍ਰਕਚਰ ਵਜੋਂ ਕਿਉਂ ਮੰਨ ਰਹੇ ਹਨ

ਸਸਤੇ, ਓਪਨ-ਵੇਟ ਮਾਡਲ—ਜਿਨ੍ਹਾਂ ਵਿੱਚੋਂ ਬਹੁਤ ਸਾਰੇ ਚੀਨੀ ਪ੍ਰੋਵਾਈਡਰਾਂ ਦੇ ਹਨ—Anthropic ਵਰਗੀਆਂ ਪ੍ਰੀਮੀਅਮ ਆਫਰਿੰਗਜ਼ ਦੇ ਇੱਕ ਹਿੱਸੇ ਦੇ ਬਰਾਬਰ ਖਰਚਾ ਕਰਦੇ ਹਨ। ਕੋਡ ਐਕਸਟਰੈਕਸ਼ਨ, ਟੈਕਸਟ ਕਲੀਨਿੰਗ, ਜਾਂ ਸਧਾਰਨ ਡਾਟਾ ਲੁੱਕ-ਅੱਪ ਵਰਗੇ ਰੁਟੀਨ ਕੰਮਾਂ ਲਈ, ਇੱਕ ਅਜਿਹਾ ਮਾਡਲ ਜੋ ਡਾਲਰਾਂ ਦੀ ਬਜਾਏ ਸੈਂਟਾਂ ਵਿੱਚ ਖਰਚ ਹੁੰਦਾ ਹੈ, ਵਧੇਰੇ ਆਕਰਸ਼ਕ ਹੋ ਸਕਦਾ ਹੈ, ਭਾਵੇਂ ਇਹ ਕੁਝ ਪ੍ਰਤੀਸ਼ਤ ਘੱਟ ਸਹੀ ਹੀ ਕਿਉਂ ਨਾ ਹੋਵੇ।

ਇਸ ਦਾ ਨਤੀਜਾ ਇੱਕ ਨਵਾਂ ਡਿਜ਼ਾਈਨ ਪੈਟਰਨ ਹੈ। ਇੱਕ ਐਪਲੀਕੇਸ਼ਨ ਪਹਿਲਾਂ ਕੰਮ ਦੇ "ਬੋਰਿੰਗ" ਹਿੱਸੇ ਲਈ ਇੱਕ ਘੱਟ-ਲਾਗਤ ਵਾਲੇ ਮਾਡਲ ਨੂੰ ਰਿਕਵੈਸਟ ਭੇਜਦੀ ਹੈ। ਜੇਕਰ ਆਊਟਪੁੱਟ ਇੱਕ ਸਧਾਰਨ ਕੁਆਲਿਟੀ ਚੈੱਕ ਪਾਸ ਕਰ ਲੈਂਦਾ ਹੈ, ਤਾਂ ਪਾਈਪਲਾਈਨ ਅੱਗੇ ਵਧਦੀ ਹੈ; ਜੇਕਰ ਨਹੀਂ, ਤਾਂ ਦੂਜੀ ਵਾਰ ਜਾਂ ਅੰਤਿਮ ਫੈਸਲੇ ਲਈ ਇੱਕ ਉੱਚ-ਕੀਮਤ ਵਾਲੇ ਮਾਡਲ ਨੂੰ ਬੁਲਾਇਆ ਜਾਂਦਾ ਹੈ। ਇੱਥੇ ਰੂਟਿੰਗ ਲੌਜਿਕ ਮਹੱਤਵਪੂਰਨ ਹਿੱਸਾ ਬਣ ਜਾਂਦਾ ਹੈ, ਨਾ ਕਿ ਕਿਸੇ ਇੱਕ ਮਾਡਲ ਦੀ ਚੋਣ।

ਅੰਕੜੇ ਕੀ ਕਹਿੰਦੇ ਹਨ

Vercel ਦਾ ਡਾਟਾ, ਜੋ ਕਿ ਕਈ AI ਪ੍ਰੋਵਾਈਡਰਾਂ ਦੇ ਸਾਹਮਣੇ ਕੰਮ ਕਰਨ ਵਾਲੇ ਇਸਦੇ ਗੇਟਵੇ ਤੋਂ ਲਿਆ ਗਿਆ ਹੈ, ਦਿਖਾਉਂਦਾ ਹੈ ਕਿ ਓਪਨ-ਵੇਟ ਮਾਡਲ ਹੁਣ ਮੇਨਸਟ੍ਰੀਮ (ਮੁੱਖ ਧਾਰਾ) ਵੱਲ ਵਧ ਰਹੇ ਹਨ। ਅਪ੍ਰੈਲ ਵਿੱਚ, ਉਹਨਾਂ ਦਾ ਹਿੱਸਾ ਸਾਰੇ ਟੋਕਨਾਂ ਦੇ ਇੱਕ-ਦਸਵੇਂ ਹਿੱਸੇ ਤੋਂ ਥੋੜ੍ਹਾ ਜਿਹਾ ਸੀ; ਜੂਨ ਤੱਕ, ਉਹ ਇੱਕ-ਤੀਜੇ ਦੇ ਨੇੜੇ ਪਹੁੰਚ ਗਏ ਸਨ। DeepSeek, ਜੋ ਕਿ ਇੱਕ ਚੀਨੀ ਮਾਡਲ ਹੈ, ਨੇ ਇਕੱਲੇ ਹੀ ਟੋਕਨ ਵਾਲੀਅਮ ਦੇ ਪੰਜਵੇਂ ਹਿੱਸੇ ਤੋਂ ਵੱਧ ਯੋਗਦਾਨ ਪਾਇਆ।

ਉੱਚ-ਦਰਜੇ (High-end) ਦੇ ਮਾਡਲ ਅਜੇ ਵੀ ਖਰਚੇ 'ਤੇ ਹਾਵੀ ਹਨ। ਉਦਾਹਰਨ ਲਈ, Anthropic ਅਜੇ ਵੀ ਜ਼ਿਆਦਾਤਰ ਵਿੱਤੀ ਖਰਚਾ ਹਾਸਲ ਕਰ ਰਿਹਾ ਹੈ ਕਿਉਂਕਿ ਪ੍ਰਤੀ ਟੋਕਨ ਇਸਦੀ ਕੀਮਤ ਵਧੇਰੇ ਹੈ। ਗਣਿਤ ਸਿੱਧਾ ਹੈ: ਸਸਤੇ ਮਾਡਲ ਉੱਚ-ਵਾਲੀਅਮ, ਘੱਟ-ਮਾਰਜਿਨ ਵਾਲੇ ਕੰਮਾਂ ਵਿੱਚ ਜਿੱਤਦੇ ਹਨ, ਜਦੋਂ ਕਿ ਮਹਿੰਗੇ ਮਾਡਲ ਉੱਚ-ਮਾਰਜਿਨ, ਉੱਚ-ਪ੍ਰਭਾਵ ਵਾਲੇ ਕੰਮਾਂ ਨੂੰ ਬਰਕਰਾਰ ਰੱਖਦੇ ਹਨ।

AI ਏਜੰਟਾਂ ਲਈ ਪ੍ਰਭਾਵ

ਇੱਕ AI ਏਜੰਟ ਆਮ ਤੌਰ 'ਤੇ ਕਦਮਾਂ ਦੀ ਇੱਕ ਲੜੀ ਪੂਰੀ ਕਰਦਾ ਹੈ: ਯੋਜਨਾਬੰਦੀ (planning), ਡਾਟਾ ਰੀਟ੍ਰੀਵਲ, ਟੂਲ ਇੰਵੋਕੇਸ਼ਨ, ਅਤੇ ਨਤੀਜੇ ਦੀ ਰਿਫਾਈਨਮੈਂਟ। ਜਦੋਂ ਹਰੇਕ ਕਦਮ ਨੂੰ ਸਭ ਤੋਂ ਕਿਫਾਇਤੀ ਮਾਡਲ ਨੂੰ ਸੌਂਪਿਆ ਜਾ ਸਕਦਾ ਹੈ, ਤਾਂ ਸਮੁੱਚੀ ਸੰਚਾਲਨ ਲਾਗਤ (operating cost) ਵਿੱਚ ਭਾਰੀ ਗਿਰਾਵਟ ਆਉਂਦੀ ਹੈ।

  • ਡਾਟਾ ਰੀਟ੍ਰੀਵਲ ਅਤੇ ਐਕਸਟਰੈਕਸ਼ਨ ਲਈ ਅਕਸਰ ਸਿਰਫ ਬੁਨਿਆਦੀ ਭਾਸ਼ਾ ਸਮਝ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ, ਜੋ ਕਿ ਸਸਤੇ ਮਾਡਲਾਂ ਦਾ ਖਾਸ ਖੇਤਰ ਹੈ।
  • ਅੰਤਿਮ ਫੈਸਲਾ—ਉਹ ਹਿੱਸਾ ਜੋ ਇਹ ਤੈਅ ਕਰਦਾ ਹੈ ਕਿ ਜਵਾਬ ਸਵੀਕਾਰਯੋਗ ਹੈ ਜਾਂ ਨਹੀਂ—ਉੱਚ ਭਰੋਸੇਯੋਗਤਾ ਵਾਲੇ ਪ੍ਰੀਮੀਅਮ ਮਾਡਲਾਂ ਦੇ ਅਧੀਨ ਰਹਿੰਦਾ ਹੈ।

ਇਹ ਲੇਅਰਡ ਅਪ੍ਰੋਚ ਡਿਵੈਲਪਰਾਂ ਨੂੰ ਬਜਟ ਨੂੰ ਵਿਗਾੜੇ ਬਿਨਾਂ ਵੱਡੇ ਵਰਕਲੋਡ ਨੂੰ ਆਟੋਮੇਟ ਕਰਨ ਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦੀ ਹੈ। ਇਹ "ਸਭ ਤੋਂ ਵਧੀਆ ਮਾਡਲ ਚੁਣੋ" ਦੀ ਬਜਾਏ "ਹਰੇਕ ਕਦਮ ਅਨੁਸਾਰ ਸਫਲਤਾ ਨੂੰ ਮਾਪੋ ਅਤੇ ਉਸ ਅਨੁਸਾਰ ਰੂਟ ਕਰੋ" ਵੱਲ ਇੱਕ ਬਦਲਾਅ ਲਿਆਉਂਦੀ ਹੈ।

ਖ਼ਤਰੇ ਅਤੇ ਸੀਮਾਵਾਂ

ਇਸ ਦੀ ਆਰਥਿਕਤਾ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਹੈ, ਪਰ ਇਹ ਤਬਦੀਲੀ ਬਿਨਾਂ ਕਿਸੇ ਰੁਕਾਵਟ ਦੇ ਨਹੀਂ ਹੈ।

  • ਕੰਪਲਾਇੰਸ (Compliance): ਕੁਝ ਅਧਿਕਾਰ ਖੇਤਰਾਂ ਵਿੱਚ ਡਾਟਾ-ਹੈਂਡਲਿੰਗ ਦੇ ਸਖ਼ਤ ਨਿਯਮ ਹਨ ਜੋ ਵਿਦੇਸ਼ੀ-ਹੋਸਟਡ ਮਾਡਲਾਂ ਦੀ ਵਰਤੋਂ ਨੂੰ ਸੀਮਤ ਕਰ ਸਕਦੇ ਹਨ।
  • ਹੋਸਟਿੰਗ ਦੀ ਜਟਿਲਤਾ: ਵੱਡੇ ਪ੍ਰੀਮੀਅਮ ਮਾਡਲਾਂ ਨੂੰ ਇਨ-ਹਾਊਸ ਚਲਾਉਣਾ ਮੁਸ਼ਕਲ ਹੁੰਦਾ ਹੈ, ਇਸ ਲਈ ਸੰਸਥਾਵਾਂ ਨੂੰ ਬਾਹਰੀ APIs 'ਤੇ ਨਿਰਭਰ ਕਰਨਾ ਪੈਂਦਾ ਹੈ, ਜੋ ਕਿ ਲੇਟੈਂਸੀ ਅਤੇ ਵੈਂਡਰ-ਲੌਕ ਦੀਆਂ ਚਿੰਤਾਵਾਂ ਪੈਦਾ ਕਰ ਸਕਦਾ ਹੈ।

ਇਨ੍ਹਾਂ ਕਾਰਨਾਂ ਕਰਕੇ, ਸਸਤੇ ਮਾਡਲਾਂ ਦੁਆਰਾ ਪ੍ਰੀਮੀਅਮ ਮਾਡਲਾਂ ਨੂੰ ਪੂਰੀ ਤਰ੍ਹਾਂ ਬਦਲਣ ਦੀ ਸੰਭਾਵਨਾ ਘੱਟ ਹੈ। ਇਸ ਦੀ ਬਜਾਏ, ਉਹ ਰੁਟੀਨ ਕੰਮਾਂ ਲਈ ਡਿਫੌਲਟ ਬਣ ਜਾਂਦੇ ਹਨ, ਜਦੋਂ ਕਿ ਪ੍ਰੀਮੀਅਮ ਮਾਡਲ "ਡੈਸੀਜ਼ਨ ਲੇਅਰ" ਵਿੱਚ ਰਹਿੰਦੇ ਹਨ ਜਿੱਥੇ ਉਹਨਾਂ ਦੀ ਉੱਚ ਲਾਗਤ ਜਾਇਜ਼ ਹੁੰਦੀ ਹੈ।

ਅੱਗੇ ਕੀ ਦੇਖਣਾ ਹੈ

  • ਰੂਟਿੰਗ ਲਈ ਟੂਲਿੰਗ: ਜਿਵੇਂ-ਜਿਵੇਂ ਰੂ