DeepSeek ਨੇ V4-Flash-Vision-Exp ਲਾਂਚ ਕੀਤਾ ਹੈ, ਜੋ ਕਿ ਇੱਕ ਪ੍ਰਯੋਗਸ਼ੀਲ (experimental) ਮਲਟੀਮੋਡਲ ਮਾਡਲ ਹੈ। ਇਸ ਦਾ ਦਾਅਵਾ ਹੈ ਕਿ ਇਹ ਅੰਦਰੂਨੀ ਏਜੰਟ ਬੈਂਚਮਾਰਕਸ 'ਤੇ Anthropic ਦੇ Opus 4.8 ਦੇ ਲਗਭਗ ਬਰਾਬਰ ਪ੍ਰਦਰਸ਼ਨ ਕਰਦਾ ਹੈ, ਜਦਕਿ ਹਰ ਤਸਵੀਰ ਦੀ ਟੋਕਨ ਲਾਗਤ ਨੂੰ 384 'ਤੇ ਸੀਮਤ ਰੱਖਦਾ ਹੈ। ਇਹ ਲਾਂਚ ਡਿਵੈਲਪਰਾਂ ਨੂੰ ਵਿਜ਼ੂਅਲ AI ਕੰਮਾਂ ਲਈ ਇੱਕ ਤੇਜ਼-ਫਲੈਸ਼ ਵਿਕਲਪ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ, ਜੋ ਤਸਵੀਰਾਂ 'ਤੇ ਰੀਜ਼ਨਿੰਗ (reasoning) ਕਰਨ ਦੀ ਸਮਰੱਥਾ ਦੇ ਨਾਲ DeepSeek ਦੀ V4-Flash ਲਾਈਨ ਦੀ ਰਫ਼ਤਾਰ ਦਾ ਵਾਅਦਾ ਕਰਦਾ ਹੈ।

ਇਹ ਐਲਾਨ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ

ਮਲਟੀਮੋਡਲ ਏਜੰਟ—ਅਜਿਹੇ ਸਿਸਟਮ ਜੋ ਦੇਖ ਸਕਦੇ ਹਨ, ਪੜ੍ਹ ਸਕਦੇ ਹਨ ਅਤੇ ਕੰਮ ਕਰ ਸਕਦੇ ਹਨ—ਹੁਣ ਆਟੋਨੋਮਸ-ਟੂਲ ਵਿਕਾਸ ਦੇ ਕੇਂਦਰ ਵਿੱਚ ਹਨ। ਟੀਮਾਂ ਉਹਨਾਂ ਦੀ ਵਰਤੋਂ ਕਸਟਮਰ-ਸਪੋਰਟ ਬੋਟਸ ਲਈ ਕਰਦੀ ਹੈ ਜੋ ਸਕ੍ਰੀਨਸ਼ੌਟ ਪੜ੍ਹ ਸਕਦੇ ਹਨ ਅਤੇ ਰਿਸਰਚ ਅਸਿਸਟੈਂਟਸ ਲਈ ਕਰਦੀ ਹੈ ਜੋ ਡਾਇਗ੍ਰਾਮ ਦਾ ਵਿਸ਼ਲੇਸ਼ਣ ਕਰ ਸਕਦੇ ਹਨ। Anthropic ਦੇ Opus 4.8 ਨੇ ਇੱਕ ਉੱਚ ਮਿਆਰ ਸੈੱਟ ਕੀਤਾ ਹੈ, ਪਰ ਇਸਦੀ ਕੀਮਤ ਅਤੇ ਲੇਟੈਂਸੀ (latency) ਨੇ ਕਈਆਂ ਨੂੰ ਪਿੱਛੇ ਰੱਖਿਆ ਹੈ। ਘੱਟ ਟੋਕਨ ਲਾਗਤ 'ਤੇ ਲਗਭਗ ਬਰਾਬਰ ਪ੍ਰਦਰਸ਼ਨ ਦਾ DeepSeek ਦਾ ਦਾਅਵਾ ਉਹਨਾਂ ਸਾਰਿਆਂ ਲਈ ਲਾਗਤ-ਲਾਭ ਦੇ ਹਿਸਾਬ ਨੂੰ ਬਦਲ ਸਕਦਾ ਹੈ ਜੋ ਆਪਣੇ ਵਰਕਫਲੋ ਵਿੱਚ ਵਿਜ਼ਨ (vision) ਦੀ ਵਰਤੋਂ ਕਰਨ ਬਾਰੇ ਵਿਚਾਰ ਕਰ ਰਹੇ ਹਨ।

DeepSeek ਨੇ ਇਹ ਮਾਡਲ ਕਿਵੇਂ ਬਣਾਇਆ

ਨਵਾਂ ਮਾਡਲ DeepSeek ਦੇ ਮੌਜੂਦਾ V4-Flash ਆਰਕੀਟੈਕਚਰ ਦਾ ਵਿਸਤਾਰ ਕਰਦਾ ਹੈ, ਜੋ ਪਹਿਲਾਂ ਹੀ ਤੇਜ਼ ਟੈਕਸਟ ਰੀਜ਼ਨਿੰਗ ਅਤੇ ਘੱਟ ਟੋਕਨ ਦੀ ਵਰਤੋਂ ਲਈ ਟਿਊਨ ਕੀਤਾ ਗਿਆ ਹੈ। ਉਸ ਕੋਰ ਵਿੱਚ ਇੱਕ ਇਮੇਜ-ਪ੍ਰੋਸੈਸਿੰਗ ਫਰੰਟ-ਐਂਡ ਜੋੜ ਕੇ, DeepSeek ਨੇ ਵਿਜ਼ੂਅਲ ਅੰਡਰਸਟੈਂਡਿੰਗ ਜੋੜਦੇ ਹੋਏ ਮੂਲ ਮਾਡਲ ਦੇ ਵਿਸ਼ਵ-ਗਿਆਨ ਅਤੇ ਰੀਜ਼ਨਿੰਗ ਦੀਆਂ ਸ਼ਕਤੀਆਂ ਨੂੰ ਬਰਕਰਾਰ ਰੱਖਿਆ ਹੈ।

ਮੁੱਖ ਤਕਨੀਕੀ ਚੋਣਾਂ ਵਿੱਚ ਸ਼ਾਮਲ ਹਨ:

  • ਆਟੋਮੈਟਿਕ ਫਾਰਮੈਟ ਡਿਟੈਕਸ਼ਨ – ਮਾਡਲ ਇਹ ਫੈਸਲਾ ਕਰਨ ਲਈ ਤਸਵੀਰ ਦੇ ਬਾਈਨਰੀ ਕੰਟੈਂਟ ਨੂੰ ਪੜ੍ਹਦਾ ਹੈ ਕਿ ਉਹ JPEG, PNG, GIF ਜਾਂ WebP ਹੈ, ਜਿਸ ਨਾਲ ਗਲਤ ਨਾਮ ਵਾਲੀਆਂ ਫਾਈਲਾਂ ਤੋਂ ਹੋਣ ਵਾਲੀਆਂ ਗਲਤੀਆਂ ਤੋਂ ਬਚਿਆ ਜਾ ਸਕਦਾ ਹੈ।
  • ਅਡੈਪਟਿਵ ਰੀਸਾਈਜ਼ਿੰਗ – ਆਉਣ ਵਾਲੀਆਂ ਤਸਵੀਰਾਂ ਲਗਭਗ 800 × 800 ਪਿਕਸਲ ਤੱਕ ਨਾਰਮਲਾਈਜ਼ ਹੁੰਦੀਆਂ ਹਨ। ਡਿਵੈਲਪਰ ਇੱਕ ਘੱਟ-ਡਿਟੇਲ ਮੋਡ ਦੀ ਮੰਗ ਕਰ ਸਕਦੇ ਹਨ ਜੋ 512 × 512 ਸਾਈਜ਼ ਨੂੰ ਲਾਗੂ ਕਰਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਟੋਕਨ ਦੀ ਵਰਤੋਂ ਹੋਰ ਘਟ ਜਾਂਦੀ ਹੈ।
  • ਟੋਕਨ ਸੀਲਿੰਗ – ਅਸਲ ਰੈਜ਼ੋਲਿਊਸ਼ਨ ਦੀ ਪਰਵਾਹ ਕੀਤੇ ਬਿਨਾਂ, ਮਾਡਲ ਹਰ ਤਸਵੀਰ ਲਈ 384 ਟੋਕਨਾਂ ਤੋਂ ਵੱਧ ਨਹੀਂ ਲੈਂਦਾ, ਜਿਸ ਨਾਲ ਬਜਟ ਬਣਾਉਣਾ ਆਸਾਨ ਹੋ ਜਾਂਦਾ ਹੈ।

DeepSeek ਨੇ ਆਪਣੇ Harness ਫਰੇਮਵਰਕ ਦਾ ਵਰਜ਼ਨ 0.1.1 ਵੀ ਰਿਲੀਜ਼ ਕੀਤਾ ਹੈ, ਜੋ ਨਵੇਂ ਮਾਡਲ ਨੂੰ ਇਕੱਠਾ ਕਰਦਾ ਹੈ ਅਤੇ OpenAI Chat Completions ਅਤੇ Responses APIs ਦੇ ਨਾਲ-ਨਾਲ Anthropic ਦੇ Messages endpoint ਲਈ ਤਿਆਰ-ਮੇਲਡ ਅਡੈਪਟਰਾਂ ਦੀ ਪੇਸ਼ਕਸ਼ ਕਰਦਾ ਹੈ। ਟੀਮਾਂ ਸਿਰਫ਼ ਕੁਝ ਕੌਂਫਿਗਰੇਸ਼ਨ ਤਬਦੀਲੀਆਂ ਨਾਲ ਮਾਡਲ ਨੂੰ ਮੌਜੂਦਾ ਕੋਡਬੇਸ ਵਿੱਚ ਸ਼ਾਮਲ ਕਰ ਸਕਦੀਆਂ ਹਨ।

ਡਿਵੈਲਪਰਾਂ ਨੂੰ ਕੀ ਮਿਲੇਗਾ

  • ਵਿਆਪਕ ਇਮੇਜ ਸਪੋਰਟ – JPEG, PNG, GIF ਅਤੇ WebP ਨੂੰ ਸਵੀਕਾਰ ਕੀਤਾ ਜਾਂਦਾ ਹੈ, ਅਤੇ ਮਾਡਲ Base64 ਸਟ੍ਰਿੰਗਜ਼, ਪਬਲਿਕ URL (32 MiB ਤੱਕ), ਜਾਂ DeepSeek ਦੇ ਮੁਫ਼ਤ Files API ਰਾਹੀਂ ਡੇਟਾ ਪ੍ਰਾਪਤ ਕਰ ਸਕਦਾ ਹੈ। Files API 64 MiB ਤੱਕ ਦੀ ਇੱਕ ਸਿੰਗਲ ਅਪਲੋਡ ਨੂੰ ਸਟੋਰ ਕਰਦਾ ਹੈ ਅਤੇ ਤੁਹਾਨੂੰ ਕਈ ਟਰਨਾਂ ਵਿੱਚ ID ਰਾਹੀਂ ਇਸ ਨੂੰ ਰੈਫਰੈਂਸ ਕਰਨ ਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਲੰਬੀਆਂ ਗੱਲਬਾਤਾਂ ਵਿੱਚ ਵਾਰ-ਵਾਰ ਅਪਲੋਡ ਕਰਨ ਦੀ ਲੋੜ ਨਹੀਂ ਪੈਂਦੀ।
  • ਹਾਈ-ਵੌਲਯੂਮ ਕੰਟੈਕਸਟ – ਇੱਕ ਸਿੰਗਲ ਰਿਕੁਐਸਟ ਵਿੱਚ 600 ਤਸਵੀਰਾਂ ਤੱਕ ਹੋ ਸਕਦੀਆਂ ਹਨ। ਪ੍ਰਤੀ ਤਸਵੀਰ ਵੱਧ ਤੋਂ ਵੱਧ ਐਜ ਲੈਂਥ (edge length) 8,192 ਪਿਕਸਲ ਹੈ, ਜੋ ਕਿ 4,096 ਪਿਕਸਲ ਤੱਕ ਡਿੱਗ ਜਾਂਦੀ ਹੈ ਜਦੋਂ ਕਿਸੇ ਰਿਕੁਐਸਟ ਵਿੱਚ 15 ਜਾਂ ਇਸ ਤੋਂ ਵੱਧ ਤਸਵੀਰਾਂ ਹੁੰਦੀਆਂ ਹਨ, ਜੋ ਪ੍ਰੋਸੈਸਿੰਗ ਸਮੇਂ ਨੂੰ ਕੰਟਰੋਲ ਵਿੱਚ ਰੱਖਣ ਵਿੱਚ ਮਦਦ ਕਰਦਾ ਹੈ।
  • ਏਜੰਟ-ਰੇਡੀ ਟਾਸਕਸ – ਮਾਡਲ ਨੂੰ "ਏਜੈਂਟਿਕ" ਵਰਕਲੋਡ ਲਈ ਟਿਊਨ ਕੀਤਾ ਗਿਆ ਹੈ: ਗੁੰਝਲਦਾਰ ਦ੍ਰਿਸ਼ਾਂ ਦਾ ਵਰਣਨ ਕਰਨਾ, ਸਕ੍ਰੀਨਸ਼ੌਟ ਤੋਂ ਟੈਕਸਟ ਕੱਢਣਾ, ਅਤੇ ਗੁੰਝਲਦਾਰ ਡਾਇਗ੍ਰਾਮ ਦਾ ਵਿਸ਼ਲੇਸ਼ਣ ਕਰਨਾ। ਕਿਉਂਕਿ ਇਹ V4-Flash ਦੀ ਰੀਜ਼ਨਿੰਗ ਰਫ਼ਤਾਰ ਨੂੰ ਬਰਕਰਾਰ ਰੱਖਦਾ ਹੈ, ਇਹ ਰੋਕ (bottleneck) ਬਣੇ ਬਿਨਾਂ ਵਿਜ਼ੂਅਲ ਸੰਕੇਤਾਂ ਨੂੰ ਵਿਆਪਕ ਵਿਚਾਰਾਂ (chains of thought) ਵਿੱਚ ਜੋੜ ਸਕਦਾ ਹੈ।

ਇਹ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਡਿਵੈਲਪਰਾਂ ਦੀਆਂ ਆਮ ਮੁਸ਼ਕਲਾਂ ਨੂੰ ਹੱਲ ਕਰਦੀਆਂ ਹਨ: ਇੱਕ ਸੈਸ਼ਨ ਵਿੱਚ ਕਈ ਤਸਵੀਰਾਂ ਨੂੰ ਸੰਭਾਲਣਾ, ਟੋਕਨਾਂ ਦੀ ਬਹੁਤ ਜ਼ਿਆਦਾ ਵਰਤੋਂ ਤੋਂ ਬਚਣਾ, ਅਤੇ API ਕਾਲਾਂ ਨੂੰ ਦੁਬਾਰਾ ਲਿਖੇ ਬਿਨਾਂ ਵਿਜ਼ਨ ਨੂੰ ਜੋੜਨਾ।

ਸੰਭਾਵੀ ਸੀਮਾਵਾਂ

DeepSeek ਦਾ ਪ੍ਰਦਰਸ਼ਨ ਦਾ ਦਾਅਵਾ ਅੰਦਰੂਨੀ ਮਲਟੀਮੋਡਲ ਏਜੰਟ ਬੈਂਚਮਾਰਕਸ 'ਤੇ ਅਧਾਰਤ ਹੈ। ਉਹ ਟੈਸਟ ਅਸਲ ਦੁਨੀਆ ਦੀ ਭਿੰਨਤਾ—ਜਿਵੇਂ ਕਿ ਸ਼ੋਰ ਵਾਲੀਆਂ ਫੋਟੋਆਂ, ਘੱਟ ਰੌਸ਼ਨੀ ਦੀਆਂ ਸਥਿਤੀਆਂ, ਜਾਂ ਅਜੀਬ ਫਾਈਲ ਫਾਰਮੈਟ—ਨੂੰ ਮਿਸ ਕਰ ਸਕਦੇ ਹਨ। "ਪ੍ਰਯੋਗਸ਼ੀਲ" (experimental) ਲੇਬਲ ਇਹ ਵੀ ਸੰਕੇਤ ਦਿੰਦਾ ਹੈ ਕਿ ਮਾਡਲ ਅਜੇ ਵੀ ਸਥਿਰਤਾ ਅਤੇ ਸਕੈਲਿੰਗ ਦੀਆਂ ਸਮੱਸਿਆਵਾਂ ਨੂੰ ਸੁਲਝਾ ਰਿਹਾ ਹੋ ਸਕਦਾ ਹੈ।

V4-Flash ਵਰਗੇ ਰਫ਼ਤਾਰ-ਪਹਿਲ ਵਾਲੇ ਡਿਜ਼ਾਈਨ ਆਮ ਤੌਰ 'ਤੇ ਉਸ ਡੂੰਘਾਈ ਦਾ ਕੁਰਬਾਨੀ ਦਿੰਦੇ ਹਨ ਜੋ ਵੱਡੇ ਅਤੇ ਹੌਲੀ ਮਾਡਲ ਪ੍ਰਾਪਤ ਕਰਦੇ ਹਨ। ਟੋਕਨ ਸੀਲਿੰਗ ਲਾਗਤ ਨੂੰ ਘੱਟ ਰੱਖਦੀ ਹੈ ਪਰ ਵਿਜ਼ੂਅਲ ਡਿਟੇਲ ਨੂੰ ਸੀਮਤ ਕਰਦੀ ਹੈ, ਜੋ ਕਿ ਉਹਨਾਂ ਕੰਮਾਂ ਨੂੰ ਨੁਕਸਾਨ ਪਹੁੰਚਾ ਸਕਦੀ ਹੈ ਜਿਨ੍ਹਾਂ ਲਈ ਬਾਰੀਕ ਵਿਸ਼ਲੇਸ਼ਣ (ਜਿਵੇਂ ਕਿ ਬਹੁਤ ਛੋਟੇ ਫੋਂਟ ਪੜ੍ਹਨਾ ਜਾਂ ਬਰੀਕ ਟੈਕਸਚਰ ਦੇ ਅੰਤਰ ਨੂੰ ਪਛਾਣਨਾ) ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ।

ਅੰਤ ਵਿੱਚ, ਈਕੋਸਿਸਟਮ ਲੌਕ-ਇਨ (ecosystem lock-in) ਇੱਕ ਵਿਚਾਰ ਬਣਿਆ ਹੋਇਆ ਹੈ। ਹਾਲਾਂਕਿ DeepSeek, OpenAI ਅਤੇ Anthropic API ਦੇ ਰੂਪਾਂ ਦੀ ਨਕਲ ਕਰਦਾ ਹੈ, ਫਿਰ ਵੀ ਡਿਵੈਲਪਰਾਂ ਨੂੰ ਇੱਕ ਵੱਖਰੇ

  • ਸੁਤੰਤਰ ਮੁਲਾਂਕਣ – ਤੀਜੀ-ਪੱਖੀ ਬੈਂਚਮਾਰਕਸ “near-Opus 4.8” ਦੇ ਦਾਅਵੇ ਦਾ ਪਹਿਲਾ ਅਸਲੀ ਟੈਸਟ ਹੋਣਗੇ। VQAv2 ਜਾਂ CLEVR ਵਰਗੇ ਜਨਤਕ ਡੇਟਾਸੈਟਾਂ 'ਤੇ ਅਜਿਹੇ ਨਤੀਜਿਆਂ ਦੀ ਉਮੀਦ ਰੱਖੋ ਜੋ ਤਰਕ (reasoning) ਅਤੇ ਵਿਜ਼ੂਅਲ ਫਿਡੈਲਿਟੀ (visual fidelity) ਦੋਵਾਂ 'ਤੇ ਜ਼ੋਰ ਦਿੰਦੇ ਹੋਣ।
  • ਕੀਮਤਾਂ ਵਿੱਚ ਅਪਡੇਟਸ – DeepSeek ਟੋਕਨ ਕੁਸ਼ਲਤਾ 'ਤੇ ਜ਼ੋਰ ਦਿੰਦਾ ਹੈ, ਪਰ 384-ਟੋਕਨ ਵਾਲੀ ਤਸਵੀਰ ਦੀ ਅਸਲ ਲਾਗਤ ਇਹ ਤੈਅ ਕਰੇਗੀ ਕਿ ਕੀ ਇਹ ਮਾਡਲ ਸੱਚਮੁੱਚ ਮੁਕਾਬਲੇਬਾਜ਼ਾਂ ਨਾਲੋਂ ਸਸਤਾ ਹੈ।
  • ਫੀਚਰ ਰੋਲ-ਆਊਟਸ – ਭਵਿੱਖ ਵਿੱਚ Harness ਦੀਆਂ ਰਿਲੀਜ਼ਾਂ ਵਿੱਚ ਬੈਚ ਪ੍ਰੋਸੈਸਿੰਗ, ਸਟ੍ਰੀਮਿੰਗ ਆਊਟਪੁੱਟਸ, ਜਾਂ ਪ੍ਰਸਿੱਧ ਏਜੰਟ ਆਰਕੈਸਟ੍ਰੇਸ਼ਨ ਟੂਲਜ਼ ਨਾਲ ਬਿਹਤਰ ਇੰਟੀਗ੍ਰੇਸ਼ਨ ਜੋੜਿਆ ਜਾ ਸਕਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਮਾਡਲ ਦੀ ਉਪਯੋਗਤਾ ਵਧੇਗੀ।
  • ਕਮਿਊਨਿਟੀ ਅਪਣਾਉਣਾ – ਡਿਵੈਲਪਰ ਕਿਸ ਰਫ਼ਤਾਰ ਨਾਲ ਪਲੱਗਇਨ, ਵੈਪਰਜ਼ ਜਾਂ ਕੇਸ ਸਟੱਡੀਜ਼ ਪ੍ਰਕਾਸ਼ਿਤ ਕਰਦੇ ਹਨ, ਇਸ ਤੋਂ ਪਤਾ ਲੱਗੇਗਾ ਕਿ ਕੀ ਮਾਡਲ ਦੀ API ਅਨੁਕੂਲਤਾ ਅਸਲ ਵਰਤੋਂ ਵਿੱਚ ਬਦਲਦੀ ਹੈ।

ਸਿੱਟਾ

DeepSeek ਦਾ V4-Flash-Vision-Exp ਬਾਜ਼ਾਰ ਵਿੱਚ ਇੱਕ ਤੇਜ਼ ਅਤੇ ਟੋਕਨ-ਕੁਸ਼ਲ ਮਲਟੀਮੋਡਲ ਏਜੰਟ ਲੈ ਕੇ ਆਇਆ ਹੈ, ਜੋ Anthropic ਦੇ Opus 4.8 ਦੇ ਨੇੜੇ ਪ੍ਰਦਰਸ਼ਨ ਦਾ ਦਾਅਵਾ ਕਰਦਾ ਹੈ। ਜੇਕਰ ਅੰਦਰੂਨੀ ਬੈਂਚਮਾਰਕਸ ਸਹੀ ਸਾਬਤ ਹੁੰਦੇ ਹਨ, ਤਾਂ ਇਹ ਉਨ੍ਹਾਂ ਡਿਵੈਲਪਰਾਂ ਲਈ ਇੱਕ ਮਨਪਸੰਦ ਵਿਕਲਪ ਬਣ ਸਕਦਾ ਹੈ ਜਿਨ੍ਹਾਂ ਨੂੰ ਫਰੰਟੀਅਰ-ਸਕੇਲ ਮਾਡਲਾਂ ਦੀ ਮਹਿੰਗੀ ਕੀਮਤ ਤੋਂ ਬਿਨਾਂ ਵਿਜ਼ਨ ਦੀ ਲੋੜ ਹੈ, ਭਾਵੇਂ ਕਿ ਇਸ ਨੂੰ ਪ੍ਰਯੋਗਿਕ ਅਤੇ ਗਤੀ-ਕੇਂਦਰਿਤ AI ਦੇ ਆਮ ਸਮਝੌਤਿਆਂ ਨਾਲ ਨਜਿੱਠਣਾ ਪਵੇਗਾ।