Anthropic ਦਾ ਨਵਾਂ ਬੀਟਾ ਹੈਡਰ Claude 3.7 Sonnet ਲਈ ਟੂਲ ਕਾਲਜ਼ (tool calls) ਦੀ ਟੋਕਨ ਲਾਗਤ ਨੂੰ ਲਗਭਗ 14 ਪ੍ਰਤੀਸ਼ਤ ਘਟਾਉਂਦਾ ਹੈ, ਜਿਸ ਨਾਲ AI ਏਜੰਟਾਂ ਦੇ ਮਹੀਨਾਵਾਰ ਬਿੱਲਾਂ ਵਿੱਚ ਮਾਮੂਲੀ ਕਮੀ ਅਤੇ ਲੇਟੈਂਸੀ (latency) ਵਿੱਚ ਥੋੜ੍ਹਾ ਫਾਇਦਾ ਮਿਲਦਾ ਹੈ।
ਟੂਲ ਦੀ ਵਰਤੋਂ ਟੋਕਨਾਂ ਦੀ ਖਪਤ ਕਿਉਂ ਕਰਦੀ ਹੈ
Claude ਨਾਲ ਇੱਕ ਏਜੰਟ ਦੁਆਰਾ ਲਏ ਗਏ ਹਰ ਮੋੜ (turn) ਵਿੱਚ ਤਿੰਨ ਟੋਕਨ-ਅਧਾਰਿਤ ਕਦਮ ਸ਼ਾਮਲ ਹੁੰਦੇ ਹਨ:
- ਟੂਲ ਡੈਫੀਨੇਸ਼ਨਜ਼ (Tool definitions) – ਉਹ ਨਾਮ ਅਤੇ JSON ਸਕੀਮਾ ਜੋ ਤੁਸੀਂ ਪ੍ਰੋਂਪਟ ਦੇ ਹਿੱਸੇ ਵਜੋਂ ਭੇਜਦੇ ਹੋ।
- ਟੂਲ ਕਾਲਜ਼ (Tool calls) – ਉਹ ਸਟ੍ਰਕਚਰਡ ਆਉਟਪੁੱਟ ਜੋ ਮਾਡਲ ਉਦੋਂ ਤਿਆਰ ਕਰਦਾ ਹੈ ਜਦੋਂ ਉਹ ਕਿਸੇ ਟੂਲ ਨੂੰ ਕਾਲ ਕਰਨ ਦਾ ਫੈਸਲਾ ਕਰਦਾ ਹੈ।
- ਟੂਲ ਰਿਜ਼ਲਟਸ (Tool results) – ਉਹ ਡੇਟਾ ਜੋ ਤੁਹਾਡਾ ਕੋਡ ਮਾਡਲ ਨੂੰ ਵਾਪਸ ਭੇਜਦਾ ਹੈ।
ਪਹਿਲਾ ਅਤੇ ਤੀਜਾ ਕਦਮ ਇਨਪੁੱਟ ਟੋਕਨ ਹਨ; ਦੂਜਾ ਕਦਮ ਆਉਟਪੁੱਟ ਟੋਕਨ ਹੈ। ਕਿਉਂਕਿ Claude ਇਨਪੁੱਟ ਨਾਲੋਂ ਆਉਟਪੁੱਟ ਲਈ ਵਧੇਰੇ ਚਾਰਜ ਕਰਦਾ ਹੈ, ਇਸ ਲਈ ਆਉਟਪੁੱਟ ਟੋਕਨਾਂ ਨੂੰ ਘਟਾਉਣ ਨਾਲ ਲਾਗਤ ਘੱਟ ਸਕਦੀ ਹੈ, ਭਾਵੇਂ ਕਿ ਕੁੱਲ ਟੋਕਨਾਂ ਦੀ ਗਿਣਤੀ ਸਮਾਨ ਹੀ ਰਹੇ।
ਬੀਟਾ ਹੈਡਰ
Anthropic ਨੇ token-efficient tool use ਨਾਮ ਦੇ ਇੱਕ ਬੀਟਾ ਫੀਚਰ ਦੀ ਘੋਸ਼ਣਾ ਕੀਤੀ ਹੈ। HTTP ਹੈਡਰ
anthropic-beta: token-efficient-tools-2025-02-19
ਜੋੜਨ ਨਾਲ ਆਪਟੀਮਾਈਜ਼ੇਸ਼ਨ (optimization) ਚਾਲੂ ਹੋ ਜਾਂਦੀ ਹੈ, ਪਰ ਇਹ ਸਿਰਫ਼ ਉਦੋਂ ਹੀ ਕੰਮ ਕਰਦੀ ਹੈ ਜਦੋਂ ਰਿਕਵੈਸਟ Claude 3.7 Sonnet ਲਈ ਹੋਵੇ। ਜੇਕਰ ਹੈਡਰ ਕਿਸੇ ਹੋਰ ਮਾਡਲ ਨੂੰ ਭੇਜਿਆ ਜਾਂਦਾ ਹੈ, ਤਾਂ ਰਿਕਵੈਸਟ ਬਿਨਾਂ ਕਿਸੇ ਬਦਲਾਅ ਦੇ ਅੱਗੇ ਵਧਦੀ ਹੈ; ਹੈਡਰ ਨੂੰ ਬਿਨਾਂ ਕਿਸੇ ਐਰਰ (error) ਦੇ ਨਜ਼ਰਅੰਦਾਜ਼ ਕਰ ਦਿੱਤਾ ਜਾਂਦਾ ਹੈ।
ਇਹ ਆਪਟੀਮਾਈਜ਼ੇਸ਼ਨ ਮਾਡਲ ਦੇ ਟੂਲ-ਕਾਲ ਆਉਟਪੁੱਟ ਨੂੰ ਕੰਪਰੈੱਸ (compress) ਕਰਕੇ ਕੰਮ ਕਰਦੀ ਹੈ, ਜਿਸ ਨਾਲ ਉਸ ਕਦਮ ਲਈ ਆਉਟਪੁੱਟ ਟੋਕਨਾਂ ਦੀ ਗਿਣਤੀ ਵਿੱਚ ਲਗਭਗ 14 ਪ੍ਰਤੀਸ਼ਤ ਦੀ ਕਮੀ ਆਉਂਦੀ ਹੈ।
ਤੁਸੀਂ ਅਸਲ ਵਿੱਚ ਕਿੰਨੀ ਬਚਤ ਕਰਦੇ ਹੋ
ਆਉਟਪੁੱਟ ਟੋਕਨ ਇਨਪੁੱਟ ਟੋਕਨਾਂ ਨਾਲੋਂ ਮਹਿੰਗੇ ਹੁੰਦੇ ਹਨ, ਇਸ ਲਈ ਉਸ ਹਿੱਸੇ ਵਿੱਚ 14 ਪ੍ਰਤੀਸ਼ਤ ਦੀ ਕਮੀ ਕੁੱਲ ਬਿੱਲ ਵਿੱਚ ਉਸੇ ਅਨੁਪਾਤ ਵਿੱਚ ਗਿਰਾਵਟ ਨਹੀਂ ਲਿਆਉਂਦੀ। ਇੱਕ ਆਮ ਚਾਰ-ਕਦਮਾਂ ਵਾਲੇ ਏਜੰਟ ਲੂਪ ਵਿੱਚ, ਟੂਲ ਡੈਫੀਨੇਸ਼ਨਜ਼ ਅਕਸਰ ਇਨਪੁੱਟ ਲਾਗਤਾਂ ਦਾ ਵੱਡਾ ਹਿੱਸਾ ਹੁੰਦੀਆਂ ਹਨ, ਜੋ ਕਈ ਵਾਰ ਵਰਤੇ ਗਏ ਅੱਧੇ ਟੋਕਨਾਂ ਤੋਂ ਵੀ ਵੱਧ ਹੁੰਦੀਆਂ ਹਨ। ਅਜਿਹੀਆਂ ਸਥਿਤੀਆਂ ਵਿੱਚ, ਆਉਟਪੁੱਟ ਟੋਕਨਾਂ 'ਤੇ 14 ਪ੍ਰਤੀਸ਼ਤ ਦੀ ਬਚਤ ਆਮ ਤੌਰ 'ਤੇ ਕੁੱਲ ਚਾਰਜ ਵਿੱਚ ਸਿਰਫ਼ ਲਗਭਗ 3 ਪ੍ਰਤੀਸ਼ਤ ਦੀ ਕਮੀ ਹੀ ਲਿਆਉਂਦੀ ਹੈ।
ਇਸ ਲਈ, ਬਚਤ ਦਾ ਇਹ ਮੁੱਖ ਅੰਕੜਾ ਮਾਮੂਲੀ ਲੱਗਦਾ ਹੈ, ਪਰ ਇਹ ਬਦਲਾਅ ਬਿਨਾਂ ਕਿਸੇ ਵਾਧੂ ਲਾਗਤ ਦੇ ਆਉਂਦਾ ਹੈ ਅਤੇ ਲੇਟੈਂਸੀ ਵਿੱਚ ਥੋੜ੍ਹਾ ਵਾਧਾ (boost) ਵੀ ਦਿੰਦਾ ਹੈ: ਘੱਟ ਆਉਟਪੁੱਟ ਟੋਕਨਾਂ ਦਾ ਮਤਲਬ ਹੈ ਕਿ ਮਾਡਲ ਜਨਰੇਸ਼ਨ ਦਾ ਕੰਮ ਥੋੜ੍ਹਾ ਜਲਦੀ ਖਤਮ ਕਰ ਲੈਂਦਾ ਹੈ।
ਵੱਧ ਬਚਤ ਲਈ ਵੱਖਰੀਆਂ ਰਣਨੀਤੀਆਂ ਦੀ ਲੋੜ ਹੈ
ਜੇਕਰ ਟੀਚਾ ਖਰਚਿਆਂ ਨੂੰ ਮਹੱਤਵਪੂਰਨ ਰੂਪ ਵਿੱਚ ਘਟਾਉਣਾ ਹੈ, ਤਾਂ ਸਿਰਫ਼ ਹੈਡਰ ਹੀ ਕਾਫ਼ੀ ਨਹੀਂ ਹੋਵੇਗਾ। ਤਿੰਨ ਵਿਹਾਰਕ ਤਰੀਕੇ ਵੱਧ ਫਾਇਦੇ ਦੇ ਸਕਦੇ ਹਨ:
- ਪ੍ਰੋਂਪਟ ਕੈਸ਼ਿੰਗ (Prompt caching) – ਟੂਲ ਡੈਫੀਨੇਸ਼ਨਜ਼ ਨੂੰ ਇੱਕ ਵਾਰ ਸਟੋਰ ਕਰੋ ਅਤੇ ਅਗਲੇ ਕਾਲਾਂ 'ਤੇ ਕੈਸ਼ ਕੀਤੇ ਵਰਜ਼ਨ ਦੀ ਦੁਬਾਰਾ ਵਰਤੋਂ ਕਰੋ। ਕੈਸ਼ ਕੀਤੇ ਰੀਡਸ (reads) ਦੀ ਬਿਲਿੰਗ ਨਵੇਂ ਇਨਪੁੱਟ ਟੋਕਨਾਂ ਨਾਲੋਂ ਘੱਟ ਦਰ 'ਤੇ ਹੁੰਦੀ ਹੈ।
- ਟੂਲ ਸੈੱਟ ਨੂੰ ਘਟਾਓ (Trim the tool set) – ਸਿਰਫ਼ ਉਹਨਾਂ ਟੂਲਸ ਨੂੰ ਸ਼ਾਮਲ ਕਰੋ ਜੋ ਮੌਜੂਦਾ ਕੰਮ ਲਈ ਜ਼ਰੂਰੀ ਹਨ। ਹਰ ਵਾਧੂ ਟੂਲ ਹਰ ਰਿਕਵੈਸਟ ਵਿੱਚ ਆਪਣੀ ਡੈਫੀਨੇਸ਼ਨ ਜੋੜਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਇਨਪੁੱਟ ਲਾਗਤ ਵਧ ਜਾਂਦੀ ਹੈ।
- ਟੂਲ ਰਿਜ਼ਲਟਸ ਨੂੰ ਘੱਟ ਕਰੋ (Slim down tool results) – ਸਿਰਫ਼ ਉਹ ਫੀਲਡਸ ਵਾਪਸ ਭੇਜੋ ਜਿਨ੍ਹਾਂ ਦੀ ਮਾਡਲ ਨੂੰ ਅਸਲ ਵਿੱਚ ਲੋੜ ਹੈ। ਵੱਡੇ API ਰਿਸਪਾਂਸ ਜੋ ਗੱਲਬਾਤ ਵਿੱਚ ਵਾਪਸ ਭੇਜੇ ਜਾਂਦੇ ਹਨ, ਉਹ ਇਨਪੁੱਟ ਟੋਕਨਾਂ ਅਤੇ ਗੱਲਬਾਤ ਦੇ ਇਤਿਹਾਸ (conversation history) ਦੋਵਾਂ ਨੂੰ ਵਧਾ ਦਿੰਦੇ ਹਨ।
ਇਹਨਾਂ ਤਰੀਕਿਆਂ ਨੂੰ ਅਪਣਾਉਣ ਨਾਲ ਕੁੱਲ ਖਰਚੇ ਵਿੱਚ ਕਾਫ਼ੀ ਕਮੀ ਲਿਆਂਦੀ ਜਾ ਸਕਦੀ ਹੈ, ਜੋ ਕਿ ਸਿਰਫ਼ ਬੀਟਾ ਤੋਂ ਮਿਲਣ ਵਾਲੀ 3 ਪ੍ਰਤੀਸ਼ਤ ਬਚਤ ਤੋਂ ਕਿਤੇ ਵੱਧ ਹੈ।
ਕਿਸ ਚੀਜ਼ 'ਤੇ ਨਜ਼ਰ ਰੱਖੀਏ
Anthropic ਨੇ ਇਹ ਨਹੀਂ ਦੱਸਿਆ ਹੈ ਕਿ ਟੋਕਨ-ਐਫੀਸ਼ੀਐਂਟ ਮੋਡ ਕਦੋਂ—ਜਾਂ ਕੀ—ਬੀਟਾ ਤੋਂ ਇੱਕ ਡਿਫਾਲਟ ਫੀਚਰ ਬਣੇਗਾ। ਡਿਵੈਲਪਰਾਂ ਨੂੰ ਭਵਿੱਖ ਦੇ ਐਲਾਨਾਂ 'ਤੇ ਨਜ਼ਰ ਰੱਖਣੀ ਚਾਹੀਦੀ ਹੈ ਜੋ Claude 3.7 Sonnet ਤੋਂ ਅੱਗੇ ਸਹਾਇਤਾ ਦਾ ਵਿਸਤਾਰ ਕਰ ਸਕਦੇ ਹਨ ਜਾਂ ਡੂੰਘੀਆਂ ਟੋਕਨ-ਕੰਪ੍ਰੈਸ਼ਨ ਤਕਨੀਕਾਂ ਲਿਆ ਸਕਦੇ ਹਨ। ਵਰਤੋਂ ਦੇ ਤਰੀਕਿਆਂ ਦੇ ਬਦਲਣ ਦੇ ਨਾਲ, ਪ੍ਰਤੀ-ਰਿਕਵੈਸਟ ਟੋਕਨ ਬ੍ਰੇਕਡਾਊਨ ਦੀ ਨਿਗਰਾਨੀ ਕਰਨ ਨਾਲ ਅਸਲ-ਦੁਨੀਆ ਦੇ ਪ੍ਰਭਾਵ ਨੂੰ ਮਾਪਣ ਵਿੱਚ ਵੀ ਮਦਦ ਮਿਲੇਗੀ।
ਨਿਚੋੜ (Bottom line)
ਬੀਟਾ ਹੈਡਰ ਇੱਕ ਮੁਫ਼ਤ, ਘੱਟ ਮਿਹਨਤ ਵਾਲਾ ਸੁਧਾਰ ਹੈ ਜੋ ਟੂਲ-ਕਾਲ ਆਉਟਪੁੱਟ ਟੋਕਨਾਂ ਨੂੰ ਲਗਭਗ 14 ਪ੍ਰਤੀਸ਼ਤ ਘਟਾਉਂਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਬਿੱਲ ਵਿੱਚ ਮਾਮੂਲੀ ਕਮੀ ਅਤੇ ਗਤੀ ਵਿੱਚ ਥੋੜ੍ਹਾ ਵਾਧਾ ਮਿਲਦਾ ਹੈ। ਉਹਨਾਂ ਲੋਕਾਂ ਲਈ ਜੋ ਪਹਿਲਾਂ ਹੀ ਉੱਚੇ ਏਜੰਟ ਖਰਚਿਆਂ ਨਾਲ ਜੂਝ ਰਹੇ ਹਨ, ਇਹ ਹੈਡਰ ਇੱਕ ਮਦਦਗਾਰ ਐਡ-ਆਨ ਹੈ, ਪਰ ਅਸਲ ਬਚਤ ਪ੍ਰੋਂਪਟ ਕੈਸ਼ਿੰਗ, ਟੂਲ ਐਕਸਪੋਜ਼ਰ ਨੂੰ ਸੀਮਤ ਕਰਨ ਅਤੇ ਘੱਟ ਡੇਟਾ ਵਾਲੇ ਰਿਜ਼ਲਟਸ ਵਾਪਸ ਭੇਜਣ ਨਾਲ ਹੋਵੇਗੀ।
ਸਰੋਤ: https://dev.to/multigrid/token-efficient-tool-use-in-the-claude-api-3j0l
