ਇੱਕ ਇਕੱਲੇ ਖੋਜਕਰਤਾ ਨੇ ਇੱਕ ਮਹੀਨੇ ਲਈ ਆਪਣੇ LLM-driven ਰਿਸਰਚ ਏਜੰਟ ਦੁਆਰਾ ਵਰਤੇ ਗਏ ਹਰ ਟੋਕਨ ਦਾ ਰਿਕਾਰਡ ਰੱਖਿਆ ਅਤੇ ਬਿੱਲ ਵਿੱਚ 31% ਦੀ ਕਟੌਤੀ ਕੀਤੀ। ਖਰਚਾ $945 ਤੋਂ ਘਟ ਕੇ $651 ਹੋ ਗਿਆ ਜਦੋਂ ਕਿ ਸਫਲਤਾ ਦੀ ਦਰ 91% ਤੋਂ ਵਧ ਕੇ 93% ਹੋ ਗਈ, ਇਹ ਇੱਕ ਅਜਿਹਾ ਨਤੀਜਾ ਹੈ ਜਿਸ ਵੱਲ ਲਾਗਤ-ਸੰਵੇਦਨਸ਼ੀਲ AI ਵਰਕਫਲੋ ਚਲਾਉਣ ਵਾਲਾ ਕੋਈ ਵੀ ਧਿਆਨ ਦੇਵੇਗਾ।

ਟੋਕਨ-ਪੱਧਰ ਦਾ ਡੇਟਾ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਸੀ

ਜ਼ਿਆਦਾਤਰ LLM ਉਪਭੋਗਤਾ ਸਿਰਫ਼ ਅੰਤਿਮ ਇਨਵੌਇਸ ਦੇਖਦੇ ਹਨ - ਇੱਕ ਇਕੱਠੀ ਰਕਮ ਜੋ ਹਰੇਕ ਸਬ-ਟਾਸਕ (sub-task) ਦੀ ਲਾਗਤ ਨੂੰ ਛੁਪਾ ਲੈਂਦੀ ਹੈ। ਖੋਜਕਰਤਾ ਦੇ ਏਜੰਟ ਨੇ ਤਿੰਨ ਮੁੱਖ ਕੰਮ ਕੀਤੇ: SEC ਫਾਈਲਾਂ ਦੀ ਖੋਜ ਕਰਨਾ, ਰਿਪੋਰਟਾਂ ਦਾ ਡਰਾਫਟ ਤਿਆਰ ਕਰਨਾ, ਅਤੇ ਰਿਸਰਚ ਸਿੰਥੇਸਿਸ (research syntheses) ਨੂੰ ਜੋੜਨਾ। ਵਿਸਤ੍ਰਿਤ ਡੇਟਾ ਤੋਂ ਬਿਨਾਂ, ਉਹ ਇਹ ਨਹੀਂ ਦੱਸ ਸਕਦਾ ਸੀ ਕਿ ਜੂਨ ਵਿੱਚ ਉਸ ਦੁਆਰਾ ਅਦਾ ਕੀਤੀ ਗਈ $312 ਦੀ ਰਕਮ ਸਹੀ ਤਰ੍ਹਾਂ ਖਰਚ ਕੀਤੀ ਗਈ ਸੀ ਜਾਂ ਨਹੀਂ।

ਲੁਕੀ ਹੋਈ ਨੁਕਸਾਨ ਨੂੰ ਸਾਹਮਣੇ ਲਿਆਉਣ ਲਈ, ਉਸਨੇ ਇੱਕ PostgreSQL ਲੌਗਿੰਗ ਲੇਅਰ ਜੋੜੀ ਜਿਸ ਨੇ ਮਾਡਲ ਦਾ ਨਾਮ, ਟੋਕਨ ਦੀ ਗਿਣਤੀ, ਟਾਸਕ ਦੀ ਕਿਸਮ, ਅਤੇ ਪ੍ਰਤੀ-ਕਾਲ (per-call) ਲਾਗਤ ਨੂੰ ਕੈਪਚਰ ਕੀਤਾ। 30 ਦਿਨਾਂ ਬਾਅਦ ਡੇਟਾ ਨੇ ਇੱਕ ਸਪਸ਼ਟ ਤਸਵੀਰ ਪੇਸ਼ ਕੀਤੀ:

  • SEC ਫਾਈਲਿੰਗ ਸਰਚ – ਕੁੱਲ ਖਰਚ ਦਾ 41%
  • ਰਿਪੋਰਟ ਡਰਾਫਟਿੰਗ – 28%
  • ਰਿਸਰਚ ਸਿੰਥੇਸਿਸ – 17%
  • ਕੁਆਲਿਟੀ ਚੈੱਕ – 9%
  • ਹੋਰ (Miscellaneous) – 5%

ਅੰਕਾਂ ਨੇ ਦਿਖਾਇਆ ਕਿ ਸਭ ਤੋਂ ਮਹਿੰਗਾ ਕਦਮ ਮਾਡਲ ਖੁਦ ਨਹੀਂ ਸੀ, ਸਗੋਂ ਇਹ ਸੀ ਕਿ ਏਜੰਟ ਕਿਵੇਂ ਕੱਚੇ ਸਰਚ ਨਤੀਜਿਆਂ ਨੂੰ ਪ੍ਰੋਂਪਟ (prompts) ਵਿੱਚ ਭਰਦਾ ਸੀ।

ਤਿੰਨ ਸੁਧਾਰ ਜਿਨ੍ਹਾਂ ਨੇ ਬਚਤ ਕੀਤੀ

1. ਪ੍ਰੋਂਪਟ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਸਾਰਾਂਸ਼ (Summarize) ਕਰੋ

ਸ਼ੁਰੂ ਵਿੱਚ ਏਜੰਟ ਹਰੇਕ ਪ੍ਰੋਂਪਟ ਵਿੱਚ 20 ਕੱਚੇ ਸਰਚ ਨਤੀਜੇ ਭਰ ਦਿੰਦਾ ਸੀ, ਜਿਸ ਨਾਲ ਟੋਕਨਾਂ ਦੀ ਗਿਣਤੀ ਬਹੁਤ ਵੱਧ ਜਾਂਦੀ ਸੀ। ਉਸਨੇ ਪਹਿਲਾਂ ਇੱਕ ਸਸਤਾ ਸਮਰਾਈਜ਼ਰ (summarizer) ਲਗਾਇਆ, ਜਿਸ ਨਾਲ ਇਨਪੁਟ ਵਿੱਚ ਭਾਰੀ ਕਟੌਤੀ ਹੋਈ। ਸਰਚ ਟਾਸਕ ਦੀ ਲਾਗਤ $0.84 ਤੋਂ ਘਟ ਕੇ $0.19 ਹੋ ਗਈ – ਜੋ ਕਿ 77% ਦੀ ਕਟੌਤੀ ਹੈ।

2. ਸਧਾਰਨ ਚੈੱਕਾਂ ਨੂੰ ਸਸਤੇ ਮਾਡਲ ਵੱਲ ਭੇਜੋ

ਕੁਆਲਿਟੀ ਚੈੱਕ ਇੱਕ ਹਾਈ-ਐਂਡ ਮਾਡਲ 'ਤੇ ਚੱਲਦੇ ਸਨ ਜਿਸਦੀ ਲਾਗਤ $0.09 ਪ੍ਰਤੀ ਚੈੱਕ ਸੀ। ਉਸਨੇ ਜ਼ਿਆਦਾਤਰ pass/fail ਚੈੱਕਾਂ ਲਈ ਇੱਕ ਘੱਟ ਕੀਮਤ ਵਾਲਾ ਮਾਡਲ ਵਰਤਿਆ, ਜਿਸ ਨਾਲ ਪ੍ਰਤੀ-ਚੈੱਕ ਕੀਮਤ ਘਟ ਕੇ $0.01 ਹੋ ਗਈ। ਸਸਤਾ ਮਾਡਲ 89% ਸਮੇਂ ਸਹੀ ਜਵਾਬ ਦਿੰਦਾ ਸੀ; ਕੋਈ ਵੀ ਅਸਫਲਤਾ ਹੋਣ 'ਤੇ ਉਸਨੂੰ ਅਸਲ ਮਾਡਲ ਕੋਲ ਭੇਜ ਦਿੱਤਾ ਜਾਂਦਾ ਸੀ, ਜਿਸ ਨਾਲ ਸ਼ੁੱਧਤਾ ਬਣੀ ਰਹੀ ਅਤੇ ਲਾਗਤ ਵਿੱਚ 87% ਦੀ ਕਟੌਤੀ ਹੋਈ।

3. ਜਦੋਂ ਭਰੋਸਾ (confidence) ਜ਼ਿਆਦਾ ਹੋਵੇ ਤਾਂ ਚੈੱਕਾਂ ਨੂੰ ਛੱਡ ਦਿਓ

ਉਸਨੇ ਇੱਕ ਨਿਯਮ ਜੋੜਿਆ ਕਿ ਜਦੋਂ ਵੀ ਟਾਸਕ ਦੀ ਇਤਿਹਾਸਕ ਸਫਲਤਾ ਦਰ ਉੱਚੀ ਸੀ ਅਤੇ ਆਉਟਪੁੱਟ ਦੀ ਲੰਬਾਈ ਉਮੀਦ ਕੀਤੇ ਅਨੁਸਾਰ ਸੀ, ਤਾਂ ਕੁਆਲਿਟੀ-ਚੈੱਕ ਸਟੈਪ ਨੂੰ ਬਾਈਪਾਸ (bypass) ਕਰ ਦਿੱਤਾ ਜਾਵੇ। ਇਸ ਨਾਲ ਲਗਭਗ 60% ਚੈੱਕ ਖਤਮ ਹੋ ਗਏ ਜੋ ਕਿ ਫਿਰ ਵੀ ਚੱਲਦੇ ਰਹਿੰਦੇ।

ਫਾਇਦਾ (The payoff)

ਤਿੰਨਾਂ ਤਬਦੀਲੀਆਂ ਦੇ ਲਾਗੂ ਹੋਣ ਨਾਲ, ਮਹੀਨਾਵਾਰ ਖਾਤਾ ਇਸ ਤਰ੍ਹਾਂ ਸੀ:

  • ਕੁੱਲ ਖਰਚ: $945 → $651 (31% ਕਟੌਤੀ)
  • SEC ਸਰਚ ਲਾਗਤ ਪ੍ਰਤੀ ਟਾਸਕ: $0.84 → $0.19 (77% ਕਟੌਤੀ)
  • ਕੁਆਲਿਟੀ-ਚੈੱਕ ਲਾਗਤ ਪ੍ਰਤੀ ਟਾਸਕ: $0.09 → $0.01 (87% ਕਟੌਤੀ)
  • ਕੁੱਲ ਸਫਲਤਾ ਦਰ: 91% → 93%

ਉੱਚੀ ਸਫਲਤਾ ਦਰ ਇਹ ਦਰਸਾਉਂਦੀ ਹੈ ਕਿ ਛੋਟੇ ਪ੍ਰੋਂਪਟਾਂ ਨੇ ਸ਼ੋਰ (noise) ਨੂੰ ਘਟਾਇਆ ਅਤੇ ਮਾਡਲ ਨੂੰ ਮੁੱਖ ਸਵਾਲ 'ਤੇ ਧਿਆਨ ਕੇਂਦਰਿਤ ਕਰਨ ਵਿੱਚ ਮਦਦ ਕੀਤੀ।

ਸਾਵਧਾਨੀਆਂ ਅਤੇ ਵਿਰੋਧੀ ਨੁਕਤੇ

ਇਹ ਪਹੁੰਚ ਦੋ ਅਨੁਮਾਨਾਂ 'ਤੇ ਟਿਕੀ ਹੋਈ ਹੈ। ਪਹਿਲਾ, ਸਸਤਾ ਸਮਰਾਈਜ਼ਰ ਅਗਲੇਰੀ ਤਰਕ (downstream reasoning) ਲਈ ਲੋੜੀਂਦੀ ਜਾਣਕਾਰੀ ਰੱਖਣਾ ਚਾਹੀਦਾ ਹੈ; ਜੇਕਰ ਇਹ ਮਹੱਤਵਪੂਰਨ ਵੇਰਵੇ ਰੱਦ ਕਰ ਦਿੰਦਾ ਹੈ, ਤਾਂ ਆਉਟਪੁੱਟ ਦੀ ਗੁਣਵੱਤਾ ਪ੍ਰਭਾਵਿਤ ਹੋ ਸਕਦੀ ਹੈ। ਦੂਜਾ, ਕੁਆਲਿਟੀ ਚੈੱਕਾਂ ਲਈ ਵਰਤਿਆ ਜਾਣ ਵਾਲਾ ਘੱਟ-ਲਾਗਤ ਵਾਲਾ ਮਾਡਲ ਸੰਪੂਰਨ ਨਹੀਂ ਹੈ; ਇਸਦੀ 89% ਸ਼ੁੱਧਤਾ ਦਾ ਮਤਲਬ ਹੈ ਕਿ ਗਲਤੀਆਂ ਦਾ ਇੱਕ ਛੋਟਾ ਹਿੱਸਾ ਅਜੇ ਵੀ ਅੰਤਿਮ ਉਤਪਾਦ ਤੱਕ ਪਹੁੰਚਦਾ ਹੈ, ਹਾਲਾਂਕਿ ਐਸਕੇਲੇਸ਼ਨ ਪਾਥ (escalation path) ਜ਼ਿਆਦਾਤਰ ਨੂੰ ਫੜ ਲੈਂਦਾ ਹੈ। ਸਖ਼ਤ ਕੰਪਲਾਇੰਸ (compliance) ਲੋੜਾਂ ਵਾਲੇ ਉਪਭੋਗਤਾਵਾਂ ਨੂੰ ਹੋਰ ਸਖ਼ਤ ਥ੍ਰੈਸ਼ਹੋਲਡ ਜਾਂ ਵਾਧੂ ਵੈਲੀਡੇਸ਼ਨ ਸਟੈਪਾਂ ਦੀ ਲੋੜ ਹੋ ਸਕਦੀ ਹੈ।

LLM ਅਭਿਆਸੀਆਂ (practitioners) ਲਈ ਇਸਦਾ ਕੀ ਮਤਲਬ ਹੈ

  • ਵਿਸਤ੍ਰਿਤ (Granular) ਡੈਸ਼ਬੋਰਡ ਜਿੱਤਦੇ ਹਨ। ਉੱਚ-ਪੱਧਰੀ ਖਰਚ ਰਿਪੋਰਟਾਂ ਟੋਕਨ ਦੀ ਬਰਬਾਦੀ ਨੂੰ ਛੁਪਾ ਲੈਂਦੀਆਂ ਹਨ। ਪ੍ਰਤੀ ਟਾਸਕ ਵਰਤੋਂ ਨੂੰ ਰਿਕਾਰਡ ਕਰਨ ਨਾਲ ਉਹ ਅਕੁਸ਼ਲਤਾਵਾਂ ਸਾਹਮਣੇ ਆ ਜਾਂਦੀਆਂ ਹਨ ਜੋ ਨਹੀਂ ਤਾਂ ਲੁਕੀਆਂ ਰਹਿੰਦੀਆਂ।
  • ਫਰੰਟੀਅਰ ਮਾਡਲਾਂ ਦੀ ਹਮੇਸ਼ਾ ਲੋੜ ਨਹੀਂ ਹੁੰਦੀ। ਇੱਕ ਸਸਤਾ ਮਾਡਲ ਸਮੁੱਚੀ ਗੁਣਵੱਤਾ ਨਾਲ ਸਮਝੌਤਾ ਕੀਤੇ ਬਿਨਾਂ ਡੇਟਾ ਨੂੰ ਕੰਪਰੈੱਸ ਕਰ ਸਕਦਾ ਹੈ ਜਾਂ ਸਧਾਰਨ ਬਾਈਨਰੀ ਫੈਸਲੇ ਲੈ ਸਕਦਾ ਹੈ।

ਇੱਕ LLM ਏਜੰਟ ਦੀ ਲੁਕੀ ਹੋਈ ਲਾਗਤ ਅਕਸਰ ਉਹ ਅਣਮਾਪਿਆ ਕੰਮ ਹੁੰਦਾ ਹੈ ਜੋ ਉਹ ਕਰਦਾ ਹੈ। ਟੋਕਨ ਫਲੋ (token flow) ਨੂੰ ਮਾਪ ਕੇ ਅਤੇ ਨਿਸ਼ਾਨੇਬੱਧ ਅਪਟੀਮਾਈਜ਼ੇਸ਼ਨ ਲਾਗੂ ਕਰਕੇ, ਖੋਜਕਰਤਾ ਨੇ $945 ਦੇ ਮਹੀਨਾਵਾਰ ਬਿੱਲ ਨੂੰ $651 ਦੇ ਘੱਟ ਖਰਚੇ ਵਾਲੇ ਕੰਮ ਵਿੱਚ ਬਦਲ ਦਿੱਤਾ ਅਤੇ ਨਾਲ ਹੀ ਪ੍ਰਦਰਸ਼ਨ ਨੂੰ ਵਧਾਇਆ। AI ਵਰਕਲੋਡ ਦਾ ਬਜਟ ਬਣਾਉਣ ਵਾਲੇ ਕਿਸੇ ਵੀ ਵਿਅਕਤੀ ਲਈ, ਸਬਕ ਸਪਸ਼ਟ ਹੈ: ਹਰ ਟੋਕਨ ਨੂੰ ਮਾਪੋ, ਫਿਰ ਡੇਟਾ ਨੂੰ ਇਹ ਦੱਸਣ ਦਿਓ ਕਿ ਕਿੱਥੇ ਕਟੌਤੀ ਕਰਨੀ ਹੈ।