ਕਿਰਾਏ ਦੀ ਬੁੱਧੀ ਤੋਂ ਇੱਕ ਮਾਡਲ ਫੈਕਟਰੀ ਤੱਕ
ਸਾਲਾਂ ਤੋਂ Thomson Reuters ਤੀਜੀ-ਪੱਖੀ ਲੈਬਾਂ ਦੇ ਵਪਾਰਕ ਮਾਡਲਾਂ ਦੀ ਫਾਈਨ-ਟਿਊਨਿੰਗ (fine-tuning) ਕਰਕੇ AI-ਸੰਪੰਨ ਉਤਪਾਦ ਪੇਸ਼ ਕਰ ਰਿਹਾ ਸੀ। ਫਾਈਨ-ਟਿਊਨਿੰਗ ਇੱਕ ਪਹਿਲਾਂ ਤੋਂ ਸਿਖਲਾਈ ਪ੍ਰਾਪਤ ਮਾਡਲ ਲੈਂਦੀ ਹੈ ਅਤੇ ਇੱਕ ਛੋਟੇ ਡੇਟਾ ਸੈੱਟ 'ਤੇ ਇਸਦੇ ਵੇਟਸ (weights) ਵਿੱਚ ਬਦਲਾਅ ਕਰਦੀ ਹੈ, ਪਰ ਇਹ ਮਾਡਲ ਦੀ ਵਿਆਪਕ ਤਰਕ ਸ਼ਕਤੀ ਨੂੰ ਘਟਾ ਦਿੰਦੀ ਹੈ ਅਤੇ ਕੰਪਨੀ ਨੂੰ ਪ੍ਰਦਾਤਾ ਦੀ ਕੀਮਤ ਅਤੇ API ਸੀਮਾਵਾਂ ਨਾਲ ਬੰਨ੍ਹ ਦਿੰਦੀ ਹੈ।
ਹੁਣ ਕੰਪਨੀ AI ਨੂੰ ਇੱਕ ਉਤਪਾਦਨ ਲਾਈਨ ਵਾਂਗ ਮੰਨਦੀ ਹੈ। ਪਿਛਲੇ ਦੋ ਸਾਲਾਂ ਵਿੱਚ ਇਸਨੇ ਇੰਜੀਨੀਅਰਾਂ, ਡੇਟਾ ਵਿਗਿਆਨੀਆਂ ਅਤੇ ਕੰਪਿਊਟ ਸਪੈਸ਼ਲਿਸਟਾਂ ਨੂੰ ਨੌਕਰੀ 'ਤੇ ਰੱਖਿਆ ਹੈ, ਅਤੇ ਓਪਨ-ਸੋਰਸ Qwen ਸੀਰੀਜ਼—Alibaba ਦੇ Qwen ਆਰਕੀਟੈਕਚਰ—ਤੋਂ ਇੱਕ ਮਾਡਲ ਨੂੰ ਸਿਖਲਾਈ ਦੇਣ ਲਈ ਕਲਾਊਡ GPU ਸਮੇਂ ਅਤੇ ਆਨ-ਪ੍ਰੇਮ (on-prem) ਹਾਰਡਵੇਅਰ 'ਤੇ $40 ਮਿਲੀਅਨ ਖਰਚ ਕੀਤੇ ਹਨ। ਓਪਨ-ਸੋਰਸ ਦਾ ਮਤਲਬ ਹੈ ਕਿ ਕੋਡ ਅਤੇ ਵੇਟਸ ਜਨਤਕ ਹਨ, ਇਸ ਲਈ Thomson Reuters ਬਿਨਾਂ ਲਾਇਸੈਂਸਿੰਗ ਫੀਸ ਦੇ ਇੱਕ ਮਜ਼ਬੂਤ ਅਧਾਰ ਤੋਂ ਸ਼ੁਰੂਆਤ ਕਰ ਸਕਦਾ ਹੈ।
Imperial College ਦੇ ਨਾਲ ਇੱਕ ਭਾਈਵਾਲੀ ਨੇ ਇੱਕ ਵਿਚਕਾਰਲਾ “Snowdon” ਮਾਡਲ ਤਿਆਰ ਕੀਤਾ, ਜਿਸ ਨੂੰ ਪਹਿਲਾਂ ਸੁਰੱਖਿਆ, ਨੈਤਿਕਤਾ ਅਤੇ ਰਾਜਨੀਤਿਕ ਨਿਰਪੱਖਤਾ ਲਈ ਮੁੜ ਸਿਖਲਾਈ ਦਿੱਤੀ ਗਈ ਸੀ—ਇਹ ਉਹ ਲੋੜਾਂ ਹਨ ਜੋ ਕਿਸੇ ਵੀ LLM ਨੂੰ ਗਾਹਕਾਂ ਤੱਕ ਪਹੁੰਚਣ ਤੋਂ ਪਹਿਲਾਂ ਪੂਰੀਆਂ ਕਰਨੀਆਂ ਚਾਹੀਦੀਆਂ ਹਨ। Snowdon ਤੋਂ ਬਾਅਦ, ਟੀਮ ਨੇ ਮਾਡਲ ਨੂੰ Westlaw, Practical Law, Checkpoint ਅਤੇ Reuters ਖ਼ਬਰਾਂ ਦੇ ਆਰਕਾਈਵਜ਼ ਤੋਂ ਮਲਕੀਅਤ ਵਾਲੀ ਸਮੱਗਰੀ ਦਿੱਤੀ। ਹੁਣ ਤੱਕ ਉਸ ਸਮੱਗਰੀ ਦਾ 10% ਤੋਂ ਵੀ ਘੱਟ ਹਿੱਸਾ ਵਰਤਿਆ ਗਿਆ ਹੈ, ਜਿਸ ਨਾਲ ਹੋਰ ਡੇਟਾ ਸ਼ਾਮਲ ਕੀਤੇ ਜਾਣ 'ਤੇ ਇਸ ਨੂੰ ਵਧਾਉਣ ਲਈ ਕਾਫੀ ਜਗ੍ਹਾ ਬਚੀ ਹੈ। ਅੰਤਿਮ ਕਦਮ ਵਿੱਚ ਏਜੈਂਟਿਕ ਰੀਇਨਫੋਰਸਮੈਂਟ ਲਰਨਿੰਗ (agentic reinforcement learning) ਜੋੜਿਆ ਗਿਆ: ਮਾਡਲ Thomson Reuters ਦੇ ਆਪਣੇ ਟੂਲ ਵਾਤਾਵਰਣਾਂ ਨਾਲ ਗੱਲਬਾਤ ਕਰਦਾ ਹੈ, ਫੀਡਬੈਕ ਪ੍ਰਾਪਤ ਕਰਦਾ ਹੈ, ਅਤੇ ਕਾਰਜ ਪ੍ਰਦਰਸ਼ਨ ਨੂੰ ਸੁਧਾਰਨ ਲਈ ਆਪਣੀ ਨੀਤੀ ਨੂੰ ਅਪਡੇਟ ਕਰਦਾ ਹੈ। ਇਸ ਸੰਦਰਭ ਵਿੱਚ, ਰੀਇਨਫੋਰਸਮੈਂਟ ਲਰਨਿੰਗ ਮਾਡਲ ਨੂੰ ਸਥਿਰ ਉਦਾਹਰਣਾਂ ਦੀ ਬਜਾਏ ਕੋਸ਼ਿਸ਼ ਅਤੇ ਗਲਤੀ (trial and error) ਰਾਹੀਂ ਟੀਚਿਆਂ (ਜਿਵੇਂ ਕਿ ਸਹੀ ਸਿਟੇਸ਼ਨ ਲੱਭਣਾ) ਨੂੰ ਪ੍ਰਾਪਤ ਕਰਨਾ ਸਿਖਾਉਂਦੀ ਹੈ।
ਮਾਡਲ ਦੀ ਪ੍ਰਦਰਸ਼ਨ ਤੁਲਨਾ
Stanford LegalBench—ਕਾਨੂੰਨੀ ਤਰਕ ਟੈਸਟਾਂ ਦੇ ਇੱਕ ਸੂਟ—ਤੇ, ਇਨ-ਹਾਊਸ ਮਾਡਲ ਨੇ 0.823 ਸਕੋਰ ਕੀਤਾ, ਜੋ Harvey Legal Agent Benchmark 'ਤੇ Gemini 3.1 Pro, GPT-5.5 ਅਤੇ Opus 4.8 ਤੋਂ ਪਿੱਛੇ ਹੈ। ਇਹ ਆਮ ਕੋਡਿੰਗ ਅਤੇ ਤਰਕ ਦੀਆਂ ਸਮੱਸਿਆਵਾਂ ਵਿੱਚ ਵੀ ਪਿੱਛੇ ਹੈ, ਜੋ ਇਹ ਦਰਸਾਉਂਦਾ ਹੈ ਕਿ ਇਸਦੀ ਮੂਲ ਤਰਕ ਸ਼ਕਤੀ ਅਜੇ ਵੀ ਉਨ੍ਹਾਂ ਅਗਾਂਵਰ ਲੈਬਾਂ ਨਾਲੋਂ ਕਮਜ਼ੋਰ ਹੈ ਜੋ ਵਿਸ਼ਾਲ, ਆਮ-ਮੰਤਵ ਵਾਲੇ LLMs ਵਿੱਚ ਅਰਬਾਂ ਖਰਚ ਕਰਦੇ ਹਨ।
ਫਾਇਦਾ ਉਦੋਂ ਦਿਖਾਈ ਦਿੰਦਾ ਹੈ ਜਦੋਂ ਮਾਡਲ Thomson Reuters ਦੇ ਵਿਸ਼ੇਸ਼ ਡੇਟਾ ਦੀ ਵਰਤੋਂ ਕਰਦਾ ਹੈ। ਤੱਥਾਂ ਦੀ ਸ਼ੁੱਧਤਾ ਨੂੰ ਮਾਪਦੇ ਇੱਕ Deep Research ਬੈਂਚਮਾਰਕ ਵਿੱਚ, ਮਾਡਲ ਨੇ ਸਿਰਫ ਵੈੱਬ ਐਕਸੈਸ ਨਾਲ 0.53 ਪ੍ਰਾਪਤ ਕੀਤਾ—ਜੋ GPT-5.4 ਦੇ 0.65 ਨਾਲੋਂ ਘੱਟ ਹੈ। ਇਸਦੀ ਅੰਦਰੂਨੀ ਕਾਨੂੰਨੀ ਲਾਇਬ੍ਰੇਰੀਆਂ ਨੂੰ ਜੋੜਨ ਨਾਲ ਸ਼ੁੱਧਤਾ ਵਧ ਕੇ 0.83 ਹੋ ਗਈ, ਜਿਸ ਨਾਲ ਇਹ ਵਪਾਰਕ ਮੁਕਾਬਲੇਬਾਜ਼ ਨੂੰ ਪਿੱਛੇ ਛੱਡ ਦਿੱਤਾ। ਨਤੀਜਾ ਇੱਕ ਜਾਣੇ-ਪਛਾਣੇ ਪੈਟਰਨ ਨੂੰ ਦਰਸਾਉਂਦਾ ਹੈ: ਇੱਕ ਦਰਮਿਆਨੇ ਆਕਾਰ ਦਾ ਮਾਡਲ, ਜਦੋਂ ਖੇਤਰ-ਵਿਸ਼ੇਸ਼ ਗਿਆਨ ਦਿੱਤਾ ਜਾਂਦਾ ਹੈ, ਤਾਂ ਉਹ ਬਹੁਤ ਵੱਡੀਆਂ ਪ੍ਰਣਾਲੀਆਂ ਨੂੰ ਹਰਾ ਸਕਦਾ ਹੈ ਜਿਨ੍ਹਾਂ ਕੋਲ ਉਹ ਵਿਸ਼ੇਸ਼ ਜਾਣਕਾਰੀ ਨਹੀਂ ਹੁੰਦੀ।
"ਮਾਲਕੀ" "ਕਿਰਾਏ" ਨਾਲੋਂ ਕਿਉਂ ਬਿਹਤਰ ਹੈ
CTO Joel Hron ਅਤੇ ਰਿਸਰਚ ਚੀਫ Jonathan Schwartz ਇਸ ਨਿਵੇਸ਼ ਲਈ ਤਿੰਨ ਮੁੱਖ ਥੰਮ੍ਹ ਦੱਸਦੇ ਹਨ:
- ਲਾਗਤ ਅਤੇ ਸਮਰੱਥਾ – ਦਸਤਾਵੇਜ਼ ਦੀ ਸਮੀਖਿਆ ਵਰਗੇ ਉੱਚ-ਵਾਲੀਅਮ ਵਾਲੇ ਕੰਮਾਂ ਨੂੰ ਵਪਾਰਕ API 'ਤੇ ਚਲਾਉਣ ਨਾਲ ਪ੍ਰਤੀ-ਟੋਕਨ ਫੀਸ ਲੱਗਦੀ ਹੈ ਜੋ ਤੇਜ਼ੀ ਨਾਲ ਵਧਦੀ ਜਾਂਦੀ ਹੈ। ਇੱਕ ਸਮਰਪਿਤ, ਛੋਟਾ ਮਾਡਲ ਕਾਨੂੰਨੀ-ਵਿਸ਼ੇਸ਼ ਪ੍ਰਦਰਸ਼ਨ ਨੂੰ ਬਰਕਰਾਰ ਰੱਖਦੇ ਹੋਏ, ਇੱਕ ਹਿੱਸੇ ਦੀ ਕੀਮਤ 'ਤੇ ਉਹੀ ਕੰਮ ਕਰ ਸਕਦਾ ਹੈ।
- ਡੇਟਾ ਪ੍ਰਭੂਸੱਤਾ – Thomson Reuters ਦੀ ਸਭ ਤੋਂ ਕੀਮਤੀ ਸੰਪਤੀ ਇਸਦੀ ਚੁਣਵੀਂ ਕਾਨੂੰਨੀ ਸਮੱਗਰੀ ਹੈ। ਉਸ ਡੇਟਾ ਨੂੰ ਬਾਹਰੀ AI ਪ੍ਰਦਾਤਾ ਨੂੰ ਸੌਂਪਣ ਨਾਲ ਸੁਰੱਖਿਆ ਅਤੇ ਗੁਪਤਤਾ ਦੇ ਜੋਖਮ ਪੈਦਾ ਹੁੰਦੇ ਹਨ ਅਤੇ ਪ੍ਰਦਾਤਾ ਨੂੰ ਇੱਕ ਮੁਕਾਬਲੇਬਾਜ਼ ਲਾਭ ਮਿਲਦਾ ਹੈ। ਡੇਟਾ ਨੂੰ ਇਨ-ਹਾਊਸ ਰੱਖਣਾ ਇਹ ਯਕੀਨੀ ਬਣਾਉਂਦਾ ਹੈ ਕਿ ਸੁਧਾਰ ਨਿੱਜੀ ਰਹਿਣ।
- ਵਧਦੀ ਹੋਈ ਬੌਧਿਕ ਇਕੁਇਟੀ – ਹਰ ਵਾਰ ਜਦੋਂ ਕੋਈ ਵਕੀਲ ਮਾਡਲ ਦੇ ਆਉਟਪੁੱਟ ਦੀ ਸਮੀਖਿਆ ਕਰਦਾ ਹੈ, ਤਾਂ ਉਸ ਗੱਲਬਾਤ ਨੂੰ ਟ੍ਰੇਨਿੰਗ ਡੇਟਾ ਵਜੋਂ ਰਿਕਾਰਡ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ, ਜੋ ਹੌਲੀ-ਹੌਲੀ ਮਾਡਲ ਨੂੰ ਨਿਖਾਰਦਾ ਹੈ। ਸਮੇਂ ਦੇ ਨਾਲ ਕੰਪਨੀ ਇੱਕ ਸਵੈ-ਮਜ਼ਬੂਤ ਹੋਣ ਵਾਲੀ ਸੰਪਤੀ ਬਣਾਉਂਦੀ ਹੈ ਜੋ ਕਿਰਾਇਆ ਦੇਣ ਦੀ ਬਜਾਏ ਜਾਇਦਾਦ ਦੇ ਮਾਲਕ ਹੋਣ ਵਾਂਗ ਵਧਦੀ ਜਾਂਦੀ ਹੈ।
ਪਹਿਲੇ ਵਰਤੋਂ ਦੇ ਮਾਮਲੇ ਅਤੇ ਓਪਨ-ਸੋਰਸ ਨੂੰ ਸਹਿਯੋਗ
ਮਾਡਲ Thomson Reuters ਦੇ CoCounsel Legal suite ਵਿੱਚ ਉਹਨਾਂ ਕੰਮਾਂ ਲਈ ਲਾਗੂ ਕੀਤਾ ਜਾ ਰਿਹਾ ਹੈ ਜਿਨ੍ਹਾਂ ਲਈ ਉੱਚ ਥਰਪੁੱਟ ਅਤੇ ਘੱਟ ਲਾਗਤ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ, ਜਿਵੇਂ ਕਿ Tabular Analysis ਫੀਚਰ ਜੋ ਇਕਰਾਰਨਾਮਿਆਂ ਤੋਂ ਸੰਰਚਿਤ ਡੇਟਾ ਕੱਢਦਾ ਹੈ। ਇਹ ਸਿਟੇਸ਼ਨ-ਚੈਕਿੰਗ (citation-checking) ਨੂੰ ਵੀ ਸੰਭਾਲਦਾ ਹੈ, ਜੋ ਕਾਨੂੰਨੀ ਡਰਾਫਟਿੰਗ ਵਿੱਚ ਇੱਕ ਵਾਰ-ਵਾਰ ਹੋਣ ਵਾਲਾ ਪਰ ਸ਼ੁੱਧਤਾ ਲਈ ਮਹੱਤਵਪੂਰਨ ਕਦਮ ਹੈ।
ਡਿਵੈਲਪਰ ਈਕੋਸਿਸਟਮ ਨੂੰ ਉਤਸ਼ਾਹਿਤ ਕਰਨ ਲਈ, ਇੱਕ ਘੱਟ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਵਾਲਾ ਵਰਜ਼ਨ Hugging Face 'ਤੇ ਗੈਰ-ਵਪਾਰਕ ਲਾਇਸੈਂਸ ਦੇ ਅਧੀਨ ਉਪਲਬਧ ਹੋਵੇਗਾ। ਇਹ ਖੋਜਕਰਤਾਵਾਂ ਅਤੇ ਭਾਈਵਾਲਾਂ ਨੂੰ ਉਸ ਪੂਰੇ, ਮਲਕੀਅਤ ਵਾਲੇ ਮਾਡਲ ਨੂੰ ਪ੍ਰਗਟ ਕੀਤੇ ਬਿਨਾਂ ਪ੍ਰਯੋਗ ਕਰਨ ਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦਾ ਹੈ ਜੋ ਕੰਪਨੀ ਦੇ ਮਾਲੀਆ ਪੈਦਾ ਕਰਨ ਵਾਲੇ ਉਤਪਾਦਾਂ ਨੂੰ ਚਲਾਉਂਦਾ ਹੈ।
