மூன்று கடினமான தூண்டுதல்களில் (prompts)—ஒரு நிகழ்தகவுப் பிரச்சனை, ஒரு புல்லி-நிலைமத் தன்மை (pulley-inertia) சூழல் மற்றும் ஒரு சிக்கலான Python பேக்பேக் ஸ்கிரிப்ட்—Kimi K3 தனது ஆற்றலை இழந்து நின்றது, ஆனால் GPT-5.6-SOL வெற்றிகரமாக முடித்தது. பல படிநிலைகளைக் கொண்ட கணிதம், இயற்பியல் மற்றும் குறியீடுகளைத் தடையின்றி பகுத்தறியக்கூடிய ஒரு மாடல் தேவைப்படும்போது, டோக்கன் பட்ஜெட் (token budgeting) மற்றும் தாமதம் (latency) ஏன் முக்கியம் என்பதை இந்த இடைவெளி காட்டுகிறது.
இந்த பெஞ்ச்மார்க் ஏன் முக்கியமானது
டெவலப்பர்களும் ஆராய்ச்சியாளர்களும் பெரும்பாலும் ஒரு LLM-ஐ அதன் தலைப்புச் செய்திகளில் வரும் மதிப்பெண்களைக் கொண்டே தேர்ந்தெடுக்கிறார்கள், நிஜ உலக அழுத்தத்தில் அது எவ்வாறு செயல்படுகிறது என்பதைக் கொண்டு அல்ல. இந்த ஒப்பீட்டுச் சோதனையில், ஒவ்வொரு மாடலும் நீண்ட தொடர்ச்சியான பகுத்தறிவை (reasoning) கோரும் ஒரு சிக்கலைத் தீர்க்க முயன்றன. GPT-5.6-SOL மூன்று துறைகளிலும் முழுமையான, சரியான பதில்களை வழங்கியது; Kimi K3 பயனுள்ள எதையும் வழங்குவதற்கு முன்பே தனது டோக்கன் பட்ஜெட்டைத் தீர்த்துவிட்டது அல்லது காலாவதியானது (timed out).
சோதனை அமைப்பு
- கணிதம் – ஒரு பேட்டர்ன்-ஓவர்லேப் நிகழ்தகவைக் கணக்கிட வேண்டியிருந்ததோடு, எதிர்பார்ப்பு (expectation) மற்றும் மாறுபாடு (variance - second moments) ஆகிய இரண்டையும் கணக்கிட வேண்டிய ஒரு நிகழ்தகவு கேள்வி.
- இயற்பியல் – ஒரு புல்லியின் நிலைமத் தன்மையை (inertia) மாதிரியாக்குதல் மற்றும் ஒரு ஸ்பிரிங்-டென்ஷன் செய்யப்பட்ட கேபிள் தளர்வடையும் போது ஏற்படும் ஆற்றல் இழையைக் கணக்கிடுதல்.
- புரோகிராமிங் – சிக்கலான சார்புகள் (dependencies) மற்றும் டை-பிரேக் விதிகளைக் கொண்ட ஒரு பேக்பேக்-பேக்கிங் பிரச்சனைக்கான Python தீர்வை எழுதுதல், பின்னர் ஆறு தனித்தனி சோதனைத் தரவுகளுடன் (test cases) வெளியீட்டைச் சரிபார்த்தல்.
புள்ளிவிவரங்கள் என்ன சொல்கின்றன
GPT-5.6-SOL
- கணிதம் – எதிர்பார்ப்பு மதிப்பு மற்றும் மாறுபாட்டைத் தெளிவாகக் காட்டியபடி ஒரு முழுமையான, சரியான தீர்வை வழங்கியது.
- இயற்பியல் – நிலைமத் தன்மை மாதிரியைச் சரியாக உருவாக்கி, ஆற்றல் இழையையும் கணக்கில் கொண்டு வந்தது, இது பகுப்பாய்வு விடையுடன் (analytical answer) ஒத்துப்போயது.
- புரோகிராமிங் – கம்பைல் (compile) செய்யப்பட்டு, இயங்கி, ஆறு வெளிப்புறச் சோதனைகளையும் தேர்ச்சி பெற்ற குறியீட்டை உருவாக்கியது. ஒரு உட்புற சோதனை உறுதிப்பாடு (internal test assertion) தவறாக இருந்தது, இது மாடல் மூலம் உருவாக்கப்பட்ட சோதனைகள் பிழையற்றவை அல்ல என்பதை நமக்கு நினைவூட்டுகிறது.
Kimi K3
- கணிதம் – தனது டோக்கன் வரம்பை (முதலில் 6,500 டோக்கன்களிலும், பின்னர் 10,000 டோக்கன்களிலும்) எட்டியது மற்றும் எந்தப் பதிலையும் காட்டாமல் நின்றுவிட்டது.
- இயற்பியல் – எந்த வெளியீடும் தெரிவதற்கு முன்பே டோக்கன்கள் தீர்ந்துவிட்டன.
- புரோகிராமிங் – 245 வினாடிகளுக்குப் பிறகு காலாவதியானது (timed out), மதிப்பீடு செய்ய எதையும் வழங்கவில்லை.
பகுத்தறிவுத் திறன் vs. மூல ஆற்றல்
உற்பத்திப் பாதைகளை (production pipelines) உருவாக்கும் எவருக்கும் இதன் தாக்கம் தெளிவானது: வெளியீட்டை வழங்காமல் டோக்கன்களை மட்டும் செலவழிக்கும் ஒரு மாடல், அடுத்தடுத்த செயல்முறைகளைத் தடையடையச் செய்யலாம், செலவுகளை அதிகரிக்கலாம் மற்றும் பயனர்களைக் கவலையடையச் செய்யலாம்.
நம்பகத்தன்மை மற்றும் "முழுமையான" குறியீட்டின் மறைமுகச் செலவு
வெற்றி பெற்ற மாடலும் தவறிவிட்டது: GPT-5.6-SOL தானாக உருவாக்கிய சோதனைத் தரவில் ஒரு தவறான உறுதிப்பாடு (assertion) இருந்தது. மாடல் மூலம் உருவாக்கப்படும் சரிபார்ப்பு (validation), மனித ஆய்வுக்கு மாற்றாகாது என்பதை இது காட்டுகிறது. ஒரு மாடல் குறியீட்டை எழுதும்போது, நீங்கள் இன்னும் தனித்தனிச் சோதனைகளைச் செய்ய வேண்டியது அவசியம்.
அடுத்து கவனிக்க வேண்டியவை
- முடிவுக்கான காரணத்தைக் கண்காணித்தல் (Finish reason tracking) – ஒரு பதில் டோக்கன் வரம்பை எட்டியதால், காலாவதியானதால் அல்லது இயல்பான நிறுத்தத்தினால் முடிவடைந்ததா என்பதைப் பதிவு செய்தல்.
- பகுத்தறிவு டோக்கன் எண்ணிக்கை (Reasoning token count) – ஒவ்வொரு மாடலும் இறுதி வெளியீட்டிற்குப் பதிலாகத் தனது உட்புறச் சிந்தனைக்காக (internal deliberation) எத்தனை டோக்கன்களைச் செலவிடுகிறது என்பதை ஒப்பிடுதல்.
- தாமதத்தைக் கண்காணித்தல் (Latency monitoring) – ஒவ்வொரு படிநிலைக்கும் எடுத்துக்கொள்ளும் நேரத்தை அளவிடுதல்; ஒரு கேள்விக்கு பல நிமிடங்கள் எடுத்துக்கொள்ளும் மாடல், ஊடாடும் செயலிகளுக்கு (interactive apps) பொருத்தமற்றதாக இருக்கலாம்.
டெவலப்பர்கள் இந்த அளவீடுகளை (metrics) வெறும் இறுதி விடையாக மட்டும் பார்க்காமல், முதன்மையான சமிக்ஞைகளாகக் கருத வேண்டும்.
சுருக்கம்
முழுமையின் அடிப்படையில் GPT-5.6-SOL, Kimi K3-ஐ விடச் சிறப்பாகச் செயல்படுகிறது. "சரியான விடையைத் தரும்" ஒரு மாடல் கூட பிழையான உட்புறச் சோதனைகளை உருவாக்கக்கூடும் என்பதை இந்தச் சோதனை நமக்கு நினைவூட்டுகிறது, எனவே மனித மேற்பார்வை அவசியமானது. முடிவுக்கான காரணங்கள், டோக்கன் பயன்பாடு மற்றும் தாமதத்தைக் கண்காணிப்பது, ஒரு மௌனமான காலாவதியில் (silent timeout) சிக்கிக்கொள்ளாமல், உங்கள் வேலைக்குச் சரியான கருவியைத் தேர்ந்தெடுக்க உதவும்.
