Anthropic Claude Opus 5 சிறந்த செயல்திறனுடன் Fable 5-க்கு சவால் விடுக்கிறது

Claude Opus 5-ன் வெளியீட்டுடன், Anthropic அதிகாரப்பூர்வமாக ஒரு புதிய எல்லை மாதிரிக் (frontier modeling) யுகத்திற்குள் நுழைந்துள்ளது. இது அதன் முதன்மைப் போட்டியாளர்களை விட கணிசமாகக் குறைந்த விலையில் உயர்தர நுண்ணறிவை வழங்கும் ஒரு மாதிரியாகும். பல முக்கியமான அளவுகோல்களில் (benchmarks) Claude Fable 5 மற்றும் GPT-5.6 Sol ஆகியவற்றின் செயல்திறனுக்கு இணையாக அல்லது அதைவிட மேலாகச் செயல்படுவதன் மூலம், Opus 5 மேம்பட்ட AI பகுத்தறிவின் (reasoning) பொருளாதாரத்தை மறுவடிவமைப்பு செய்து வருகிறது.

கோடிங் மற்றும் அறிவுசார் பணிகளில் ஆதிக்கம்

Claude Opus 5, குறிப்பாக மென்பொருள் பொறியியல் மற்றும் அலுவலகத் தானியங்கி (office automation) போன்ற சிறப்புத் துறைகளில் ஒரு வலிமையான சக்தியாக தன்னை நிலைநிறுத்திக் கொண்டுள்ளது. கோடிங், அறிவியல் ரீதியான பகுத்தறிவு மற்றும் உண்மைத் துல்லியம் ஆகியவற்றை உள்ளடக்கிய விரிவான அளவீடான Artificial Analysis Intelligence Index-இல், Opus 5 61 என்ற முன்னணியில் உள்ள மதிப்பெண்ணைப் பெற்று, Claude Fable 5 (60) மற்றும் GPT-5.6 Sol (59) ஆகியவற்றை முந்தியது.

தன்னாட்சி பொறியியல் (autonomous engineering) துறையில், Claude Code உடன் இணைந்த Opus 5, Coding Agent Index-இல் 67 புள்ளிகளுடன் முதலிடத்தைப் பகிர்ந்து கொள்கிறது. இது Terminal-Bench v2.1-இல் 89% என்ற ஈர்க்கக்கூடிய மதிப்பெண்ணைப் பெற்று, முந்தையத் தொழில்முறைத் தலைவரான GPT-5.6 Sol-க்கு இணையாகச் செயல்பட்டுள்ளது. மேலும், அலுவலகம் சார்ந்த பணிகளில் இந்த மாதிரி நிகரற்ற ஆதிக்கத்தைக் காட்டுகிறது. ஆராய்ச்சி, விளக்கக்காட்சி (presentation) மற்றும் ஸ்பிரெட்ஷீட் பகுப்பாய்வு ஆகியவற்றை அளவிடும் AA-Briefcase benchmark-இல், Opus 5 1720 Elo மதிப்பெண்ணை எட்டியது, இது Fable 5-ஐ விட 146 புள்ளிகள் அதிகம் ஆகும்.

செயல்திறன் முரண்பாடு: ஏன் "High" என்பது "Max"-ஐ விடச் சிறந்தது

டெவலப்பர்களுக்கான மிக முக்கியமான கண்டுபிடிப்புகளில் ஒன்று, பகுத்தறிவு நிலைகளுக்கும் (reasoning tiers) உண்மையான பயன்பாட்டிற்கும் இடையிலான உறவாகும். Anthropic "low" முதல் "max" வரையிலான நிலைகளை வழங்கினாலும், மிக உயர்ந்த பகுத்தறிவு நிலைகள் நடைமுறைச் செயல்பாட்டிற்கு எப்போதும் மிகவும் பயனுள்ளதாக இருப்பதில்லை என்று தரவுகள் தெரிவிக்கின்றன.

Vals.ai மூலம் Vibe Code Bench-இல் நடத்தப்பட்ட சோதனையில், செயல்திறன் சிக்கலானமையைப் பொறுத்து அதிகரித்தாலும், "high" நிலை பெரும்பாலும் மிகவும் நம்பகமான மற்றும் எளிமையான தீர்வுகளை உருவாக்குகிறது என்பது தெரியவந்துள்ளது. இதற்கு நேர்மாறாக, "max" மற்றும் "xhigh" நிலைகள் பிழைகளுக்கு வாய்ப்புள்ள சிக்கலான தீர்வுகளை உருவாக்கும் போக்கைக் கொண்டுள்ளன. இது Terminal-Bench 2.1-இலும் பிரதிபலிக்கிறது; அங்கு "high" நிலை "max"-ஐ விடச் சிறப்பாகச் செயல்படுகிறது, ஏனெனில் "max" நிலை ஒருமுறை முயற்சிப்பதிலேயே அதிக நேரத்தைச் செலவிடுவதால், வேலையை முடிப்பதற்கு முன்பே கால வரம்பு முடிந்துவிடுகிறது. பெரும்பாலான உற்பத்தி பயன்பாடுகளுக்கு (production use cases), "high" நிலை என்பது நம்பகத்தன்மை மற்றும் செலவுத் திறன் ஆகியவற்றின் சரியான சமநிலையாக (sweet spot) உள்ளது.

செலவு குறைந்த எல்லை நுண்ணறிவு

Claude Opus 5-இன் மிகவும் புரட்சிகரமான அம்சம் அதன் நுண்ணறிவுக்கு ஏற்ற விலை நிர்ணயக் கட்டமைப்பாகும். AA-Briefcase பணிகளில், "max" பகுத்தறிவுடன் கூடிய Opus 5 ஒரு பணிக்கு தோராயமாக $17.79 செலவாகிறது, இது Fable 5-இன் $22.30-ஐ விட 20% குறைவு. "high" நிலையைத் தேர்ந்தெடுக்கும் பயனர்களுக்கு, செலவு வெறும் $10.41 ஆகக் குறைகிறது—இது அதன் போட்டியாளரின் செலவில் பாதியைக் காட்டிலும் குறைவு, அதே சமயம் சிறந்த Elo தரவரிசையைத் தக்க வைத்துக் கொள்கிறது.

Anthropic ஒரு போட்டித்தன்மை வாய்ந்த டோக்கன் விலை மாதிரியைப் பராமரித்துள்ளது:

  • Input tokens: மில்லியன்த்திற்கு $5
  • Output tokens: மில்லியன்த்திற்கு $25
  • Cache hits: மில்லியன் டோக்கன்களுக்கு $0.50

நெருங்கி வரும் எல்லை

அதன் வெற்றிகளுக்கு மத்தியிலும், Opus 5-இல் குறைகள் உள்ளன. உண்மைத் துல்லியம் இன்னும் ஒரு சவாலாகவே உள்ளது; AA-Omniscience benchmark-இல், இந்த மாதிரி Fable 5-ஐ விடப் பின்தங்கியுள்ளது மற்றும் நிச்சயமற்ற நிலையில் அடிக்கடி பதிலளிக்க முயற்சிப்பதால், அதன் மாயத்தோற்ற விகிதம் (hallucination rate) 50% ஆக அதிகரித்துள்ளது.

Opus 5, Fable 5 மற்றும் GPT-5 தொடர்களுக்கு இடையிலான மிகக் குறுகிய இடைவெளிகள், சந்தை வேகமாக முதிர்ச்சியடைந்து வருவதைக் காட்டுகின்றன. அறிவியல் ரீதியான பகுத்தறிவு மற்றும் கோடிங் ஆகியவற்றில் செயல்திறன் இடைவெளிகள் குறையும் போது, AI தொழில் ஒரு பொதுவானப் பொருளாக மாறும் (commoditization) காலத்தை நோக்கி நகர்கிறது; அங்கு செயல்திறன், செலவு மற்றும் சிறப்புப் பணிப்பாய்வு ஒருங்கிணைப்பு (specialized workflow integration) ஆகியவை முதன்மையான வேறுபடுத்திக் காட்டும் காரணிகளாக மாறும்.

முக்கியக் குறிப்புகள்

  • சிறந்த சிறப்புச் செயல்திறன்: அறிவுசார் பணிகளில் (AA-Briefcase Elo 1720) Opus 5 முன்னணியில் உள்ளது மற்றும் கோடிங் ஏஜென்ட் அளவுகோல்களில் முதலிடத்தைப் பகிர்ந்து கொள்கிறது.
  • மேம்படுத்தப்பட்ட பகுத்தறிவு நிலைகள்: கோடிங் மற்றும் டெர்மினல் பணிகளுக்கு "high" பகுத்தறிவு நிலை மிகவும் நம்பகமான மற்றும் செலவு குறைந்த அமைப்பாகக் கண்டறியப்பட்டுள்ளது, இது பெரும்பாலும் "max" நிலையை விடச் சிறப்பாகச் செயல்படுகிறது.
  • புரட்சிகரமான பொருளாதாரக் கணக்கீடு: Claude Fable 5 உடன் ஒப்பிடும்போது, Opus 5 ஒரு பணிக்கு கணிசமாகக் குறைந்த செலவில் எல்லை அளவிலான நுண்ணறிவை வழங்குகிறது.