Claude Opus 5 యొక్క “max effort” సెట్టింగ్, ఒక సాధారణ అభ్యర్థన ధరను $0.76 నుండి $19.21కి పెంచుతుంది, కానీ ఇది దాదాపు ఒకే విధమైన ఫంక్షనల్ అవుట్పుట్ను మాత్రమే అందిస్తుంది. ఈ అదనపు ఖర్చు అంతర్గత ఆడిట్ (internal audit) కోసం మాత్రమే ఉపయోగపడుతుంది తప్ప, మెరుగైన పరిష్కారం కోసం కాదు. ఇది కేవలం తక్కువ టెస్ట్ కవరేజ్ ఉన్న పనులలో మాత్రమే కొలవదగిన ఫలితాలను చూపుతుంది.
పరీక్ష ఏమి చూపిస్తుందంటే
ఈ ప్రయోగం రెండు రకాల ప్రాంప్ట్లపై Claude Opus 5 యొక్క డిఫాల్ట్ ఎఫర్ట్ లెవల్ను మరియు “max effort” నాబ్ను (knob) పోల్చి చూసింది: రోజువారీ కోడింగ్ పనులు మరియు కావాలనే కష్టమైన సమస్యలు.
- ఒక సాధారణ టాస్క్ కోసం, తక్కువ ఎఫర్ట్ (low-effort) రన్ రెండు నిమిషాల్లో పూర్తయింది మరియు దీని ఖర్చు $0.76. సెట్టింగ్ను మాక్స్కు (max) పెంచినప్పుడు బిల్లు $19.21కి చేరుకుంది, అయినప్పటికీ రిక్వైర్మెంట్-కవరేజ్ స్కోర్ (requirement-coverage score)—అంటే మోడల్ బ్రీఫ్ ఎంత బాగా నెరవేర్చింది అని రిపోర్ట్ చేసే మెట్రిక్—అదే విధంగా ఉంది.
- ట్రాన్స్క్రిప్ట్ సృష్టి (creation) నుండి సవరణ (revision) వైపు మార్పును చూపుతుంది. మోడల్ కొత్త కోడ్ను రూపొందించడం ఆపివేసి, ఇప్పటికే రాసిన దానిని మెరుగుపరచడం (polishing) ప్రారంభించింది. కొత్త కోడ్ రాసిన దానికంటే ఎడిట్స్ 2.4 రెట్లు ఎక్కువగా ఉన్నాయి. “read” టూల్ కాల్స్ పద్దెనిమిది రెట్లు పెరిగాయి మరియు “bash” టూల్ ఇన్వోకేషన్లు ఆరు రెట్లు పెరిగాయి. ఆచరణలో, మోడల్ అడగకపోయినా మాడ్యూల్స్ను మళ్ళీ చదివింది, తన స్వంత టెస్ట్లను మళ్ళీ రన్ చేసింది, linting మరియు mutation testing కూడా చేసింది.
“max effort” నాబ్ కొత్త అల్గారిథమ్ను పరిచయం చేయదు; ఇది కేవలం మోడల్ ఖర్చు చేయగల బడ్జెట్ను పెంచుతుంది. బడ్జెట్ తగినంత ఎక్కువగా ఉన్నప్పుడు, మోడల్ సెల్ఫ్-ఆడిట్ మోడ్లోకి మారుతుంది, తద్వారా ఖర్చు చేయడానికి తగిన మార్పుల కోసం వెతుకుతుంది.
ఖర్చు ఎందుకు పెరుగుతుంది
మోడల్ ఆడిట్ చేయాలని నిర్ణయించుకున్నప్పుడు, ప్రతి అదనపు read లేదా bash కాల్ బిల్లును పెంచుతుంది, మరియు మల్టిప్లైయర్ ఎఫెక్ట్స్ వల్ల మొత్తం ఖర్చు వేగంగా పెరుగుతుంది.
ఆడిట్ మోడ్ అనేది ఒక స్పష్టమైన డిజైన్ ఎంపిక. మోడల్ పెద్ద బడ్జెట్ను “సరిదిద్దదగిన దేనినైనా వెతకడానికి” అనుమతిగా భావిస్తుంది. ఒకవేళ మెరుగుపరచడానికి ఏమీ లేకపోతే, అదనపు ఖర్చు వల్ల ఎటువంటి ఫంక్షనల్ ప్రయోజనం ఉండదు.
ఎక్కువ ఎఫర్ట్ ఎప్పుడు ఉపయోగపడుతుంది
ప్రారంభ అవుట్పుట్లో మెరుగుపరచడానికి అవకాశం ఉన్నప్పుడు మాత్రమే ఆడిట్ మోడ్ ఉపయోగపడుతుంది. 0.73 టెస్ట్ కవరేజ్ ఉన్న ఒక Go ప్రాజెక్ట్లో, ఎఫర్ట్ను మాక్స్కు పెంచడం వల్ల కవరేజ్ 0.88కి పెరిగింది.
దీనికి విరుద్ధంగా, ఇప్పటికే 0.98 కవరేజ్ సాధించిన Python టాస్క్లో, బడ్జెట్ను పెంచినప్పుడు ఎటువంటి మార్పు కనిపించలేదు. మోడల్ కేవలం అదే అధిక నాణ్యత కలిగిన కోడ్ను మళ్ళీ తనిఖీ చేసింది, దీనివల్ల విలువను పెంచకుండా ఖర్చు మాత్రమే పెరిగింది.
సంభావ్య నష్టాలు
- బడ్జెట్ పెరిగిపోవడం (Budget blowout) – తక్కువ ఎఫర్ట్ ధరలకు అలవాటు పడిన వినియోగదారులు, అదే డెలివరాబుల్ కోసం ఇరవై ఐదు రెట్లు పెరిగిన ధరను చూసి ఆశ్చర్యపోవచ్చు.
డెవలపర్ల కోసం ఆచరణాత్మక మార్గదర్శకాలు
- రోజువారీ ప్రాంప్ట్లను డిఫాల్ట్ ఎఫర్ట్ లెవల్లోనే ఉంచండి. మీరు తక్కువ ధరకే అదే ఫంక్షనల్ ఫలితాన్ని పొందవచ్చు.
- స్పష్టమైన క్వాలిటీ థ్రెషోల్డ్ను చేరుకోలేని కోడ్ కోసం మాత్రమే “max effort”ను ఉపయోగించండి—ఉదాహరణకు తక్కువ టెస్ట్ కవరేజ్, మిస్సింగ్ lint వార్నింగ్స్ లేదా ఇతర కొలవదగిన లోపాలు.
- ఈ సెట్టింగ్ను ఒక ప్రత్యేక మోడ్గా పరిగణించండి: మెరుగైన సమాధానాల కోసం స్పీడ్ డయల్లా కాకుండా, ఒక ఐచ్ఛిక సెల్ఫ్-రివ్యూ పాస్గా చూడండి.
ముగింపు
Claude Opus 5 యొక్క max-effort స్విచ్ మెరుగైన కోడ్ కోసం కాకుండా, అంతర్గత క్వాలిటీ చెక్ కోసం డబ్బును ఖర్చు చేస్తుంది. మీ బేస్లైన్ ఫలితాలలో పూరించడానికి ఏదైనా కొలవదగిన లోపం ఉన్నప్పుడు మాత్రమే దీనిని తక్కువగా ఉపయోగించండి; లేకపోతే, తక్కువ ఖర్చుతో కూడిన డిఫాల్ట్ సెట్టింగ్ ఆడిట్-మోడ్ ధర లేకుండానే అదే ఫలితాన్ని అందిస్తుంది.
Community discussion: https://t.me/GyaanSetuAi
