Tetapan “max effort” Claude Opus 5 melambungkan harga permintaan rutin daripada $0.76 kepada $19.21, sedangkan ia memberikan output fungsian yang pada dasarnya sama. Perbelanjaan tambahan itu membeli proses audit dalaman, bukannya penyelesaian yang lebih baik, dan hanya menunjukkan peningkatan yang boleh diukur pada tugasan yang bermula dengan liputan ujian (test coverage) yang rendah.
Apa yang ditunjukkan oleh ujian tersebut
Eksperimen tersebut membandingkan tahap usaha lalai Claude Opus 5 dengan tetapan “max effort” pada dua jenis arahan (prompt): tugasan pengekodan harian dan masalah yang sengaja dibuat sukar.
- Untuk tugasan tipikal, pelaksanaan usaha rendah selesai dalam masa dua minit dan menelan kos $0.76. Menetapkan tetapan ke tahap maksimum melonjakkan bil kepada $19.21, namun skor liputan-keperluan (requirement-coverage score)—metrik yang dilaporkan oleh model tentang sejauh mana ia memenuhi taklimat—kekal sama.
- Transkrip menunjukkan peralihan daripada penciptaan kepada semakan. Model tersebut berhenti menjana kod baharu dan mula menggilap apa yang telah ditulisnya. Bilangan suntingan melebihi penulisan baharu dengan nisbah 2.4-ke-1. Panggilan ke alatan “read” meningkat lapan belas kali ganda, dan penggunaan alatan “bash” meningkat enam kali ganda. Dalam praktiknya, model tersebut membaca semula modul, menjalankan semula ujiannya sendiri, melakukan linting, dan juga ujian mutasi tanpa diminta.
Tetapan “max effort” tidak memperkenalkan algoritma baharu; ia hanya meningkatkan bajet yang boleh dibelanjakan oleh model. Sebaik sahaja bajet mencukupi, model akan beralih ke mod audit kendiri, mencari sebarang penambahbaikan yang boleh dijustifikasikan untuk dibelanjakan.
Mengapa kos melonjak
Apabila model memutuskan untuk melakukan audit, setiap panggilan “read” atau “bash” tambahan akan menambah bil, dan kesan pengganda akan menyebabkan jumlah kos berkembang dengan pantas.
Mod audit adalah pilihan reka bentuk yang eksplisit. Model tersebut menganggap bajet yang lebih besar sebagai kebenaran untuk “mencari sesuatu yang berbaloi untuk diperbaiki.” Jika tiada apa-apa yang kelihatan boleh dipertingkatkan, perbelanjaan tambahan tersebut tidak memberikan sebarang manfaat fungsian.
Bila usaha yang lebih tinggi masuk akal
Mod audit hanya memberikan hasil yang baik apabila output awal masih mempunyai ruang untuk penambahbaikan. Dalam projek Go dengan liputan ujian 0.73, meningkatkan usaha ke tahap maksimum telah menaikkan liputan kepada 0.88.
Sebaliknya, tugasan Python yang sudah mencapai liputan 0.98 tidak menunjukkan sebarang perubahan apabila bajet ditingkatkan. Model tersebut hanya menyemak semula kod berkualiti tinggi yang sama, sekali gus melambungkan kos tanpa menambah nilai.
Potensi keburukan
- Bajet melambung – Pengguna yang biasa dengan harga tahap usaha rendah mungkin terkejut dengan peningkatan sebanyak dua puluh lima kali ganda untuk hasil yang sama.
Panduan praktikal untuk pembangun
- Kekalkan arahan (prompt) rutin pada tahap usaha lalai. Anda mendapat hasil fungsian yang sama dengan harga yang jauh lebih murah.
- Simpan “max effort” untuk kod yang gagal memenuhi ambang kualiti yang jelas—liputan ujian yang rendah, amaran lint yang hilang, atau jurang boleh ukur yang lain.
- Anggap tetapan tersebut sebagai mod berasingan: satu proses semakan kendiri pilihan, dan bukannya cara pantas untuk mendapatkan jawapan yang lebih baik.
Kesimpulan
Suis “max-effort” Claude Opus 5 menukar wang untuk semakan kualiti dalaman, bukannya untuk kod yang lebih baik. Gunakannya secara berhemah, hanya apabila keputusan asas anda meninggalkan jurang yang boleh diukur untuk diisi; jika tidak, tetapan lalai yang murah memberikan hasil yang sama tanpa kos tambahan mod audit.
Community discussion: https://t.me/GyaanSetuAi
