Claude Opus 5 diluncurkan ke pasar pada 24 Juli, dan angka-angka utamanya menjanjikan lonjakan tiga kali lipat dibandingkan pesaing terdekatnya dan dua kali lipat performa dari Opus 4.8 milik Anthropic sendiri. Pertanyaan sebenarnya bagi siapa pun yang membayar untuk output AI adalah apakah rasio tersebut diterjemahkan ke dalam keuntungan nyata tanpa menaikkan harga.

Mengapa angka-angka tersebut penting

Pengembang paling peduli pada skor SWE-bench Pro, sebuah tolok ukur yang menguji model terhadap masalah GitHub yang nyata untuk melihat seberapa baik model tersebut dapat memperbaiki kode. Opus 5 mencapai 79,2%, sementara Opus 4.8 hanya mencapai 69,2%—kenaikan sepuluh poin hanya dalam dua bulan. Anthropic menjaga harga per token tetap tidak berubah, sehingga pengguna mendapatkan asisten pengodean yang jauh lebih cerdas dengan biaya yang sama.

Jika rasio utama tersebut bertahan di pengujian lain, narasi biaya-performa ini dapat mengubah cara perusahaan memilih model bahasa untuk beban kerja yang padat kode.

Bagaimana Opus 5 dibandingkan dalam pengujian utama

  • SWE-bench Pro – 79,2% vs 69,2% (Opus 4.8). Harga token sama, tingkat keberhasilan lebih tinggi pada perbaikan bug di dunia nyata.
  • CursorBench 3.2 – Opus 5 berada dalam rentang 0,5% dari Fable 5 yang memimpin dalam hal kecepatan penyelesaian tugas, namun biayanya sekitar setengahnya per tugas.
  • ARC-AGI-3 – Opus 5 mencetak skor 30,2, sementara runner-up tertinggal di angka 7,8. Kesenjangannya sangat mencolok, menunjukkan bahwa Opus 5 menangani masalah penalaran abstrak jauh lebih baik daripada sebagian besar model kontemporer lainnya.
  • General Reasoning – Persaingannya lebih ketat. GPT-5.6 Sol memimpin dengan rata-rata 92,5, unggul tipis dari Opus 5 yang mencetak 90,4. Di sini, Opus 5 kompetitif tetapi tidak dominan.

Angka-angka ini memberikan gambaran yang bernuansa: Opus 5 unggul dalam tolok ukur terkait kode dan penalaran tertentu, namun masih tertinggal dari model General Reasoning terbaik saat ini.

Melihat lebih dalam

Angka tolok ukur bisa menyesatkan jika kondisi pengujian tidak jelas. Empat pemeriksaan membantu membedakan antara fakta dan hype:

  1. Tingkat upaya (Effort level) – Apakah model dijalankan pada upaya rendah, default, atau maksimal? Upaya yang lebih tinggi dapat meningkatkan skor tetapi juga meningkatkan latensi dan biaya.
  2. Jumlah uji coba (Trial count) – Pengujian tunggal mungkin hanya menangkap pencilan yang beruntung. Uji coba berulang (lima atau lebih) memberikan gambaran yang lebih stabil.
  3. Sumber (Source) – Tolok ukur yang disediakan vendor berguna sebagai dasar, tetapi harus dikonfirmasi oleh laboratorium independen.
  4. Basis perbandingan (Comparison baseline) – Apakah "model berikutnya" masih merupakan pemimpin saat ini, atau apakah ada kompetitor baru yang masuk ke lapangan sejak pengujian dilakukan?

Dampak bagi pengguna dan kompetitor

Perusahaan yang menjalankan alur kerja peninjauan kode skala besar dapat memangkas waktu siklus debugging dan menurunkan biaya komputasi cloud dengan kenaikan sepuluh poin pada SWE-bench Pro dengan harga token yang tidak berubah. Tim yang lebih kecil mendapatkan asisten yang lebih mumpuni tanpa perlu meningkatkan anggaran.

Skor General Reasoning yang ketat mengingatkan para pengembang bahwa Opus 5 bukanlah pengganti menyeluruh untuk model all-round terbaik saat ini.

Apa yang perlu diperhatikan selanjutnya

  • Rilis tolok ukur independen – Laboratorium pihak ketiga akan segera menguji Opus 5 terhadap rangkaian pengujian yang sama dengan berbagai tingkat upaya. Temuan mereka akan mengonfirmasi atau menyanggah klaim Anthropic.

Kesimpulan

Claude Opus 5 memberikan peningkatan performa pengodean yang jelas dengan harga token yang sama, menjadikannya peningkatan yang menarik bagi pengembang yang fokus pada tugas-tugas perangkat lunak. Model ini masih selangkah di belakang pemimpin mutlak dalam General Reasoning, dan keunggulan yang diiklankan masih memerlukan verifikasi independen. Bagi siapa pun yang menyusun anggaran layanan AI, efisiensi biaya model ini pada pekerjaan kode adalah alasan paling konkret untuk mempertimbangkannya secara serius.