Claude Opus 5 telah memasuki pasaran pada 24 Julai, dan angka utama yang diumumkan menjanjikan lonjakan tiga kali ganda berbanding pesaing terdekat serta prestasi dua kali ganda berbanding Opus 4.8 milik Anthropic sendiri. Persoalan sebenar bagi sesiapa yang membayar untuk output AI adalah sama ada nisbah tersebut diterjemahkan kepada peningkatan nyata tanpa menaikkan harga.

Mengapa angka ini penting

Pembangun paling mementingkan skor SWE-bench Pro, sebuah penanda aras yang menguji model terhadap isu GitHub yang sebenar untuk melihat sejauh mana ia boleh memperbaiki kod. Opus 5 mencapai 79.2%, manakala Opus 4.8 hanya mencatatkan 69.2%—satu peningkatan sepuluh mata dalam masa hanya dua bulan. Anthropic mengekalkan harga setiap token tanpa perubahan, jadi pengguna mendapat pembantu pengekodan yang jauh lebih pintar dengan kos yang sama.

Jika nisbah utama ini kekal konsisten merentasi ujian lain, perbandingan kos-prestasi ini boleh membentuk semula cara syarikat memilih model bahasa untuk beban kerja yang padat dengan kod.

Bagaimana Opus 5 bersaing dalam ujian utama

  • SWE-bench Pro – 79.2% berbanding 69.2% (Opus 4.8). Harga token yang sama, kadar kejayaan lebih tinggi dalam pembaikan pepijat dunia sebenar.
  • CursorBench 3.2 – Opus 5 berada dalam lingkungan 0.5% daripada peneraju Fable 5 dari segi kelajuan penyelesaian tugasan, namun kosnya adalah kira-kira separuh lebih murah bagi setiap tugasan.
  • ARC-AGI-3 – Opus 5 mencatatkan skor 30.2, manakala naib juara ketinggalan pada 7.8. Jurang ini sangat ketara, menunjukkan Opus 5 mengendalikan masalah penaakulan abstrak jauh lebih baik daripada kebanyakan model kontemporari yang lain.
  • Penaakulan Umum (General Reasoning) – Persaingan dalam bidang ini lebih sengit. GPT-5.6 Sol mendahului dengan purata 92.5, mengatasi Opus 5 yang mencatatkan 90.4. Di sini, Opus 5 adalah berdaya saing tetapi tidak mendominasi.

Angka-angka ini memberikan gambaran yang terperinci: Opus 5 cemerlang dalam penanda aras berkaitan kod dan penaakulan tertentu, namun ia masih ketinggalan di belakang model penaakulan umum terbaik.

Melihat di sebalik angka

Angka penanda aras boleh mengelirukan jika keadaan ujian tidak jelas. Empat semakan membantu membezakan antara fakta sebenar dengan gimik pemasaran:

  1. Tahap usaha – Adakah model dijalankan pada tahap usaha rendah, lalai (default), atau maksimum? Usaha yang lebih tinggi boleh meningkatkan skor tetapi juga meningkatkan latensi dan kos.
  2. Bilangan percubaan – Larian tunggal mungkin menangkap pencilan (outliers) yang bernasib baik. Percubaan berulang (lima atau lebih) memberikan gambaran yang lebih stabil.
  3. Sumber – Penanda aras yang disediakan oleh vendor berguna sebagai asas, tetapi ia harus disahkan oleh makmal bebas.
  4. Asas perbandingan – Adakah "model seterusnya" itu masih merupakan peneraju semasa, atau adakah pesaing baharu telah memasuki pasaran sejak ujian dijalankan?

Pertaruhan bagi pengguna dan pesaing

Perusahaan yang menjalankan saluran semakan kod berskala besar boleh menjimatkan berjam-jam dalam kitaran penyahpepijatan dan mengurangkan bil pengkomputeran awan dengan peningkatan sepuluh mata pada SWE-bench Pro pada harga token yang tidak berubah. Pasukan yang lebih kecil pula mendapat pembantu yang lebih berkemampuan tanpa perlu menaik taraf bajet.

Skor Penaakulan Umum yang sengit mengingatkan pembangun bahawa Opus 5 bukanlah pengganti menyeluruh bagi model serba boleh terbaik pada masa ini.

Apa yang perlu diperhatikan seterusnya

  • Penerbitan penanda aras bebas – Makmal pihak ketiga akan segera menguji Opus 5 terhadap set ujian yang sama pada pelbagai tahap usaha. Penemuan mereka akan mengesahkan atau menyangkal dakwaan Anthropic.

Kesimpulan

Claude Opus 5 memberikan lonjakan prestasi pengekodan yang jelas pada harga token yang sama, menjadikannya naiktaraf yang menarik bagi pembangun yang fokus pada tugasan perisian. Ia kekal satu langkah di belakang peneraju mutlak dalam penaakulan umum, dan kelebihan yang diiklankan masih memerlukan pengesahan bebas. Bagi sesiapa yang merancang bajet untuk perkhidmatan AI, kecekapan kos model ini untuk kerja pengekodan adalah alasan paling konkrit untuk mempertimbangkannya secara serius.