Penanda aras baharu bagi 20 model bahasa besar (LLM) menunjukkan tiada satu model pun yang mendominasi mana-mana beban kerja pada tahun 2026. Menghalakan setiap tugasan kepada pakar dapat mengurangkan kos dan mempercepatkan penyampaian. Kajian tersebut membandingkan Anthropic, OpenAI, Google, xAI, Meta dan beberapa makmal China, serta mendapati bahawa pemilihan model yang salah membazirkan wang dan masa.

Mengapa satu LLM sahaja tidak lagi memadai

Setahun yang lalu, kebanyakan pembangun memilih satu model untuk segalanya—daripada pengekodan hingga jawapan penyelidikan. Jurang antara model yang dibina untuk pengekodan, orkestrasi alatan, penaakulan mendalam dan keberkesanan kos mentah telah semakin melebar sehingga pendekatan "satu saiz untuk semua" kini lebih memudaratkan daripada membantu.

Bagaimana penanda aras ini dibina

Saya menjalankan set tugasan yang sama merentasi kesemua 20 model, mengabaikan dakwaan pemasaran vendor dan memberi tumpuan kepada data bebas yang boleh diulang semula. Tugasan dibahagikan kepada empat kategori:

  • Pengekodan dan autonomi – menjana kod gred pengeluaran, mengendalikan gelung ejen (agentic loops).
  • Penggunaan alatan dan orkestrasi – memanggil API luaran, memanipulasi fail, mengendalikan komputer.
  • Penaakulan dan sains – menyelesaikan masalah matematik, mentafsir data penyelidikan.
  • Nilai – memberikan kualiti yang boleh diterima pada kos serendah mungkin.

Matriks yang terhasil membolehkan jurutera memadankan bentuk tugasan dengan kekuatan model, berbanding hanya bergantung secara lalai kepada nama yang paling terkenal.

Model manakah yang menerajui setiap kelas

Pengekodan dan autonomi – Claude Opus 5 dan Fable 5 secara konsisten menduduki tangga teratas, mengendalikan penjanaan kod yang kompleks dan gelung berbilang langkah dengan percubaan semula yang paling sedikit. GPT-5.6 Sol mengekor rapat di belakang, menawarkan sandaran yang kukuh apabila dua model teratas tidak tersedia.

Penggunaan alatan dan orkestrasi – Muse Spark 1.1 daripada Meta terbukti paling boleh dipercayai dalam memanggil alatan luaran, manakala Gemini 3.6 Flash cemerlang dalam senario penggunaan komputer tulen seperti manipulasi hamparan (spreadsheet) dan automasi UI.

Penaakulan dan sains – GPT-5.6 Sol dan Gemini 3.1 Pro merupakan pilihan utama untuk matematik dan penyelidikan.

Nilai maksimum – Model China berwajaran terbuka (open-weight)—GLM-5.2 dan DeepSeek V4—mencapai kualiti tahap perintis (frontier-level) pada harga per-token yang jauh lebih murah berbanding tawaran utama. Pasukan yang boleh menerima sedikit kekurangan dari segi kekemasan akan mendapat nilai terbaik bagi setiap ringgit yang dibelanjakan.

Peneraju wajaran terbuka – Kimi K3 kini merupakan model yang dikeluarkan secara terbuka yang paling kuat. Llama 4 daripada Meta telah ketinggalan.

Kesimpulannya: model yang "paling pintar" tidak semestinya yang paling ekonomik atau terpantas untuk tugasan tertentu.

Strategi penghalaan untuk sistem pengeluaran

  1. Halakan, jangan seragamkan – Anggap pemilihan model sebagai keputusan dinamik, bukan tetapan lalai yang statik.
  2. Gunakan yang murah secara lalai, tingkatkan jika gagal – Mulakan dengan model kos terendah yang boleh mengendalikan tugasan; jika ia gagal, beralih kepada model tahap lebih tinggi.
  3. Asingkan perancang daripada pekerja – Gunakan model penaakulan yang kuat (contohnya, Opus 5) untuk memecahkan masalah kepada beberapa langkah, kemudian serahkan sub-tugasan yang berulang kepada pelaksana yang lebih murah (contohnya, Gemini Flash).
  4. Ukur kejayaan, bukan sekadar penggunaan token – Model murah yang melakukan percubaan semula sebanyak tiga kali boleh menelan kos lebih tinggi daripada model mahal yang berjaya pada percubaan pertama.

Apa yang perlu diperhatikan seterusnya

Pembangun harus menganggap peta penghalaan ini sebagai dokumen yang sentiasa dikemas kini dan menyemak semula pilihan model dengan setiap pelancaran besar.

Kesimpulan

Pada tahun 2026, kelebihan daya saing terletak pada pasukan yang menganggap LLM sebagai sebuah kotak peralatan dan bukannya sebuah pisau tentera Swiss (Swiss-army knife) tunggal. Dengan memadankan tugasan dengan model yang pakar dalam bidang tersebut, organisasi dapat menjimatkan perbelanjaan AI sambil memberikan hasil dengan lebih pantas. Kemenangan sebenar bukanlah model utama yang baharu; ia adalah strategi penghalaan yang berdisiplin yang meletakkan kecerdasan yang tepat di tempat yang paling diperlukan.