OpenAI menyatakan bahawa model GPT-5.6 Sol miliknya mencapai kadar kejayaan 38.3% pada penanda aras penaakulan logik ARC-AGI-3, mengatasi Claude Opus 5 milik Anthropic pada 30.2%. Kelebihan ini hanya muncul apabila model tersebut dijalankan di sebalik Responses API tersuai OpenAI, yang menambah dua teknik semasa inferens yang tidak dibenarkan oleh kerangka ujian rasmi.

Persediaan: perlumbaan senjata penanda aras

ARC-AGI-3 menguji keupayaan model untuk menyelesaikan masalah baharu yang melibatkan pelbagai langkah tanpa bergantung kepada fakta yang telah dihafal. Awal tahun ini, Anthropic mengumumkan lonjakan empat kali ganda pada penanda aras tersebut, meletakkan Opus 5 di puncak papan pendahulu awam. Keputusan itu menetapkan titik rujukan baharu bagi keupayaan model "mentah" kerana kerangka rasmi membuang sebarang penaakulan perantara selepas setiap langkah, memaksa model untuk bermula semula setiap kali.

Dakwaan OpenAI muncul dalam iklim persaingan yang sama. Dengan menerbitkan skor yang lebih tinggi, syarikat itu memberi isyarat bahawa generasi terbaharunya bukan sahaja dapat menandingi, malah melampaui prestasi logik pesaing utamanya. Walau bagaimanapun, tajuk berita tersebut menyembunyikan nuansa teknikal yang sedang membentuk semula cara komuniti membaca jadual penanda aras.

Apa maksud sebenar angka-angka tersebut

Apabila GPT-5.6 Sol dinilai di bawah kerangka rasmi ARC-AGI-3 yang sama yang memberikan Opus 5 keputusan 30.2%, prestasi model tersebut merosot kepada kadar kejayaan 7.8%. Perbezaan ketara ini bukanlah ralat; ia adalah hasil daripada dua ciri kejuruteraan yang disertakan oleh OpenAI bersama model tersebut:

  • Retained Reasoning – berbanding memadam rantaian pemikiran (chain-of-thought) selepas setiap sub-tugasan, sistem ini mengekalkan teks perantara, membolehkan model merujuk kembali kepada deduksi terdahulu dan membina hujah kumulatif.
  • Compaction – berbanding memotong konteks lama untuk kekal dalam had token, pembungkus (wrapper) tersebut memampatkan langkah-langkah terdahulu ke dalam ringkasan pendek, sekali gus mengekalkan aliran logik sambil memastikan saiz prom yang terkawal.

Kedua-dua mekanisme ini terdapat dalam Responses API proprietari. Dengan membekalkan konteks yang lebih kaya dan berterusan kepada model, OpenAI secara berkesan meningkatkan "memori" model dan membolehkannya menggunakan semula penaakulannya sendiri. Sebaliknya, kerangka rasmi menguatkuasakan mod "stateless" yang ketat yang menghapuskan kelebihan tersebut.

Mengapa metodologi ini penting

Episod ini menonjolkan perpecahan yang semakin meningkat dalam penilaian AI: skor model mentah berbanding prestasi tahap sistem. OpenAI berhujah bahawa penanda aras sepatutnya mencerminkan keseluruhan timbunan (stack) yang akan digunakan oleh pembangun – model, saluran paip inferens, dan pengurusan memori. Dari sudut pandangan itu, skor 38.3% memberitahu pasukan produk bahawa tawaran gabungan tersebut boleh menyelesaikan lebih banyak tugasan dunia nyata berbanding model yang dinilai secara berasingan.

Pengkritik mengatakan ini mengaburkan kemajuan saintifik. Jika setiap makmal menambah pembungkus tersuai, papan pendahulu akan menjadi gabungan helah kejuruteraan dan bukannya perbandingan kecerdasan model yang bersih. Kerangka rasmi ARC-AGI-3 wujud untuk mewujudkan persaingan yang adil, memastikan angka yang lebih tinggi menandakan model asas yang benar-benar lebih kuat, bukannya pembungkus yang lebih pintar.

Pertaruhan bagi pembangun dan pelabur

Bagi syarikat pemula yang membina produk berasaskan AI, perbezaan ini adalah praktikal. Model yang boleh mengekalkan penaakulan dan memampatkan konteks mungkin memerlukan kurang kejuruteraan prom, kependaman inferens yang lebih rendah, dan kurang panggilan API untuk mencapai penyelesaian. Ini diterjemahkan kepada bil pengkomputeran yang lebih murah dan pengalaman pengguna yang lebih lancar. Syarikat yang menawarkan sistem siap guna (turnkey) – model ditambah lapisan inferens yang dioptimumkan – mendapat kelebihan daya saing dalam aspek kelajuan dan kos.

Pelabur memerhatikan kenaikan penanda aras sebagai proksi kepada hasil masa hadapan. Kelebihan yang menarik perhatian media boleh meningkatkan penilaian sesebuah firma, walaupun keupayaan mentah model asasnya setanding dengan pesaing. Oleh itu, perdebatan tentang apa yang diwakili oleh angka-angka tersebut mempengaruhi aliran modal merentasi sektor AI.

Apa yang perlu diperhatikan seterusnya

  • Respons penetap piawaian – penganjur penanda aras mungkin memperketat peraturan berkaitan helah inferens "luaran" atau menambah trek "sistem" berasingan yang membenarkannya secara eksplisit. Respons mereka akan membentuk gelombang papan pendahulu awam yang seterusnya.
  • Pembungkus sumber terbuka – jika komuniti mengeluarkan pelaksanaan tersendiri bagi retained reasoning dan compaction, kelebihan tersebut boleh menjadi ciri asas dan bukannya kelebihan proprietari.
  • Tapak ujian dunia nyata – syarikat semakin banyak menerbitkan prestasi pada set masalah proprietari (contohnya, suite penjanaan kod dalaman). Keputusan tersebut, walaupun kurang boleh dibandingkan, akan mula menjadi lebih penting daripada satu penanda aras awam tunggal.

Hujah balas: adakah ini "memanipulasi" penanda aras?

Sesetengah penyelidik melabelkan penggunaan API tersuai sebagai “benchmark gaming,” dengan berhujah bahawa ia meningkatkan skor tanpa memajukan pemahaman teras model. Mereka menyatakan bahawa model yang merosot kepada prestasi angka tunggal di bawah kekangan yang ketat masih jauh daripada matlamat AGI. Kebimbangan yang timbul adalah bidang ini mungkin mula memberi ganjaran kepada jalan pintas kejuruteraan berbanding lonjakan tulen dalam keupayaan penaakulan.

Pihak OpenAI menekankan bahawa garis pemisah antara model dan sistem semakin bersifat buatan. Aplikasi AI moden jarang menjalankan model dalam vakum; ia sentiasa berada di sebalik lapisan penyajian yang mengendalikan caching, penyambungan konteks, dan pasca-pemprosesan output. Dari sudut itu, mengukur keseluruhan saluran (pipeline) adalah lebih jujur tentang apa yang sebenarnya dialami oleh pengguna.

Rumusan

Kisah GPT-5.6 Sol menunjukkan bahawa kemenangan penanda aras hari ini bergantung sama banyak kepada kejuruteraan inferens seperti juga saiz model. Sama ada komuniti menerima skor tahap sistem atau mengekang penggunaan pembungkus (wrappers) tersuai akan menentukan bagaimana kita membaca tajuk berita “papan pendahulu” (leaderboard) yang seterusnya. Bagi sesiapa yang membina atau membiayai produk AI, pengajarannya jelas: angka mentah itu penting, tetapi perisian di sekelilingnya boleh menjadi faktor penentu dalam prestasi dunia nyata.