Mengapa seni bina dua-otak?

Kebanyakan pembantu penulisan kod menggunakan satu model tunggal yang perlu memutuskan apa yang hendak dibina dan menulis kod sumbernya. Sepanjang sesi yang panjang, tetingkap konteks model akan penuh, menyebabkan "hanyutan konteks" (context drift) – ia melupakan keputusan terdahulu dan menghasilkan kod yang bercanggah atau bertindih. Cursor menyelesaikan masalah ini dengan membahagikan beban kerja mental:

  • Ejen perancang (Planner agents) berjalan pada model yang paling berkuasa (draf menyebut Opus 4.8 atau Fable 5). Mereka memecahkan permintaan tahap tinggi kepada hierarki tugasan, menyelesaikan kekaburan, dan merekodkan pilihan reka bentuk.
  • Ejen pekerja (Worker agents) berjalan pada model yang lebih pantas dengan daya pemprosesan tinggi (Composer 2.5). Mereka mengambil tugasan konkrit daripada perancang dan menjana keratan kod.

Memisahkan antara "apa" dan "bagaimana" menghalang beban berlebihan yang melambatkan sistem model tunggal. Setiap model kekal dalam saiz konteks yang sesuai dengan peranannya, mengelakkan pembaziran bajet token yang memaksa pereka memendekkan prom.

Menskalakan gerombolan

Versi awal gerombolan (swarm) Cursor memproses kira-kira seribu komit sejam. Selepas reka bentuk semula "split-brain", sistem tersebut mencapai kira-kira seribu komit sesaat. Kelajuan tersebut mendedahkan hambatan (bottleneck) baharu: alatan kawalan versi tidak dibina untuk persaingan sebegitu. Apabila dua perancang mengeluarkan arahan yang bertindih, repositori boleh berakhir dengan logik yang bertindih – satu masalah yang dipanggil pasukan sebagai "ralat split-brain."

Cursor mengawal huru-hara tersebut dengan tiga langkah perlindungan:

  1. Dokumen reka bentuk dikongsi – Setiap perancang menulis keputusannya ke dalam satu dokumen pusat yang dipautkan ke kod yang dijana. Pekerja mengikut pautan tersebut, supaya reka bentuk yang sama tidak dicipta semula di tempat lain.
  2. Semakan pelbagai sudut – Tiga ejen masing-masing memeriksa bahagian kerja yang berbeza (transkrip penuh, hanya output, atau hanya kod). Semakan silang ini mengesan ketidakkonsistenan yang mungkin terlepas jika hanya menggunakan satu pandangan.
  3. Panduan lapangan kendiri – Ejen menyimpan "folder pengetahuan" tentang penemuan mengejutkan dan rintangan. Apabila pekerja baharu bermula, ia merujuk folder tersebut untuk mengelakkan pengulangan kesilapan yang diketahui, sekali gus menyediakan memori jangka pendek merentasi gerombolan tersebut.

Langkah-langkah ini memastikan kod sumber kekal koheren walaupun terdapat aliran perubahan yang deras.

Penanda aras yang penting

Cursor menguji gerombolan hibrid tersebut dengan membina semula keseluruhan manual SQLite – satu pelaksanaan Rust sebanyak 835 halaman – satu tugas yang menguji ketepatan dan juga saiz. Keputusannya sangat ketara:

  • Ketepatan – Konfigurasi hibrid (perancang + pekerja Composer) mencapai 100% ketepatan, secara konsisten mengatasi pelaksanaan solo model paling canggih yang dirujuk (GPT-5.5).
  • Saiz kod – Gerombolan hibrid menghasilkan 9,908 baris kod enjin, berbanding 64,305 baris daripada gerombolan monolitik yang lama.
  • Kos – Menjalankan satu instans GPT-5.5 secara solo menelan kos kira-kira $10,565. Pendekatan hibrid hanya membelanjakan $411 untuk armada pekerja.

Jurang kos ini berpunca daripada Composer 2.5, yang digambarkan dalam draf sebagai memberikan prestasi yang setanding dengan model utama (flagship) sambil mengenakan harga sebahagian kecil daripada harga bagi setiap satu juta token. Dengan mengalihkan sebahagian besar penggunaan token kepada model yang lebih murah ini, gerombolan tersebut mengekalkan perbelanjaan keseluruhan yang rendah tanpa mengorbankan kualiti.

Kesimpulan

  • Memadankan perancang yang berkuasa dengan pelaksana yang murah memberikan peningkatan berlipat ganda dalam kelajuan, kepadatan kod, dan kos.
  • Reka bentuk ini menghapuskan hanyutan konteks dengan menetapkan "apa" kepada model perintis (frontier models) dan "bagaimana" kepada model pakar.
  • Beban operasi dan keperluan infrastruktur kekal sebagai halangan terbesar untuk penggunaan yang lebih meluas.