Kejuruteraan perisian sentiasa mengejar metrik produktiviti yang salah. Pengurus mengira baris kod. Pasukan Agile menjejaki story points. Tiada satu pun daripadanya mengukur secara dipercayai sama ada seorang pembangun sedang berfikir dengan jelas atau sekadar menaip dengan banyak. CEO Nvidia, Jensen Huang, berpendapat beliau mempunyai kayu ukur yang lebih baik, dan ia tidak mempunyai kaitan dengan papan kekunci. Dalam penampilan terbaharu di Podcast All-In susulan GTC 2026, Huang berhujah bahawa ukuran sebenar nilai seorang jurutera moden adalah berapa banyak token AI yang mereka gunakan berbanding gaji mereka. Mesejnya adalah jelas: jika anda berpendapatan setengah juta dolar setahun tetapi membelanjakan kurang daripada separuh jumlah itu untuk perkhidmatan model bahasa besar (LLM), anda mungkin gagal menggunakan alatan yang mewajarkan gaji anda.

Satu Nisbah yang Tegas

Metrik yang diterangkan oleh Huang adalah sangat ringkas. Ambil pampasan tahunan seorang jurutera. Bandingkan ia dengan perbelanjaan tahunan mereka untuk panggilan API LLM, larian fine-tuning, dan inferens ejen (agentic inference). Jika seorang jurutera berkemahiran tinggi yang berpendapatan $500,000 setahun membelanjakan kurang daripada $250,000 untuk kos token AI, Huang melihat satu masalah. Ia menunjukkan jurutera tersebut sama ada bekerja secara terasing daripada bantuan moden atau melayan AI seperti enjin carian yang canggih dan bukannya sebagai rakan kolaborasi yang sebenar.

Ini bukan lesen untuk perbelanjaan melulu. Ia adalah ujian kognisi yang menanggung beban (load-bearing cognition). Premis Huang adalah bahawa jurutera elit sepatutnya menyerahkan sebanyak mungkin kerja mental yang membosankan kepada model yang paling berkemampuan yang ada. Sesi penyahpepijatan (debugging) yang dahulunya memakan masa selama tiga hari boleh dipendekkan kepada beberapa jam apabila sesebuah model memegang keseluruhan kod sumber dalam konteks. Debat reka bentuk sistem yang dahulunya memerlukan mesyuarat yang panjang boleh diselesaikan melalui prototaip pantas dengan model penaakulan (reasoning model). Bagi Huang, ambang $250,000 itu bukanlah siling bajet, sebaliknya ia adalah lantai. Ia mewakili subsidi kecerdasan minimum yang diperlukan oleh jurutera tahap tinggi untuk beroperasi pada kapasiti penuh.

Pembangun yang berada di bawah garis itu melakukan terlalu banyak kerja sendiri. Mereka menjejaki pepijat secara manual, menulis kod rangka (boilerplate) dengan tangan, dan membaca semula dokumentasi yang boleh disintesis oleh model dengan arahan (prompt) yang baik dalam beberapa saat sahaja. Dalam era di mana kos inferens semakin menurun dan tetingkap konteks (context windows) semakin berkembang, sikap berjimat dengan token menandakan kurangnya penggunaan alatan, bukannya disiplin. Seorang jurutera yang gagal menggunakan AI secara agresif untuk meningkatkan output mereka adalah, mengikut logik ini, tidak berprestasi tinggi.

Token sebagai Proksi untuk Leveraj

Pengurusan kejuruteraan tradisional menyukai output yang nyata. Tiket Jira yang ditutup. Komit (commits) yang dihantar. Ciri (features) yang dilancarkan. Nombor-nombor ini terasa selamat kerana ia boleh dikira. Kerangka kerja Huang sebahagian besarnya mengetepikan perkara ini. Di bawah logiknya, seorang jurutera kakitangan kanan mungkin menghasilkan lebih sedikit komit mentah berbanding pekerja tahap pertengahan, namun menjana nilai yang jauh lebih besar, kerana produk sebenar mereka adalah keputusan. Token menjadi buku lejar bagi keputusan tersebut.

Apabila seorang jurutera membelanjakan banyak untuk inferens LLM, mereka bukan sekadar membeli penjanaan teks. Mereka membeli pemikiran selari (parallelized thought). Seorang jurutera bergaji $500,000 yang menggunakan tetingkap konteks yang besar untuk masalah penstrukturan semula kod (refactoring) pada dasarnya sedang menjalankan belasan aliran kognitif serentak, menyemak kes-kes hujung (edge cases) merentasi mikroperkhidmatan, dan menguji tekanan andaian seni bina tanpa perlu menulis satu baris pun kod pengeluaran. Token menukarkan jam gaji kepada hasil yang mampat. Ia membeli kelajuan, pandangan jauh seni bina, dan keupayaan penyahpepijatan yang jika dilakukan secara manual akan memakan ratusan jam.

Ini mengubah struktur insentif lama. Pemimpin kejuruteraan secara sejarahnya telah berunding keras untuk diskaun pengkomputeran awan dan menganggap perolehan SaaS sebagai pusat kos yang perlu diminimumkan. Huang mencadangkan bahawa pemikiran sedemikian adalah terbalik untuk AI. Bajet token harus berkembang seiring dengan bakat. Jika anda mengambil otak yang mahal dan kemudian membiarkan mereka kekurangan akses kepada model yang paling mahal, anda memerangkap mereka dalam aliran kerja manual. Mereka menjadi pengetik (typists) yang berharga tinggi. Matlamatnya adalah apa yang diimplikasikan oleh Huang sebagai ketumpatan kecerdasan (intelligence density): kognisi terpakai maksimum bagi setiap jam manusia, walaupun bil awan kelihatan membimbangkan pada pandangan pertama. Jika seorang jurutera tidak menggunakan token yang mencukupi untuk mewajarkan pampasan tinggi mereka, mereka berkemungkinan gagal menyerahkan beban kognitif yang berat kepada AI, sekaligus mengehadkan impak potensi mereka terhadap organisasi.

Kekalkan Pasukan, Luaskan Pengkomputeran

Peningkatan kos operasi biasanya mencetuskan semakan bilangan pekerja. CFO melihat bil API yang melambung tinggi dan secara refleks bertanya siapa yang boleh dikurangkan. Huang menawarkan preskripsi yang bertentangan. Daripada mengecilkan pasukan untuk memuatkan bajet, syarikat sepatutnya mengoptimumkan bajet untuk memperkasakan pasukan.

Hujah ini bergantung kepada kos penggantian dan beban penyelarasan. Sebuah organisasi perisian warisan mungkin menggaji tiga puluh jurutera untuk menyelenggara monolit, menyemak permintaan tarik (pull requests) satu sama lain, dan memigrasikan perkhidmatan secara perlahan-lahan. Pasukan kecil yang terdiri daripada lima jurutera yang dipertingkatkan secara mendalam, yang masing-masing menggunakan kuota token gred perusahaan, boleh menyamai atau melebihi hasil kerja tersebut. Penjimatan tidak ditemui pada item baris API itu sendiri. Ia muncul melalui ketiadaan kependaman komunikasi, kitaran pengambilan pekerja, dan beban birokrasi.

Strategi ini hanya berkesan jika anda menggaji jurutera yang boleh mengarahkan aliran token yang besar dengan niat yang jelas. Terdapat perbezaan ketara antara pembangun yang menampal jejak timbunan (stack trace) ke dalam bot sembang dan pembangun yang mengorkestrasi saluran paip pelbagai ejen (multi-agent pipelines), menyelenggara perpustakaan konteks yang kaya, dan mengesahkan output halusinasi secara rapi. Profil yang terakhir lebih sukar dicari. Itulah sebabnya Huang mengaitkan metrik tersebut dengan gaji. Pampasan yang tinggi harus berkorelasi dengan kemahiran orkestrasi yang tinggi. Anda tidak membayar seseorang setengah juta dolar hanya untuk memberi arahan (prompt) kepada model seminggu sekali. Anda membayar mereka untuk menguruskan ekosistem penaakulan automatik yang membina sistem kompleks pada kelajuan yang tidak pernah berlaku sebelum ini.

Apa Maknanya dalam Praktik

Bagi organisasi kejuruteraan, nisbah token-kepada-gaji bukanlah peraturan perakaunan yang kaku, sebaliknya ia adalah titik semakan budaya. Pemimpin harus bertanya sama ada pembangun mereka yang bergaji paling tinggi mempunyai akses, latihan, dan mandat untuk menggunakan AI secara agresif. Adakah mereka menjalankan analisis konteks panjang pada kod warisan, atau adakah mereka masih mencari (grepping) melalui log baris demi baris? Adakah mereka menggunakan alatan pengekodan ejen untuk ujian integrasi, atau adakah mereka menulis mock secara manual? Adakah projek mereka tersekat oleh perhatian manusia atau oleh had kadar API?

Jika jawapannya menunjukkan kepada kesesakan manusia, penyelesaiannya jarang sekali dengan menuntut lebih banyak jam bekerja. Ia biasanya adalah dengan menaikkan siling token. Biarkan jurutera menjalankan lebih banyak ejen. Biarkan mereka mengekalkan tetingkap konteks yang berterusan untuk keseluruhan rangkaian perkhidmatan (service mesh). Biarkan mereka melakukan iterasi pada seni bina sebanyak lima puluh kali dalam satu petang berbanding dua kali dalam seminggu. Apabila penggunaan token dilihat sebagai tanda kejuruteraan berimpak tinggi dan bukannya kos yang tidak perlu, struktur keizinan di dalam syarikat akan berubah.

Sudah tentu, perbelanjaan semata-mata tidak menjamin apa-apa. Token yang dicurahkan ke dalam pertanyaan remeh atau arahan (prompt) yang skopnya lemah hanyalah pembaziran. Disiplin terletak pada menyasarkan pengkomputeran berat kepada masalah bernilai tinggi: reka bentuk rentas perkhidmatan, audit keselamatan, klon tingkah laku untuk migrasi warisan, dan menjana data latihan sintetik. Jurutera yang menguasai sasaran tersebut menjadi pengganda (multipliers). Mereka yang tidak menguasainya, tanpa mengira pampasan mereka, akan kelihatan mahal dalam cara yang salah.

Intipati Sebenar

Tesis Huang akhirnya adalah tentang membingkai semula perbelanjaan AI. Berhenti menganggap token LLM sebagai cukai operasi. Anggap ia sebagai bahan mentah yang ditukarkan kepada kepantasan kejuruteraan. Dalam bingkai tersebut, jurutera yang