Rekayasa perangkat lunak selalu mengejar metrik produktivitas yang salah. Manajer menghitung baris kode. Tim Agile melacak story points. Tidak ada satu pun yang secara andal mengukur apakah seorang pengembang sedang berpikir jernih atau sekadar banyak mengetik. CEO Nvidia Jensen Huang merasa ia memiliki tolok ukur yang lebih baik, dan itu tidak ada hubungannya dengan papan ketik. Dalam penampilannya baru-baru ini di Podcast All-In setelah GTC 2026, Huang berargumen bahwa ukuran nyata dari nilai seorang insinyur modern adalah seberapa banyak token AI yang mereka konsumsi dibandingkan dengan gaji mereka. Pesannya sangat lugas: jika Anda berpenghasilan setengah juta dolar setahun tetapi menghabiskan kurang dari setengah jumlah itu untuk layanan large language model, Anda mungkin gagal menggunakan alat yang membenarkan besarnya gaji Anda.
Sebuah Rasio yang Nyata
Metrik yang dijelaskan Huang sangat sederhana hingga mengejutkan. Ambil kompensasi tahunan seorang insinyur. Bandingkan dengan pengeluaran tahunan mereka untuk panggilan API LLM, proses fine-tuning, dan inferensi agen (agentic inference). Jika seorang insinyur sangat terampil dengan gaji $500.000 per tahun mengeluarkan kurang dari $250.000 untuk biaya token AI, Huang melihat adanya masalah. Hal ini menunjukkan bahwa pengembang tersebut bekerja secara terisolasi dari bantuan modern atau memperlakukan AI seperti mesin pencari yang dilebih-lebihkan, alih-alih sebagai kolaborator sejati.
Ini bukan izin untuk pengeluaran yang sembrono. Ini adalah ujian bagi kognisi yang menopang beban kerja. Premis Huang adalah bahwa insinyur elit harus melimpahkan sebanyak mungkin pekerjaan mental yang membosankan ke model-model paling mumpuni yang tersedia. Sesi debugging yang dulunya memakan waktu tiga hari dapat dipadatkan menjadi hitungan jam ketika sebuah model mampu memahami seluruh basis kode dalam konteksnya. Debat desain sistem yang biasanya membutuhkan rapat panjang dapat diselesaikan melalui pembuatan prototipe cepat dengan model penalaran (reasoning model). Bagi Huang, ambang batas $250.000 bukanlah plafon anggaran, melainkan lantai. Ini mewakili subsidi kecerdasan minimum yang dibutuhkan seorang insinyur tingkat atas untuk beroperasi dengan kapasitas penuh.
Pengembang yang berada di bawah garis tersebut melakukan terlalu banyak pekerjaan sendiri. Mereka melacak bug secara manual, menulis boilerplate dengan tangan, dan membaca ulang dokumentasi yang sebenarnya bisa disintesis oleh model dengan prompt yang tepat dalam hitungan detik. Di era di mana biaya inferensi menurun dan jendela konteks (context windows) semakin luas, penghematan token menandakan kurangnya pemanfaatan, bukan disiplin. Menurut logika ini, seorang insinyur yang gagal memanfaatkan AI secara agresif untuk meningkatkan hasil kerjanya dianggap berkinerja rendah.
Token sebagai Proksi untuk Daya Ungkit
Manajemen rekayasa tradisional menyukai hasil yang nyata. Tiket Jira yang ditutup. Commit yang didorong. Fitur yang dirilis. Angka-angka ini terasa aman karena dapat dihitung. Kerangka kerja Huang sebagian besar mengabaikan hal tersebut. Di bawah logikanya, seorang senior staff engineer mungkin menghasilkan lebih sedikit commit mentah dibandingkan karyawan tingkat menengah, namun menghasilkan nilai yang jauh lebih besar, karena produk nyata mereka adalah keputusan. Token menjadi buku besar untuk keputusan-keputusan tersebut.
Ketika seorang insinyur menghabiskan banyak biaya untuk inferensi LLM, mereka tidak sekadar membeli pembuatan teks. Mereka membeli pemikiran yang diparalelkan. Seorang insinyur bergaji $500.000 yang menggunakan jendela konteks masif untuk masalah refaktorisasi pada dasarnya sedang menjalankan belasan alur kognitif secara simultan, memeriksa kasus tepi (edge cases) di berbagai mikrolayanan, dan menguji ketahanan asumsi arsitektural tanpa harus menulis satu baris kode produksi pun. Token mengubah jam gaji menjadi hasil yang terkompresi. Token membeli kecepatan, pandangan arsitektural ke depan, dan kemampuan debugging yang jika dilakukan secara manual akan memakan ratusan jam.
Ini membalikkan struktur insentif lama. Pemimpin rekayasa secara historis bernegosiasi keras untuk diskon komputasi awan dan memperlakukan pengadaan SaaS sebagai pusat biaya yang harus diminimalkan. Huang menyarankan bahwa pola pikir tersebut terbalik untuk AI. Anggaran token harus berskala dengan bakat. Jika Anda mempekerjakan otak-otak mahal lalu membiarkan mereka kekurangan akses ke model termahal, Anda menjebak mereka dalam alur kerja manual. Mereka hanya akan menjadi pengetik berharga mahal. Tujuannya adalah apa yang disiratkan Huang sebagai kepadatan kecerdasan (intelligence density): kognisi terapan maksimum per jam manusia, meskipun tagihan cloud terlihat mengkhawatirkan pada pandangan pertama. Jika seorang insinyur tidak mengonsumsi cukup banyak token untuk membenarkan kompensasi tingginya, kemungkinan besar mereka gagal melimpahkan beban kognitif berat ke AI, sehingga membatasi dampak potensial mereka terhadap organisasi.
Pertahankan Tim, Perluas Komputasi
Kenaikan biaya operasional biasanya memicu peninjauan jumlah karyawan. CFO melihat tagihan API yang membengkak dan secara refleks bertanya siapa yang bisa dipangkas. Huang menawarkan resep yang sebaliknya. Alih-alih memperkecil tim agar sesuai dengan anggaran, perusahaan harus mengoptimalkan anggaran untuk memberdayakan tim.
Argumen ini bertumpu pada biaya penggantian dan beban koordinasi. Sebuah organisasi perangkat lunak warisan (legacy) mungkin menugaskan tiga puluh insinyur untuk memelihara sebuah monolit, meninjau pull request satu sama lain, dan melakukan migrasi layanan secara perlahan. Tim yang lebih kecil berisi lima insinyur yang sangat teraugmentasi, yang masing-masing menghabiskan kuota token kelas perusahaan, dapat menyamai atau melampaui throughput tersebut. Penghematan tidak ditemukan pada pos biaya API itu sendiri. Penghematan tersebut muncul dari hilangnya latensi komunikasi, siklus perekrutan, dan hambatan birokrasi.
Strategi ini hanya berhasil jika Anda merekrut insinyur yang dapat mengarahkan aliran token masif dengan penuh maksud. Ada perbedaan nyata antara pengembang yang menempelkan stack trace ke dalam chatbot dan pengembang yang mengorkestrasi pipeline multi-agent, memelihara pustaka konteks yang kaya, dan memvalidasi output halusinasi secara ketat. Profil yang terakhir lebih sulit ditemukan. Itulah alasan mengapa Huang mengaitkan metrik tersebut dengan gaji. Kompensasi tinggi harus berkorelasi dengan keterampilan orkestrasi yang tinggi. Anda tidak membayar seseorang setengah juta dolar hanya untuk memberikan prompt ke model seminggu sekali. Anda membayar mereka untuk mengelola ekosistem penalaran otomatis yang membangun sistem kompleks dengan kecepatan yang belum pernah terjadi sebelumnya.
Apa Artinya dalam Praktik
Bagi organisasi teknik, rasio token-terhadap-gaji bukanlah aturan akuntansi yang kaku, melainkan lebih merupakan titik pemeriksaan budaya. Para pemimpin harus bertanya apakah pengembang dengan gaji tertinggi mereka memiliki akses, pelatihan, dan mandat untuk menggunakan AI secara agresif. Apakah mereka menjalankan analisis konteks panjang pada kode warisan, atau apakah mereka masih melakukan grepping pada log baris demi baris? Apakah mereka menggunakan alat pengodean berbasis agen (agentic coding tools) untuk pengujian integrasi, atau apakah mereka menulis mock secara manual? Apakah proyek mereka terhambat oleh perhatian manusia atau oleh batasan laju (rate limits) API?
Jika jawabannya mengarah pada hambatan manusia, solusinya jarang sekali dengan menuntut jam kerja lebih banyak. Biasanya solusinya adalah dengan menaikkan batas atas (ceiling) token. Biarkan insinyur menjalankan lebih banyak agen. Biarkan mereka menjaga jendela konteks (context window) yang persisten tetap terbuka untuk seluruh service mesh. Biarkan mereka melakukan iterasi pada arsitektur lima puluh kali dalam satu sore, alih-alih hanya dua kali dalam seminggu. Ketika konsumsi token dipandang sebagai tanda rekayasa berdaya ungkit tinggi (high-leverage engineering) dan bukan biaya yang tidak perlu, struktur perizinan di dalam perusahaan akan berubah.
Tentu saja, pengeluaran saja tidak menjamin apa pun. Token yang dituangkan ke dalam kueri sepele atau prompt dengan cakupan yang buruk hanyalah pemborosan. Disiplinnya terletak pada pengarahan komputasi berat ke masalah bernilai tinggi: desain lintas layanan, audit keamanan, kloning perilaku (behavior-cloning) untuk migrasi warisan, dan pembuatan data pelatihan sintetis. Insinyur yang menguasai hal tersebut akan menjadi pengganda (multipliers). Mereka yang tidak, terlepas dari kompensasi mereka, akan terlihat mahal dengan cara yang salah.
Kesimpulan Utama
Tesis Huang pada akhirnya adalah tentang membingkai ulang pengeluaran AI. Berhentilah memperlakukan token LLM sebagai pajak operasional. Perlakukan mereka sebagai bahan baku yang diubah menjadi kecepatan rekayasa (engineering velocity). Dalam kerangka tersebut, insinyur yang
