Satya Nadella baru sahaja memulakan pertikaian terbuka dengan makmal-makmal yang dibantu pembinaannya oleh syarikatnya sendiri. Ketua eksekutif Microsoft mengeluarkan amaran tegas tentang bagaimana syarikat AI terbesar sedang menulis semula peraturan pemilikan data, dan mesej tersebut diterima dengan impak yang luar biasa. Dalam satu hantaran blog baru-baru ini, Nadella menuduh makmal perintis termasuk OpenAI dan Anthropic membina pasaran yang dimanipulasi. Mereka menuai data awam untuk melatih model besar, kemudian menggunakan terma perkhidmatan mereka untuk menghalang sesiapa pun daripada belajar daripada output yang dihasilkan oleh model tersebut. Hasilnya, hujah beliau, adalah pemindahan nilai sehala yang menyebabkan perusahaan membayar bil sambil menyerahkan pengetahuan proprietari mereka.
Piawaian Berganda Distilasi
Untuk memahami aduan tersebut, adalah membantu untuk melihat teknik yang sangat ingin disekat oleh maklab-maklab ini. Distilasi adalah kaedah latihan biasa di mana model yang lebih kecil dan khusus belajar daripada output model yang lebih besar, dan bukannya menyerap teks internet mentah dari awal. Sebuah syarikat pemula atau pasukan penyelidik mungkin memasukkan berjuta-juta prompt kepada model perintis, menangkap responsnya, dan menggunakan isyarat kaya tersebut untuk melatih model kompak yang berjalan secara tempatan atau memenuhi keperluan khusus. Ia lebih murah dan jauh kurang intensif tenaga berbanding membina model asas dari awal.
OpenAI dan Anthropic kedua-duanya melarang amalan ini dalam terma perkhidmatan mereka. Apabila mereka mengesan distilasi secara sistematik, mereka menganggapnya sebagai satu pelanggaran. Penguatkuasaan sering menyasarkan pesaing, terutamanya syarikat AI yang berpangkalan di China, yang dituduh menggunakan kaedah tersebut untuk merapatkan jurang keupayaan tanpa menyamai berbilion ringgit yang dibelanjakan untuk latihan asal.
Nadella menonjolkan ketegangan di pusat dasar ini. Maklab-maklab yang sama ini membina model utama mereka dengan merayap (crawling) web terbuka, mengikis (scraping) buku, forum, repositori kod, dan artikel, semuanya di bawah hujah undang-undang bahawa latihan pada data yang boleh diakses secara awam merupakan penggunaan adil (fair use). Mereka telah mengorek sumber awam. Namun, mereka kini memasang pagar undang-undang untuk menghalang sesiapa pun daripada menganggap output model mereka sebagai bahan pengajaran awam sebagai balasan. Anda boleh belajar daripada pengetahuan terbuka dunia, seolah-olah itu yang mereka katakan, tetapi tiada sesiapa pun boleh belajar daripada kami.
Asimetri ini penting melampaui debat akademik. Ia mewujudkan hierarki di mana segelintir penyedia infrastruktur mengawal siapa yang boleh mengetahui apa. Jika penggunaan adil menghalalkan pengambilan kecerdasan manusia yang telah diterbitkan, output model tersebut mula kelihatan seperti sumber awam yang diprivatisasikan. Pesaing dan pelanggan sama ada dihalang daripada mengitar semula isyarat tersebut menjadi alatan baharu. Segala keuntungan hanya mengalir kepada maklab-maklab terbesar.
Membayar Dua Kali untuk Kecerdasan Anda Sendiri
Nadella mencipta satu frasa untuk perangkap ekonomi yang beliau lihat sedang terbentuk: "paradoks maklumat terbalik" (reverse information paradox). Pada pandangan beliau, perusahaan kini membayar untuk kecerdasan buatan sebanyak dua kali, dan hanya satu daripada pembayaran tersebut yang muncul dalam invois.
Kos pertama adalah jelas. Syarikat membeli kredit API, melanggan Copilot, atau melesenkan perkhidmatan chatbot. Kos kedua adalah tersembunyi. Setiap kali seorang pekerja membetulkan fakta yang berhalusinasi, menilai respons sebagai membantu, atau memperhalusi laporan yang dijana, tindakan itu menghasilkan apa yang dipanggil Nadella sebagai "sisa" (exhaust). Ia adalah jejak pembetulan, data pilihan, dan log interaksi yang dijana semasa kerja sebenar.
Sisa ini bukanlah sampah digital. Ia sering mengandungi logik perniagaan yang sukar diperoleh. Pasukan logistik mungkin memberikan prompt kepada model untuk mengoptimumkan laluan penghantaran menggunakan kekangan dalaman yang telah dibangunkan oleh firma tersebut selama bertahun-tahun. Jabatan undang-undang mungkin membetulkan bahasa kontrak secara berulang kali sehingga outputnya sepadan dengan gaya penulisan syarikat. Kumpulan penyelidikan farmaseutikal boleh membuat pertanyaan tentang data klinikal dengan cara yang mendedahkan keutamaan strategik. Apabila interaksi tersebut melalui API pihak ketiga, penyedia dapat melihat keseluruhan pertukaran tersebut. Model tersebut belajar bagaimana rupa jawapan yang baik untuk domain khusus tersebut.
Lama-kelamaan, maklum balas ini menjadikan model umum penyedia lebih tajam pada tugas tepat yang diupah oleh pelanggan untuk dilaksanakan. Penyedia kemudiannya boleh berpaling dan menjual keupayaan yang telah dipertingkatkan itu kepada pesaing pelanggan, atau melancarkan produk sampingan yang meniru aliran kerja khusus tersebut. Perusahaan asal telah membayar yuran langganan, menyumbangkan kepakaran proprietari mereka, dan secara berkesan melatih pesaing mereka sendiri.
Mengapa AI Berdaulat Beralih daripada Istilah Popular kepada Strategi
Tindakan logik terhadap penyusutan ini adalah untuk mengambil semula kawalan ke atas gelung pembelajaran. Hujah Nadella jelas direka untuk meletakkan Microsoft sebagai sejenis pemilik tanah yang berbeza. Daripada mendesak pelanggan menyalurkan kecerdasan mereka ke dalam kotak hitam yang berpusat, beliau menyokong persekitaran di mana pelanggan memegang kunci tersebut.
Di sinilah perbincangan mengenai AI berdaulat memperoleh kepentingan praktikal. Menjalankan model di dalam awan peribadi, pusat data dalam premis, atau rangkaian maya yang dikawal ketat bermakna data interaksi tidak akan meninggalkan sempadan organisasi tersebut. Perusahaan masih mendapat manfaat daripada model asas moden, tetapi pemberat, prom, dan data pilihan kekal di dalam sempadan yang diuruskan oleh syarikat tersebut.
Microsoft telah membina perniagaan awan Azure berasaskan janji penyebaran peribadi dan residensi data serantau ini. Dalam hantaran beliau, Nadella memberi isyarat bahawa Microsoft mahu menjadi platform di mana perusahaan boleh mengendalikan latihan dan inferens mereka sendiri tanpa secara tidak sengaja menghantar harta intelek mereka kepada penyedia model yang jauh. Tawaran tersebut adalah ringkas: gunakan AI yang berkuasa, tetapi simpan sisa data anda.
Vendor lain turut mengeluarkan kenyataan yang serupa, tetapi campur tangan Nadella membawa impak tambahan disebabkan kerjasama mendalam Microsoft dengan OpenAI. Bagi seorang CEO yang
