Open-source AI telah berkembang menjadi ekosistem yang luas di mana satu produk mungkin menarik kode dari lusinan repositori, bergantung pada data pelatihan dari berbagai sumber, dan berjalan pada konfigurasi perangkat keras khusus yang hanya didokumentasikan secara lengkap oleh sedikit tim. Melacak dependensi ini sangatlah sulit. Memahami bagian mana dari tumpukan (stack) tersebut yang terpapar ke internet jauh lebih sulit lagi. Rilis Open Source AI Gap Map v0.1 oleh Current AI berupaya memberikan keteraturan pada kekacauan tersebut, dan tim keamanan harus menganggapnya sebagai bacaan wajib.
Indeks ini mengatalogkan 421 produk AI sumber terbuka. Indeks ini membaginya menjadi empat kategori: model AI, dataset, perangkat lunak, dan perangkat keras. Di balik layar, seluruh proyek ini berjalan di atas 1.184 file YAML yang melacak lebih dari 16.000 repositori GitHub. Kesenjangan antara 421 produk dan 16.000 repositori tersebut menceritakan kisahnya sendiri. Sebagian besar aplikasi AI bukanlah monolit yang berdiri sendiri. Mereka adalah kumpulan dari mesin inferensi (inference engines), skrip fine-tuning, pemuat data (data loaders), tolok ukur evaluasi (evaluation benchmarks), dan lapisan driver, yang masing-masing berada di repositorinya sendiri dengan pemelihara, riwayat commit, dan profil kerentanan masing-masing.
Current AI menerbitkan dataset tersebut di bawah lisensi MIT dan menjadikannya sepenuhnya publik. Keterbukaan itulah intinya. Siapa pun dapat mengunduhnya, mengurai (parse) YAML-nya, dan membangun alat (tooling) di atasnya. Bagi pembela (defenders), aksesibilitas tersebut adalah sebuah peluang. Bagi penyerang (attackers), hal itu sama nyamannya.
Apa yang Sebenarnya Dilacak oleh Peta Ini
Sebagian besar organisasi yang menggunakan AI tidak memiliki inventaris yang jelas tentang apa yang telah mereka terapkan. Sebuah tim mungkin mengunduh model bahasa dari hub populer, menginstal beberapa paket Python untuk menjalankannya, dan menganggap tugas selesai. Namun, di balik alur kerja sederhana tersebut, terdapat rangkaian dependensi yang bersarang (nested). Bobot model (model weights) berasal dari satu repositori. Konfigurasi tokenizer berasal dari repositori lain. Kerangka kerja inferensi (inference framework) mungkin merupakan fork dari proyek ketiga. Driver CUDA dan citra kontainer (container images) menarik dari lebih banyak sumber lagi.
Gap Map menangkap hal ini dengan mengatur 1.184 file YAML-nya di sekitar 421 produk AI yang berbeda. Lebih dari 16.000 repositori GitHub yang dipetakan di sini mewakili kode, konfigurasi, dan artefak aktual yang membuat produk-produk tersebut berfungsi. Dengan memisahkan entri ke dalam model, dataset, perangkat lunak, dan perangkat keras, indeks ini memicu pertanyaan mendasar: apakah Anda tahu lapisan mana dari keempat lapisan ini yang benar-benar disentuh oleh sistem Anda?
Jika Anda menjalankan model bahasa besar (large language model) sumber terbuka di lingkungan produksi, Anda kemungkinan besar menyentuh keempatnya. Anda bergantung pada bobot dan arsitektur model. Anda bergantung pada dataset yang digunakan untuk pra-pelatihan (pre-training) atau fine-tuning, meskipun Anda tidak pernah mengunduhnya secara langsung. Anda bergantung pada perangkat lunak untuk mengonversi, menguantisasi (quantize), atau menyajikan (serve) model tersebut. Dan jika Anda menjalankan pada GPU atau akselerator khusus, Anda bergantung pada tumpukan firmware dan driver yang termasuk dalam kategori perangkat keras.
Pedang Bermata Dua bagi Keamanan
Dataset ini melayani dua pihak, dan para pemimpin keamanan perlu memahami kedua sisinya.
Dari sisi defensif, Gap Map berfungsi seperti buku telepon untuk rantai pasokan AI Anda. Anda dapat membandingkan repositori dan alat yang diandalkan organisasi Anda dengan indeks ini dan menemukan celah dalam visibilitas Anda. Jika repositori kritis muncul di peta tetapi tidak ada dalam daftar material perangkat lunak (software bill of materials) Anda, Anda kemungkinan besar telah menemukan infrastruktur AI bayangan (shadow AI). Hal itu patut diketahui sebelum lawan menemukannya untuk Anda.
Dari sisi ofensif, dataset ini adalah emas pengintaian (reconnaissance). Penyerang terus-menerus memindai infrastruktur AI yang terpapar, endpoint penyajian model, dan dependensi yang rentan dalam alur kerja (pipeline) ML yang populer. Gap Map memberi mereka daftar target terstruktur yang dapat dibaca mesin, yang disusun tepat berdasarkan kategori yang mereka pedulikan. Sebuah parser YAML tunggal dapat mengekstrak ribuan URL repositori, dan dari sana seorang penyerang dapat melakukan referensi silang terhadap kerentanan yang diketahui, mencari instansi publik yang salah konfigurasi, atau mengidentifikasi target bernilai tinggi untuk serangan kebingungan dependensi (dependency confusion attacks).
Karena datanya berlisensi MIT dan bersifat publik, tidak ada hambatan untuk masuk. Tanpa langganan, tanpa proses persetujuan. Pilihan desain tersebut memaksimalkan kegunaan bagi peneliti dan pembela, tetapi juga memaksimalkan kegunaan bagi aktor ancaman. File yang sama yang membantu Anda memperkuat (harden) stack Anda juga membantu orang lain membangun daftar target.
Apa yang Harus Dilakukan dengan Informasi Ini
Perlakukan dataset ini persis seperti Anda memperlakukan umpan intelijen ancaman (threat intelligence feed). Jangan hanya menandainya (bookmark) lalu melupakannya. Lakukan pemeriksaan aktif terhadap lingkungan Anda.
Mulailah dengan menarik daftar setiap komponen AI sumber terbuka yang saat ini digunakan oleh tim Anda. Lihatlah lebih dari sekadar yang terlihat jelas. Tanyakan repositori mana yang menyediakan tokenizer, skrip evaluasi, pustaka kuantisasi, dan citra dasar kontainer Anda. Kemudian periksa repositori tersebut terhadap 16.000 repositori yang dilacak dalam Gap Map. Jika Anda menemukan kecocokan, Anda telah mengonfirmasi bahwa dependensi Anda berada di salah satu sudut yang paling menonjol dalam indeks dunia AI sumber terbuka. Keunggulan tersebut bagaikan pisau bermata dua. Hal ini biasanya berarti pemeliharaan yang aktif dan pengawasan komunitas, tetapi itu juga berarti penyerang mengetahui keberadaan repositori ini.
Selanjutnya, lihatlah struktur YAML itu sendiri. Masing-masing dari 1.184 file tersebut menghubungkan produk ke repositori dasarnya dalam format yang terstandarisasi. Anda dapat menulis skrip sederhana untuk membandingkan manifes dependensi, daftar paket, atau ekspor SBOM Anda dengan pemetaan ini. Jika Anda menemukan bahwa production stack Anda bergantung pada repositori yang belum pernah Anda dengar, gali lebih dalam. Dependensi yang tidak dikenal adalah tempat serangan rantai pasokan bersembunyi.
Berikan perhatian khusus pada lapisan perangkat keras. Tim keamanan sering kali berfokus pada perangkat lunak dan model, sementara menganggap driver dan firmware sebagai gangguan latar belakang. Gap Map secara eksplisit mengindeks repositori terkait perangkat keras, yang seharusnya mengingatkan Anda bahwa tumpukan driver GPU, compiler toolchains, dan firmware akselerator juga merupakan kode. Mereka memiliki bug. Mereka diperbarui. Dan ketika sudah kedaluwarsa, mereka bisa menjadi target termudah dalam pipeline Anda.
Akhirnya, gunakan...
