Seorang pengembang mengambil model bahasa berukuran 350 juta parameter, melakukan fine-tuning, dan menyebarkannya sebagai asisten AI yang berfungsi penuh yang berjalan di dalam browser web modern apa pun—tanpa panggilan server, tanpa kunci API, tanpa biaya cloud.

Proyek ini menyertakan bobot (weights) model bersama dengan halaman web statis, memungkinkan agen untuk memilih alat, mengikat argumen, menyelesaikan referensi seperti “yang kedua,” dan menolak menjawab ketika kekurangan informasi—semuanya dilakukan sementara data Anda tetap berada di perangkat Anda sendiri.

Cara agen berbasis browser ini dibangun

Titik awalnya adalah keluarga LFM2.5 dari LiquidAI, khususnya varian parameter 230 M dan 350 M.

Alih-alih memasukkan katalog produk atau tabel harga ke dalam model, pelatih (trainer) mengajarkannya pola interaksi. Agen tersebut tidak pernah mengetahui SKU tertentu; ia belajar cara untuk:

  • Memilih alat yang sesuai untuk permintaan tertentu.
  • Mengikat argumen dan pengidentifikasi yang tepat ke alat tersebut.
  • Menafsirkan referensi yang ambigu (“selusin,” “yang kedua”).
  • Menarik teks eksternal dan menggunakannya untuk menjawab pertanyaan.
  • Menolak ketika informasi yang diperlukan tidak ada.
  • Menjaga percakapan tetap pada topik.

Kumpulan alatnya sengaja dibuat statis: list_items, get_item, search_knowledge, add_to_cart, remove_from_cart, clear_cart, checkout, dan navigate. Membekukan daftar (roster) mencegah model menghafal ID alat dan menjaga data fine-tuning tetap kecil.

Tiga pilihan teknik menjaga sistem tetap ringan:

  1. Daftar alat yang dibekukan – Model melihat daftar tindakan yang tetap, sehingga tidak memerlukan kosakata nama alat yang besar.
  2. RAG sebagai alat – Retrieval-augmented generation (RAG) bertindak seperti fungsi lainnya. Agen memanggil search_knowledge untuk mengambil teks, lalu memasukkan teks tersebut langsung ke dalam responsnya, menghindari pipeline pengambilan terpisah yang akan menambah latensi dan overhead memori.
  3. Decoding dengan batasan tata bahasa – Selama pembuatan (generation), decoder mengikuti tata bahasa sederhana yang memaksa output ke dalam struktur pemanggilan alat yang valid. Batasan ini menghilangkan pemborosan token dan mengurangi perintah yang salah format.

Pelatihan menggunakan distilasi data sintetis. Penulis menentukan 18 resep interaksi, yang masing-masing mendeskripsikan pertukaran tipikal antara pengguna dan asisten. Model “guru” yang lebih besar menghasilkan sisi bahasa alami, sementara skrip deterministik menghasilkan format pemanggilan alat yang tepat. Proses fine-tuning menghabiskan sekitar 30 juta token dan muat dalam satu GPU dengan memori 16 GB.

Mengapa on-device itu penting

  • Privasi – Semua perintah (prompt) pengguna tetap berada di memori browser. Tidak ada telemetri yang meninggalkan perangkat, yang sangat penting untuk kueri sensitif.
  • Kemampuan offline – Karena model disimpan dalam cache secara lokal, asisten dapat bekerja tanpa koneksi internet, membuka kemungkinan untuk pekerjaan lapangan atau perjalanan.
  • Biaya – Mengirimkan file model statis menghilangkan kebutuhan akan server inferensi bertenaga GPU yang berulang atau biaya API per panggilan.
  • Aksesibilitas – Navigasi antarmuka web yang kompleks berbasis suara menjadi layak dilakukan pada perangkat spesifikasi rendah, memperluas jangkauan aplikasi web ke pengguna yang mengandalkan teknologi bantu.

Keuntungan-keuntungan ini menggeser percakapan dari “Bisakah model raksasa menjawab ini?” menjadi “Seberapa kecil sebuah model dapat dibuat namun tetap memberikan bantuan yang berguna?”

Potensi keterbatasan

Model berukuran ini tidak dapat menyimpan fakta ensiklopedis. Ketika pengguna menanyakan harga produk tertentu atau berita terkini, asisten akan mengambil informasi melalui search_knowledge atau menolak dengan sopan. Desain tersebut melindungi privasi tetapi juga mengaitkan sistem dengan kualitas dan kesegaran sumber pengetahuan eksternalnya.

Apa yang perlu diperhatikan selanjutnya

Demo publik tersedia di URL GitHub Pages yang sederhana, dan kode sumbernya tersedia secara terbuka.

Kesimpulan: Dengan mengajarkan LLM berukuran sedang untuk mengikuti tata bahasa alat yang ketat dan dengan memperlakukan pengambilan data (retrieval) sebagai fungsi lainnya, pengembang dapat merilis asisten AI yang berguna yang sepenuhnya hidup di dalam browser—menawarkan privasi, penggunaan offline, dan nol biaya cloud tanpa mengorbankan kemampuan percakapan inti.