Bir geliştirici, 350 milyon parametreli bir dil modelini aldı, ince ayar (fine-tune) yaptı ve herhangi bir modern web tarayıcısında çalışan tam işlevsel bir yapay zeka asistanı olarak yayına aldı; sunucu çağrısı yok, API anahtarı yok, bulut faturası yok.

Proje, modelin ağırlıklarını statik bir web sayfasıyla birlikte sunarak ajanın araçlar seçmesine, argümanları bağlamasına, "ikincisi" gibi referansları çözümlemesine ve bilgi eksik olduğunda cevap vermeyi reddetmesine olanak tanıyor; tüm bunlar yapılırken verileriniz kendi cihazınızda kalıyor.

Tarayıcı tabanlı ajan nasıl inşa edildi

Başlangıç noktası, LiquidAI'ın LFM2.5 ailesi, özellikle de 230 M ve 350 M parametreli varyantlarıydı.

Modelin içine ürün katalogları veya fiyat tabloları tıkıştırmak yerine, eğitici modele etkileşim örüntüleri öğretildi. Ajan hiçbir zaman belirli bir SKU'yu bilmez; şunları yapmayı öğrenir:

  • Verilen bir istek için uygun aracı seçmek.
  • O araca doğru argümanları ve tanımlayıcıları bağlamak.
  • Belirsiz referansları (“bir düzine”, “ikincisi”) yorumlamak.
  • Harici metni çekmek ve soruları yanıtlamak için kullanmak.
  • Gerekli bilgi eksik olduğunda reddetmek.
  • Konuşmayı konu dahilinde tutmak.

Araç seti kasıtlı olarak statiktir: list_items, get_item, search_knowledge, add_to_cart, remove_from_cart, clear_cart, checkout ve navigate. Listeyi dondurmak, modelin araç kimliklerini (ID) ezberlemesini önler ve ince ayar verilerini küçük tutar.

Sistemi hafif tutan üç mühendislik seçimi:

  1. Dondurulmuş araç listesi – Model sabit bir eylem listesi görür, bu nedenle geniş bir araç ismi kelime dağarcığına ihtiyaç duymaz.
  2. Bir araç olarak RAG – Veri geri çağırma ile zenginleştirilmiş üretim (RAG), diğer tüm işlevler gibi hareket eder. Ajan, metni getirmek için search_knowledge işlevini çağırır ve ardından bu metni doğrudan yanıtına ekler; böylece gecikme ve bellek yükü ekleyecek ayrı bir geri çağırma hattından kaçınmış olur.
  3. Dil bilgisi kısıtlamalı kod çözme (Grammar-constrained decoding) – Üretim sırasında kod çözücü, çıktıyı geçerli bir araç çağırma yapısına zorlayan basit bir dil bilgisi izler. Bu kısıtlama, boşa harcanan token'ları ortadan kaldırır ve hatalı komutları azaltır.

Eğitimde sentetik veri damıtma (distillation) kullanıldı. Yazar, her biri tipik bir kullanıcı-asistan etkileşimini tanımlayan 18 etkileşim tarifi belirledi. Daha büyük bir "öğretmen" model doğal dil kısmını oluştururken, deterministik bir betik tam araç çağırma formatını üretti. İnce ayar işlemi yaklaşık 30 milyon token tüketti ve 16 GB belleğe sahip tek bir GPU'ya sığdı.

Cihaz üzerinde çalışmasının önemi

  • Gizlilik – Tüm kullanıcı istemleri tarayıcı belleğinde kalır. Hassas sorgular için önemli olan hiçbir telemetri verisi cihazdan dışarı çıkmaz.
  • Çevrimdışı yetenek – Model yerel olarak önbelleğe alındığı için asistan internet bağlantısı olmadan çalışır; bu da saha çalışmaları veya seyahatler için olanaklar sağlar.
  • Maliyet – Statik model dosyalarının sunulması, yinelenen GPU destekli çıkarım (inference) sunucularını veya çağrı başına API ücretlerini ortadan kaldırır.
  • Erişilebilirlik – Karmaşık web arayüzlerinin sesle yönetilmesi düşük özellikli cihazlarda mümkün hale gelerek, web uygulamalarının yardımcı teknolojiye ihtiyaç duyan kullanıcılara ulaşımını genişletir.

Bu avantajlar, tartışmayı "Devasa bir model bunu yanıtlayabilir mi?" sorusundan "Faydalı bir yardım sunarken bir model ne kadar küçük olabilir?" sorusuna kaydırıyor.

Potansiyel sınırlamalar

Bu boyuttaki bir model ansiklopedik gerçekleri hafızasında tutamaz. Bir kullanıcı belirli bir ürün fiyatı veya güncel bir haber başlığı sorduğunda, asistan bilgiyi ya search_knowledge aracılığıyla getirir ya da nazikçe reddeder. Bu tasarım gizliliği korur ancak sistemi harici bilgi kaynağının kalitesine ve güncelliğine de bağlar.

Sırada ne var

Genel demo basit bir GitHub Pages URL'sinde yer alıyor ve kaynak kodu açıkça erişilebilir durumda.

Özet: Mütevazı boyutlardaki bir LLM'e katı bir araç dil bilgisi izlemeyi öğreterek ve veri geri çağırmayı sadece başka bir işlev olarak ele alarak, geliştiriciler temel konuşma yeteneklerinden ödün vermeden gizlilik, çevrimdışı kullanım ve sıfır bulut maliyeti sunan, tamamen tarayıcıda yaşayan kullanışlı bir yapay zeka asistanı sunabilirler.