Ein Entwickler nahm ein Sprachmodell mit 350 Millionen Parametern, führte ein Fine-Tuning durch und implementierte es als voll funktionsfähigen KI-Assistenten, der direkt in jedem modernen Webbrowser läuft – ohne Serveraufrufe, ohne API-Keys, ohne Cloud-Kosten.

Das Projekt liefert die Modellgewichte zusammen mit einer statischen Webseite aus, wodurch der Agent Werkzeuge auswählen, Argumente binden, Referenzen wie „das zweite“ auflösen und die Antwort verweigern kann, wenn ihm Informationen fehlen – und das alles, während Ihre Daten auf Ihrem eigenen Gerät bleiben.

So wurde der browserbasierte Agent gebaut

Der Ausgangspunkt war die LFM2.5-Familie von LiquidAI, speziell die Varianten mit 230 Mio. und 350 Mio. Parametern.

Anstatt Produktkataloge oder Preistabellen in das Modell zu pressen, brachte das Training ihm Interaktionsmuster bei. Der Agent kennt nie eine spezifische SKU; er lernt stattdessen, wie er:

  • das passende Werkzeug für eine bestimmte Anfrage auswählt.
  • die richtigen Argumente und Identifikatoren an dieses Werkzeug bindet.
  • mehrdeutige Referenzen („ein Dutzend“, „das zweite“) interpretiert.
  • externen Text abruft und diesen nutzt, um Fragen zu beantworten.
  • eine Antwort ablehnt, wenn die erforderlichen Informationen fehlen.
  • das Gespräch beim Thema hält.

Das Werkzeugset ist bewusst statisch gehalten: list_items, get_item, search_knowledge, add_to_cart, remove_from_cart, clear_cart, checkout und navigate. Das Einfrieren der Liste verhindert, dass das Modell Tool-IDs auswendig lernt, und hält die Fine-Tuning-Daten klein.

Drei technische Entscheidungen halten das System leichtgewichtig:

  1. Eingefrorene Werkzeugliste – Das Modell sieht eine feste Liste von Aktionen, sodass es keinen großen Wortschatz an Tool-Namen benötigt.
  2. RAG als Werkzeug – Retrieval-Augmented Generation (RAG) fungiert wie jede andere Funktion. Der Agent ruft search_knowledge auf, um Text abzurufen, und fügt diesen Text dann direkt in seine Antwort ein. Dadurch wird eine separate Retrieval-Pipeline vermieden, die Latenz und Speicherbedarf erhöhen würde.
  3. Grammatikgesteuerte Dekodierung – Während der Generierung folgt der Decoder einer einfachen Grammatik, die den Output in eine gültige Tool-Call-Struktur zwingt. Diese Einschränkung verhindert verschwendete Token und reduziert fehlerhafte Befehle.

Das Training nutzte die Destillation synthetischer Daten. Der Autor definierte 18 Interaktionsrezepte, die jeweils einen typischen Austausch zwischen Nutzer und Assistent beschreiben. Ein größeres „Teacher“-Modell generierte die natürliche Sprache, während ein deterministisches Skript das exakte Tool-Call-Format erzeugte. Der Fine-Tuning-Durchlauf verbrauchte etwa 30 Millionen Token und passte auf eine einzige GPU mit 16 GB Speicher.

Warum On-Device wichtig ist

  • Datenschutz – Alle Nutzeranfragen bleiben im Speicher des Browsers. Es werden keine Telemetriedaten das Gerät verlassen, was bei sensiblen Abfragen entscheidend ist.
  • Offline-Fähigkeit – Da das Modell lokal zwischengespeichert wird, funktioniert der Assistent auch ohne Internetverbindung, was Möglichkeiten für die Arbeit im Außendienst oder auf Reisen eröffnet.
  • Kosten – Das Ausliefern statischer Modelldateien macht wiederkehrende GPU-gestützte Inferenzserver oder API-Gebühren pro Aufruf überflüssig.
  • Barrierefreiheit – Die sprachgesteuerte Navigation komplexer Web-Interfaces wird auf Geräten mit geringer Leistung machbar, wodurch die Reichweite von Webanwendungen auf Nutzer ausgeweitet wird, die auf assistive Technologien angewiesen sind.

Diese Vorteile verschieben die Diskussion von „Kann ein riesiges Modell das beantworten?“ hin zu „Wie klein kann ein Modell sein und dennoch nützliche Unterstützung bieten?“

Potenzielle Einschränkungen

Ein Modell dieser Größe kann kein enzyklopädisches Wissen speichern. Wenn ein Nutzer nach einem bestimmten Produktpreis oder einer aktuellen Schlagzeile fragt, ruft der Assistent die Informationen entweder über search_knowledge ab oder lehnt die Anfrage höflich ab. Dieses Design schützt die Privatsphäre, bindet das System jedoch auch an die Qualität und Aktualität seiner externen Wissensquelle.

Was als Nächstes zu beachten ist

Die öffentliche Demo ist unter einer einfachen GitHub-Pages-URL erreichbar, und der Quellcode ist frei verfügbar.

Fazit: Indem man einem LLM moderater Größe beibringt, einer strengen Tool-Grammatik zu folgen, und Retrieval wie eine weitere Funktion behandelt, können Entwickler einen nützlichen KI-Assistenten ausliefern, der vollständig im Browser lebt – und dabei Datenschutz, Offline-Nutzung und null Cloud-Kosten bietet, ohne die grundlegenden Gesprächsfähigkeiten zu opfern.