Deep Interaction stelt ontwikkelaars in staat om het redeneerproces van een taalmodel direct aan te passen, wat het succes van correcties met meer dan 25 % verhoogt en het tokenverbruik bij STEM-problemen met ongeveer 40 % vermindert.

Waarom bestaande oplossingen tekortschieten

Large language models (LLM's) die gebruikmaken van chain-of-thought prompting, breken complexe vragen af in een reeks logische stappen. Wanneer één stap misgaat, starten ontwikkelaars meestal de conversatie opnieuw of voegen ze een corrigerende prompt toe aan het begin. Beiden verspillen tijd: het model herhaalt de fout vaak of geeft een algemene verontschuldiging zonder er iets van te leren. Ontwikkelaars sturen uiteindelijk tientallen prompts om het model weer op het juiste spoor te krijgen, wat het aantal tokens en de rekenkosten opdrijft.

Wat Deep Interaction anders doet

De nieuwe techniek behandelt de output van het model als bewerkbare tekst in plaats van een 'black-box'-antwoord. De workflow is als volgt:

  1. De fout opsporen – de ontwikkelaar wijst de exacte stap in de redeneerketen aan die onjuist is.
  2. Ter plaatse bewerken – de ontwikkelaar herschrijft die regel, terwijl de omliggende correcte stappen behouden blijven.
  3. De bewerking distilleren – het systeem zet de door de mens gemaakte correctie om in een beknopte prompt die de beoogde logica vastlegt.
  4. Het model sturen – het LLM ontvangt deze gedistilleerde prompt en zet het redeneren voort vanaf het gecorrigeerde punt.

Door het model een gerichte correctie te geven in plaats van een volledige nieuwe prompt, wordt voorkomen dat eerdere, reeds correcte delen van het antwoord opnieuw worden gegenereerd.

Meetbare winst

Benchmarks op een reeks STEM-taken laten de impact duidelijk zien. Wanneer ontwikkelaars Deep Interaction gebruikten, steeg het aandeel succesvol gecorrigeerde antwoorden met meer dan een kwart in vergelijking met standaard re-prompting. Tegelijkertijd daalde het tokenverbruik met ongeveer 40 %, wat de kosten voor cloudcomputing verlaagt en interactieve applicaties versnelt.

Wie profiteert hiervan

  • Ontwikkelaars – Hoeven niet langer eindeloze loops voor prompt-tuning te schrijven. Eén enkele bewerking kan een logische fout oplossen, waardoor er meer tijd vrijkomt voor complexer werk.
  • Bedrijven die wetenschappelijke of technische tools bouwen – Betrouwbaardere redeneringen betekenen minder fouten in downstream-processen zoals simulaties, berekeningen of data-analysepijplijnen.
  • Eindgebruikers – Snellere reacties en lagere servicekosten verbeteren de algehele ervaring van AI-gestuurde assistenten.

Beperkingen en tegenargumenten

Deep Interaction gaat ervan uit dat de ontwikkelaar de exacte logische fout kan identificeren en verwoorden. In domeinen waar de fout subtiel is of de redenering ondoorzichtig, kan handmatige bewerking onpraktisch zijn. De gerapporteerde winst komt bovendien voort uit gecontroleerde STEM-benchmarks.

Conclusie

Deep Interaction verandert een ontwikkelaar van een passieve gebruiker in een actieve leraar, wat nauwkeurige en goedkope correcties van LLM-redeneringen mogelijk maakt.