Neon Functions unterstützt jetzt Streaming-Verbindungen mit unbegrenzter Dauer, wodurch KI-Agenten einen Live-Kanal für Sekunden, Minuten oder länger offen halten können, ohne die Timeout-Limits zu erreichen, die die meisten serverlosen Workloads beenden. Die Änderung ist entscheidend für alle, die Chat-Assistenten oder Tool-nutzende Bots entwickeln, da ein unterbrochener Stream ein Gespräch unterbricht und die Benutzererfahrung ruiniert.

Warum Serverless und KI-Agenten bisher nicht zusammenpassten

Die meisten Serverless-Plattformen sind für schnelle Fire-and-Forget-Aufgaben konzipiert. Sie erzwingen harte Ausführungslimits – oft 10 Sekunden in Free-Tiers und 60 Sekunden in kostenpflichtigen Tarifen –, um Ressourcen vorhersehbar zu halten. Ein KI-Agent verbringt jedoch Zeit mit dem Nachdenken, dem Aufrufen externer Tools und dem Ausgeben von Tokens, während diese generiert werden. Diese „Denkphase“ kann sich oft über Dutzende von Sekunden hinziehen, und der Token-Stream kann so lange fortgesetzt werden, wie das Modell Output produziert. Wenn der Timer der Plattform abläuft, wird die Verbindung geschlossen und der Client sieht einen unterbrochenen Stream.

Neons Antwort: Standardmäßig langlebiges Streaming

Neon Functions ändert die Spielregeln. Ein Funktionsaufruf kann unbegrenzt offen bleiben und Daten über WebSockets oder Server-Sent Events (SSE) ohne spezielle Konfiguration liefern. Die Plattform behandelt einen langen Stream wie eine normale Anfrage, sodass Entwickler die Logik schreiben, die den Stream generiert, und Neon den Rest erledigen lassen.

In einem kürzlich durchgeführten Test demonstrierten zwei Endpunkte dieses Verhalten:

  • Heartbeat-Endpunkt – die Funktion gab einmal pro Sekunde für 90 Sekunden einen „Tick“ aus. Typische Serverless-Tarife hätten die Anfrage nach 10 oder 60 Sekunden beendet; Neon hielt die Verbindung so lange aufrecht, bis die Funktion von selbst fertig war.
  • Token-Relay-Endpunkt – die Funktion streamte Tokens von einem KI-Modell an den Client, sobald jedes Token erzeugt wurde. Nutzer sahen die Antwort Wort für Wort erscheinen, anstatt auf den gesamten Textblock warten zu müssen.

Beide Beispiele erforderten nur eine einzige Anfrage vom Client; Polling oder Keep-Alive-Tricks waren nicht erforderlich.

Wer profitiert und wer vorsichtig bleiben sollte

Teams, die konversationelle Assistenten, Tool-nutzende Agenten oder Dienste entwickeln, die inkrementelle Ergebnisse liefern müssen, profitieren sofort: Das Timeout fällt weg. Das Ergebnis sind einfacherer Code, geringere Latenzzeiten und eine reibungslosere Benutzererfahrung.

Die Kompromisse sind jedoch beachtenswert:

  • Request-only-Modell – Neon Functions verwaltet Streams, die an eine aktive Anfrage gebunden bleiben. Hintergrund-Jobs, die über die Anfrage hinauslaufen müssen, benötigen weiterhin einen separaten Scheduler wie Inngest oder eine ähnliche Workflow-Engine.
  • Cold Starts – Funktionen, die im Leerlauf sind, können auf Null skalieren, sodass die nächste Anfrage eine Cold-Start-Verzögerung verursachen kann. Ein aktiver Stream verhindert das Herunterskalieren, aber die erste Anfrage nach einer Inaktivität verursacht dennoch die Startkosten.

Worauf man als Nächstes achten sollte

Das Fazit: Neon Functions beseitigt die Timeout-Obergrenze, die KI-Entwickler lange Zeit zu Workarounds gezwungen hat. Indem Neon eine Anfrage so lange offen hält, wie der Agent Zeit zum Denken und Sprechen benötigt, macht es das Deployment von Streaming-KI-Agenten so einfach wie das jeder anderen serverlosen Funktion.