Neon Functions kini menyokong sambungan penstriman berdurasi tanpa had, membolehkan ejen AI mengekalkan saluran langsung yang terbuka selama beberapa saat, minit atau lebih lama tanpa mencapai had masa tamat (timeout) yang biasanya menghentikan kebanyakan beban kerja serverless. Perubahan ini penting bagi sesiapa yang membina pembantu gaya sembang atau bot yang menggunakan alatan, kerana penstriman yang terputus akan melambatkan perbualan dan merosakkan pengalaman pengguna.

Mengapa serverless dan ejen AI sering tidak sehaluan

Kebanyakan platform serverless dibina untuk tugasan pantas jenis "fire-and-forget" (hantar dan lupakan). Ia menguatkuasakan had pelaksanaan yang ketat—selalunya 10 saat pada pelan percuma dan 60 saat pada pelan berbayar—untuk memastikan sumber boleh diramal. Walau bagaimanapun, ejen AI meluangkan masa untuk berfikir, memanggil alatan luaran, dan mengeluarkan token semasa ia dijana. Fasa "berfikir" itu sering berlarutan sehingga berpuluh-puluh saat, dan aliran token boleh berterusan selagi model menghasilkan output. Apabila pemasa platform tamat, ia akan menutup sambungan dan klien akan melihat penstriman yang terputus.

Jawapan Neon: penstriman jangka panjang secara lalai

Neon Functions mengubah keadaan. Panggilan fungsi boleh kekal terbuka tanpa had, menghantar data melalui WebSockets atau Server-Sent Events (SSE) tanpa sebarang konfigurasi khas. Platform ini menganggap aliran panjang sebagai permintaan biasa, jadi pembangun hanya perlu menulis logik yang menjana aliran tersebut dan membiarkan Neon mengendalikan selebihnya.

Dalam ujian baru-baru ini, dua titik akhir (endpoints) menunjukkan tingkah laku tersebut:

  • Titik akhir Heartbeat – fungsi tersebut mengeluarkan "tick" sekali setiap saat selama 90 saat. Tahap serverless biasa akan menamatkan permintaan selepas 10 atau 60 saat; Neon mengekalkan sambungan sehingga fungsi itu selesai dengan sendirinya.
  • Titik akhir Token-relay – fungsi tersebut menstrimkan token daripada model AI kepada klien sebaik sahaja setiap token dihasilkan. Pengguna dapat melihat jawapan muncul kata demi kata dan bukannya menunggu keseluruhan blok teks.

Kedua-dua contoh ini hanya memerlukan satu permintaan daripada klien; tiada teknik polling atau keep-alive diperlukan.

Siapa yang mendapat manfaat, dan siapa yang perlu berwaspada

Pasukan yang membina pembantu perbualan, ejen yang menggunakan alatan, atau sebarang perkhidmatan yang perlu menghantar hasil secara berperingkat mendapat kelebihan segera: masalah masa tamat (timeout) hilang. Hasilnya ialah kod yang lebih ringkas, kependaman (latency) yang lebih rendah, dan pengalaman pengguna yang lebih lancar.

Pertukaran (trade-offs) yang perlu diperhatikan:

  • Model hanya permintaan (Request-only model) – Neon Functions mengendalikan aliran yang kekal terikat pada permintaan aktif. Tugasan latar belakang yang mesti bertahan lebih lama daripada permintaan masih memerlukan penjadual berasingan seperti Inngest atau enjin aliran kerja yang serupa.
  • Permulaan sejuk (Cold starts) – Fungsi yang tidak aktif boleh diskalakan ke sifar, jadi permintaan seterusnya mungkin mengalami kelewatan permulaan sejuk. Aliran aktif menghalang penskalaan ke bawah, tetapi permintaan pertama selepas tempoh tidak aktif masih akan menanggung kos permulaan.

Apa yang perlu diperhatikan seterusnya

Kesimpulannya: Neon Functions menghapuskan had masa tamat yang sekian lama memaksa pembangun AI menggunakan jalan penyelesaian alternatif (workarounds). Dengan membiarkan permintaan kekal terbuka selama mana ejen perlu berfikir dan bercakap, Neon menjadikan penyebaran ejen AI penstriman semudah mana-mana fungsi serverless yang lain.