Neon Functions kini mendukung koneksi streaming berdurasi tak terbatas, memungkinkan agen AI menjaga saluran tetap terbuka selama detik, menit, atau lebih lama tanpa terbentur batas timeout yang biasanya mematikan sebagian besar beban kerja serverless. Perubahan ini sangat penting bagi siapa pun yang membangun asisten gaya chat atau bot pengguna alat, karena stream yang terputus akan menghentikan percakapan dan merusak pengalaman pengguna.
Mengapa serverless dan agen AI sering tidak sejalan
Sebagian besar platform serverless dibangun untuk tugas-tugas cepat yang bersifat 'fire-and-forget'. Platform tersebut menerapkan batas eksekusi yang ketat—sering kali 10 detik pada tier gratis dan 60 detik pada paket berbayar—untuk menjaga sumber daya tetap terprediksi. Namun, seorang agen AI menghabiskan waktu untuk berpikir, memanggil alat eksternal, dan mengeluarkan token saat token tersebut dihasilkan. Fase “berpikir” tersebut sering kali memakan waktu hingga puluhan detik, dan aliran token dapat berlanjut selama model menghasilkan output. Ketika timer platform habis, koneksi akan ditutup dan klien akan melihat stream yang terputus.
Solusi Neon: streaming berdurasi panjang secara default
Neon Functions membalikkan keadaan. Sebuah panggilan fungsi dapat tetap terbuka tanpa batas waktu, mengirimkan data melalui WebSockets atau Server-Sent Events (SSE) tanpa konfigurasi khusus apa pun. Platform ini memperlakukan stream yang panjang sebagai permintaan normal, sehingga pengembang cukup menulis logika yang menghasilkan stream dan membiarkan Neon menangani sisanya.
Dalam pengujian baru-baru ini, dua endpoint mendemonstrasikan perilaku tersebut:
- Endpoint Heartbeat – fungsi tersebut mengeluarkan “tick” sekali per detik selama 90 detik. Tier serverless biasa akan menghentikan permintaan setelah 10 atau 60 detik; Neon menjaga koneksi tetap hidup hingga fungsi selesai dengan sendirinya.
- Endpoint Token-relay – fungsi tersebut melakukan streaming token dari model AI ke klien segera setelah setiap token dihasilkan. Pengguna melihat jawaban muncul kata demi kata, alih-alih menunggu seluruh blok teks selesai.
Kedua contoh tersebut hanya memerlukan satu permintaan dari klien; tidak diperlukan teknik polling atau keep-alive.
Siapa yang diuntungkan, dan siapa yang perlu tetap waspada
Tim yang membangun asisten percakapan, agen pengguna alat, atau layanan apa pun yang perlu mendorong hasil secara bertahap akan langsung merasakan keuntungannya: timeout tidak lagi menjadi masalah. Hasilnya adalah kode yang lebih sederhana, latensi yang lebih rendah, dan pengalaman pengguna yang lebih lancar.
Beberapa hal yang perlu diperhatikan (trade-offs):
- Model khusus permintaan (Request-only model) – Neon Functions menangani stream yang tetap terhubung dengan permintaan aktif. Pekerjaan latar belakang (background jobs) yang harus berjalan lebih lama dari permintaan tersebut tetap memerlukan penjadwal terpisah seperti Inngest atau mesin alur kerja (workflow engine) serupa.
- Cold starts – Fungsi yang sedang menganggur dapat melakukan scale to zero, sehingga permintaan berikutnya mungkin mengalami penundaan cold-start. Stream yang aktif mencegah scaling down, tetapi permintaan pertama setelah masa tidak aktif tetap akan menanggung biaya startup.
Apa yang perlu diperhatikan selanjutnya
Intinya: Neon Functions menghilangkan batasan timeout yang selama ini memaksa pengembang AI untuk menggunakan solusi sementara (workarounds). Dengan membiarkan permintaan tetap terbuka selama agen perlu berpikir dan berbicara, Neon membuat deployment streaming AI agent semudah fungsi serverless lainnya.
