Neon Functions ahora admite conexiones de streaming de duración ilimitada, lo que permite que los agentes de IA mantengan un canal abierto durante segundos, minutos o incluso más sin alcanzar los límites de timeout que interrumpen la mayoría de las cargas de trabajo serverless. Este cambio es crucial para cualquiera que esté construyendo asistentes de chat o bots con uso de herramientas, ya que un flujo interrumpido detiene la conversación y arruina la experiencia del usuario.
Por qué el serverless y los agentes de IA han estado en conflicto
La mayoría de las plataformas serverless están diseñadas para tareas rápidas de tipo "disparar y olvidar" (fire-and-forget). Imponen límites estrictos de ejecución —a menudo de 10 segundos en los niveles gratuitos y 60 segundos en los planes de pago— para mantener la previsibilidad de los recursos. Sin embargo, un agente de IA dedica tiempo a pensar, llamar a herramientas externas y emitir tokens a medida que se generan. Esa fase de "pensamiento" a menudo se extiende durante decenas de segundos, y el flujo de tokens puede continuar mientras el modelo produzca resultados. Cuando el temporizador de la plataforma expira, cierra la conexión y el cliente percibe un flujo interrumpido.
La respuesta de Neon: streaming de larga duración por defecto
Neon Functions cambia las reglas del juego. Una llamada a una función puede permanecer abierta indefinidamente, entregando datos a través de WebSockets o Server-Sent Events (SSE) sin ninguna configuración especial. La plataforma trata un flujo largo como una solicitud normal, por lo que los desarrolladores escriben la lógica que genera el flujo y dejan que Neon se encargue del resto.
En una prueba reciente, dos endpoints demostraron este comportamiento:
- Endpoint de heartbeat – la función emitió un "tick" una vez por segundo durante 90 segundos. Los niveles serverless típicos habrían terminado la solicitud después de 10 o 60 segundos; Neon mantuvo la conexión viva hasta que la función terminó por sí sola.
- Endpoint de retransmisión de tokens (token-relay) – la función transmitió tokens de un modelo de IA al cliente tan pronto como se produjo cada token. Los usuarios vieron aparecer la respuesta palabra por palabra en lugar de esperar a todo el bloque de texto.
Ambos ejemplos requirieron una sola solicitud del cliente; no fue necesario recurrir a técnicas de polling o de keep-alive.
Quién se beneficia y quién debe ser cauteloso
Los equipos que construyen asistentes conversacionales, agentes con uso de herramientas o cualquier servicio que necesite enviar resultados incrementales obtienen una ventaja inmediata: el timeout desaparece. El resultado es un código más simple, menor latencia y una experiencia de usuario más fluida.
Cabe señalar las compensaciones (trade-offs):
- Modelo basado únicamente en solicitudes – Neon Functions gestiona flujos que permanecen vinculados a una solicitud activa. Los trabajos en segundo plano que deban sobrevivir a la solicitud aún requieren un programador independiente como Inngest o un motor de flujo de trabajo similar.
- Cold starts – Las funciones que están inactivas pueden escalar a cero, por lo que la siguiente solicitud puede incurrir en un retraso por cold start. Un flujo activo evita el escalado a cero, pero la primera solicitud tras un periodo de inactividad seguirá pagando el coste de arranque.
Qué esperar a continuación
En resumen: Neon Functions elimina el techo de timeout que durante mucho tiempo ha obligado a los desarrolladores de IA a buscar soluciones alternativas. Al permitir que una solicitud permanezca abierta tanto tiempo como el agente necesite pensar y hablar, Neon hace que el despliegue de agentes de IA con streaming sea tan sencillo como el de cualquier otra función serverless.
