Mitos serverless bahwa “Anda hanya membayar untuk milidetik saat kode Anda berjalan” runtuh saat Anda mencoba menjalankan agen AI di AWS Lambda. Dalam praktiknya, komponen biaya terbesar bukanlah biaya komputasi Lambda, melainkan latensi cold-start, retry loops, dan penggunaan token yang dihasilkan oleh loop tersebut.
Mengapa gambaran serverless yang biasa menyesatkan bagi agen AI
Kebanyakan pengembang memperlakukan fungsi Lambda seperti sandbox komputasi murni: jaga agar handler tetap cepat, atur ukuran memori yang moderat, dan pantau agar tagihan tetap stabil. Hal itu berhasil untuk endpoint HTTP sederhana, tetapi sebuah agen yang memanggil model bahasa, mengevaluasi respons, dan kemungkinan mengulang seluruh siklus tidak dapat dipetakan satu-ke-satu dengan satu pemanggilan (invocation) Lambda. Alur kerja internal agen melipatgandakan jumlah panggilan model, dan setiap panggilan tambahan menambah biaya token yang dapat jauh melampaui biaya komputasi.
Cold start adalah biaya tersembunyi
Saat kontainer Lambda pertama kali disediakan (provisioned), ia harus membongkar paket penyebaran (deployment package). Agen yang dimaksud menarik sekumpulan pustaka Python yang besar, sehingga ukuran gambarnya bisa cukup besar. Menghapus alat-alat khusus pengembangan—seperti pustaka otomatisasi browser yang hanya digunakan untuk pengujian lokal—akan memangkas ukuran gambar, yang pada gilirannya memperpendek waktu pembongkaran. Paket yang lebih ramping berarti fungsi tersebut menjadi lebih cepat siap untuk menangani permintaan, sehingga mengurangi waktu yang dihabiskan untuk menunggu kontainer memanas (warm up).
Tuas kedua adalah di mana kode inisialisasi berada. Dengan membangun graf agen pada saat impor modul, pekerjaan berat dilakukan sekali per setiap awal kontainer, bukan pada setiap permintaan. Pemanggilan yang sudah hangat (warm invocations) kemudian akan melewatkan pekerjaan tersebut sepenuhnya. Komprominya adalah cold start yang sedikit lebih lama, tetapi imbalannya adalah waktu pengaturan per permintaan yang hampir nol setelah kontainer menjadi hangat.
Memori juga berfungsi sebagai pengatur latensi
Pada Lambda, jumlah memori yang Anda alokasikan juga menentukan porsi CPU yang diterima fungsi tersebut. Mengatur fungsi ke memori 1 GB memberikannya satu inti CPU virtual penuh. CPU tambahan tersebut mempercepat impor pustaka dan pembuatan graf agen, sehingga memperkecil latensi cold-start maupun warm-up.
Biaya loop: pengulangan melipatgandakan pengeluaran token
Agen mengikuti worker-evaluator loop. Pekerja (worker) menghasilkan respons, evaluator memeriksanya, dan jika evaluator menandai adanya kesalahan, tugas tersebut dikirim kembali ke pekerja. Loop dapat berulang hingga lima kali sebelum menyerah. Itu berarti satu permintaan eksternal dapat memicu:
- hingga lima panggilan ke model pekerja
- hingga lima panggilan ke model evaluator
- jumlah panggilan alat (tool calls) berapa pun yang diputuskan oleh agen untuk dilakukan
Tagihan Lambda tetap dapat diprediksi karena AWS menagih berdasarkan milidetik eksekusi, tetapi tagihan token dapat berfluktuasi secara liar tergantung pada berapa banyak pengulangan yang diperlukan.
Jebakan timeout: API Gateway vs. Lambda
API Gateway memberlakukan batas waktu (timeout) keras selama 29 detik pada permintaan HTTP yang ditanganinya. Loop agen lima putaran dapat dengan mudah melampaui batas tersebut, bahkan jika fungsi Lambda yang mendasarinya dikonfigurasi untuk jendela eksekusi lima menit. Melewati API Gateway dengan Lambda Function URLs menghilangkan batasan 29 detik tersebut, memungkinkan fungsi untuk menyelesaikan loop-nya tanpa terputus.
Apa yang harus dianggarkan oleh pengembang
Pelajarannya sederhana: menganggarkan untuk agen AI serverless memerlukan lebih dari sekadar menjumlahkan milidetik waktu jalan (runtime) Lambda. Anda perlu memperhitungkan:
- ukuran paket penyebaran dan latensi cold-start yang dihasilkan
- pengaturan memori yang menentukan CPU dan dengan demikian kecepatan impor
- perkiraan jumlah pengulangan dalam worker-evaluator loop, yang secara langsung mendorong penggunaan token
- pilihan front-end (API Gateway vs. Function URL) untuk menghindari timeout prematur
Mengabaikan salah satu variabel ini dapat membuat Anda menerima tagihan yang sama sekali tidak menyerupai proyeksi Anda.
