Automatic Prompt Engineer (APE) memungkinkan model bahasa untuk menulis, menguji, dan memilih prompt terbaik untuk tugas tertentu, mengubah apa yang dulunya merupakan seni coba-coba menjadi pencarian berbasis data yang dapat diulang.
Mengapa penulisan prompt telah menjadi hambatan
Prompt engineering—menyusun pilihan kata yang tepat untuk memberi tahu model apa yang harus dilakukan—sudah lama menjadi campuran antara intuisi dan keberuntungan. Praktisi mengubah satu kata di sini, menukar frasa di sana, menjalankan model, dan berhenti ketika hasilnya "terasa benar." Pendekatan ini memakan waktu lama, bergantung pada imajinasi engineer, dan membatasi performa. Dalam produksi, hal ini berarti siklus yang lebih panjang, hasil yang tidak konsisten, dan biaya tersembunyi yang baru muncul setelah peluncuran.
Alur kerja tiga langkah APE
APE memperlakukan pembuatan prompt sebagai masalah pencarian. Pengguna memasukkan sekumpulan kecil contoh input-output. Kemudian sistem menjalankan tiga tahap otomatis:
- Propose – Model memindai contoh-contoh tersebut dan mengeluarkan sekumpulan instruksi kandidat, seperti “kembalikan kebalikannya” atau “tulis antonimnya.”
- Score – Sistem menjalankan setiap kandidat pada sekumpulan contoh baru yang belum pernah dilihat sebelumnya dan menghitung berapa banyak jawaban yang sesuai dengan output yang diharapkan, menghasilkan angka akurasi mentah. Tidak ada penilaian manusia dalam langkah ini.
- Select – Instruksi dengan akurasi tertinggi menjadi prompt final.
Siklus ini dapat diulang. Prompt pemenang menjadi benih (seed) baru, dan model menyarankan variasi. Dalam laporan pengujian, instruksi generik yang mendapat skor 83% disempurnakan menjadi versi yang mencapai 100% pada set pengujian.
Apa yang membuat pendekatan ini lebih kuat daripada pengerjaan manusia
- Coverage – Sebuah LLM menghasilkan puluhan alternatif frasa dalam hitungan detik, jauh lebih banyak daripada yang dapat diuji oleh manusia.
- Objectivity – Pemilihan bergantung pada akurasi yang terukur, bukan pada seberapa halus kata-katanya. Instruksi bergaya buku teks mungkin tetap kalah dari varian singkat dan terdengar aneh yang lebih dipahami oleh model.
Karena metrik penilaian berasal dari pengguna—biasanya berupa pemeriksaan kecocokan persis (exact-match) atau unit test—sistem dapat disesuaikan dengan kebutuhan downstream apa pun, mulai dari pembuatan kode hingga analisis sentimen.
Harga dari otomatisasi
Kompensasinya adalah daya komputasi. Menilai setiap kandidat memicu banyak panggilan model, sehingga fase pengembangan menghabiskan penggunaan API yang cukup besar. APE menganggap biaya tersebut sebagai investasi satu kali: setelah prompt optimal diidentifikasi, Anda dapat menggunakannya selamanya tanpa biaya tambahan.
Dua prasyarat juga membatasi adopsi:
- Labeled examples – Sistem membutuhkan sekumpulan input dan output yang benar yang representatif.
- Scoring function – Pengguna harus menentukan apa arti "benar" untuk tugas mereka, baik itu kecocokan string yang persis, toleransi numerik, atau validator khusus.
Di mana ide ini bisa menemui kendala
Jika set contoh awal sangat sedikit atau tidak representatif, prompt yang dipilih mungkin mengalami overfitting dan gagal dalam penggunaan dunia nyata.
Apa yang perlu diperhatikan selanjutnya
Alat ini menawarkan alternatif: masukkan beberapa contoh, biarkan model melakukan iterasi, dan dapatkan prompt yang peringkatnya paling tinggi di antara upayanya. Demo tersedia melalui tautan pada pengumuman asli, dan komunitas pembelajaran berkumpul di Telegram.
Poin Utama: Mengotomatiskan prompt engineering mengganti tebak-tebakan dengan performa yang terukur, tetapi membutuhkan data di awal, komputasi, dan definisi keberhasilan yang jelas.
