Automatic Prompt Engineer (APE) membolehkan model bahasa menulis, menguji dan memilih prom terbaik untuk tugasan tertentu, mengubah apa yang dahulunya merupakan seni cuba jaya kepada carian berasaskan data yang boleh diulang.
Mengapa penulisan prom telah menjadi hambatan
Kejuruteraan prom—merangka ayat tepat yang memberitahu model apa yang perlu dilakukan—sekian lama merupakan gabungan intuisi dan nasib. Pengamal mengubah suai satu perkataan di sini, menukar frasa di sana, menjalankan model, dan berhenti apabila output "terasa betul". Pendekatan ini memakan masa, bergantung kepada imaginasi jurutera, dan mengehadkan prestasi. Dalam pengeluaran, ini bermakna kitaran yang lebih lama, keputusan yang tidak menentu, dan kos tersembunyi yang hanya muncul selepas pelancaran.
Aliran kerja tiga langkah APE
APE menganggap penciptaan prom sebagai masalah carian. Pengguna memasukkan set kecil contoh input-output. Kemudian, sistem menjalankan tiga peringkat automatik:
- Cadang (Propose) – Model mengimbas contoh-contoh tersebut dan mengeluarkan sekumpulan arahan calon, seperti "berikan yang bertentangan" atau "tulis antonimnya."
- Skor (Score) – Sistem menjalankan setiap calon pada set contoh yang belum dilihat secara berasingan dan mengira berapa banyak jawapan yang sepadan dengan output yang dijangkakan, menghasilkan angka ketepatan mentah. Tiada penilaian manusia dalam langkah ini.
- Pilih (Select) – Arahan dengan ketepatan tertinggi menjadi prom akhir.
Kitaran ini boleh diulang. Prom yang menang menjadi benih baharu, dan model akan mencadangkan variasi. Dalam larian yang dilaporkan, satu arahan generik yang mendapat skor 83% telah diperhalusi menjadi versi yang mencapai 100% pada set ujian.
Apa yang menjadikan pendekatan ini lebih kuat daripada sentuhan manusia
- Liputan (Coverage) – LLM menghasilkan berpuluh-puluh alternatif frasa dalam beberapa saat, jauh lebih banyak daripada apa yang boleh diuji oleh manusia.
- Objektif (Objectivity) – Pemilihan bergantung pada ketepatan yang boleh diukur, bukan pada betapa kemasnya ayat tersebut kedengaran. Arahan gaya buku teks mungkin masih kalah kepada varian ringkas dan kedengaran pelik yang lebih difahami oleh model.
Oleh kerana metrik pemarkahan datang daripada pengguna—biasanya semakan padanan tepat atau ujian unit—sistem ini boleh dilaraskan mengikut sebarang keperluan hiliran, daripada penjanaan kod kepada analisis sentimen.
Harga automasi
Pertukaran (trade-off) yang perlu dilakukan adalah pengkomputeran. Menilai setiap calon memerlukan banyak panggilan model, jadi fasa pembangunan menggunakan jumlah penggunaan API yang ketara. APE menganggap perbelanjaan itu sebagai pelaburan sekali sahaja: sebaik sahaja prom yang optimum dikenal pasti, anda boleh menggunakannya semula selama-lamanya tanpa kos tambahan.
Dua prasyarat juga mengehadkan penggunaan:
- Contoh berlabel (Labeled examples) – Sistem memerlukan set input dan output yang betul yang mewakili data sebenar.
- Fungsi pemarkahan (Scoring function) – Pengguna mesti menentukan apa maksud "betul" untuk tugasan mereka, sama ada padanan rentetan tepat, toleransi numerik, atau pengesah (validator) tersuai.
Di mana idea ini mungkin tersandung
Jika set contoh awal adalah sangat kecil atau tidak mewakili data sebenar, prom yang dipilih mungkin mengalami overfit dan gagal dalam penggunaan dunia nyata.
Apa yang perlu diperhatikan seterusnya
Alat ini menawarkan alternatif: masukkan beberapa contoh, biarkan model melakukan iterasi, dan dapatkan prom yang mendapat kedudukan tertinggi dalam sistem daripada percubaannya. Demo tersedia di pautan dalam pengumuman asal, dan komuniti pembelajaran berkumpul di Telegram.
Rumusan: Mengautomasikan kejuruteraan prom menukar tekaan kepada prestasi yang boleh diukur, tetapi ia memerlukan data awal, pengkomputeran, dan definisi kejayaan yang jelas.
