Foreman menukarkan ejen model bahasa besar (LLM) kepada sumber Kubernetes asli, membolehkan pasukan menjalankan kod yang dijana AI dalam persekitaran pengeluaran sambil mengekalkan kos dan keselamatan di bawah kawalan ketat.

Bagaimana idea ini sesuai dengan aliran kerja pembangunan hari ini

Perusahaan telah mula bereksperimen dengan LLM yang boleh menulis kod, tetapi kebanyakan pelaksanaan menganggap model tersebut sebagai "kotak hitam" yang dipercayai. Satu isyarat "siap" daripada model boleh menolak perubahan yang tidak diuji terus ke dalam repositori, sekali gus menimbulkan kebimbangan keselamatan dan kebolehpercayaan. Pada masa yang sama, menjalankan perkhidmatan AI di awan boleh menjadi mahal dengan cepat, terutamanya apabila model yang sama dipanggil berulang kali daripada saluran paip (pipeline) CI.

Jawapan Foreman adalah dengan menyematkan keseluruhan gelung pengekodan di dalam kluster Kubernetes. Foreman berjalan sebagai sumber Kubernetes.

Empat objek teras yang merealisasikannya

  • Agent – Mentakrifkan pekerja. Ia menamakan LLM yang perlu dipanggil, menyenaraikan alatan yang boleh digunakan oleh model (cth., file-write atau git-push), dan menetapkan bajet yang mengehadkan panggilan model. Peranan disambungkan di sini; ejen pengekod menulis kod, ejen pengesah menyemaknya.
  • Workload – Unit kerja yang ditulis oleh pengguna. Ia memegang niat tahap tinggi (cth., "tambah ujian unit untuk modul X"), rujukan ke repositori sasaran, dan senarai ejen yang harus mengendalikan tugas tersebut.
  • AgenticTask – Tugas konkrit yang dihasilkan oleh Workload. Apabila tugas berjalan, setiap AgenticTask merekodkan kemas kini status, membolehkan pengendali memantau saluran paip secara masa nyata.
  • FleetNode – Nod Kubernetes yang menjalankan tugas tersebut. Penjadual terbina dalam memadankan AgenticTask yang tertunda kepada FleetNode yang mempunyai peranan dan sumber yang diperlukan.

Pengesahan menggantikan kepercayaan buta

Foreman tidak menganggap output model adalah betul. Apabila ejen pengekod menyelesaikan kerjanya, ia menghantar permintaan dan bukannya hasil akhir. Pengesah—biasanya skrip deterministik, bukan LLM lain—menjalankan kod melalui linter, ujian unit, atau binaan penuh. Hanya jika semakan tersebut lulus, Foreman akan menulis cawangan (branch) baharu kembali ke repositori.

Jika pengesah gagal, tugas tersebut ditandakan sebagai ditolak dan perubahan tersebut tidak akan dilaksanakan. Pengasingan ini membolehkan model menjana secara kreatif sementara jaring keselamatan kekal sepenuhnya di bawah kawalan manusia.

Memasang stack pada kluster

  1. Deploy core chart LLMKube dengan Helm.
  2. Deploy chart Foreman, juga melalui Helm.
  3. Tukar mod ejen kepada “native” supaya gelung permintaan-respons yang sebenar aktif.
  4. Tetapkan peranan (coder, verifier) kepada FleetNode yang akan mengendalikan kerja tersebut.

Dua set kredensial diperlukan: kredensial git untuk membaca isu dan menolak cawangan, serta kredensial model untuk memanggil sama ada API hos atau perkhidmatan inferens hos sendiri.

Pelaras kos dan keselamatan yang boleh anda kawal

Foreman membolehkan pengendali mengehadkan kuasa model dengan membuang alatan daripada definisi ejen. Membuang “bash” atau “write_file” menghalang model daripada melaksanakan arahan shell sewenang-wenangnya atau menulis di luar ruang kerja yang ditetapkan.

Had pusingan (turn limit) mengehadkan bilangan panggilan model bagi setiap tugas, sekali gus mengawal perbelanjaan secara langsung. Melaraskan tetingkap konteks (context window)—sejauh mana prompt yang dilihat oleh model—akan mengurangkan penggunaan token dengan lebih lanjut. Apabila model dijalankan secara tempatan pada perkakasan on-prem, tiada data meninggalkan organisasi, memenuhi polisi privasi data yang ketat.

Di mana platform ini cemerlang, dan di mana ia masih menghadapi kesukaran

Foreman cemerlang dalam tugas mekanikal yang mempunyai skop yang jelas:

  • Membaiki pepijat (bug) yang didokumentasikan.
  • Menambah kes ujian yang hilang.
  • Mengemas kini dokumentasi untuk kejelasan atau gaya.

Tugas-tugas ini mempunyai kriteria kejayaan yang jelas yang boleh disemak secara automatik oleh pengesah. Sistem ini masih bergelut dengan reka bentuk semula seni bina tahap tinggi atau kerja ciri yang samar-samar di mana "ketepatan" bergantung kepada pertimbangan manusia.

Kesimpulan

Dengan menganggap pengekod dipacu LLM sebagai sumber Kubernetes kelas pertama dan menguatkuasakan langkah pengesahan deterministik, Foreman menawarkan jalan pragmatik ke arah penjanaan kod AI pengeluaran yang memastikan perbelanjaan dapat dilihat dan keselamatan terkawal. Ia bukanlah penyelesaian ajaib (silver bullet) untuk semua kerja pembangunan, tetapi untuk tugas yang boleh diulang dan diuji, ia menyediakan aliran kerja yang boleh diaudit dan sesuai secara semula jadi ke dalam operasi cloud-native sedia ada.