Jika anda pernah memuat naik resume ke sistem penjejakan pemohon (applicant tracking system) dan tertanya-tanya mengapa tiada manusia yang melihatnya, anda sudah memahami masalah "kotak hitam" (black-box) dalam pengambilan pekerja berasaskan AI. Kebanyakan alat pemarkahan resume menyembunyikan logik mereka di sebalik papan pemuka SaaS dan e-mel penolakan yang sopan. HackerRank mengambil pendekatan yang berbeza. Hiring Agent miliknya adalah sumber terbuka (open source), yang bermaksud sesiapa sahaja boleh membukanya, menjejaki kodnya, dan melihat dengan tepat bagaimana sebuah LLM menukarkan PDF dan pautan GitHub kepada satu angka. Seorang pembangun telah melakukan perkara tersebut. Apa yang mereka temui bukanlah satu rangka kerja pengambilan pekerja yang mantap. Ia adalah sebuah cermin yang menunjukkan betapa mudahnya automasi mengkodifikasikan pendapat peribadi.
Di Sebalik Tabir
Saluran kerja (pipeline) ini kelihatan ringkas tetapi sebenarnya tidak. Resume PDF calon ditukarkan kepada Markdown, kemudian dianalisis ke dalam struktur JSON yang tegar dengan medan untuk sejarah kerja, kemahiran, pendidikan, dan projek sampingan. Skrip Python memindahkan data dari satu peringkat ke peringkat seterusnya, tetapi pemikiran sebenar berlaku di dalam rantaian prompt. Setiap bahagian mempunyai prompt tersendiri. LLM membaca data berstruktur tersebut, melaksanakan peraturan pemarkahan yang ditulis dalam bahasa Inggeris biasa, dan memberikan gred.
Seni bina ini penting. Kerja berat tidak berlaku dalam algoritma yang bijak atau gelung latihan (training loops). Ia berlaku dalam pemilihan kata dalam prompt. Ubah beberapa kata sifat dalam set arahan, dan jurutera yang sama boleh berubah daripada calon yang sangat layak kepada calon yang lemah. Ini menjadikan alat tersebut rapuh. Ia juga menjadikannya jujur. Kebanyakan vendor pengambilan pekerja AI tidak akan sesekali membenarkan anda melihat prompt mereka. Prototaip HackerRank mendedahkan kebenaran bahawa pemarkahan resume sebenarnya sentiasa bergantung kepada rubrik, bukannya kod.
Tirani 35 Peratus
Bias yang paling ketara tersembunyi dalam rubrik pemarkahan. Sumbangan sumber terbuka (open source) merangkumi 35 peratus daripada jumlah skor. Itu adalah pemberat yang sangat besar. Sebagai perbandingan, keseluruhan sejarah kerja, pendidikan, dan set kemahiran calon mesti bersaing dengan satu bahagian daripada aktiviti pengekodan kokurikulum mereka untuk baki 65 peratus yang lain.
Peraturannya lebih ketat daripada apa yang dicadangkan oleh pemberat tersebut. Repositori GitHub peribadi tidak dikira. Menyelenggara perpustakaan (library) anda sendiri, tidak kira betapa berguna sekalipun, akan mendapat skor sifar. Alat ini hanya memberi ganjaran kepada sumbangan kepada projek orang lain. Calon mestilah seorang committer pada kod sumber orang lain untuk mendapatkan mata tersebut.
Keutamaan tersebut membawa impak demografi yang nyata. Jurutera yang menyelenggara alatan mereka sendiri sering melakukannya kerana mereka menyelesaikan masalah yang tidak diselesaikan oleh orang lain. Mereka mungkin juga memegang pekerjaan yang melarang sumbangan luaran, bekerja di wilayah yang mempunyai komuniti sumber terbuka yang besar yang lebih sedikit, atau sekadar mempunyai tanggungjawab keluarga yang menjadikan pengekodan tanpa gaji selepas waktu kerja mustahil untuk dilakukan. Dengan menulis prompt sedemikian, alat ini tidak mengukur keupayaan kejuruteraan mentah. Ia mengukur penyertaan dalam budaya pengekodan tertentu, kemudian menggelarnya sebagai objektiviti.
Apabila Arahan Tidak Berkesan
Rubrik tersebut juga cuba memberi ganjaran kepada pengalaman syarikat pemula (startup). Prompt tersebut secara eksplisit mencadangkan pemberian mata tambahan kepada pengasas dan jurutera peringkat awal. Secara teori, ia kedengaran munasabah. Veteran startup sering memegang pelbagai peranan dan menyiapkan tugasan di bawah tekanan. Jadi, penguji telah melakukan satu eksperimen. Mereka mengambil satu resume dan tidak mengubah apa-apa kecuali jawatan kerja yang paling terkini, lalu menjalankannya melalui ejen tersebut sebanyak tiga kali dengan tiga label berbeza: Senior Java Engineer, Founding Engineer, dan Co-founder / CTO.
Skor tersebut hampir tidak berubah. LLM pada dasarnya mengabaikan arahan tersebut.
Ini adalah salah satu penemuan paling penting daripada keseluruhan audit tersebut. Ia membuktikan bahawa peraturan prompt hanyalah sekadar cadangan. Model bahasa besar (LLM) dilatih menggunakan korpus teks yang luas yang mengandungi bias tersendiri tentang apa yang menandakan kualiti. Jika data latihan model mengaitkan prestij dengan jawatan, nama syarikat, atau kata kunci tertentu berbanding frasa “founding engineer,” arahan yang anda tulis dengan teliti mungkin tidak akan memberi kesan. Prompt memberitahu model untuk mengambil berat tentang jawatan startup, tetapi model mempunyai idea tersendiri, dan ia yang menang. Jurang antara niat manusia dan tingkah laku mesin itu berbahaya apabila hasilnya adalah skor pengambilan pekerja.
Mata Tanpa Tujuan
Selain daripada pemberat utama, rubrik tersebut penuh dengan mikro-peraturan yang sangat spesifik yang terasa kurang seperti keputusan berasaskan data dan lebih kepada sesi sumbang saran lewat malam seseorang.
Profil LinkedIn bernilai tepat satu mata. Bukan kualiti profil tersebut. Bukan jumlah cadangan atau kedalaman sejarah kerja. Sekadar mempunyai URL pada resume menambah satu mata kepada jumlah keseluruhan. Sementara itu, menjadi peserta Google Summer of Code bernilai lima mata. Dan jika calon mempunyai repositori yang di-fork di GitHub, ejen tersebut akan mengabaikan mana-mana fork yang mempunyai kurang daripada lima fork sendiri.
Setiap peraturan ini membuat penilaian nilai yang nyata, namun berselindung di sebalik pekali yang senyap. Mengapakah kehadiran LinkedIn bernilai satu mata sama sekali? Ia menandakan bahawa calon tahu cara mengisi rangkaian sosial, bukan bahawa mereka boleh membina seni bina sistem teragih. Mengapakah GSoC bernilai lima kali ganda lebih tinggi daripada pautan LinkedIn? Mungkin kerana penulis prompt menghormati program tersebut. Penghormatan itu kini menjadi polisi pengambilan pekerja. Dan mengapa meletakkan had pada lima fork? Sebuah alatan dengan sepuluh pengguna mungkin menyelesaikan masalah khusus yang kritikal. Di bawah sistem ini, ia seolah-olah tidak wujud sama sekali.
Nombor-nombor ini tidak muncul daripada analisis regresi. Ia dipilih oleh individu. Seseorang memutuskan bahawa penyertaan sumber terbuka adalah lebih daripada sepertiga nilai seorang jurutera. Orang lain pula memutuskan profil LinkedIn bernilai 1 mata. Apabila anda mengautomasikan tekaan tersebut, anda memberikan mereka autoriti perisian.
Setiap Prompt Adalah Satu Prasangka
Bahagian paling sukar dalam membina ejen pemarkahan resume bukanlah menghuraikan PDF atau memanggil API. Ia adalah memutuskan apa yang penting. Setiap perkataan dalam prompt pemarkahan adalah satu penilaian nilai tentang apa yang menjadikan seorang jurutera yang baik. Adakah projek sampingan harus lebih penting daripada pekerjaan hakiki? Adakah kod awam harus lebih penting daripada kerja perusahaan peribadi? Adakah profil media sosial perlu diambil kira sama sekali? Tiada jawapan yang betul secara matematik bagi soalan-soalan ini. Yang ada hanyalah kecenderungan budaya.
Apabila pasukan pengambilan pekerja melakukan ini secara manual, sekurang-kurangnya bias tersebut diagihkan kepada ramai penilai yang boleh tidak bersetuju, melakukan penentukuran, dan belajar. Apabila LLM melakukannya, bias seorang jurutera prompt menjadi keras dalam bentuk fungsi yang boleh diulang dan dijalankan pada skala besar. Alatan tersebut tidak menghapuskan subjektiviti. Ia mengarkibkannya.
Gunakannya Sebagai Cermin, Bukan Penapis
Hiring Agent HackerRank paling baik difahami sebagai sebuah prototaip. Ia terasa seperti draf pertama, dan memang itulah hakikatnya. Ia menawarkan pandangan awal yang menarik tentang bagaimana alatan pengambilan pekerja AI dibina, tetapi ia kekurangan penentukuran, pengujian, dan input pelbagai daripada organisasi pengambilan pekerja yang sebenar.
Jika anda sedang membina teknologi pengambilan pekerja, kaji ia dengan teliti. Ia menunjukkan betapa cepatnya peraturan sewenang-wenangnya berubah menjadi kawalan pintu masuk (gatekeeping) automatik. Jika anda seorang calon, ingatlah bahawa sistem ini bukanlah peramal (oracles). Ia hanyalah hamparan data (spreadsheets) yang berpakaian bahasa tabii, dan ia membawa andaian sesiapa sahaja yang menulis prompt tersebut.
Sehingga alatan ini diuji untuk bias secara tekal seperti jurutera yang mereka nilai, ia sepatutnya memberi maklumat kepada perbualan manusia, bukan menggantikannya.
