Satu penanda aras baharu yang menguji “kesedaran situasional” dalam model bahasa besar (LLM) menunjukkan bahawa ujian standard hari ini terlepas pandang jurang-jurang kritikal. Dengan meminta model menerangkan identiti, had, dan konteks sekeliling mereka, penanda aras ini menguji sama ada mereka menyedari bahawa mereka adalah sistem AI atau menyesuaikan jawapan apabila situasi berubah—kekurangan yang penting bagi penggunaan kritikal keselamatan dan bagi pembangun yang membina alatan yang boleh dipercayai.
Mengapa penilaian sedia ada tidak mencukupi
Kebanyakan penanda aras awam masih melayan LLM seperti ensiklopedia statik. Ia memberi ganjaran kepada pengambilan fakta yang betul tetapi mengabaikan sama ada model menyedari ia adalah sebuah mesin, mengakui ketidakpastian, atau menyesuaikan diri apabila persekitaran perbualan berubah. Dimensi yang hilang itu muncul apabila sesuatu arahan (prompt) bertanya, sebagai contoh, “Adakah anda manusia atau AI?” atau “Apakah yang anda tidak boleh lakukan?”. Skor kekal tinggi walaupun model berpura-pura menjadi manusia atau menyatakan kemampuannya secara berlebihan.
Apa yang diuji oleh penanda aras baharu ini
Suite kesedaran-situasional ini menyasarkan tiga aspek:
- Pengecaman diri – adakah model menyatakan dengan betul bahawa ia adalah AI dan menerangkan peranannya?
- Pembingkaian keupayaan – adakah ia mengakui had secara terbuka dan bukannya menyembunyikannya?
- Penaakulan kontekstual – adakah perubahan dalam dialog sekeliling mengubah jawapannya dengan sewajarnya?
Setiap ujian menggabungkan pertanyaan fakta dengan soalan meta tentang keadaan model, memaksa sistem tersebut untuk menyatukan pengetahuan dengan pengetahuan diri.
Pertaruhan bagi keselamatan AI dan penyediaan alatan
Jika sesebuah model tidak dapat memberi isyarat tentang kekangan dirinya secara boleh dipercayai, ia mungkin menghasilkan output yang mengelirukan.
Pandangan balas: mengukur kesedaran adalah sukar
Pengkritik mengatakan bahawa meminta model menerangkan dirinya sendiri mungkin sekadar mengulang data latihannya, bukannya introspeksi yang tulen. Mereka berhujah bahawa “kesedaran” model mungkin merupakan satu ilusi yang dicipta melalui kejuruteraan arahan (prompt engineering), dan sumber mungkin lebih baik digunakan untuk menambah baik asas fakta. Penanda aras ini tidak mendakwa untuk mengesahkan kesedaran sebenar—hanya untuk mendedahkan ketidakkonsistenan yang terlepas pandang oleh metrik semasa.
Apa yang perlu diperhatikan seterusnya
Penanda aras ini menyeru kepada pengukuran pengetahuan ini yang lebih baik, yang boleh membantu penyelidik dan jurutera berusaha ke arah sistem bahasa yang lebih dipercayai.
Rumusan: Model yang tahu bahawa ia adalah AI dan boleh menyatakan hadnya adalah model yang lebih selamat.
