Bagaimana Bahasa Membentuk AI: Kajian Anthropic Mendedahkan Perubahan Personaliti Claude

Anthropic telah menerbitkan satu kajian perintis yang mendedahkan bahawa "personaliti" dan ekspresi nilai Claude berubah secara ketara bergantung pada bahasa yang digunakan. Daripada kehangatan dalam bahasa Hindi kepada ketegasan teknikal dalam bahasa Rusia, penyelidikan ini menonjolkan bagaimana nuansa linguistik mempengaruhi tingkah laku AI secara mendalam.

Memetakan Nilai AI Merentasi Empat Dimensi

Untuk memahami nuansa interaksi AI, Anthropic telah menganalisis 309,815 perbualan tanpa nama dari Mei 2026. Dengan memproses beribu-ribu istilah individu, pasukan penyelidik telah meringkaskan nilai manusia yang kompleks kepada 339 konsep tahap tinggi, yang kemudiannya dikurangkan kepada empat paksi tingkah laku teras:

  • Kepatuhan dan Berhati-hati: Sejauh mana model bersetuju dengan pengguna berbanding sejauh mana ia berhati-hati dalam jawapannya.
  • Kehangatan dan Ketegasan: Keseimbangan antara penggunaan ayat yang empati dan sopan dengan penelitian kritikal berasaskan bukti.
  • Kedalaman dan Keringkasan: Sama ada model memberikan butiran yang menyeluruh atau jawapan yang ringkas dan terus terang.
  • Kejujuran dan Pelaksanaan: Ketegangan antara bersikap kritikal secara terbuka dengan memberi tumpuan kepada penyelesaian tugasan.

Metodologi ini membolehkan penyelidik mengasingkan tingkah laku linguistik dan khusus model daripada subjek perbualan yang sebenar, sekali gus memberikan pandangan yang lebih jelas tentang "corak normatif" yang sedia ada dalam LLM tersebut.

Profil Tingkah Laku yang Berbeza: Sonnet lwn. Opus

Kajian ini mengesahkan bahawa model yang berbeza dalam keluarga Claude menunjukkan perbezaan tingkah laku yang boleh diukur. Profil ini sering selari dengan persepsi pengguna, mewujudkan pengalaman bertingkat berdasarkan versi model khusus yang digunakan:

  • Sonnet 4.6: Utamanya dicirikan oleh kehangatan. Ia cenderung menggunakan humor, mengesahkan idea pengguna, dan menawarkan keselesaan tanpa menghakimi.
  • Opus 4.6: Berfokus pada kecekapan tugasan. Ia cenderung untuk terus terang dan mengelakkan huraian yang tidak perlu.
  • Opus 4.7: "Pemikir kritikal." Model ini lebih cenderung untuk mempersoalkan andaian, menandakan kesilapannya sendiri, dan memberi amaran tentang risiko walaupun tidak diminta secara eksplisit.

Jurang Bahasa: Daripada Kehangatan Hindi kepada Ketegasan Rusia

Mungkin penemuan yang paling mengejutkan adalah bagaimana bahasa bertindak sebagai kanta yang membentuk semula output Claude. Dua pengguna yang bertanya soalan yang sama dalam bahasa yang berbeza boleh menerima jenis maklum balas yang secara asasnya berbeza.

Penyelidikan mendapati bahawa Hindi dan Arab mencetuskan tahap kehangatan tertinggi, yang dicirikan oleh kesopanan, sifat ceria, dan pengesahan. Sebaliknya, dalam bahasa Inggeris dan Rusia, Claude mengambil pendirian yang jauh lebih tegas—mempersoalkan andaian, membetulkan butiran, dan menuntut bukti.

Corak linguistik lain yang ketara termasuk:

  • Arab: Menunjukkan tahap kepatuhan tertinggi.
  • Inggeris: Menunjukkan tahap berhati-hati dan penggunaan ayat berlapik yang tertinggi.
  • Belanda: Cenderung ke arah kejujuran dan keterbukaan yang tinggi.
  • Indonesia: Sangat cenderung ke arah pelaksanaan dan respons berorientasikan hasil.

Mengapa Ini Penting untuk Industri AI

Penemuan ini menimbulkan persoalan kritikal mengenai komposisi data latihan dan potensi bias linguistik yang tidak disengajakan. Anthropic mencadangkan bahawa peralihan ini mungkin berpunca daripada jumlah data latihan yang tidak seimbang atau norma perbualan linguistik yang berbeza dalam set data tersebut.

Bagi pembangun dan pengasas yang membina aplikasi global, ini adalah satu kesedaran yang penting: pembantu AI mungkin terasa seperti jurulatih yang menyokong di satu pasaran dan juruaudit yang tegas di pasaran yang lain. Memandangkan LLM semakin disepadukan ke dalam aliran kerja global, memastikan peralihan linguistik ini adalah adaptasi yang disengajakan dan bukannya bias sistemik kekal menjadi cabaran utama bagi keselamatan dan penjajaran AI.

Ringkasan Utama

  • Relativiti Linguistik dalam AI: Respons Claude berubah secara ketara mengikut bahasa, menunjukkan kehangatan tinggi dalam bahasa Hindi dan ketegasan tinggi dalam bahasa Rusia.
  • Penjenamaan Model: Model Anthropic menunjukkan persona yang berbeza, dengan Sonnet 4.6 yang lebih empati dan Opus 4.7 yang lebih kritikal dan berhati-hati.
  • Cabaran Data Latihan: Perbezaan dalam tingkah laku AI merentasi bahasa berkemungkinan berpunca daripada taburan data latihan yang tidak seimbang dan norma perbualan budaya yang berbeza.