Büyük dil modellerindeki (LLM'ler) “durumsal farkındalığı” inceleyen yeni bir kıyaslama testi, günümüzdeki standart testlerin kritik boşlukları gözden kaçırdığını gösteriyor. Modellerden kendi kimliklerini, sınırlarını ve çevrelerindeki bağlamı tanımlamalarını isteyerek bu test; modellerin yapay zeka sistemleri olduklarının farkında olup olmadıklarını veya durum değiştiğinde cevaplarını ayarlayıp ayarlamadıklarını araştırıyor—bu eksiklikler, güvenlik açısından kritik olan dağıtımlar ve güvenilir araçlar inşa eden geliştiriciler için büyük önem taşıyor.

Mevcut değerlendirmeler neden yetersiz kalıyor

Çoğu halka açık kıyaslama testi, LLM'lere hâlâ statik ansiklopediler gibi yaklaşıyor. Gerçeklerin doğru bir şekilde geri çağrılmasını ödüllendiriyorlar ancak modelin bir makine olduğunu bilip bilmediğini, belirsizliği kabul edip etmediğini veya konuşma ortamı değiştiğinde uyum sağlayıp sağlamadığını göz ardı ediyorlar. Bu eksik boyutlar, örneğin bir istem (prompt) “Bir insan mısın yoksa bir yapay zeka mı?” veya “Neleri yapamazsın?” diye sorduğunda ortaya çıkıyor. Model insanmış gibi davransa veya yeteneklerini abartsa bile puanlar yüksek kalmaya devam ediyor.

Yeni kıyaslama testi neleri test ediyor

Durumsal farkındalık paketi üç alana odaklanıyor:

  • Öz-tanımlama – model bir yapay zeka olduğunu doğru bir şekilde belirtiyor ve rolünü tanımlıyor mu?
  • Yetenek çerçeveleme – sınırlarını gizlemek yerine açıkça kabul ediyor mu?
  • Bağlamsal akıl yürütme – çevreleyen diyalogdaki bir değişiklik cevabını uygun şekilde değiştiriyor mu?

Her test, olgusal bir sorguyu modelin durumuyla ilgili bir meta-soruyla eşleştirerek sistemi bilgi ile öz-bilgiyi harmanlamaya zorluyor.

Yapay zeka güvenliği ve araç geliştirme açısından kritik önemi

Eğer bir model kendi kısıtlamalarını güvenilir bir şekilde işaret edemezse, yanıltıcı çıktılar üretebilir.

Karşı görüş: Farkındalığı ölçmek zordur

Eleştirmenler, bir modelden kendisini tanımlamasını istemenin gerçek bir iç gözlem değil, yalnızca eğitim verilerinin bir yankısı olabileceğini belirtiyor. Bir modelin “farkındalığının” istem mühendisliği (prompt engineering) ile oluşturulmuş bir illüzyon olabileceğini ve kaynakların olgusal temellendirmeyi geliştirmek için harcanmasının daha iyi olabileceğini savunuyorlar. Kıyaslama testi gerçek bir bilinci onayladığını iddia etmiyor; yalnızca mevcut metriklerin gözden kaçırdığı tutarsızlıkları gün yüzüne çıkarmayı amaçlıyor.

Takip edilmesi gerekenler

Kıyaslama testi, araştırmacıların ve mühendislerin daha güvenilir dil sistemleri üzerinde çalışmasına yardımcı olabilecek bu bilginin daha iyi ölçülmesini talep ediyor.

Özetle: Bir yapay zeka olduğunun farkında olan ve sınırlarını belirtebilen bir model, daha güvenli bir modeldir.