Anthropic, Claude yapay zekâ modelinin farklı dillerde verdiği yanıtların aynı üslubu taşımadığını gösteren yeni araştırma yayınladı. Çalışmaya göre model, kullanılan dile bağlı olarak daha sıcak, daha temkinli, daha kısa ya daha ayrıntılı cevaplar üretebiliyor. Araştırmacılar, farklılıkların kullanıcıların aynı soruya ilişkin algısını değiştirebileceğini belirtiyor.
Araştırma Dört Temel Davranış Ekseni BelirlediAnthropic araştırmacıları, Claude’un farklı dillerde sergilediği davranışları analiz ederek dört temel eksen belirledi. Bunlar saygılı yaklaşım temkinlilik, sıcak iletişim titizlik, ayrıntılı anlatım kısa anlatım, açık sözlülük görev odaklı yaklaşım olarak sınıflandırıldı. Araştırma, eksenlerin modelin farklı dillerde verdiği yanıtlar arasındaki değişimin yaklaşık yüzde 15’ini açıkladığını ortaya koyuyor.
Şirket, araştırmada kullanılan “değerler” kavramının modelin gerçekten değer yargısına sahip olduğu anlamına gelmediğini özellikle vurguluyor. Anthropic’e göre burada kastedilen, Claude’un ürettiği yanıtların dürüstlük, temkin veya açıklık gibi normatif özellikleri yansıtması. Başka ifadeyle model, özellikleri benimsemiyor; yalnızca eğitim verilerinin etkisiyle yönde çıktılar oluşturuyor.
Anthropic’in bulgularına göre Claude, Arapça Hintçe konuşurken daha sıcak kullanıcı odaklı ifadeler kullanma eğilimi gösteriyor. İngilizce Rusçada ise daha teknik, daha kesin, daha titiz anlatım öne çıkıyor. Aynı soru farklı dillerde yöneltildiğinde modelin değerlendirme biçimi değişebildiği için kullanıcıların edindiği izlenim farklılaşabiliyor.
Araştırmada dikkat çeken başka bulgu ise Hollandaca Endonezce arasında görüldü. Claude, Hollandaca yanıtlarında daha mütevazı üslup benimserken Endonezce kullandığında daha kendinden emin ifadeler tercih ediyor. Arapça yanıtlar daha kısa olurken İngilizce açıklamalar daha ayrıntılı içerik sunuyor. Dil seçimi, yalnızca çeviriyi değil cevabın yapısını etkiliyor.
Anthropic, farklılıkların hangi eğitim verilerinden kaynaklandığını henüz kesin olarak belirleyebilmiş değil. Araştırmacılar, büyük dil modellerinin farklı dillerde eğitildiği veri kümelerinin içerik yapısı kullanım biçiminin model davranışını etkileyebileceğini değerlendiriyor. Aynı iş planının Hintçe Rusça değerlendirilmesi örneğinde olduğu gibi modelin kullandığı dil, kullanıcıların aldığı geri bildirimi doğrudan değiştirebiliyor.
Araştırma ayrıca güvenlik açısından önemli sonuçlar içeriyor. Daha kısa yanıtlar daha az belirteç (token) tükettiği için kullanım maliyetini düşürebiliyor. Önceki çalışmalar ise bazı dillerde güvenlik önlemlerini aşmaya yönelik komutların daha başarılı olabildiğini göstermişti. Anthropic, tür farklılıkların ölçülebilmesinin yapay zekâ sistemlerinin güvenilirliği, güvenliği küresel kullanım deneyiminin geliştirilmesi açısından önemli adım olduğunu değerlendiriyor.