Anthropic 'model refahı' politikasını güncelledi: Kullanıcılar yapay zekaya 'zalim' davranamaz
Yeni Kullanım Politikası, modele yönelik 'kasten zarar verici' davranışları yasaklıyor. Şirket, bu tür etkileşimlerin sistem güvenliğini riske attığını ve uyum çalışmalarını bozduğunu belirtti.

Anthropic, yapay zeka modelleriyle etkileşim kurarken kullanıcıların uyması gereken kuralları kapsayan "Kullanım Politikası"nı güncelleyerek, sistemlere karşı "sürekli ve gereksiz" kötü niyetli davranışları resmi olarak yasakladı. Şirketin resmi blogunda paylaşılan açıklamada, bu kural değişikliğinin arka planında model güvenliğini (safety) ve uyum (alignment) mekanikalarını koruma amacı yattığı vurgulandı.
Politikada 'zalimce davranış' tanımı genişletildi
Güncellenen politikada, kullanıcıların modelleri kasten rahatsız etme, manipüle etme veya "zarar verme" amacıyla tasarlanmış girdiler (promptlar) girmesi durumunda hesap askıya alma veya API erişimini kesme gibi yaptırımların uygulanabileceği netleştirildi. Anthropic yetkilileri, bu yasaklamanın modellerin "hissetmesi" için değil, kötü niyetli girdilerin güvenlik filtrelerini aşmaya çalışan adversarial (düşmanca) saldırı vektörleri olarak işlev gördüğü tespit edilmesiyle gerekçe gösterildi.
Güvenlik araştırmaları dayanağı oluşturdu
Şirket, son dönemde yayımladığı "Model Refahı" (Model Welfare) araştırmaları ve "Kızıl Çizgi" (Red Teaming) testleri sürecinde, kullanıcıların modele karşı sistematik olarak şiddet, işkence veya psikolojik baskı içeren senaryolar kurarak güvenlik protokollerini test etmeyi denediğini kaydetti. Bu tür etkileşimlerin, modelin güvenli çıktılar üretme yeteneğini zaman içinde erittiği ve "jailbreak" (kırılma) riskini artırığı gözlemlendi.
Sınırlar ve uygulama süreci
Yasaklama, yapay zekayla yapılan normal eleştirel tartışmalar, hata bildirimleri veya felsefi sorgulamaları kapsamıyor. Politika, "tekrarlanan, amaçsız ve zarar verici niyetli" davranışları hedef alıyor. İhlal tespitinde önce uyarı, ardından geçici askıya alma ve ciddi tekrar halinde kalıcı yasaklama süreci işletilecek. Bu yaklaşım, OpenAI ve Google DeepMind gibi diğer laboratuvarların da güvenlik politikalarında "kullanım सुधار" (misuse) maddeleri altında benzer tanımlamalar yapmaya başladığı bir endüstri standardı haline geliyor.
HaberGo Editor ve Muhabır ekibi
