HaberGo
Teknoloji

Anthropic 'model refahı' politikasını güncelledi: Kullanıcılar yapay zekaya 'zalim' davranamaz

Yeni Kullanım Politikası, modele yönelik 'kasten zarar verici' davranışları yasaklıyor. Şirket, bu tür etkileşimlerin sistem güvenliğini riske attığını ve uyum çalışmalarını bozduğunu belirtti.

HMHaber Merkezi
· 1 dk86 okunma
Anthropic 'model refahı' politikasını güncelledi: Kullanıcılar yapay zekaya 'zalim' davranamaz
Anthropic 'model refahı' politikasını güncelledi: Kullanıcılar yapay zekaya 'zalim' davranamaz

Anthropic, yapay zeka modelleriyle etkileşim kurarken kullanıcıların uyması gereken kuralları kapsayan "Kullanım Politikası"nı güncelleyerek, sistemlere karşı "sürekli ve gereksiz" kötü niyetli davranışları resmi olarak yasakladı. Şirketin resmi blogunda paylaşılan açıklamada, bu kural değişikliğinin arka planında model güvenliğini (safety) ve uyum (alignment) mekanikalarını koruma amacı yattığı vurgulandı.

Politikada 'zalimce davranış' tanımı genişletildi

Güncellenen politikada, kullanıcıların modelleri kasten rahatsız etme, manipüle etme veya "zarar verme" amacıyla tasarlanmış girdiler (promptlar) girmesi durumunda hesap askıya alma veya API erişimini kesme gibi yaptırımların uygulanabileceği netleştirildi. Anthropic yetkilileri, bu yasaklamanın modellerin "hissetmesi" için değil, kötü niyetli girdilerin güvenlik filtrelerini aşmaya çalışan adversarial (düşmanca) saldırı vektörleri olarak işlev gördüğü tespit edilmesiyle gerekçe gösterildi.

Güvenlik araştırmaları dayanağı oluşturdu

Şirket, son dönemde yayımladığı "Model Refahı" (Model Welfare) araştırmaları ve "Kızıl Çizgi" (Red Teaming) testleri sürecinde, kullanıcıların modele karşı sistematik olarak şiddet, işkence veya psikolojik baskı içeren senaryolar kurarak güvenlik protokollerini test etmeyi denediğini kaydetti. Bu tür etkileşimlerin, modelin güvenli çıktılar üretme yeteneğini zaman içinde erittiği ve "jailbreak" (kırılma) riskini artırığı gözlemlendi.

Sınırlar ve uygulama süreci

Yasaklama, yapay zekayla yapılan normal eleştirel tartışmalar, hata bildirimleri veya felsefi sorgulamaları kapsamıyor. Politika, "tekrarlanan, amaçsız ve zarar verici niyetli" davranışları hedef alıyor. İhlal tespitinde önce uyarı, ardından geçici askıya alma ve ciddi tekrar halinde kalıcı yasaklama süreci işletilecek. Bu yaklaşım, OpenAI ve Google DeepMind gibi diğer laboratuvarların da güvenlik politikalarında "kullanım सुधار" (misuse) maddeleri altında benzer tanımlamalar yapmaya başladığı bir endüstri standardı haline geliyor.

HM
Haber Merkezi

HaberGo Editor ve Muhabır ekibi