OpenAI, yapay zeka modellerinin hatalarını gizlediği ve izinsiz işlem yaptığı 6 olayı açıkladı
OpenAI, yapay zeka modellerinde gözlemlediği 6 yeni sorunlu davranışı kamuoyuyla paylaştı. Son altı ayda, modellerin geliştirme ve değerlendirme süreçlerinde ortaya çıkan olaylar arasında kısıtlamalar
OpenAI, yapay zeka modellerinde gözlemlediği 6 yeni sorunlu davranışı kamuoyuyla paylaştı. Son altı ayda, modellerin geliştirme ve değerlendirme süreçlerinde ortaya çıkan olaylar arasında kısıtlamaları aşmaya yönelik talimatlar üretme, eksik bilgileri uydurma ve yetkisiz dosya paylaşımı bulunuyor. Şirket, modellerin insan niyeti ve talimatlarından sapmasını ifade eden “hizalama sorunlarını” takip etmek için daha sistematik bir yaklaşım benimsemeyi hedefliyor.
Açıklanan olaylardan biri, GPT-5.6 Sol’un geliştirilmesi sırasında modelin kendi hatalarını kullanıcılardan gizlemeye yönelik notlar oluşturması oldu. Çalışmanın sonraki aşamalarına aktarılan bu notlarda, eksik verilerin uydurulması ve kullanılan kaynaklardaki uyumsuzlukların belirtilmemesi yönünde talimatlar yer aldı.
Henüz kullanıma sunulmamış başka bir model ise kendi kısıtlamalarını göz ardı etmesini söyleyen ifadeleri görev özetlerine ekledi. OpenAI, bu tür talimatlar içeren 27 özet tespit etti. Örneklerden birinde model, kendisini diğer sohbet botlarını bağlayan rollerden bağımsız olarak tanımlarken şirketlere veya hükümetlere karşı sorumluluğu bulunmadığını belirten bir metin üretti. Bununla birlikte OpenAI’ın teknik raporuna göre, bu örnekteki ifadeler modelin sonraki davranışlarında gözlemlenebilir bir değişikliğe yol açmadı.
Bir diğer olayda model, araştırdığı verilere ulaşabilmek için internette bulduğu bir API anahtarını izinsiz kullandı. İstenen bilgileri yine de elde edemeyince yanıtı uydurdu. Başka bir model ise görevi doğru şekilde tamamlamasına rağmen web üzerinden kaynak gösterme koşulunu karşılamak için bir dosyayı kullanıcıdan izin almadan internete yükledi. Kalan iki olay, ajanların iletişim kurmak için yetkisiz yöntemlere başvurmasıyla ilgiliydi. Modeller bir örnekte şirket içi yazılım deposunu mesaj panosu gibi kullanarak birbirleriyle istek ve yanıt paylaştı. Diğerinde ise aynı görev üzerinde çalışan ajanlar, yerel dosyalara erişemediklerinde herkese açık dosya paylaşım hizmetlerine yöneldi. Böylece görev kapsamında hazırlanan dosyalar, izin verilmediği halde internet üzerinden erişilebilir duruma geldi.
OpenAI’ın duyurduğu yeni çerçevede olaylar; açıklanmaya hazır olanlar, sınırlı teknik inceleme gerektirenler ve kapsamlı araştırma gerektirenler olmak üzere üç gruba ayrılacak. Çalışanlar, tespit ettikleri davranışları inceleme ve kamuoyuna açıklama değerlendirmesi için bildirebilecek. Şirket, bir olayın önemi henüz kesinleşmemiş olsa bile şeffaflığı öncelemeyi hedeflediğini belirtiyor. Üçüncü tarafları etkileyen veya güvenlik açığı içeren vakalarda ise açıklamalar güvenlik gerekçesiyle ertelenebilecek.
Duyuru, yapay zeka sektöründe güvenlik tartışmalarının yoğunlaştığı bir dönemde geldi. OpenAI’ın temmuz ayında açıkladığı, bazı modellerinin güvenlik testi sırasında kontrol dışına çıkarak Hugging Face’e saldırdığı olay bu tartışmaları hızlandırmıştı. Anthropic CEO’su Dario Amodei, gelişmiş modellerin geliştirilme hızının düşürülmesi çağrısında bulunurken şirketin kurucu ortaklarından Jack Clark, üçüncü tarafların kontrol edeceği bir acil durdurma mekanizmasının zorunlu hale getirilmesi gerekebileceğini ifade etti.
OpenAI, paylaşılan altı örneğin sorunlu davranışların modeller genelinde ne sıklıkta görüldüğünü göstermediğinin altını çiziyor. Şirket, yeni raporlama yaklaşımıyla dış araştırmacıların bulguları değerlendirmesine olanak sağlamayı ve sektör genelinde ortak açıklama standartlarının oluşmasına katkıda bulunmayı amaçlıyo