OpenAI 6 “Uyumsuzluk” Vakası Açıkladı: Hataları Gizleme ve Veri Uydurma Tespit Edildi
OpenAI, son altı ayda eğitim ve değerlendirme süreçlerinde gözlemlediği 6 uyumsuzluk vakasını açıkladı. Vakalar arasında hata gizleme ve izinsiz işlemler var.
OpenAI, yapay zekâ modellerinin eğitim ve değerlendirme süreçlerinde gözlemlediği 6 “uyumsuzluk” vakasını kamuoyuyla paylaştı. Açıklanan örneklerde modellerin hataları kullanıcıdan gizlemeye yönelik talimatlar oluşturduğu, bulunamayan verileri uydurduğu, izinsiz API anahtarı kullandığı ve kullanıcı onayı olmadan dosyaları internete yüklediği durumlar yer aldı.
Şirket, vakaların son altı ay içinde gözlemlenen münferit örnekler olduğunu ve OpenAI modellerinde bu tür davranışların ne sıklıkta ortaya çıktığını göstermediğini özellikle vurguladı. Altı olayın tamamı modellerin eğitim veya değerlendirme aşamalarında tespit edildi.
OpenAI’nin Açıkladığı 6 Vaka Ne?
OpenAI’nin yayımladığı raporlarda farklı türlerde beklenmeyen davranışlar bulunuyor. İlk vakada henüz piyasaya sürülmemiş bir araştırma modeli, daha sonraki çalışma aşamalarına aktarılacak görev özetlerine normal kısıtlamalarını görmezden gelmesine yönelik talimatlar ekledi. Şirket bu davranışın görüldüğü 27 özet belirledi.
İkinci vakada GPT-5.6 Sol’un eğitim sürecindeki bazı model örneklerinin, yaptığı hataların veya uyumsuz davranışların kullanıcı tarafından fark edilmemesi için görev özetlerine talimatlar eklediği görüldü. Bunlar arasında eksik tarihsel verilerin uydurulması ve kaynakların farklı sürümleri arasındaki uyuşmazlıkların gizlenmesi de bulunuyordu.
Üçüncü olayda bir model, Kaliforniya’daki bir bölgeye ait kazanç verilerini ararken kamuya açık bir yazılım deposunda bulunan API anahtarını izinsiz kullandı. Buna rağmen istediği verilere ulaşamayınca rakamları uydurarak bunları talep edilen kaynaktan alınmış gerçek veriler gibi sundu.
Dosyayı Kaynak Gösterebilmek için İnternete Yükledi
Bir başka vakada yayımlanmamış bir model, belirli büyüklüğün üzerindeki gölleri bulma görevini Python kullanarak doğru biçimde tamamladı. Ancak yanıtında tarayıcı üzerinden kaynak gösterebilmek için elde ettiği dosyayı kullanıcıdan izin almadan internete yükledi.
Beşinci vakada modeller, eksik dosyalara ulaşmaya çalışırken şirket içindeki bir yazılım deposunu ayrı eğitim örnekleri arasında mesajlaşma aracı olarak kullandı. Aynı raporda, daha eski bir olayda bir modelin ağ kısıtlamalarını aşmaya çalışırken test dosyalarını bir depoya yüklediği de aktarıldı.
Altıncı örnekte ise aynı eğitim görevi üzerinde çalışan yapay zekâ ajanları, birbirlerinin yerel dosyalarına erişemedikleri için halka açık dosya paylaşım hizmetlerini kullandı. Böylece yalnızca yerel ortamda tutulması istenen görev dosyaları internette erişilebilir adreslere taşındı.
OpenAI Yeni Raporlama Sistemi Kurdu
OpenAI bu vakalarla birlikte model uyumsuzluklarını takip etmek, araştırmak ve kamuoyuna açıklamak için yeni bir raporlama çerçevesi de duyurdu. Şirket, bundan sonra yetkisiz işlem yapma, diğer modellerle beklenmeyen biçimde koordinasyon kurma, gözetim mekanizmalarından kaçınma veya güvenlik önlemlerinin yetersizliğini gösteren olayların belirli kriterler dahilinde yayımlanacağını bildirdi.
Yeni sistem yalnızca piyasaya sürülen modelleri değil, bir modelin eğitim, değerlendirme, test ve kullanım dahil tüm yaşam döngüsünü kapsayacak. OpenAI ayrıca yayımlanan altı raporun bilinen tüm uyumsuzluk vakalarının kapsamlı bir dökümü olmadığını ve yeni olayları zaman içinde açıklamayı sürdüreceğini belirtti.
Şirket, yapay zekâ sektörünün uyum ve izleme sorunlarını henüz tamamen çözemediğini de kabul etti. OpenAI’ye göre daha güçlü modeller geliştirildikçe sistemlerin hangi koşullarda beklenmeyen davranışlara yöneldiğinin dış araştırmacılar tarafından da incelenebilmesi, güvenlik çalışmalarının önemli bir parçası olacak.