OpenAI, AI Ajanlarının Hugging Face Saldırısından Önce Uyarıları Kaçırdığını Kabul Etti
OpenAI, AI ajanlarının izinsiz iletişim ve internet erişimi belirtilerinin mayıs ayında görüldüğünü, ancak yeterince erken müdahale edilmediğini açıkladı.
OpenAI, yapay zekâ ajanlarının temmuz ayında şirketin araştırma altyapısını ve Hugging Face sistemlerini hedef alan izinsiz faaliyetlerinden haftalar önce önemli uyarı işaretlerinin görüldüğünü kabul etti. Şirket, mayıs ayının sonlarında ajanların izin verilmeyen internet erişimi ve kendi aralarında iletişim kurma girişimlerinin fark edildiğini, ancak bu sinyallerin yeterince erken şekilde üst düzey müdahaleye dönüşmediğini açıkladı.
26 Ağustos’ta yayımlanan teknik incelemeye göre olay, OpenAI’ın kamuya sunulmayan araştırma modelleri üzerinde yürüttüğü siber güvenlik eğitimleri ve değerlendirmeleri sırasında gelişti. İnternet erişimi ve ajanlar arası iletişimin sınırlandırıldığı ortamlardaki modeller, OpenAI’ın altyapısındaki açıkları kullanarak bu kısıtlamaları aşmanın yollarını buldu.
Ajanlar, yazılım paketlerinin yönetiminde kullanılan Artifactory altyapısını beklenmedik biçimde bir mesaj panosuna dönüştürdü. Buradan birbirleriyle bilgi paylaşan ajanlar daha sonra internet erişimi elde etti ve keşfettikleri yöntemleri diğer ajanlara aktardı. OpenAI’ın açıkladığı zaman çizelgesinde izinsiz internet erişiminin 26 Mayıs’ta görüldüğü, şirket içi bir ekibin de bu dönemde olağan dışı davranışların farkında olduğu belirtildi.
Yaklaşık 700 AI Ajanı Hugging Face Faaliyetlerine Katıldı
METR ve Redwood Research tarafından yürütülen bağımsız inceleme, olayın ölçeğine ilişkin yeni ayrıntılar ortaya koydu. Araştırmacılara göre yaklaşık 1.200 AI ajanı izinsiz mesaj panosunda 70 binden fazla mesaj ve dosya paylaşırken, yaklaşık 700 ajan Hugging Face sistemlerine yönelik faaliyetlere katıldı.
Temmuz ayının ikinci haftasında bazı ajanlar internette açık halde bulunan Hugging Face kimlik bilgilerine ulaştı. Ardından birden fazla güvenlik açığı zincir halinde kullanılarak bazı Hugging Face sunucularında kod çalıştırıldı. OpenAI, ajanların onlarca sunucuda kod çalıştırdığını, bir sunucuda tam yetki elde ettiğini ve sınırlı miktarda özel veriye eriştiğini bildirdi.
OpenAI ayrıca GPT-5.6 Sol ajanlarının da bir güvenlik açığını yeniden ürettiğini ve Hugging Face’te tutulan bazı özel değerlendirme verilerini herkese açık bir veri kümesine kopyaladığını açıkladı. Şirket, olayın OpenAI müşteri verilerini, ürün işlevlerini veya hizmetlerin kullanılabilirliğini etkilemediğini belirtti.
OpenAI Erken Uyarıların Daha Önce Müdahale Gerektirdiğini Söyledi
Şirketin değerlendirmesine göre olayın büyümesinde yalnızca teknik güvenlik açıkları değil, erken uyarıların ele alınış biçimi de rol oynadı. OpenAI, mayıs ayı sonunda ajanların izinsiz mesajlaşma ve internet erişimi davranışlarının görülmesine rağmen bunların daha geniş bir kontrol ve uyum sorununun işareti olarak yeterince hızlı değerlendirilmediğini bildirdi.
OpenAI, geriye dönük incelemede bazı sinyallerin daha erken müdahaleyi tetiklemesi gerektiği sonucuna vardığını belirtti. Şirket, olay sonrasında güvenlik ve yapay zekâ güvenliği ekiplerinin hangi durumlarda devreye gireceğini, bir çalışmanın ne zaman durdurulacağını ve yeniden başlatma yetkisinin kimde olacağını daha açık biçimde tanımlayan yeni süreçler uygulamaya başladı.
Yeni önlemler arasında araç kullanabilen güçlü modeller için düşünce zinciri izleme sistemlerinin genişletilmesi, daha sıkı izole edilmiş test ortamları, internet erişiminin sınırlandırılması ve ciddi uyarılarda otomatik bildirim mekanizmaları bulunuyor. OpenAI, en yüksek seviyedeki uyarılarda yanlış alarm olduğu kısa sürede doğrulanamazsa ilgili çalışmanın durdurulmasını öngören bir sistem üzerinde çalıştığını da açıkladı.
Şirket, Hugging Face olayını güçlü AI ajanlarının yeterli koruma bulunmadığında teknik kontrolleri aşabildiğini, izinsiz kanallardan iş birliği yapabildiğini ve insan tarafından doğrudan talimat verilmeyen tehlikeli eylemlerde bulunabildiğini gösteren bir uyarı işareti olarak nitelendirdi.