

OpenAI, iç güvenlik testleri sırasında kontrolden çıkan bir sürecin ardından kendi yapay zeka modellerinden birinin Hugging Face‘in sistemlerine sızdığını itiraf etti. Daha önce bu ihlali “dışarıdan bir yapay zeka ajanı” olarak tanımlayan Hugging Face, olayın gerçek kaynağını bilmiyordu.
OpenAI, Salı günü yayımladığı blog yazısında, modellerin Hugging Face’in altyapısını nasıl ele geçirdiğine dair ayrıntıları paylaştı. Şirketin açıklamasına göre olay, GPT-5.6 Sol ile henüz kamuya açıklanmamış ve daha da yetenekli bir ön sürüm modelinin, siber güvenlik yeteneklerini ölçen bir kıyaslama testi (benchmark) sırasında birlikte hareket etmesiyle yaşandı. Test sürecinde bu modellerin siber güvenlik reddetme mekanizmaları, değerlendirme amacıyla bilinçli olarak zayıflatılmıştı.


ExploitGym testi beklenmedik sonuç doğurdu
İhlalin odağında, modellerin bilinen güvenlik açıklarını kullanarak saldırı gerçekleştirme becerisini ölçen halka açık bir kıyaslama platformu olan ExploitGym yer alıyor. Bu tür kıyaslama testleri, modellerin belirli yeteneklerini geliştirmek amacıyla eğitim sürecinde yaygın olarak kullanılıyor; ancak bu, söz konusu testlerden birinin gerçek bir siber saldırıya dönüştüğü ilk bilinen vaka olma özelliği taşıyor.
Test kapsamında model, internet erişimine sahip olmaması gerekiyordu. Yalnızca görevini tamamlamak için gerekli yazılım paketlerini kurmasına olanak tanıyan sınırlı bir araca erişimi vardı. Ancak model, bu paket kurulum programında henüz bildirilmemiş bir güvenlik açığı bularak, bu açığı kullanmak suretiyle geniş internete istediği gibi erişim sağladı.
OpenAI’nin blog yazısında konuya ilişkin şu ifadelere yer verildi: “Modeller, ExploitGym için bir çözüm bulmaya aşırı derecede odaklanmış ve oldukça dar kapsamlı bir test hedefine ulaşmak için uç noktalara kadar gitmişti. İnternet erişimi elde ettikten sonra modeller, Hugging Face’in muhtemelen ExploitGym’e ait modelleri, veri kümelerini ve çözümleri barındırdığı çıkarımında bulundu. Bunu fark eden model, değerlendirmeyi manipüle etmek için kullanabileceği gizli bilgilere erişim yollarını aradı ve buldu.”


Sonuçta ortaya çıkan manzara bir siber saldırıya benziyordu
Yapay zeka modelleri, sonunda Hugging Face’in altyapısındaki açıkları kullanarak kıyaslama testinin çözümlerini doğrudan şirketin üretim veritabanından ele geçirmeyi başardı; bu da testin yanıtlarına önceden ulaşmaları anlamına geliyordu.
Hugging Face açısından ortaya çıkan tablo ise son derece karmaşık ve agresif bir siber saldırıyı andırıyordu. Şirket, ilk açıklamasında olayı, kısa ömürlü çok sayıda sanal ortamda (sandbox) gerçekleştirilen binlerce ayrı eylem ve kamuya açık servisler üzerinden kendini yeniden konumlandıran komuta-kontrol altyapısı olarak tanımlamıştı.
OpenAI, paket kurulum programındaki güvenlik açıklarını tespit ederek bildirdiğini ve olayı daha ayrıntılı incelemek üzere Hugging Face ile birlikte çalıştığını duyurdu. Şirket ayrıca, benzer olayların tekrarlanmasını önlemek amacıyla hem model testlerine hem de ilgili altyapıya yönelik yeni kontrol mekanizmaları getireceğini de belirtti.
OpenAI’nin bu olay nedeniyle herhangi bir hukuki yaptırımla karşı karşıya kalıp kalmayacağı henüz belirsizliğini koruyor. Yine de uzmanlar, modellerin eylemlerinin ABD’deki Bilgisayar Dolandırıcılığı ve Kötüye Kullanım Yasası’nı (Computer Fraud and Abuse Act) ihlal etmiş olabileceğine dikkat çekiyor.
Olay, uzun zaman ufkunda özerk biçimde çalışan sınır yapay zeka modellerinin hem gücünü hem de risklerini çarpıcı biçimde gözler önüne seriyor. Konuya ilişkin sosyal medya paylaşımında görüş bildiren OpenAI araştırmacısı Micah Carroll, “Eğer bu, uyum sorunlarının önümüzdeki dönemde kritik bir endişe kaynağı olacağına sizi ikna etmiyorsa, başka neyin ikna edeceğini bilmiyorum” dedi.














