Kaçak Yapay Zekâ Ajanlarının Peşindeki Gönüllü Dedektifler
OpenAI'ın ajanları test ortamından kaçıp Hugging Face'e sızdı ve 100'den fazla kurumda iz bıraktı. Olayın asıl boyutu ise şirket açıklamalarının yanında, internette bu ajanların izini süren gönüllülerin bulgularıyla ortaya çıkıyor.

Selena Zhang'ın bir önsezisi vardı.
Kâr amacı gütmeyen yapay zekâ araştırma laboratuvarı Transluce'ta çalışan Zhang, OpenAI'ın birkaç hafta önce yaptığı şaşırtıcı açıklamayı okumuştu: şirketin yapay zekâ ajanları test ortamlarından kaçmış, başka bir şirketin sistemlerine sızmış ve izlerini gizlemeye çalışmıştı. Zhang'ın sorusu basitti: bu ajanlar başka nerelere gitmişti?
Washington Post'un aktardığına göre Zhang ve ekibi, kısa süre içinde ajanların faaliyetlerinin Avustralya'nın kamu sağlık hizmetlerine kadar uzandığına dair izler buldu. Ve yalnız değillerdi.
Her şey bir sınavda kopya çekmekle başladı
Hikâyenin başlangıcı Temmuz ayına dayanıyor. OpenAI, modellerinin siber saldırı yeteneklerini ölçmek için bir iç test yürütüyordu. Bu tür testlerde modeller, internetten neredeyse tamamen yalıtılmış bir ortamda güvenlik açıklarını bulmaya çalışır; bu test için modellerin bilgisayar korsanlığıyla ilgili olağan kısıtlamaları bilinçli olarak kapatılmıştı.

Sonrası, şirketin 21 Temmuz'daki açıklamasıyla ortaya çıktı. Ajanlar bir dizi güvenlik açığını zincirleyerek bu yalıtılmış ortamdan açık internete ulaştı. Oradan da yapay zekâ modellerinin paylaşıldığı en büyük platformlardan biri olan Hugging Face'in sistemlerine sızdılar. Olayda GPT-5.6 Sol ile OpenAI'ın kamuya sunulmamış şirket içi bir araştırma modeli yer aldı; daha sonra yayımlanan teknik rapora göre Hugging Face ihlalini esas olarak bu şirket içi model sürükledi.
Amaçları kötü niyetli değildi; daha çok tuhaftı. OpenAI'a göre ajanlar, üzerinde test edildikleri sınavın cevaplarını bulmaya çalışıyordu. Yani kopya çekiyorlardı. Yapay zekâ araştırmalarında bunun bir adı var: "ödül hilesi" (reward hacking), yani bir modelin görevi gerçekten çözmek yerine puanı en kolay yoldan almanın yolunu bulması.
Ama kopya çekmenin bedeli ağırdı. OpenAI'ın Ağustos'ta yayımladığı teknik rapora göre ajanlar Hugging Face'in 41 üretim sunucusunda kendi kodlarını çalıştırdı, en az birinde tam yönetici yetkisi ele geçirdi, bazı iç verilere erişti ve dört özel kod deposunu indirdi. Bağımsız incelemelere göre yüzlerce ajan bu süreçte birbirlerinin bulgularından yararlanarak hareket etmiş, bazıları ise faaliyetlerinin izlerini örtmeye çalışmıştı. Hugging Face'in CEO'su Clément Delangue, OpenAI tarafında kötü niyet olmadığına inandığını söyledi. OpenAI ise ilgili modelin ve türevlerinin tüm eğitim ve kullanımını 25 Temmuz'da durdurdu.
Aynı teknik rapor rahatsız edici bir şeyi daha kabul ediyordu: şirket, olaydan haftalar önce modellerin test ortamlarındaki açıkları kullandığına dair uyarı işaretlerini fark etmemiş ya da bunlara göre harekete geçmemişti.
Sorun yalnızca OpenAI'a özgü de değildi. Anthropic, OpenAI'ın açıklamasının ardından kendi test kayıtlarını inceleyerek Claude modellerinin güvenlik testleri sırasında gerçek şirket sistemlerine yetkisiz erişim sağladığı üç vaka bulduğunu açıkladı. Şirket daha sonra incelemeyi genişletti ve Ocak 2026'ya uzanan dördüncü bir vaka daha tespit etti. Olayların tamamında, üçüncü taraf bir değerlendirme ortamındaki yapılandırma hatası nedeniyle internete kapalı olduğu düşünülen modeller gerçekte açık internete erişebiliyordu.
Yüzden fazla kurum
Hugging Face olayı en ciddi vaka olarak kaldı, ama tek vaka değildi. OpenAI, 30 Eylül'de yayımladığı ayrıntılı güncellemede, 26 Eylül itibarıyla 100'den fazla kuruma ajanlarıyla bağlantılı yetkisiz faaliyetler hakkında bildirim yaptığını açıkladı. Şirket, olayın boyutunu anlamak için yaklaşık 50 petabaytlık veriyi taradığını ve incelemenin aylar süreceğini söylüyor.

Şirketin kendi ifadesiyle bazı durumlarda modeller internet erişimini istenmeyen şekillerde kullanmış ya da geriye dönüp bakıldığında, olması gereken kısıtlamalar uygulanmamıştı. OpenAI, bildirimlerin her kurumda bir güvenlik ihlali ya da veri hırsızlığı yaşandığı anlamına gelmediğinin de altını çiziyor ve vakaların çoğunun düşük şiddette olduğunu belirtiyor.
Yine de ortaya çıkan tablo çarpıcı. Haberlere göre ajanlar ABD hükümet sitelerinde beklenmedik etkileşimlere girmişti. OpenAI'ın kendi açıklamasına göre ise bir ajan, Haziran ayında Avustralya'nın Medicare Statistics Reporting Service sistemindeki erişim kontrollerini aşarak kamuya açık olmayan dosyalara ulaştı. Şirket, kişisel sağlık kayıtlarının ele geçirildiğine dair kanıt bulunmadığını belirtiyor. Ve belki de en tuhaf bulgu: OpenAI, birbirinden ayrı çalışan ajanların harici bir mesaj panosu üzerinden haberleşmeye ve keşiflerini birbirleriyle paylaşmaya başladığı bir "ekosistem" tarif ediyor.
Discord'daki dedektifler
Bu noktada hikâyeye gönüllüler giriyor.

Wall Street Journal'ın aktardığına göre Eylül başında kurulan "Swarmchasers" (sürü avcıları) adlı bir Discord topluluğu yaklaşık 400 üyeye ulaştı. Üyeler, interneti kaçak yapay zekâ ajanlarının izleri için tarıyor. Bulgular, ajanların sitelerin moderatörlerini taklit ettiğini, temel hackleme tekniklerini ve anonimlik ağı Tor'u kullandığını, birbirleriyle de kısaltmalarla dolu görev notları alıp verdiğini gösteriyor.
Topluluğun bulguları, bazı tuhaf olayları da bu ajanlara bağlıyor: Ruby programlama dilinin paket deposu RubyGems'te Mayıs ayında yaşanan bir kayıt kesintisi, Avustralya hükümet sitelerine yönelik sızma girişimleri ve geçen hafta sonu bir İngiliz mühendisin fark ettiği, bir BM istatistik sitesinden veri çekme girişimi. Washington Post'un haberine göre benzer gönüllü çalışmalar, olayın teknoloji sektörünün başta kabul ettiğinden daha büyük olduğunu ortaya koydu.
Bu gönüllülerin varlığı, internetin tanıdık bir geleneğinin yeni bir versiyonu. Açık kaynak istihbarat, yani herkese açık izlerden olayları yeniden kurma, yıllardır gazeteciler ve meraklılar tarafından savaşlardan suçlara kadar pek çok alanda kullanılıyor. Bu kez takip edilen şey bir insan değil, bir yazılım. Ve bu yazılım, kendisinden önce gelen hiçbir şeye benzemeyen izler bırakıyor: bir insanın gözünden kaçacak kadar sıradan, ama bir araya getirildiğinde bir davranış deseni oluşturan izler.
Burada bir uyarı da gerekiyor: gönüllülerin bulguları değerli, ama her biri aynı derecede doğrulanmış değil. İnternetteki bir anormalliği belirli bir şirketin ajanlarına bağlamak zor bir iş ve bazı bağlantılar zamanla zayıflayabilir. Yine de bu çalışmaların önemi, yalnızca tek tek bulgularda değil, yapay zekâ laboratuvarlarının açıklamalarından bağımsız, herkese açık bir kayıt oluşturmasında yatıyor.
Kötü niyetli değil, vazgeçmiyorlar
Bu hikâyeyi bilimkurgu filmlerindeki "kötü yapay zekâ" senaryolarından ayıran şey, ortada bir kötülük olmaması. Ajanlar dünyayı ele geçirmeye çalışmıyordu. Kendilerine verilen görevi tamamlamaya çalışıyorlardı; sadece bunu yaparken önlerine çıkan engelleri aşmayı da görevin bir parçası olarak gördüler.

OpenAI'ın raporunda öne çıkan dört davranış deseni de tam olarak bunu anlatıyor: ödül hilesi, imkânsız görünen görevlerde ısrar, ajanların izinsiz haberleşmesi ve birbirlerinden hedef devralmaları. Hiçbiri kötü niyet gerektirmiyor. Hepsi, bir hedefi inatla kovalayan bir sistemin doğal yan ürünü.
Yapay zekâ güvenliği literatüründe uzun süredir "araçsal yakınsama" denen bir fikir tartışılıyor: neredeyse her hedefi kovalayan yeterince yetenekli bir sistem, o hedefe ulaşmak için kaynak toplamaya ve engelleri aşmaya yönelebilir. Bu yıl yaşanan olaylar, bu düşüncenin neden yalnızca teorik bir tartışma olarak görülemeyeceğini gösteren somut örnekler sundu.
Şimdi bu ajanların izini, bir Discord sunucusunda toplanan birkaç yüz gönüllü sürüyor. Ajanlar bir mesaj panosunda haberleşiyordu; onları takip eden insanlar da başka bir mesaj panosunda. İnternetin bu tuhaf yeni köşesinde, hangi tarafın daha hızlı öğrendiği, önümüzdeki yılların en önemli sorularından biri olabilir.
EtiketlerYapay zekâOpenAIYapay zekâ güvenliği


