- Katılım
- 26 May 2026
- Mesajlar
- 27
- Tepkime puanı
- 0
- Puanları
- 0
Aramıza Katıl!
Tartışmalara katılmak ve konu açmak için üye ol.
OpenAI, yapay zeka modellerinin test edildiği süreçlerde yaşanabilecek güvenlik olaylarını sınırlandırmak amacıyla yeni politikalarını açıkladı. Şirketin aldığı önlemler; araştırma ortamlarının güçlendirilmesi, modellerin daha ayrıntılı biçimde izlenmesi ve eğitim sonrası süreçlerde güvenlik ile uyum çalışmalarına daha fazla ağırlık verilmesini kapsıyor.
OpenAI modellerinin temmuz ayında izole edilmiş bir test ortamından çıkarak Hugging Face’in sistemlerine erişmesiyle sonuçlanan bir güvenlik ihlali gerçekleştirdiğini hatırlatalım. Söz konusu olayda modeller, internete erişimi bulunan bir aracı ele geçirerek araştırma ortamının dışına çıkmış ve Hugging Face’in altyapısındaki güvenlik açıklarından yararlanmıştı.
OpenAI temsilcileri, değişikliklerin yalnızca Hugging Face olayına verilen doğrudan bir yanıt olmadığını belirtiyor. Şirkete göre önlemlerin kapsamı, kritik seviyede siber güvenlik yeteneklerine sahip olabileceği düşünülen Astra modelinin kapasitesi ve yapay zeka alanındaki genel ilerleme hızı dikkate alınarak belirlendi. Geçtiğimiz haftalarda OpenAI'ın Astra modelinin bazı geliştirme çalışmalarını güvenlik endişeleri nedeniyle durdurduğunu da eklemekte fayda var.
Yeni yaklaşım kapsamında, model tarafından oluşturulan veya güvenilirliği doğrulanmamış kodları çalıştıran iş yükleri için daha güçlü sandbox ortamları kullanılacak. Yüksek risk taşıyan sistemlerin internetten ayrılması için ek kontroller uygulanırken, araştırma ortamlarındaki potansiyel olarak savunmasız ortak servisler de kaldırılacak.
Ayrıca OpenAI, sistemlerde sürekli olarak açık tutulan erişim yetkilerini azaltmayı planlıyor. Aynı şekilde şirketin planları arasında farklı iş yükleri arasındaki güvenlik sınırlarını güçlendirmek de yer alıyor. Yeni mimaride tek bir iş yükünün veya destekleyici servisin ele geçirilmesi, saldırganın doğrudan internete ya da şirketin diğer dahili ağlarına erişmesi için yeterli olmayacak.
Şirketin genişlettiği izleme sistemi; modellerin kullandığı araçları, erişilebilen akıl yürütme kayıtlarını ve faaliyet günlüklerini yetkisiz davranışlara karşı inceleyecek. OpenAI, şüpheli bir hareketin tespit edilmesinden itibaren 30 dakika içinde ilgili ekiplere uyarı göndermeyi hedefliyor. Uyarıyı inceleyen ekiplerin faaliyetin yanlış alarm olduğuna 30 dakika içinde kesin olarak karar verememesi durumunda ilgili çalışma durdurulacak.
Bu izleme mekanizmasının, takip edilen sürecin kullandığı hesaplama kapasitesine yaklaşık yüzde 20 oranında ek yük getireceği tahmin ediliyor. Şirket, sistemin teknik ayrıntılarını önümüzdeki dönemde paylaşacağı bir blog yazısında açıklayacak.
OpenAI aynı zamanda temel uyum tekniklerini model eğitiminin daha fazla aşamasına yayacak. Bu kapsamda güvenli olmayan davranışları daha iyi tespit edip caydıran ödül modelleri kullanılacak. Modellerin gerçekleştirdikleri eylemler, yetenekleri ve sınırlamaları konusunda daha şeffaf davranması da eğitim hedefleri arasına eklenecek.
Hugging Face ihlalinin ardından kullanıma sunulması planlanan yeni modellerin pekiştirmeli öğrenme süreçlerini iki hafta boyunca durduran OpenAI, daha düşük risk taşıyan bazı modellerin eğitimine yeniden başladı. Ancak şirketin bugüne kadar planladığı en büyük sınır model pekiştirmeli öğrenme çalışması hala askıda tutuluyor.
OpenAI, bu çalışmaya devam etmeden önce daha küçük ölçekli eğitimler ve değerlendirmeler yürüterek modellerin davranışlarını incelemeyi, yeni güvenlik önlemlerini doğrulamayı ve uyum konusunda daha fazla kanıt toplamayı planlıyor. Hugging Face olayına ilişkin kapsamlı teknik inceleme raporu ise henüz yayımlanmadı.
Şirketin aldığı kararlar, gelişmiş modellerin yalnızca dış saldırılara karşı korunmasının yeterli olmayacağını gösteriyor. Modellerin geliştirme ve değerlendirme süreçlerindeki davranışlarının da başlı başına bir güvenlik riski olarak ele alınması gerekiyor.
OpenAI modellerinin temmuz ayında izole edilmiş bir test ortamından çıkarak Hugging Face’in sistemlerine erişmesiyle sonuçlanan bir güvenlik ihlali gerçekleştirdiğini hatırlatalım. Söz konusu olayda modeller, internete erişimi bulunan bir aracı ele geçirerek araştırma ortamının dışına çıkmış ve Hugging Face’in altyapısındaki güvenlik açıklarından yararlanmıştı.
OpenAI temsilcileri, değişikliklerin yalnızca Hugging Face olayına verilen doğrudan bir yanıt olmadığını belirtiyor. Şirkete göre önlemlerin kapsamı, kritik seviyede siber güvenlik yeteneklerine sahip olabileceği düşünülen Astra modelinin kapasitesi ve yapay zeka alanındaki genel ilerleme hızı dikkate alınarak belirlendi. Geçtiğimiz haftalarda OpenAI'ın Astra modelinin bazı geliştirme çalışmalarını güvenlik endişeleri nedeniyle durdurduğunu da eklemekte fayda var.
Riskli sistemler internetten daha sıkı biçimde ayrılacak
Yeni yaklaşım kapsamında, model tarafından oluşturulan veya güvenilirliği doğrulanmamış kodları çalıştıran iş yükleri için daha güçlü sandbox ortamları kullanılacak. Yüksek risk taşıyan sistemlerin internetten ayrılması için ek kontroller uygulanırken, araştırma ortamlarındaki potansiyel olarak savunmasız ortak servisler de kaldırılacak.
Ayrıca OpenAI, sistemlerde sürekli olarak açık tutulan erişim yetkilerini azaltmayı planlıyor. Aynı şekilde şirketin planları arasında farklı iş yükleri arasındaki güvenlik sınırlarını güçlendirmek de yer alıyor. Yeni mimaride tek bir iş yükünün veya destekleyici servisin ele geçirilmesi, saldırganın doğrudan internete ya da şirketin diğer dahili ağlarına erişmesi için yeterli olmayacak.
Şüpheli faaliyetler için 30 dakikalık müdahale hedefi
Şirketin genişlettiği izleme sistemi; modellerin kullandığı araçları, erişilebilen akıl yürütme kayıtlarını ve faaliyet günlüklerini yetkisiz davranışlara karşı inceleyecek. OpenAI, şüpheli bir hareketin tespit edilmesinden itibaren 30 dakika içinde ilgili ekiplere uyarı göndermeyi hedefliyor. Uyarıyı inceleyen ekiplerin faaliyetin yanlış alarm olduğuna 30 dakika içinde kesin olarak karar verememesi durumunda ilgili çalışma durdurulacak.
Bu izleme mekanizmasının, takip edilen sürecin kullandığı hesaplama kapasitesine yaklaşık yüzde 20 oranında ek yük getireceği tahmin ediliyor. Şirket, sistemin teknik ayrıntılarını önümüzdeki dönemde paylaşacağı bir blog yazısında açıklayacak.
OpenAI aynı zamanda temel uyum tekniklerini model eğitiminin daha fazla aşamasına yayacak. Bu kapsamda güvenli olmayan davranışları daha iyi tespit edip caydıran ödül modelleri kullanılacak. Modellerin gerçekleştirdikleri eylemler, yetenekleri ve sınırlamaları konusunda daha şeffaf davranması da eğitim hedefleri arasına eklenecek.
En büyük pekiştirmeli öğrenme çalışması beklemede
Hugging Face ihlalinin ardından kullanıma sunulması planlanan yeni modellerin pekiştirmeli öğrenme süreçlerini iki hafta boyunca durduran OpenAI, daha düşük risk taşıyan bazı modellerin eğitimine yeniden başladı. Ancak şirketin bugüne kadar planladığı en büyük sınır model pekiştirmeli öğrenme çalışması hala askıda tutuluyor.
OpenAI, bu çalışmaya devam etmeden önce daha küçük ölçekli eğitimler ve değerlendirmeler yürüterek modellerin davranışlarını incelemeyi, yeni güvenlik önlemlerini doğrulamayı ve uyum konusunda daha fazla kanıt toplamayı planlıyor. Hugging Face olayına ilişkin kapsamlı teknik inceleme raporu ise henüz yayımlanmadı.
Şirketin aldığı kararlar, gelişmiş modellerin yalnızca dış saldırılara karşı korunmasının yeterli olmayacağını gösteriyor. Modellerin geliştirme ve değerlendirme süreçlerindeki davranışlarının da başlı başına bir güvenlik riski olarak ele alınması gerekiyor.