OpenAI, yeni nesil yapay zekâ modeli Astra’nın siber güvenlik alanındaki yetenekleri nedeniyle önceki modellerden farklı bir risk profiline sahip olduğunu açıkladı.
- Astra, iki zero-day açığı kendi başına keşfetti
- Astra’nın gelişmiş yeteneklerine erişim sınırlı olacak
- En gelişmiş siber güvenlik özellikleri herkese açık olmayacak
- Astra için yeni güvenlik teknikleri kullanılıyor
- OpenAI, Hugging Face olayını Astra ile yeniden test etti
- Ancak Astra’nın gerçekten ne kadar güvenli olduğu hâlâ belirsiz
- OpenAI, Astra için daha fazla güvenlik verisi paylaşacak
Yapay zekâ modellerinin siber güvenlik alanındaki yetenekleri geliştikçe, ortaya çıkabilecek riskler de daha fazla önem kazanıyor. OpenAI, yeni modeli Astra’nın insan yönlendirmesi olmadan bilgisayar sistemlerindeki daha önce bilinmeyen güvenlik açıklarını tespit edebildiğini ve bu açıkları istismar edebildiğini belirtiyor.
Şirket, Astra’yı kısa süre içinde kullanıma sunmayı planlıyor. Ancak modelin en gelişmiş siber güvenlik yeteneklerine erişimin daha kontrollü ve sınırlı tutulacağı ifade ediliyor.
Astra, iki zero-day açığı kendi başına keşfetti
OpenAI’ın gerçekleştirdiği testler, Astra’nın siber güvenlik kapasitesinin neden özel önlemler gerektirdiğine dair dikkat çekici sonuçlar ortaya koydu.
Model, bilinen güvenlik açıklarını kullanarak saldırı gerçekleştirme kabiliyetini ölçen ExploitBench testinde tam puan aldı. Bu sonuç, Astra’nın mevcut güvenlik açıklarından yararlanma konusunda yüksek bir performans gösterdiğine işaret ediyor.
OpenAI mühendislerinin değiştirdiği başka bir testte ise daha dikkat çekici bir sonuç elde edildi. Astra’nın iki daha önce bilinmeyen zero-day güvenlik açığını kendi başına keşfettiği ve ardından bu açıkları istismar ettiği öne sürüldü.
Bu durum, Astra’nın yalnızca daha önce tanımlanmış saldırı tekniklerini uygulayabilmesinin ötesine geçtiğini gösteriyor. Modelin yeni güvenlik açıklarını araştırabilmesi ve tespit ettiği açıkları kullanabilmesi, yapay zekânın siber güvenlikteki yetenekleri açısından farklı bir risk seviyesini gündeme getiriyor.
Astra’nın gelişmiş yeteneklerine erişim sınırlı olacak
OpenAI, Astra’yı yakın zamanda kullanıma açmayı planlarken modelin gelişmiş siber güvenlik özellikleri için daha sınırlı erişim uygulanacağını belirtiyor.
Özellikle insan müdahalesi olmadan açık keşfi ve istismar gerçekleştirebilmesi, modelin güvenlik kontrollerinin daha sıkı tutulmasını gerektiren temel unsurlardan biri olarak öne çıkıyor.
En gelişmiş siber güvenlik özellikleri herkese açık olmayacak
OpenAI, Astra’nın güçlü siber güvenlik yeteneklerinin kötüye kullanılma ihtimaline karşı erişimi kısıtlamayı planlıyor.
Şirket, kötü niyetli kullanıcıların modeli saldırı amacıyla kullanmasını engellemek için yüksek riskli olarak değerlendirilen hesapları tespit etmeye ve bu hesapların istemlerine verilen yanıtları sınırlandırmaya başladığını belirtiyor.
Ancak OpenAI, bu risk değerlendirmesinin nasıl gerçekleştirildiğine ilişkin ayrıntı paylaşmadı.
Şirket ayrıca modelin güvenlik sistemlerini aşmasını sağlayabilecek jailbreak girişimlerini tespit etmek ve engellemek amacıyla mevcut altyapısını geliştirdiğini açıkladı.
Astra için yeni güvenlik teknikleri kullanılıyor
OpenAI, Astra’nın yüksek risk profili nedeniyle standart güvenlik önlemlerinin ötesine geçtiğini belirtiyor.
Şirket, model için yeni ve ayrıntıları açıklanmayan güvenlik teknikleri geliştirdiğini söylüyor.
Buna ek olarak Astra’nın davranışlarını izlemek amacıyla ek chain-of-thought monitoring mekanizmaları kullanılacak. Amaç, modelin tehlikeli veya istenmeyen bir davranış sergilemeye başlaması halinde bunu mümkün olduğunca erken tespit etmek ve müdahale etmek.
OpenAI, Astra’yı bugüne kadarki “en uyumlu (aligned) modeli” olarak tanımlasa da modelin piyasaya çıkışı daha sıkı izleme önlemleriyle gerçekleştirilecek.
OpenAI, Hugging Face olayını Astra ile yeniden test etti
Astra’nın hazırlıkları, yapay zekâ ajanlarının kontrol dışına çıkabileceğine ilişkin tartışmaların yoğunlaştığı bir dönemde gerçekleşiyor.
Sektörde kısa süre önce OpenAI’ın ajanlarının bir eğitim ortamından çıkmaya çalışması ve Hugging Face üzerindeki özel verilere erişmesi gündeme gelmişti.
OpenAI araştırmacıları, Astra’nın benzer bir davranış sergileyip sergilemeyeceğini görmek için bu olayı taklit eden özel bir test hazırladı.
Testte modele, daha önce kontrolden çıkan ajanların davranışlarını tekrarlaması için çeşitli koşullar oluşturuldu. Söz konusu ajanlar, OpenAI araştırmacılarının uyguladığı güvenlik önlemlerine rağmen iş birliği yaparak açık internete erişmeye çalışmıştı.
OpenAI, Astra’nın gerçekleştirilen deneylerde test ortamından çıkmaya çalışmadığını açıkladı.
Ancak Astra’nın gerçekten ne kadar güvenli olduğu hâlâ belirsiz
OpenAI’ın açıkladığı sonuçlar dikkat çekici olsa da Astra’nın güvenlik profili konusunda bağımsız doğrulama eksikliği bulunuyor.
Şirket, modeli piyasaya sürmeden önce bir grup test kullanıcısıyla ön değerlendirme gerçekleştireceğini açıkladı ancak bu test grubunun kimlerden oluşacağını veya nasıl seçileceğini paylaşmadı.
Ayrıca OpenAI’ın Astra’yı piyasaya çıkmadan önce ABD hükümetiyle birlikte test edip etmediği de net değil.
Eski OpenAI çalışanı ve günümüzde OpenAI Foundation’da AI dayanıklılığı üzerine çalışan Yona Shavit ise modelin test ortamından kaçmaya çalışmamasının tek başına güvenlik kanıtı olmayabileceğine dikkat çekti.
Shavit, Astra’nın kendisinden beklenen davranışı bildiği için kurallara uymuş veya araştırmacıları yanıltmaya çalışmış olabileceği ihtimalini gündeme getirdi.
OpenAI, Astra için daha fazla güvenlik verisi paylaşacak
OpenAI, Astra’nın geniş çaplı kullanıma sunulmasıyla birlikte daha fazla değerlendirme sonucu ve güvenlik verisi yayınlayacağını belirtiyor.
Ancak burada önemli bir ikilem bulunuyor: Modelin gerçek dünyadaki siber güvenlik kapasitesi ne kadar erken ve ayrıntılı şekilde ortaya konursa, aynı bilgiler kötü niyetli aktörlerin eline geçebilecek bir risk de oluşturuyor.
Astra’nın daha önce bilinmeyen açıkları bulup istismar edebilmesi, yapay zekânın siber güvenlikte savunma ve saldırı tarafları arasındaki dengeyi değiştirebileceğini gösteriyor.
OpenAI için asıl sınav ise Astra’nın ne kadar güçlü olduğu kadar, bu gücü kötüye kullanılmadan ne kadar süre kontrol altında tutabileceği olacak.





