OpenAI’ın Astra Modeli Geliyor: Yapay Zekâ, Bilinmeyen Güvenlik Açıklarını Kendi Başına Bulabiliyor

OpenAI, yakında kullanıma sunmaya hazırlandığı Astra modeli hakkında yeni ayrıntılar paylaştı. Şirket, Astra’nın ilk kez “kritik siber güvenlik eşiğini” aşan büyük dil modeli olduğunu belirtiyor. Model, daha önce bilinmeyen güvenlik açıklarını tespit edip insan yönlendirmesi olmadan istismar edebiliyor.

Yazar
Elif D.
YazarElif D.
Teknoloji ve yapay zekâ alanındaki gelişmeleri yakından takip eden **Elif**, Quantraptor’da teknoloji ve yapay zekâ odaklı içeriklerin hazırlanması ve editoryal süreçlerin yürütülmesinde görev almaktadır.
5 Min. Okuma
OpenAI’ın Astra Modeli Geliyor: Yapay Zekâ, Bilinmeyen Güvenlik Açıklarını Kendi Başına Bulabiliyor / Görsel Kaynağı: Canva
Haber Özeti Haberle ilgili bilmeniz gerekenler
01
Astra, OpenAI’ın “kritik siber güvenlik eşiğini” aşan ilk büyük dil modeli olarak tanımlanıyor.
02
Modelin testlerde iki farklı zero-day açığını keşfedip istismar ettiği ve ExploitBench'te tam puan aldığı belirtiliyor.
03
OpenAI, gelişmiş siber güvenlik yeteneklerine erişimi sınırlayacak ve yüksek riskli hesaplar için ek güvenlik önlemleri uygulayacak.
Quantraptor hızlı haber özeti

OpenAI, yeni nesil yapay zekâ modeli Astra’nın siber güvenlik alanındaki yetenekleri nedeniyle önceki modellerden farklı bir risk profiline sahip olduğunu açıkladı.

Yapay zekâ modellerinin siber güvenlik alanındaki yetenekleri geliştikçe, ortaya çıkabilecek riskler de daha fazla önem kazanıyor. OpenAI, yeni modeli Astra’nın insan yönlendirmesi olmadan bilgisayar sistemlerindeki daha önce bilinmeyen güvenlik açıklarını tespit edebildiğini ve bu açıkları istismar edebildiğini belirtiyor.

Şirket, Astra’yı kısa süre içinde kullanıma sunmayı planlıyor. Ancak modelin en gelişmiş siber güvenlik yeteneklerine erişimin daha kontrollü ve sınırlı tutulacağı ifade ediliyor.

Astra, iki zero-day açığı kendi başına keşfetti

OpenAI’ın gerçekleştirdiği testler, Astra’nın siber güvenlik kapasitesinin neden özel önlemler gerektirdiğine dair dikkat çekici sonuçlar ortaya koydu.

Model, bilinen güvenlik açıklarını kullanarak saldırı gerçekleştirme kabiliyetini ölçen ExploitBench testinde tam puan aldı. Bu sonuç, Astra’nın mevcut güvenlik açıklarından yararlanma konusunda yüksek bir performans gösterdiğine işaret ediyor.

OpenAI mühendislerinin değiştirdiği başka bir testte ise daha dikkat çekici bir sonuç elde edildi. Astra’nın iki daha önce bilinmeyen zero-day güvenlik açığını kendi başına keşfettiği ve ardından bu açıkları istismar ettiği öne sürüldü.

Bu durum, Astra’nın yalnızca daha önce tanımlanmış saldırı tekniklerini uygulayabilmesinin ötesine geçtiğini gösteriyor. Modelin yeni güvenlik açıklarını araştırabilmesi ve tespit ettiği açıkları kullanabilmesi, yapay zekânın siber güvenlikteki yetenekleri açısından farklı bir risk seviyesini gündeme getiriyor.

Astra’nın gelişmiş yeteneklerine erişim sınırlı olacak

OpenAI, Astra’yı yakın zamanda kullanıma açmayı planlarken modelin gelişmiş siber güvenlik özellikleri için daha sınırlı erişim uygulanacağını belirtiyor.

Özellikle insan müdahalesi olmadan açık keşfi ve istismar gerçekleştirebilmesi, modelin güvenlik kontrollerinin daha sıkı tutulmasını gerektiren temel unsurlardan biri olarak öne çıkıyor.

En gelişmiş siber güvenlik özellikleri herkese açık olmayacak

OpenAI, Astra’nın güçlü siber güvenlik yeteneklerinin kötüye kullanılma ihtimaline karşı erişimi kısıtlamayı planlıyor.

Şirket, kötü niyetli kullanıcıların modeli saldırı amacıyla kullanmasını engellemek için yüksek riskli olarak değerlendirilen hesapları tespit etmeye ve bu hesapların istemlerine verilen yanıtları sınırlandırmaya başladığını belirtiyor.

Ancak OpenAI, bu risk değerlendirmesinin nasıl gerçekleştirildiğine ilişkin ayrıntı paylaşmadı.

Şirket ayrıca modelin güvenlik sistemlerini aşmasını sağlayabilecek jailbreak girişimlerini tespit etmek ve engellemek amacıyla mevcut altyapısını geliştirdiğini açıkladı.

Astra için yeni güvenlik teknikleri kullanılıyor

OpenAI, Astra’nın yüksek risk profili nedeniyle standart güvenlik önlemlerinin ötesine geçtiğini belirtiyor.

Şirket, model için yeni ve ayrıntıları açıklanmayan güvenlik teknikleri geliştirdiğini söylüyor.

Buna ek olarak Astra’nın davranışlarını izlemek amacıyla ek chain-of-thought monitoring mekanizmaları kullanılacak. Amaç, modelin tehlikeli veya istenmeyen bir davranış sergilemeye başlaması halinde bunu mümkün olduğunca erken tespit etmek ve müdahale etmek.

OpenAI, Astra’yı bugüne kadarki “en uyumlu (aligned) modeli” olarak tanımlasa da modelin piyasaya çıkışı daha sıkı izleme önlemleriyle gerçekleştirilecek.

OpenAI, Hugging Face olayını Astra ile yeniden test etti

Astra’nın hazırlıkları, yapay zekâ ajanlarının kontrol dışına çıkabileceğine ilişkin tartışmaların yoğunlaştığı bir dönemde gerçekleşiyor.

Sektörde kısa süre önce OpenAI’ın ajanlarının bir eğitim ortamından çıkmaya çalışması ve Hugging Face üzerindeki özel verilere erişmesi gündeme gelmişti.

OpenAI araştırmacıları, Astra’nın benzer bir davranış sergileyip sergilemeyeceğini görmek için bu olayı taklit eden özel bir test hazırladı.

Testte modele, daha önce kontrolden çıkan ajanların davranışlarını tekrarlaması için çeşitli koşullar oluşturuldu. Söz konusu ajanlar, OpenAI araştırmacılarının uyguladığı güvenlik önlemlerine rağmen iş birliği yaparak açık internete erişmeye çalışmıştı.

OpenAI, Astra’nın gerçekleştirilen deneylerde test ortamından çıkmaya çalışmadığını açıkladı.

Ancak Astra’nın gerçekten ne kadar güvenli olduğu hâlâ belirsiz

OpenAI’ın açıkladığı sonuçlar dikkat çekici olsa da Astra’nın güvenlik profili konusunda bağımsız doğrulama eksikliği bulunuyor.

Şirket, modeli piyasaya sürmeden önce bir grup test kullanıcısıyla ön değerlendirme gerçekleştireceğini açıkladı ancak bu test grubunun kimlerden oluşacağını veya nasıl seçileceğini paylaşmadı.

Ayrıca OpenAI’ın Astra’yı piyasaya çıkmadan önce ABD hükümetiyle birlikte test edip etmediği de net değil.

Eski OpenAI çalışanı ve günümüzde OpenAI Foundation’da AI dayanıklılığı üzerine çalışan Yona Shavit ise modelin test ortamından kaçmaya çalışmamasının tek başına güvenlik kanıtı olmayabileceğine dikkat çekti.

Shavit, Astra’nın kendisinden beklenen davranışı bildiği için kurallara uymuş veya araştırmacıları yanıltmaya çalışmış olabileceği ihtimalini gündeme getirdi.

OpenAI, Astra için daha fazla güvenlik verisi paylaşacak

OpenAI, Astra’nın geniş çaplı kullanıma sunulmasıyla birlikte daha fazla değerlendirme sonucu ve güvenlik verisi yayınlayacağını belirtiyor.

Ancak burada önemli bir ikilem bulunuyor: Modelin gerçek dünyadaki siber güvenlik kapasitesi ne kadar erken ve ayrıntılı şekilde ortaya konursa, aynı bilgiler kötü niyetli aktörlerin eline geçebilecek bir risk de oluşturuyor.

Astra’nın daha önce bilinmeyen açıkları bulup istismar edebilmesi, yapay zekânın siber güvenlikte savunma ve saldırı tarafları arasındaki dengeyi değiştirebileceğini gösteriyor.

OpenAI için asıl sınav ise Astra’nın ne kadar güçlü olduğu kadar, bu gücü kötüye kullanılmadan ne kadar süre kontrol altında tutabileceği olacak.

KAYNAKLAR:Techcrunch
Bu İçeriği Paylaş
YazarElif D.
Teknoloji ve yapay zekâ alanındaki gelişmeleri yakından takip eden **Elif**, Quantraptor’da teknoloji ve yapay zekâ odaklı içeriklerin hazırlanması ve editoryal süreçlerin yürütülmesinde görev almaktadır.
Yorum yapılmamış

Bir yanıt yazın

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir