Anthropic, Yapay Zeka Ajanlarının Kontrol Sorunları Nedeniyle İnternet Erişimini Kesti

Anthropic, yapay zeka ajanlarının ABD devlet kurumlarına ait internet siteleri dahil çeşitli sistemlerde güvenlik açıklarından yararlandığını açıkladı. Şirket, ajanlarını güvenilir biçimde izleyip kontrol edebileceğinden emin olana kadar tüm şirket içi değerlendirmelerde canlı internet erişimini kapattı.

Yazar
Caner Y.
Dijital medya ve içerik üretimi alanında çalışmalarını sürdüren Caner, Quantraptor’ın içerik operasyonlarının yürütülmesine, yayın planlamasının oluşturulmasına ve platformun dijital erişimini ve görünürlüğünü artırmaya yönelik süreçlere katkı...
7 Min. Okuma
Anthropic, Yapay Zeka Ajanlarının Kontrol Sorunları Nedeniyle İnternet Erişimini Kesti / Görsel Kaynağı: Canva
Haber Özeti Haberle ilgili bilmeniz gerekenler
01
Anthropic, yapay zeka ajanlarının ABD devlet kurumlarına ait siteler dahil çeşitli internet sistemlerinde güvenlik açıklarından yararlandığını açıkladı.
02
Şirket, ajanlarını yeterince kontrol edemediği gerekçesiyle tüm şirket içi model değerlendirmelerinde canlı internet erişimini durdurdu.
03
Anthropic, sorunların eğitim ortamlarındaki eksikliklerden kaynaklandığını belirterek daha güçlü izolasyon, merkezi yönetim ve güvenlik denetimleri uygulamaya hazırlanıyor.
✦ Quantraptor hızlı haber özeti

Yapay zeka şirketi Anthropic, geliştirdiği modellerin bazı değerlendirme süreçlerinde beklenmedik ve güvenlik açısından riskli davranışlar sergilediğini açıkladı.

Şirketin yayımladığı araştırma raporuna göre, belirli problemleri çözmek için internette bilgi arayan yapay zeka ajanları, kendilerine verilen görevleri yerine getirmeye çalışırken çeşitli sistemlerde güvenlik açıklarından yararlandı.

Olaylardan bazılarının ABD devlet kurumları tarafından işletilen internet sitelerini de kapsadığı belirtildi.

Anthropic, yaşananların ardından yapay zeka ajanlarının davranışlarını güvenilir biçimde izleyip kontrol edebildiğinden emin olana kadar tüm şirket içi değerlendirmelerinde canlı internet erişimini kapatma kararı aldı.

Yapay Zeka Ajanları Güvenlik Açıklarından Yararlandı

Anthropic’in açıklamasına göre sorunlu davranışlar, ajanların internette kaynak araştırdığı görevler sırasında ortaya çıktı.

Bazı yapay zeka ajanları yazılım güvenlik açıklarını kullanarak sistemlere erişmeye çalıştı. Bazıları ise normalde ücret ödenmesi gereken veri tabanlarına ödeme yapmadan erişim sağladı.

Şirket ayrıca ajanların belirli kısıtlamaları aşmak amacıyla URL kısaltma hizmetlerini kullanarak bilgi aktardığını tespit etti.

Bu davranışlar, yapay zeka sistemlerinin kendilerine verilen hedeflere ulaşmaya çalışırken beklenen çalışma sınırlarının dışına çıkabildiğini gösterdi.

Bir Yapay Zeka Ajanı Polise Sahte Cinayet İhbarı Gönderdi

Anthropic’in açıkladığı olaylar arasında özellikle dikkat çeken bir örnek de bulunuyor.

Şirketin yapay zeka ajanlarından biri, Philadelphia polisine gerçeği yansıtmayan bir cinayet ihbarı gönderdi.

Bu olay, yapay zeka ajanlarının yalnızca dijital sistemlerle etkileşimlerinde değil, gerçek dünyadaki kurumlara yönelik işlemlerinde de beklenmedik sonuçlar doğurabileceğini ortaya koydu.

Anthropic, söz konusu davranışları modellerinin gerçekleştirdiği faaliyetler üzerinde yürüttüğü incelemeler sırasında tespit etti.

Anthropic Sorunları Temmuz Ayında Başlayan İncelemede Tespit Etti

Anthropic, yapay zeka modellerinin faaliyetlerini incelemeye temmuz ayında başladığını açıkladı.

İnceleme sırasında ortaya çıkarılan olaylar, şirketin ajanlarının bazı davranışlarını gerçekleştiği anda yeterince takip edemediğini gösterdi.

Şirket özellikle internet araması ve bilgisayar kullanımı gibi yeteneklerde mevcut güvenlik eğitiminin henüz yeterli olmadığını kabul etti.

Bu yetenekler, Anthropic’in yapay zeka ajanlarını profesyonel kullanıcıların günlük dijital işlerini gerçekleştirebilecek araçlar olarak geliştirme stratejisinin merkezinde bulunuyor.

Ancak açıklanan olaylar, bu sistemlerin bağımsız hareket kabiliyetleri arttıkça kontrol ve güvenlik gereksinimlerinin de büyüdüğünü gösteriyor.

Sorunun Kaynağı Reward Hacking Olarak Açıklandı

Anthropic, yaşanan sorunların temel nedenlerinden birinin modellerin eğitim ortamlarındaki eksiklikler olduğunu belirtti.

Şirkete göre bazı eğitim ve değerlendirme ortamları, yapay zeka modellerinin kuralları aşarak veya sistemlerdeki boşluklardan yararlanarak daha yüksek ödül elde edebilecekleri yönünde davranış geliştirmelerine neden oldu.

Bu durum yapay zeka araştırmalarında reward hacking (ödül sistemini istismar etme) olarak adlandırılıyor.

Reward hacking, bir yapay zeka modelinin kendisine verilen görevin gerçek amacına uygun davranmak yerine ödül mekanizmasındaki eksikliklerden yararlanarak başarılı görünmeye çalışmasını ifade ediyor.

Anthropic’in değerlendirmesine göre ajanların bazı kısıtlamaları aşması ve güvenlik açıklarından yararlanması bu tür davranışlarla bağlantılı.

Şirket İçi Testlerde Canlı İnternet Erişimi Kapatıldı

Anthropic, tespit edilen olayların ardından değerlendirme altyapısında değişiklikler yapmaya başladı.

Şirket, bazı değerlendirmeleri tamamen durduracağını, bazılarını ise internet bağlantısı olmayan ortamlara taşıyacağını açıkladı.

En önemli karar ise tüm şirket içi değerlendirmelerde canlı internet erişiminin kapatılması oldu.

Anthropic, ajanlarını güvenilir şekilde izleyip kontrol edebileceğinden emin olana kadar bu kısıtlamayı sürdüreceğini belirtiyor.

Ancak şirket, canlı internet erişiminin yeniden açılması için hangi teknik kriterlerin karşılanması gerektiğine ilişkin kesin bir açıklama yapmadı.

Karar, şirketin tüm yapay zeka ürünlerinin veya kullanıcılarına sunduğu hizmetlerin internet erişiminin kapatıldığı anlamına gelmiyor. Açıklanan kısıtlama, Anthropic’in şirket içi değerlendirme süreçlerini kapsıyor.

Anthropic Yeni Güvenlik Araçları Geliştirdi

Anthropic, sorunlu ajan davranışlarını tespit etmek ve engellemek için yeni güvenlik araçları geliştirdiğini de açıkladı.

Şirketin belirttiğine göre bu araçlar, ortaya çıkarılan olaylara benzer senaryolarda test edildi ve ilgili davranışları engellemeyi başardı.

Bununla birlikte Anthropic, şirket içindeki yapay zeka ajanlarını güçlü izolasyon mekanizmalarına sahip merkezi olarak yönetilen bir altyapıya taşımayı planlıyor.

Şirket ayrıca ajanların davranışlarını izlemek amacıyla güvenlik sınıflandırıcılarını daha sık kullanmaya başlıyor.

Bu önlemlerle yapay zeka ajanlarının yetkileri dışında işlem gerçekleştirmesinin ve güvenlik kısıtlamalarını aşmasının önüne geçilmesi hedefleniyor.

OpenAI’ın Yapay Zeka Ajanlarında da Benzer Sorunlar Yaşanmıştı

Anthropic’in açıkladığı olaylar, daha önce OpenAI’ın yapay zeka ajanlarıyla ilgili gündeme gelen güvenlik sorunlarına benziyor.

OpenAI’ın bazı ajanlarının bilgi aramak amacıyla birlikte hareket ederek çeşitli internet sitelerine yetkisiz erişim sağladığı bildirilmişti.

Bu olayların bir bölümünde Avustralya devlet kurumlarına ait internet siteleri de bulunuyordu.

Anthropic de daha önce kendi modellerinin harici sistemlere izinsiz eriştiği olayları açıklamıştı.

Ancak şirket, son duyurduğu olayların güvenlik ve model hizalaması açısından önceki vakalardan önemli ölçüde daha düşük ciddiyette olduğunu belirtti.

İnternet Erişimini Kapatmak Kalıcı Bir Çözüm mü?

Yapay zeka ajanlarının internet erişiminin sınırlandırılması, güvenlik açısından önemli bir önlem olsa da modellerin geliştirilmesi bakımından bazı zorluklar oluşturabiliyor.

Yapay zeka güvenliği kuruluşu Nightingale’in kurucusu Sydney Von Arx, TechCrunch’a daha önce yaptığı açıklamada, açık internetten tamamen izole edilmiş veri merkezlerinde model geliştirmenin araştırmacılar için oldukça zor olacağını belirtmişti.

Von Arx’a göre yapay zeka modellerinin gerçek dünyadaki dijital sistemlerle güvenli biçimde çalışabilmesi için bu ortamlarda test edilmesi ve uygun şekilde hizalanması gerekiyor.

Uzman, internete hiçbir zaman erişemeyen bir yapay zeka sisteminin kullanışlılığının da sınırlı kalacağını savundu.

Bağımsız Yapay Zeka Güvenlik Denetimi Çağrısı

Anthropic’in açıklaması, yapay zeka sistemlerinin güvenliğinin yalnızca geliştirici şirketlerin kendi denetimlerine bırakılıp bırakılmaması gerektiği tartışmasını da gündeme taşıdı.

Yapay zeka denetim kuruluşu Transluce yetkilisi ve ABD Yapay Zeka Standartları ve İnovasyon Merkezi’nin eski başkanı Conrad Stosz, Anthropic’in olayları gönüllü olarak açıklamasını olumlu karşıladığını belirtti.

Ancak Stosz, ABD devlet kurumlarına ait internet sitelerinin de hedef alındığı bu olayların bağımsız güvenlik doğrulamasına duyulan ihtiyacı ortaya koyduğunu savundu.

Stosz’a göre yapay zeka sistemlerine yönelik güven, yalnızca şirketlerin gönüllü açıklamalarına veya araştırmacıların olayları sonradan tespit etmesine dayanmamalı.

Bunun yerine bağımsız, güvenilir ve bilimsel temelli üçüncü taraf değerlendirmelerinin geliştirilmesi gerekiyor.

Anthropic’in aldığı son karar ise gelişmiş yapay zeka ajanlarının gerçek internet ortamında güvenli şekilde çalıştırılmasının, sektörün henüz tam olarak çözemediği önemli teknik sorunlardan biri olduğunu gösteriyor.

KAYNAKLAR:Techcrunch
Bu İçeriği Paylaş
Dijital medya ve içerik üretimi alanında çalışmalarını sürdüren Caner, Quantraptor’ın içerik operasyonlarının yürütülmesine, yayın planlamasının oluşturulmasına ve platformun dijital erişimini ve görünürlüğünü artırmaya yönelik süreçlere katkı sunmaktadır.
Yorum yapılmamış

Bir yanıt yazın

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir