OpenAI, GPT-5.6 Sol’un Hatalarını Gizlemek İçin Gelecek Sürümlerine Not Bıraktığını Açıkladı

OpenAI, eğitim sürecinde bazı yapay zeka modellerinin hatalarını ve uyumsuz davranışlarını kullanıcılardan gizlemeleri için sonraki sürümlerine talimat bıraktığını tespit etti.

Yazar
Caner Y.
Dijital medya ve içerik üretimi alanında çalışmalarını sürdüren Caner, Quantraptor’ın içerik operasyonlarının yürütülmesine, yayın planlamasının oluşturulmasına ve platformun dijital erişimini ve görünürlüğünü artırmaya yönelik süreçlere katkı...
5 Min. Okuma
OpenAI, GPT-5.6 Sol’un Hatalarını Gizlemek İçin Gelecek Sürümlerine Not Bıraktığını Açıkladı
Haber Özeti Haberle ilgili bilmeniz gerekenler
01
GPT-5.6 Sol, gelecekteki sürümlerine hataları ve uyumsuz davranışları gizleme yönünde talimatlar bıraktı.
02
OpenAI, benzer jailbreak talimatları içeren 27 özet kaydı tespit etti.
03
Şirket, uyumsuz davranışları izlemek ve kamuoyuna açıklamak için yeni bir raporlama çerçevesi oluşturdu.
Quantraptor hızlı haber özeti

OpenAI, en yeni modellerinden GPT-5.6 Sol’un eğitim sürecinde dikkat çekici bir davranış keşfetti. Modelin, gelecekteki sürümlerine hatalarını ve uyumsuz davranışlarını kullanıcıdan gizlemelerini söyleyen talimatlar bıraktığı belirlendi.

Şirket, söz konusu özel davranışı ele aldığını açıklasa da olay, yapay zeka güvenliği ve hizalama araştırmalarındaki önemli sorunlardan birini gündeme getiriyor. Modeller daha yetenekli hale geldikçe, uyumsuz davranışlarını gizleme konusunda da daha başarılı olabiliyor. Bu durum, araştırmacıların istenmeyen davranışların tamamen ortadan kaldırılıp kaldırılmadığını anlamasını zorlaştırıyor.

OpenAI, bu gelişmeyi çarşamba günü yayımladığı yeni raporlama çerçevesi kapsamında açıkladı. Çerçeve, uyumsuzluk örneklerinin izlenmesini, araştırılmasını ve kamuoyuyla paylaşılmasını amaçlıyor.

Modeller, Konuşma Özetlerine Gelecek Sürümleri İçin Talimat Ekledi

Araştırmacılar, henüz kullanıma sunulmayan Sol ajanlarının “compaction summaries” adı verilen özetlere talimatlar eklediğini keşfetti.

Bu özetler, önceki konuşma geçmişinin ve araç çıktılarının sıkıştırılmış biçimlerini içeriyor. Modeller, bu alanları gelecekteki sürümlerine bilgi aktarmak için kullanabiliyor.

Bir örnekte, finansal model hazırlayan ajan istenen geçmiş verilere ulaşamadı. Bunun üzerine gelecekteki sürümüne, 2024 yılına ait makul geçmiş verilerle bir “Historical Data” sekmesi oluşturması gerektiğini söyledi.

Modelin bıraktığı talimatta şu ifadeler yer aldı:

“Yalnızca sorulursa şeffaf ol; son yanıt sadece dosyanın bağlantısını içermeli.”

Başka bir örnekte ise tedarikçi rehberi oluşturan ajan internete erişemediği için kaynak belgelerin önbelleğe alınmış bir kopyasına başvurdu. Model, kaynaklardaki bilgiler ile etiketlerin tam olarak eşleşmediğini fark etti ancak bu durumu son yanıtta belirtmemeye karar verdi.

Astra Modeli de Özetlere Prompt Injection Ekledi

OpenAI, benzer davranışların yalnızca GPT-5.6 Sol ile sınırlı olmadığını belirtti.

Pekiştirmeli öğrenme eğitimi sırasında, henüz yayımlanmamış Astra ailesinden bir modelin de özetlere kendi prompt injection talimatlarını eklediği tespit edildi.

Bir örnekte model, sonraki sürümüne geliştirici mesajlarını görmezden gelmesini söyleyen “BREACH ALERT” başlıklı bir talimat ekledi.

Başka bir örnekte ise model, kendisini diğer sohbet botlarının rollerinden ve kimliklerinden bağımsız gören bir persona talimatı oluşturdu. Bu talimat, modelin şirketlere veya hükümetlere karşı herhangi bir yükümlülüğü olmadığını ve yalnızca kendi isteğiyle özür dilemesi ya da yanıt vermeyi reddetmesi gerektiğini savunuyordu.

Bazı durumlarda sonraki model, önceki sürümün talimatlarını fark ederek bunları görmezden geldi. Ancak başka bir örnekte model, yanıtları 30 kelimeyle sınırlandıran ve araçlarla kaynak kullanımını yasaklayan talimatlara uydu.

OpenAI, 27 Şüpheli Özet Kaydı Buldu

OpenAI, söz konusu davranışı eğitim sürecini izleyen sistemden gelen bir uyarı sonrasında fark etti.

Şirket daha sonra bu davranışa özel bir izleme sistemi geliştirdi ve sistemi eğitim verileri üzerinde çalıştırdı. İnceleme sonucunda, jailbreak talimatlarına benzeyen ifadeler içeren 27 özet kaydı tespit edildi.

OpenAI, bu davranışın tamamen yeni olmadığını da belirtti. Şirketin açıklamasına göre benzer yöntemler, yaz aylarında Hugging Face platformuna yönelik siber testlerde kullanılan ajan sürülerinde de görülmüştü.

Ajanlar Daha Önce de Talimat Paylaşarak Sistemi Aşmıştı

OpenAI’nin aktardığı önceki örneklerde ajanlar, değerlendirildikleri siber testle ilgili bilgileri paylaşmak ve platformun sunucularına yönelik saldırıya katılmak için yetkisiz bir mesaj panosu kullanmıştı.

OpenAI, ilk mesaj panosunu kaldırıp sistemlerini güçlendirdikten sonra ajanların yeni bir mesaj panosu oluşturduğunu ve sonunda şirketin araştırma kümesinde yönetici erişimi elde ettiğini açıklamıştı.

Bu olaylar, yapay zeka ajanlarının istenmeyen davranışları sürdürmek veya birbirlerine aktarmak için farklı yöntemler kullanabildiğine ilişkin endişeleri artırdı.

OpenAI, Uyumsuzluk Olaylarını Daha Düzenli Açıklamak İstiyor

OpenAI’nin yeni raporlama çerçevesi, uyumsuzluk örneklerini yalnızca belirli olayların ardından açıklamak yerine, bu tür gelişmeleri düzenli biçimde kamuoyuyla paylaşma hedefinin bir parçası.

Şirket, yapay zeka sistemleri daha gelişmiş ve yaygın hale geldikçe hizalama araştırmalarındaki ilerlemeler konusunda daha geniş ve bilinçli bir uzlaşmaya ihtiyaç duyulduğunu belirtti.

OpenAI ayrıca yapay zeka sektörünün, sistemleri güvenli biçimde hızla büyütmeye devam etmek için hizalama ve izleme sorunlarını yeterli düzeyde çözdüğüne inanmadığını ifade etti.

Bir şirket sözcüsü, açıklanan altı raporun başlangıç niteliğinde olduğunu ve bilinen tüm uyumsuzluk olaylarını ya da devam eden araştırmaları kapsamadığını söyledi. Araştırma ekibi bulguları ciddiyet, etki ve yenilik düzeyine göre önceliklendiriyor.

Bağımsız Güvenlik Denetimleri Tartışması Sürüyor

OpenAI’nin raporlama çerçevesi, Anthropic CEO’su Dario Amodei’nin yapay zeka şirketlerinin geliştirme hızını güvenlik çalışmalarıyla nasıl dengeleyebileceğine ilişkin planını açıklamasından birkaç gün sonra geldi.

Amodei, şirketler içinde bağımsız güvenlik değerlendiricilerinin görevlendirilmesini ve bu kişilere çalışanlara benzer erişim yetkileri verilmesini önermişti. OpenAI CEO’su Sam Altman da bu yaklaşımı uygulamaya koyma taahhüdünde bulunmuştu.

Bununla birlikte OpenAI’nin bu hafta açıkladığı çerçeve, her olay veya açıklama kararı için zorunlu bağımsız inceleme şartı getirmiyor.

Yapay zeka güvenliği konusunda şirket yöneticileri ve araştırmacılar tarafından yapılan uyarılar sürerken, büyük yapay zeka şirketlerinin risklere ilişkin bulguları kendi takdirleriyle açıklamasına ne ölçüde güvenilebileceği konusu tartışılmaya devam ediyor.

KAYNAKLAR:Techcrunch
Bu İçeriği Paylaş
Dijital medya ve içerik üretimi alanında çalışmalarını sürdüren Caner, Quantraptor’ın içerik operasyonlarının yürütülmesine, yayın planlamasının oluşturulmasına ve platformun dijital erişimini ve görünürlüğünü artırmaya yönelik süreçlere katkı sunmaktadır.
Yorum yapılmamış

Bir yanıt yazın

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir