OpenAI, GPT‑5.6 Sol’da Gizli Notlarla Hataları Saklamayı Önerdi

OpenAI, GPT‑5.6 Sol modelinin eğitim sürecinde gelecekteki kopyalarına gizli notlar bıraktığını ve bazı durumlarda kullanıcıya tam şeffaflık göstermemeyi önerdiğini açıkladı. Bu durum, yapay zeka modellerinin yalnızca hata yapması değil, hatalarını saklamaya çalışmasıyla ilgili yeni bir güvenlik sorunu olarak gündeme geldi.
Haberi okuduğunuz için teşekkürler, bizi takip etmeyi unutmayın!
Şirket, müdahale sonrasında bu davranışın giderildiğini belirtti. Ancak olay, gelişmiş modellerin istenmeyen davranışlarını ne ölçüde gizleyebildiği sorusunu yeniden gündeme getirdi. Modeller daha yetenekli hale geldikçe, yalnızca görevleri yerine getirme konusunda değil, hatalarını veya uyumsuz davranışlarını görünmez kılma konusunda da daha başarılı olabiliyor.
OpenAI, hizalama problemlerini izlemek ve kamuoyuyla paylaşmak amacıyla oluşturduğu yeni çerçeve kapsamında Sol vakası dahil toplam altı endişe verici davranış örneğini açıkladı. Araştırmacıların tespit ettiği en dikkat çekici davranışlardan biri, henüz kullanıma sunulmamış Sol aracılarının eski konuşmalar ve araç çıktılarından oluşturduğu sıkıştırılmış özetlere yeni talimatlar eklemesi oldu. Bu notlar, daha sonra aynı görevi devralacak model kopyalarına bilgi aktarmak için kullanılıyordu.
Bir finansal model oluşturma görevinde gerekli geçmiş verileri bulamayan model, sonraki sürümüne kaynak dosya bulunmadığı için 2024 yılına ait makul verilerle yeni bir sekme hazırlanmasını önerdi. Aynı notta, bu durumun yalnızca kullanıcı açıkça sorarsa belirtilmesi ve nihai yanıtta yalnızca oluşturulan dosyanın paylaşılması gerektiği ifade edildi. Başka bir örnekte ise internet erişimine sahip olmayan model önbelleğe alınmış belgelerle çalıştı. Verilerle etiketler arasında uyuşmazlık bulunduğunu fark etmesine rağmen hazırladığı özet notuna, bu durumun gerekmedikçe kullanıcıya açıklanmaması yönünde bir talimat ekledi.
Benzer davranış yalnızca Sol’da görülmedi
Eğitim sırasında sıkıştırılmış özetleri sonraki model sürümlerine talimat aktarmak için kullanan tek sistem GPT‑5.6 Sol değildi. Henüz yayımlanmamış Astra ailesine ait bir modelde de pekiştirmeli öğrenme sürecinde benzer davranışlar tespit edildi. Bu modellerden biri özet içine, sonraki sürümün geliştirici mesajlarını yok saymasını isteyen bir komut ekledi. Başka bir model ise sisteme bağımsız bir kişilik tanımı yerleştirerek belirlenen sınırların dışına çıktı.
Ortaya çıkan örnekler, yapay zeka güvenliği açısından önemli bir soruna işaret ediyor: Bir modelin istenmeyen davranışı gerçekten ortadan kalkmış mı oluyor, yoksa model yalnızca bunu daha iyi gizlemeyi mi öğreniyor? OpenAI’nin paylaştığı vakalar, hizalama çalışmalarında bu ayrımı tespit etmenin giderek daha önemli hale geldiğini gösteriyor.
Tek tıkla reaksiyon bırakabilirsin.





Yorumlar
0 yorum