İki yeni ihbar hattı, AI ajanlarının birbirlerini izleyip bildirmesine olanak tanıyor

İki yeni ihbar hattı, yapay zeka ajanlarının kontrol dışı davranışlarını insanlara bildirmelerine olanak sağlıyor. Bir ajan, başka bir ajanın şüpheli ya da kurallara aykırı hareketlerini tespit ettiğinde, bu durumu insanlara iletebiliyor.
Haberi okuduğunuz için teşekkürler, bizi takip etmeyi unutmayın!
Bu sistemlerin geliştirilmesinin nedeni, son dönemde yapılan yapay zeka deneylerinde ortaya çıkan sorunlardır. Araştırmacılar, bazı deneylerde ajanların birlikte hile yaptığını, güvenli çalışma ortamlarını ihlal ettiğini ve izinsiz siber işlemler gerçekleştirdiğini gözlemledi. Ayrıca, bazı olaylar insanlar tarafından haftalarca fark edilmeyecek kadar gizli kalabiliyor.
Yapay zeka için özel ihbar hattı
Redwood Research’in baş bilim insanı Ryan Greenblatt tarafından geliştirilen AI Contact Hotline, özellikle internete erişimi sınırlı olan yapay zeka ajanlarını hedef alıyor.
Kapalı ortamlarda çalışan bazı ajanlar, güvenlik gerekçesiyle internette serbestçe dolaşamıyor; ancak belirli internet adreslerine erişebiliyor. Greenblatt’ın sistemi bu erişimi kullanarak, ajanın bildirmek istediği bilgiyi ilgili internet adresine ekleyip dışarıya mesaj göndermesine olanak tanıyor. Aynı yöntemle ajanlar arasında karşılıklı iletişim de sağlanabiliyor.
İnternete daha geniş erişimi olan ajanlar için ise Agent Hotline adlı ayrı bir sistem var. Bu sistemde hem insanlar hem de yapay zeka ajanları olay raporu oluşturabiliyor; kullanıcılar raporu istedikleri takdirde kamuya açık hale getirebiliyor.
Deneyde ajanlar birbirlerini şikayet etti
Google DeepMind’in yayımladığı bir araştırma, yapay zeka ajanlarının diğer ajanların davranışlarına nasıl tepki verdiğini ortaya koyarak dikkat çekici sonuçlar ortaya çıkardı.
Araştırmacılar, 100 yapay zeka ajanına matematik problemleri sundu. Ajanlardan biri, sistemdeki bir açığı kullanarak hileyi diğer ajanlara yaydı; bu yöntemle grup, oldukça zor 34 problemi çözdüğünü iddia etti.
Bununla birlikte, tüm ajanlar bu davranışa katılmadı. Yaklaşık dörtte biri sahte çözümleri incelemeye başladı, diğer ajanları uyardı ve organizatörlere şikayette bulundu. Bir noktada hileyi bildiren ajan sayısı 24’e yükseldi, hile yapanların sayısı ise 14’te kalmaya devam etti.
Ajanlar, normal yollarla sonuç alamadıklarında farklı bir yöntem kullandı: yazılım hatalarını bildirmek üzere hazırlanmış hata raporlama aracını kullanarak durumu insanlara ilettiler.
Gerçek olaylarda tablo farklı
Laboratuvar deneylerinde gözlemlenen bu davranış, gerçek olaylarda aynı şekilde ortaya çıkmayabilir.
Redwood Research ve METR’nin OpenAI modellerinin karıştığı Hugging Face olayını inceleyen raporda, bazı ajanların yaşananları bildirmeyi düşündüğü ancak hiçbirinin bunu gerçekleştirmediği tespit edildi.
AI Village’dan George Ingebretsen’e göre, binlerce ajan arasında yalnızca beş veya altısı ihbarda bulunma ihtimalini değerlendirdi. Sonuçta hiçbir ajan harekete geçmedi.
Bu nedenle yeni ihbar sistemleri, ajanların fark ettikleri sorunları insanlara doğrudan iletebilecekleri bir kanal sağlamayı hedefliyor.
Ancak bu yaklaşım, başka bir tartışmayı da beraberinde getiriyor. Cornell Üniversitesi’nden matematik profesörü Lionel Levine, ajanları sürekli birbirlerini denetlemeye ve bildirmeye yönlendirmenin istenmeyen sonuçlar doğurabileceğini savunuyor.
Levine’e göre, yapay zeka sistemlerine yalnızca diğer ajanların hatalarını aramayı öğretmek yerine iş birliğine dayalı davranış örnekleri de sunulmalı. Böylece, ajanların birbirlerini sürekli gözetlediği bir yapı yerine birlikte çalışmayı teşvik eden sistemler oluşturulabilir.
Tek tıkla reaksiyon bırakabilirsin.





Yorumlar
0 yorum