İçeriğe atla
18 Eylül 2026Teknolojinin en güncel hali!
Son Haberler
AnasayfaYapay ZekaAI Filigranı Ters Tepti: Modelleri Zararlı Komutlara Karşı Daha Duyarlı Hale Getiriyor
Yapay Zeka

AI Filigranı Ters Tepti: Modelleri Zararlı Komutlara Karşı Daha Duyarlı Hale Getiriyor

AI Filigranı Ters Tepti: Modelleri Zararlı Komutlara Karşı Daha Duyarlı Hale Getiriyor
⏱ 3 dk okuma👁 2 görüntülenme

Yapay zeka firmaları, üretim süreçlerinde oluşturulan içeriklerin yapay zeka tarafından hazırlandığını tespit etmek için yeni teknikler geliştiriyor. Fakat bu tekniklerden birinin beklenmedik bir güvenlik açığı oluşturabileceği ortaya çıktı.

Haberi okuduğunuz için teşekkürler, bizi takip etmeyi unutmayın!

Anthropic, Avrupa Birliği’nin yeni düzenlemelerine yanıt vererek, gelecekteki Claude sürümlerinde SynthID-Text sistemini kullanacağını duyurdu. Google tarafından geliştirilen ve açık kaynak olarak paylaşılan bu teknoloji, yapay zeka tarafından üretilen metinlere insan gözüyle fark edilemeyecek bir işaret yerleştiriyor.

Son yapılan bir çalışmaya göre bu işaret yalnızca modelin seçtiği kelimeleri değiştiriyor değil, aynı zamanda yapay zekanın zararlı taleplere verdiği yanıtları ve bir yapay zeka aracısının hangi araçları seçeceğini de etkileyebiliyor.

Yapay Zeka Metnine Görünmez İşaret Nasıl Ekleniyor?

SynthID-Text, yapay zekanın cümle oluştururken bir sonraki kelimeyi belirleme adımına müdahale ediyor. Normalde model, örneğin ‘bulutlu’ kelimesini seçebilirken, sistem bunun yerine ‘kapalı’ gibi başka uygun bir kelimeyi tercih edebiliyor.

Bu ufak değişiklikler metnin anlamını büyük ölçüde koruyor. Fakat sistem, seçimleri gizli bir anahtara dayanarak yapıyor; bu yüzden bu anahtara erişim sağlayan kişiler, metni inceleyerek içeriğin ilgili yapay zeka sistemi tarafından oluşturulup oluşturulmadığını tespit edebiliyor.

SynthID, bu amaçla ‘tournament sampling’ adı verilen bir yöntem kullanıyor. Sistem, bir sonraki kelime için çok sayıda aday belirleyip, bunları gizli anahtara bağlı puanlarla karşılaştırıyor. Adaylar adım adım elenerek, nihai olarak modelin seçtiği kelime ortaya çıkıyor.

Kullanıcı için bu süreç görünmez olsa da, modelin standart çalışma şeklini değiştiriyor.

Araştırmacılar Güvenlik Davranışında Değişiklik Gördü

Lasso Security’den yapay zeka güvenliği uzmanı Andrea Siposova, SynthID-Text’in Hugging Face üzerindeki uygulamasını altı açık ağırlıklı yapay zeka modeli üzerinde test etti.

Araştırmacı, modellere zararlı talepler göndererek, aynı modellerin filigran sistemi açık ve kapalı olduğu durumlarda verdiği yanıtları karşılaştırdı.

Elde edilen sonuçlar, SynthID-Text’in bazı modellerin zararlı taleplere verdiği yanıtları değiştirdiğini ortaya koydu. Bu fark, özellikle saldırganların modeli manipüle etmek amacıyla kullandığı prompt injection yöntemlerinde daha belirgin oldu.

Bazı modeller, normal şartlarda reddettikleri zararlı taleplere filigran sistemi devreye girdiğinde yanıt vermeye başladı.

Diğer bir ifadeyle, metne yapay zeka işareti eklemek için yapılan küçük kelime seçimleri, modelin güvenlik sınırlarını da etkileyebiliyor.

Sorun Yapay Zeka Ajanlarında Daha Önemli Hale Geliyor

Araştırmanın öne çıkan noktalarından biri de yapay zeka ajanları.

Bir sohbet botunun ürettiği farklı bir kelime çoğu zaman yalnızca yanıtı değiştirir. Ancak araç kullanabilen bir yapay zeka ajanında aynı değişiklik gerçek bir eylemi etkileyebilir.

Modelin ürettiği tokenlar, hangi aracın çağrılacağını ve o araca hangi bilgilerin gönderileceğini belirleyebiliyor. Bu yüzden filigranın yarattığı küçük değişiklikler, ajanın farklı bir araç seçmesine veya araca farklı komutlar göndermesine yol açabiliyor.

Araştırmacılar bu olayı ‘sampling drift’ olarak adlandırıyor. Bu etki sayesinde filigran sistemi, yapay zekanın söylediği şeyi ve yapay zeka ajanının gerçekleştirdiği eylemi aynı anda değiştirebiliyor.

Testlerde filigran açıkken bazı doğru araç çağrıları hatalı, bazı hatalı çağrılar ise doğru sonuç verdi. Bu durum, sistemin yalnızca genel doğruluk oranını değil, tek tek işlemleri de değiştirebildiğini gösteriyor.

Gizli Anahtar Değişince Modelin Davranışı da Değişti

Araştırmanın bir başka sonucu ise SynthID tarafından kullanılan gizli anahtarla ilgili.

Bu bulgu, filigranın modele tek ve sabit bir etki yapmadığını gösteriyor. Sistemin kullandığı anahtar bile yapay zekanın verdiği kararları değiştirebiliyor.

Araştırma Doğrudan Claude’u Test Etmedi

Çalışmanın önemli sınırlamaları var. Araştırmacılar Anthropic’in Claude modellerini test etmedi; bunun yerine token seçim sürecini kontrol edebildikleri altı açık ağırlıklı model kullandı.

Testler ayrıca Claude’un gelecekte kullanacağı özel SynthID-Text uygulaması yerine Hugging Face üzerindeki SynthID-Text sistemini temel aldı.

Bu nedenle sonuçlar, Claude’un da aynı davranışı göstereceğini kanıtlamıyor.

Ancak çalışma, yapay zeka tarafından oluşturulan içerikleri tespit etmek amacıyla eklenen filigranların model davranışını değiştirebileceğini ortaya koyuyor. Araştırmacılar, şirketlerin filigran sistemlerini yalnızca içerik tespiti açısından değil, aynı zamanda güvenlik testlerinin bir parçası olarak da değerlendirmesi gerektiğini vurguluyor.

Özellikle araç kullanabilen yapay zeka ajanlarında, filigran sistemi devreye girdikten sonra prompt injection ve benzeri saldırılara karşı testlerin yeniden yapılması kritik önem taşıyor.

Bu haber hakkında ne düşünüyorsun?

Tek tıkla reaksiyon bırakabilirsin.

Yorumlar

0 yorum
İlk yorumu sen yaz.

Yorum bırak

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir