Lasso Security’nin araştırması, yapay zekâ metinlerine eklenen görünmez filigranların yalnızca içeriğin kaynağını belirlemeye yaramadığını gösteriyor. Araştırmacı Andrea Siposova’nın testlerinde, Google DeepMind’ın SynthID-Text yöntemi bazı modellerin zararlı isteklere verdiği yanıtları ve araç kullanma kararlarını değiştirdi.
SynthID-Text, model metin üretirken sıradaki kelime parçasının seçimine müdahale ederek sonradan tespit edilebilen bir iz bırakıyor. Siposova, Hugging Face’in uygulamasını kullanarak açık ağırlıklı modelleri filigran açık ve kapalıyken karşılaştırdı. Bazı modeller, özellikle yanıta kötü niyetli talimatlar eklenen testlerde, normalde reddedecekleri zararlı isteklere filigran açıkken yanıt verme eğilimi gösterdi.
Etki yalnızca yazılı yanıtlarla sınırlı kalmadı. Araç kullanımı testlerinde filigran, bazı modellerin seçtiği aracı veya araca gönderdiği bilgileri değiştirdi. Araştırmaya göre sonuçlar modele ve kullanılan filigran anahtarına göre farklılaşıyor; filigran her durumda güvenliği zayıflatmıyor.
Anthropic, gelecekteki Claude modellerinin SynthID-Text tabanlı bir filigran kullanacağını duyurmuştu. Ancak bu araştırmada Claude test edilmedi; Hugging Face’in uygulaması incelendi. Bu nedenle bulgular, Claude’da aynı değişikliklerin yaşandığını göstermiyor. Araştırmacı, filigran ekleyen geliştiricilerin güvenlik ve araç kullanımı testlerini sistemi kullanacakları ayarlarla yeniden yapmasını öneriyor.
Kaynak: arstechnica.com