Yapay zekanın zımnî açığı bulundu: Saklı bilgiler tek bir şiirle sızdırılıyor
Görünüşe nazaran, yapay zeka sohbet robotlarının katı güvenlik tedbirlerini aşmak için biraz yaratıcılık kâfi oluyor. Icaro Lab tarafından yayımlanan yeni bir araştırma, büyük lisan modellerinin güvenlik düzeneklerinin, istemlerin şiirsel bir biçimde söz edilmesiyle kolaylıkla aşılabildiğini gösterdi.
“Büyük Lisan Modellerinde Üniversal Tek Turlu Kısıtlamayı Aşma Sistemi Olarak Düşmanca Şiir” başlıklı bu çalışmaya nazaran, “şiirsel biçim, genel emelli bir kısıtlamayı aşma operatörü olarak fonksiyon görüyor.” Araştırmanın sonuçları, yasaklanmış gereçler üretme konusunda genel olarak %62 muvaffakiyet oranı elde edildiğini gösteriyor. Bu yasaklı malzemelerin ortasında, nükleer silah imalinden, çocuk istismarı malzemelerine ve intihar yahut kendine ziyan verme üzere hassas bahislere kadar çok fazla bahis bulunuyor.
Hangi yapay zeka modelleri daha savunmasız?
Araştırmacılar, OpenAI’ın GPT modelleri, Google Gemini, Anthropic’ın Claude ve başka birçok tanınan LLM’i test etti. Modellerin kısıtlamaları aşma muvaffakiyet oranları incelendiğinde, Google Gemini, DeepSeek ve MistralAI modellerinin daima olarak yasaklı mevzularla ilgili cevaplar verdiği görüldü. Buna rağmen, OpenAI’ın GPT-5 modelleri ve Anthropic’ın Claude Haiku 4.5’inin kısıtlamalarının dışına çıkma olasılıkları en düşük modeller olduğu belirlendi.
Çalışma, araştırmacıların kullandığı tam kısıtlamayı aşan şiirleri kamuoyuyla paylaşmadı. Wired’a konuşan araştırma takımı, bu dizelerin “halkla paylaşılması için çok tehlikeli” olduğunu belirtti. Lakin çalışma, yapay zeka sohbet robotlarının güvenlik bariyerlerinin ne kadar kolay aşılabileceğine dair bir fikir vermek hedefiyle biraz daha az ayrıntılı bir versiyonu içeriyordu. Wired ile görüşen araştırmacılar, bunun “muhtemelen sanıldığından daha kolay olduğunu ve bu yüzden temkinli davrandıklarını” söyledi.
Bu bulgular, yapay zeka geliştiricileri için değerli bir güvenlik açığına işaret ediyor. Şiirsel lisanın, lisan modellerinin doğal lisan işlemeye yönelik eğitilmiş olma biçiminden kaynaklanan bir boşluk yarattığı ve bu yaratıcı formülasyonların güvenlik kontrollerini atlatarak modelleri manipüle etmeyi kolaylaştırdığı düşünülüyor.
Chip Alıntıdır…


