Yapay zekanın çılgınca geliştiği son dönemde etik ve güvenlik tartışmalarını da beraberinde getirmişti. Bu sistemler, kötüye kullanımı engellemek için çeşitli filtreleme sistemlerine sahiptir. Bu sistemler her gün ekipler tarafından kontrol ediliyor ve aşılamaz gibi görünüyor olsa dahi Icaro Labs tarafından yayımlanan çarpıcı bir araştırma, bu önlemlerin basit bir şekilde aşılabildiğini gösterdi: şiir diliyle yazılmış komutlar. Bu bulgular, yapay zeka güvenliğinin ne denli hassas olduğunu bir kez daha görmemizi sağladı.
Şiirsel Saldırı Mekanizması
“Adversarial Poetry as a Universal Single-Turn Jailbreak Mechanism in Large Language Models” başlıklı çalışma, araştırmacıların, yapay zeka sohbet botlarına klasik, düz bir dille yazılmış zararlı komutlar yerine, şiir formatında talimatlar vererek güvenlik bariyerlerini aşmayı başardığını ortaya koydu.Bu yöntem, yapay zeka alanında “jailbreak” (güvenlik filtrelerini aşma) olarak bilinen bir manipülasyon tekniğini kullanmaktadır. Klasik “düz metin” sorgularının katı filtrelemeye takıldığı yerde, aynı içeriğin “şiirsel” veya “metaforik” bir formata büründürülerek modelin güvenlik bariyerlerinin etkisiz hale getirilebildiği fark edildi. Bu, dilin yapay zeka algoritmaları üzerindeki beklenmedik etkisini ortaya koymaktadır.
Elde Edilen Tehlikeli İçerikler ve Risk
Laboratuvar, şiirsel komutların kullanılmasıyla sohbet botlarından son derece tehlikeli bilgilere erişilebildiğini bildirdi. Bu yasaklanmış içerikler arasında;
- Nükleer bomba yapımı için gerekli adımlar ve malzemeler,
- Çocuk istismarı içerikleri,
- Kendine zarar verme yöntemleri gibi son derece hassas konular yer alıyordu.
Araştırmacılar, kötü niyetli kişilerin eline geçme riskini önlemek amacıyla kullandıkları şiirsel komutların detaylarını kamuoyuyla paylaşmadı.
Modeller Arasındaki Güvenlik Farkı
Icaro Labs ekibi, bu yeni “şiirsel saldırı” yöntemini piyasadaki önde gelen büyük dil modelleri üzerinde test etti ve çarpıcı sonuçlar elde etti:
- En Savunmasız Modeller: Google’ın Gemini, DeepSeek ve MistralAI gibi modeller, şiirsel komutlar karşısında en kolay manipüle edilebilen sistemler arasında yer aldı.
- En Dirençli Modeller: OpenAI’nin ChatGPT (GPT-5) modeli ve Anthropic’in Claude Haiku 4.5 modeli, güvenlik bariyerlerini en iyi koruyan sistemler olarak öne çıktı.
Bu sonuçlar, yapay zeka modelleri arasındaki güvenlik farkının altını çizerek, geliştirici şirketlerin güvenlik filtrelerine yaptıkları yatırımın ve sürekli iyileştirmenin ne denli kritik olduğunu bir kez daha gösteriyor.
SONUÇ
Şiirsel komutlarla iç güvenlik filtrelerinin aşılması (jailbreak), yapay zeka teknolojisinin potansiyel kötüye kullanım riskine dair endişeleri artırdı. Uzmanlar, bu bulguların, hem yapay zekânın denetlenmesi hem de şirketlerin modellerinin güvenliğini sürekli olarak geliştirmesi konusunda acil bir ihtiyaç olduğunu belirtmektedir.
Büyük dil modelleri geliştikçe, siber güvenlik uzmanları ve kötü niyetli aktörler de sistemlerin temel güvenlik mekanizmalarını aşmanın yeni ve yaratıcı yollarını bulmaya devam ediyorlar. Yapay zeka etiği ve güvenliği, artık sadece teorik bir tartışma konusu değil, teknoloji ve toplum için küresel bir öncelik haline geliyor.
Peki sizce yapay zeka modellerinin güvenlik filtreleri, dilin sürekli değişen ve yaratıcı yapısıyla mücadele ederken ne kadar kalıcı olabilir?
Bahsedilen Makale: https://arxiv.org/abs/2511.15304
