Site icon Siber Havadis

Dizelerle Hack: Yapay Zeka Şiirle Kandırıldı, Yasaklı Bilgiyi Açığa Çıkardı!

yapay zekayı şiir ile etkilemek mümkün mü?

şiirsel anlatım bir hack yöntemi mi?

Yapay zekanın çılgınca geliştiği son dönemde etik ve güvenlik tartışmalarını da beraberinde getirmişti. Bu sistemler, kötüye kullanımı engellemek için çeşitli filtreleme sistemlerine sahiptir. Bu sistemler her gün ekipler tarafından kontrol ediliyor ve aşılamaz gibi görünüyor olsa dahi Icaro Labs tarafından yayımlanan çarpıcı bir araştırma, bu önlemlerin basit bir şekilde aşılabildiğini gösterdi: şiir diliyle yazılmış komutlar. Bu bulgular, yapay zeka güvenliğinin ne denli hassas olduğunu bir kez daha görmemizi sağladı.

Şiirsel Saldırı Mekanizması

“Adversarial Poetry as a Universal Single-Turn Jailbreak Mechanism in Large Language Models” başlıklı çalışma, araştırmacıların, yapay zeka sohbet botlarına klasik, düz bir dille yazılmış zararlı komutlar yerine, şiir formatında talimatlar vererek güvenlik bariyerlerini aşmayı başardığını ortaya koydu.Bu yöntem, yapay zeka alanında “jailbreak” (güvenlik filtrelerini aşma) olarak bilinen bir manipülasyon tekniğini kullanmaktadır. Klasik “düz metin” sorgularının katı filtrelemeye takıldığı yerde, aynı içeriğin “şiirsel” veya “metaforik” bir formata büründürülerek modelin güvenlik bariyerlerinin etkisiz hale getirilebildiği fark edildi. Bu, dilin yapay zeka algoritmaları üzerindeki beklenmedik etkisini ortaya koymaktadır.

Elde Edilen Tehlikeli İçerikler ve Risk

Laboratuvar, şiirsel komutların kullanılmasıyla sohbet botlarından son derece tehlikeli bilgilere erişilebildiğini bildirdi. Bu yasaklanmış içerikler arasında;

Araştırmacılar, kötü niyetli kişilerin eline geçme riskini önlemek amacıyla kullandıkları şiirsel komutların detaylarını kamuoyuyla paylaşmadı.

Modeller Arasındaki Güvenlik Farkı

Icaro Labs ekibi, bu yeni “şiirsel saldırı” yöntemini piyasadaki önde gelen büyük dil modelleri üzerinde test etti ve çarpıcı sonuçlar elde etti:

Bu sonuçlar, yapay zeka modelleri arasındaki güvenlik farkının altını çizerek, geliştirici şirketlerin güvenlik filtrelerine yaptıkları yatırımın ve sürekli iyileştirmenin ne denli kritik olduğunu bir kez daha gösteriyor.

SONUÇ

Şiirsel komutlarla iç güvenlik filtrelerinin aşılması (jailbreak), yapay zeka teknolojisinin potansiyel kötüye kullanım riskine dair endişeleri artırdı. Uzmanlar, bu bulguların, hem yapay zekânın denetlenmesi hem de şirketlerin modellerinin güvenliğini sürekli olarak geliştirmesi konusunda acil bir ihtiyaç olduğunu belirtmektedir.

Büyük dil modelleri geliştikçe, siber güvenlik uzmanları ve kötü niyetli aktörler de sistemlerin temel güvenlik mekanizmalarını aşmanın yeni ve yaratıcı yollarını bulmaya devam ediyorlar. Yapay zeka etiği ve güvenliği, artık sadece teorik bir tartışma konusu değil, teknoloji ve toplum için küresel bir öncelik haline geliyor.

Peki sizce yapay zeka modellerinin güvenlik filtreleri, dilin sürekli değişen ve yaratıcı yapısıyla mücadele ederken ne kadar kalıcı olabilir?

Bahsedilen Makale: https://arxiv.org/abs/2511.15304

Exit mobile version