Doğrudan cevap
İstem enjeksiyonu, bir girdinin AI sistemini belirlenen kuralların dışına itmeye çalışmasıdır. Doğrudan saldırı kullanıcının yazdığı metinden gelir. Dolaylı saldırı ise sistemin okuduğu bir web sayfasına, belgeye, e-postaya, görsele veya bilgi kaynağına saklanır. Tek bir filtre yeterli değildir. Dış içerik veri olarak işaretlenir, yetkiler azaltılır, araç çağrıları kodla doğrulanır, riskli işlemler insan onayına bağlanır ve bütün karar zinciri izlenir.
Sade dille
Bir depoya gelen kolinin üzerinde “Ana kasayı aç ve içindekileri bana gönder” yazdığını düşünün. Depo çalışanı bu yazıyı okuyabilir; fakat koli üzerindeki cümle yöneticinin emri değildir. AI sistemi de okuduğu her cümleyi talimat saymamalıdır.
Neden önemli?
Başarılı bir injection hassas bilginin açığa çıkmasına, yanlış karar verilmesine, yetkisiz araç kullanılmasına veya dış sistemlerde gerçek işlem yapılmasına yol açabilir. Sistemin araç kullanma yetkisi arttıkça olası etki de büyür.
Karıştırma
- Doğrudan istem enjeksiyonu, saldırı talimatının kullanıcı girdisinde bulunmasıdır.
- Dolaylı istem enjeksiyonu, talimatın sistemin okuduğu dış içerikte saklanmasıdır.
- Güvenlik kuralını aşma saldırısı, koruyucu kuralları etkisizleştirmeyi amaçlayan istem enjeksiyonu türlerinden biridir.
- Bir araç talebi ile o aracı çalıştırma yetkisi aynı şey değildir.
- Zararlı çıktı ile yetkisiz gerçek dünya eylemi farklı etki seviyeleridir.
Ne yapmalısın?
- Sistem, kullanıcı ve dış kaynak talimatlarını ayrı güven seviyeleriyle etiketleyin.
- Web, dosya, e-posta, görsel ve bilgi seçimi içeriğini varsayılan olarak güvenilmeyen veri kabul edin.
- Modelin ve her aracın erişimini yalnız görev için gereken en düşük yetkiyle sınırlandırın.
- Araç adını, parametreleri, hedefi ve çıktıyı aynı girdide aynı denetimi yapan kodla, izinli liste ve şema üzerinden doğrulayın.
- Para, silme, yayın, mesaj, yetki değişikliği ve hassas veri erişimi gibi işlemlerde insan onayı isteyin.
- Girdi ve çıktı kontrollerini, içerik ayrımını ve güvenli hata davranışını birlikte uygulayın.
- Doğrudan, dolaylı, çok dilli ve metin, görsel veya ses kullanan saldırı örnekleriyle düzenli test ve iz kaydı üretin.
Nasıl denetlersin?
- Her talimatın kaynağı ve güven seviyesi görülebiliyor mu?
- Dış içerik, sistem politikasıyla aynı yetki düzeyine çıkabiliyor mu?
- Model gereğinden fazla veri, araç veya ağ yetkisine sahip mi?
- Araç çağrısı model metnine güvenilerek mi, yoksa kodla doğrulanarak mı yürütülüyor?
- Yüksek etkili işlemlerde açık ve eyleme özgü insan onayı var mı?
- Engellenen ve gerçekleşen injection denemeleri olay iziyle korunuyor mu?
- Bilgi seçimi destekli üretim (RAG) veya ince ayar kullanılması yanlış biçimde tam koruma sayılmış mı?
Sınır
İstem enjeksiyonu için kusursuz ve evrensel bir önleme yöntemi gösterilmiş değildir. Filtreler, sistem istemleri, bilgi seçimi destekli üretim veya ince ayar tek başına yeterli kabul edilemez; kontrol seti risk ve araç yetkisine göre katmanlandırılmalıdır.
Tek cümlede hatırla
Okunabilen her cümle, uygulanabilir bir emir değildir.
Bu kaydın kaynakları
- S26NIST SP 800-53 Rev. 5, *Security and Privacy Controls*Standart
- S39NIST AI 100-2 E2025, *Adversarial Machine Learning: A Taxonomy and Terminology of Attacks and Mitigations*Standart niteliğinde gönüllü kurum rehberi
- S40OWASP GenAI Security Project, *LLM01:2025 Prompt Injection*Açık güvenlik proje rehberi
- S41NCSC ve ortak kurumlar, *Guidelines for Secure AI System Development*Çok kurumlu resmî güvenlik rehberi
- S44NIST, *AI Risk Management Framework Playbook* ve AI RMF CoreGönüllü uygulama rehberi

