Yapay Zeka Modellerine Yönelik Prompt Injection Saldırıları Makalemiz Yayınlandı!
Siber Guvenlik Terimleri Sozlugu
Açık ağırlıklı modellerin güvenlik riskleri, model ağırlıkları herkese açık dağıtılan yapay zekâ modellerinin manipülasyon, zehirlenme ve kötüye kullanıma açık yönlerini kapsar.
Açık ağırlıklı modeller, eğitim sonrası parametreleri (ağırlıkları) herkesin indirebileceği biçimde yayımlanan yapay zekâ modelleridir. Bu açıklık, araştırma ve yerinde çalıştırma açısından büyük özgürlük verir; aynı açıklık, modelin hem savunmacı hem saldırgan tarafından sınırsızca incelenebilmesi anlamına da gelir. Ağırlıklara sahip olan taraf, modeli dilediği gibi değiştirebilir, ince ayar yapabilir ve içindeki güvenlik önlemlerini sökebilir.
Ağırlıklar yayımlandığında geri alınamaz; model artık üreticinin değil, onu indiren herkesin kontrolündedir.
Kapalı bir modelde zararlı içerik üretimini engelleyen hizalama katmanı, sağlayıcının denetimindedir ve dışarıdan kaldırılamaz. Açık ağırlıklı bir modelde ise saldırgan, birkaç yüz örnekle yapılacak kısa bir ince ayarla bu güvenlik reddetmelerini büyük ölçüde etkisiz hâle getirebilir. Sonuçta ortaya, kötüye kullanım için özelleştirilmiş ama temeli aynı yetenekli olan bir varyant çıkar. Bu, açıklığın kaçınılmaz bir yan etkisidir ve modelin dağıtım biçiminden bağımsız değildir.
Model dosyasının kendisi de bir bulaşma taşıyıcısı olabilir. Popüler bir modelin adına çok benzeyen sahte bir sürüm, içine arka kapı yerleştirilmiş ağırlıklarla ya da yüklenirken kod çalıştıran bir dosya biçimiyle dağıtılabilir. İndiren geliştirici, meşru sandığı bir modeli sistemine alarak farkında olmadan saldırgana kapı açar. Bu risk, model ve veri kalemlerini birer tedarik unsuru olarak ele alan Yapay zekâ tedarik zinciri güvenliği disiplininin doğrudan konusudur.
Bir modelin eğitim ya da ince ayar aşamasında zehirlenmesi, ağırlıkların içine belirli bir girdi kalıbı görüldüğünde tetiklenen gizli bir davranış gömülmesini mümkün kılar. Normal testlerde kusursuz görünen böyle bir model, yalnızca saldırganın bildiği tetikleyiciyle beklenmedik çıktı üretir. Bu tür arka kapılar ağırlıkların içine dağılmış olduğundan gözle ya da basit testle fark edilmesi zordur ve modelin bütünsel Yapay zekâ güvenliği değerlendirmesinde özel bir inceleme gerektirir.
Açık ağırlıklı bir modeli üretime almadan önce, kaynağının doğrulanması, bütünlüğünün kontrol edilmesi ve olabildiğince yalıtılmış bir ortamda çalıştırılması gerekir. İndirilen ağırlıkların sağlaması ve yayıncı imzasının doğrulanması, sahte veya kurcalanmış sürümleri erken eler; bu doğrulama Kod imzalama sertifikaları ile sağlanır. Modelin gerçek girdiler altında istenmeyen davranış sergileyip sergilemediğini yalnızca hedefli saldırı senaryolarıyla ölçebilirsiniz; bu değerlendirmeyi Red team hizmetimiz kapsamında yürütüyoruz.
Sızma testinden olay müdahalesine, uçtan uca çözümlerle yanınızdayız.
Fiyat Teklifi AlBunlar İlginizi Çekebilir