Ulusal Standartlar ve Teknoloji Enstitüsü (NIST), makine öğrenimi (ML) modellerinin çeşitli saldırı türlerine karşı dayanıklılığını test etmek amacıyla yeni bir açık kaynaklı yazılım aracı olan Dioptra’yı yayınladı. Bu araç, NIST’in yeni yapay zeka kılavuzuyla birlikte Başkan Joe Biden’ın Yapay Zekanın Güvenli, Emniyetli ve Güvenilir Gelişimine İlişkin Yürütme Emri’nin imzalanmasının 270. günü dolayısıyla duyuruldu.
NIST’in Yapay Zeka Güvenliği
GitHub’da bulunan Dioptra aracı, NIST’in AI model testlerine yardımcı olması amacıyla geliştirildi ve NIST’in AI Risk Yönetim Çerçevesi’nin “ölçüm” işlevini destekliyor. NIST sözcüsü, Dioptra’nın açık kaynaklı geliştirilmesine 2022’de başlandığını, ancak alfa sürümünün 26 Temmuz’a kadar yayınlanmadığını belirtti. Yeni eklenen temel özellikler arasında web tabanlı ön uç, kullanıcı kimlik doğrulaması ve deneyin tüm unsurlarının köken takibi bulunuyor. Bu özellikler, sonuçların yeniden üretilebilirliğini ve doğrulanmasını sağlıyor.
Saldırı Türleri ve Dioptra’nın Rolü
NIST’in önceki araştırmaları, makine öğrenimi algoritmalarına karşı üç ana saldırı kategorisi belirlemişti: kaçınma, zehirleme ve kehanet.
- Kaçınma saldırıları: Veri girişini manipüle ederek (örneğin, gürültü ekleyerek) yanlış bir model yanıtı tetiklemeyi hedefler.
- Zehirleme saldırıları: Eğitim verilerini değiştirerek modelin doğruluğunu engellemeyi ve yanlış ilişkilere yol açmayı amaçlar.
- Kehanet saldırıları (Oracle saldırıları): Eğitim veri kümesi veya parametreleri hakkında bilgi edinmek için modeli “tersine mühendislik” yapmayı hedefler.
Dioptra aracı, başlangıçta görüntü sınıflandırma modellerine yönelik saldırıları ölçmek için oluşturuldu ancak konuşma tanıma modelleri gibi diğer ML uygulamalarını test etmek için de uyarlanabilir.
Dioptra’nın Kullanımı ve Özellikleri
Dioptra, kullanıcıların belirtilen üç kategorideki saldırıların model performansını ne ölçüde etkileyeceğini belirlemelerine olanak tanır. Ayrıca, veri temizleme veya daha sağlam eğitim yöntemleri gibi çeşitli savunmaların kullanımını ölçmek için de kullanılabilir. Açık kaynaklı test ortamı, farklı modeller, eğitim veri kümeleri, saldırı taktikleri ve savunmalar gibi farklı faktör kombinasyonlarıyla denemeyi destekleyecek şekilde modüler bir tasarıma sahiptir.
