Yapay Zeka Kıyaslama Testlerinde Ciddi Kusurlar Ortaya Çıktı

yapay-zeka-kiyaslama-testlerinde-ciddi-kusurlar-ortaya-cikti-Za5QN6Es.jpg

İngiltere Yapay Zeka Güvenlik Enstitüsü ile Stanford, Berkeley ve Oxford gibi dünyanın önde gelen üniversitelerinden araştırmacılar, yapay zekanın değerlendirilme biçimlerine dair kritik bir çalışma yayımladı. “Önemli Olanı Ölçmek: Büyük Dil Modeli Kıyaslamalarında Yapı Geçerliği” başlıklı araştırma, mevcut testlerin güvenilirliği konusunda ciddi soru işaretleri doğurdu.

445 test incelendi, neredeyse tamamı kusurlu

14 kurumdan 29 bilim insanı, yapay zekanın alt dalları olan doğal dil işleme (NLP) ve makine öğrenimi alanlarının önde gelen konferanslarında kullanılan 445 farklı kıyaslama testini sistematik olarak inceledi. Sonuçlar çarpıcıydı: Araştırmacılar, testlerin neredeyse tamamının “sonuçların geçerliliğini zedeleyebilecek hatalar” içerdiğini tespit etti.

“Sağlıklı ölçümler olmadan ilerlemeyi anlayamayız”

Oxford İnternet Enstitüsü’nden araştırmacı Andrew Bean, The Guardian’a yaptığı açıklamada, söz konusu testlerin büyük teknoloji şirketlerinin yeni yapay zeka modellerini değerlendirirken kullandıkları araçlar olduğunu belirtti. Bean, bu testlerin yapay zekayla ilgili tüm başarı iddialarının temelini oluşturduğunu vurgulayarak şunları söyledi:

Ortak tanımlar ve güvenilir ölçüm yöntemleri olmadan, modellerin gerçekten gelişip gelişmediğini anlamamız neredeyse imkânsız hale geliyor.

Büyük dil modellerinin değerlendirilmesi sorgulanıyor

Araştırmaya göre, birçok popüler kıyaslama testi, modellerin yalnızca belirli görevlerdeki performansını ölçüyor ancak genel zeka, bağlam anlama, etik karar verme veya öğrenme yeteneği gibi alanlarda yetersiz kalıyor. Uzmanlar, yapay zekanın gerçek dünya etkilerini değerlendirmek için yeni nesil test sistemlerine ihtiyaç olduğunu belirtiyor.

Çalışma, yapay zekanın hızla geliştiği bir dönemde, mevcut değerlendirme yöntemlerinin bilimsel şeffaflık ve güvenilirlik açısından yetersiz kaldığını bir kez daha ortaya koydu.

Exit mobile version