OpenAI’nin yeni duyurduğu o3 ve o4-mini adlı yapay zekâ modelleri, gelişmiş akıl yürütme becerileriyle dikkat çekerken, yüksek halüsinasyon oranlarıyla endişe yaratıyor. Yani bu modeller, gerçeğe dayanmayan ya da tamamen uydurma bilgiler üretme konusunda önceki nesillere kıyasla daha hatalı sonuçlar veriyor.
Gelişmişlik Yanında Yüksek Risk
OpenAI’nin yaptığı iç testlere göre, yeni modellerin doğru yanıt üretme kapasitesi artarken, aynı zamanda yanlış bilgi üretme olasılığı da yükseldi. OpenAI’nin geliştirdiği PersonQA testinde:
-
o3 modeli, soruların %33’ünde yanlış veya hayali yanıt verdi.
-
o4-mini modeli ise %48’lik bir halüsinasyon oranına ulaştı.
Karşılaştırma yapmak gerekirse, önceki modeller olan o1 ve o3-mini için bu oranlar sırasıyla %16 ve %14,8 idi.
Bağımsız Araştırmalar Durumu Onaylıyor
Transluce adlı bağımsız yapay zekâ laboratuvarının bulguları, bu durumu doğrular nitelikte. Örneğin o3 modeli, teknik olarak mümkün olmayan şeyler yaptığını iddia edebiliyor. Bir testte, modelin MacBook Pro’da kod çalıştırdığını söylediği ancak bunun teknik olarak imkânsız olduğu tespit edildi.
Kodlama Güçlü, Ama Yanıltıcı Linkler Sorun
Stanford Üniversitesi’nden yapay zekâ uzmanı Kian Katanforoosh, o3 modelinin kodlama konusunda oldukça başarılı olduğunu, fakat çalışmayan ya da uydurma bağlantılar üretme eğiliminin ciddi bir sorun teşkil ettiğini vurguladı. Özellikle hukuk, finans veya sağlık gibi doğruluğun kritik olduğu alanlarda bu durum riskli hale geliyor.
Halüsinasyonlar Ne Zaman Tehlikeli?
Bazı uzmanlar, yaratıcı içerik üretiminde bu “halüsinasyonların” faydalı olabileceğini belirtiyor. Ancak doğruluk odaklı işlerde bu davranış modeli ciddi hatalara, yanlış yönlendirmelere ve güvenlik risklerine yol açabilir. Dolayısıyla bu modellerin çıktılarının insan denetiminden geçmesi hâlâ büyük önem taşıyor.
Daha Güçlü Zekâ, Daha Yüksek Sorumluluk
OpenAI’nin yeni modelleri, yapay zekâ alanında ölçekleme başarılarını sürdürse de, güvenilirlik ve doğruluk konularında kullanıcıların ekstra dikkatli olması gerektiğini ortaya koyuyor. Özellikle hassas verilerle çalışan kurumlar ve profesyoneller için bu modellerin çıktıları doğrulanmadan kullanılmamalı.
