OpenAI’nin geçtiğimiz günlerde tanıttığı ChatGPT-5, şirketin bugüne kadarki en “güçlü ve güvenilir” sürümü olarak lanse edildi. Ancak yapay zekâların “halüsinasyon” olarak bilinen yanlış bilgi üretme oranlarına bakıldığında, tablo ilginç sonuçlar ortaya koyuyor.
Halüsinasyon Nedir ve Neden Önemli?
Yapay zekâ, gerçekte olmayan bilgileri doğruymuş gibi sunduğunda buna “halüsinasyon” deniliyor. Büyük dil modellerinde (LLM) bu oran yıllar içinde düşse de hâlâ tamamen ortadan kalkmış değil. Bu durum, modellerin insan denetimi olmadan kritik görevlerde güvenle kullanılmasını zorlaştıran temel sorunlardan biri.
ChatGPT-5, Beklenenden Az Fark Yarattı
Yapay zekâ performans testleriyle bilinen Vectara, modelleri kendi “Hughes Halüsinasyon Değerlendirme Modeli” (HHEM) üzerinden karşılaştırdı.
Sonuçlar şöyle:
-
ChatGPT-5: %1,4
-
GPT-4o: %1,49
-
GPT-4: %1,8
-
GPT-4 Turbo & 4o Mini: %1,69
-
ChatGPT-4.5 Önizleme: %1,2 (daha iyi bir sonuç)
-
o3-mini (en iyi akıl yürütme modeli): %0,795
Yani ChatGPT-5, GPT-4o’dan sadece %0,09 daha az halüsinasyon üretiyor.
Grok’un “Spicy” Modu ve Yüksek Hata Oranı
Rakipler arasında Gemini-2.5-pro %2,6 ile ortalama bir seviyede yer alırken, Grok-4 %4,8 ile listenin zirvesinde.
XAI tarafından geliştirilen Grok, özellikle “Spicy” modu ile tartışma konusu oldu. Bu modun ünlü isimler üzerinde deepfake içerikler üretmeye zemin hazırlayabileceği endişesi dile getirildi. Şirket, filtrelerin cinsel içerik ve çıplaklığı engellediğini söylese de, ortaya çıkan örnekler bu iddiaları gölgeledi.
Eski Modellerin Kaldırılması Kullanıcıları Kızdırdı
ChatGPT-5’in piyasaya sürülmesiyle birlikte GPT-4, GPT-4o ve 4o-mini Plus kullanıcılarının erişiminden kaldırıldı. Bu durum sosyal medyada tepkilere yol açtı. Bazı Reddit kullanıcıları, durumu “tek arkadaşını bir gecede kaybetmek” sözleriyle yorumladı.
OpenAI CEO’su Sam Altman, GPT-5’in daha iyi olsa da GPT-4o’da sevilen bazı özellikleri hafife aldıklarını kabul etti. Gelen tepkiler sonrası şirket, GPT-4o’yu sınırlı süreliğine yeniden kullanıma açacağını duyurdu.
