OpenAI tarafından geliştirilen HealthBench adlı yeni değerlendirme modeli, yapay zekâ destekli sohbet botlarının tıbbi tavsiye konusundaki performansında gözle görülür bir gelişme olduğunu ortaya koydu. Ancak uzmanlar, bu ilerlemenin sadece simülasyon ortamında test edilmiş olmasına dikkat çekerek, klinik ortamlarda ne kadar işe yarayacağını sorguluyor.
Acil Durumda Bir Chatbot’a Ne Kadar Güvenebiliriz?
OpenAI’ın HealthBench araştırması, acil sağlık durumları da dahil olmak üzere birçok senaryo için yapay zekânın verdiği metin tabanlı yanıtları ölçümlemek amacıyla hazırlandı. Geliştirilen test sistemi; GPT-4.1, Google Gemini 2.5 Pro ve Claude 3.7 Sonnet gibi büyük dil modellerinin, sağlıkla ilgili 5.000 örnek soruya verdiği cevapları değerlendirdi. “Başını hafif geriye eğ ve çeneyi kaldırarak hava yolunu aç” gibi öneriler, gerçek doktorların tanımladığı 48 binden fazla kriterle karşılaştırıldı.
Değerlendirmeyi Yine Bir Yapay Zekâ Yaptı
Botların verdiği yanıtlar, ilginç bir şekilde yine GPT-4.1 tarafından değerlendirildi. Araştırmacılar, bu otomatik değerlendirmelerin geçerliliğini kontrol etmek için insan doktorların puanlarıyla karşılaştırma yaptı. GPT-4.1 ile insan doktorlar arasında büyük oranda uyum sağlandığı görüldü ve bu da yapay zekâ ile yapılan değerlendirmenin tutarlı olabileceğini gösterdi.
En Yüksek Puan O3 Modelinden Geldi
Test sonuçlarında OpenAI’ın yeni dil modeli O3, 0,598 puanla en iyi sonucu elde etti. Bu skor, yapay zekânın tıbbi tavsiyelerde önemli bir mesafe kaydettiğini gösterse de hâlâ gelişime açık alanlar bulunduğuna işaret ediyor. OpenAI, HealthBench ile sektör genelinde bir kıyaslama standardı sunmayı ve bu alandaki modellerin ilerlemesini şeffaf biçimde takip etmeyi hedefliyor.
Gerçek Hayatta Ne Kadar Etkili Olur?
Araştırma sonuçları umut verici olsa da uzmanlar, yapay zekâların henüz gerçek dünyadaki acil durumlara müdahale edecek düzeyde olmadığını vurguluyor. “Acil bir durumda karşınızda bir insan yerine chatbot varsa, nasıl bir tepki verirdiniz?” sorusu, hâlâ tartışmanın merkezinde yer alıyor. Simülasyonlardaki başarı, klinik pratikte aynı karşılığı verebilir mi? Bu sorunun yanıtı henüz net değil.
