Meta’nın yeni yapay zeka modeli Maverick AI, en güncel sohbet kıyaslamalarında rakiplerinin gerisinde kalarak beklentileri karşılayamadı. Popüler değerlendirme platformu LM Arena’da yapılan karşılaştırmalarda, Maverick’in “vanilya” yani değiştirilmemiş sürümü, GPT-4o, Claude 3.5 Sonnet ve Gemini 1.5 Pro gibi rakiplerinden daha düşük performans gösterdi.
LM Arena’da puan karmaşası
Olay, Meta’nın henüz yayınlanmamış deneysel versiyonu olan “Llama-4-Maverick-03-26-Experimental” modelinin, LM Arena’da yüksek puanlar almasıyla başladı. Bu sürüm, sohbet performansı için özel olarak optimize edilmişti. Ancak Meta’nın bu deneyselleştirilmiş sürümü, kamuya sunulan vanilya versiyonla karıştırılınca, kıyaslama platformu LM Arena eleştirilere maruz kaldı. LM Arena yöneticileri kamuoyuna açıklama yaparak özür diledi ve politikalarını güncelleyerek sadece yayınlanmış, açık kaynaklı versiyonların puanlanacağını duyurdu.
Gerçekçi testlerde düşüş yaşandı
Değiştirilmemiş “Llama-4-Maverick-17B-128E-Instruct” modelinin son testlerde aldığı düşük puanlar, Meta’nın sohbet için optimize ettiği sürümle arasındaki farkı gözler önüne serdi. GPT-4o, Claude 3.5 ve Gemini 1.5 Pro gibi modellerin çoğu aylar önce tanıtılmış olmasına rağmen, Maverick’in geride kalması dikkat çekti.
Meta: Geliştiricilere açık kaynak sunuldu
Meta’dan yapılan açıklamada, LM Arena’da yüksek puan alan deneysel versiyonun yalnızca test amaçlı geliştirildiği, resmi açık kaynaklı versiyonun ise geçtiğimiz günlerde paylaşıldığı belirtildi. Şirketin sözcüsü, “Artık açık kaynaklı sürümümüzü yayınladık ve geliştiricilerin Llama 4’ü kendi kullanım durumlarına göre nasıl uyarlayacağını göreceğiz. Ne inşa edeceklerini görmek için heyecanlıyız” ifadelerini kullandı.
Performans sorunu nereden kaynaklanıyor?
Uzmanlar, LM Arena gibi kalabalık kaynaklı kıyaslama platformlarının, sohbet için optimize edilen modelleri öne çıkarabileceğini ancak bu tür testlerin genelleştirilebilirlik açısından sınırlı olduğunu belirtiyor. Bu durum, model geliştiricilerinin belirli bir testte yüksek skor almanın ötesinde gerçek dünya senaryolarında ne kadar başarılı sonuçlar elde edileceğini tahmin etmelerini zorlaştırıyor.
