1. Haberler
  2. İnovasyon
  3. Yapay Zeka
  4. Meta’nın Maverick AI modeli beklentilerin gerisinde kaldı

Meta’nın Maverick AI modeli beklentilerin gerisinde kaldı

Meta’nın Maverick AI modeli, LM Arena sohbet kıyaslamasında GPT-4o, Claude 3.5 ve Gemini 1.5 Pro’nun gerisinde kaldı. Deneysel sürüm tartışma yaratırken, vanilya versiyonun düşük puanları dikkat çekti.

featured
Google'da Abone Ol
0
Paylaş

Bu Yazıyı Paylaş

veya linki kopyala

Meta’nın yeni yapay zeka modeli Maverick AI, en güncel sohbet kıyaslamalarında rakiplerinin gerisinde kalarak beklentileri karşılayamadı. Popüler değerlendirme platformu LM Arena’da yapılan karşılaştırmalarda, Maverick’in “vanilya” yani değiştirilmemiş sürümü, GPT-4o, Claude 3.5 Sonnet ve Gemini 1.5 Pro gibi rakiplerinden daha düşük performans gösterdi.

LM Arena’da puan karmaşası

Olay, Meta’nın henüz yayınlanmamış deneysel versiyonu olan “Llama-4-Maverick-03-26-Experimental” modelinin, LM Arena’da yüksek puanlar almasıyla başladı. Bu sürüm, sohbet performansı için özel olarak optimize edilmişti. Ancak Meta’nın bu deneyselleştirilmiş sürümü, kamuya sunulan vanilya versiyonla karıştırılınca, kıyaslama platformu LM Arena eleştirilere maruz kaldı. LM Arena yöneticileri kamuoyuna açıklama yaparak özür diledi ve politikalarını güncelleyerek sadece yayınlanmış, açık kaynaklı versiyonların puanlanacağını duyurdu.

Gerçekçi testlerde düşüş yaşandı

Değiştirilmemiş “Llama-4-Maverick-17B-128E-Instruct” modelinin son testlerde aldığı düşük puanlar, Meta’nın sohbet için optimize ettiği sürümle arasındaki farkı gözler önüne serdi. GPT-4o, Claude 3.5 ve Gemini 1.5 Pro gibi modellerin çoğu aylar önce tanıtılmış olmasına rağmen, Maverick’in geride kalması dikkat çekti.

Meta: Geliştiricilere açık kaynak sunuldu

Meta’dan yapılan açıklamada, LM Arena’da yüksek puan alan deneysel versiyonun yalnızca test amaçlı geliştirildiği, resmi açık kaynaklı versiyonun ise geçtiğimiz günlerde paylaşıldığı belirtildi. Şirketin sözcüsü, “Artık açık kaynaklı sürümümüzü yayınladık ve geliştiricilerin Llama 4’ü kendi kullanım durumlarına göre nasıl uyarlayacağını göreceğiz. Ne inşa edeceklerini görmek için heyecanlıyız” ifadelerini kullandı.

Performans sorunu nereden kaynaklanıyor?

Uzmanlar, LM Arena gibi kalabalık kaynaklı kıyaslama platformlarının, sohbet için optimize edilen modelleri öne çıkarabileceğini ancak bu tür testlerin genelleştirilebilirlik açısından sınırlı olduğunu belirtiyor. Bu durum, model geliştiricilerinin belirli bir testte yüksek skor almanın ötesinde gerçek dünya senaryolarında ne kadar başarılı sonuçlar elde edileceğini tahmin etmelerini zorlaştırıyor.

0
be_enmi_
Beğenmiş
0
_zg_n
Üzgün
0
sinirli
Sinirli
0
_a_rm_
Şaşırmış
Meta’nın Maverick AI modeli beklentilerin gerisinde kaldı
0

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir

0/30 karakter

Giriş Yap

Patronlar Kulübü ayrıcalıklarından yararlanmak için hemen giriş yapın veya hesap oluşturun, üstelik tamamen ücretsiz!