1. Haberler
  2. İnovasyon
  3. Yapay Zeka
  4. DeepSeek’ten yeni AI hamlesi küçük model büyük başarı elde etti

DeepSeek’ten yeni AI hamlesi küçük model büyük başarı elde etti

DeepSeek'in yeni yapay zekâ modeli DeepSeek-R1-0528-Qwen3-8B, az kaynakla dev performans sunuyor. Model, Google ve Microsoft'un AI'larını bazı testlerde geride bıraktı.

featured
Google'da Abone Ol
0
Paylaş

Bu Yazıyı Paylaş

veya linki kopyala

Çin merkezli yapay zekâ laboratuvarı DeepSeek, güncellenmiş R1 modeliyle dikkatleri üzerine çekti. Ancak esas sürpriz, bu modelin damıtılmış ve daha küçük bir versiyonu olan DeepSeek-R1-0528-Qwen3-8B ile geldi. DeepSeek’in iddiasına göre bu model, bazı ölçütlerde çok daha büyük rakiplerini geride bırakıyor. Özellikle matematiksel muhakeme testleri olan AIME 2025 ve HMMT’de gösterdiği performans, teknoloji çevrelerinde yankı uyandırdı.

Google Gemini 2.5 Flash geride kaldı

DeepSeek-R1-0528-Qwen3-8B, Alibaba’nın Mayıs ayında yayınladığı Qwen3-8B modeli temel alınarak geliştirildi. Şirketin yaptığı karşılaştırmalara göre, bu kompakt model, AIME 2025 testinde Google’ın Gemini 2.5 Flash modelini geride bıraktı. Ayrıca Microsoft’un yeni muhakeme modeli Phi 4 ile HMMT testinde benzer seviyede sonuçlar verdi.

Daha az kaynakla daha yüksek verim

Damıtılmış modeller genellikle daha az kapasiteye sahip olsalar da DeepSeek-R1-0528-Qwen3-8B için bu durum geçerli değil. NodeShift verilerine göre modelin çalışması için 40–80 GB RAM’e sahip bir GPU yeterli oluyor. Bu, yüksek performanslı AI uygulamalarına erişimi daha ulaşılabilir kılıyor. Tam boyutlu R1 modeli içinse yaklaşık 12 adet 80 GB GPU gerekiyor.

Eğitimde R1 çıktılarını kullandılar

DeepSeek, yeni damıtılmış modelini eğitirken güncellenmiş R1 modelinin ürettiği verilerden faydalandı. Böylece yüksek kaliteli bir ön modelin çıktılarıyla daha küçük bir modelin performansını optimize etti. Bu teknik, hem akademik araştırmalar hem de sanayi uygulamaları için oldukça verimli bir yöntem olarak görülüyor.

Ticari kullanıma açık lisans avantajı

DeepSeek-R1-0528-Qwen3-8B, MIT lisansı altında yayınlandı. Bu da geliştiriciler ve şirketler için büyük bir avantaj sağlıyor çünkü model, ticari kullanım için herhangi bir kısıtlama içermiyor. Halihazırda LM Studio gibi çeşitli platformlar, bu modeli API’ler üzerinden erişime açmış durumda.

0
be_enmi_
Beğenmiş
0
_zg_n
Üzgün
0
sinirli
Sinirli
0
_a_rm_
Şaşırmış
DeepSeek’ten yeni AI hamlesi küçük model büyük başarı elde etti
0

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir

0/30 karakter

Giriş Yap

Patronlar Kulübü ayrıcalıklarından yararlanmak için hemen giriş yapın veya hesap oluşturun, üstelik tamamen ücretsiz!