Çin merkezli yapay zekâ laboratuvarı DeepSeek, güncellenmiş R1 modeliyle dikkatleri üzerine çekti. Ancak esas sürpriz, bu modelin damıtılmış ve daha küçük bir versiyonu olan DeepSeek-R1-0528-Qwen3-8B ile geldi. DeepSeek’in iddiasına göre bu model, bazı ölçütlerde çok daha büyük rakiplerini geride bırakıyor. Özellikle matematiksel muhakeme testleri olan AIME 2025 ve HMMT’de gösterdiği performans, teknoloji çevrelerinde yankı uyandırdı.
Google Gemini 2.5 Flash geride kaldı
DeepSeek-R1-0528-Qwen3-8B, Alibaba’nın Mayıs ayında yayınladığı Qwen3-8B modeli temel alınarak geliştirildi. Şirketin yaptığı karşılaştırmalara göre, bu kompakt model, AIME 2025 testinde Google’ın Gemini 2.5 Flash modelini geride bıraktı. Ayrıca Microsoft’un yeni muhakeme modeli Phi 4 ile HMMT testinde benzer seviyede sonuçlar verdi.
Daha az kaynakla daha yüksek verim
Damıtılmış modeller genellikle daha az kapasiteye sahip olsalar da DeepSeek-R1-0528-Qwen3-8B için bu durum geçerli değil. NodeShift verilerine göre modelin çalışması için 40–80 GB RAM’e sahip bir GPU yeterli oluyor. Bu, yüksek performanslı AI uygulamalarına erişimi daha ulaşılabilir kılıyor. Tam boyutlu R1 modeli içinse yaklaşık 12 adet 80 GB GPU gerekiyor.
Eğitimde R1 çıktılarını kullandılar
DeepSeek, yeni damıtılmış modelini eğitirken güncellenmiş R1 modelinin ürettiği verilerden faydalandı. Böylece yüksek kaliteli bir ön modelin çıktılarıyla daha küçük bir modelin performansını optimize etti. Bu teknik, hem akademik araştırmalar hem de sanayi uygulamaları için oldukça verimli bir yöntem olarak görülüyor.
Ticari kullanıma açık lisans avantajı
DeepSeek-R1-0528-Qwen3-8B, MIT lisansı altında yayınlandı. Bu da geliştiriciler ve şirketler için büyük bir avantaj sağlıyor çünkü model, ticari kullanım için herhangi bir kısıtlama içermiyor. Halihazırda LM Studio gibi çeşitli platformlar, bu modeli API’ler üzerinden erişime açmış durumda.

















