Yandex Araştırma ekibi, IST Austria, NeuralMagic ve KAUST araştırmacılarıyla iş birliği yaparak büyük dil modelleri için iki yeni sıkıştırma yöntemi geliştirdi: Dil Modelleri için Eklemeli Niceleme (AQLM) ve PV-Tuning. Bu yöntemler bir araya getirildiğinde model boyutunda 8 kata kadar azalma sağlanıyor ve yanıt kalitesi %95 oranında korunuyor. Detaylar, Viyana, Avusturya’da düzenlenen Uluslararası Makine Öğrenimi Konferansı’nda (ICML) sunuldu.
AQLM ve PV-Tuning’in Temel Özellikleri
AQLM (Eklemeli Niceleme)
- Geleneksel Eklemeli Niceleme: Bilgi erişiminde kullanılan bu yöntem, LLM (Büyük Dil Modelleri) sıkıştırmasında da kullanılıyor.
- Bellek Tüketimini Azaltma: AQLM, aşırı sıkıştırma altında modelin doğruluğunu koruyarak günlük cihazlarda LLM’lerin kullanılmasını mümkün kılıyor.
PV-Tuning
- Hata Giderme: Model sıkıştırma sırasında ortaya çıkabilecek hataları düzeltiyor.
- Optimum Sonuçlar: AQLM ile birleştiğinde, sınırlı bilgi işlem kaynaklarında bile yüksek kalitede yanıtlar sağlayabilen kompakt bir model oluşturuyor.
Yöntemlerin Değerlendirilmesi ve Tanınması
Araştırma ekibi, yöntemlerin etkinliğini LLama 2, Mistral ve Mixtral gibi popüler açık kaynaklı modeller üzerinde titizlikle değerlendirdi. Bu büyük dil modelleri sıkıştırılarak, yanıt kalitesi İngilizce karşılaştırma ölçütleri olan WikiText2 ve C4 ile test edildi. Modeller, %95 yanıt kalitesini koruyarak 8 kat sıkıştırıldı.
AQLM ve PV-Tuning’den Kimler Yararlanabilir?
- Şirketler: Tescilli dil modellerini ve açık kaynaklı LLM’leri geliştiren ve dağıtan şirketler için kaynak tasarrufu sağlar.
- Araştırmacılar ve Girişimler: Llama gibi gelişmiş LLM’leri günlük kullanılan bilgisayarlarda çalıştırma imkanı sağlar.
- Bireysel Kullanıcılar: Akıllı telefonlar, akıllı hoparlörler ve diğer cihazlarda çevrimdışı olarak gelişmiş LLM’leri kullanma imkanı sunar.
Yeni LLM Uygulamaları
AQLM ve PV-Tuning, sınırlı hesaplama kaynaklarına sahip cihazlarda çevrimdışı olarak dağıtılabilecek. Bu sayede akıllı telefonlar, akıllı hoparlörler gibi cihazlarda metin ve görüntü oluşturma, sesli yardım, kişiselleştirilmiş öneriler ve gerçek zamanlı dil çevirisi gibi özellikler aktif internet bağlantısı olmadan kullanılabilir.
Uygulama ve Erişim
Geliştiriciler ve araştırmacılar, GitHub’da bulunan AQLM ve PV-Tuning’i kullanabiliyor. Sağlanan demo materyalleri, sıkıştırılmış LLM’leri etkili bir şekilde eğitmek için rehberlik sunuyor. Ayrıca, bu yöntemler kullanılarak sıkıştırılmış popüler açık kaynaklı modeller indirilebiliyor.
ICML’de Öne Çıkan Çalışma
Yandex Research’ün AQLM sıkıştırma yöntemine ilişkin bilimsel makalesi, dünyanın en prestijli makine öğrenimi konferanslarından biri olan ICML’de yayınlandı. IST Austria’dan araştırmacılar ve yapay zeka girişimi Neural Magic’ten uzmanlarla hazırlanan bu çalışma, LLM sıkıştırma teknolojisinde önemli bir ilerleme anlamına geliyor.

















