
Kimi K3 açık ağırlık modeli: Çin'in en büyük yapay zekası, hesaplama gücüne değil, belleğe odaklanıyor.
Özet
Moonshot AI tarafından piyasaya sürülen 2,8 trilyon parametreli Kimi K3 modeli, açık ağırlıklı modeller arasında şimdiye kadarki en büyük kapasiteye ulaşarak sektörde önemli bir kilometre taşı oluşturmuştur. ABD'nin çip ihracat kısıtlamalarıyla karşı karşıya kalan şirket, bu engeli aşmak için bilgi işlem gücü ile bellek kullanımını optimize eden stratejik bir mühendislik yaklaşımı benimsemiştir. "Uzmanların karışımı" (MoE) tekniğini kullanan model, tüm parametreleri bellekte hazır tutarken yalnızca küçük bir kısmını aktif kullanarak bilgi işlem yükünü minimize etmektedir. Bu tasarım, kısıtlı kaynaklara sahip bir laboratuvarın yüksek performanslı yapay zeka modelleri geliştirmek için verimliliği nasıl merkeze aldığını göstermektedir.
Moonshot AI'ın Kimi K3 açık ağırlıklı modeli, 16 Temmuz'da piyasaya sürüldüğünden bu yana neredeyse tamamen parametre sayısı üzerinden okunuyor. 2,8 trilyon parametre ile bugüne kadar piyasaya sürülen en büyük açık ağırlıklı model olma özelliğini taşıyor. Model boyutları genellikle kaba dilimlere ayrılır ve 2,8 trilyon, sektörün 3T sınıfı olarak adlandırdığı kategoriye yuvarlanır. Bu, daha önce hiçbir açık erişimli modelin girmediği bir seviyedir.
Doğal sonuç, Moonshot'ın ABD'nin bilgi işlem kısıtlamalarını kendi mühendislik yöntemleriyle aştığı yönünde. Şirketin kendi teknik blogu daha spesifik bir duruma işaret ediyor: K3 kısıtlamadan kaçınmıyor, daha ziyade onu yeniden konumlandırıyor; tasarımın neredeyse her katmanında bilgi işlem gücünü bellek ile takas ediyor.
Bu takası anlamak önemli, çünkü bilgi işlem ve bellek birbirinin yerine geçebilen kısıtlamalar değildir ve Çinli bir laboratuvar için eşit derecede erişilebilir değillerdir.
Kimi K3 açık ağırlıklı modeli neden bir bellek sorunudur?
Büyük bir modeli çalıştırmanın maliyetini iki farklı şey belirler. Birincisi, makinenin her bir kelimeyi üretmek için ne kadar hesaplama yaptığıdır. İkincisi ise, modelin çalıştığı süre boyunca ne kadarının hazır ve anında erişilebilir tutulması gerektiğidir. Birincisi bilgi işlem, ikincisi ise bellektir. Çip ihracat kontrolleri başlangıçta Çin'i zor durumda bıraktı ve Moonshot'ın tasarımı, bu kısıtlamalar altında daha az harcama yapmaya yönelik sürekli bir çaba olarak okunuyor.
Buradaki ana hamle, uzmanların karışımı (mixture-of-experts) adı verilen bir tekniktir. K3, her kelime için modelin tamamını çalıştırmak yerine, kendisini 896 uzman bölüme ayırıyor ve bunlardan sadece 16'sını, yani toplamın yaklaşık %1,8'ini aynı anda kullanıyor. Kelime başına düşen hesaplama yükü ciddi oranda azalıyor. Bellek maliyeti ise hiç değişmiyor, çünkü 2,8 trilyon parametrenin tamamı, bir sonraki seferde hangisinin çağrılacağı belli olmadığı için yüklü ve hazır bekletilmek zorunda.
Bu yüzden Moonshot doğrudan o maliyete odaklandı. K3'ü, genellikle kullanılan on altı bit yerine parametre başına dört bit hassasiyetle çalışacak şekilde eğitti. "Niceleme farkındalıklı eğitim" (quantisation-aware training) olarak bilinen bu yöntemi, ince ayar aşamasından itibaren uygulayan şirket, bunu "geniş donanım uyumluluğu" için seçtiğini belirtiyor. Nvidia dışındaki silikonlarda çalışmaya karşı bir önlem olarak okunduğu için üzerinde durulması gereken bir ifade. Sağlanan tasarruf oldukça büyük. Yayına ilişkin bağımsız analizler, bu formatta modelin yaklaşık 1,4 TB olduğunu, tam hassasiyette ise 5,6 TB gerektireceğini ortaya koyuyor.
İkinci değişiklik olan Kimi Delta Attention, farklı bir bellek maliyetini hedefliyor. Bir model çok uzun bir belge üzerinde çalışırken, okuduğu her şeyin bir özetini saklıyor. K3'ün ilan edilen bir milyon tokenlık (birkaç bin sayfa) sınırında, bu depolama alanı —modelin kendisi değil— bellekteki en büyük yer kaplayan unsur haline geliyor.
Moonshot, buradaki ticari risk konusunda alışılmadık derecede açık. Açık kaynaklı sunum projesi vLLM'e önbelleğe alma kodu katkısında bulundu ve bu kombinasyonun, modelin boyutuna rağmen K3'ü rekabetçi bir şekilde fiyatlandırmasını sağladığını belirtiyor. Moonshot, K3'ün tek bir havuz gibi davranacak kadar birbirine yakın şekilde bağlanmış 64 veya daha fazla hızlandırıcı üzerinde çalıştırılmasını öneriyor.
Bu, Huawei'nin CloudMatrix sistemlerinin arkasındaki yaklaşımla aynıdır ve bu durum...