Mistral’ın yeni modeli 'Le Chonk' Batı'nın açık kaynak hamlesine dahil oldu



Özet


Mistral, yaklaşık bir trilyon parametreye sahip "Le Chonk" adlı Large 4 modelinin halka açık API önizlemesini yayınlayarak Batı merkezli açık kaynaklı modellerde güçlü bir performans sergilediğini duyurdu. Şirket, modelin özellikle siber güvenlik ve kodlama alanlarında üstün başarılar yakaladığını iddia ederken, dış kaynaklı testler de bu iddiaları siber güvenlik performansıyla destekliyor. Reflection tarafından geliştirilen Beam modeli ile birlikte bu gelişme, Çinli rakiplere karşı Batı'nın açık model hamlesi açısından önemli bir adım olarak görülüyor. Mistral, modelin ağırlıklarını Ekim ayı sonuna kadar yayınlamayı planlarken, performans verileri farklı test koşullarına göre değişkenlik göstermeye devam ediyor.




Mistral, 6 Ekim'de "Le Chonk" adını verdiği modelin halka açık API önizlemesini yayınlayarak Large 4'ü tanıttı. Yaklaşık bir trilyon parametreye sahip olan modelin, ABD ve Avrupa menşeli rakiplerinden oluşan açık kaynaklı modellere karşı üstün performans gösterdiğini iddia eden Mistral, modelin gücünü vurguluyor.

Bu gelişme, Reflection'ın 5 Ekim'deki Beam duyurusunu takip ediyor ve The Rundown'da ele alınan Batı merkezli açık model hamlesini güçlendiriyor. Mistral, indirilebilir model ağırlıklarını (weights) Ekim sonuna kadar yayınlamayı planlıyor. Reflection ise erken erişim için kayıt topluyor ve model ağırlıklarını bu ayın ilerleyen günlerinde Apache 2.0 lisansı ile sunacağını vaat ediyor.

Testler ne söylüyor?

Mistral, bir kodlama testi olan DeepSWE v1.1'de %61,7 oranında başarı sağladığını belirtiyor. Reflection'ın yayımladığı karşılaştırma tablosunda ise Beam %44,4, Kimi K3 %68,0 ve DeepSeek V4.1 Flash %74,2 başarı gösteriyor. Bu veriler, Large 4'ü Beam'in üzerinde ancak iki Çinli modelin altında konumlandırıyor; ancak bu raporlar farklı test koşullarını yansıtıyor olabilir.

Artificial Analysis tarafından yapılan bir değerlendirmede Large 4, CyberGym-E2E-AA testinde karşılaştırılan diğer modellerin önüne geçerek %82 puan aldı. Bu sonuç, siber güvenliğin modelin güçlü yönlerinden biri olduğu yönündeki Mistral iddialarını dış kaynaklı olarak destekliyor.

Hukuki testler de umut verici görünüyor. Vals'in 6 Ekim tarihli sonuç tablosunda, Large 4'ün Harvey'in Hukuk Ajanı Testi'nde (Legal Agent Benchmark) %15,83 başarı oranı gösterdiğine karşılık, GPT-6 Astra %5,42 oranında kaldı. Bu, söz konusu testte yaklaşık üç kat daha yüksek bir skor anlamına gelse de, mutlak tamamlama oranının düşük olması dikkat çekiyor.

Neden önemli?

Le Chonk, yapay zeka dünyasının en iyi ismine layık görülmeyi hak ediyor. Beam ile birlikte bu isim, Batı'nın açık model hamlesi için de bir iyimserlik kaynağı oluşturuyor. Çinli laboratuvarlar önemli açık model karşılaştırmalarında hala liderliğini korusa da, tek bir haftada gelen iki ciddi Batı duyurusu piyasayı daha rekabetçi bir hale getiriyor.

Hassas kodlar veya hukuki belgelerle çalışan kuruluşlar için Mistral, işlerini seçtikleri altyapılarda tutmak adına yeni bir seçenek haline gelebilir. Mistral, Avrupa'da faaliyet gösterdiği altyapıyı tanımlarken, özel bulut kurulumları ve müşterilerin kendi tesislerine yönelik kurulum planlarını da paylaşıyor. Ekipler şu an API önizlemesini test edebilir. Large 4'ü yerel olarak çalıştırmak ise halka açılacak ağırlıklara, lisansa, yazılım desteğine ve donanım gereksinimlerine bağlı olacak.

Hukuk ekipleri için sağlanan göreceli kazanç, denetimli belge çalışmaları denemek için bir neden sunuyor. Vals, bir görevin başarılı sayılması için her kriterin karşılanmasını şart koşuyor ve iki yapay zeka hakemin ortalama puanlarını kullanıyor. Large 4'ün düşük mutlak başarı oranı, çıktıların dikkatli bir insan incelemesinden geçmesi gerektiğini gösteriyor. Genel karşılaştırmalarda diğer modeller öne çıksa bile, kullanışlı bir uzman modeli değerlendirmeye alınabilir.

Güvenlik ekipleri için ise modelin faydası, hangi görevleri yerine getireceğine bağlıdır. Mistral, önizleme sürecinde seçilmiş siber ortakların ve devlet otoritelerinin daha az moderasyona tabi tutulacağını ve genişletilmiş siber yeteneklere sahip olacağını belirtiyor. Şirket, rakip modellerin söz konusu siber testindeki kötü sonuçlarını "reddetme" (refusal) davranışlarına bağlıyor. Genişletilmiş izinler, meşru savunma sistemlerine yardımcı olabilir. Ancak Mistral'in bu erişimi nasıl tanıdığı ve denetlediği, önemli bir güvenlik sorusu olmaya devam ediyor.