
Mistral AI, açık kaynaklı sürüm öncesi Large 4 preview sürümünü tanıttı
Özet
Mistral AI, 1 trilyon parametreye sahip yeni çok modlu modeli Mistral Large 4'ü halka açık önizlemeye açtı ve model ağırlıklarının 2026 sonuna kadar yayınlanacağını duyurdu. Avrupa veri merkezlerinde güçlü GPU altyapısıyla eğitilen model, 160'tan fazla dili kapsarken siber güvenlik alanında yüksek başarı oranları sergileyerek testlerde öne çıktı. Şirket, modelin zararlı yazılım analizi ve açık açık bulma gibi kritik konularda etkin olduğunu belirterek, güvenlik araştırmalarını engellemeden yerel ve özel bulut sistemlerde çalıştırılmasını hedefliyor. Mistral Large 4, hem devlet makamları hem de siber güvenlik liderleri ile gerçek dünya senaryolarında kapsamlı testlerden geçirilmektedir.
Mistral AI, 1 trilyon parametreye ve 49 milyar aktif parametreye sahip yerli çok modlu (multimodal) modeli Mistral Large 4'ü halka açık önizlemeye açtığını duyurdu. Önizleme API'si Mistral Studio üzerinden erişilebilir durumdayken, model ağırlıklarının (weights) Ekim 2026 sonuna kadar yayınlanması planlanıyor.
Mistral, yaptığı açıklamada modeli —"le Chonk" takma adıyla anılan modeli (evet, meme olarak başlayan bir isim)— kendi Avrupa veri merkezlerindeki 3.800 NVIDIA Grace Blackwell GPU üzerinde sıfırdan eğittiğini belirtti. Halka açık önizleme de aynı altyapı üzerinde çalışıyor. Modelin eğitim verileri, AB'deki tüm resmi diller de dahil olmak üzere 160'dan fazla dili kapsıyor.
Mistral AI şu ifadede bulundu: “Modeli; siber güvenlik liderleri, onaylanmış ortaklar ve devlet makamlarıyla gerçek dünya senaryolarında 'red-teaming' testlerine tabi tutuyoruz. Bu kurumlar, aynı modele daha düşük moderasyon ve genişletilmiş siber yeteneklerle erişecekler.”
Siber güvenlik testleri ve Mistral AI'ın Large 4 modeli dağıtım planları
Mistral'ın açıklamasına göre Large 4, gerçek yazılımlardaki güvenlik açıklarını bulma ve düzeltme performansını ölçen Artificial Analysis Cyber Index'te ilk beş model arasında yer alıyor. Şirketin verilerine göre model; açık kaynaklı yazılımlardaki gerçek bir açığı yeniden üretip ardından yamalama gerektiren bir testten yüzde 82 başarı puanı aldı. Bu skor, söz konusu testteki tüm modeller arasında en yüksek seviyede.
Mistral ayrıca modelin, Cybench'in 40 güvenlik yarışması sorusunun yüzde 93'ünü çözdüğünü bildirdi. Şirket, dahili testlerinde modelin zararlı yazılım analizi, açık açık önceliklendirmesi ve tespit kuralı yazımı gibi konularda yararlı olduğunu saptadı.
Şirket, sağlayıcı düzeyindeki reddetme mekanizmalarının meşru zafiyet araştırmalarını ve olay müdahale süreçlerini engelleyebileceğini savunuyor. Açık ağırlıklı (open-weight) yayın aracılığıyla özel bulut ve yerel (on-premise) çalışmayı desteklemeyi planlayan Mistral, bu sayede kuruluşların kendi politikalarını uygulamasına olanak tanıyor.
Ayrıca Mistral, Large 4'ün Lakera'nın halka açık B3 AI Güvenlik Kriteri'ndeki (Not: Bu bir kriter sonucudur, neredeyse her türlü istem enjeksiyonuna karşı koruma kanıtı değildir) saldırıların yüzde 93,3'üne karşı koyduğunu bildirdi.
Kodlama ajanları ve görsel görevler
Yazılım mühendisliği alanında Mistral; DeepSWE v1.1'de yüzde 61,7, SWE-Atlas-QnA'da yüzde 59,4 ve Terminal-Bench 4'te yüzde 28,3 gibi skorlar elde etti. Bu veriler Artificial Analysis kodlama indeksinden alınmıştır. Modelin birleşik Kodlama Ajanı İndeksi (Coding Agent Index) skoru ise yüzde 49,8 olarak gerçekleşti.
Surge AI ile yürütülen ayrı bir kör insan değerlendirmesinde ise profesyonel denetçilerden, model kimlikleri gizli tutularak kodlama çıktılarını 1-5 ölçeğinde puanlamaları istendi. Large 4 Preview, 4,22 alan Claude Opus 5'in ardından 3,74 puanla beş model arasında ikinci sırada yer aldı.
Gmail, Google Sheets, Slack ve Salesforce gibi uygulamaları kapsayan 657 iş akışını içeren AutomationBench'te ise Mistral, yüzde 59,9'luk bir skor bildirdi.
Şirket ayrıca teknik çizimler, PDF'ler ve uydu görüntüleri içeren görsel görevleri de sergiledi. Mistral'ın test sonuçlarına göre modelin Dense 200 görsel temellendirme (visual-grounding) sonucu yüzde 42 olurken, GPT-6-Astra yüzde 41 performans gösterdi.
RLHF ile pekiştirme (Reinforcement learning across)
Yorumlar
Yorum için giriş yap veya kaydol.
Henüz yorum yok — ilk sen yaz.