
Google'ın Gemini 3.6 Flash sürümü, kurumsal aracı token maliyetlerini hedefliyor.
Özet
Google, kurumsal yapay zeka ajanları için gecikmeyi ve maliyetleri düşürmek amacıyla Gemini 3.6 Flash ve 3.5 Flash-Lite modellerini piyasaya sürdü. Arka plan ajanları oluşturan ekipler için tasarlanan bu yeni modeller, önceki sürümlere kıyasla daha az token kullanımı ve artırılmış kodlama ile akıl yürütme başarısı sunuyor. Özellikle sürekli çalışan iş akışları için optimize edilen bu yapay zeka çözümleri, Figma ve Harvey gibi önde gelen şirketler tarafından aktif olarak kullanılmaya başlandı.
Google, kurumsal yapay zeka ajanları için gecikmeyi ve token maliyetlerini düşürmek amacıyla tasarlanmış yeni iş atları olan Gemini 3.6 Flash ve 3.5 Flash-Lite'ı piyasaya sürdü.
Üretim ortamında otonom yazılım ajanları çalıştırmanın ekonomisi, birkaç sağlayıcının doğrudan reklamını yaptığı sabit bir denkleme dayanır. Bir modelin çok adımlı bir görevi yetkin bir şekilde akıl yürüterek çözmesi gerekir, ancak bunu yaparken ürettiği her ek token, saatte binlerce kez çalışabilecek bir iş akışına maliyet ve gecikme ekler.
Sohbet arayüzlerinden ziyade arka plan ajanları oluşturan ekiplerin önceliği iş hacmi, ikinciliği ise parametre sayısıdır. Google'ın bu hafta duyurduğu yanıtı, bu dengeyi üç model arasında bölüştürüyor: kodlama ve çok modlu akıl yürütme için Gemini 3.6 Flash, yüksek hacimli, düşük gecikmeli işler için Gemini 3.5 Flash-Lite ve güvenlik açığı düzeltmesi için oluşturulmuş kısıtlı bir Gemini 3.5 Flash Cyber varyantı.
Gemini 3.6 Flash'ın arkasındaki matematik
Google'ın 3.6 Flash için hazırladığı geliştirici belgeleri tek bir rakama odaklanıyor: Artificial Analysis Index'ten alınan ölçümlere göre, önceki 3.5 Flash sürümüne kıyasla yüzde 17 daha az çıktı token'ı.
Datacurve DeepSWE kıyaslaması dahil olmak üzere belirli sentetik testlerde Google, token kullanımında yüzde 65'e varan düşüşler bildiriyor. Fiyatlandırma, 1 milyon girdi token'ı için 1,50 dolar ve 1 milyon çıktı token'ı için 7,50 dolar olarak belirlenmiş olup, bu da modeli isteğe bağlı olarak değil sürekli çalışan akıl yürütme döngüleri için konumlandırmaktadır.
DeepSWE'de şirket, 3.6 Flash için selefinin yüzde 37'lik başarısına karşılık yüzde 49'luk bir başarı oranı kaydediyor. MLE Bench'te puan yüzde 49,7'den yüzde 63,9'a yükseliyor ve Google'ın kodlama bulmacalarından ziyade gerçek dünya bilgi çalışmasını ölçmeye çalışan GDPval-AA v2 testinde 3.6 Flash, daha eski modelin 1349 puanına karşılık 1421 puan alıyor.
Figma, Hebbia ve Harvey modeli iş başa geçiriyor
Figma, 3.6 Flash'ı prototipleme altyapısına entegre etti ve şirketin Ürün Mühendisliği Direktörü Matt Colyer'a göre model, geliştiricilere çıktı kalitesinde bir düşüş olmaksızın tasarım yinelemelerinden geçmek için daha hızlı bir rota sunuyor.
Hukuki teknoloji platformu Harvey ve araştırma aracı Hebbia, ham finansal başvuruları alma, belge yapısını ayrıştırma, gömülü grafikleri okuma ve inceleme için taslak raporlar üretme gibi çok modlu belge çalışmaları için verileri model üzerinden yönlendiriyor.
Google ayrıca, modellerin bir işletim sisteminin üzerinde çalışmasını sağlamak için mühendislerin önceden oluşturduğu özel ara yazılımı ortadan kaldırarak, istemci tarafı bir bilgisayar kullanım aracını doğrudan Gemini API ve Gemini Enterprise platformlarına dahil etti.
Şirket, yüzde 78,4'ten yüzde 83,0'a yükselen bir OSWorld-Verified puanı bildirmekte ve kimyasal, biyolojik, radyolojik ve nükleer kötüye kullanıma karşı güncellenen korumaların, iyi niyetli talepler için reddetme oranlarını artırmadan jailbreak'e (koruma kırma) karşı direnci iyileştirdiğini söylüyor.
Yüksek hacimli arka plan ajanları için daha ucuz bir katman
Gemini 3.5 Flash-Lite farklı bir işi hedefliyor: akıl yürütme derinliğinden ziyade hacimli çalışan belge işleme ve ajan tabanlı arama. Artificial Analysis Index modeli ölçtü