Google, Gemini 3.8 Flash TTS ses modellerini tanıttı



Özet


Google, yüksek performanslı ses üretimi için tasarlanmış ve yaratıcı yönlendirme ile maliyet odaklı altyapı olarak ikiye ayrılan Gemini 3.8 Flash TTS modellerini tanıttı. Yeni sistemler, oyun geliştirme gibi etkileşimli eğlence alanlarından otomatik medya dublajı ve müşteri hizmetleri gibi yüksek kapasiteli işlere kadar geniş bir kullanım yelpazesi sunuyor. Geliştiriciler, 100'den fazla dilde ve binlerce vokal profilinde çeşitlilik sunan bu modeller sayesinde metin komutlarıyla tını, tempo ve aksan gibi detayları kolayca ayarlayabilecek. Bağımsız değerlendirmeler ve insan denemeleri, yeni modellerin aksan modelleme ve genel kalite konularında önceki nesilleri geride bırakarak sektörde lider konumda olduğunu gösteriyor.




Google, doğrudan performans senaryoları ve yüksek hacimli ses üretimi için tasarlanmış özel konuşma üretim sistemlerini içeren iki yeni Gemini 3.8 Flash TTS ses modeli tanıttı. Çiftli bu sürüm, vokal sentezi görevlerini yaratıcı yönlendirme ve maliyet odaklı altyapı olarak ikiye ayırıyor.

Gemini 3.8 Flash TTS; stüdyo ekiplerinin istem (prompt) tabanlı vokal tasarımı beklediği etkileşimli eğlence, oyun geliştirme ve uzun süreli anlatımlar için hedefleniyor. Gemini 3.8 Flash-Lite TTS ise otomatik medya dublajı, müşteri odaklı konuşma asistanları ve yüksek kapasiteli çeviri hatlarına odaklanıyor.

Her iki sistem, daha önce 3.5 Live Translate, 3.5 Transcribe, 3.8 Live ve 3.8 Live Extended Thinking modellerini içeren Google'ın mevcut ses ürün yelpazesini genişletiyor. Teknik ekipler, yeni modelleri eski sistemlerdeki sabit 30 sesli kataloğun yerini alacak şekilde yapılandırdı.

Geliştiriciler artık Quebec Fransızcası, İskoç İngilizcesi ve Meksika İspanyolcası gibi bölgesel dil varyasyonlarını kapsayan, 100'den fazla dilde 2.000'den fazla önceden hazırlanmış vokal profili içeren bir dizine erişebilecek. Yakında çıkacak olan ses karıştırma (remixing) modülü, ses mühendislerinin doğrudan metin komutları aracılığıyla tını, perde, tempo ve aksan kıvrımlarını ayarlamasına olanak tanıyacak.

Hume AI sentez performansını test ediyor

Bağımsız değerlendirmeler, büyük modeli üçüncü taraf ses sıralamalarının zirvesine yerleştiriyor.

Hume AI Ses Tasarımı Kıyaslamasında (Voice Design Benchmark) Gemini 3.8 Flash TTS, genelde 71.4 puan alırken, aksan modelleme kategorisinde 60.8 ile liderlik konumuna yerleşti.

Hume AI Genel Kalite Endeksinde ise Gemini 3.8 Flash TTS birinci sırayı kaparken, Gemini 3.8 Flash-Lite TTS ikinci sırayı aldı ve Gemini 3.1 Flash TTS ile belirlenen önceki baz çizgilerini geride bıraktı.

Voice Arena üzerinden yürütülen çift kör (double-blind) insan denemeleri; Japonca, Brezilya Portekizcesi, Vietnamca, Modern Standart Arapça, Meksika İspanyolcası ve Hintçe gibi bölgesel dillerde tercih avantajını doğruladı.

Çoklu konuşmacı kurgusu ve genişletilmiş sentez süreçleri temel odak noktalarından birini oluşturuyor. Tek bir senaryo, doğal konuşma sırasını ve uzun diyaloglar boyunca ses ayrımını koruyan çift konuşmacılı alışverişleri yönetebiliyor.

Ses kalitesi ve karakter tınısı, saatler süren dosyalarda bile stabil kalıyor; bu da sesli kitap kayıtları ve bölüm bazlı podcastler sırasında ses kalitesinin bozulmasını engelliyor.

Yazarlar, üretim metinlerine doğrudan sözel olmayan akustik işaretler ekleyebiliyor. Konuşma temposunu dengelemek için satırlara |mhm|, |yeah| gibi tepkisel sözlü ünlemlerin yanı sıra [nefes alma], [duraklama] veya [gülme] gibi etiketler yerleştirebiliyorlar.

Google'ın Gemini 3.8 Flash TTS ses modelleri için güvenlik kontrolleri

Ses klonlama süreçleri, taklit riskine karşı zorunlu kimlik kontrollerine dayanıyor. Bir vokal profilini yeniden oluşturmak için 30 saniyelik bir referans kaydı ve orijinal ses sahibinin açık sözlü onayını içeren bir ses kaydı gerekiyor. Google, özel profilleri işleme almadan önce her iki ses kaydı arasındaki akustik uyumu doğruluyor.

Üretilen ses dosyaları, fark edilemeyen SynthID ses filigranlarını ve kriptografik kodları içeriyor.