Google’ın Gemini 3.5 Transcribe’ı Konuşma Hatalarını Kendi Düzeltirken Gürültülü Ortamlarda da Kesin Çıktı Sağlıyor

Google, Gemini ailesine sesli konuşmaları metne dönüştürmeyi amaçlayan yeni bir yapay zeka modeli ekledi. Gemini 3.5 Transcribe, özellikle gürültülü ortamlarda konuşmaları daha doğru algılamaya ve günlük dilin inceliklerini yakalamaya odaklanıyor.
Haberi okuduğunuz için teşekkürler, bizi takip etmeyi unutmayın!
Şirket, Gemini 3.5 Transcribe’ı şimdiye kadar geliştirdiği en doğru konuşmadan metne dönüştürme modeli olarak tanımlıyor. Yeni model, arka plan sesleri yoğun olan ortamda ve teknik terimler içeren konuşmalarda önceki modellere göre daha az hata yapıyor.
Konuşurken yapılan hataları kendi düzeltebiliyor
Gemini 3.5 Transcribe yalnızca duyduğu kelimeleri metne aktarmıyor. Model, konuşma sırasında yapılan bazı hataları düzeltebiliyor; “ııı”, “eee” gibi dolgu ifadelerini kaldırabiliyor ve ortaya çıkan metni otomatik olarak düzenleyebiliyor.
Google ayrıca modeli insanların doğal konuşma biçimlerini anlayacak şekilde geliştirdiğini söylüyor. Böylece kullanıcılar sesli komut verirken önceden belirlenmiş kalıplarla konuşmak zorunda kalmıyor. Model ayrıca kullanıcıların eklediği özel kelimeleri, farklı yazımları ve belirli alanlarda kullanılan terimleri tanıyabiliyor.
Gemini 3.5 Transcribe gerektiğinde dosya analizi veya görsel oluşturma gibi kendi alanının dışındaki işleri diğer Gemini modellerine aktarabiliyor.
Google hata oranlarını da açıkladı

Şirketin paylaştığı verilere göre Gemini 3.5 Transcribe, canlı konuşmaların yazıya aktarılmasında ortalama yüzde 4,0 kelime hata oranına (WER) sahip. Önceden kaydedilmiş içeriklerde ise bu oran yüzde 2,6’ya kadar düşüyor.
Model özellikle arka plan gürültüsünün bulunduğu ortamlarda konuşmaları ayırt etmeye odaklanıyor. Sipariş numaraları ve posta kodları gibi harflerle rakamların birlikte kullanıldığı ifadeleri de daha doğru biçimde metne aktarabiliyor.
Google, yeni modeli macOS’taki Gemini uygulamasında ve Android’deki Gboard’un Rambler özelliğinde kullanmaya başladı. Şirket, bu iki alanda da konuşma tanıma performansında artış gördüğünü belirtiyor.
85 dili ve farklı aksanları destekliyor
Gemini 3.5 Transcribe toplam 85 dili destekliyor. Model bölgesel aksanları ve farklı lehçeleri de tanıyabiliyor.
Önceden kaydedilmiş ses dosyalarında üç kişiye kadar konuşmacıları birbirinden ayırabiliyor ve konuşmalara zaman damgası ekleyebiliyor. Kullanıcılar ayrıca modele özel kelime listeleri tanımlayabiliyor. Bu özellik şirket isimleri, ürün adları veya belirli mesleklerde kullanılan terimler gibi standart sözlüklerde bulunmayan ifadelerin doğru yazılması için kullanılabiliyor.
Chrome’a da geliyor
Google, Gemini 3.5 Transcribe’ı geliştiriciler için Gemini API üzerinden genel önizlemeye açtı. Geliştiriciler modele Google AI Studio ve Google Antigravity üzerinden erişebiliyor. Model; sesli asistanlar, gerçek zamanlı altyazı sistemleri ve görüşme sonrasında konuşmaları analiz eden araçlarda kullanılabiliyor.
Son kullanıcılar ise yeni modeli Android ve macOS üzerinde deneyebiliyor. Google, Gemini 3.5 Transcribe desteğini yakında Chrome’a da getirecek. Böylece kullanıcılar internet sitelerindeki metin alanlarına klavyeyi kullanmadan konuşarak yazı girebilecek.
Tek tıkla reaksiyon bırakabilirsin.





Yorumlar
0 yorum