Microsoft, gerçek zamanlı konuşma sistemlerine yönelik üç yeni ses yapay zekâ modelini kullanıma sundu. MAI-Transcribe-2-Streaming, MAI-Voice-2.1 MAI-Voice-2.1-Flash adlarını taşıyan modeller, düşük gecikmeli konuşma tanıma ses üretimi işlemlerine odaklanıyor. Şirket, yeni transkripsiyon modelinin kısmi tamamlanmış metin doğruluğunda Artificial Analysis sıralamasında ilk sırada yer aldığını belirtirken ses üretiminde hız maliyet avantajları sunuyor.

MAI-Transcribe-2-Streaming Konuşmayı 100 Milisaniyede Metne Aktarmaya Başlıyor

Microsoft’un yeni gerçek zamanlı konuşma tanıma modeli MAI-Transcribe-2-Streaming, ses kaydının tamamlanmasını beklemeden metin üretmeye başlıyor. Model, ses verisini aldıktan yaklaşık 100 milisaniye sonra ilk transkripsiyon parçalarını oluşturuyor konuşma ilerledikçe önceki sonuçları yeni bağlama göre güncelliyor.

Geleneksel ses transkripsiyonu sistemleri, çoğunlukla konuşma tamamlandıktan sonra nihai metni oluşturuyor. Akış tabanlı konuşma tanıma yaklaşımı ise sesin işlenmesiyle metin üretimini eş zamanlı yürüttüğü için canlı toplantılar, sesli asistanlar otomatik altyazı sistemlerinde gecikmeyi azaltıyor.

MAI-Transcribe-2-Streaming, 60 dili desteklerken otomatik dil algılama özelliğiyle konuşmanın hangi dilde gerçekleştiğini sürekli takip ediyor. Microsoft, Artificial Analysis değerlendirmesinde modelin geçici nihai transkript doğruluğu bakımından ilk sırada bulunduğunu ileri sürüyor.

Şirketin dikte altyazı testlerinde yeni model, en yakın rakibine kıyasla kelimeleri transkriptte iki kat daha hızlı gösterdi. Microsoft, akış tabanlı sürümün ses işleme ücretini 2026 sonuna kadar sesin her saati için 0,54 dolar olarak belirledi. Önceki MAI-Transcribe-2 modelinin tanıtım fiyatı ise saat başına 0,10 dolar seviyesindeydi.

Microsoft’un yeni metinden konuşmaya modeli MAI-Voice-2.1, 26 yerel dil seçeneği kapsamında 23 dili destekliyor. Sistem, aynı ses kimliğini koruyarak farklı dillerde konuşma üretebiliyor her dilde doğal aksana yakın seslendirme gerçekleştirmeyi hedefliyor.

Çok dilli ses sentezi, özellikle uluslararası müşteri hizmetleri dijital asistanlar için önem taşıyor. şirket, farklı ülkelerdeki müşterilerine aynı sanal temsilci kimliğiyle yanıt verirken her dil için ayrı ses profili oluşturma ihtiyacını azaltabiliyor.

Microsoft, MAI-Voice-2.1 modelinin fiyatını milyon karakter başına 22 dolar olarak açıkladı. Model, şirketin daha önce tanıttığı MAI-Voice-2 ailesinin devamı niteliğini taşıyor. Önceki modeller, Dynamics 365 Contact Center Azure Voice Live gibi Microsoft hizmetlerinde kullanılıyordu.

Microsoft’un MAI-Voice-2.1-Flash modeli, yoğun istek alan hızlı yanıt gerektiren sesli uygulamalar için geliştirildi. Şirket, modelin yaklaşık 150 milisaniyelik uçtan uca gecikmeyle 45 saniyelik ses üretebildiğini karşılaştırılan modellere göre çıkarım işlemini yüzde 55 daha hızlı gerçekleştirdiğini belirtiyor.

MAI-Voice-2.1-Flash, milyon karakter başına 15 dolar fiyatlandırılıyor. Microsoft, benzer modellerle karşılaştırıldığında yaklaşık yüzde 60 maliyet avantajı sunduğunu iddia ediyor. fiyatlandırma, yüksek hacimli sesli etkileşimleri yöneten işletmeler açısından toplam işlem maliyetini değerlendirmede önemli ölçüt oluşturuyor.

Her iki yeni ses modeli yalnızca birkaç saniyelik referans ses kullanarak ses klonlama desteği sunuyor. Ses klonlama teknolojisi, belirli konuşmacının ses özelliklerini taklit eden çıktılar üretebildiği için şirketlerin kullanım izni, kimlik doğrulama kötüye kullanım önleme süreçlerini planlaması gerekiyor.

Microsoft, üç yeni modeli Microsoft Foundry, MAI Playground Vercel üzerinden erişime. MAI-Voice ailesi ayrıca OpenRouter üzerinden kullanılabiliyor; LiveKit entegrasyonunun ise ilerleyen dönemde sunulması planlanıyor.

Azure Voice Live üzerinden değerlendirilebilen modeller, gerçek zamanlı sesli ajanların konuşmayı algılama, yanıt hazırlama sesli karşılık üretme aşamalarını aynı altyapıda araya getirmeyi hedefliyor. Böyle mimari, müşteri temsilcisi botları, toplantı altyazıları sesle çalışan kurumsal asistanların yanıt sürelerini doğrudan etkiliyor.

Microsoft’un MAI ailesine yaptığı yatırım, şirketin yalnızca üçüncü taraf yapay zekâ modellerini sunan bulut sağlayıcısı olmanın ötesinde kendi temel modellerini geliştirme stratejisini genişletiyor. Özellikle gecikme, doğruluk işlem maliyetinin birlikte değerlendirildiği sesli yapay zekâ pazarında yeni modellerin gerçek performansı, bağımsız testler üretim ortamındaki kullanım sonuçlarıyla daha net ortaya çıkacak.