Konuşma tanımanın
tarihi

Konuşma tanıma 1952'de Bell Labs'te icat edildi. Sesle söylenen on rakamdan 54+ dile uzanan yolculuğu on yıl on yıl anlatıyoruz.

Bir bakışta konuşma tanıma

İcadı
Konuşma tanıma 1952'de, Bell Labs'in Audrey sistemi tek bir sesin söylediği 0'dan 9'a kadar rakamları tanıdığında icat edildi.
İlk tüketici yazılımı
1990'da yaklaşık 9.000 dolara piyasaya çıkan Dragon Dictate, halka satılan ilk konuşma tanıma ürünüydü ve her kelimeden sonra duraklama gerektiriyordu.
İlk 1.000 kelimelik dağarcık
Carnegie Mellon'un Harpy sistemi 1976'da 1.011 kelime anlıyordu ve DARPA'nın beş yıllık Konuşma Anlama Araştırması programı için koyduğu hedefi tutturmuştu.
İnsan düzeyi
Microsoft 2017'de Switchboard telefon kıyaslamasında %5,1 kelime hata oranı ölçtü; bu, aynı görüşmeleri yazıya döken profesyonel deşifre uzmanlarıyla aynı düzeydi.
Açık modeller
OpenAI'ın Eylül 2022'de yayımladığı Whisper 680.000 saatlik ses kaydıyla eğitildi; ağırlıkları herkese açık ve 100'e yakın dili deşifre edebiliyor.
Bugün
2017 yılında kurulan Sonix, 54+ dili 99% doğrulukla deşifre ediyor ve bir saatlik dosyayı yaklaşık 5 ila 6 dakikada teslim ediyor.

Konuşma tanıma 1952'de icat edildi

İlk konuşma tanıyıcı 1952'de Bell Labs'te yapıldı ve tam olarak on kelime anlıyordu: sıfırdan dokuza kadar rakamlar.

Audrey, Otomatik Rakam Tanıyıcı

K. H. Davis, R. Biddulph ve S. Balashek, Audrey'yi yaklaşık iki metrelik bir röle rafını dolduran analog devrelerden yaptı. Konuşmacı telefon ahizesine bir rakam söylüyor, makine ünlü formantlarını ölçüyor ve duyduğu rakamın yanındaki lamba yanıyordu. Tasarımcılarının sesine ayarlandığında yüzde 97 ile 99 arasında başarı gösteriyor, yabancı seslerde ise sınıfta kalıyordu. Numaraları çeviren bir insan operatör daha ucuza geldiği için Audrey laboratuvardan hiç çıkmadı; ama bir makinenin duyup duyamayacağı sorusunu kesin olarak yanıtladı.

IBM'in Shoebox'ı ve 1960'lar

IBM, 1962'de Shoebox'ı Seattle Dünya Fuarı'nda sergiledi. Sistem 16 sözlü kelimeyi, yani on rakamla altı aritmetik komutu tanıyor ve bunlarla bir toplama makinesini çalıştırıyordu. On yıl boyunca ABD, İngiltere, Japonya ve Sovyetler Birliği'ndeki laboratuvarlar ünlüler, ünsüzler ve küçük kelime listeleri için tanıyıcılar geliştirdi; 1968'de Taras Vintsyuk, makinenin farklı hızlarda söylenmiş konuşmaları karşılaştırmasını sağlayan hizalama yöntemi dinamik zaman bükmeyi tanımladı. 1969'a gelindiğinde alanın hırsı vardı ama kuramı yoktu: Bell Labs'ten John Pierce bunu suyu benzine çevirme planlarına benzetti ve laboratuvar yıllarca bu işe para ayırmadı.

DARPA'nın Konuşma Anlama Araştırması programıyla kelime dağarcıkları 1.000 kelimeyi aştı

DARPA 1971 ile 1976 arasında o güne kadarki en büyük konuşma tanıma çalışmasını finanse etti ve Carnegie Mellon'un Harpy sistemi 1.000 kelimelik hedefe ulaştı.

Beş yıllık hedef

Konuşma Anlama Araştırması programı, birden çok konuşmacının bağlantılı konuşmasını 1.000 kelimelik bir dağarcıkta yüzde 10'un altında hatayla anlayabilen bir sistem istiyor ve yarışmaları için Carnegie Mellon, BBN, SRI ve başkalarına para ödüyordu. Bitiş çizgisine üç sistem ulaştı: Carnegie Mellon'daki Hearsay-II ile Harpy ve BBN'deki HWIM. 1976'da tamamlanan Harpy, kabaca üç yaşındaki bir çocuğun dağarcığı kadar, 1.011 kelime anlıyordu ve hedefi tutturan tek sistem oldu. Püf noktası, her olasılığı tartmak yerine düşük olasılıklı kelime dizilerini erkenden budayan bir aramaydı; bu fikir bugün de her kod çözücünün kalbinde yer alıyor.

İstatistiksel dönemeç

Aynı yıllar, sonraki 40 yıl boyunca diğer her şeyi geride bırakacak fikri de doğurdu. Carnegie Mellon'da James Baker'ın 1975 tarihli tezi, konuşmayı bir saklı Markov modeli olarak ele alan ve hangi kelimelerin söylendiğine elle yazılmış kurallar yerine olasılıkların karar vermesini sağlayan DRAGON sistemini tanımlıyordu. IBM'de Fred Jelinek'in ekibi aynı yaklaşımı bir araştırma amaçlı dikte sistemine yerleştirdi ve n-gram dil modelleri ekledi; böylece tanıyıcı, son iki kelimeye bakarak bir sonrakini tahmin edebiliyordu. Bu arada Bell Labs tek sesten çok sese geçti ve telefon uygulamalarının gerektirdiği, konuşmacıdan bağımsız çalışan tanıyıcılar geliştirdi.

Saklı Markov modelleri 1980'lerde konuşma tanımayı istatistiksel hale getirdi

1980'ler örüntü eşlemenin yerine olasılığı koydu ve kelime dağarcıkları on yılda birkaç yüz kelimeden 20.000'e çıktı.

Saklı Markov modeli nasıl duyar

Saklı Markov modeli bir sesi bir şablonla eşleştirmeye çalışmaz. Önce aldığı ses kaydını en büyük olasılıkla hangi konuşma sesi dizisinin ürettiğini, sonra o sesleri en büyük olasılıkla hangi kelime dizisinin ürettiğini sorar. Olasılıklar kayıtlı konuşmayla yapılan eğitimle belirlenir; yani daha çok veri daha iyi tanıyıcı demektir ve internet geldiğinde bu özellik muazzam önem kazanacaktı. HMM, n-gram dil modelleriyle birleşince her araştırma laboratuvarında standart mimari haline geldi ve 2012'de derin öğrenme onu tahtından edene kadar orada kaldı.

Tangora, Sphinx ve ilk ürünler

IBM'in Tangora sistemi 1980'lerin ortasında 20.000 kelimelik bir dağarcığı tanıyordu; gerçi kelimeler arasında duraklama ve her konuşmacı için ayrı eğitim gerektiriyordu. 1988'de Kai-Fu Lee'nin Carnegie Mellon'daki Sphinx sistemi, geniş dağarcığı, sürekli konuşmayı ve konuşmacıdan bağımsızlığı tek bir tanıyıcıda birleştiren ilk sistem oldu. James ve Janet Baker'ın 1982'de kurduğu Dragon Systems, kişisel bilgisayarlar için tanıma yazılımı satmaya başladı. Ses tanıma da ilk kez tüketiciye ulaştı: Worlds of Wonder'ın Julie bebeği 1987'de birkaç sözlü ifadeye yanıt veriyordu, telefon şirketleri ise sesle aramayı denemeye başlamıştı. Oyuncaklar kabaydı ama "ses tanıma" ifadesini sıradan evlere soktu.

1990'lar konuşma tanımayı kişisel bilgisayarlara taşıdı

Daha hızlı işlemciler dikteyi laboratuvar gösterisinden raflarda satılan yazılıma dönüştürdü; ortak bir kıyaslama seti de ilerlemeyi ölçmeyi kolaylaştırdı.

Dragon Dictate'ten NaturallySpeaking'e

Dragon Dictate 1990'da yaklaşık 9.000 dolara piyasaya çıktı. Sıradan bir kullanıcının satın alabildiği ilk konuşma tanıma ürünüydü ve her kelimeden sonra duraklama istiyordu. 1997'de Dragon NaturallySpeaking bu duraklamayı ortadan kaldırdı: ev bilgisayarında sürekli konuşmayı dakikada yaklaşık 100 kelime hızında tanıyordu; IBM de aynı yıl ViaVoice ile karşılık verdi. Bir avukat, bir doktor ya da bir yazar ilk kez bilgisayarla konuşup, onu eğitmek ve düzeltmek koşuluyla, işe yarar bir metin elde edebiliyordu.

Telefon menüleri ve ilk kıyaslamalar

BellSouth 1996'da sözlü soruları yanıtlayan, telefonla aranan bir ses portalı olan VAL'ı hizmete aldı; o günden beri tartıştığınız her otomatik telefon sistemi onun soyundan geliyor. Perde arkasında DARPA ile Ulusal Standartlar ve Teknoloji Enstitüsü, Switchboard telefon derlemi gibi ortak kayıtlar üzerinde yıllık değerlendirmeler yapıyordu ve kelime hata oranı her laboratuvarın raporladığı sayı haline geldi. O andan itibaren konuşma tanımanın tarihi, büyük ölçüde bu sayının düşüşünün tarihidir.

2000'ler konuşma tanımayı buluta taşıdı

Doğruluk on yılın büyük bölümünde yüzde 80 civarında takılı kaldı; ta ki Google tanımayı cihazdan alıp kendi sunucularına taşıyana kadar.

Durgunluk

2001'e gelindiğinde en iyi sistemler dikte edilen konuşmayı kabaca yüzde 80 doğrulukla yazıya döküyordu; sonraki yıllar sıçrama değil, ince ayar getirdi. Masaüstü dikte niş bir alan olarak kaldı, telefon menüleri sinir bozucu olmaya devam etti, araştırma fonları da azaldı. Saklı Markov modeli tavanına yaklaşmıştı; yerini alacak modellerin ise ihtiyaç duydukları işlem gücü ve veri henüz ortada yoktu.

Google Voice Search

Google'ın 2007'de başlattığı GOOG-411 rehber servisi, milyonlarca sözlü sorgu toplamanın bir yoluydu. Şirket Kasım 2008'de Google Voice Search'ü iPhone uygulaması olarak yayımladı ve konuşma tanıma biçim değiştirdi: telefon yalnızca kayıt yapıyor, tanıma ise Google'ın veri merkezlerinde, hiçbir cihaza sığmayacak kadar büyük modeller üzerinde çalışıyordu. Google'ın İngilizce sistemi 230 milyar kelimelik arama sorgusuyla eğitilmişti; bu sayede insanların ne söyleme ihtimalinin yüksek olduğunu tahmin edebiliyordu ve her yeni sorgu bir sonraki modeli besliyordu. Tanıma bir programdan çok bir hizmete dönüştü; bugün de bu biçimini koruyor.

Kronoloji

Konuşma tanımanın kilometre taşları,
yıl yıl

Aşağıdaki her olay tarihlendirilmiştir. Tablonun çevresindeki bölümler her birinin neden önemli olduğunu açıklıyor.

YılGelişmeNeden önemliydi
1952Bell Labs Audrey'yi yaptıKonuşmayı tanıyan ilk makine: tek konuşmacıdan 0'dan 9'a kadar rakamlar
1962IBM Shoebox'ı sergiledi16 kelime, Seattle Dünya Fuarı'nda halka gösterildi
1971DARPA Konuşma Anlama Araştırması programını başlattıBeş yıllık fon ve 1.000 kelimelik hedef
1976Carnegie Mellon'un Harpy'si hedefi tutturdu1.011 kelime ve kod çözücülerin hâlâ kullandığı budanmış arama
1986IBM'in Tangora'sı 20.000 kelimeye ulaştıSaklı Markov modelleri ve n-gram dil modelleri standart oldu
1988Carnegie Mellon'da SphinxSürekli, konuşmacıdan bağımsız, geniş dağarcıklı tanıma tek sistemde
1990Dragon Dictate satışa çıktıTüketiciye satılan ilk konuşma tanıma ürünü
1997Dragon NaturallySpeaking ve IBM ViaVoiceEv bilgisayarında dakikada yaklaşık 100 kelimeyle sürekli dikte
2008Google Voice SearchTanıma buluta taşındı ve her sorgudan öğrenmeye başladı
2011Apple Siri'yi sunduYaygın bir telefonda sesli asistan
2012Derin sinir ağları Gauss karışım modellerinin yerini aldıHata oranları tek adımda üçte bire varan ölçüde düştü
2016Microsoft Switchboard'da %5,9 bildirdiKonuşma kıyaslamasında ilk insan düzeyi iddiası
2017Microsoft %5,1, IBM %5,5, Google %4,9; Transformer yayımlandıİnsan düzeyi yarışı sona erdi, sıradaki mimari geldi
2020wav2vec 2.0 ve ConformerÖz denetimli öğrenme etiketli veri ihtiyacını azalttı
2022OpenAI Whisper'ı yayımladı680.000 saat eğitim verisi, 100'e yakın dil, açık ağırlıklar

Derin öğrenme 2010'larda hata oranlarını yarıdan fazla düşürdü

2011 ile 2017 arasında telefon konuşmalarındaki kelime hata oranı yüzde 10 küsurdan yüzde 5 civarına indi; sesli asistanlar da evlere girdi.

Siri ve asistanlar

Apple, Ekim 2011'de Siri'yi iPhone 4S ile birlikte sundu; böylece ilk kez yaygın kullanılan bir telefon, ana ekran tuşunun arkasında bir sesli asistanla geldi. Ardından 2014'te Amazon Echo üzerindeki Alexa ile, 2016'da Google ise Google Home ile onu izledi. Asistanların önemi, Google Voice Search gibi bulutta çalışan tanımalarından çok, oluşturdukları alışkanlıktaydı: yüz milyonlarca insan her gün makinelerle konuşmaya başladı ve her söz eğitim verisine dönüştü.

Sinir ağı adımı

2012'de aralarında Geoffrey Hinton'ın da bulunduğu Microsoft, Google, IBM ve Toronto Üniversitesi araştırmacıları ortak bir makale yayımladı: problemin akustik tarafında eğitilen derin sinir ağları, HMM sistemlerinin 25 yıldır kullandığı Gauss karışım modellerine kıyasla hata oranlarında üçte bire varan bir düşüş sağlıyordu. Baidu'nun Deep Speech sistemi 2014'te bir adım öteye geçti ve tek bir yinelemeli ağı sesten karakterlere uçtan uca, telaffuz sözlüğü ve elle kurulmuş işlem hattı olmadan eğitti. Tanıma bir derin öğrenme problemine dönüştü; en çok GPU'ya ve veriye sahip laboratuvarlar öne geçti.

İnsan düzeyine ulaşma yarışı

Kayıtlı telefon görüşmelerinden oluşan Switchboard kıyaslaması skor tahtasına dönüştü. Microsoft, Ekim 2016'da yüzde 5,9'luk bir kelime hata oranı bildirdi; bu, aynı görüşmeleri yazıya dökmesi için tuttuğu profesyonel deşifre uzmanlarıyla aynı orandı ve şirket buna insan düzeyi adını verdi. IBM Mart 2017'de yüzde 5,5 ile karşılık verdi, Google o yılın mayısında kendi test setlerinde yüzde 4,9 açıkladı ve Microsoft Ağustos 2017'de, insan referansının daha titiz bir ölçümüne karşı yüzde 5,1'e ulaştı. Mary Meeker'ın 2017 İnternet Trendleri raporundan alınan aşağıdaki grafik, Google'ın kelime doğruluğunun sektörün insan eşiği saydığı yüzde 95 çizgisini aştığını gösteriyor. Aynı yıl Transformer mimarisi makine çevirisi için yayımlandı ve üç yıl içinde konuşmayı da ele geçirdi.

Mary Meeker'ın 2017 İnternet Trendleri raporundan, Google'ın kelime doğruluk oranının yüzde 95'i aştığını gösteren grafik

Whisper ve Transformer deşifreyi herkesin ulaşabildiği bir hizmete dönüştürdü

Öz denetimli eğitim ve tek bir açık model, doğru çok dilli deşifreyi büyük teknoloji şirketlerine özgü bir yetenek olmaktan çıkarıp her ürünün sunabileceği bir şeye dönüştürdü.

Etiketsiz sesten öğrenmek

2010'ların darboğazı etiketli veriydi: her eğitim saati için bir insan deşifresi gerekiyordu. 2020'de Facebook AI'ın wav2vec 2.0 modeli konuşma temsillerini önce ham, deşifre edilmemiş sesten öğrendi ve işe yarar bir tanıyıcıya ince ayar yapmak için yalnızca on dakikalık etiketli konuşma yetiyordu. Google'ın aynı yıl yayımladığı Conformer modeli evrişimi Transformer dikkat mekanizmasıyla birleştirdi ve standart kıyaslamalarda yeni rekorlar kırdı. İkisi birlikte Transformer'ı konuşma için varsayılan mimari haline getirdi ve yeni bir dil eklemenin maliyetini düşürdü.

Whisper

OpenAI, Eylül 2022'de Whisper'ı yayımladı: web'den toplanan 680.000 saatlik sesle eğitilmiş, 100'e yakın dili kapsayan ve model ağırlıkları herkesin çalıştırabilmesi için açıkça yayımlanmış bir sistemdi. Her kıyaslamada en doğru sistem değildi ama aksanlara, arka plan gürültüsüne ve teknik terimlere karşı önceki akademik modellerde görülmeyen bir dayanıklılığa sahipti ve üstelik ücretsizdi. Aylar içinde binlerce ürünün içine girdi; deşifre şirketleri için soru, konuşmayı tanıyıp tanıyamadıklarından deşifre metninin etrafında ne inşa ettiklerine kaydı.

Bunun bugün sizin için anlamı

Sonix'e yüklediğiniz bir saatlik kayıt, 54+ dilin herhangi birinde, konuşmacı etiketleri ve zaman damgalarıyla, temiz seste 99% doğrulukla yaklaşık 5 ila 6 dakikada deşifre olarak geri döner. Sonix, insan düzeyi yarışının yaşandığı 2017 yılında kuruldu ve o günden beri atılan her adımdan yararlandı: modeller her yıl gelişiyor, emek ise artık deşifreyi işe yarar kılan editöre, özetlere, çevirilere ve dışa aktarmalara harcanıyor. Yukarıdaki yetmiş yıl, ilk deşifrenin bugün neden hiçbir ücrete mal olmadığının açıklamasıdır: ilk 30 dakikanız ücretsiz.

Otomatik dil tanımlamanın kendi tarihi var

Hangi dilin konuşulduğunu bilmek, hangi kelimelerin söylendiğini bilmekten ayrı bir problemdir ve çözümü de kendi başına 50 yıl aldı.

Fonem istatistiklerinden i-vektörlere

1970'lerdeki ilk dil tanımlama deneyleri, her dilin farklı fonemleri farklı sıklıkta kullandığı varsayımından hareketle dilleri seslerinin istatistiklerine göre ayırt etmeye çalıştı. 1990'larda bu yaklaşım fonotaktik yönteme dönüştü: önce bir fonem tanıyıcı çalıştırılıyor, sonra hangi dilin fonem örüntülerinin en iyi uyduğu soruluyordu. Ulusal Standartlar ve Teknoloji Enstitüsü 1996'da resmi Dil Tanıma Değerlendirmeleri'ne başladı ve konuşma tanımayı ileri taşıyan kıyaslama kültürü dil tanımlamayı da ileri taşıdı. 2010'larda konuşmacı tanımadan ödünç alınan, bir kaydın sabit uzunluktaki kompakt özeti olan i-vektör, birkaç saniyelik sesten dili söyleyebilen sistemler ortaya çıkardı.

Modelin içine gömülü

Modern çok dilli tanıyıcılar iki problemi tek potada eritiyor. Whisper ve ardılları dili deşifrenin ilk belirteci (token) olarak tahmin ediyor; böylece dil tanımlama ayrı bir adım değil, tanımanın bir yan ürünü oluyor. Tek bir ürünün her dil için ayrı bir tanıyıcı olmadan 54+ dili işleyebilmesi bu sayede mümkün; konuştuğunuz dilin, neyi deşifre edebileceğinizin sınırı olmaktan çıkmasının nedeni de bu.

Sırada ne var: ses arayüz haline geliyor

Sesli uygulamalar için gereken teknoloji artık ucuz ve doğru; soru da makinelerin duyup duyamayacağından, duyduklarıyla ne yapmaları gerektiğine kaydı.

Ses öncelikli ürünler

Akıllı hoparlörlerden kulaklıklara ve otomobillere kadar ses öncelikli cihazlar, bir makineyle konuşmayı sıradan bir şeye dönüştürdü; ulaşılması 70 yıl süren doğruluk ise artık bir özellik değil, varsayılan bir beklenti. Dil, neredeyse herkesin zaten sahip olduğu tek arayüz; bu yüzden tanımadaki küçük bir iyileşme, yeni bir ekranın ulaşabileceğinden çok daha fazla insana ulaşıyor. 2010'ların mobil öncelikli şirketlerinde olduğu gibi, sesin üzerine erkenden inşa eden şirketler o alanı elinde tutma eğiliminde.

Deşifrenin ötesi

Deşifrenin kendisi artık ham madde haline geldi. Büyük dil modelleri toplantıları özetliyor, bir röportajla ilgili soruları yanıtlıyor, bir dersi çeviriyor ve ondan takip e-postasını taslak olarak yazıyor; bunları iyi yapabilmelerinin tek nedeni ise altındaki deşifrenin doğru olması. Sonix'te iş tam da bu: tanıma, yukarıda adı geçen herkesin döşediği temel; ürün ise kelimeler bir kez var olduğunda onlarla yapabildikleriniz.

Sık sorulan sorular

Konuşma tanıma tarihi,
sorular ve yanıtlar

Konuşma tanıma ne zaman ve nerede icat edildi?

1952'de. Bell Labs'te K. H. Davis, R. Biddulph ve S. Balashek'in yaptığı Audrey sistemi, tek bir konuşmacının söylediği 0'dan 9'a kadar rakamları tanıyordu. 1962'de IBM'in Shoebox'ı 16 kelimeyle onu izledi; satın alabileceğiniz ilk ürün olan Dragon Dictate ise 1990'da geldi.

Konuşma tanımayı kim icat etti?

Tek bir kişi değil. İlk tanıyıcı Audrey'yi 1952'de üç Bell Labs mühendisi yaptı. James Baker ve Fred Jelinek 1970'lerde saklı Markov modelleriyle tanımayı istatistiksel hale getirdi, Kai-Fu Lee'nin Sphinx sistemi 1988'de onu sürekli ve konuşmacıdan bağımsız kıldı, Geoffrey Hinton'ın çalışma arkadaşları da 2012'de derin öğrenmeyi bu alana taşıdı.

İlk konuşma tanıma yazılımı hangisiydi?

Dragon Systems'in 1990'da yaklaşık 9.000 dolara piyasaya sürdüğü Dragon Dictate, halka satılan ilk konuşma tanıma yazılımıydı. Kelimeler arasında duraklama gerektiriyordu. 1997'de çıkan Dragon NaturallySpeaking ise ev bilgisayarları için ilk sürekli konuşmalı dikte ürünüydü.

Konuşma tanıma ile ses tanıma arasındaki fark nedir?

Konuşma tanıma, söylenen kelimeleri belirler. Ses tanıma ise sesin özelliklerinden kimin söylediğini belirler; telefonun sahibi için kilidini açması bu sayededir. Günlük kullanımda iki terim rahatça birbirinin yerine kullanılır. Bu makale kelimeleri tanımayı, yani deşifrenin, diktenin ve sesli asistanların arkasındaki teknolojiyi ele alıyor.

Konuşma tanıma bir yapay zeka türü mü?

Evet. 2012'den beri rekabetçi her konuşma tanıyıcı, büyük miktarda sesle eğitilmiş bir derin sinir ağı; yani büyük dil modellerinin arkasındaki yöntem ailesinin bir üyesi. Ondan önce saklı Markov modelleri de bir makine öğrenmesi biçimiydi: elle yazılmış kuralları izlemek yerine olasılıkları kayıtlı konuşmadan öğreniyorlardı.

Konuşma tanıma şu anda ne kadar doğru?

Temiz konuşma kayıtlarında en iyi sistemler profesyonel deşifre uzmanlarıyla başa baş: Microsoft 2017'de Switchboard kıyaslamasında %5,1 kelime hata oranı ölçtü ve modeller o günden beri daha da gelişti. Sonix iyi seste 99% doğruluğa ulaşıyor. Ağır aksanlar, üst üste konuşmalar ve arka plan gürültüsü hata oranını hâlâ yükseltiyor; her deşifrenin bir editörle gelmesinin nedeni de bu.

Başlayın

Sonix'i ücretsiz deneyin

Sonix, medya dosyalarınızı arayabilmeniz, düzenleyebilmeniz ve paylaşabilmeniz için ses ve video dosyalarınızı deşifre eder, zaman damgalarını ekler ve organize eder.

30 minutes dakikalık ücretsiz deşifre içerir

Okumaya devam et

%99 doğruluk. Her kelime önemlidir.

54+ dilde yapay zeka transkripsiyonu ve çevirisi.

30 minutes ücretsiz
Kredi kartı gerekmez
İstediğiniz zaman iptal edin