Generatif (Beta) |. Memberikan berita dan tren terkini dalam AI generatif

Deepgram Mengumumkan Model Sintesis Ucapan Langsung yang Disempurnakan
Generatived
20/2/25, 13.45
Deepgram telah meluncurkan model speech-to-text (STS) baru yang meningkatkan interaksi suara dengan mempertahankan nuansa dan nada emosional tanpa mengubah ucapan menjadi teks. Inovasi ini menjanjikan komunikasi yang lebih alami, responsif, dan real-time, sehingga memberikan keuntungan strategis bagi perusahaan yang mengadopsinya.
Pendekatan perusahaan terhadap teknologi STS menghindari tahapan pemrosesan berurutan tradisional, yang bertujuan untuk mengurangi latency dan menangkap nuansa halus percakapan manusia dengan lebih akurat. Dengan mengubah ucapan langsung menjadi ucapan, model Deepgram berupaya memperbaiki keterbatasan LLM multimoda yang ada yang masih mengandalkan teks sebagai perantara.
Arsitektur Deepgram mengintegrasikan penyematan ruang laten, yang mempertahankan karakteristik ucapan penting di seluruh alur pemrosesan. Metode ini memungkinkan penggabungan ucapan ke teks, model bahasa berskala besar, dan komponen teks ke ucapan yang mulus, sehingga menghasilkan model ucapan tunggal yang dapat dikontrol dan menyeluruh.
Penggunaan pembelajaran transfer dan model yang telah dilatih sebelumnya oleh perusahaan mempercepat penelitian dan mengurangi kebutuhan akan data pelatihan ekstensif yang biasanya diperlukan untuk model STS. Efisiensi ini diharapkan dapat mendorong penerapan AI suara yang dapat diskalakan dan menyeluruh yang dapat beradaptasi dengan tuntutan aplikasi suara yang terus berkembang.
Bagikan artikel ini:

