top of page
Generatived(Beta)|生成AIの最新ニュースとトレンドを提供

Deepgram が強化された直接音声合成モデルを発表
Generatived
25/2/20 13:45
Deepgram は、音声をテキストに変換せずにニュアンスと感情的なトーンを維持することで音声インタラクションを強化する新しい音声合成 (STS) モデルを発表しました。このイノベーションは、より自然で応答性の高いリアルタイムのコミュニケーションを実現することを約束し、これを採用する企業に戦略的優位性を提供します。
同社の STS 技術へのアプローチは、従来の順次処理段階を回避し、レーテンシーを減らして人間の会話の微妙なニュアンスをより正確に捉えることを目指しています。Deepgram のモデルは、音声を直接音声に変換することで、依然としてテキストを仲介として頼りにしている既存のマルチモーダル LLM の限界を改善しようとしています。
Deepgram のアーキテクチャは、潜在空間埋め込みを統合しており、処理パイプライン全体で重要な音声特性を保持します。この方法により、音声テキスト変換、大規模言語モデル、テキスト音声変換コンポーネントをシームレスに融合することができ、単一の制御可能なエンドツーエンドの音声モデルが実現します。
同社の転移学習と事前トレーニング済みモデルの使用により、研究が加速し、STS モデルに従来必要とされていた膨大なトレーニング データの必要性が軽減されます。この効率性により、音声アプリケーションの進化する需要に適応できる、スケーラブルなエンドツーエンドの音声 AI の導入が促進されると期待されています。


%20(1).webp)