概要
NVIDIA が、多言語対応の音声合成(TTS)モデル「Magpie TTS Multilingual」の最新版を発表しました。オープンウェイト(モデルの重みが公開されている)で提供され、低遅延な音声AIエージェントを自社インフラ上に構築できる点が特徴です。日本語を含む12言語に対応しています。
何が発表・更新されたのか
Magpie TTS Multilingualは、3億6,400万パラメータのオープンウェイトTTSモデルです。今回のアップデートで、現代標準アラビア語・韓国語・ブラジルポルトガル語が新たに追加され、対応言語は英語・スペイン語・フランス語・ドイツ語・イタリア語・ベトナム語・中国語(普通話)・ヒンディー語・日本語・アラビア語・韓国語・ブラジルポルトガル語の12言語になりました。各言語で男女の音声が選べます。
また、フランス語やスペイン語などで発音精度(誤読率)や話者の再現性が向上したほか、ヒンディー語と日本語では、異なる言語が混在する文章(コードスイッチング)の読み上げ精度も改善されています。モデルはHugging Faceで公開されており、本番運用向けには「NVIDIA NIM」というコンテナ形式でも提供されています。
なぜ重要なのか
音声AIの応答では、ユーザーが最も遅延を感じやすいのが「音声が聞こえるまでの最初の一言(Time to First Audio)」です。公式ブログによれば、NVIDIAのGPU(B200やH100など)上でMagpieを動かした場合、1ストリームあたり32〜79ミリ秒で最初の音声が生成されるとしています。これは自社インフラ上で計測した数値であり、外部のAPIサービスを経由する際に発生する通信の往復時間を含みません。オープンウェイトであることで、開発者は自社の環境で速度を測定・調整でき、パイプライン全体の遅延を管理しやすくなります。
誰に関係があるのか
- 多言語対応のコールセンターやカスタマーサポートAIを開発する企業
- 医療・翻訳・小売など、音声を使った業務システムを検討している担当者
- データを自社環境内に留める必要がある(データレジデンシー要件がある)企業
- 自社ブランドに合わせた声質や発音をカスタマイズしたい開発チーム
仕事や業務でどう使えるのか
オープンウェイトモデルのため、社内サーバーやプライベートクラウド、外部ネットワークに接続しないair-gapped環境でも動かせます。NVIDIAのNeMoフレームワークを使えば、専門用語や社名・商品名の発音、話者の声質を独自にファインチューニング(追加学習)することも可能です。ASR(音声認識)やLLM(大規模言語モデル)と組み合わせたカスケード型の音声パイプラインを構築し、各コンポーネントを個別に調整・入れ替えできる点も業務システム向けの利点です。
注意点
公式情報上では、日本での提供状況や対象プランの詳細は確認できませんでした。また、料金体系やクラウドサービスとしての提供有無についても、本記事のもとになった公式ブログ内では明記されていません。実運用にあたっては、公式ドキュメントやNVIDIA Buildサイトなどで最新の提供条件をご確認ください。
公式情報
関連キーワード
- NVIDIA NIM
- Text-to-Speech(音声合成)
- オープンウェイトモデル
- 音声AIエージェント
- 多言語対応AI





