このスペイン語の音声クリップを聞いてみよう。
この音声クリップを従来の自動翻訳システムで英語に翻訳すると、次のようになる。
そしてこちらが、グーグルの新しい自動翻訳システムを利用した場合のものである。
完璧ではないものの、グーグルの翻訳システムでは、元の話者の声と口調がある程度維持されていることがわかる。グーグルの翻訳システムは、音声入力を音声出力に直接変換しているからだ。その間に他のステップはない。それに対して従来の翻訳システムは、音声を一旦テキストに変換し、そのテキストを翻訳した後、再度音声を合成している。そのため、その過程で元の声の特徴が失われてしまう。
「トランスラトトロン(Translatotron)」と名付けられたこの新しいシステムには3つのコンポーネントがあり、そのすべてが、話者の音声スペクトログラムを調べている。音声スペクトログラムとは、再生されている音の周波数分布のスナップショットを視覚化したもので、一般的に声紋と呼ばれる。トランスラトトロンの最初のコンポーネントでは、入力言語の声紋を出力言語の声紋にマッピングするように訓練したニューラル・ネットワークを使用する。2つめのコンポーネントは、マッピングした声紋を、再生可能な音声の波形に変換する。その後、3つめのコンポーネントが、元の話者の声の特徴を、最終的な音声出力に被せて戻す。
このアプローチによって、言葉には表されない重要な情報が維持され、より繊細な表現の翻訳が可能になるだけでなく、理論的には、翻訳ミスが最小限に抑えられる。ステップがより少なくなるからだ。
トランスラトトロンは現在、研究者らが概念実証をしている段階だ。テストでは、精選された訓練用データがすでに大量に確保されているスペイン語から英語への翻訳だけを試みている。だが、上の音声クリップを聞くと、いずれは商用システムとして実用化される可能性がありそうだ。その他の音声クリップはこちらから確認できる。
- 人気の記事ランキング
-
- America’s new dietary guidelines ignore decades of scientific research 「ステーキとバターを食べよ」米国の新食事ガイドラインが波紋
- This company is developing gene therapies for muscle growth, erectile dysfunction, and “radical longevity” まず筋肉増強、勃起不全・薄毛も——「長寿」治療謳う企業が試験
- Text-to-image AI models can be tricked into generating disturbing images AIモデル、「脱獄プロンプト」で不適切な画像生成の新手法
- Meet the man hunting the spies in your smartphone 20年間、独裁国家を追った研究者は今、米国を監視している
- カーレン・ハオ [Karen Hao]米国版 寄稿者
- 受賞歴のあるフリー・ジャーナリスト。人工知能が社会に与える影響について取材している。ウォール・ストリート・ジャーナル紙の海外特派員として中国のテクノロジー業界を担当。2022年4月まではMITテクノロジーレビューのAI担当上級編集者を務めた。