広告を閉じる

テクノロジー大手Googleは、音声の即時翻訳を目的とした最新の音声モデルを発表した。 Gemini 3.5 ライブ翻訳。この先進的なモデルは、人々が言語の壁を克服する方法に根本的な変化をもたらし、ほぼリアルタイムでシームレスな音声間翻訳を提供します。

従来の翻訳システムは、双方向で動作します。つまり、ユーザーが話し、システムがその音声を処理し、その後初めて翻訳を再生します。 Gemini 3.5 Live Translateは、全く異なる仕組みで動作します。音声をストリームとして継続的に処理することで、即時翻訳と文脈を保持するための短い待ち時間という、理想的なバランスを実現しています。 max精度が向上します。その結果、話者のペースに遅れることなく、途切れることのない滑らかな音声の流れが実現します。

本モデルの主な特徴

70以上の言語に対応:従来のライブモードではごく少数の言語しかサポートしていませんでしたが、新モデルでは70以上の言語に対応しています。これにより、2回の会議内で000以上の言語の組み合わせで接続が可能になります(翻訳は英語との組み合わせに限定されなくなりました)。

  • 人間の感情とトーンを保つ翻訳は機械的なものではありません。このモデルは話者の抑揚、話す速度、音程、全体的なトーンを忠実に再現できるため、結果として自然な音声が得られます。
  • 自動言語検出システムは多言語入力を自動的に認識できるため、ユーザーは会話中に言語を切り替える際に手動で設定を切り替える必要がありません。
  • ノイズ耐性このモデルは、賑やかな街路や会議室など、騒がしく予測不可能な環境でも確実に動作するように設計されています。

統合と可用性

新しいモデルは、Android と iOS プラットフォームの両方の Google 翻訳アプリ内で、世界中で展開され始めています。Android ユーザー向けに特別なリスニング モードもリリースされます。これにより、chat スマートフォンの受話器を通して、さりげなく翻訳できます。通常の通話と同じようにスマートフォンを耳に当てるだけで、翻訳された音声が直接聞こえてきます。

モデルによって生成されるすべてのオーディオ出力 Gemini 3.5 Live Translateには、Google DeepMindのSynthIDテクノロジーが搭載されています。これは人間の耳には聞こえないデジタル透かしですが、音声が人工知能によって生成されたことを確実に識別します。Googleは透明性を高め、このテクノロジーの悪用リスクを低減しています。

Gemini 3.5 Live Translateは、最も厄介な言語の壁をついに打ち破る、まさに技術の粋を集めた製品と言えるでしょう。もう気まずい沈黙に悩まされたり、スマホが文章を一つ一つ解読するのを待ったりする必要はありません。個人的には、この新製品をポケットから取り出して、近々予定している海外旅行で実際に使ってみるのが今からとても楽しみです。地元の市場で値切り交渉をしたり、英語が通じないような人里離れた家族経営のレストランで夕食を注文したりする際に、きっと役立つはずです。 nest辞書なしで旅行できる未来が、どうやら一歩近づいたようだ。

今日最も読まれた記事

.