关闭广告

科技巨头谷歌发布了其最新的音频模型,该模型专为即时语音翻译而设计—— Gemini 3.5 实时翻译。这一先进模型从根本上改变了人们克服语言障碍的方式,提供近乎实时的无缝语音翻译。

传统翻译系统按回合运行——用户必须先说话,系统处理语音,然后才播放翻译结果。 Gemini 然而,3.5 实时翻译的工作方式则完全不同。它将音频作为流连续处理,从而能够在即时翻译和保留上下文之间找到理想的平衡点。 max极高的准确度。其结果是语音流畅不间断,能够跟上说话者的语速。

该模型的主要特点

支持超过 70 种语言:与之前实时模式下仅支持少数几种语言的限制相比,新模式可处理超过 70 种语言。这使得在一次会议中可以连接超过 2000 种语言组合(翻译不再局限于与英语的组合)。

  • 保留人类的情感和语调翻译并非机械式的。该模型能够忠实地复制说话者的语调、语速、音高和整体语气,因此生成的语音听起来自然流畅。
  • 自动语言检测该系统可以自动识别多语言输入,因此用户在对话中切换语言时无需手动切换设置。
  • 抗噪声能力该型号的设计使其即使在嘈杂且不可预测的环境中,例如繁忙的街道或会议室,也能可靠地工作。

集成和可用性

新模式正在全球范围内陆续推出,直接集成在适用于安卓和iOS平台的谷歌翻译应用中。此外,安卓用户还可以使用特殊的聆听模式。该模式允许用户收听翻译内容。chat 通过手机听筒即可直接进行私密翻译。只需像平常通话一样将手机贴近耳朵,翻译后的音频就会直接传输到您耳中。

该模型生成的所有音频输出 Gemini 3.5 版本实时翻译功能采用了谷歌 DeepMind 的 SynthID 技术。这是一种人耳无法察觉的数字水印,但能够可靠地识别音频是由人工智能生成的。谷歌正在提高透明度,并降低该技术被滥用的风险。

Gemini 3.5 实时翻译听起来像是一项科技奇迹,它终于打破了最恼人的语言障碍。从此告别尴尬的沉默,无需再苦苦等待手机逐句翻译。我个人非常期待在即将到来的海外假期中,从口袋里掏出这款新产品,亲身体验一番——无论是在当地市场讨价还价,还是在一家完全不讲英语的僻静家庭餐厅点餐。 nest无需字典即可旅行的未来显然又近了一步。

今日阅读最多的

.