小米推出了OmniVoice——一款开放式人工智能模型,能够几乎在所有语言中朗读文本并复制声音。

小米推出了OmniVoice——一款开放式人工智能模型,能够几乎在所有语言中朗读文本并复制声音。

31 software

小米发布开放式 AI 模块 OmniVoice

公司宣布推出人工智能模型 OmniVoice,可将文本转换为语音。除了在数百种语言中合成声音外,该模型还能克隆声音并生成带有用户自定义设置的发音。

OmniVoice 有哪些新功能?

指标描述
语言支持支持超过 200 种语言,包括稀有和低资源语言。即使只有不到 10 小时的数据,模型也能生成“几乎任何语言”的语音。
声音质量在 102 种语言的测试中,语音清晰度与人类相当,在某些情况下甚至优于人类。在 24 种语言上,该模型在相似性和可懂度方面超过了多家商业系统。
架构简化的双向 Transformer 网络,无需中间标记预测模块。这将训练时间缩短至一天(使用 100,000 小时数据),并提升推理速度(PyTorch 下可达实时的 40 倍)。
技术• “随机隐藏声学编码”加速训练。
• 在预训练期间连接大型语言模型,改善发音和可懂度。

实际应用

1. 声音克隆
- 根据描述的特征(年龄、性别、语调、口音、方言)生成语音。
- 能在没有参考音频的情况下创建低声或其他风格化变体。

2. 原始录音处理
- 去除噪声并提取清晰的声音特征,即使文件不完美也能实现。

3. 音调控制
- 添加喘息、笑声等细微差别,使语音更自然。

4. 精准发音校正
- 手动调整复杂音素,例如多音节汉字或英语专有名词。

结论

OmniVoice 是现有商业语音合成系统的有竞争力替代方案。凭借简洁设计、高速训练与推理以及广泛定制能力,该模型已准备好集成到消费级应用和服务中。

评论 (0)

分享你的想法——请保持礼貌并围绕主题。

暂无评论。留下评论,分享你的观点!

要发表评论,请先登录。

登录后发表评论