小米推出了OmniVoice——一款开放式人工智能模型,能够几乎在所有语言中朗读文本并复制声音。
31
software
小米发布开放式 AI 模块 OmniVoice
公司宣布推出人工智能模型 OmniVoice,可将文本转换为语音。除了在数百种语言中合成声音外,该模型还能克隆声音并生成带有用户自定义设置的发音。
OmniVoice 有哪些新功能?
| 指标 | 描述 |
|---|---|
| 语言支持 | 支持超过 200 种语言,包括稀有和低资源语言。即使只有不到 10 小时的数据,模型也能生成“几乎任何语言”的语音。 |
| 声音质量 | 在 102 种语言的测试中,语音清晰度与人类相当,在某些情况下甚至优于人类。在 24 种语言上,该模型在相似性和可懂度方面超过了多家商业系统。 |
| 架构 | 简化的双向 Transformer 网络,无需中间标记预测模块。这将训练时间缩短至一天(使用 100,000 小时数据),并提升推理速度(PyTorch 下可达实时的 40 倍)。 |
| 技术 | • “随机隐藏声学编码”加速训练。 • 在预训练期间连接大型语言模型,改善发音和可懂度。 |
实际应用
1. 声音克隆
- 根据描述的特征(年龄、性别、语调、口音、方言)生成语音。
- 能在没有参考音频的情况下创建低声或其他风格化变体。
2. 原始录音处理
- 去除噪声并提取清晰的声音特征,即使文件不完美也能实现。
3. 音调控制
- 添加喘息、笑声等细微差别,使语音更自然。
4. 精准发音校正
- 手动调整复杂音素,例如多音节汉字或英语专有名词。
结论
OmniVoice 是现有商业语音合成系统的有竞争力替代方案。凭借简洁设计、高速训练与推理以及广泛定制能力,该模型已准备好集成到消费级应用和服务中。
评论 (0)
分享你的想法——请保持礼貌并围绕主题。
登录后发表评论