小米推出了新的AI模型MiMo V2.5,能够将文本转换为语音,也能将语音转换为文本
57
software
小米推出新的语音人工智能模型
小米公司发布了两种版本的语音AI模型,支持文本和音频:
| 模型 | 功能 | 关键特性 |
|---|---|---|
| MiMo‑V2.5‑TTS | 文本 → 语音 | 三种变体,MiMo Studio限时免费;可调节速度、音调与情感;通过短句生成新声音(VoiceDesign);从少量样本克隆声音(VoiceClone)。 |
| MiMo‑V2.5‑ASR | 语音 → 文本 | 在复杂环境下识别口语,支持中文方言+英语;双语对话与歌曲文本(伴随音乐的歌声);在噪声强烈时工作;根据语调自动标点。 |
如何使用 MiMo‑V2.5‑TTS
1. 基础版 – 选择预设声音并可调整速度、音调和情感色彩。
2. VoiceDesign – 输入短句,系统生成新声纹。
3. VoiceClone – 上传所选声音的若干样本;模型保持风格与指令进行复现。
为获得理想效果,用户可以:
- 给文本添加特殊标签;
- 用简体中文或英文自然语言描述声音;
- 为多声道虚拟演出创建脚本,让多种声音同时互动。
MiMo‑V2.5‑ASR 的特点
- 多语种 – 支持多种中文方言与英语。
- 歌曲转写 – 模型能在伴随音乐的情况下提取歌声。
- 抗噪性能 – 在强噪环境中精准识别。
- 语调标点 – 自动插入标点,减少手动校正需求。
因此,小米正在扩展其语音技术能力,为合成语音与精确口语识别提供灵活工具。
评论 (0)
分享你的想法——请保持礼貌并围绕主题。
登录后发表评论