小米推出了新的AI模型MiMo V2.5,能够将文本转换为语音,也能将语音转换为文本

小米推出了新的AI模型MiMo V2.5,能够将文本转换为语音,也能将语音转换为文本

57 software

小米推出新的语音人工智能模型

小米公司发布了两种版本的语音AI模型,支持文本和音频:

模型功能关键特性
MiMo‑V2.5‑TTS文本 → 语音三种变体,MiMo Studio限时免费;可调节速度、音调与情感;通过短句生成新声音(VoiceDesign);从少量样本克隆声音(VoiceClone)。
MiMo‑V2.5‑ASR语音 → 文本在复杂环境下识别口语,支持中文方言+英语;双语对话与歌曲文本(伴随音乐的歌声);在噪声强烈时工作;根据语调自动标点。

如何使用 MiMo‑V2.5‑TTS

1. 基础版 – 选择预设声音并可调整速度、音调和情感色彩。
2. VoiceDesign – 输入短句,系统生成新声纹。
3. VoiceClone – 上传所选声音的若干样本;模型保持风格与指令进行复现。

为获得理想效果,用户可以:

- 给文本添加特殊标签;
- 用简体中文或英文自然语言描述声音;
- 为多声道虚拟演出创建脚本,让多种声音同时互动。

MiMo‑V2.5‑ASR 的特点

- 多语种 – 支持多种中文方言与英语。
- 歌曲转写 – 模型能在伴随音乐的情况下提取歌声。
- 抗噪性能 – 在强噪环境中精准识别。
- 语调标点 – 自动插入标点,减少手动校正需求。

因此,小米正在扩展其语音技术能力,为合成语音与精确口语识别提供灵活工具。

评论 (0)

分享你的想法——请保持礼貌并围绕主题。

暂无评论。留下评论,分享你的观点!

要发表评论,请先登录。

登录后发表评论