OpenAI 推出了 GPT‑Realtime‑2 和两种全新的语音版本,仅通过 API 可用

OpenAI 推出了 GPT‑Realtime‑2 和两种全新的语音版本,仅通过 API 可用

26 hardware

OpenAI 扩展语音 API 的功能

公司宣布推出新功能,帮助开发者创建更“生动”的语音应用:他们可以与用户对话、将语音转写为文本,并实时翻译对话。

Realtime 新模型
通过 Realtime 接口,现在可用三种模型:

模型目的关键特性
GPT‑Realtime‑2实时语音交互分析请求、调用工具、处理修正并平滑延续对话。基于 GPT‑5 逻辑,能处理比 GPT‑Realtime‑1.5 更复杂的任务。
GPT‑Realtime‑Translate实时翻译支持 70+ 输入语言和 13 种输出语言,即使在上下文、地区口音或专业术语变化时也能保持意义。
GPT‑Realtime‑Whisper语音转写流式低延迟模型,几乎即时将音频转换为文本。

> “我们的新模型能够实时将音频从简单对话转换为可工作的语音界面:聆听、推理、翻译、转写,并在对话进行时采取行动。”公司表示。

价格
| 模型 | 费用 |
|---|---|
| GPT‑Realtime‑2 | $32/百万输入音频 token,$0.40/百万缓存 token,$64/百万输出音频 token |
| GPT‑Realtime‑Translate | $0.034/分钟 |
| GPT‑Realtime‑Whisper | $0.017/分钟 |

如何尝试
开发者可以在 OpenAI Playground 在线平台测试新模型,并立即看到它们的实时运行效果。

评论 (0)

分享你的想法——请保持礼貌并围绕主题。

暂无评论。留下评论,分享你的观点!

要发表评论,请先登录。

登录后发表评论