OpenAI 推出了 GPT‑Realtime‑2 和两种全新的语音版本,仅通过 API 可用
26
hardware
OpenAI 扩展语音 API 的功能
公司宣布推出新功能,帮助开发者创建更“生动”的语音应用:他们可以与用户对话、将语音转写为文本,并实时翻译对话。
Realtime 新模型
通过 Realtime 接口,现在可用三种模型:
| 模型 | 目的 | 关键特性 |
|---|---|---|
| GPT‑Realtime‑2 | 实时语音交互 | 分析请求、调用工具、处理修正并平滑延续对话。基于 GPT‑5 逻辑,能处理比 GPT‑Realtime‑1.5 更复杂的任务。 |
| GPT‑Realtime‑Translate | 实时翻译 | 支持 70+ 输入语言和 13 种输出语言,即使在上下文、地区口音或专业术语变化时也能保持意义。 |
| GPT‑Realtime‑Whisper | 语音转写 | 流式低延迟模型,几乎即时将音频转换为文本。 |
> “我们的新模型能够实时将音频从简单对话转换为可工作的语音界面:聆听、推理、翻译、转写,并在对话进行时采取行动。”公司表示。
价格
| 模型 | 费用 |
|---|---|
| GPT‑Realtime‑2 | $32/百万输入音频 token,$0.40/百万缓存 token,$64/百万输出音频 token |
| GPT‑Realtime‑Translate | $0.034/分钟 |
| GPT‑Realtime‑Whisper | $0.017/分钟 |
如何尝试
开发者可以在 OpenAI Playground 在线平台测试新模型,并立即看到它们的实时运行效果。
评论 (0)
分享你的想法——请保持礼貌并围绕主题。
登录后发表评论