PANews 9月11日消息,OpenAI宣布在API中推出GPT-Live-1全双工语音模型,可同时听取和生成语音,改善对打断、停顿、背景噪音及长时间对话的处理,并支持电话场景。开发者可通过系统提示控制语气、语速和对话风格,还可将深度推理与工具调用委托给GPT-6 Astra等后端文本模型或第三方模型。 OpenAI称,GPT-Live-1在Full Duplex Bench上的表现较GPT-Realtime-2.1提高30个百分点;语言学习平台Speak的早期测试显示,该模型对学习者思考停顿的误打断较传统轮次系统减少近80%。

作者 Reporter

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注