OpenAI 发布新一代语音模型,让 AI 智能体语音表达更自然

2025-03-25 0 793

3 月 21 日消息,OpenAI昨日(3 月 20 日)发布博文,宣布推出语音转文本(speech-to-text)和文本转语音(text-to-speech)模型,提升语音处理能力,支持开发者构建更精准、可定制的语音交互系统,进一步推动人工智能语音技术的商业化应用。在语音转文本模型上,OpenAI 主要推出了 gpt-4o-transcribe 和 gpt-4o-mini-transcribe 两个模型,官方表示在单词错误率(WER)、语言识别和准确性上超越现有 Whisper 系列。这两个模型支持超 100 种语言,主要通过强化学习和多样化高质量音频数据集训练,能捕捉细微语音特征,减少误识别,尤其在嘈杂环境、口音及不同语速下表现更稳定。在文本转语音上,OpenAI 最新推出了 gpt-4o-mini-tts 模型,开发者通过“模拟耐心客服”或“生动故事叙述”等指令,控制语音风格,可以应用于客服(合成更具同理心的语音,提升用户体验)和创意内容(为有声书或游戏角色设计个性化声音)方面。1AI援引博文介绍,附上三款模型费用如下:gpt-4o-transcribe:音频输入每 100 万 tokens 费用 6 美元、文本输入每 100 万 tokens 费用 2.5 美元,输出每 100 万 tokens 费用 10 美元,每分钟成本 0.6 美分。gpt-4o-mini-transcribe:音频输入每 100 万 tokens 费用 3 美元、文本输入每 100 万 tokens 费用 1.25 美元,输出每 100 万 tokens 费用 5 美元,每分钟成本 0.3 美分。gpt-4o-mini-tts:每 100 万 tokens 输入费用为 0.60 美元,每 100 万 tokens 输出费用为 12 美元,每分钟成本 1.5 美分。相关内容:​微软与 OpenAI 计划建造拥有百万服务器的数据中心OpenAI 推出 Batch 批处理 API:半价折扣,24 小时内输出结果消息称苹果、OpenAI 成为台积电 A16 制程首批客户OpenAI Deep Research 功能向 ChatGPT Plus 用户开放,每月可查询 10 次声明:内容来源公开的各类媒体平台,若收录的内容侵犯了您的权益,请联系邮箱,本站将第一时间处理。

收藏 (0) 打赏

感谢您的支持,我会继续努力的!

打开微信扫一扫,即可进行扫码打赏哦,分享从这里开始,精彩与您同在。
点赞 (0)
常见问题
  • 本站所有资源版权均属于原作者所有,这里所提供资源均只能用于参考学习用,请勿直接商用。若由于商用引起版权纠纷,一切责任均由使用者承担。
查看详情
  • 如果出现购买后没有跳转下载链接,请更换浏览器登陆本站会员中心在购买记录里面查找链接。如果链接失效出现无法下载的情况,请联系客户修复并补发资源。
查看详情

相关文章

发表评论
暂无评论