GPT-4o语音模式部分开放,秋季覆盖所有付费用户

seekdeep2年前AI资讯906

继此前 OpenAI 方面在今年 5 月发布多模态大模型 GPT-4o,原计划今年 6 月开放语音模式的测试,随后以 " 需要改进模型检测和拒绝某些内容的能力 " 为由推迟后。当地时间 7 月 30 日官方已向部分 ChatGPT Plus 订阅用户开放基于 GPT-4o 的高级语音模式(Advanced Voice Mode)测试,并宣布将在今年秋季逐步扩展至所有 ChatGPT Plus 用户。



据悉,ChatGPT 此前的语音模式是基于转录、大语言模型和文生语音 3 个独立模型来实现的语音功能。公开信息显示,GPT-3.5 的平均延迟为 2.8 秒、GPT-4 为 5.4 秒,而 GPT-4o 则能够以平均 320 毫秒的速度回应音频输入,与人类在典型对话中的反应时间相似。


对此 OpenAI 首席技术官 Muri Murati 表示," 在 GPT-4o 中,我们训练了跨文本、视觉和音频的端到端全新统一模型,这意味着所有输入和输出都由同一个神经网络处理 "。


据 OpenAI 方面透露,高级语音模式除了可以提供更自然的实时对话、允许用户随时打断之外,还能够感知或响应用户的情绪语调,包括悲伤、兴奋等。但需要注意的是,该模式目前设置了 Juniper、Breeze、Cove、Ember4 种预设语音,对此 OpenAI 发言人 Lindsay McCallum 曾表示,"ChatGPT 不能冒用他人的声音,包括个人和公众人物的声音,并且会阻止与这些预设声音之一不同的输出 "。


日前 OpenAI 方面还解释了高级语音模式仅向部分用户开放的原因,因此通过逐步推出,其可以密切监控用户的使用情况,并根据反馈不断改进模型的能力和安全性。需要注意的是,这部分用户将在 ChatGPT 应用程序中收到提醒,并收到一封有关如何使用高级语音模式的说明邮件。


相关文章

解锁大模型时代的无限可能,从GPT-3到Sora

从2020年OpenAI的GPT-3到2023年的GPT-4再到2024年的文生视频模型Sora,我们见证了大模型领域创新速度之快。从百度、阿里和360等为代表的头部科技企业率先入局到互联网公司、AI...

ChatGPT 出现答非所问、胡言乱语,OpenAI 已紧急修复!

2 月 22 日消息,ChatGPT 用户昨日发现,该聊天机器人返回了很多奇怪的回答内容,例如切换到其它语言、循环输出,反复自我纠正,甚至有些回复答非所问,纯属胡言乱语。例如一位用户和 ChatGPT...

揭示二叠纪大灭绝秘密 , AI助力科研!

二叠纪末大灭绝是地球历史上最惨烈的生物灾难之一,约80%的海洋生物和大量陆地生物消失。然而,最新研究发现,在新疆吐哈盆地南桃东沟地区,却存在着一个神奇的陆地'避难所',这里的植被和生态...

2B参数越级跑赢GPT-3.5-Turbom,谷歌开源最强端侧小模型!

谷歌也来卷「小」模型了,一出手就是王炸,胜过了比自己参数多得多的GPT-3.5、Mixtral竞品模型。今年 6 月底,谷歌开源了 9B、27B 版 Gemma 2 模型系列,并且自亮相以来,27B...

设计行业变革,如何让GPT变身设计界黑马?

最近不少修图软件都开始推出生成式AI功能了,比如这两周大火的Remini、Lensa可以根据照片内容生成其他风格的图片,老牌的Canva也接入了AI实现图像生成功能。不过想要不受限制的使用这些工具,用...

将用《人物》其内容训练ChatGPT,OpenAI与《人物》出版商签署合作协议 !

OpenAI宣布与数字媒体公司Dotdash Meredith签署了一项内容许可协议,该协议允许OpenAI将这家出版商的内容引入ChatGPT,并帮助训练其最先进的人工智能(AI)模型。根据当天宣布...