物化生水平比肩人类博士,OpenAI发布o1推理模型,碾压GPT-4o!

seekdeep1年前AI资讯563

对于复杂的推理任务来说,o1 代表了当前人工智能(AI)能力的新水平。


就在刚刚,OpenAI 的“草莓”模型正式发布,名为“o1”,这是一系列新的人工智能模型,旨在花更多时间思考后再做出回答。


与以前的科学、编码和数学模型相比,o1 模型可以推理复杂的任务,解决更难的问题。


就像人类一样,o1 系列模型会用更多时间思考问题,然后再做出回答。通过训练,这些模型学会了完善思考过程、尝试不同的策略,并认识到自己的错误。


据 OpenAI 介绍,在测试中,o1 的下一个更新模型在物理、化学和生物等具有挑战性的基准任务上的表现达到了博士生的水平。


他们还发现,这一模型在数学和编码方面表现出色。在国际数学奥林匹克(IMO)的资格考试中,GPT-4o 只正确解决了 13% 的问题,而 o1 模型的得分率则高达 83%。



此外,o1 模型的编码能力也在竞赛中得到了评估,在 Codeforces 竞赛中达到了第 89 个百分点。



作为早期模型,o1 还不具备 ChatGPT 的许多实用功能,如浏览网页信息、上传文件和图片等。对于许多常见情况,GPT-4o 在短期内会有更强的功能。


但 OpenAI 表示,o1 模型更擅长解决科学、编码、数学和类似领域的复杂问题。例如,医疗保健研究人员可以使用 o1 为细胞测序数据添加注释,物理学家可以使用 o1 生成量子光学所需的复杂数学公式,所有领域的开发人员都可以使用 o1 构建和执行多步骤工作流。


以下三个视频 demo 展示了o1 模型在解决复杂推理问题方面的强大能力。


视频|o1 解决了一个复杂的逻辑难题。


视频|o1 根据提示为视频游戏编码。


视频|o1 翻译了一个损坏的句子。


此外,在安全性方面,OpenAI 提出了一种新的安全训练方法,利用 o1 模型的推理能力,使它们遵守安全和对齐准则。通过在上下文中对安全规则进行推理,o1 模型可以更有效地应用这些规则。


衡量安全性的方法之一,是测试当用户试图绕过安全规则(即“越狱”)时,模型能在多大程度上继续遵循其安全规则。在最难的越狱测试中,GPT-4o 得分为 22 分(0-100 分),而 o1-preview 得分为 84 分。



此外,为了向开发人员提供更高效的解决方案,OpenAI 还同时发布了 o1-mini,这是一种速度更快、成本更低的推理模型,在编码方面尤为有效。作为一个较小的模型,o1-mini 比 o1-preview 便宜 80%,因此对于需要推理但不需要广泛世界知识的应用程序来说,它是一个经济高效的模型。


目前,o1 的预览版本和 o1-mini 已经在 ChatGPT(Plus 和 Team)和 API 上线。未来,o1-mini 将提供给所有 ChatGPT 免费用户使用。


相关文章

这家智能锁公司再次引领行业,加入GPT技术及大扭力电机

中国智能锁品牌德施曼在北京举办2024德施曼创新技术预沟通会,德施曼技术研发中心总监桑胜伟揭秘了两项行业突破性技术——GPTfinger及龙霆电机。据悉,GPTfinger首次将GPT技术应用于智能锁...

OpenAI推出新旗舰模型GPT-4o,图文音频手机AI搞定,类人速度超快语音响应!

年初“文生视频模型”Sora后许久未给市场带来惊喜的OpenAI举行春季发布会。公司首席技术官米拉·穆拉蒂(Mira Murati)向外界展现了多项与ChatGPT有关的更新。简要来说,OpenAI的...

最大参数超 1400 亿,2 名核心团队成员却离职,Llama 3 被爆 7 月解禁剑指 GPT-4。

Meta 将推出 Llama 3 大模型,性能超 Llama 2。【导读】外媒称,Llama 3 或将在 7 月发布,并解除了一些限制能回答更棘手的问题,而且对多重语境理解更加到位,至于是否有多模态能...

日耗电量高达50万度 ,GPT成“吃电狂魔”, 马斯克“电荒”预言成真?

最近一段时间,公众开始注意到,当前蓬勃发展的生成式AI技术需要耗费大量的电力。据《纽约客》当时时间9日报道,荷兰国家银行数据专家Alex de Vries估计,OpenAI旗下聊天机器人ChatGPT...

免费了,OpenAI放开限制,用户无需注册即可使用ChatGPT

人工智能(AI)公司OpenAI宣布,将允许用户直接使用ChatGPT,而无需注册该项服务,这将让人们更加容易体验人工智能的潜力。OpenAI表示,它将从周一开始逐步推出这一功能,让185个国家和地区...

几百家企业接入DeepSeek,后续将有更多的企业接入!

几百家企业接入DeepSeek,后续将有更多的企业接入!

但要有人说:DeepSeek 是秦始皇。那咱没准还真要琢磨下,毕竟人家这段时间,真一统全国了。。。你看甭管是哪个行业的哪家公司、和 AI 有没有打过交道,平时有没有互相 Diss ,最近都跟说好了一样...