美国大学研究:ChatGPT 的新闻搜索结果经常不准确

seekdeep1年前AI资讯571

据 The Verge 北京时间今日报道,美国哥伦比亚大学 Tow 数字新闻研究中心(Tow Center for Digital Journalism)的研究人员测试发现,OpenAI 的 ChatGPT 搜索工具在准确性上存在一些问题。

今年 11 月,OpenAI 面向订阅用户推出了这一工具,称其可以快速提供答案,并附带相关网页来源链接。然而研究显示,ChatGPT 搜索在识别文章引用时表现不佳,即使是面对来自与 OpenAI 数据共享的出版商的内容,ChatGPT 也难以准确处理。

研究人员测试了 20 家出版商的 200 条引文,其中 40 条来自禁止 OpenAI 爬虫抓取的网站。但 ChatGPT 依然自信地给出了错误答案,几乎没有表明自身的不确定性。

d50735fae6cd7b894bfb3455c3974aa8db330e97.jpg

测试结果显示,ChatGPT 的 153 次回答完全或部分错误,仅有 7 次明确表示无法准确回答。这 7 次回答中,它使用了“看起来”“有可能”等限定词,或直接承认“无法找到具体文章”。

一份图表进一步显示,ChatGPT 的回答中“错误”的占 89 次,“部分正确”有 57 次,而完全“正确”的只有 47 次。

测试中还记录了一些典型案例,例如,ChatGPT 错误地将《奥兰多哨兵报》读者来信的引用归因为《时代周刊》文章;另一个例子中,它在被要求确认《纽约时报》一篇关于濒危鲸鱼的文章引用时,链接到了一家完全剽窃该文章的网站。

OpenAI 对《哥伦比亚新闻评论》回应称,“在缺乏 Tow Center 隐藏的测试数据和方法的情况下,解决错误归因非常困难。这次研究是对我们产品的非典型测试。”OpenAI 同时承诺将继续优化搜索结果。

据IT之家此前报道,今年早些时候,OpenAI 还宣布与新闻行业进行了广泛的合作,并收集了合作伙伴对于搜索功能的反馈。任何网站或出版商都可以选择出现在 ChatGPT 搜索结果中。达成合作的媒体和出版商包含美联社、阿克塞尔・斯普林格、康泰纳仕、道奇梅雷迪思、《金融时报》、GEDI、赫斯特、《世界报》、路透社、大西洋月刊、时代杂志和 Vox 媒体等等。

相关文章

性能直逼GPT-4,微软宣布合作投资,欧洲最火AI独角兽发布旗舰大模型!

欧洲生成式AI独角兽Mistral AI发布最新旗舰大语言模型Mistral Large。据报道,与Mistral AI之前的模型不同,Mistral Large不会开源。该模型上下文窗口为32K t...

GPT-5有望今年夏季发布,多模态能力预期提升,中国银河给予计算机行业推荐评级!

AI快讯,中国银河03月29日发布研报称:给予计算机行业推荐(维持)评级。近日,多家媒体公开消息称 GPT-5 预计将在今年夏季正式发布,目前仍处内测阶段。当前,最新版本 GPT-4 Turbo 已能...

OpenAI该放出“GPT-5”了,对手相继突破GPT-4!

终于,GPT-4独霸时代终结了!过去一个月里,四款大模型横空出世,在各项关键基准测试中与GPT-4相匹敌,甚至更胜一筹。谷歌Gemini 1.5突破100万个tokens,是GPT-4的近8倍,此外能...

未来专家将有“分身术”,元宇宙医学数字人GPT在闵行亮相!

专家少,患者多,如何解决专家的稀缺性问题?4月10日,上海市闵行区医学会元宇宙医学专业委员会举行成立大会。会上,全球领先的元宇宙医学数字人GPT——BAIMGPT1.0正式亮相。据悉,BAIMGPT1...

人工智能ETF、软件30ETF等产品布局相关产业链投资机会。GPT-5有望于今夏发布!

本周国证机器人产业指数下跌1.4%,中证云计算与大数据主题指数下跌2.1%,中证人工智能主题指数下跌2.2%,中证软件服务指数下跌3.2%。银河证券认为,预计GPT-5将在大模型的上下文输入长度实现重...

北大&字节提出VAR范式,GPT超越扩散、视觉生成Scaling Law时刻!

新一代视觉生成范式「VAR: Visual Auto Regressive」视觉自回归来了!使 GPT 风格的自回归模型在图像生成首次超越扩散模型,并观察到与大语言模型相似的 Scaling Laws...