斯坦福大学研究发现,AI 聊天机器人 ChatGPT 的表现很不稳定

人工智能
斯坦福大学的一项新研究发现,热门生成式人工智能(AI)聊天机器人 ChatGPT 的能力在几个月内有所波动。

9 月 7 日消息,斯坦福大学的一项新研究发现,热门生成式人工智能(AI)聊天机器人 ChatGPT 的能力在几个月内有所波动。

斯坦福大学的团队评估了 ChatGPT 在几个月内如何处理不同的任务。他们发现,ChatGPT 的能力随时间的推移而出现了不一致。目前,ChatGPT 有两个版本 —— 免费的 GPT-3.5 模型和更智能、更快速的付费 GPT-4 版本。 研究人员发现,GPT-4 在 3 月份能够有效地解决数学问题,识别质数的准确率为 97.6%。三个月后,其准确率下降到了 2.4%。而另一方面,GPT-3.5 却变得更好,从 7.4% 的准确率提高到了 86.8%。

研究人员还注意到,在编写代码和视觉推理方面也有类似的波动。斯坦福大学计算机科学教授 James Zou 称:“当我们调整一个大型语言模型来提高它在某些任务上的表现时,那可能会有很多意想不到的后果,可能会损害这个模型在其他任务上的表现…… 这个模型回答问题的方式有各种各样的相互依赖性,这可能导致我们观察到的一些恶化行为。”

研究人员认为,结果并不能真正反映 ChatGPT 性能的准确性状态,而是显示了微调模型带来的意外后果。本质上,当修改模型的一部分来改善一个任务时,其他任务可能会受到影响。为什么会这样很难确定,因为没有人知道 ChatGPT 是如何运作的,而且它的代码也不是开源的。

随着时间的推移,研究人员注意到,ChatGPT 的回答不仅变得不太准确,而且还停止了解释其推理过程。

由于 ChatGPT 的运作方式,要研究和衡量它的表现可能很困难,这项研究强调了观察和评估驱动 ChatGPT 等工具的大型语言模型(LLM)性能变化的必要性。该研究已经在 arXiv 上发布,并正在等待同行评审,IT之家附链接在此

责任编辑:庞桂玉 来源: IT之家
相关推荐

2020-07-08 16:46:46

人工智能病毒技术

2018-01-22 16:16:28

AI发展新趋势机器学习

2022-10-13 16:01:38

技术大脑

2023-05-22 07:02:50

电子皮肤机器人

2023-04-12 15:45:56

人工智能ChatGPT

2023-06-11 16:13:19

机器人ChatGPT人工智能

2023-02-15 14:33:26

2011-11-17 09:53:18

斯坦福大学iOS应用开发

2021-03-18 11:30:15

人工智能AI机器学习

2023-06-29 15:04:21

微软ChatGPT

2009-05-07 08:49:11

鲍尔默斯坦福大学巴茨

2022-07-05 06:42:01

聊天机器人人工智能

2023-03-21 23:50:16

人工智能机器人ChatGPT

2019-03-20 14:02:13

AI 行业 人工智能

2018-06-28 09:07:58

2023-12-27 14:07:00

模型训练

2021-05-06 15:07:25

人工智能机器学习技术

2023-10-13 09:00:00

2023-01-30 21:34:35

人工智能机器人ChatGPT
点赞
收藏

51CTO技术栈公众号