实验》AI 没让人变聪明,但“承认自己不懂”的人几乎归零

法国与意大利学者以 3,132 名受试者做了五个实验,发现只要 AI 建议在场,人们承认“我不知道”的比例会从 44% 崩到 3%,答对比例从 27% 掉到 9%,对自己答案的信心却从 30% 竄到 76%。题目被刻意设计成 AI 一定答错,就算加上答对给钱的诱因,暂缓判断也只回到 8%。主持研究的 Valerio Capraro 认为,这得靠 AI 素养与教育政策处理。
(前情提要:AI 聊天机器人不只附和:Nature 研究揭“放大螺旋”导致使用者错误幻觉)
(背景补充:人类患上AI病“大脑外包”极度恶化!iKala 创办人警告:求方便毁掉原創力)

重点摘要

  • 五个实验、3,132 名受试者,AI 在场时承认不知道的比例从 44% 崩到 3%
  • 受试者正确率从 27% 掉到 9%,对答案的信心却从 30% 升到 76%
  • 加入答对给钱的诱因后,暂缓判断回到 8%、正确率回到 16%,仍远低于基准线

五个实验、3,132 名受试者,结论只有一句话。据科技媒体 The Register 报道,法国与意大利的学者发现,只要手边有 AI 可以问,人们承认“我不知道”的比例会从 44% 崩到 3%,答对比例同时从 27% 掉到 9%,但对自己答案的信心反而从 30% 竄到 76%。

研究由米兰比可卡大学(University of Milano-Bicocca)副教授 Valerio Capraro、巴黎高等师范学院的 Chiara Marcoccia 与罗马大学的 Walter Quattrociocchi 共同完成,论文 7 月中旬挂上 arXiv,五个实验有四个经过预先注册。

AI 没有让人变聪明或变笨,是把人“觉得自己懂了”的门槛往下大幅降低。

题目被刻意设计成 AI 一定答错

研究团队没有随机出题。他们挑的是大型语言模型特别容易翻车的问题,全部围绕电影里的视觉细节,例如《我爱贝克汉》球队制服是什么颜色。这种题目要看过画面才答得出来,模型只能靠语料硬猜。

把 AI 建议固定设成错的,等于把“有没有用 AI”跟“AI 准不准”两件事拆开。受试者全程都可以选择不作答,直接说自己不知道。

结果是,只要 AI 在旁边,“不作答”的选项几乎没人才按。不论建议是受试者主动问来的,还是系统直接把答案摊在画面上,抑制效果都一样。

用钱诱导也只追回一小截

团队接着加码,答对给钱、答错扣钱。诱因确实有用,受试者变得比较少问 AI,也比较少照抄,暂缓判断的比例从 3% 回到 8%,正确率从 9% 拉到 16%。

但离基准线还很远,没有 AI 的时候,暂缓判断是 44%、正确率是 27%。换句话说,就算是钱摆在桌上,受试者也只追回不到四分之一的差距。

“对人类而言,说出‘我不知道’的能力非常重要,那代表我们认知到自身知识的边界。”Valerio Capraro 说,“但现在有了 AI,几乎任何问题都能拿到现成答案,我们因此想知道,这会不会干扰人类说‘我不知道’、暂缓判断的能力。”

Valerio Capraro 真正担心的是小孩,因为“大人已经学过批判性思考”。他认为这件事得靠 AI 素养与教育政策处理,教育层面的介入比较有机会见效。

对天天用 AI 读链上数据、拆研报的人来说,这篇论文是一面镜子。我们该担心的不是模型胡说八道,是自己看完 AI 摘要之后,有没有质问自己“我真的懂了吗”。

常见问题

使用 AI 会影响人的批判性思考吗?

米兰比可卡大学 Valerio Capraro 团队的五个实验(3,132 人)显示,AI 建议在场时,受试者承认自己不知道的比例从 44% 降到 3%,正确率从 27% 掉到 9%,对答案的信心却从 30% 升到 76%。

为什么这份研究要把题目设计成 AI 会答错?

团队刻意挑选大型语言模型容易失误的电影视觉细节题,让 AI 建议固定是错的。这样才能把“有没有用 AI”跟“AI 准不准”拆开,证明压抑暂缓判断的是 AI 在场本身,不是答案品质。

查看原文
此页面可能包含第三方内容,仅供参考(非陈述/保证),不应被视为 Gate 认可其观点表述,也不得被视为财务或专业建议。详见声明
  • 赞赏
  • 评论
  • 转发
  • 分享
评论
请输入评论内容
请输入评论内容
暂无评论
  • 置顶