案例研究:国际象棋中的图灵测试:揭示人类主观性作用的实验

图灵测试最初由Alan Turing于1950年提出,用于确定机器是否能够如此令人信服地模仿人类智能,以至于人类评估人员无法可靠地将其与人区分开来。在《人类行为报告中的计算机》发表的一项研究中,研究人员Yke Bauke Eisma、Robin Koerts和Joost de Winter测试了国际象棋选手是否可以确定他们的对手是人类还是计算机。
方法和程序
该实验涉及24名国际象棋选手,他们每人从平衡的预选位置开始玩8场5分钟的闪电战。每位参赛者两次面对四个不同的对手:
- 人类玩家:一位实验者的评分约为1100埃洛(高于平均水平的玩家)。
- Maia:一个神经网络引擎,专门针对数百万个人类游戏进行训练,以复制类似人类的动作和错误。
- Stockfish(低级):Stockfish 16的降级版本,偶尔会引入人为错误。
- Stockfish(最高级别):世界上最强的国际象棋引擎,以超人的水平进行比赛。
为了使体验标准化,对手以10秒的固定间隔执行动作。参与者在游戏过程中大声说出自己的想法,分析位置并反思对手的游戏风格。每场比赛结束后,玩家都会完成一份问卷,评估他们认为对手是人类还是机器。
使用EyeLink和WebLink进行视觉跟踪及其结果
为了观察基于网络的游戏过程中的视觉注意力和认知努力,研究人员使用EyeLink Portable Duo跟踪器(SR Research),采样频率为1000 Hz。
实验使用SR Research进行 WebLink一种屏幕记录软件,可在现场国际象棋比赛中无缝捕获同步的凝视数据、屏幕活动、浏览器导航和鼠标移动。例如,EyeLink系统捕获的瞳孔测量数据显示,对手执行一个动作后,瞳孔扩张立即急剧增加,反映了玩家评估新棋盘位置时认知处理负荷的即时跳跃。
总体而言,该研究强调了人类感知在评估人工智能中的主要作用:
- 超人表现失败:最高级别的Stockfish在75%的情况下被正确识别为引擎,因为它的游戏太完美了。
- 类人错误欺骗:玩家经常将Maia误认为是人类对手,因为它犯了自然的类人错误。
结论—图灵测试是关于模仿人类的局限性
高精度EyeLink硬件和WebLink软件有助于捕捉实时人机交互过程中认知负担的微妙变化。该研究证明,在计算机以超人水平运行的领域,通过图灵测试不再是衡量原始机器智能的标准;相反,这是对人工智能是否能够自我适应以令人信服地复制人类缺陷并符合我们对人类行为的期望的测试。
有关眼动追踪如何帮助您的研究的信息,请查看我们的解决方案和产品页面或联系我们。我们很乐意为您提供帮助!
