AI助手认知卸载的多寡:对新手协作表现与技能发展的影响
https://www.sciencedirect.com/science/article/abs/pii/S0306457326004371

研究亮点
摘要
人工智能代理正越来越多地被部署为专业队友。然而,尚不清楚它们如何在不妨碍人类技能发展的前提下提升协作表现,尤其是在高风险领域的新手群体中。认知卸载——即利用外部资源(在此指AI助手)来减少自身认知努力——是这一张力的核心所在。我们使用自建平台和CAIL 2018数据集进行了一项对照实验。130名参与者被随机分配到四种条件之一:无AI控制组、高卸载AI组(提供直接建议)、中等卸载AI组(提供分析支持)或低卸载AI组(提供评估反馈)。结果揭示了一种基本的权衡。高卸载条件达到了最高的决策准确率(68.8%)和最短的决策时间(37.55秒),但它削弱了技能发展,准确率提升幅度比控制组低7.1%。相比之下,中等和低卸载条件促进了约5.5%的技能增益。中介分析表明,这种技能发展的受阻与元认知校准失当(感知能力与实际能力之间的差距)有关,而不仅仅是行为参与度的降低。这些发现扩展了“AI能力悖论”,揭示了存在一个关键的卸载阈值——在此阈值以下,AI可以在支持技能发展的同时提升协作表现;并识别出元认知校准失当(而非努力减少)是技能受损的作用机制,这表明面向新手的AI助手应优先考虑自适应的认知摩擦和实时能力校准,而非全自动化。
关键词面向新手的AI;元认知校准失当;认知卸载;技能发展;协作表现
引言
人工智能(AI)长期以来一直作为一套旨在扩展人类能力的工具发挥作用。通过自动化重复性和数据密集型的流程,AI助手减轻了用户对高要求心智任务的负担,使他们在教育、医疗和金融等多个领域提高了效率(Bhayana等,2023;Fütterer等,2023;Gunnarsson等,2021)。在这种背景下,采用AI的主要目标是最大化从用户向AI的认知卸载程度,使他们能够将自身资源集中于更高层次的决策(Gandhi等,2023)。认知卸载最初被定义为“利用身体行动来改变任务的信息加工需求,以减少认知负荷”(Clark,2003;Hutchins,1995;Risko & Gilbert,2016)。在人机协作中,它指的是利用AI助手来减少用户的认知负担(Chirayath等,2025);卸载水平越高,委托给AI助手的认知功能和分析性思维就越复杂。
为实现这一目标,人机交互(HCI)领域的早期研究传统上侧重于使人与AI的协作更加高效。研究者认识到,要使AI有效,用户必须愿意接受并采纳系统的建议(Choung等,2023;Kelly等,2023)。为鼓励用户接受,许多研究强调“基于信任”的设计。这些设计通过可解释性(Wang & Ding,2024)、置信度信号(Li等,2025)、拟人化设计(Xiao等,2025)和推理过程披露(Wu等,2022)来减少抵触。其根本目标是通过使用户易于将任务卸载给AI助手来提高协作表现。在HCI中,协作表现被概念化为“人与AI之间的协同与互补”(Jarrahi,2018;Raisch & Krakowski,2021)。这一指标通常以任务效率和决策质量来量化(Wang & Ding,2024),评估的是联合系统的能力,而非用户的独立能力。
由大语言模型(LLMs)驱动的主动式AI助手的出现进一步加速了这一趋势,同时从根本上改变了人与AI的关系。这些系统已将AI从简单工具转变为活跃的队友(Vaccaro等,2024)。与主要处理数据驱动型任务的传统AI不同,LLM允许更广泛的认知卸载。用户现在经常将高层次的脑力工作——如逻辑推理(Di等,2025)、信息综合(Asai等,2026)和创造性生成(Tian等,2024)——直接委托给系统。这种转变重新定义了人机协作:交互不再只是卸载简单的数据处理,而是卸载高层次的认知过程(Lin等,2024)。
然而,这种演进也带来了隐藏的风险:过度认知卸载(Shukla等,2025;Zohar等,2026)。由于基于LLM的智能体提供了一种“无摩擦”的方式来完成复杂任务,用户可能会在协作表现上获得即时收益,但代价是他们独立的个人能力(Larson等,2024)。这产生了一个关键悖论:通过委托基本认知过程来实现协作表现,用户可能会阻碍其独立于AI的个人能力的发展(Choudhury & Chaudhry,2024;Zhai等,2024)。这种风险对缺乏应用理论知识实践经验的新手尤为显著(Chen等,2024;Feldman & Anderson,2024)。过早依赖AI驱动的卸载,新手可能会跳过构建独立技能所必需的认知加工过程(Rhaimi等,2025)。
为应对这些风险,近期研究探索了反思性设计(Sharma等,2026)作为传统“基于信任”方法的替代方案。“魔鬼代言人”智能体(Suh等,2025)和“苏格拉底式探究”(Leoste等,2025)等技术通过要求在任务循环中更主动的用户参与来有意识地改变交互方式。通过引入理想难度(Bjork & Kroll,2015),这些方法旨在支持技能发展而非仅仅完成任务表现。然而,大多数先前工作在很大程度上仍是技术中心的,往往侧重于特定技术特征的实现——如苏格拉底式对话(Chen等,2024)或支架式提示(Yin & Yin,2024)。正如Oviatt(2006)所指出的,以人为中心的设计不仅仅是一系列技术特征的集合,而是关乎技术特征如何调节用户的认知负荷。然而,很少有研究实证地考察不同水平的AI驱动认知卸载如何影响协作表现与个人技能发展之间的权衡。
为填补这一空白,本研究调查了不同水平的AI驱动认知卸载如何影响新手。与先前关注技术特征的存在或具体形式的研究(Li等,2025;Wang & Ding,2024;Xiao等,2025)不同,我们聚焦于认知卸载水平,采用了三个AI助手——推荐型(高)、分析型(中等)和评估型(低)——它们在委托给系统的认知工作量上有所不同。通过一项对照实验,我们旨在揭示不同卸载水平如何塑造新手协作表现与技能发展之间关系的模式,从而为设计既能支持协作表现又能促进技能发展的以新手为中心的AI助手提供实证依据。此外,认知卸载的效果并非总是统一的,因为它们高度依赖于外部情境边界(Hermanns & Teubner,2025;Salimzadeh等,2023);例如,复杂任务需要大量认知资源和深度分析加工,而简单任务则通常依赖于常规启发式,这直接改变了认知卸载的程度(Risko & Gilbert,2016)及其随后的协作结果(Vaccaro等,2024)。然而,不同认知卸载水平的效果在这些情境边界之间如何变化仍不清楚。此外,关于认知机制,先前研究表明,认知参与(例如,在学习中投入更多时间和精力)可以促进知识获取和技能发展(Raees等,2025)。与此同时,其他研究表明,元认知校准(即自我评估的准确性)使学习者能够认识到自己知道什么和不知道什么,从而促进从AI反馈中进行更有效的学习(Lee等,2025)。鉴于这些相互竞争的观点,在不同水平的AI驱动认知卸载下,行为参与还是元认知校准主要驱动了所观察到的协作表现与技能发展之间的权衡,这仍然是一个开放性的实证问题。
基于这些目标,本研究旨在回答以下研究问题:
本文其余部分的结构如下。第2节回顾相关研究并概述现有研究的局限性。第3节描述实验设计、操纵、任务与材料、测量指标及实验平台实现。第4节呈现定量结果。第5节讨论关键发现。第6节讨论对以新手为中心的AI系统设计的启示。第7节总结研究局限性及未来研究方向。
。。。。。。
原文链接:https://www.sciencedirect.com/science/article/abs/pii/S0306457326004371