Key points are not available for this paper at this time.
随着像ChatGPT这样的会话AI系统变得更加先进,研究人员正在探索将它们应用于教育的方法。然而,在允许这些系统帮助教学之前,我们需要有效的评估这些系统的方法。本研究提出了一个详细的框架,用于根据三个重要标准测试会话AI。首先,专业基准衡量技能,包括给出清晰的解释、在长对话中适应上下文以及保持一致的教学个性。其次,适应性标准检查系统是否满足隐私、公平和透明的伦理要求。这些标准定期更新,以符合社会期望。最后,从三个角度进行了评估:在测试数据集上的技术准确性、与虚拟学生群体的模拟中的表现,以及真实学生和教师对使用该系统的反馈。该框架提供了一种强有力的方法论,以识别会话AI在学校部署前的优缺点。它强调评估针对对话智能的关键特质量身定制,用户中心的指标捕获现实世界影响,以及通过参与设计进行的伦理对齐。AI助手的负责任创新需要证据表明它们能够在不影响教学效果或学生自主性的情况下,增强可及、吸引人和个性化的教育。
Mittal等人(Thu)研究了这个问题。