TutorMoments:人工智能辅导老师知道何时施以援手、何时静观其变吗?
Hugging Face
Hugging Face 推出了 TutorMoments 框架,用于评估大语言模型能否在辅导学生与让学生自行摸索之间取得平衡。该框架基于真实辅导数据构建,利用教师标注的关键时刻,在模拟辅导场景中测试人工智能辅导老师的表现。初步结果显示,模型默认倾向于过度帮助,但通过明确提示词可以改善表现,不过仍不及人类判断。
Hugging Face 发布了 TutorMoments 的预览版,这是一个旨在衡量前沿大型语言模型(LLM)能否在帮助学生与克制指导以鼓励独立思考之间取得平衡的框架。该框架基于一个包含462份来自美国2至7年级学生真实一对一数学辅导课程的去标识化记录的数据集,这些记录由经验丰富的数学教师标注,标出了辅导员必须在搭建支架和推动严谨性之间做出选择的关键时刻。在测试中,七个LLM被提供了截至决策点的记录,并作为辅导员与模拟学生继续互动。结果显示,在简单提示下,模型倾向于过度帮助,但当提示中明确描述了权衡时,所有模型的表现都有所改善,但仍未达到人类辅导员的一致性水平。研究人员正在发布数据集、代码和重放以供复现,并强调自动化评估不能取代真实的学习成果研究。该项目得到了盖茨基金会和学习共享组织的支持。
来源: Hugging Face blog —
原文
