文章分享 | 生成式AI反馈如何赋能小学生科学绘图?
时间: 2026-09-29 发布者: stem 文章来源: 科学教育研究中心 审核人: 浏览次数: 10
图片
图片
图片
图片
图片
图片

在小学科学课堂中,绘图并非单纯的美术活动,而是儿童外化科学理解、落实科学观察与科学建模实践的关键方式。受班额限制,教师难以面向全体学生提供即时、可操作的绘图修改建议。随着多模态生成式AI快速发展,AI能否成为教师的“反馈协作者”,为小学生手绘科学图提供形成性反馈?同时又该如何规避风险,避免AI剥夺学生一手探究的机会?一篇近期发表于《Research in Science Education》的论文,来自香港教育大学、首尔国立大学的研究团队就此开展实证探索,不仅揭示了生成式AI反馈在小学科学绘图学习中的实践效能,还指出多模态AI应用于低龄科学教育的现实局限,为AI赋能科学实践提供可落地的设计框架与课堂证据。



图片

研究背景

图片


科学观察与科学建模是小学科学两大核心实践,绘图可以弥补低龄学生书面表达的局限,帮助学生把宏观实验现象转化为可视化科学模型。现有AI相关研究大多聚焦对科学绘图的自动评分,较少关注小学生如何与AI反馈互动并修改自己的作品。学界对GenAI融入科学课堂存在争议:一方面GenAI可以快速生成个性化指导;另一方面,如果直接让AI生成图像,会割裂学生一手实证观察和理论建构过程,学生容易直接照搬AI结果,丧失自主思考与绘图建构的机会。

现有领域缺少一套适配小学生、立足科学实践本身的GenAI反馈设计框架。因此该研究聚焦解决:如何设计GenAI反馈,既发挥AI实时反馈优势,又保留学生动手观察、自主手绘的科学探究过程。研究团队联合一线小学教师,提出两大实践阶段 + 三条反馈设计原则的理论框架,详见图1。

两大实践阶段:观察绘图、建模绘图。学生完成真实实验,手绘之后上传获取反馈迭代修改,而非由AI直接出图。

三大反馈原则:①允许学生依据反馈采取行动,能够修改绘图;②提供学科主题特异性反馈,遵循空间同构性、科学符号表达规范;③多元反馈模式,适配小学生阅读能力,包含短句、表情、音频等形式。

图片

图1:基于生成式人工智能反馈的小学科学教育应用设计框架


由此,研究者提出三个研究问题:

1.使用生成式AI反馈应用之后,小学生的科学模型绘图发生了怎样的变化?

2.生成式AI对学生科学观察绘图、模型绘图的打分准确度如何?

3.学生如何响应GenAI反馈,开展多次绘图修改尝试?



图片

研究设计

图片


研究方法

该研究采用混合方法案例研究,基于上述理论框架开发Sci‑GiFD(Science GenAI Feedback for Drawing)应用,选用GPT‑5多模态模型,以盐水蒸发作为探究主题。


研究对象

以香港某小学4个三年级班级,共65名7‑10岁学生为研究对象。学校本身是区域信息技术教育示范校,参与教师具备不同教龄与学科背景。教师仅向学生介绍AI工具基础操作,不专门教授如何解读AI反馈。


干预流程

1.学生连续6天完成盐水蒸发的实物观察;

2.在40分钟课堂内,学生上传第1、3、6天盐水蒸发俯视视角观察手绘绘图;再完成盐水蒸发侧视视角科学模型绘图;

3.Sci‑GiFD系统按照教师共同制定的评分标准,对绘图进行二元判定(达到标准/未达到标准),输出分数、文字、表情、音频多模态反馈,学生可多次拍照上传、迭代修改绘图;

4.收集前测‑后测科学模型绘图、共404份绘图过程数据,同时记录GenAI打分结果。3名学生存在登录异常,最终有效过程数据为62名学生。


数据与分析方式

1.量化数据:前后测绘图得分,使用配对样本t检验分析学生绘图能力变化;以双人人工编码为金标准,计算GenAI打分的准确率、精确率、召回率、F1分数,评估AI评分可靠性;统计学生每一轮绘图尝试的平均分变化。

2.质性数据:选取两名多次迭代绘图、表现出明显成长的学生,追踪绘图版本与对应AI反馈,分析学生对反馈的响应行为。



图片

研究发现

图片


图片

发现一:AI反馈干预后,学生科学

模型绘图能力得到显著提升

配对样本t检验显示,学生盐水蒸发模型绘图得分出现统计学显著提升,中等效应量(Cohen’s d=0.791),详见表1、图2。

水蒸气绘制:干预前仅9%学生可以画出水蒸气,干预后提升至78%;

标签正确书写:干预前仅19%学生正确书写繁体“盐水”“水蒸气”,干预后提升至50%;

箭头表征蒸发方向占比下降:由25%降至3%,推测学生将认知资源集中在水蒸气绘制与文字标签,忽略箭头要素。

图片

表1:学生接触Sci-GiFD后对盐水蒸发科学模型的变化

图片

图2:3Z13的第一次尝试、第二次尝试以及相应的反馈结果

部分学生能够依据AI反馈完成迭代,掌握直线标注、特定图形表征科学现象等绘图规范。典型案例学生3Z13接收反馈后,补齐水滴图形、补充标注线、修正标签,一次迭代就达成全部绘图标准。


图片

发现二:GenAI打分表现不均衡,

存在明显识别短板

以人工编码作为参照基准,详见表2。

1.侧视科学模型绘图:整体表现优异,多数指标大于0.8,该类绘图在模型训练数据中更为常见;

2.第1天、第6天俯视观察绘图,大部分评判标准达到可接受水平;

3.第3天俯视观察绘图识别效果较差。当画面同时出现代表水的空心图形、代表盐的实心图形混合时,AI容易混淆;

4.繁体汉字识别缺陷。模型训练素材以西方资料为主,识别繁体汉字(如“鹽”)容易出错,标签识别的精确率偏低。

这表明多模态GenAI并非完美评判工具,受训练数据、语言类型、学生创造性绘图表达方式制约,会出现误判。

图片

表2:显示Sci-GiFD中GPT-5模型可靠性的参数


图片

发现三:学生可依据AI反馈迭代绘

图,但会受课堂时间、倦怠情绪制约

多数学生完成1‑2次绘图提交,部分学生开展3次以上迭代。第1、3天观察绘图任务中,学生第二次提交作品平均得分显著高于第一次。而第6天观察绘图、侧视模型任务,超过半数学生仅提交1次。主要影响因素在于课堂课时有限需要赶任务及多次绘图带来学习倦怠,详见图3、图4。

图片

图3:在Sci-GiFD应用中,不同尝试次数的学生比例(n=62)

典型案例学生3Z07完成4轮侧视模型迭代,跟随AI提示逐步完善绘图。同时暴露关键风险:受拍照清晰度、拍摄角度影响,AI没有识别学生已经画出的蒸发箭头,依旧提示补充箭头;学生无法辨别AI发生误判,重复增加箭头。低龄儿童缺少甄别AI错误反馈的意识与能力。

图片

图4:3Z07的四次连续尝试及其对应的反馈结果




图片

研究结论

图片


1.当GenAI反馈嵌入真实一手科学观察活动,并且遵循三大反馈设计原则时,Sci‑GiFD应用可以有效辅助三年级学生改进科学观察绘图、科学模型绘图,帮助学生掌握科学图示的符号、标注等表达惯例,可作为教师教学的补充工具,缓解个性化反馈压力。

2.多模态GenAI评估绘图存在能力边界。对经典科学模型识别效果好,对于元素混杂的俯视观察绘图、非拉丁文字识别存在局限,AI反馈不能完全替代教师人工评价。

3.小学生能够理解AI反馈并迭代自己的绘图,但课堂时长、任务倦怠会降低学生迭代修改意愿。低龄学生难以识别AI输出错误,是小学使用AI工具不可忽视的风险点。

4.GenAI的定位是“学习伙伴”,不能直接生成绘图给学生使用。必须将AI反馈建立在学生亲身动手探究基础之上,避免AI取代学生的观察与自主建构。



图片

未来启示

图片


1.坚守探究为本,厘清AI辅助定位。教学中优先保障学生动手实验、自主手绘的科学实践,不能直接复制AI生成图像;AI仅用于提供初步形成性反馈,教师仍承担教学核心职责,处理AI误判,把握学生深层认知问题。

2.适配低龄认知,优化AI反馈设计。面向小学生摒弃大段文字反馈,运用短句、表情、音频等多模态形式;反馈要给出可落地修改指引,避免笼统空泛的评价。

3.培育批判思维,教会学生理性看待AI输出。引导学生掌握上传绘图的拍摄规范,同时建立认知,AI意见仅作参考,有疑问要回归实验现象与教师的专业指导。

4.拓展深化研究,优化本土场景技术方案。扩大研究主题范围检验框架通用性;探索评价标准与学生创造性表达兼顾的提示词;增加长期追踪研究;中文教学场景选用适配中文能力的多模态模型,改善文字识别短板。



图片

结语

图片


生成式AI为解决大班科学课堂个性化反馈难题提供了新的可能性,但它不是实现科学教育提质的“万能解药”。这项研究带给我们最重要的启发,在小学科学课堂引入GenAI工具,核心不是追求AI识别打分的百分百准确,不在于AI技术本身有多强大,而是把更多机会还给孩子,将技术应当服务于科学实践,而不是替代科学实践。