数字时代,计算思维早已不是计算机学科的 “专属能力”,它和数据分析、科学实验、模型建构深度绑定,是科学教师必备的核心素养。但现实难题摆在研究者面前:我们该拿什么工具,客观测评理科师范生的计算思维?过去大多依赖自我报告问卷,容易出现 “自我感觉良好,但实际能力不足” 的偏差;改编中小学生试题又不符合职前科学教师的专业场景。
这篇来自匈牙利塞格德大学与印尼国立三宝垄大学合作的研究,立足印尼职前科学教师群体,开发一套30 题计算机化计算思维测评工具,经过完整信效度检验,同时对经典 ISTE 四维计算思维框架提出新的实证思考,给全球教师教育领域提供可借鉴的测评方案。

研究背景

21 世纪的教育对计算思维高度重视,ISTE 提出的经典框架将计算思维拆解为分解、模式识别、抽象、算法思维四大维度,被大量教师教育课程采纳。
但现有研究存在显著短板:
①测评工具局限:大量研究采用自评问卷,测得更多是自我效能感而非真实能力;编程类测评又容易混淆 “编程技能” 和 “计算思维”,不适合非计算机方向师范生;直接挪用中小学生 Bebras、CTt 测试,缺少针对科学教育场景的本土化重构,构念效度证据不足 。
②研究对象失衡:计算思维教师教育研究大多聚焦计算机师范生,针对物理、生物、化学方向的职前科学教师的测评工具非常稀缺,印尼本土更是没有经过严格验证的专用测评试卷 。
③理论构念待验证:虽然广泛使用 ISTE 四维模型,但很少通过验证性因子分析,检验这套四维框架在职前科学教师样本中是否真的可以实证区分开 。
职前科学教师有其特殊性:他们需要在科学探究和教学实践双重场景下运用计算思维,因此亟需一套贴合科学教学情境、信效度完备的认知成就测试工具 。

研究设计

(一)样本
研究采用便利抽样,一共纳入368 名印尼职前科学师范生,涵盖大一到大四,平均年龄 20.40 岁(SD=1.17);其中男生 64 人,女生 304 人 (P3)。

(二)工具开发思路:证据中心设计 ECD
研究者使用证据中心设计(ECD)开发测试,完整走完域分析、域建模、概念评估框架、测评实施、测评交付五层流程,所有题目设置模拟科学、教学真实情境,不需要高深专业科学知识,重点测查认知能力,题型包含多选、匹配、拖拽排序、简答等计算机作答题型,依托 eDia 线上测评平台施测,作答限时 60 分钟,计分采用 0‑1 二分计分(答对得 1 分,答错 0 分)。
最初产出 35 道题,经过 6 位科学教育专家评审内容效度,再根据项目总相关剔除 5 道区分度不佳题目,最终版本为30 题,覆盖分解、模式识别、抽象、算法思维四个维度 。

(三)数据分析方法
1. 内容效度:计算 I‑CVI 内容效度指数,6 位领域专家评审;
2. 信度:Cronbach’s α 系数、校正项目总分相关;
3. 结构效度:Mplus 做验证性因子分析 CFA,对比一维、四维、三维模型,1000 次 Bootstrap 检验模型稳定性;
4. 项目‑被试匹配:Rasch 分析,Wright 题人图、项目特征曲线 ICC、测试信息函数 TIF 评估题目难度与被试能力匹配度。
研究设置 4 个核心研究问题:检验内容效度、检验信度、比较不同因子模型、检验题目难度与被试能力适配情况。

研究发现

1. 内容效度良好
全部题目的项目水平内容效度指数I‑CVI 介于 0.83‑1.00,高于 0.78 的合格阈值,专家定性反馈确认题目可以有效测查计算思维各维度,部分题目根据专家建议修改语言表述、作答指令、本土化人名等内容。

2. 信度表现优秀
30题最终版本整体Cronbach’s α=0.885,属于高信度;各分维度信度:分解 0.742,模式识别0.703,抽象0.728,算法思维 0.850。

3. 结构效度:四维可行,但三维模型更简约
研究对比了一维、四维、三维的 CFA 模型拟合结果:

(1)一维模型拟合很差,说明计算思维不是单一整体,是多维能力;
(2)原始四维模型经过残差协方差修正后,拟合达标。
(3)但数据发现:模式识别与抽象两个潜变量相关高达 r=0.978,二者高度重叠。于是研究者把二者合并为 “模式抽象”,构建三维模型:分解、模式抽象、算法思维;修正后三维模型RMSEA=0.068,CFI=0.912,TLI=0.903,同样达到良好拟合。
嵌套模型卡方差异检验显示:四维和三维模型之间没有统计学显著差异(Δχ²=4.68,Δdf=3,p=0.196);基于简约原则,研究推荐使用三维模型解释职前科学教师计算思维结构。


三维模型组合信度CR全部 > 0.86,达到理想标准;虽然分解、模式抽象的 AVE 略低于0.5,但是符合新开发工具可接受标准(CR>0.6 即可),收敛效度达标 。

4.Rasch 分析:题目难度适配师范生能力
题人Wright地图显示,题目难度分布‑2~+2,可以覆盖被试能力范围。
三个维度难度特征有意思:
(1)分解:集中低‑中等能力区间;
(2)模式抽象:难度分布居中,围绕被试平均能力;
(3)算法思维是最难维度,部分题目需要很高能力(θ≈+2.0)才有 50% 正确率,大量职前科学教师在此维度表现薄弱 。



Rasch的 EAP/PV 信度:分解 0.767,模式抽象 0.835,算法思维 0.798,各维度测量一致性理想 。

研究结论

1. 这套 30 题计算机化测评工具拥有可靠内容效度、结构效度、高信度,题目难度适配职前科学教师,适合用来测评理科师范生计算思维水平。
2. ISTE 经典四维模型在职前科学教师样本数据成立;但模式识别与抽象高度耦合,可以合并为 “模式抽象”,形成更简约的三维模型(分解‑模式抽象‑算法思维)。研究者解释:在科学学习情境中,识别规律和抽象简化概念本就是连续认知过程,科学教育场景下二者很难完全割裂开来。
3. 测评结果提示:职前科学教师普遍短板在算法思维维度,是教师教育课程需要补强的重点方向。
研究同时坦诚局限性:样本是便利抽样、没有做跨组不变性检验、CFA 事后增加残差协方差、缺少独立样本交叉验证,后续需要更多研究复现这个三维结构 。

为什么该理论模型更有效?

1. 跳出自评问卷与编程测评的弊端:属于认知成就测试,测真实解题能力,不是主观自我评估;题目不需要编程,避免把计算思维等同于代码编写,适配理科师范生群体。
2. 情境专门面向科学教师教育:不是简单照搬中小学生 Bebras、CTt 测试,任务大量模拟科学实验数据分析、教学场景,贴合科学教师未来工作,实现任务再情境化,而不是直接复用其他学段工具 。
3. 完整全套心理测量学证据链:同时报告内容效度、专家评审、CFA 结构效度、Rasch 项目分析;多数旧工具只报告 Cronbach’s α,缺少构念效度证据,本研究填补这一块缺口。
4. 带来理论新启发:实证发现科学教师场景下模式识别、抽象高度相关,对广为使用的 ISTE 四维框架提出场景化反思,不只是开发工具,也反哺计算思维理论建构 。

给教师的启示

1. 在设计职前科学教师计算思维课程时,不必教条地严格割裂 “模式识别” 和 “抽象” 两个训练环节。科学场景中,发现数据规律、提炼模型概念本就是连贯思维链条,可以整合设计教学任务。
2. 重点补强算法思维训练:研究发现算法思维是师范生最大短板。传统理科教学多是 “给实验步骤”,很少训练学生自主设计、优化步骤;课程中要增加 “从零设计流程、寻找最优步骤” 类任务,而不只是分析现成实验流程 。
3. 测评选择上,谨慎使用自评量表评估计算思维能力;条件允许优先采用客观认知测试;这套工具可以翻译、跨文化修订,用于国内职前科学教师测评研究。
4. 计算思维不是信息科技课专属。日常科学课堂:把复杂问题拆解(分解)、从实验数据找规律(模式识别)、忽略无关变量提炼模型(抽象)、设计实验操作流程(算法思维),都是计算思维落地的载体。
5. 注意区分:学生自我报告 “我会计算思维” 不等于真实掌握,需要设计任务、客观观察学生问题解决过程。
6. 教学中关注学生算法思维短板:多给机会,让学生自主设计实验步骤、优化方案,而不是完全照着课本既定步骤完成实验。

结语

计算思维是我国素养导向科学教育改革中,教师必备的专业素养。当前国内职前科学教师的计算思维评估,较多依赖主观问卷,缺少适配理科场景、经过严谨实证检验的客观测评工具。
这项海外研究带来有益启示:计算思维框架不可机械套用,在科学探究情境中,模式识别与抽象高度交融,三维模型更契合真实认知规律,同时要重视师范生算法思维的能力短板。
但该工具根植印尼本土背景,无法直接拿来即用。立足我国国情,我们需要结合课标与师资培养现状,做好测评工具的本土化修订验证。教学上跳出理论说教,依托实验、教学设计等真实任务锤炼思维,以评价反哺培养,夯实科学教师高阶思维根基,助力学生核心素养发展。




