CRASE5 研究报告总结
一、引言
自 2022 年 10 月起,ACT 开始在其国际项目 ACT 写作考试中使用自动化评分引擎 CRASE® 生成其中一份评分。此后,CRASE® 已被应用于 ACT 区域(2023 年春季)、ACT 州级等更多项目。为支持该决策,ACT 建立了研究议程,通过多项概念验证研究评估 CRASE® 评分与人工评分的准确性。自 CRASE® 开始评分 ACT 写作以来,ACT 希望通过添加新功能(如自动检测离题内容、自动检测不当内容、利用现代模型拟合方法等)来扩展其处理能力。本报告旨在使用 CRASE5 生成的新通用评分模型复制 CRASE+ 技术报告中的研究,并评估 CRASE5 模型的性能。
二、背景:自动化评分和 CRASE5
自动化评分(或自动化作文评分)是指使用计算机算法模拟人工评分行为。评分算法称为引擎,而准备评分算法以投入运营称为训练引擎。CRASE®(即 Constructed Response Automated Scoring Engine)于 2007 年为美国一州的总结性评估项目创建。CRASE5 是 CRASE 软件的第五个主要版本,提供了更大的灵活性来开发评分模型。本报告假设读者对自动化评分概念有基本了解,并推荐相关资源。
三、引擎训练和验证方法
数据
CRASE 引擎的训练需要人工评分的作文数据,这些数据应在真实测试条件下收集,并代表不同写作任务的样本。本报告使用的数据来自 2020 年 9 月和 10 月的 ACT 国际考试以及 2021 年春季的州级和区域考试。训练和盲测验证样本分别包含 8,862 篇和 5,128 篇作文。
训练和验证样本
通用评分模型的目标是使用来自多个写作任务的作文数据构建模型,以便在类似任务的作文数据上使用。训练样本用于确定最佳拟合模型,而盲测验证样本用于通过模拟新作文的运营实践来评估模型。
引擎训练
CRASE5 引擎的训练方式与 CRASE+ 相同,使用默认的 39 个写作特征。ACT 写作的记录分数定义如下:如果两位评分者对同一篇作文的同一领域分配相同的分数,则记录分数为两位评分者分数的总和;如果两位评分者分配的分数相差不超过 1 分,则记录分数为两位评分者分数的总和;如果两位评分者分配的分数相差超过 1 分,则由第三位评分者进行解决阅读。
引擎评估
自动化评分模型使用盲测验证样本的分布指标和协议指标进行评估。分布指标包括评分者 1、评分者 2 和 CRASE5 的分数点分布、均值和标准差。协议指标包括评分者间信度(即两位独立评分者之间的一致程度)。评估指标包括标准化均值差异(SMD)、精确协议率、邻近协议率、kappa 和二次加权 kappa(QWK)。
四、引擎训练和验证结果
基线结果(1-6 分制)
CRASE5 模型的评分结果与人工评分结果相似。所有四个领域的 R1-CRASE5 和 R2-CRASE5 一致率均优于 R1-R2 一致率。所有但一个 QWK 超过了 0.70 的阈值,所有但一个精确协议率超过了 60% 的阈值。
基线结果(2-12 分制)
CRASE5 模型的评分结果与人工评分结果相似。所有四个领域的 SR-CRASE5 QWK 均超过 0.88,表明模型具有较高的评分准确性。
五、子群分析
方法
子群分析旨在评估不同子群(如性别、西班牙裔身份和种族/民族)的评分差异。本报告采用 ETS 风格分析,计算了不同子群的评分指标。
结果
对于 1-6 分制和 2-12 分制,所有性别和西班牙裔/非西班牙裔子群指标均符合预期,除少数例外。种族/民族子群指标中,少数情况下未达到预期,但总体差异较小。
六、自动检测条件代码
CRASE5 具有自动分配条件代码的功能,以识别无效或难以评分的作文。这些条件代码包括空白、作废、无效、离题、无法辨认、非英语、不当内容和踢出。CRASE5 通过一系列检查来识别这些条件代码,并在必要时将作文发送给人工评分者或测试管理员进行审查。
总结
CRASE5 引擎的评分结果与人工评分结果相似,并在子群分析中表现出较小的差异。CRASE5 的自动检测功能能够有效识别无效或难以评分的作文,提高了评分的准确性和效率。这些结果表明,CRASE5 可以作为人工评分的有效补充,并有助于提高大规模考试的评分效率和质量。