研报主要内容与关键数据
一、研究背景与目的
- 研究时间:2021年和2022年
- 研究团队:CRASE+®研究团队
- 研究目标:评估CRASE+自动化评分引擎在在线写作测试中的可行性,比较其评分准确性与人工评分结果。
二、方法与数据
- 数据来源:三个来源的作文样本,包括ACT国际考试(2020年9月和10月)、州级和区级考试(2021年春季)。
- 数据量:约14,000篇作文,其中不足1%的作文因条件代码被排除。
- 作文题目:共27个作文题目,主要来自州级和区级考试(占66.8%),其次是国际考试(占19.1%)。
三、评分分布与标准
- 评分分布:各领域评分分布呈正态分布,大多数学生得分集中在3至4分之间。
- 不同考试类型:国际考试的学生得分普遍高于州级和区级考试的学生,这可能是因为国际考试是自愿参加的,而州级和区级考试是强制参加的。
四、性别与种族分布
- 性别:各考试类型的性别分布相对一致。
- 种族/族裔:国际考试的学生中亚洲学生比例较高;而州级和区级考试的学生则更符合2020年美国人口普查的数据分布。
结论
为了确保自动化评分模型能够适应不同类型的考试人群,研究过程中需要包含平衡的样本,以代表整个测试人群。这些数据为理解CRASE+的训练过程和评分结果提供了重要依据。