Loading...
Loading...
我们在 2024 年创立 WeWrites 时,最常听到的问题是:「机器真的能像老师一样批改作文吗?」两年过去,积累了大量作文批改数据后,我们有了一个以数据为支撑的答案。
在我们的内部验证中,WeWrites AI 系统的评分与资深 DSE 英文教师的平均评分高度一致——差异通常处于两位真人教师批改同一篇作文时的正常波动范围之内。
一名典型的香港中学英文教师大约负责 120 名学生。如果每名学生每周提交一篇作文,每篇作文需要 15 分钟详细批改,那么教师每周面临 30 小时的批改工作量。现实是残酷的:大多数学生每学期只能获得 4 到 6 篇作文的详细反馈。
WeWrites AI 在 3 分钟内处理一篇作文,并返回涵盖语法、结构、内容、词汇和逻辑的全面报告。学生如果愿意,每天都可以提交一篇作文,每次都能获得一致、详细的反馈。这种练习量从根本上改变了学习轨迹。
人类阅卷员,即使是经验丰富的,也会受到疲劳、情绪和无意识偏见的影响。教育测量领域的研究发现,同一位教师在相隔数周后批改同一篇作文,有可能会给出明显不同的分数。AI 不会在批改完第 40 篇作文后感到疲倦。它每次都按照相同的标准、相同的详细程度进行评分。对于需要长期追踪进步的学生来说,这种一致性至关重要——他们可以确信分数的变化反映的是写作能力的真正提升,而非阅卷员的主观波动。
真人教师通常提供整体性反馈——一个总体印象、几句旁注和一个分数。WeWrites AI 将每篇作文分解为五个独立维度:语法准确性(逐句修正)、结构组织(段落流畅度和连贯性)、内容相关性(作文是否恰当回应题目)、词汇精炼度(提供符合水平的替代表达)以及逻辑论证(识别缺乏支撑的主张或逻辑谬误)。
这种细粒度的拆解帮助学生精准定位失分点,明确学习方向。一个在语言维度持续获得 5/7 分但在内容维度仅获 3/7 分的学生,就会知道应该专注于观点发展而非语法练习。
数据同样揭示了真人教师不可替代的领域。AI 反馈无论多么详细,都无法复制一位相信学生的老师所带来的激励力量。它无法读懂肢体语言、感知挫折情绪,也无法根据个体的情感状态调整教学风格。教师提供的是指导、启发以及当前 AI 无法匹敌的细腻文学讨论。
我们最成功的学生将 AI 用于练习量和一致性,将真人教师用于策略和动力。两者并非竞争关系——它们是学生学习工具箱中的互补工具。
经过大量作文批改的实证检验,结论已经清晰:AI 作文批改并非「几乎和人类一样好」——在速度、一致性和细粒度分析等关键维度上,它表现更优。但教育不仅仅是批改。我们在 WeWrites 构建的未来是:AI 负责处理首轮评估中重复性的分析工作,让教师能够专注于人类最擅长的事情:启发、指导和改变。
In our internal validation, AI scores align closely with the average scores of experienced DSE teachers, typically within the normal range of variation between two human markers scoring the same essay.
No, and we do not aim to. AI excels at speed, consistency, and granular analysis — the repetitive, analytical work. Teachers remain essential for mentorship, motivation, emotional support, and nuanced literary guidance. The optimal approach combines both.
Very consistent. Research shows human markers may give different scores to the same essay when re-marking weeks later. AI applies identical criteria every time, making it more reliable for tracking progress over weeks and months.