用 AI 改作文,最容易被忽略的不是"准不准",而是分数本身不可信。
有几个已经公开的实测数据:
有记者拿 18 篇作文(小学 3–6 年级、初中 7–8 年级)在 6 款热门 AI 批改产品上跑了一遍,
同一篇作文跨平台的最高分和最低分,普遍差 8–15 分,部分超过 20 分。
更麻烦的是时间维度:同一平台,上午上传判"一类文",下午上传同一篇判"良",
分差最高 10 分,而原文一个字都没改(人民网 2026 年 7 月)。
也就是说:同一个学生的同一篇作文,交给不同的工具、不同的时间,能拿到完全不同的分数。
2025 年 11 月教育部发布的《教师生成式人工智能应用指引(第一版)》里写得很明确:
不得将生成式人工智能对作文、艺术作品、开放性作业等的自动批改结果, 作为学生最终评价予以直接使用。
还有一条要求:须对生成内容进行审核和校正,并把发现的问题反馈给技术提供方。
所以"直接用 AI 给的分数"这件事,现在同时踩两条线:一条是准确性,一条是规范性。
能用,而且我觉得很值得用。关键是把"分数"和"批改内容"分开看。
我的做法是三件事:
① 分数只作参考,不作结论
我把 AI 的分当成"第三方视角",不是我的分。真要给分,我自己定。
它的分最多帮我确认一下"这篇确实偏弱"或"这篇明显不错"。
② 真正有用的是维度排序和错点清单
AI 最有价值的输出不是那个数字,而是:
这几样东西我可以逐条核对——核对完就变成我自己的判断。而那个 13 分还是 15 分,
我核对不了,也没必要核对。
③ 用自己的旧作文把尺度锚回来
这一步我觉得最关键,也是最少人做的。
做法:翻出 10 篇你已经批过、有你自己给分的旧作文,先让 AI 各改一遍,
看看它给的分和你的分差多少、差在哪个维度。
这 10 篇就是你的"校准样本"。跑完你会发现它的系统性偏差——
比如它可能对"内容充实但语言一般"的作文给分偏高,对"语言干净但内容单薄"的给分偏低。
知道偏差之后,你再看它给的新分数,心里就有底了。
⚠️ 注意:你上传的旧作文里不要带学生姓名。学号或代号就够了。
《指引》要求老师审核并留痕。我的做法很简单:
在作文批改记录里加一栏"教师复核",写一句我改了什么。比如:
| 学生 | AI 分 | 我的分 | 我改了什么 |
|---|---|---|---|
| A | 13 | 11 | AI 没发现时态错了三处 |
| B | 9 | 12 | AI 把"内容少"判成"语言差",其实是词数不够 |
这一栏既满足留痕要求,也是你以后判断"这个工具还值不值得用"的依据。
用一段时间之后你会发现某些错误反复出现——那就是该反馈给工具方的东西。
AI 批改的价值在于"它帮你把每篇都读了一遍",不在于"它给了一个分"。
把这一点想清楚,用起来就不别扭了——分数是我给的,它只是我的一个帮手。
出题、出卷、作文批改的提示词,整理成了 8 条免费领取:
→ 免费资料
网站上放的都是单篇和样板,一直免费。成套课件、可编辑源文件和持续更新,放在下面这几个地方。
网站上放的是单篇和样板,一直免费。成套课件、可编辑源文件和持续更新,放在下面这几个地方。
每周发一篇教学随笔和课件预览。公众号里回复关键词能领几份免费资料包——先看看我的东西对不对路。
扫码打开长按二维码识别买断制的小册与连载,写我怎么把 AI 用进日常备课和批改。适合先花小钱看看我的思路对不对路。已更新 17 篇,后续更新免费看。
扫码打开长按二维码识别网站上的课件和教案继续免费,不会收回。付费的是「成套 + 可编辑 + 持续更新」那一部分。
公众号里回复关键词能领免费资料包;有问题也可以在公众号留言。