多所高校这学期试点用 AI 助教批改作业、写反馈,并且明确这部分计入平时成绩。效率是真的上来了,但评论区一句"机器打分算数吗"把旧问题又掀开了。我的判断:争议不在 AI 批得准不准,而在我们一直没说清——分数到底证明什么。
事实摆出来:一门两百人的课,助教以前改一轮作业要一周,现在 AI 当天出初评加润色建议,老师只复核争议项。学校省下的是人力,学生拿到的是"即时反馈"——这点没人反对。
值得想深一层的是公平性。AI 批改对表达规范、结构完整的学生更友好,对思路野、写得跳的学生可能更苛刻;更关键的,是它默认了一套"标准答案的写法"。当评分尺度悄悄变成模型的偏好,那些本来就被忽视的表达方式,会被系统性压低。这不是技术 bug,是我们在用工具回避一个本该讨论的教育决策。
对几类人的影响很现实。学生:别再把 AI 反馈当最终裁决,它给的是参考,复核和申诉权得攥在自己手里。老师:AI 接管了重复劳动,你该把时间花在"为什么扣这分"的解释上,那才是教学。家长:与其怕"机器不公",不如关心学校有没有留出人工复核通道。
教高数的陈老师跟我聊过他的做法:AI 先标出错题和常见误区,他再挑三成当面讲,学生投诉量反而降了,"因为反馈快了,疑问不过夜"。他说了句实在话——学生反感的从来不是 AI,是"没人管的 AI 决定"。
关心这个方向的:可以看看本站收录的 Kimi、元宝、智谱这类长文本模型怎么帮你整理笔记和复盘错题,但记住它们是辅助,决定权在人。观察指标很简单——你们学校有没有公示"AI 评分占多少、谁复核"。
技术把批改变快了,公平这件事却慢不得,它得有人拍板,而不能只交给模型。