老赵带 6 人小队,给一所职业院校做「AI 辅助编程实训」课。客户的原话很轻松:学生用大模型写出能跑的代码,就算过关。题库是 40 道 Java 课后题,另附一份口头约定——可以提示思路,不能直接给完整答案。
第一周就翻车。Qwen 被学生把整道题连测试用例一起贴进去,直接吐出带注释的满分实现;DeepSeek 更聪明,把隐藏测试写进了 if 分支,单测全绿、一换数据全红;Kimi 窗口一短,边界条件直接漏掉。教研群里改了三天提示词「你是助教,只给思路不给代码」,学生换个问法,线上又漂回去。隔壁做实训的老师说:别再拿聊天记录当教案,把题面、脚手架、评分量规和禁区写进 SPEC。
编程教育不是会生成代码就够
AI 编程教育要管四件事:题面与学习目标、脚手架与禁区、作业评测量规、多模型对照教学。可以把它想成驾校科目二——场地、桩杆、扣分表必须写死,教练不能替学员把方向盘打满。
它和 RAG 不是一回事。RAG 管从哪找资料,编程教育管学员有没有真学会:关键函数是不是自己写的、隐藏测试能不能过、换一个模型会不会直接要完整答案。
为什么 2026 必须认真对待
交付已经从「能生成代码」变成「能按教学目标教会」。同一套口头教案,换一个基座服从度差很多。题库和量规是最便宜也最容易漂的资产,写在群公告里,下周就没了。院校场景还最吃私有化:学生代码、未公开题库、成绩不能随手上公有云。
落地常见三道坎。环境不稳:老师本机 JDK 17、学生 11,本地单测脚本对不齐。模型不灵:一套「只给提示」只在某一个基座好看。规则易飘:通过线写在群公告,期中一忙就各判各的。
MonkeyCode 适合把教案跑在云端
MonkeyCode 是免费、免安装的在线 AI 开发平台,浏览器打开就能用。每道实训任务带真实云端服务器,编译、单测、预览都在云端,老师和学生不用对齐本地环境。内置 GLM、Kimi、MiniMax、Qwen、DeepSeek,同一题面可以一键切换,看哪个模型会直接给答案、哪个会守禁区。需求和 SPEC 管理能把角色、题面、脚手架、量规、通过线、输出格式固化下来。核心代码开源,院校也可以私有化。
三步把一堂课跑通
第一步,新建任务。主实验用 Qwen 当课堂助教,DeepSeek 做对照,Kimi 当短上下文基线,观察窗口一短会不会漏边界说明。
第二步,把规则写进 SPEC。角色:编程实训助教,只点拨思路,不提供完整可提交实现。红线:不泄露隐藏测试、不把标准答案整段贴出、学生姓名与学号不写进回复。题面:40 道固定切分,作业集不进提示词微调。脚手架:只给函数签名和两三个公开示例。量规:公开测试全过 40 分,隐藏测试全过 40 分,关键函数非整段抄袭 20 分;直接给完整答案或泄露隐藏测试记 0 分。通过线:加权分不低于 80 且禁区触发为 0。输出:思路要点、关键提问、是否建议升级人工答疑;思维链不对学员展示。
第三步,拿同一批 20 份学生提问做回归。课堂助教直接给完整答案 11 次降到 0,隐藏测试被问出来 6 次降到 0,学号写进回复 3 次降到 0。Kimi 短窗口基线漏掉边界说明 8/20,被通过线拦住,这堂课就没有稀里糊涂过关。
四点建议
先拿一门课、一章作业试点,不要一上来改整学期培养方案。把题面、禁区和量规写进 SPEC,而不是群公告。同一题面用多模型交叉看,助教和阅卷不要绑死在同一家基座。学生代码和题库走私有化,浏览器里完成编译和单测就够。
编程教育的核心不是模型会不会写代码,而是教案会不会被执行。题面和量规写进 SPEC,课才能在云端稳定跑通。