这段时间连续做了几轮数学建模论文:2024A、2022B,后来又接着做 2026B。题目不同,模型也不同,但做到第三轮时,我发现真正反复消耗时间的事情其实高度相似。
不是“这一问应该用什么算法”这么单一,而是一整条交付链不断冒出同类问题:一个数字到底从哪里来,公式和代码是不是同一个口径,图有没有真的重画,LaTeX 编译成功是不是就代表版面能交,摘要有没有把四问结果说清楚,所谓“改进”“鲁棒”“全局最优”有没有证据,附录和支撑材料能不能复现正文里的结论。
如果每一篇论文都重新提醒 Agent 一遍,这些经验就没有真正留下来。
所以 7 月 18 日,我决定把反复踩过的坑直接写进 math-modeling-paper-writer,让它从一个“会写论文的提示词”变成一套带验收门槛的工作流。
先把别人的 Skill 拆开看,而不是直接装进去
当时我拿到了一套外部数学建模 Skill。里面有不少值得借鉴的东西,例如 decision log、逐小问状态卡、跨阶段一致性检查、模型候选比较和多视角终审。
但它也有一些我不想照搬的做法。
例如用样本论文里的字数、公式数、图表数直接推导硬阈值,或者把“五段摘要”变成固定模板,再或者通过听起来很厉害的模型命名包装创新。这些规则看起来很“自动化”,可一旦把经验统计误当成比赛官方规则,就会把 Agent 带向另一种形式主义。
还有一个很典型的问题:Markdown 或 LaTeX 能编译成 PDF,并不代表 PDF 可以提交。目录不该出现却出现了、页码起点错了、字体被替代、图还是占位框、正文已经超页,这些都可能在“编译成功”之后继续存在。
最后我只吸收那些能改善状态管理和复核的部分,把证据链和交付审计继续当成底线。
我开始把“论文质量”写成可以阻断交付的规则
新版 Skill 最重要的变化不是多了几段写作建议,而是增加了一组硬门槛。
国赛默认版式被明确成可检查的结构:封面第一页,摘要第二页,正文第三页;不生成目录;正文和参考文献控制在规定页数内;附录放在正文之后。高分不能覆盖这些错误。
我又加了一套 100 分内部审稿量表,同时设置 17 个 hard gates。它们的目的不是“预测最后能拿几等奖”,而是在 Agent 说“可以交了”之前逼它回答几个更基本的问题:
- 每一问有没有真的回答;
- 关键数字有没有可追溯证据;
- 结果有没有独立复算;
- 图表是不是正式输出而不是占位;
- PDF 的页面、字体、引用和附件结构是否满足提交要求;
- 创新措辞有没有公式、代码或实验支撑。
我尤其想压住一种很常见的 AI 写作习惯:为了让论文显得厉害,随手加上“动态”“鲁棒”“自适应”“改进”“全局最优”。新版规则不禁止这些词,但每一个修饰都要对应到实际机制或实验。没有证据,就删掉。
让审计脚本检查那些人最容易漏掉的地方
仅把规则写进 SKILL.md 还不够。Agent 很容易“知道规则”,然后在真正交付时忘掉其中两条。
所以这轮还把机器验收补了起来:内部评分脚本负责检查评分卡和阻断项,PDF 审计脚本负责检查页面结构、字体、缺图、引用、溢出和交付布局。
我还特意做了一份带问题的模拟论文,让独立审稿实例使用新版 Skill 去判断。它成功拦下了封面与摘要页错位、目录、页码重置、正文超页,以及没有证据的“全局最优”和包装式创新。
对我来说,这一步比“Agent 写出来的语言更像论文”重要得多。它证明 Skill 不只是记住一套偏好,而是真的能在错误到达提交环节之前挡住它。
7 月 21 日,终于有了一次完整的实战回归
几天后做 2026B 时,这套流程真正跑了一遍。
MATLAB R2026a 最终生成了 11 组正式图,既有矢量 PDF,也有高分辨率 PNG。中间还碰到了几个很真实的兼容性问题:图形属性在新版 MATLAB 里不接受、轨迹 CSV 里的退出状态不是普通坐标、到达后的库存用特殊符号表示。每一次都不是把断言关掉,而是把“数据语义”和“绘图层容错”分开处理。
论文随后经过 XeLaTeX 双遍编译、图表逐项检查、PDF 页面和字体审计、数字证据核对,以及支撑材料打包。最开始那个“缺图时也能静默编译占位框”的宏也被去掉了:少一张正式图就应该直接构建失败,而不是生成一份看起来完整的 PDF。
这轮让我第一次觉得,这个 Skill 已经不只是“写作模板”。它开始更像一个交付 Agent:知道什么时候写,什么时候查证,什么时候调用 MATLAB,什么时候必须拒绝继续包装一个未经验证的结论。
Skill 真正压缩的是犯错历史
以前我对 Agent Skill 的理解比较像“把好用的提示词保存下来”。这几轮做完后,我觉得更准确的定义应该是:把重复出现的判断、失败和验收动作压缩成可复用的流程。
一篇优秀论文不会因为装了一个 Skill 自动出现。模型本身仍然要对,代码仍然要跑,结果仍然要解释。但 Skill 可以让很多本来靠记忆维持的工程纪律变成默认动作。
以后再遇到新的数学建模题,我希望自己少重复一次“为什么编译成功却不能交”,少漏一次证据来源,也少写一句没有根据的漂亮话。
如果这个目标能做到,那这套 Skill 才算真的有价值。
Comments
评论