今天早上七点十三分,白话AI的自动任务跑完了。三个信息源都抓到了内容,IT之家有六十条,少数派十条,Solidot 二十条。程序随后写出五篇文章,检查器全部放行,代码提交成功,网站也能打开。

把文章点开,问题才露出来。五篇都没有采用刚抓到的资讯,来源记录全部写着 fallback。正文最短只有一百二十个汉字,最长也只有一百七十个。五篇摘要还是同一句话。发布环节又触发了两次生产部署,相隔两秒。

每一个步骤单看都亮着绿灯,合在一起却交不出能读的文章。

这件小事很适合解释 AI 陪跑。陪跑的人不能只教你打开一个模型,也不能交一份提示词就离场。他要跟着一项真实工作走到最后,看到结果落在哪里,错误又由谁收拾。

先把任务说清楚

白话AI每天写文章,这句话太宽。程序可以把五个 Markdown 文件放进目录,也可以把五个页面送上网,两件事都满足“有文章”。读者要的是另一种结果。他点开以后能读到具体材料,知道信息从哪来,也能看懂作者为何下这个判断。

于是任务要继续往下写。每天五篇,每篇至少有五条可核验材料,正文达到可完整说明问题的长度,摘要不能重复。当天找不到材料,程序应当停下来报错。它不能拿旧模板补位,更不能把空稿送上生产环境。

陪跑在这里做的第一件事,是把一句愿望改成可以验收的工作。

绿灯也要有人追问

原来的文字检查器确实做了事。它能找到一些常见的模型腔,也能拦住禁用句式。它没有能力判断文章有没有新材料,更不知道五篇文章用了同一个摘要。检查器完成了自己的工作,只是验收条件写少了。

美国国家标准与技术研究院发布的 AI 风险管理框架把工作分成治理、理解场景、衡量风险和处置风险几个相互连接的部分。这个框架供组织自愿采用,重点在于把可信要求放进 AI 产品的设计、使用和评估。放到一个小网站上,道理仍然成立。谁批准发布,怎样发现短文,发现后如何撤回,都要提前写进流程。

陪跑的人应该继续追问。五篇是否都来自当天材料,正文有没有重复,链接能否访问,线上版本是否和刚提交的代码一致。少问一层,绿色状态就可能只说明命令没有报错。

陪到人能接手为止

一套流程第一次跑通时,最容易让人高兴。麻烦随后才来。来源会失效,模型会写偏,部署会重复,网站也可能拿到旧缓存。每次都等外部顾问回来救火,这套流程仍然没有交到企业手里。

合格的陪跑需要留下几样能继续使用的东西。任务规则要放进项目,质量检查要能在本地重复执行,失败状态要写清原因。负责的人还得知道哪里可以自动修,哪里必须停下来确认事实。交接完成以后,企业自己能看懂当天报告,也能在文章不合格时阻止发布。

白话AI这次修复会把 Codex 放进每日任务。它负责研究和写作,human-writing 负责约束中文表达,程序负责检查数量、长度、重复度和来源。Vercel只接收通过检查的提交。哪一步没过,当天就不发。

这才是陪跑该陪的那段路。工具只是其中一站。工作是否完成,要看线上结果,也要看团队能不能接手。

参考资料