满执行病:写进提示词的规矩,都会变成新的指纹

2026 年 7 月的仿写实验里,我们给模型下过四批「写得更像人」的指令:金句限额、允许写废话、口述腔、数字别太精确。四批全部被评委抓住,抓法一模一样——模型把每条规矩执行得十全十美,而「十全十美」本身就是指纹。这篇讲清楚这个结构性死角:为什么修复指令本身是指纹源,为什么定向修复两轮后必须停手,以及唯一的出路为什么在选型不在提示词。

暖纸底插画:一排士兵般整齐立正的钢笔,每支笔尖都滴着一模一样的墨点,旁边一支人类的笔歪倒着,墨渍洇开

7 月 26 日凌晨两点,我们给写作模型下发了六条新纪律:金句每篇最多一句、三分之一的段落要平平收尾、 必须写一些对情节没用的细节、对话里要有废话。这是照着评委上一轮的判词改的,判词说机器稿 「细节全在干活,真人连载的细节一半在摸鱼」。我们想,那就让它摸鱼。

几个小时后新一轮盲评回来,识破率还是 100%。这次的判词换了个方向:「毛边为毛边而生,密度超过情节需要」, 「器物一律配数量、年份或来历,像资料卡按行贴」。

模型没有违抗任何一条纪律。它把六条全执行了,执行得十全十美。问题就出在这里。

同一个死法,我们撞了四次

这个现象后来有了名字:满执行病。给模型的任何风格条款,它都会执行到位,而「执行到位」这件事本身 有统计学形状。整场实验里它以四种形态复现,一次比一次隐蔽。

第一次是上面那批「摸鱼细节」:配额被满格兑现,每段一个,间距均匀。第二次是口述腔,我们教模型写 「先口述后落笔」的连载腔,可以讲岔、可以补叙。它学会了,然后把「先前忘了说」「扯远了」这两句 口述标记在不同篇目里逐字复用,评委把五篇摆在一起,一眼看到同一个手势出现在五个地方。

第三次最典型。我们观察到真人作者写数字经常偷懒,就下令「数字别太精确」。结果六段里五段出现了 同款含糊:「五十还是五十五,没记清」。评委的原话值得抄在这里:真人偶尔懒,机器是每段都表演懒。 而且这条指令连方向都错了,真人网文作者对数字恰恰是记账控,《全职高手》里敢用整段写 「目前一个70级的满级角色,做完常规的任务,可以拥有4000个技能点」,信息密度低得理直气壮。 我们让模型学「含糊」,等于让它避开真人真正的写法。

第四次是元层面的:对同一批稿子下同一条修复指令,哪怕话术逐篇换着写,各篇还是会把它执行成 同一个手势,在整批层面现形。修复指令本身成了指纹源。

为什么这是结构性的,不是提示词写得不够好

写到这里你可能想:把条款写得再模糊一点、再概率化一点呢?我们试了。「三分之一的段落平收」改成 「大部分段落不需要漂亮的收尾」,执行结果依然是一条肉眼可辨的均匀分布。

原因不复杂。模型被训练成忠实执行指令的样子,忠实的意思是:无遗漏、无偏废、全文覆盖。 人类作者遵守写作纪律的方式完全不同,想起来就守,写嗨了就忘,一章严一章松。 这种「执行度的不均匀」没法用指令下达,因为「请不均匀地执行」也是一条会被均匀执行的指令。

这也解释了为什么按评委判词做定向修复是打地鼠。我们打了两轮:第一轮修掉「拒绝精确」手势, 第二轮修掉节拍化收口,识破率纹丝不动,只是判词越来越抽象。第三轮我们停手了,不是修好了, 是确认了再修下去只会把稿子修得更僵。

出路在选型,不在工序

实验第 11 轮换了打法:同一份任务书,发给六家模型写手。前十轮所有稿子都被守门员全数识破, 这一轮有三段漏网了。复盘胜因,三段的共同点不是哪条工序执行得好,而是各自带着真实的能力缺陷: 一家写出了真错字,评委引为「错别字懒得改」的活人证据;一家有同音别字;一家的转折词 全篇扎堆用「可」,像个真人的口癖。

这些错不是指令要求的,是模型中文能力的自然产物。它们恰好落在「零失手」判据的外侧, 因为它们真的是失手。你让一个不犯错的模型去犯错,它会犯得很整齐; 而一个天生会犯错的模型,错得毫无规律,那才是指令模仿不出来的东西。

所以「写得像人」这件事,工序的天花板比想象中低,选型的权重比想象中高。这个结论对我们自己的 产线是有真金白银后果的:现在批量写作任务的修复预算封顶两轮,第三轮的钱拿去换模型; 同批稿子的修复指令必须逐篇不同方向;条款一律写成概率倾向,并且接受它被执行得依然太整齐的现实。

完整的实验过程、六条人类判据和评委判词原文,在《十个 AI 评委都被骗过了》这篇长文里。 想亲手试试自己的眼力,可以去「AI 还是真人?」盲测页, 里面有一段机器文本,我们的守门员对它的置信只有 55。

常见问题

为什么给 AI 下「写得随意点」的指令没用?

因为模型会把「随意」执行得整整齐齐。我们实测:要求「允许写没用的细节」,它就每段配一个没用的细节,密度均匀得像配置出来的;要求「数字别太精确」,六段里五段在同一个位置用同一种口吻含糊。评委的判词是「真人偶尔懒,机器是每段都表演懒」。指令能改变它写什么,改不了它执行指令的方式,而执行方式的均匀性正是检测器抓的东西。

定向修复 AI 味,修几轮合适?

我们的实测边界是两轮。每一轮按评委判词修,都能消灭上一轮的具体指纹,但归因会向更抽象的层面退一步:套话没了抓腔调,腔调没了抓节拍,节拍没了抓「零失手」。识破率从头到尾没降过。更糟的是,对同一批稿子下同一条修复指令,各篇会把它执行成同一个手势,在整批层面现形。所以修复指令只能逐篇给不同方向,且两轮后必须停手收货。

「执行质量过好」这条指纹能修掉吗?

修不掉,这是我们十六轮实验里唯一从头站到尾的判据。不加错,是零失手;故意加错,错得太安全,像做旧。守门员最后的判词是「八百字里挑不出一处失手,恰恰是最大的破绽」。真正有效的做法是换一个天生会犯错的模型——真实能力缺陷产生的错字和口癖,是指令模仿不出来的。

满执行病:你写进提示词的每条规矩,都会变成新的 AI 指纹 · Foreverse · 新梦