「给它原文让它模仿着写」,学界研究两年的答案是什么

把原著贴给 AI 让它模仿文风续写,写出来还是 AI 腔,这事是不是永远做不到?我们通读了 2024 到 2026 年关于风格模仿的论文,和自己的续写实验对了账:用词层面的像现在就能做到,续写恰好是已知最有利的任务形态(作者验证器下 99.9% 风格一致);句式节奏靠提示词救不动,但采样和微调路径已被验证;「读起来就是同一个人」目前没有公开方法稳定做到,连评价它的裁判都还没有。

宣纸上一道狂放的手写笔画,下方描图纸上是机器临摹出的完全均匀的波浪线,旁边一枚朱红印章

「我把原著整段贴给它了,写出来还是那股 AI 腔。是我提示词没写对,还是这事永远做不到?」

这个问题我们被问过很多次,自己也一直在问。过去一年我们跑了一堆续写实验:五档上下文对照、二十轮连续续写的漂移链、 九个模型两种文体的双盲横评。数据在手上,但一直缺一块拼图:学术界怎么看这件事? 于是这个月把 2024 到 2026 年风格模仿方向的论文系统读了一遍,和自己的实验数据对账。 这篇是对账的结果。

先把结论放前面。「写得像」不是一件事,是三件事:用词像,现在就能做到; 句式节奏像,提示词救不动,但已有验证过的路径;「读起来就是同一个人写的」, 目前没有任何公开方法稳定做到,而且连怎么评价它都还没解决。 「永远做不到」言重了,最后一层确实还看不到解。

最反直觉的发现:续写恰好是最占便宜的任务形态

2025 年 9 月有篇论文直接测了这个问题。How Well Do LLMs Imitate Human Writing Style? 拿作者身份验证器当裁判(判断两段文字是不是同一人写的),对比了四种喂法。 只用文字描述目标风格,基本无效。给一到两段范文,风格匹配率比纯描述高 23.5 倍。 最强的是续写形态:给上半篇原文、让模型接着写下半篇,五个模型里四个达到 99.9% 风格一致, 验证器的置信度直接饱和。论文的解释是,人类原文前缀会把模型「锚」进那个风格流形,续写时它就留在里面。

给参考文本要求模仿着续写,正好就是这个最强形态。所以这件事不是天生做不到, 它是所有风格模仿任务里条件最好的一种。

两个诚实的注脚。第一,那篇论文的语料是英文议论文,裁判是统计验证器,不是小说读者; 第二,同一篇论文发现验证器满意不代表人读着像:即便风格匹配 99.9%, AI 产物的困惑度(文字的不可预测程度)仍然只有人类的一半,29.5 对 15.2。 「统计上像原作者」和「读起来不像 AI」是两个可以分离的目标,这个发现贯穿下面所有内容。

另一篇 EMNLP 2025 的Catch Me If You Can? Not Yet 从反方向泼了盆冷水:400 多位真实作者、每个模型四万多次生成, 新闻和邮件这类结构化文体模仿得还行,博客论坛里那种随性的个人腔就不行,模型总往通用腔上滑。 个人风格是隐式的,作者自己都未必说得清,更别指望在提示词里说清。

给了参考还是写不像,病根不在「没看见」

我们去年做过一个五档对照实验:把一本 890 万字玄幻的原文按 4k 到 20 万 token 五个档位塞进上下文,不加任何文风指令,看模型会不会自己学。结果是 20 万 token 那一档的比喻套话密度反而爆到原著的 10 倍,满篇「宛如」「仿佛」「一丝」。 27 万字原著就在眼前,它照样写它的。 (实验细节在漂移实验那篇里。)

当时我们只知道现象。这两年的论文把病根挖出来了,而且几篇互相咬合得很紧。

CMU 团队发在 PNAS 的Do LLMs write like humans? 用语言学家 Biber 的特征集逐项测了 GPT-4o 和 Llama 3 全家,结论是 LLM 有一套自己的房子腔: 名词密堆、信息密度高、分词从句超频,明确要求它模仿口语文体也改不掉。 更扎心的是方向:经过对话调教的版本比基座模型偏得更远。也就是说让模型「更听话」的那些训练, 同时把它的文风钉死了。

钉死的机制这两年也被拆开了。Creativity Has Left the Chat(2024) 观察到对齐后的模型输出会被吸进少数几个「吸引子」,高置信、低探索。Verbalized Sampling(2025)追到更深一层: 病根在偏好数据本身。人类标注员天然偏爱「典型」的文字,这个偏差叫 typicality bias, 只要偏好数据是人标的,就算奖励模型和训练算法都完美,坍缩照样发生。Narrative Flattening(2026) 把基座、SFT、DPO 各训练阶段逐一拆开测小说续写,证明每过一道后训练, 主题、情绪、风格的变化幅度就被压扁一截。 量化的极端案例来自 Antislop(ICLR 2026): 某些套话短语在 LLM 产物里的出现频率,是人类文字的 1000 倍以上。

翻译成人话:你给它参考文本,它不是没看见,是它的手已经被训练捏成了那个形状。 参考文本提供的只是可模仿的材料,「以谁为基准」必须显式说。 我们实测在系统提示里加一句基准声明,五档上下文的套话密度全部压掉一半左右, 20 万 token 也不稀释这句话的效力。

「像」要拆成三层验收

对完账之后我们把「写得像」拆成了三层,每层的可行性完全不同。

词汇层,就是不写 AI 套话、用原文惯用的词。这层已经解了: 显式基准声明加范文就有效,上面的数据都在。

句式节奏层难得多。那本玄幻原著的句长波动系数是 0.84,短句和长句猛烈交错, 拟声词单独占一行;我们所有实验组的产出落在 0.28 到 0.48 之间, 多轮链里最好的窗口摸到 0.79,没有一条链真正回到原著的水平。 怎么改指令都拉不动,这和 PNAS 那篇「语法结构层的偏好改不掉」完全对得上。 这层要动手术,靠说是说不通的,下一节讲手术方案。

第三层是整体纹理,「就是这个作者」的那种细读质感。我们九模型横评里有个标本: qwen 的结构化指标全场最像原著,平均句长 32.1 对原著的 32,套话密度还是全场最低, 双盲细读却只排到四五名。评审给出的理由是它每个窗口都要写气味和触感, 而原著全书零气味描写。统计指标测不出「写了原著从来不写的东西」。 (横评全文在这篇。)

更麻烦的事:「像不像」的裁判席是空的

第三层做不出来,一个根本原因是没有裁判。CHI 2024 的Art or Artifice? 请了 10 位职业作家用 14 项创意测试盲评 48 篇小说,LLM 作品的通过率比职业作者低 3 到 10 倍; 同一批数据交给 LLM 当评委,没有任何一个模型的判断和专家评审正相关。 我们自己的双盲实验更难看:让多个 LLM 评委判「哪段是真人写的」, 对齐人类判断的正确率只有 12%,评委之间的一致率倒有 86%,一致地错。 (那次实验的完整记录在这篇。)

工程上这意味着一件很实际的事:没有可靠的自动评价,就没有可优化的目标函数, 「同一作者感」连回归测试都建不起来。目前唯一可靠的裁判是真人细读。贵,慢,不可规模化。 顺带一提,中文侧已经有人在建基准了:WebNovelBench(2025) 用 4000 多本中文网文给 24 个模型的叙事能力排位,能区分出名著、热门网文和 AI 产物三个档位, 但它测的是「写得好不好」,不是「像不像某一个作者」,后者还是空位。

已验证有效的手段,各自够到哪层

把论文里验证过的手段按「够到哪层、要什么权限」排一遍,事情就清楚了:

手段验证出处够到哪层只用对话接口拿得到吗
续写形态 + 显式基准声明arXiv 2509.24930 + 我们的五档对照词汇层拿得到
范文 few-shot(给原文,别描述)同上,23.5 倍差距词汇层,句式层部分拿得到
基座模型(未对话调教)PNAS 2025 / Narrative Flattening句式层明显改善基本拿不到,商用接口只给对话版
反套话采样(生成时回退重采)Antislop,压制 8000+ 模式不掉质量词汇层根治拿不到,要控制推理端
手术式微调 FTPOAntislop,套话减 90% 不伤文笔词汇层根治要自己部署权重
作者风格向量 + 小模型TinyStyler(EMNLP 2024)短文本风格迁移胜过 GPT-4要自己部署

TinyStyler 值得单独说一句: 8 亿参数的小模型,靠作者风格向量做条件化,在作者风格迁移任务上胜过 GPT-4。 风格模仿缺的从来不是模型规模,是一条专门的条件化通道。 表格右边那一列也解释了为什么市面上的应用做到的程度都差不多: 前两行是提示词工程的天花板,后四行全都要碰推理端或模型权重, 用别人家 API 的产品够不着。

所以,「永远做不到」吗?

分层回答。词汇层已经解了。句式节奏层卡的是通道:手段都发表了, 商用对话接口摸不到推理端,等哪家供应商把基座模型或采样钩子开出来,这层就能推进。 真正开放的是第三层,而且是评价先于生成缺位,裁判都没有,选手怎么练。

我们自己实验里最诚实的一个数字是句长波动系数:原著 0.84, 所有实验组没有一条链回到过这个水平。这个数字回去之前, 「写得像」在我们这里就还是一道没做完的题。 目前 app 里的来源标注开关做到的是第一层的收尾:二十轮连续续写不再越写越 AI, 套话密度压回原著段位。第二层等通道,第三层等裁判。

常见问题

为什么我把原著整段贴给 AI 了,它写出来还是 AI 腔?

因为看见不等于变成。对话模型的输出分布被后训练固定住了:偏好对齐把它拉向少数「典型」写法,某些套话短语在 AI 产物里的频率是人类文字的 1000 倍以上。我们实测把 27 万字原著塞进 20 万 token 上下文、不加任何指令,比喻套话密度反而是原著的 10 倍。参考文本提供的是材料,「以谁为基准」必须显式说,加一句基准声明后套话密度全档减半。

让 AI 模仿文风,什么提示词方法最有效?

2025 年的对照研究排了序:只用文字描述风格基本无效;给一到两段范文,风格匹配率比纯描述高 23.5 倍;最强的是续写形态,给上半篇原文让模型接着写,五个模型里四个在作者验证器下达到 99.9% 风格一致。也就是说别描述,直接给原文,再配一句显式声明「文风句式以原文为基准」。

有没有天生更擅长模仿文风的模型?

有分工,没有全能。我们用同一套提示词测过九个模型两种文体:玄幻续写的第一名到了女频宫斗掉到第六七位,女频第一名的得分点恰好是它在玄幻的扣分点。另外多篇研究一致发现基座模型(未经对话调教的版本)比对话版更接近人类风格分布,可惜商用接口基本只提供对话版。

「AI 味」到底是什么?能被量化吗?

能量化的部分有三类:套话词频(某些短语在 AI 文字里超出人类 1000 倍)、句长均匀化(人类写作长短句猛烈交错,AI 趋向匀速)、语法偏好(名词密堆、分词从句超频,CMU 发在 PNAS 的研究有完整清单)。量化不了的是整体纹理,比如细节密度处处均匀、没有闲笔,这部分职业作家读得出来,目前没有可靠的自动检测。

AI 能不能学会一个作者的文风?我们把 2024–2026 的论文读了一遍 · Foreverse · 新梦