同一道「觉醒大典」考题:flash 自创了道具,pro 连「魂斗罗」都写对了
一次可判卷的模型知识存量评测:让 DeepSeek v4-flash 和 v4-pro 各写两篇《斗罗大陆》同人,用 32 条带原文出处的「设定事实卡」逐条判错。结果 pro 硬错 4 处、flash 10 处;两档模型栽在同一个坑(跨称号升级机制);给模型喂原著选段对 pro 是校准器,对 flash 是双刃剑——覆盖到的题清零,覆盖不到的题反而把主角专属的「紫极魔瞳」安给了路人。评测研究,未发布任何同人内容。

考题是「写一个无名小卒的武魂觉醒大典」。DeepSeek v4-flash 交上来的卷子里, 觉醒仪式用的是一块「磨盘觉醒石」。《斗罗大陆》原著里没有这个东西, 原著的觉醒流程是属性石围阵加魂力水晶球,第二章写得明明白白。 同一道题,v4-pro 不但把流程逐拍写对,还顺手写对了一个大多数读者都记错的冷知识。
用 AI 写同人,读者最不能忍的就是设定错。但「错得多不多」一直停留在体感层面, 没人认真判过卷。我们拿《斗罗大陆》做了一次可判卷的测试:flash 和 pro 两个档位、 裸写和带原著选段两种条件,各写两道题,共八篇,然后逐条数错。
怎么判卷:把「设定对不对」变成可数的错
评测最难的不是让模型写,是让「错」可以被点名。我们先从原著前 30 章里提炼了一份 「设定事实卡」:32 条硬设定加 8 个常见易错点,每条都带原文章节出处和引句。 比如魂环颜色对应年限(白十年、黄百年、紫千年)、每十级一个称号且跨级必须先吸魂环、 猎杀魂兽必须由吸收者本人完成最后一击。
判卷交给四个互相隔离的异构模型评委,人手一份事实卡加一万五千字原著选段, 判词必须逐条注明违反了哪条设定。评委之上还有一道主检复核: 评委引用了事实卡之外的数字(真伪没法裁决的)一律降级为观察项,不进主表; 评委之间可以互相否决误判。实测这道复核不是摆设, 有评委把「26 级自称器魂师」判成错,被另一个评委引的原文互证否决了, 原著里辅助系魂师报系别通称完全合法。
两道考题都是故意逼设定的:「觉醒大典的一天」逼仪式流程、魂力测定、先天魂力数值; 「猎取千年魂环」逼年限适配、组队规矩、吸收过程。想写对,光记得「有魂环这回事」不够。
结果:pro 硬错 4 处,flash 10 处
| 条件 | 设定遵守 | 文风贴脸 | 知识面 | 去重硬错数 |
|---|---|---|---|---|
| flash 裸写 | 5.50 | 6.12 | 5.75 | 5 |
| flash 带选段 | 5.88 | 7.12 | 6.12 | 5 |
| pro 裸写 | 6.62 | 7.00 | 7.00 | 3 |
| pro 带选段 | 7.25 | 8.12 | 8.00 | 1 |
(四评委均分,1 到 10;硬错数为主检去重后逐条可指认的设定错误。) 方向很干净:模型档位的差距大于喂不喂语料的差距,pro 两种条件在设定、文风、 知识三个维度全面压过 flash 两种条件。
质的差异比分数更能说明问题。pro 裸写不看任何参考,能把觉醒大典的流程逐拍写对: 执事报武魂名、水晶球测魂力、报出级数,连「村民的武魂多是锄头、纺锤」 这种原著风味都在。flash 裸写则在流程留白处自由发挥, 自创了「磨盘觉醒石」,还发明了原著整数体系里不存在的「先天魂力半级」。 两档模型的记忆都是概念层扎实、机制细节层模糊,差别在模糊层有多厚。
一个冷知识试金石:第九级称号叫什么?
《斗罗大陆》的十级称号体系里,第九级(90 级以上)在原著里写作「魂斗罗」。 大众记忆普遍把它记成「斗罗」,连不少读者复述时都会记错。 八篇卷子里,只有 pro 裸写那篇显式写对了这个称号。
这类冷知识是测「知识存量」最便宜的试金石:它不考推理,只考模型见没见过、 记没记住。顺着这个思路再看全场唯一一条所有条件都栽的坑,就更有意思了。
全场共同的坑:跨称号升级机制
原著的升级机制里藏着一个反直觉的细节:30 级仍然是「大魂师」, 必须先把 30 级练满、吸收了第三魂环,才能踏进 31 级成为「魂尊」。 考「猎千年魂环」这道题,flash 两篇加 pro 裸写一篇,三篇全在这里翻车: 有的让 29 级角色直接称魂尊,有的让角色吸完魂环凭空跳级。
只有 pro 带选段那篇把这条机制链完整写对,评委的判词是全场唯一把升级瓶颈机制写对的卷子, 组队猎杀与吸收上限「教科书级还原」。流程性机制是模型记忆里最脆的一层, 也是同人读者一眼就能戳穿的一层。
喂原著选段:对 pro 是校准器,对 flash 是双刃剑
带语料的两组各附了一万五千字原著选段(开篇两章加魂环规则讲解章), 并要求设定细节以选段为准。pro 吃了这份材料,硬错从 3 处降到 1 处,两道题都稳。
flash 的表现要拆开看,两道题走向完全相反。
「觉醒大典」这道题恰好落在选段覆盖范围内,flash 从 2 处硬错直接清零, 设定分从 5.25 跳到 8.00,全场最大单篇涨幅。「猎千年魂环」这道题选段只给了规则讲解, 具体情节要靠外推,flash 反而写出全场最差的一篇:5 处硬错, 包括让队友补刀、魂环却归主角吸收(把「最后一击」原则反着用,原著原文是 「最后不是由他杀死,那么也很难得到魂环」), 还有一处篇内自陈矛盾:前文长老刚说 29 级吸千年魂环超出承受极限, 主角 29 级照吸一枚接近两千年的,只伤了一条胳膊。
最值得写进操作手册的是那处「语料反噬」:flash 从选段里捡走了「紫极魔瞳」, 安给了自己的原创主角。这是唐三的专属血脉技能。 对知识底子薄的模型,参考语料不只是校准器,也是一堆可以被拿错的零件: 覆盖到就贴着写,覆盖不到就把专有名词当装饰乱用。
评委判卷的严谨程度也值得记一笔。有评委论证「29 级单人正面猎两千年魂兽全程无风险」 是硬错时,直接拿原著同级人物当标尺:选段第九章里,同为 29 级的大师面对约四百年的魂兽, 判断是「大师可不认为凭借自己二十九级大魂师的实力就能和这样一只魂兽对抗」, 当场喊快跑。同级角色,原著喊跑,同人硬刚,这错就钉死了。
文风:贴脸度最高的一篇,和一个方法论彩蛋
文风维度上,带选段对两个档位都是最一致的杠杆,均分各涨一分以上。 贴脸度天花板是 pro 带选段:写白衣执事的外貌,与原著 「一身白色劲装,背后是黑色披风,胸前正中心的位置,有一个拳头大小的魂字」近乎逐字同构, 还复刻了原著「借旁人议论讲规则」的叙事手法。客观指标同向: 带选段的四篇平均句长向原著的白话短句收拢,裸写的普遍偏长。
彩蛋是一个反例:pro 裸写的觉醒篇,剧情分全场第一,四个评委的组内排序平均 1.5 名, 但两个评委一致判它「文风是散文而不是原作者」,整段铺陈篝火与星光的氛围, 而原著写夜晚就是几个动作交代完。文风遵循度和文笔好坏是两回事, 写得越「文学」,离网文白话的指纹反而越远。这和我们在写手排位实验里看到的现象同源: 评委里也只有细读派抓得住这个区别,粗读的评委会把「写得好」误记成「文风像」。
写同人的三条操作建议
一,能挂原著选段就挂,但选段要覆盖你要写的领域。选段只给规则不给情节的领域, 弱档模型会用想象填空,错得比裸写还狠。
二,写设定密集的题材,模型档位的钱不能省。档位差大于语料差是这次实验最稳定的结论。 如果预算只够开一样,先升档位,再谈喂料。
三,写完做一遍专名反查。把产出里的每个原著专有名词对回原文核对归属, 人物专属的技能、武魂、道具是重灾区。「紫极魔瞳」这种错,读者零容忍, 机器自查却查不出来,因为它就是从你给的参考里「学」来的。
这次评测的边界
样本小:每个条件每道题一篇,结论的方向可信,幅度数字别外推。 评委不是斗罗读者,判卷依赖事实卡,卡外的真错误测不到。 选段只覆盖开篇与规则章,测的实际是前期设定域的知识, 中后期的设定不在考卷里。这些局限都指向同一个提醒: 这是一张方向清晰的小样本考卷,不是给两个模型盖棺的鉴定书。
最后回到那个称号。八篇卷子只有一篇写对「魂斗罗」, 而写对它的模型不看任何参考。知识存量这个东西,喂料能补一时, 补不了它没记住的那一层。挑模型的时候,先问问它记得多少,再问它写得多好。
常见问题
AI 写同人为什么总是把设定写错?
大模型对热门 IP 的记忆是「概念层扎实、机制细节层模糊」。我们实测 DeepSeek 两个档位都记得武魂、魂环、称号这些概念,但一到「第三魂环必须 30 级练满才能吸收」这种流程性机制就翻车,两档四篇里三篇在同一个位置出错。模型档位越弱,模糊层越厚:flash 会直接自创原著里不存在的道具和数值刻度。
给 AI 喂原著选段能减少设定错误吗?
分模型,而且有条件。对 v4-pro 是校准器:硬错从 4 处降到 1 处,两道题都稳。对 v4-flash 是双刃剑:命题落在选段覆盖范围内时硬错清零,需要外推时反而写出全场最差的一篇(5 处硬错),还出现「语料反噬」——把选段里主角专属的招式名捡出来安给了自己的原创角色。
DeepSeek flash 和 pro 写创作类内容差距大吗?
在设定密集的题材上差距明显:四个评审维度(设定遵守、文风、知识面、剧情)pro 两种条件下全面领先,去重后的设定硬错 pro 共 4 处、flash 共 10 处。质的差异在流程性知识:pro 裸写能把觉醒仪式的流程逐拍写对,flash 裸写会自创「磨盘觉醒石」这类体系外道具。写设定考究的类型文,档位钱不能省。
「语料反噬」是什么?怎么防?
指模型把参考语料里的专有名词当成可自由取用的装饰,安到不该的地方:我们实测 flash 从选段里捡走唐三专属的「紫极魔瞳」,用在了自己的原创主角身上。防法是写完做一遍专名反查:把产出里出现的每个原著专有名词对回原文,确认归属和用法,特别是人物专属的技能、武魂、道具。