Labs · 书籍体检
这本 txt 好不好读,
导入前先体检。
拖一本小说 txt 进来:编码认出来、章节按生产导入器的规则切出来、字数算清楚,再告诉你听完要几个通勤来回。30MB 的大书也在浏览器本地解析——进度条不掺假。
把 txt 拖进来,或点击选择
.txt(UTF-8 / GBK / UTF-16 自动识别)· 最大 64MB
整本书在浏览器本地解析——不上传、不留存。30MB 的大书也一样。
体检报告会出现在这里。
txt 导入阅读器之前,先查哪几样?
最常见的三个坑:编码(GBK 文件按 UTF-8 读就是一屏乱码)、章节标题识别不出(整本书塌成一整章)、 下载站塞的目录页和广告行。把文件拖进上面的体检器,这三样在浏览器本地一次查完, 顺带给出字数、阅读时长和四档语速的听书时长——确认没问题再进阅读器。
章节规则从哪来
识别器移植自我们 App 里 txt 导入器的章节规则,被真实书库反复毒打过:第N章/卷族(含卷名前缀、番外外传前缀)、裸数字标题、【001】方括号编号、Chapter N 与罗马数字、序章后记等特殊章。那些真书教会的防御手段也一并带来了——下载站目录页按「前部密集重复组」整组剔除、编号反复重置的选项式数字行整体拒绝、以句号逗号收尾的正文行不会被当成章。
编码检测走探测链:字节序标记、按字节分布判无标记 UTF-16、严格 UTF-8、轻度损伤 UTF-8、严格与近似 GB18030——每一步都以解码证据为准,不看文件扩展名。
它的边界
这是规则主干不是整台导入器:极端标题样式(全角混排、无标点分章)的识别率低于 App 完整版;超过 10MB 的书只在前 400 万字里扫章节——字数统计仍是全文精确值,报告里会标注口径。Big5 与西欧单字节编码不在探测链里。epub 暂时留给 App:浏览器里做个半吊子拆包器,比这页诚实的「不收」更害人。
常见问题
为什么 200 万字的书被识别成了一整章?
章节识别靠的是能认出来的标题行——第N章族、「001 标题」式数字行、Chapter N、序章番外这些。全书一个都没有(或样式太少见)时,整本落成一章:听书没法按章分段,AI 续写的上下文也只能按字数硬切。这页移植的是生产导入器的规则主干;App 完整版覆盖更多样式,还支持手动分章。
预览里全是乱码,怎么回事?
文件编码多半不在这页的探测链里。探测链覆盖 UTF-8(严格与轻度损伤)、GBK/GB18030、带与不带字节序标记的 UTF-16——真实书库里几乎全部形态。Big5 繁体和西欧单字节编码不在链里;在电脑上用编辑器转存 UTF-8 再试,或直接交给 App 的完整探测链。
为什么不收 epub?
epub 是 zip 容器:要拆包、解 xhtml、按 spine 顺序拼章节。在浏览器里做个半吊子版本,给出的答案比不做更误导——所以网页版 v1 只收 txt,并且明说。App 的导入器直接收 epub。
阅读和听书时长是怎么算的?
阅读按每分钟 300 字(中文)或 220 词(英文书,按 CJK 占比判定)。听书 1× 速按每分钟 250 字或 150 词——和站内成本计算器同一换算——另给 1.25×、1.5×、2× 三档。这些是规划用的数字:你的真实语速归你。