EPUB 查看器 · 元数据与正文提取
.epub 是一个结构要求严格的 ZIP 文件,所以一本看起来完全正常的书,可能会被阅读器毫无提示地拒绝打开。这个工具会打开文件并告诉你里面有什么:标题、作者、语言、出版社、日期、标识符和主题词,阅读顺序及每章字数,以及任意章节或整本书的纯文本。 它还会执行决定阅读器是否愿意打开文件的结构检查。mimetype 条目必须是压缩包中的第一项,并且以不压缩的方式存储——阅读器不解包任何内容,直接读取这些字节来判断它是不是一本书。因此,mimetype 被压缩过、或被写在最后的书,即使作为 ZIP 完全有效,也会在第一步就失败。此外还会检查:容器是否指向一个真实存在的包文件、阅读顺序中的每一项能否在清单中找到、清单里列出的文件是否确实存在于压缩包中,以及是否存在目录。 字数统计本身就很有用——这本书到底有多长、哪里注水了——提取出的正文则可以直接用来搜索、比对或粘贴到别处。全部处理都在浏览器中完成,书籍不会被上传。
—
拖入 .epub 文件即可查看。
使用方法
- 拖入 .epub 文件,或点击选择一个。
- 查看元数据区域:标题、作者、语言、出版社、标识符和主题词。
- 查看结构检查列表——红色标记就是阅读器拒绝这本书的原因。
- 在目录表中查看阅读顺序和每章字数。
- 选择某一章或整本书,复制或下载纯文本。
常见问题
- 为什么 mimetype 文件必须排在最前且不压缩?
- 这样阅读器就能在不解包任何内容的前提下,从已知位置读取固定长度的字节来判断文件类型。该规则来自 OCF 容器规范。违反它的书作为 ZIP 依然有效,所以失败看起来才格外莫名其妙——阅读器只是直接拒绝了它。
- 我的书在一个应用里能打开,另一个却不行,为什么?
- 各个阅读器的宽容程度不同。这里的检查正是严格阅读器所采用的,因此红色标记通常就能解释差异:清单中承诺却缺失的文件、指向空处的阅读顺序条目,或写法不正确的 mimetype。
- 字数是怎么统计的?
- 先从每一章中去掉标记、脚本和样式,再把剩下的文本按空白切分。同时也会显示字符数——对于不用空格分词的中文、日文和韩文,字符数才是更有意义的数字。
- 会显示图片和排版吗?
- 不会。这是查看文件内容的工具,而不是阅读应用。它提取文本,方便你搜索、统计、比对或粘贴。图片和排版仍留在文件中。
- 支持有 DRM 保护的书吗?
- 不支持。带 DRM 的商店书籍内容是加密的,浏览器无法读取。未加 DRM 导出的文件可以正常打开。
- 我的书会被上传吗?
- 不会。文件在你的浏览器中解压和解析,不会发送到任何服务器。
相关工具
PNG 块检查器
拖入 `.png` 文件,查看它包含的每个块 —— IHDR、IDAT、tEXt 元数据、IEND —— 带大小、CRC,以及 critical/ancillary/safe-to-copy 标志。
文件 0 0
字符与单词计数器
实时统计字符、单词、句子、行数和字节数。
文本 0 0
词频统计
统计文本中每个词出现的次数——支持停用词过滤、最小长度、CSV 导出。
文本 0 0
MP3 标签(ID3)查看器与封面提取
拖入 MP3 即可读取 ID3 标签、比特率和时长,并取出内嵌的封面图片——全部在浏览器中完成。
文件 0 0
文本 Diff 查看器
比较两段文本,按行或按词高亮显示新增与删除。
文本 0 0
Excel (XLSX) 转 CSV、JSON 和 Markdown
在浏览器中打开 .xlsx 工作簿,把任意工作表导出为 CSV、JSON 或 Markdown 表格——文件不会离开你的设备。
文件 0 0