跳到主要内容
AZ Tools

EPUB 查看器 · 元数据与正文提取

.epub 是一个结构要求严格的 ZIP 文件,所以一本看起来完全正常的书,可能会被阅读器毫无提示地拒绝打开。这个工具会打开文件并告诉你里面有什么:标题、作者、语言、出版社、日期、标识符和主题词,阅读顺序及每章字数,以及任意章节或整本书的纯文本。 它还会执行决定阅读器是否愿意打开文件的结构检查。mimetype 条目必须是压缩包中的第一项,并且以不压缩的方式存储——阅读器不解包任何内容,直接读取这些字节来判断它是不是一本书。因此,mimetype 被压缩过、或被写在最后的书,即使作为 ZIP 完全有效,也会在第一步就失败。此外还会检查:容器是否指向一个真实存在的包文件、阅读顺序中的每一项能否在清单中找到、清单里列出的文件是否确实存在于压缩包中,以及是否存在目录。 字数统计本身就很有用——这本书到底有多长、哪里注水了——提取出的正文则可以直接用来搜索、比对或粘贴到别处。全部处理都在浏览器中完成,书籍不会被上传。

拖入 .epub 文件即可查看。

使用方法

  1. 拖入 .epub 文件,或点击选择一个。
  2. 查看元数据区域:标题、作者、语言、出版社、标识符和主题词。
  3. 查看结构检查列表——红色标记就是阅读器拒绝这本书的原因。
  4. 在目录表中查看阅读顺序和每章字数。
  5. 选择某一章或整本书,复制或下载纯文本。

常见问题

为什么 mimetype 文件必须排在最前且不压缩?
这样阅读器就能在不解包任何内容的前提下,从已知位置读取固定长度的字节来判断文件类型。该规则来自 OCF 容器规范。违反它的书作为 ZIP 依然有效,所以失败看起来才格外莫名其妙——阅读器只是直接拒绝了它。
我的书在一个应用里能打开,另一个却不行,为什么?
各个阅读器的宽容程度不同。这里的检查正是严格阅读器所采用的,因此红色标记通常就能解释差异:清单中承诺却缺失的文件、指向空处的阅读顺序条目,或写法不正确的 mimetype。
字数是怎么统计的?
先从每一章中去掉标记、脚本和样式,再把剩下的文本按空白切分。同时也会显示字符数——对于不用空格分词的中文、日文和韩文,字符数才是更有意义的数字。
会显示图片和排版吗?
不会。这是查看文件内容的工具,而不是阅读应用。它提取文本,方便你搜索、统计、比对或粘贴。图片和排版仍留在文件中。
支持有 DRM 保护的书吗?
不支持。带 DRM 的商店书籍内容是加密的,浏览器无法读取。未加 DRM 导出的文件可以正常打开。
我的书会被上传吗?
不会。文件在你的浏览器中解压和解析,不会发送到任何服务器。

相关工具