PDF 提取文字
直接在 PDF 阅读器里复制,结果往往很糟:每页的页眉页脚都混进来,分栏互相穿插,句子中间还夹着换行。本工具直接读取文档的文字层,把全部内容放进一个可编辑的框里,能原样粘进笔记、翻译工具或表格。打开「重排段落」后,排版留下的折行会被撤销——被折断的行重新连上,被连字符拆开的单词接回原样,项目符号和编号列表则保持不动。可以保留页面标记,知道每页从哪里开始,也可以去掉,得到干净的正文。如果这份 PDF 是扫描件,本来就没有文字可提取,此时工具会明说,而不是给你一个空框。全部读取都在浏览器内完成,合同或工资单不会离开你的设备。
—
使用方法
- 把 PDF 拖到方框中,或点击方框选择文件。
- 范围保持「全部页面」,或切换到「页码范围」并输入 `1-3, 5` 之类。
- 决定是否保留 `--- 页 n ---` 标记,以及是否重排段落。
- 点击「提取」,然后复制文字或下载为 .txt。
常见问题
- 我的 PDF 会被上传吗?
- 不会。文档的打开与读取全部在浏览器标签页内完成。没有任何内容发送到服务器,关闭标签页也不会留下副本。
- 什么都没出来,可这份 PDF 明明有字。
- 那它几乎肯定是扫描件:一张页面的图片,没有可供选择的文字层。要从中取出文字需要 OCR,本工具不做 OCR。你仍然可以把页面转成图片,再交给 OCR 工具处理。
- 「重排段落」到底改了什么?
- PDF 会把看到的每一行分别保存,因此一个段落大约每 80 个字符就断一次。重排会把不是在句末断开的行重新连上,修复被连字符拆开的单词,并且不动空行、项目符号和编号列表。
- 双栏文档为什么文字是穿插的?
- 文字按文档自身保存的顺序输出,多栏排版大多是按栏保存的,但并非总是如此。一次只提取一页,更容易看出发生了什么,也更容易修正。
- 表格、间距、加粗这些格式会保留吗?
- 不会。输出是纯文本:按阅读顺序排列的文字,加上换行和分页。表格单元格会变成普通的文字片段,所有字体样式都会丢失。
相关主题指南
相关工具
PDF 转图片
把 PDF 的每一页按所选分辨率转成 PNG、JPEG 或 WebP 图片,可单张下载或打包成 ZIP。文件不会上传。
文件 0 0
数字 → 词语转换
把任意数字写成英文、韩文或日文——用于支票、合同或表达清晰。
转换 0 0
CSS 文字阴影生成器(多图层)
随意叠加多层 text-shadow — 霓虹发光、3D、描边、长阴影 — 实时预览,CSS 可直接复制。
颜色 0 0
PDF 压缩
通过重新编码 PDF 内部的图片来缩小体积。文字依旧可选可搜索。文件不会上传。
文件 0 0
PDF 页面提取
拖入一个 PDF,把你想要的页面 — `1-3, 5, 7-10` — 提取到新 PDF。全部在浏览器中,无上传。
文件 0 0
Markdown → 纯文本
去除所有 Markdown 语法,保留可读的纯文本——适合预览、摘要、邮件、字符数统计。
转换 0 0