PDF转Word
抽出 PDF 里的文字,给你一份能编辑的 .docx,PDF 里的图片也会一起带过来。整个转换都在这个标签页里完成,文档不会传到服务器 — 这也是它能免费、又能立刻出结果的原因。
怎么用
- 把 PDF 拖到上面的方框,或者点击它选择文件。页数会立刻显示出来。
- 如果只需要其中一部分,设置页码范围,并决定 PDF 的每一页是否要在 Word 里另起一页。
- 点 转成 Word。结果会以 .docx 下载,下面还会显示一段抽出来的文字,让你看清读到了什么。
为什么它更安全
文件由 pdf.js 打开 — 那是编译成可在浏览器里运行的 PDF 阅读器 — 文字在这里重建。全程不传输任何数据:代码里根本没有上传这一步。这对大家真正会去转换的文档很重要 — 合同、发票、体检报告,任何带姓名和地址的东西 — 因为别人服务器上的副本,是你删不掉的一份。
常见问题
转出来的 Word 会和 PDF 长得一模一样吗?
不会,任何浏览器端转换器都做不到这个承诺。这里重建的是文字、段落分隔、标题、项目符号和编号列表、居中的行,以及分页符 — 图片也会一起带过来,只是按阅读顺序作为独立块放置,而不是钉在它原来所在的那个精确位置。多栏排版、表单域、用线条画的表格,以及在页面上的精确位置都无法保留。想忠实还原这些,需要一个完整的桌面排版引擎 — 而那恰恰是必须跑在服务器上的东西。所以这就是你为了保住文件隐私而付出的代价。
结果里说某一页没有文字,那一页怎么样了?
那一页是文字的图片 — 扫描件、手机拍的照片,或者从扫描件导出的 PDF — 里面没有可供读取的字符。但它没有被跳过:那一页会作为图片放进 Word 文件,所以文档里不缺东西。它做不到的只是「可编辑」— 把图片变成可编辑的文字需要 OCR,那个太重了,跑不进浏览器标签页。有个好办法可以判断:用鼠标在 PDF 里划一段文字,如果什么都选不中,那一页就没有文字层。
有页数或文件大小限制吗?
我们不设限制,因为什么都不发给我们 — 上限就是你自己的内存。通常几百页都没问题。有一种情况会失败:加密的 PDF 需要先解锁。