每个源页面对应一个章节
HTML 会标注所选源页面,方便读者返回对应 PDF 页面。
根据 PDF 文本层创建简单的 HTML 文档。
将文件拖到此处,或使用下方按钮选择文件。
上限为 100 MB 总计 · 文件保留在您的设备上
在此预览文档。对于新添加的内容,预览仅用于辅助确定位置;请检查保存后的输出结果。
将可选择的 PDF 文字导出为简单 HTML 文档,每个所选页面对应一个章节。结果可用作可读的文字参考,或作为网页编辑的起点。
工具会对提取字符进行转义,不会重建交互式 PDF 内容或原始 CSS。结果是文字呈现,而非与 PDF 像素一致的网站版本。
HTML 会标注所选源页面,方便读者返回对应 PDF 页面。
提取的字符会经过 HTML 转义。PDF 文字不会被作为嵌入的 HTML 代码执行。
只选择与任务相关的页面,创建较小的参考文档。
下载文件可作为 HTML 文字文档打开,不会重现源字体、图片或页面 CSS。
HTML 让提取文字便于在浏览器中查看,或交给网页编辑。本转换器创建带有页码标注的文字章节,可供发布人员在制作正式网页时参考。它不会推断语义标题、重建表格,也不会提供完整的无障碍出版物。转换后,请按有意义的标题和段落重组内容,核实阅读顺序,并单独添加获准使用的图片。如果需要固定外观的预览,请改用页面渲染。
提取已批准的宣传册文字,用于网页草稿。将通用页面章节替换为有意义的标题,并确认换行没有拆开句子。
从以文字为主的 PDF 操作规程创建浏览器可读的参考文件。为团队系统准备经过审核的文章时,保留源页码引用。
比较固定 PDF 布局与简单 HTML 文字呈现,找出为了得到可用网页版本,需要手动补充哪些结构、图片说明和表格标记。
选择以文本为基础的 PDF,以提取 HTML。
点击截图可放大查看。
设置源页面,并按需设置下载文件名。
点击截图可放大查看。
下载 HTML,检查带有页码标记的文本分节。
点击截图可放大查看。
截图展示了使用不含敏感信息的示例文件操作本工具箱的过程。您的文件名、页数和设置可能不同。
| 设置 | 预期效果 |
|---|---|
| 支持的输入 | |
| 处理位置 | 您的浏览器 |
| 文件选择 | 一个输入文件 |
| 输入大小 | 总计 100 MB;解码后的图像和页面也有像素限制 |
| 页面选择 | 每次任务最多选择 200 页。只有 PDF 不超过 200 页时,“页面”留空才表示所有页面;更长文档请分范围处理。 |
此导出需要现有文字层。扫描页面须先完成并检查 OCR,之后其文字才能出现在生成的 HTML 中。
打印页面的边界通常并不代表一个完整网页章节。编辑导出文件时,请将段落放在描述主题的标题下,为真正的表格添加正确的行列标记,并为重要图表提供说明文字。生成的预格式化文本只是编辑参考,不代表原文档已经成为完成的网页。删除源页码标签前,请对照 PDF 核实措辞。
| 情况 | 处理方法 |
|---|---|
| 页面设计缺失 | 这是从 PDF 导出文字到 HTML,不是重建视觉布局。 |
| 扫描页面没有内容 | 请先添加并核实 OCR 文字层。 |
| 字符看起来像 HTML 代码 | 这些字符会有意进行转义,确保提取的文档内容不会被执行。 |
“项目计划”这样的印刷标题可能出现在导出的 pre 文本中。确认它确实是文档标题后,可编辑为 <h1>项目计划</h1>,并把后续正文放进 p 元素。结构应由文字含义决定,而不只是照搬 PDF 的分页位置。
此导出包含经过转义的提取文字,不会重建图片、可用链接或原始页面样式。
请先检查内容、无障碍性和格式。添加合适的网页布局,不要把提取文字当作完整网站。
可以。在文本或 HTML 编辑器中打开下载文件。检查提取字符并补充适当结构后,再用于已发布页面。
继续使用 HTML 转 PDF, PDF OCR 文字识别, PDF 转文本.