搜索 PDF 相关问题时经常会碰到一堆专业术语,单看某一个词往往一知半解。这份速查表把最常遇到的几个概念一次性讲清楚,每个词都配一句大白话解释。

AcroForm(交互式表单)

PDF 内部真正可以点击输入的表单字段系统,和"看起来像表格但其实是图片"的扫描版死表格是两回事——详见《PDF 表单详解》一文。

标签(Tags / 标签结构)

告诉屏幕阅读器"这是标题""这是正文""这是图片"的结构化信息,直接决定一份 PDF 对视障用户是否可用——详见《PDF 无障碍访问入门》一文。

栅格化(Rasterize)

把矢量的文字或图形转换成像素点阵图片的过程。栅格化之后的文字不再是"文字",无法被选中、搜索或复制——扫描件本质上就是整页栅格化的产物。

扁平化(Flatten)

把可交互的表单字段或批注图层"固化"成页面的静态内容,之后就不能再单独选中或修改这些元素了。常用于表单填写完成、确认不再需要改动后的最终定稿。

OCR(光学字符识别)

把扫描件(本质是图片)里的文字内容识别出来,转换成真正可选中、可搜索的文本层,弥补栅格化带来的"文字变图片"问题。

元数据(Metadata)

嵌在文件内部、不直接显示在页面上的信息,比如作者、创建时间——详见《如何查看 PDF 的元数据》一文。

书签 / 大纲(Bookmark / Outline)

侧边栏里可点击跳转的目录结构,方便在长文档里快速定位——详见《PDF 书签和导航是怎么工作的》一文。

字体子集化(Font Subsetting)

只内嵌文档里实际用到的那部分字符对应的字形数据,而不是整个字体文件,避免内嵌字体导致文件体积暴涨——详见《PDF 里的字体是怎么一回事》一文。

线性化(Linearized / Fast Web View)

重新组织文件内部数据顺序,让阅读器能一边下载一边显示第一页,而不必等整个文件下载完——详见《什么是线性化 PDF》一文。

PDF/A

面向长期存档的严格变体,要求所有资源都自包含在文件内部——详见《PDF/A 是什么》一文。

掌握了这些术语,再遇到 PDF 相关的问题会清楚很多。

打开 LocalPDF →