一份 PDF 能打开,里面未必有机器可读的文字。很多旧合同、说明书和盖章文件只是逐页图片。AI 回答错了条款,人们容易先换模型,原始问题可能早在文字识别那一步就出现了。
我看了 Google Document AI、Tesseract 和 Microsoft Document Intelligence 的公开说明。三家的工具不同,给出的排查顺序很接近。先看扫描质量和页面结构,再看识别文字,最后才把结果交给检索和问答。
先分清数字文件和扫描件
数字 PDF 往往带有嵌入文字,可以直接复制和搜索。扫描 PDF 主要保存页面图像,需要 OCR 把像素识别成字符。Google Document AI 支持把两种结果合并,页面里有数字文字时走原生 PDF 解析,遇到图像文字再调用光学识别。
入库脚本最好先检测文字层。随机抽几页复制文本,检查顺序与页面内容是否一致。能复制不等于结果可靠,有些文件已经带着质量很差的旧 OCR 层。原图上的“0”和“O”、合同编号里的“1”和“I”,都可能在旧文字层中混掉。
扫描质量会直接影响识别。Google 建议至少使用 200 dpi,300 dpi 及以上通常更合适,并提醒有损压缩会降低图像质量。Tesseract 也建议接近 300 dpi,页面倾斜会明显损害行分割。字太小、拍照反光、背景发灰和边缘裁切,都应该先修文件,继续调提示词帮不上这一关。
Google 的图像质量分析会给页面返回零到一的分数。低于零点五时,还会列出模糊、噪点、过暗、文字过小、文档截断与反光等原因。这类结果适合做入口门禁。质量太差的页面先重扫,无法重扫时标成需要人工查看,不能安静地进入知识库。
文字正确还要看阅读顺序
双栏说明书、表格和页眉页脚容易把文字顺序打乱。模型收到的文本若先读右栏再读左栏,一句话会和另一段拼在一起。Tesseract 提供不同页面分割模式,也坦率说明表格往往需要额外的版面分析。文档系统因此要同时保存页码、坐标和段落结构,不能只留一大段纯文本。
抽查时应优先看高风险位置。合同金额、日期、账号、产品型号和否定词只错一个字符,意思就可能改变。普通叙述段落错一个字影响较小,可以用不同阈值处理。Microsoft 的透明度说明建议使用贴近真实业务的样本做试点,再依据识别词和字段的置信度决定哪些自动通过,哪些交给人复核。
置信度不能单独当答案。各类文件的字体和版面不同,同一个零点八在发票与手写表格上可能对应不同错误率。团队要先拿一批已经人工核对的文件跑测试,统计关键字段漏识别与错识别,再确定自己的阈值。
给答案保留回原页的路
知识问答返回条款时,最好同时给出文件名、版本、页码和原页链接。员工发现句子可疑,可以直接看扫描图,不必相信一段脱离页面的 OCR 文本。修正识别结果后,还要重新生成受影响的切块和索引,避免旧错误继续被检索出来。
OCR 做得好,AI 才有可信的文字可读。先把几份最难的扫描件验明白,再决定工具和阈值,比把几万页文件一次灌进知识库稳得多。