给 RAG 知识库或 AI Agent 接入 PDF 时,最容易被低估的一步其实是文档解析。模型能力再强,如果双栏论文被读成两段交叉的文字、表格列发生错位,或者回答生成后无法定位原文,后面的分块、检索和引用都会受到影响。
LiteParse 解决的正是这个入口问题。它不是一款带图形界面的 PDF 阅读器,而是面向开发者的开源文档解析库和命令行工具。项目核心使用 Rust 编写,基于 PDFium 提取文本,默认不依赖大模型、云端接口或 API Key,文档可以留在本机处理。
先看速度:最高 100 倍有明确比较对象
LiteParse v2 将原来的 TypeScript 核心重写为 Rust。根据官方公布的测试,小文档相较 LiteParse V1 提速约 5~100 倍,大文档的提升约为 3 倍。其中一个 457 页、约 100MB 的 PDF,官方测试解析时间为 0.777 秒。
这个数字很亮眼,但不能理解成所有 PDF 都能在一秒内完成。实际速度会受到电脑硬件、页面数量、版面复杂程度、是否触发 OCR 以及输出格式影响。原生文字型 PDF 通常处理得最快,扫描件和大量图片页面则需要更多时间。
LiteParse 不只提取文字,还会保留文字位置
普通 PDF 文本提取工具经常只输出一长串内容,文字虽然读出来了,原来的列、段落和对齐关系却丢失了。LiteParse 会根据文本坐标进行 Grid Projection,也就是把提取出来的文字重新投射到页面网格中,尽量恢复原有的排列和阅读顺序。
- 空间结构保留:减少双栏内容、表格单元格和页面区域被完全压平的问题。
- 文字边界框:JSON 结果会记录文本元素的 x、y、width、height 等坐标。
- 多种输出格式:可以生成纯文本、结构化 JSON 或适合知识库使用的 Markdown。
- 页面截图:能够把指定页面渲染成图片,交给多模态模型进一步分析。
需要注意,空间投影保留的是文字之间的相对位置,并不等于真正理解图表含义。对于密集表格、复杂多栏、手写内容和图表较多的 PDF,仍然可能出现阅读顺序或结构识别错误。
边界框对 RAG 和 Agent 有什么用
如果只是把 PDF 转成文本,很多工具都能完成。LiteParse 更实用的地方,是能让检索结果重新对应到原始页面区域。
- 将文本、页码和边界框一起保存到向量数据库。
- 检索命中后,根据坐标找到原文所在的页面位置。
- 配合页面截图,在图片上框出引用内容。
- 让用户直接核对 AI 回答引用的是哪一页、哪一段。
这种方式适合研究报告、产品说明书、合同、财务文件和技术文档,也能减少“回答看起来正确,却找不到出处”的问题。
选择性 OCR,不必对每一页重复识别
LiteParse 会优先读取 PDF 自带的文本层,只在页面没有可用文字、包含扫描内容或嵌入文字图片时调用 OCR。默认使用 Tesseract,也可以连接 EasyOCR、PaddleOCR 或自行部署的 HTTP OCR 服务。
在正式解析前,还可以使用复杂度检测命令检查文档是否存在扫描页、稀疏文字、乱码、嵌入图片或矢量文字:
lit is-complex document.pdf
对于文字层完整的普通 PDF,可以关闭 OCR 进一步减少处理时间;对于扫描件,则需要准备对应语言的 Tesseract 数据文件。
LiteParse 安装与基础使用方法
如果电脑已经安装 Python 3.10 或更高版本,可以直接通过 pip 安装。安装完成后会同时获得统一的 lit 命令行工具。
pip install liteparse
lit parse document.pdf
lit parse document.pdf --format markdown -o output.md
lit parse document.pdf --format json -o output.json
lit batch-parse ./documents ./outputs --recursive
第一条解析命令会输出纯文本;Markdown 适合导入知识库或交给大模型整理;JSON 会保留页面结构、文本元素和坐标,更适合程序读取与 RAG 来源定位。
Node.js 用户可以使用 npm 全局安装,Rust 用户也能通过 cargo 安装。除浏览器 WASM 版之外,各语言版本使用的是同一套 lit 命令。
支持 Word、PPT 和图片,但需要看清依赖
LiteParse 的核心处理对象是 PDF。Word、PowerPoint 和 Excel 等办公文档,会先通过 LibreOffice 转换成 PDF,再进入相同的解析流程。因此,想处理 DOCX、PPTX 或 XLSX,需要提前在电脑上安装 LibreOffice。
图片格式则已支持本地转换,可处理 JPG、PNG、WEBP、TIFF、SVG 等常见文件,再通过 OCR 提取文字。
项目还提供浏览器 WASM 版本,可以直接在网页中解析本地 PDF,不需要把文件上传到服务器。不过 WASM 版不包含内置 Tesseract、Office 文档转换和页面截图功能,需要 OCR 时必须自行接入 JavaScript OCR 引擎。
使用前要注意的三个问题
- 没有传统图形界面:LiteParse 更适合开发者和熟悉命令行的用户,不是点击几下就能完成转换的桌面软件。
- 首次 OCR 可能联网:Tesseract 对应语言的 traineddata 文件通常会在首次使用时下载并缓存。隔离网络环境需要提前准备语言文件。
- 复杂文档并非完美还原:Markdown 结构重建采用规则和启发式判断,密集表格、手写扫描件、图表和复杂多栏仍需人工检查。
LiteParse 适合哪些人
如果你正在搭建本地知识库、RAG 检索系统、文档类 Agent,或者需要批量提取 PDF 并保留来源坐标,LiteParse 很适合作为文档处理流程的第一层。它速度快、部署方式灵活,而且默认不需要注册账号或购买 API 额度。
如果只是偶尔把 PDF 转成 Word,或者希望使用完整的中文图形界面,LiteParse 并不是最省事的选择。对于密集表格、手写材料和需要理解图表语义的复杂文档,也应该准备更强的 OCR、视觉模型或云端解析方案作为补充。
总结
LiteParse 的价值不只是“解析得快”,而是把文字、页面位置和版面线索一起保留下来。对于 RAG 和 Agent 来说,这些坐标可以用于更可靠的分块、来源定位和可视化引用。
它不是能够完美理解所有文档的万能解析器,但作为一个免费开源、默认本地运行、容易接入现有项目的基础工具,LiteParse 在速度、隐私和可追溯性之间做出了不错的平衡。
官方相关链接
LiteParse 官方 GitHub 仓库:https://github.com/run-llama/liteparse
LiteParse 简体中文说明:https://github.com/run-llama/liteparse/blob/main/README.zh-CN.md
LiteParse 官方入门文档:https://developers.llamaindex.ai/liteparse/getting_started/
LiteParse Releases 下载页面:https://github.com/run-llama/liteparse/releases
LiteParse 浏览器 WASM 演示:https://run-llama.github.io/liteparse/
LiteParse Python 安装页面:https://pypi.org/project/liteparse/
LiteParse v2.0 官方性能说明:https://www.llamaindex.ai/blog/liteparse-v2-0-runs-everywhere

