Guide · 使用教程
LlamaParse PDF 转 RAG 教程:扫描件、表格、页码与解析质量验收
用已授权 PDF 建立解析样本,比较 Parse 档位,保留页码和文档版本,再接入 Index 检索;通过人工答案集发现 OCR、表格和引用错误。
这篇教程会完成什么
把一组已授权 PDF 解析为可核查的文档内容,并为 RAG 准备带文件版本和页码的证据。最终得到解析结果、失败页清单、30 个带页码的问题答案,以及一张每千页成本表。教程只描述可复现的试点流程,不声称已经在读者账户中运行;真实账单、区域和模型结果要在你自己的环境核对。
开始前准备
注册 LlamaCloud/LlamaParse 账户,创建 LLAMA_CLOUD_API_KEY。选择公开或已经获得处理授权的样本:5 份原生 PDF、5 份扫描 PDF、5 份带跨页表格或脚注的长文档。给每份记录来源、许可、版本、页数、日期和文件哈希。将 30 个问题的人工答案与正确页码单独保存,其中包括“文档没有答案”和“旧版、新版冲突”。
上传客户或员工资料前,先核对账户所在 US/EU 区域、数据保留、子处理方与合同。官网将企业私有 VPC 部署单列,不能把它当作 Free 或 Starter 的默认属性。
第一步:先做小样本 Parse
安装官方 Python SDK,并把密钥存入受控环境变量:
python -m pip install llama-cloud
export LLAMA_CLOUD_API_KEY="在本机密钥管理器中取得的值"
下面的核心调用按官方 Parse 入门示例组织;把文件名换成你的已授权样本,运行前再对照当前 SDK 文档确认参数。不要把实际密钥写进脚本或文章。
from llama_cloud import LlamaCloud
client = LlamaCloud()
source = client.files.create(file="sample.pdf", purpose="parse")
result = client.parsing.parse(
file_id=source.id,
tier="agentic",
version="latest",
expand=["markdown"],
)
for page_no, page in enumerate(result.markdown.pages, start=1):
print(page_no, page.markdown[:200])
先用 1–2 页观察输出,确认它识别了列头、单位、负数、脚注和阅读顺序,再跑全组。不要直接把打印出的 Markdown 当最终资料;应保存完整结果、配置、文件哈希和处理时间。若文件含隐私信息,不把原文写入开放日志。
第二步:逐页验收而不是只看整篇
建立“页码—问题—人工答案—解析片段—错误类型”表。扫描件检查 OCR 漏字、字符混淆;表格检查列头、跨页续表和单位;合同检查条款编号与脚注。将错误分为文字识别、版面顺序、表格结构、缺失页面和无答案。只对失败页面或文档试更高精度档位,比较提升与 credits 增量。新版本模型或配置上线前,重新跑同一组样本,防止旧问题回归。
第三步:建立可检索索引
若要快速验证完整链路,可参考官方 Index v2:先把文件加入 Directory,再创建 Index,系统会执行解析、切分、嵌入和索引,然后用 Retrieve/Chat 检索。若已有自建向量库,也可只取解析结果,在自己的管线中切块、保存页码与版本元数据。无论哪条路线,都要保证每个 chunk 能追到原件与页码,并按原文权限过滤检索结果。解析正确但索引漏召回,不应归咎于 OCR。
第四步:做回答验收和成本核算
对 30 个问题逐条记录:应答/拒答、检索召回、答案正确、引用文件与页码正确、是否越权、人工修正时间。只有答案和引用同时正确才算通过;对于文档无答案的题,模型猜测要计为失败。单独核算 Parse、Extract、Index 与后续模型的 credits 和费用,按“通过验收的问答数”及“有效解析千页数”两种单位汇报。官网美国套餐 Free 10,000 credits/月、Starter $50/月含 40,000、Pro $500/月含 400,000;不同档位消耗不同,不能预设每页固定价格。
常见问题与回退
- 扫描件表格错列:保留人工标注,尝试其他解析档位,并限定只处理需要的页。
- 新版文档没进入答案:核对 Directory 同步、Index 状态和版本过滤。
- 引用对不上页码:检查 chunk 元数据在切分和重排时是否丢失。
- 成本突增:检查重复上传、缓存命中、失败重试和高精度档位是否被无差别使用。
- 敏感文件误上传:暂停管线,按组织事件流程处理,核对删除与保留条款。
什么时候换方案
若文件必须全程留在自有环境,先评估 Docling 或 MinerU 等本地方案;若只是让团队直接问答少量 PDF,可看 Humata;若核心是发票字段到业务系统的自动化,试 Parseur。工具选择应跟着资料权限、输出目标和验收成本走。
官方资料
常见问题
- LlamaParse 是开源的吗?
- LlamaParse 是商业托管文档平台;LlamaIndex Framework 与 LiteParse 是另外的开源项目,不能混为一谈。
- Free 的 10,000 credits 等于多少页?
- 没有固定页数。解析档位、文档复杂度、Extract 和 Index 操作都会影响消耗,用样本账单估算。
- 扫描 PDF 的表格怎样验收?
- 逐页核对 OCR、列头、单位、跨页续表和脚注,保存人工标注与失败原因。
- 解析正确后为什么答案仍可能错误?
- 切块、索引、权限过滤、检索召回和模型生成都可能出错,需要分阶段记录。
- LlamaParse 可以在本地离线运行吗?
- 本文介绍的是托管平台。官网列出企业私有部署选项;需要本地离线解析时应评估 LiteParse、Docling 等独立方案。
- 什么时候需要人工审核?
- 价格、合同、医疗、财务及其它高风险结论都应按原件和页码核对;试点阶段还应抽查无答案题和旧版文件。