循序渐进 · AIP 教学 · 文档智能(一)
AIP Document Intelligence 总览
企业里大量信息锁在文档里。AIP Document Intelligence 是 Foundry 中文档抽取的统一入口:打开文档、试验抽取策略、验证效果、再部署成批量流程。
本文来源 · Source
内容整理自 Palantir Foundry 官方文档:
https://www.palantir.com/docs/foundry/document-intelligence/overview/
原始标题:AIP Document Intelligence • Overview • Palantir · 所属:AIP Document Intelligence(读懂文档)
https://www.palantir.com/docs/foundry/document-intelligence/overview/
原始标题:AIP Document Intelligence • Overview • Palantir · 所属:AIP Document Intelligence(读懂文档)
★
先记住这几条
① 统一入口
所有文档抽取工作流从这里开始。
② 交互式验证
先看到抽取效果,再决定怎么部署。
③ 可从文档直通生产
验证好的策略能部署成 transform 或 function。
0
写在前面
AIP Document Intelligence 是 Foundry 中所有文档抽取(document extraction)工作流的入口。你可以使用 AIP Document Intelligence 打开一个企业文档的媒体集(media set),快速执行不同的最先进文档抽取策略(extraction strategy),并获取这些策略在质量、速度和 token 成本方面的评估结果。随后只需一次点击,即可将配置好的抽取策略部署为一个 Python transform,应用到媒体集上的批处理管道中。

1
功能特性
要点:能做哪些抽取。
AIP Document Intelligence 提供多种抽取能力,并配有简化界面以支持高效的即时使用:

- 直观的用户界面: 轻松搜索并选择要处理的 Foundry 媒体集,并使用多种抽取策略。
- 快速确认闭环: 执行的策略结果易于确认,因为 Markdown 输出会映射到原始 PDF 上的边界框。
- 传统抽取: 利用已有策略从文档中抽取 Markdown:
- Raw text: 通过读取文档元数据来抽取文本。仅适用于电子生成的 PDF。
- OCR: 使用传统 OCR(光学字符识别)抽取文本,但不保留布局信息。
- Layout-aware OCR: 使用带边界框的高级 OCR,以保留文档布局和结构。
- 生成式 AI 抽取: 使用针对抽取 Markdown 微调过的提示词,执行视觉语言模型(vision language model,VLM)策略。默认提示词经过调优,可在我们的内部评估集上取得最佳表现。你也可以通过配置界面使用自定义逻辑修改提示词。
- 带 VLM 抽取的预处理: 对于更复杂的用例,你可以将文档预处理与传统方法(例如 layout-aware OCR)结合使用。然后,你可以将预处理结果传给 VLM 以获得更好表现。进一步了解文档预处理。
- 执行指标: 观察抽取质量、执行时间以及输入/输出 token 消耗的评分指标(rubric metric)。
- 评估: 使用 VLM 作为评判者,抽取结果会针对文档中可能包含的多种因素进行评分,包括列表、表格和代码块的质量。评估策略经过调优,可使其评估结果与我们的内部评估集中的标准答案(ground truth)相匹配。进一步了解抽取评估。
- 部署: 确认理想的抽取策略后,只需一次点击即可轻松地将该策略部署到 Python transforms 仓库中。该 transform 会按精确的抽取策略进行配置,包括模型选择和任何提示词修改。进一步了解抽取策略部署。
2
开始使用
要点:第一步怎么走。
AIP Document Intelligence 遵循一套测试工作流:用户导入媒体集、选择配置,并通过观察结果和评估反复迭代策略,直到满意后再进行部署。按照以下步骤开始:

- 上传媒体集: 在应用落地页中,选择从可用文件中选择一个媒体集,或上传一个新的媒体集。
- 选择配置: 媒体集打开后,打开 Configuration 标签页来设置你想使用的抽取方法。在传统方法与生成式 AI 方法之间进行选择,按需启用预处理,并自定义要用于 VLM 的提示词。选择 Save 以记住你的配置选择,以备将来使用。 <br><br>
<br><br>
- 在媒体集上执行策略: 配置好抽取方法后,在 Configuration 标签页右上角选择 Run。
- 预览抽取结果: 运行抽取后,导航到 Extraction result 标签页,查看基于所选策略的输出。
- 评估抽取结果(可选): 在结果标签页中,选择 Evaluate results 以使用 LLM 评估抽取结果。继续测试第 3 至第 5 步,直到你对抽取结果和评估都满意为止。 <br><br>
<br><br>
- 可视化分块(可选): 在 Extraction result 标签页中,选择某个抽取结果旁边的 Chunk 按钮,即可预览文本将如何被切分。你可以调整分块参数并查看结果。
- 部署抽取策略: 打开 Deployment 标签页,从下拉菜单中选择你保存的配置,然后选择 Create transform repository。系统会提示你为新 Python transforms 仓库选择名称和位置。可以选择性地启用分块(chunking)和嵌入(embedding)。仓库创建后,指定输出数据集并开始构建。详见该仓库的
README.md获取详细说明。 <br><br>
延伸阅读 · 相关页面
按主题横向跳转,不必顺着目录一篇篇读。
本组其他页面 · AIP Document Intelligence(读懂文档)
同一主题下的相邻内容。
常见问题速答 · FAQ
关于「AIP Document Intelligence 总览」,读者最常问的几个问题。
功能特性是什么?
能做哪些抽取。AIP Document Intelligence 提供多种抽取能力,并配有简化界面以支持高效的即时使用。
如何开始使用?
第一步怎么走。AIP Document Intelligence 遵循一套测试工作流:用户导入媒体集、选择配置,并通过观察结果和评估反复迭代策略,直到满意后再进行部署。按照以下步骤开始。