循序渐进 · AIP 教学 · 文档智能(一)

AIP Document Intelligence 总览

企业里大量信息锁在文档里。AIP Document Intelligence 是 Foundry 中文档抽取的统一入口:打开文档、试验抽取策略、验证效果、再部署成批量流程。

全部目录 AIP 首页 ← 上一篇 AIP Document Intelligence 总览 下一篇 →
本文来源 · Source 内容整理自 Palantir Foundry 官方文档:
https://www.palantir.com/docs/foundry/document-intelligence/overview/
原始标题:AIP Document Intelligence • Overview • Palantir · 所属:AIP Document Intelligence(读懂文档)

先记住这几条

① 统一入口
所有文档抽取工作流从这里开始。
② 交互式验证
先看到抽取效果,再决定怎么部署。
③ 可从文档直通生产
验证好的策略能部署成 transform 或 function。
0

写在前面

AIP Document Intelligence 是 Foundry 中所有文档抽取(document extraction)工作流的入口。你可以使用 AIP Document Intelligence 打开一个企业文档的媒体集(media set),快速执行不同的最先进文档抽取策略(extraction strategy),并获取这些策略在质量、速度和 token 成本方面的评估结果。随后只需一次点击,即可将配置好的抽取策略部署为一个 Python transform,应用到媒体集上的批处理管道中。

一个来自媒体集的示例 PDF 文档,在 AIP Document Intelligence 中预览。
一个来自媒体集的示例 PDF 文档,在 AIP Document Intelligence 中预览。
1

功能特性

要点:能做哪些抽取。

AIP Document Intelligence 提供多种抽取能力,并配有简化界面以支持高效的即时使用:

一个在 Document Intelligence 中抽取文档的示例,使用边界框(bounding box)标出不同的抽取区域。
一个在 Document Intelligence 中抽取文档的示例,使用边界框(bounding box)标出不同的抽取区域。
  • 直观的用户界面: 轻松搜索并选择要处理的 Foundry 媒体集,并使用多种抽取策略。
  • 快速确认闭环: 执行的策略结果易于确认,因为 Markdown 输出会映射到原始 PDF 上的边界框。
  • 传统抽取: 利用已有策略从文档中抽取 Markdown:
  • Raw text: 通过读取文档元数据来抽取文本。仅适用于电子生成的 PDF。
  • OCR: 使用传统 OCR(光学字符识别)抽取文本,但不保留布局信息。
  • Layout-aware OCR: 使用带边界框的高级 OCR,以保留文档布局和结构。
  • 生成式 AI 抽取: 使用针对抽取 Markdown 微调过的提示词,执行视觉语言模型(vision language model,VLM)策略。默认提示词经过调优,可在我们的内部评估集上取得最佳表现。你也可以通过配置界面使用自定义逻辑修改提示词。
  • 带 VLM 抽取的预处理: 对于更复杂的用例,你可以将文档预处理与传统方法(例如 layout-aware OCR)结合使用。然后,你可以将预处理结果传给 VLM 以获得更好表现。进一步了解文档预处理
  • 执行指标: 观察抽取质量、执行时间以及输入/输出 token 消耗的评分指标(rubric metric)。
  • 评估: 使用 VLM 作为评判者,抽取结果会针对文档中可能包含的多种因素进行评分,包括列表、表格和代码块的质量。评估策略经过调优,可使其评估结果与我们的内部评估集中的标准答案(ground truth)相匹配。进一步了解抽取评估
  • 部署: 确认理想的抽取策略后,只需一次点击即可轻松地将该策略部署到 Python transforms 仓库中。该 transform 会按精确的抽取策略进行配置,包括模型选择和任何提示词修改。进一步了解抽取策略部署
2

开始使用

要点:第一步怎么走。

AIP Document Intelligence 遵循一套测试工作流:用户导入媒体集、选择配置,并通过观察结果和评估反复迭代策略,直到满意后再进行部署。按照以下步骤开始:

使用 AIP Document Intelligence 时的标准工作流示意图。
使用 AIP Document Intelligence 时的标准工作流示意图。
  1. 上传媒体集: 在应用落地页中,选择从可用文件中选择一个媒体集,或上传一个新的媒体集。
  1. 选择配置: 媒体集打开后,打开 Configuration 标签页来设置你想使用的抽取方法。在传统方法与生成式 AI 方法之间进行选择,按需启用预处理,并自定义要用于 VLM 的提示词。选择 Save 以记住你的配置选择,以备将来使用。 <br><br> AIP Document Intelligence 中的 Configuration 标签页 <br><br>
  1. 在媒体集上执行策略: 配置好抽取方法后,在 Configuration 标签页右上角选择 Run
  1. 预览抽取结果: 运行抽取后,导航到 Extraction result 标签页,查看基于所选策略的输出。
  1. 评估抽取结果(可选): 在结果标签页中,选择 Evaluate results 以使用 LLM 评估抽取结果。继续测试第 3 至第 5 步,直到你对抽取结果和评估都满意为止。 <br><br> 文档抽取结果评估的一个示例。 <br><br>
  1. 可视化分块(可选):Extraction result 标签页中,选择某个抽取结果旁边的 Chunk 按钮,即可预览文本将如何被切分。你可以调整分块参数并查看结果。
  1. 部署抽取策略: 打开 Deployment 标签页,从下拉菜单中选择你保存的配置,然后选择 Create transform repository。系统会提示你为新 Python transforms 仓库选择名称和位置。可以选择性地启用分块(chunking)和嵌入(embedding)。仓库创建后,指定输出数据集并开始构建。详见该仓库的 README.md 获取详细说明。 <br><br> 一个 Python transform 仓库,已预先配置好 AIP Document Intelligence 模板。

延伸阅读 · 相关页面

按主题横向跳转,不必顺着目录一篇篇读。

本组其他页面 · AIP Document Intelligence(读懂文档)

同一主题下的相邻内容。

常见问题速答 · FAQ

关于「AIP Document Intelligence 总览」,读者最常问的几个问题。

功能特性是什么?
能做哪些抽取。AIP Document Intelligence 提供多种抽取能力,并配有简化界面以支持高效的即时使用。
如何开始使用?
第一步怎么走。AIP Document Intelligence 遵循一套测试工作流:用户导入媒体集、选择配置,并通过观察结果和评估反复迭代策略,直到满意后再进行部署。按照以下步骤开始。