循序渐进 · AIP 教学 · 其他应用(四)

Realtime audio 总览:语音交互

音频是通过 Ontology 与平台交互的一种模态:对话前后从本体拉取上下文,实时模型边听边转写,可选地回话并触发工具调用,结果再写回本体。

全部目录 AIP 首页 ← 上一篇 Realtime audio 总览:语音交互 下一篇 →
本文来源 · Source 内容整理自 Palantir Foundry 官方文档:
https://www.palantir.com/docs/foundry/realtime-audio/overview/
原始标题:Realtime audio • Overview • Palantir · 所属:其他 AIP 应用

先记住这几条

① 音频是一种交互模态
和文字、图形并列。
② 上下文来自 Ontology
对话前和对话中都会拉取。
③ 能听、能转写、能回话
还能发起工具调用。
④ 结果写回本体
形成闭环。
0

写在前面

音频是通过 Ontology 与平台其余部分交互的一种模态。上下文会在对话之前和对话期间从 Ontology 中拉取,实时模型能够基于该上下文进行聆听、转录,并可选地回话和发起工具调用。结果会被写回 Ontology,在那里 functions、pipelines、AIP Logic、Workshop、actions 以及其他 Foundry 能力均可使用。

用例包括:

  • Dictation(听写)。 单一说话者口述决策、观察或笔记。系统转录音频、抽取实体,并以说话者的权限将它们写入 Ontology。
  • Meetings(会议)。 系统实时对多说话者的音频进行转录、说话人分离(diarize)并结构化为 Ontology 对象。
  • Live call assistance(实时通话辅助)。 一名人工正在与客户通话。某个 Foundry 应用进行聆听、转录对话、向通话中的 Foundry 用户呈现相关的 Ontology 上下文,并在通话结束时将结果写回。
  • Voice-controlled interfaces(语音控制界面)。 Foundry 用户通过语音下达命令,而无需手动导航——查询 Ontology、触发 actions 并以免手操作的方式导航工作流。
2

开始使用

要点:入门路径。

要构建你的第一个语音启用应用,请遵循教程:构建一个语音启用的 OSDK 应用

3

可用模型

要点:实时场景能用哪些模型。

关于受支持的实时语音到语音(speech-to-speech)和转录模型列表,请参阅可用的音频模型

延伸阅读 · 相关页面

按主题横向跳转,不必顺着目录一篇篇读。

本组其他页面 · 其他 AIP 应用

同一主题下的相邻内容。

常见问题速答 · FAQ

关于「Realtime audio 总览:语音交互」,读者最常问的几个问题。

录音、转写与知情同意是什么?
合规红线,开发者自己负责。使用实时音频构建的应用会采集、转录或以其他方式处理人类语音。许多司法管辖区要求在录音开始之前告知参与者其将被录音或转录,其中一些还要求获得明确同意。无论参与者是应用用户、通话另一端的第三方,还是任何其他语音被采集的人,这可能都适用。
如何开始使用?
入门路径。要构建你的第一个语音启用应用,请遵循教程:构建一个语音启用的 OSDK 应用。
可用模型是什么?
实时场景能用哪些模型。关于受支持的实时语音到语音(speech-to-speech)和转录模型列表,请参阅可用的音频模型。