循序渐进 · AIP 教学 · 其他应用(四)
Realtime audio 总览:语音交互
音频是通过 Ontology 与平台交互的一种模态:对话前后从本体拉取上下文,实时模型边听边转写,可选地回话并触发工具调用,结果再写回本体。
本文来源 · Source
内容整理自 Palantir Foundry 官方文档:
https://www.palantir.com/docs/foundry/realtime-audio/overview/
原始标题:Realtime audio • Overview • Palantir · 所属:其他 AIP 应用
https://www.palantir.com/docs/foundry/realtime-audio/overview/
原始标题:Realtime audio • Overview • Palantir · 所属:其他 AIP 应用
★
先记住这几条
① 音频是一种交互模态
和文字、图形并列。
② 上下文来自 Ontology
对话前和对话中都会拉取。
③ 能听、能转写、能回话
还能发起工具调用。
④ 结果写回本体
形成闭环。
0
写在前面
音频是通过 Ontology 与平台其余部分交互的一种模态。上下文会在对话之前和对话期间从 Ontology 中拉取,实时模型能够基于该上下文进行聆听、转录,并可选地回话和发起工具调用。结果会被写回 Ontology,在那里 functions、pipelines、AIP Logic、Workshop、actions 以及其他 Foundry 能力均可使用。
用例包括:
- Dictation(听写)。 单一说话者口述决策、观察或笔记。系统转录音频、抽取实体,并以说话者的权限将它们写入 Ontology。
- Meetings(会议)。 系统实时对多说话者的音频进行转录、说话人分离(diarize)并结构化为 Ontology 对象。
- Live call assistance(实时通话辅助)。 一名人工正在与客户通话。某个 Foundry 应用进行聆听、转录对话、向通话中的 Foundry 用户呈现相关的 Ontology 上下文,并在通话结束时将结果写回。
- Voice-controlled interfaces(语音控制界面)。 Foundry 用户通过语音下达命令,而无需手动导航——查询 Ontology、触发 actions 并以免手操作的方式导航工作流。
1
录音、转写与知情同意
要点:合规红线,开发者自己负责。
录音与知情同意由你负责
使用实时音频构建的应用会采集、转录或以其他方式处理人类语音。许多司法管辖区要求在录音开始之前告知参与者其将被录音或转录,其中一些还要求获得明确同意。无论参与者是应用用户、通话另一端的第三方,还是任何其他语音被采集的人,这可能都适用。遵守这些要求是应用开发者以及部署该应用的组织的责任。
在部署实时音频工作流之前:
- 核实应用将在其中使用的每个司法管辖区所适用的法律和监管要求。
- 在音频采集开始之前,将适当的告知和同意流程构建到应用中。
- 随应用一同记录你的同意立场与数据保留实践。
- 遵守你组织的内部政策、合规要求和法律义务。
你有责任在部署之前核实这些要求并获得必要的同意。
2
开始使用
要点:入门路径。
要构建你的第一个语音启用应用,请遵循教程:构建一个语音启用的 OSDK 应用。
3
可用模型
要点:实时场景能用哪些模型。
关于受支持的实时语音到语音(speech-to-speech)和转录模型列表,请参阅可用的音频模型。
延伸阅读 · 相关页面
按主题横向跳转,不必顺着目录一篇篇读。
本组其他页面 · 其他 AIP 应用
同一主题下的相邻内容。
- AIP Evolve 总览AIP Evolve 负责编排成群的 AI FDE 智能体,用于持续改进 Foundry 里的 AI 系统 —— 从"一
- AIP Model Catalog 总览Model Catalog 是平台里所有模型资源的总目录:统一查看有哪些模型、各自状态如何、被谁在用。选型与治理都从这里
- 模型弃用与迁移模型供应商经常弃用模型,依赖它的工作流就会被打断。这一篇讲 Palantir 如何通知、如何用 Upgrade Assi
- 构建支持语音的 OSDK 应用这是一篇动手教程:用 OSDK 把实时语音能力接进你自己的应用。注意 —— 录音与知情同意由你负责。
- AIP Threads 总览AIP Threads 让你与文档、数据"对话":把资料放进来,围绕它提问、追问、推进工作,形成一条可持续的线索。
- AIP Threads 快速入门一个简单的工作流教程:上传文档 → 与文档交互 → 与 AIP Chatbot 交互。
常见问题速答 · FAQ
关于「Realtime audio 总览:语音交互」,读者最常问的几个问题。
录音、转写与知情同意是什么?
合规红线,开发者自己负责。使用实时音频构建的应用会采集、转录或以其他方式处理人类语音。许多司法管辖区要求在录音开始之前告知参与者其将被录音或转录,其中一些还要求获得明确同意。无论参与者是应用用户、通话另一端的第三方,还是任何其他语音被采集的人,这可能都适用。
如何开始使用?
入门路径。要构建你的第一个语音启用应用,请遵循教程:构建一个语音启用的 OSDK 应用。
可用模型是什么?
实时场景能用哪些模型。关于受支持的实时语音到语音(speech-to-speech)和转录模型列表,请参阅可用的音频模型。