高通智能多媒体SDK 2.0:面向高通边缘AI平台的AI与多媒体产品开发统一框架

概要:
- 利用高通智能多媒体SDK,您只需一套工具包,即可基于高通跃龙芯片组,构建面向AI和多媒体、并支持硬件加速的应用程序及流水线。
- 全新2.0版本新增支持Python与C++环境的流水线API和应用构建工具、编码智能体Skill、生成式AI推理、容器化微服务,以及文档即代码。
- 您可以创建将生成式AI模型与摄像头、音频、视频、传感器、数据分析及微服务相结合的应用程序,让应用程序在数据生成和动作执行的就近位置运行。
您正在尝试构建可以在贴近数据生成与动作执行的位置运行生成式AI模型的边缘侧产品。除此之外,您还需要整合种类日益繁多的运行时、硬件加速器、API(应用程序编程接口)以及部署环境。
如果您能在单一工具包中开展工作,实现AI与多媒体深度融合、文档与代码互联互通、编码智能体与应用构建工具无缝衔接,会带来怎样的体验?
高通智能多媒体软件开发套件(QIMSDK)正是为提供这样的单一工具包而开发。如今全新发布的高通智能多媒体SDK 2.0,将生成式AI推理、多媒体流、易读流水线API、开发者工具链、文档体系、AI辅助编码以及容器化部署整合为一套互联互通的开发体验。
高通智能多媒体SDK 2.0专为您的各类开发项目设计,全面适配所有高通跃龙平台、高通Linux 2.0平台以及高通下游Linux平台,同时覆盖摄像头、工业、机器人与物联网等垂直领域。
| 重点 | 高通智能多媒体SDK 2.0实现的功能 |
| AI | 支持包含QAIRT、ONNX、TFLite在内的多路推理路径,更多推理框架已纳入后续产品路线图。同时增 强了多流并发与AI链式串联处理能力。 |
| 多媒体 | 摄像头、视频、音频、图形、流媒体、合成、预处理、编码以及硬件加速类插件大多已上游化,剩余插件也将持续推进上游并入。 |
| 开发者体验 | 新增特性:面向Python与C++环境提供易读型流水线API及应用程序构建工具 |
| 部署 | 示例应用、可复用微服务、内存优化型Docker支持、部署能力以及设备在环工作流。 |
| 开发者生态系统 | 新增特性:文档即代码机制,编码智能体能力。互联互通的GitHub代码仓库、示例应用、博客与插件参考文档。 |
附表1:高通智能多媒体SDK 2.0概览
高通智能多媒体SDK是什么?您该如何使用它?
AI-多媒体流水线
借助高通智能多媒体SDK,您可以构建远超模型演示范畴的边缘应用程序,打造融合多媒体处理、AI推理与应用级智能能力的完整边缘侧产品。目前高通智能多媒体SDK已在高通平台上实现规模化落地,支撑了数百款联网智能产品的开发与上市,涵盖AI智能摄像头、无人机、机器人等品类。
其流水线架构由Gstreamer衍生而来,并在此基础上扩展了高通硬件加速插件、API、多线程能力,实现了硬件IP模块间的零拷贝数据传输,同时配套提供了示例应用程序与开发工具。
如下图所示,高通智能多媒体SDK专为AI与多媒体流水线场景设计,可以从传感器数据源采集视频帧与数据,并在完成全链路处理后输出最终结果。

附图1:开发者触点与流水线构建
高通智能多媒体SDK 2.0中全新的智能体能力,不仅有助于确保您快速评估最适配自身产品的评估套件(EVK)平台,还可支持您借助智能体能力快速完成原型开发。对于该SDK内置的示例应用程序,您可借助智能体编码能力进一步迭代优化。
产品开发团队无需从零重建项目,即可快速完成从评估到部署和扩展的全流程。目前该SDK已获得三星、亚马逊、博士(Bose)等企业开发团队的广泛信赖。
容器化微服务
高通智能多媒体SDK 2.0的能力边界已从单纯的应用开发向外延伸,提供了一套开箱即用的开发蓝图与容器化微服务。借助SDK中的各类构建模块,您可针对性能情况协助优化自有流水线,然后将其部署为三大类容器化微服务,即:推理类、数据分析类与平台类。

附图2:高通智能多媒体SDK 2.0微服务
推理服务支持:
| 视觉AI | 生成式AI | 大型语言模型与视觉语言模型 |
| 音频AI | 文本生成图像 | 利用高通AI技术进行硬件加速执行 |
例如,推理类微服务兼容OpenAI API,可支持聊天补全等功能。后续规划发布的特性包括Responses API与模型全生命周期管理。
分析类服务的架构设计可将AI输出结果转化为切实可行的洞察,适用于如下应用场景:
| 人员分析 | 个人防护装备合规 | 占用情况检测 |
| 车辆分析 | 区域监控 | 热图生成 |
平台类服务的开发目标是通过与以下组件的集成,实现边缘侧应用与企业系统、云端系统的互联互通。
| 卡夫卡事件流平台 | 消息队列遥测传输 | 亚马逊云服务物联网 |
| 微软Azure物联网 | Confluent云 | 企业事件处理系统 |
高通智能多媒体SDK 2.0的微服务是可用于搭建、部署各种应用程序的构建模块。您可以将推理类服务与分析类服务灵活组合,搭配API、消息系统与云连接器,构建出完整的企业级解决方案。
您无需从零起步即可实现快速创新,同时全程保障系统的可扩展性与可维护性。
解决方案包括:
工业安全监测:人员检测、个人防护装备合规分析、告警API
禁区监测:区域分析、占用情况告警、人员检测
车辆分析:车辆检测、停车分析、云事件转发
边缘对话式AI:大型语言模型/视觉语言模型推理、摄像头上下文感知、应用API
多语言音频助手:语音识别、翻译、文本转语音
企业级边缘分析:AI推理、分析类服务、Kafka或MQTT集成
高通智能多媒体SDK 2.0可赋能的AI驱动产品
利用高通智能多媒体SDK 2.0,您可以在统一架构范围内围绕摄像头、视频流、音频处理、AI推理、高级分析与云连接能力构建应用程序,以打造如下类型的产品:
- 智能摄像头
- IP摄像头与网络摄像头
- 工业视觉系统
- 机器人平台
- 自主无人机
- 边缘侧AI盒子
- 作业人员安全解决方案
- 智慧零售应用
- 智能监控系统
- 多模态AI助手
- 边缘侧分析平台

附图3:高通智能多媒体SDK 2.0可实现的智能网络互联产品
高通智能多媒体SDK 2.0增添了哪些新特性?
面向Python与C++语言环境的易读流水线API及应用程序构建器
我们已将高通智能多媒体SDK核心内容整合至单一的公开GitHub仓库中,包含以下三类核心组件:
GStreamer插件:高通智能多媒体SDK的底层基础是一套GStreamer的多媒体与AI框架,搭载高通硬件加速插件、零拷贝数据通路,可灵活支持多流、多模型流水线。
应用程序构建器:针对不具备深厚GStreamer专业能力的开发团队,高通智能多媒体SDK 2.0在上述框架基础上扩展了Python与C++语言环境的应用程序构建器,支持开发者直接使用对应语言开展开发工作(参看下文)。
开发者工具:该GitHub仓库还包括各类实用工具、命令行辅助程序、代码、示例及应用程序构建工具。
文档即代码
高通智能多媒体SDK 2.0将文档视为与对应代码仓库直接关联的代码,确保示例代码、API指南、流水线操作说明与实现资产完全匹配。
您会发现,该文档侧重于操作指南和蓝图,旨在帮助您理解如何组合可用组件以构建完整的应用程序工作流。
此外,该文档通过专用的公开GitHub仓库和高通外部IMSDK网站进行发布。
编码智能体Skill
高通智能多媒体SDK 2.0通过GitHub将自身能力封装为可复用的编码代理技能。该编码智能体让您能够在以代码为核心的智能体式工作流中搭建端到端AI应用程序,其中包括编译、运行、调试与部署所需要的全部配套任务。
您可以从常用的编码代理(例如:Claude Code)中直接安装或引用这些技能,随后通过自然语言提示词与代码工作流创建高通智能多媒体SDK应用程序、配置流水线、开发插件、接入AI模型、完成后处理并排查集成问题。这些技能的核心作用是帮助编码智能体精准理解高通智能多媒体SDK的API、插件、微服务与部署要求,以自动生成并连接各个组件。
选择您的推理运行时,选择您的模型
多推理运行时
利用IMSDK 2.0,您可以更换模型和/或推理路由,且无需为其周边的摄像头、多媒体、分析与部署流水线重新编码。
如下图所示,运行时推理插件支持QAIRT、ONNX运行时、TFLite等多种推理运行时。您可以选择最适配自身工作流与产品的运行时,同时保持上层多媒体与应用流水线(附图5第一行)完全不变。

附图4:AI运行时与后端选项。
您也可以将各类运行时映射至CPU、GPU或NPU(附图5最后一行)。这样可确保您在使用高通AI运行时SDK(QAIRT)、ONNX、TFLite等运行时处理视觉与生成式AI模型时,拥有极高的灵活度。
除AI阶段外,高通智能多媒体SDK还支持周边步骤,包括:模型输入准备、图像变换、批处理、推理、张量后处理、元数据组合、叠加层渲染、数据分析与动作执行。
多模型来源
利用高通智能多媒体SDK 2.0,您可以选择自己的模型来源渠道与模型开发路径。
- 高通AI中心可帮助您选择针对您的目标高通平台优化过的模型。您可以在其中获取编译选项、运行时支持,以及性能与精度测试结果。
- 高通技术公司在抱抱脸平台的页面包含了高通发布的各类模型,并可将您接入更广泛的开源模型生态系统。
- 针对工业及特定领域应用场景,利用Edge Impulse开发平台,您可以采集、标注自有数据,完成模型训练,并针对边缘侧部署场景对这些模型进行优化。
- 最后,您还可以使用自带模型(BYOM)功能,导入您专有的或从外部获取的模型。高通AI中心的参考方案以及适用的高通工作流程(包括转换、量化或精度选择、编译、执行测试和准确性验证)可以帮助您为所选的运行时环境和目标平台准备好模型。
流水线API让AI与多媒体代码更易读
如上文所述,利用面向Python和C++语言环境的流水线API,您可以针对自身正在构建的流水线对应用程序进行描述,覆盖从流水线创建到全生命周期管理的完整流程。具有可读性的流水线更易于审核、调试、修改、向其他工程师讲解,也更容易从原型阶段迭代扩展为产品。
Python:加速实验验证
选用高通智能多媒体SDK Python应用程序构建工具,即可在高通平台上通过Python语言环境完成多媒体与AI流水线的构建、运行和管理。该工具在GStreamer之上提供了一个高级抽象层面,确保您可以专注于应用逻辑本身,而非底层框架细节。
实现生产集成的C++语言环境
C++语言流水线API将这套结构化开发模型引入对原生性能、紧密产品集成以及生命周期与执行过程显式控制有要求的应用。开发者无需直接实现GStreamer的全部底层细节,即可使用该应用构建工具完成开发。
下表对高通智能多媒体SDK 2.0流水线API与传统集成方法进行了对比:
| 关注问题 | 传统方法 | 高通智能多媒体SDK 2.0流水线API |
| 流程表达 | 大量底层对象、属性、回调函数,以及框架专属的设置步骤。 | 流水线结构清晰可见:创建、添加、连接、配置、运行。 |
| 学习曲线 | 开发者在构建应用程序前,需要掌握多媒体框架的深度知识。 | Python与C++语言应用程序构建工具提供了更高层次的开发起点。 |
| 可读性 | 应用程序的意图可以分散在初始化代码与各类辅助代码中。 | 数据流与组件间的关联关系很容易在同一地点查看。 |
| 更换模型 | 更改推理时,需要同步调整模型加载、缓冲区、预处理、输出处理等多个环节。 | 推理组件可直接替换,同时周边流水线结构仍保持可识别状态。 |
| 调试 | 故障点可能分散在框架调用链路与运行时配置的各个位置。 | 利用结构化流水线可以轻松隔离需要注意的阶段。 |
| 部署落地 | 构建、打包及目标设备部署等步骤可能成为单独的额外集成工作。 | 该SDK生态系统将应用程序构建与部署、Docker、智能编码代理、设备在环工作流连接在一起。 |
What’s in the Pipeline APIs for you?
流水线API为你带来什么?
全新API旨在降低非本质复杂性,确保您能够专注于应用程序的核心功能,同时由框架提供统一的流水线构建方式。
- 无需掌握GStreamer专业知识:高通智能多媒体SDK 2.0在内部管理所有底层GStreamer机制,而编译期并不依赖GStreamer头文件。
- 快速开发流水线:仅需几行Python或C++语言代码,您就能编写出从摄像头到画面显示的完整流水线。
- AI推理支持:高通智能多媒体SDK 2.0包含针对TFLite、QNN、SNPE、ONNX模型的内置二进制文件,同时支持自定义预处理与后处理。
- 两种流水线定义方式:可以利用Python或C++语言API(add() / link()调用)以编程方式定义流水线,或利用传递至流水线构造函数的YAML配置文件以声明方式定义流水线。
- 广泛的多媒体灵活性:高通智能多媒体SDK 2.0支持视频采集、信号处理、机器学习推理、叠加渲染、显示输出等全链路多媒体能力。
后续步骤
如果您在高通边缘侧平台上开发、搭建并部署AI与多媒体产品,高通智能多媒体SDK 2.0提供了构建模块,以帮助您专注于应用程序本身的构建,而非集成工作。
参看其他开发者如何将高通智能多媒体SDK应用于缺陷检测、工厂数字孪生和作业人员安全防护,然后查阅相关文档。
准备就绪后,您可从软件中心获取高通智能多媒体SDK 2.0。
高通品牌产品均为高通技术公司和/或其子公司的产品。
在所发布内容中表达的观点仅为原作者的个人观点,并不代表高通技术公司或其子公司(以下简称为“高通”)的观点。所提供的内容仅供参考之用,而并不意味着高通技术公司或任何其他方的赞同或表述。本网站也可能提供非高通技术公司网站和资源的链接或参考。高通技术公司对于可能通过本网站引用、访问或链接的任何非高通技术公司网站或第三方资源,高通不做出任何类型的任何声明、保证或其他承诺。
关于作者
阿米特·马特,产品管理总监
更多推荐





所有评论(0)