首页 → / 核心技术 → / 多模态理解与端侧演进

多模态理解与端侧演进

让检测结果进入更丰富的场景理解,按实际设备与服务条件选择部署。

即合智能 AI 核心 / 多模态演进

视觉基础 → 更丰富的现场理解

在现有视觉任务基础上探索更多输入与模型能力;部署方式、任务范围与设备适配按实际研发进展确认。

JIHE · TECHNOLOGY IN APPLICATION

设备 AI 技术架构

以端侧视觉能力为基础,持续研发面向设备的感知、任务判断与接口协同能力。

现场信息处理架构

现场信息处理架构
功能逻辑示意 · 具体能力与接口以产品配置为准

感知输入

视频提供目标、位置及变化信息。

任务组织

通过区域、时段和持续条件形成业务判断。

结果连接

将事件输出至人员通知、平台或适配设备。

PRODUCT & TECHNOLOGY

多模态理解与端侧演进

让检测结果进入更丰富的场景理解,按实际设备与服务条件选择部署。

01持续检测形成候选事件02组织证据画面、时间和上下文03多模态复核配置对应AI服务04人工处理核查并记录结论
检测与复核协同 · 流程示意

不同部署形态,承担不同工作

部署方式适用考虑需确认条件
盒子本地视觉任务持续执行明确的检测与规则能力、算力与视频条件
企业内网模型服务在企业环境内组织进一步复核模型服务、网络、权限和计算资源
约定远程模型服务按需调用复核服务数据范围、连通性和服务配置
端侧多模态探索让更多理解能力进入设备内存、模型适配、效果与延迟评测

场景理解需要具体证据

“发生了什么”应围绕事件画面、来源任务、时间与业务条件回答。缺少前后过程时,不能将单帧理解当成已证明的因果关系。

自然语言入口需要可执行任务

把人的描述转为任务前,需要检查设备实际具备哪些能力、摄像头在哪里、条件能否表达。将可执行方案交给用户确认,是从理解需求到现场运行的必要环节。

端侧模型仍需工程验证

模型大小、量化精度、输入形式和硬件资源都会影响结果。模型适配效果应通过目标设备上的测试确认,性能指标与测试条件一同提供。