阿拉丁Aladdin

视觉模型 / 拍不烂 · 自研视觉模型

人员搜索模型

用一句描述, 找到人,关联轨迹。

基于自研视觉模型「拍不烂」,支持以文搜图、以文搜人,以及语音转文字后的检索入口,面向大规模人员搜索、跨场景查找与人员追踪。

文字与语音检索同一人员、跨场景关联轨迹的示意图
模型能力与应用效果示意

输入与数据

文字描述语音转文字现场图像与视频时间与场景条件

MODEL CAPABILITIES

模型能够做什么。

01

以文搜图与搜人

以衣着、行为或场景描述作为检索条件,查找相关图像与人员候选。

02

语音检索入口

把口述条件转为文字,再进入同一条视觉检索流程。

03

大规模人员查找

结合时间、区域与场景缩小搜索范围,定位相关人员与记录。

04

人员追踪与轨迹关联

关联人员在不同片段或场景中的出现记录,辅助查看活动轨迹。

MODEL OUTCOMES

模型如何呈现分析结果。

切换不同能力,查看输入与输出。

能力效果示意

把自然语言描述,变成视觉检索条件。

输入

例如:穿蓝色工服、出现在设备区的人员

视觉模型

模型输出

  • 理解文字描述与场景条件
  • 查找相关图像与人员候选
  • 定位对应时间与场景

示意展示模型的输入与输出,具体效果结合现场数据验证。

APPLICATIONS

进入真实业务场景。

大规模人员搜索

在现场图像与视频记录中按描述查找人员。

园区与矿山人员追踪

关联时间、区域与出现记录,查看人员活动与轨迹。

事件查找与现场复核

按人员特征和场景条件定位相关片段,支持业务复核。

相关项目实践

矿山智能监测与人员轨迹分析

矿山案例展示了人次检测、多目标跟踪、轨迹分析与电子围栏,以及禁区闯入、徘徊和尾随等事件识别,构成人员搜索与跟踪的应用背景。

  • 人员出现记录与轨迹关联
  • 结合区域与事件开展业务分析
了解相关应用

PERFORMANCE & VALIDATION

围绕应用效果进行评估。

同时关注模型表现与现场使用价值。

检索命中效果

按文字与语音描述检查候选命中、排序及无匹配情况。

轨迹关联表现

检查不同视角与场景下的关联、漏匹配和错误匹配。

规模与响应

结合记录规模、检索范围与硬件,评估搜索响应和处理能力。

设备与数据适配

按授权的图像、视频、时间和区域开展检索。语音入口先转为文字,匹配结果保留场景依据以供人工复核。

量化效果依据数据集、模型版本与现场验证条件给出。

交流验证需求