惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

人人都是产品经理
人人都是产品经理
博客园_首页
博客园 - 三生石上(FineUI控件)
V
Visual Studio Blog
Hugging Face - Blog
Hugging Face - Blog
美团技术团队
小众软件
小众软件
T
Tailwind CSS Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
月光博客
月光博客
有赞技术团队
有赞技术团队
WordPress大学
WordPress大学
博客园 - 【当耐特】
Apple Machine Learning Research
Apple Machine Learning Research
罗磊的独立博客
V
V2EX
酷 壳 – CoolShell
酷 壳 – CoolShell
IT之家
IT之家
量子位
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Recent Announcements
Recent Announcements
M
MIT News - Artificial intelligence
阮一峰的网络日志
阮一峰的网络日志
The GitHub Blog
The GitHub Blog

博客园 - iNeuOS工业互联网系统

iNeuOS工业互联网操作系统,重要更新:性能优化、安全漏洞与BUG修复,远程控制响应效率大幅提升 SOP合规分析+多模态 VLM 工况理解,工业作业复杂工况识别与智能理解实践 双模型引擎协同:基于 YOLO + 多模态 VLM 的目标检测、语义理解与 SOP 合规分析复合工业场景实践与应用 一名初一学生用AI开发《末日突围》3D游戏的实践过程,Visual Studio Code+DeepSeek+GPT iNeuOS_Vision_视觉分析,增加SAM3模型对实例分割和目标检测AI自动标注图片样本功能 iNeuOS_AiMind+Ollama(Embedding 和 VLM 模型)+DeepSeek 打造专业大模型知识库 打造工业版 WorkBuddy,基于 iNeuOS 工业互联网框架体系 重磅发布 19 个视觉分析模型,涉及厂区消防安全、人员作业合规、工业设备与管线巡检、电子精密质检和农业种植监测等 10 大主流场景 iNeuOS 发布人工智能助手:小i助手,所问即所答,面向运维、工艺、管理人员提供一站式 AI 赋能 基于物联网、时序模型、大模型和智能问数,设备预测性维护应用案例 基于iNeuOS物联网(IOT)和AiInsight智能问数,【数据统计智能体】的构建和应用 [免费试用] iNeuOS_Vision视觉分析在SOP标准工作操作规程的应用 找了一个Token渠道,全球顶级模型,在vscode的配置及应用。 基于大模型、AiInsight问数框架的高炉冶炼智能体研究与应用(面向高炉历史诊断、目标优化与生产决策辅助) GitHub Copilot 新版计费翻车:2天消耗49美元,天价引爆开发者吐槽,国产开源 AI 迎来替代窗口期 iNeuOS_AiInsight·数智灵鉴(Text2SQL/NL2SQL自然语言大模型智能问数),免费下载试用 基于iNeuOS_Vision视觉分析的生产操作规范实时识别监测及预警系统 基于多模态视觉模型和图文向量模型的工业图像知识库研究与应用 iNeuOS,从单一产品向产品族生态演进,物联网(IOT)、视觉分析(Vision)、大模型智库(AiMind·心智灵慧) AI/Vibe Coding,本质是软件人工时代向软件工业时代发展 iNeuOS工业互联网操作系统集成大模型智库(iNeuOS_AiMind·心智灵慧) iNeuOS工业互联网操作系统无缝集成视觉分析(iNeuOS_Vision_Detect) 基于vibe coding,1个人的软件工程学(30+万行代码) 开源:iNeuOS_Doctor,一款基于人工智能在医疗领域的病情咨询及医学影像分析平台,例如CT\X光片\病理成像\诊断病历等 - iNeuOS工业互联网系统 - 博客园 iNeuOS Vision Detect机器视觉模型应用管理平台,在钢铁、煤炭、矿山、稀土、机械加工、农业种植等领域应用。 AI辅助编程系统工程的注意事项-程序员从“农耕”走向“魔法”的时代 基于Ai Coding,20天完成一个基于大模型的医学分析系统:Ai体征分析助手 iNeuOS工业互联网操作系统,实现能源管理及应用案例 基于DeepSeek-R1 15b微调训练自主的领域大模型,附带工程代码 都在转型,我们能做什么?
多模态知识库,打通文本、图像与视频资源的协同实践与应用
iNeuOS工业互联网系统 · 2026-09-02 · via 博客园 - iNeuOS工业互联网系统

多模态知识库,打通文本、图像与视频资源的协同实践与应用

本文介绍一个支持文本、图像、视频三类资源统一入库与检索的跨模态知识库系统。三类资源经统一向量化后进入同一向量空间,用户只需输入一句自然语言,即可一次性召回三种模态的相关资源,并按类型直观展示。

目 录

1. 背景与痛点.......................................... 2

2. 技术选型............................................ 2

3. 关键参数与调优...................................... 3

4. 效果演示............................................ 3

4.1 知识库样本..................................... 3

4.2 上传文本\图片\视频............................. 4

4.3 检索要回效果................................... 4

5. 局限与展望......................................... 12


1. 背景与痛点

  企业内部的知识与经验以多种形态存在:规章制度、操作手册是文本生产工况设备照片、产品图像、质检图像是图像维修过程、培训录像、生产监控是视频

  传统的知识库难以覆盖这些形态,关键词检索只能匹配文字字段;OCR只能提取图像中的文字,对不含文字的图片(设备状态、产品外观、现场场景)无能为力就算基于大模型视频内容几乎完全无法被检索,只能依赖文件名或人工打标签。

  大模型与嵌入技术能够实现:把不同模态的内容都映射到同一个向量空间中,让“语义相近的内容在空间中被召回”。这样,一句自然语言查询就能同时召回文本、图像和视频,真正实现跨模态检索。

  应用流程示意如下图:

1 

  测试系统应用,如下图:

0.总览

2. 技术选型

  嵌入模型方面,通用多模态嵌入模型(Qwen3.5 底座),支持文本、图像、视频与视觉文档输入,多模态模型的优势在于“一个模型、一个向量空间”:三类内容映射到同一空间,天然支持跨模态互查,无需多模型拼接与空间对齐。

  向量检索引擎方面,选用 FAISS,使用精确内积索引(IndexFlatIP)。归一化向量的内积即余弦相似度,因此检索分数可直接解释为“相似度”。知识库规模不大时,精确索引零调参、结果无近似误差,实现最简单。

3. 关键参数与调优

  系统对外暴露四类可调参数,均可在前端参数面板中直接修改并即时生效:

参数

含义

取值范围

默认值

取帧间隔(秒)

视频采样密度,fps = 1 / 取帧间隔

1 ~ 120

1

Top-K

返回结果数量上限

1 ~ 20

3

相似度阈值

相似度低于该值的结果不返回

0.1 ~ 0.99

0.6

重复内容阈值

结果间余弦相似度达到该值视为重复,只保留一条

0.9 ~ 1.0

0.98

  调优经验:取帧间隔越小,视频采样越密、语义信息越完整,但编码耗时与显存占用随之上升;

  相似度阈值决定召回精度与召回率的平衡,业务对误召回敏感时可适当调高;

  重复内容阈值建议不低于 0.9,避免误删相似但不同的内容。

4. 效果演示

4.1 知识库样本

   有文本、图像和视频类型的资源,有风景、工业场景、灾难、论文、书籍等。如下图:

0.知识库样本

4.2 上传文本\图片\视频

   分别把文本、图像和视频类型的资源上传到知识库,资源并没有使用真实语义的文件名,也就是检索的时候也不可能依据文件名称进行检索。如下图:

1.上传的资料

4.3 检索要回效果

检索文本内容

2.检索文字

检索施工3.检索施工 检索设备

4.检索高炉

检索书籍5.检索书籍

检索灾难6.检索灾难

检索汽车

7.检索汽车

检索风景

8检索风景

检索工人9.检索工厂

检索机器人10.检索机器人

检索火灾

11.检索火灾

检索计量检测单

12.检索计量检测单

检索主控室

13.检索主控室

检索工业设备高炉本体

14.检索高炉炉体

检索一个人正在高炉上施工场景15.检索一个人正在高炉上施工

检索一个人写了一篇论文场景16.检索一个人写了一篇论文,关于软件工程的 

5. 局限与展望

   应用场景方面,本系统可直接服务于:

(1)  制造业生产:设备图片、维修视频、操作手册、生产工况等统一检索,现场“拍张照、说句话”即可定位相关知识;

(2)  电商与内容运营:商品图、种草视频、图文详情一库检索,快速复用素材;

(3)  企业知识管理:会议纪要、培训录像、规章制度统一沉淀,一次提问即可同时获得三种形态的答案。

  多模态知识库的核心价值在于“让知识和场景可被检索”,把散落在文档、图片、视频里的知识,沉淀为统一可查的向量资产,一句话即可触达。

参考文章

(1)硬件网关:https://mp.weixin.qq.com/s/iKMqn62YIhBlXjGtY2wKXQ

(2)物联网(IOT):https://mp.weixin.qq.com/s/5u4L8fItaFpIbVYOlxbmGg

(3)视觉分析(Vision):https://mp.weixin.qq.com/s/SiiuXTTGplTAERRYyCmGCQ

(4)大模型智库(AiMind):https://mp.weixin.qq.com/s/SH_q2k_zbQ-pcd05zj86-g

(5)大模型智能问数(AiInsight): https://mp.weixin.qq.com/s/A1fIQq_w9c8SW9aEWVIsgw

(6)小i助手:https://mp.weixin.qq.com/s/5UCoYsDAbfFP-ZI2sj_QBg

(7)视觉模型:https://mp.weixin.qq.com/s/Gq74ITDfEwK88jt8b--1PA


物联网&大数据技术 QQ群:54256083

物联网&大数据项目 QQ群:727664080

QQ:504547114

image