惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
H
Help Net Security
云风的 BLOG
云风的 BLOG
Apple Machine Learning Research
Apple Machine Learning Research
H
Hackread – Cybersecurity News, Data Breaches, AI and More
Hugging Face - Blog
Hugging Face - Blog
博客园_首页
D
Docker
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
Blog — PlanetScale
Blog — PlanetScale
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
GbyAI
GbyAI
博客园 - Franky
B
Blog RSS Feed
Stack Overflow Blog
Stack Overflow Blog
L
LangChain Blog
量子位
V
Visual Studio Blog
Y
Y Combinator Blog
小众软件
小众软件
N
Netflix TechBlog - Medium
博客园 - 三生石上(FineUI控件)
Microsoft Security Blog
Microsoft Security Blog
雷峰网
雷峰网

博客园 - iNeuOS工业互联网系统

iNeuOS工业互联网操作系统,重要更新:性能优化、安全漏洞与BUG修复,远程控制响应效率大幅提升 SOP合规分析+多模态 VLM 工况理解,工业作业复杂工况识别与智能理解实践 多模态知识库,打通文本、图像与视频资源的协同实践与应用 双模型引擎协同:基于 YOLO + 多模态 VLM 的目标检测、语义理解与 SOP 合规分析复合工业场景实践与应用 一名初一学生用AI开发《末日突围》3D游戏的实践过程,Visual Studio Code+DeepSeek+GPT iNeuOS_Vision_视觉分析,增加SAM3模型对实例分割和目标检测AI自动标注图片样本功能 iNeuOS_AiMind+Ollama(Embedding 和 VLM 模型)+DeepSeek 打造专业大模型知识库 打造工业版 WorkBuddy,基于 iNeuOS 工业互联网框架体系 重磅发布 19 个视觉分析模型,涉及厂区消防安全、人员作业合规、工业设备与管线巡检、电子精密质检和农业种植监测等 10 大主流场景 iNeuOS 发布人工智能助手:小i助手,所问即所答,面向运维、工艺、管理人员提供一站式 AI 赋能 基于物联网、时序模型、大模型和智能问数,设备预测性维护应用案例 基于iNeuOS物联网(IOT)和AiInsight智能问数,【数据统计智能体】的构建和应用 [免费试用] iNeuOS_Vision视觉分析在SOP标准工作操作规程的应用 找了一个Token渠道,全球顶级模型,在vscode的配置及应用。 基于大模型、AiInsight问数框架的高炉冶炼智能体研究与应用(面向高炉历史诊断、目标优化与生产决策辅助) GitHub Copilot 新版计费翻车:2天消耗49美元,天价引爆开发者吐槽,国产开源 AI 迎来替代窗口期 iNeuOS_AiInsight·数智灵鉴(Text2SQL/NL2SQL自然语言大模型智能问数),免费下载试用 基于iNeuOS_Vision视觉分析的生产操作规范实时识别监测及预警系统 基于多模态视觉模型和图文向量模型的工业图像知识库研究与应用 iNeuOS,从单一产品向产品族生态演进,物联网(IOT)、视觉分析(Vision)、大模型智库(AiMind·心智灵慧) AI/Vibe Coding,本质是软件人工时代向软件工业时代发展 iNeuOS工业互联网操作系统集成大模型智库(iNeuOS_AiMind·心智灵慧) iNeuOS工业互联网操作系统无缝集成视觉分析(iNeuOS_Vision_Detect) 基于vibe coding,1个人的软件工程学(30+万行代码) 开源:iNeuOS_Doctor,一款基于人工智能在医疗领域的病情咨询及医学影像分析平台,例如CT\X光片\病理成像\诊断病历等 - iNeuOS工业互联网系统 - 博客园 iNeuOS Vision Detect机器视觉模型应用管理平台,在钢铁、煤炭、矿山、稀土、机械加工、农业种植等领域应用。 AI辅助编程系统工程的注意事项-程序员从“农耕”走向“魔法”的时代 基于Ai Coding,20天完成一个基于大模型的医学分析系统:Ai体征分析助手 iNeuOS工业互联网操作系统,实现能源管理及应用案例 基于DeepSeek-R1 15b微调训练自主的领域大模型,附带工程代码
SmolVLM2轻量级视频多模态模型,应用效果测评(风景、事故、仿...
iNeuOS工业互联网系统 · 2025-05-29 · via 博客园 - iNeuOS工业互联网系统

SmolVLM2轻量级视频多模态模型,应用效果测评

目       录

1.     前言... 2

2.     应用部署... 2

3.     应用效果... 4

1.1          风景图像理解... 4

1.2          事故现场理解... 5

1.3          仿真图像理解... 6

1.4          数量统计描述... 7

1.5          图像文字理解... 8

1.6          物体识别理解... 10

4.     待解决问题... 11

5.     结论... 11

1.     前言

  SmolVLM2 是由 Hugging Face 开发的一系列紧凑型但功能强大的大型模型,旨在为资源受限的设备(如智能手机和嵌入式系统)带来先进的语言和视觉语言处理能力。这些模型以其小型化设计著称,适合在设备上运行,填补了大型模型与小型设备性能差距的空白。本文将详细介绍这两个系列的背景、技术细节、性能和应用,旨在为研究者和开发者提供全面的理解。

  SmolVLM2 扩展了 Smol 系列的能力,专注于视觉语言任务,可处理视频、图像和文本输入,生成文本输出。模型提供三种参数规模:2.2B、500M 和 256M,旨在实现高效的多模态处理。相较于前代产品,新版 22 亿模型在图像数学解题、图片文字识别、复杂图表解析和科学视觉问答方面表现显著提升。

2.     应用部署

模型下载:HuggingFaceTB/SmolVLM2-2.2B-Instruct · Hugging Face

from transformers import AutoProcessor, AutoModelForImageTextToText
import torch

DEVICE = "cuda" if torch.cuda.is_available() else "cpu"
print(DEVICE)
model_path = "models/SmolVLM2-2.2B-Instruct"
processor = AutoProcessor.from_pretrained(model_path)
model = AutoModelForImageTextToText.from_pretrained(
    model_path,
    torch_dtype=torch.bfloat16,
    _attn_implementation="flash_attention_2" if DEVICE == "cuda" else "eager",
   device_map="cuda").to(DEVICE)
#model = AutoModelForImageTextToText.from_pretrained(
#    model_path,
#    torch_dtype=torch.bfloat16,
#   _attn_implementation="flash_attention_2" if DEVICE == "cuda" else "eager").to(DEVICE)

messages = [
    {
        "role": "user",
        "content": [
            {"type": "image", "url": "5.png"},
            {"type": "text", "text": "结合图像上的内容,请问简单iNeuOS是什么?"},
        ]
    },
]

inputs = processor.apply_chat_template(
    messages,
    add_generation_prompt=True,
    tokenize=True,
    return_dict=True,
    return_tensors="pt",
).to(model.device, dtype=torch.bfloat16)

generated_ids = model.generate(**inputs, do_sample=False, max_new_tokens=5000)
generated_texts = processor.batch_decode(
    generated_ids,
    skip_special_tokens=True,
)
print(generated_texts[0])

3.     应用效果

1.1       风景图像理解

User:请描述这张图像?

Assistant: 这张图片是一张美丽的花朵照片,其中主要的是一棵树的枝条和花朵。树枝的颜色是深红色,而花朵的颜色是白色和红色。树枝上有一层雪,雪的颜色是白色,这使得树枝和花朵的颜色显得更加美丽。花朵的颜色是红色和白色,这使得花朵的颜色显得更加独特。这张图片的背景是白色的,这使得树枝和花朵的颜色更加显得突出。这张图片的风格是美丽和美感的,它让人感受到花朵的美丽和树枝的美丽。

1.2       事故现场理解

User:请描述这个事故现场?

Assistant: 这是一次火灾事故的事实场景,其中包含一个大型的炉子和一个高的柱子。炉子的外壁是灰色的,而柱子的外壁是黑色的。(注:后面有冗余的回复

1.3       仿真图像理解

User:这是温度场仿真,请描述温度变化趋势?

Assistant: 温度变化趋势可以从图像中看出,温度在右侧高于左侧,这表明右侧的温度更高,左侧的温度更低。(注:后面有冗余和重复数据

1.4       数量统计描述

User:这是虾苗养殖图像,请分析虾苗数量?

Assistant: 虾苗数量为1000多个。

1.5       图像文字理解

User:结合图像上的内容,请问简单iNeuOS是什么?

Assistant: iNeuOS是一种操作系统,它是一种高级的操作系统,它可以被用来管理和管理计算机的系统,包括内存、硬盘和网络等。(注:后面是冗余和重复的数据

User:图像上的文字是什么?

Assistant: 这是一个英文和中文的图像,其中包含一些文字和图片。图像的左侧有一些英文文字,包括"iNeuOS"、"OS"和"NeuOS"。(注:毕竟不是OCR,所以文字识别和提取有限

1.6       物体识别理解

User:图像上的铅笔有多长?

Assistant: 铅笔的长度是约10厘米。(注:实际长度为14.7厘米

4.     待解决问题

问题:模型在回复的时候有冗余和重复的内容。

可能的原因:(1)提示词需求进行优化;(2)程序参数设置的问题。暂时还没有进一步测试。

5.     结论

  测试比我预想的要好很多,但是针对特定应用场景,特别是工业领域,需要进一步调优。


物联网&大数据技术 QQ群:54256083

物联网&大数据项目 QQ群:727664080

QQ:504547114

微信:wxzz0151

博客:https://www.cnblogs.com/lsjwq