惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

N
Netflix TechBlog - Medium
T
The Blog of Author Tim Ferriss
aimingoo的专栏
aimingoo的专栏
A
About on SuperTechFans
Stack Overflow Blog
Stack Overflow Blog
B
Blog RSS Feed
Microsoft Security Blog
Microsoft Security Blog
H
Hackread – Cybersecurity News, Data Breaches, AI and More
人人都是产品经理
人人都是产品经理
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
J
Java Code Geeks
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
B
Blog
MongoDB | Blog
MongoDB | Blog
L
LangChain Blog
WordPress大学
WordPress大学
小众软件
小众软件
IT之家
IT之家
腾讯CDC
月光博客
月光博客
量子位
Blog — PlanetScale
Blog — PlanetScale
P
Proofpoint News Feed
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More

LINUX DO - 最新话题

谷歌云盘下载700g数据集,求方法 OpenAI推出了100美元的Pro订阅后,plus的Codex 5小时限额大幅缩水 之前买的super grok居然还没掉 关于CPA认证文件周限 佬们,默认CDK的要求是什么等级啊? 最新版本的微信群聊机器人方案 有没有人知道如何free号没有封,那么是否可以循环使用,因为我看主要是周限 L站改版了?吓我一跳,我以为我浏览器崩了 淘宝这种宽带可信吗,500兆移动宽带月费8元到2099年 docker内部应用访问宿主机mysql和redis时被拒绝connection refuse Erp全栈想转行做Ai有什么推荐的吗 boost有bug 佬们,有没有靠谱点的 Plus 购买渠道 大妈,狗妈用的 lg 服务有源头开源项目吗? 有人有能过验证码打码的嘛 上次帖里好像发过通过大模型来打码的 gpt plus 封号似乎也太快了点,一天就给封号了 按流量/token收费的国产官方AI推荐 我算是知道了为什么Oracle总是ABC了 佬友们帮我分析一下 ChatGPT Team账号只有一个人使用和4个席位邀请满了使用的总额度是一样的吗? gpt-free 10个带rt CPA反代claude是默认1m吗? 我终于敢说我做出来windows上tmux的替代了,目标windows/全平台最强的终端Ai编程工具 claude pro升级max,除了原来的$20,好像还能再领一次$100 关于AI agent的知识框架 独乐乐不如众乐乐,分享一下我的的AI对话程序 佬们自建网站支付问题是怎么解决的 怎么能让gpt模仿claude风格输出 codex free已经死了,下一个会是plus或者team吗 请问chatgpt pro里的fast模式,速度快了,降智吗
【开源】视觉理解和视觉回答 - 以乐高积木AI拼搭为例子 - 我...
liangdabiao (liangdabiao) · 2026-05-06 · via LINUX DO - 最新话题

本帖使用社区开源推广,符合推广要求。我申明并遵循社区要求的以下内容:

  • 我的帖子已经打上 开源推广 标签:
  • 我的开源项目完整开源,无未开源部分:
  • 我的开源项目已链接认可 LINUX DO 社区:
  • 我帖子内的项目介绍,AI生成、润色内容部分已截图发出:
  • 以上选择我承诺是永久有效的,接受社区和佬友监督:

以下为项目介绍正文内容,AI生成、润色内容已使用截图方式发出


昨天在linux.do发布新开源项目:【开源】又一个好东西:基于多模态 Embedding + Zilliz + Qwen 视觉理解的多模态 RAG 系统
佬友有意见,我觉得加上展示效果,实战案例,可能更好的表达效果:

视觉理解和视觉回答 - 乐高积木AI拼搭

开源地址:GitHub - liangdabiao/Multimodal-RAG: 基于多模态 Embedding + Zilliz + Qwen 视觉理解的多模态 RAG 系统。支持 **Cohere / DashScope Embedding** 和 **DashScope / OpenRouter LLM** 双引擎切换。上传 PDF,用自然语言提问,系统自动检索最相关的页面并由 AI 生成回答。 与传统 RAG 不同,本系统**不做文本提取和 OCR**,而是直接将 PDF 页面当作图片处理,通过视觉 Embedding 模型编码,完整保留表格、图表、排版、手写批注等所有视觉信息。 · GitHub

基于多模态 Embedding + Zilliz + Qwen 视觉理解的多模态 RAG 系统。支持 **Cohere / DashScope Embedding** 和 **DashScope / OpenRouter LLM** 双引擎切换。上传 PDF,用自然语言提问,系统自动检索最相关的页面并由 AI 生成回答。与传统 RAG 不同,本系统**不做文本提取和 OCR**,而是直接将 PDF 页面当作图片处理,通过视觉 Embedding 模型编码,完整保留表格、图表、排版、手写批注等所有视觉信息。

以下为测试和演示效果:

怎样搭建窗户

pic_8e313c96.png

怎样搭建各种墙壁

pic_fcfc2631.png

怎样搭建一个桥

pic_685aa91d.png

帮忙搭建一个法拉利跑车

pic_efe2ce01.png
pic_267e4ac2.png

怎样搭建一个屋顶

pic_26b7efb6.png

各种屋顶

pic_96ba6195.png
pic_ae5fb24c.png

怎样搭建一个飞机

pic_6fa6d739.png
pic_cef6174e.png

查找红色 的跑车

pic_c06bc07b.png
pic_0e770d03.png

搭建直升飞机

pic_097f3866.png
pic_8361d70b.png
pic_4ad3148e.png

搭建 微型城市小车

pic_c9419a2c.png
pic_c23e5c27.png
pic_900f24a9.png

搭建模块化街景

pic_2ea9ce77.png
pic_b6373258.png

搭建街景路灯

pic_f9e505c0.png

搭建英国风格建筑

pic_2a388345.png

搭建古典主义建筑

pic_79d38671.png
pic_9ad54122.png

搭建中国风格建筑

pic_56f3a340.png

搭建动物

pic_4d7c2461.png

各种snot技巧:

pic_fba16b02.png
pic_96c0197f.png

感谢佬友支持!

qqppp (Grey) 2

这个视觉理解是不是也可以结合【开源】男人的拼豆-DIY乐高马赛克像素画生成器-有微信小程序版本-AI风格优化 这个项目,当用户做到哪一步进行不下去了,拍照上传,ai为他下个步骤做提示。

liangdabiao (liangdabiao) 3

没有往这个方向的ai去搞,我下一个方向可能是,让AI从相关资料,图文等等,学习理解了,然后利用 gpt-image-2 直接生成理解后的图文答案,不知道效果怎样,这就需要gpt是不是非常懂乐高积木了,这个我不确定,但是会试试

qqppp (Grey) 4

那天用claude研究过生成图纸需求,让ai去调研,就有提到这方面这个方向 :grinning_face_with_smiling_eyes: