惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

月光博客
月光博客
J
Java Code Geeks
F
Fortinet All Blogs
Blog — PlanetScale
Blog — PlanetScale
P
Proofpoint News Feed
U
Unit 42
B
Blog
宝玉的分享
宝玉的分享
腾讯CDC
Microsoft Azure Blog
Microsoft Azure Blog
酷 壳 – CoolShell
酷 壳 – CoolShell
Last Week in AI
Last Week in AI
博客园 - Franky
博客园 - 三生石上(FineUI控件)
人人都是产品经理
人人都是产品经理
Martin Fowler
Martin Fowler
博客园_首页
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
云风的 BLOG
云风的 BLOG
L
LangChain Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
Y
Y Combinator Blog
The GitHub Blog
The GitHub Blog
博客园 - 叶小钗

博客园_首页

Linux实操--组管理、权限管理和定时任务 Java + EasyExcel 实现单个接口导出多个Excel Mem0 源码解析系列(二):提示词工程的深度剖析 Openclaw TaskFlow究竟是什么?和普通Skill技能有什么区别 博文阅读密码验证 - 博客园 嘉立创开源:应该是全网MicroPython教程最多的开发板 Hermes Agent 集成实践:从协议到生产 2026年AI编程工具横评:Cursor、Codex、Claude Code、Zed、Windsurf Java程序员必看的RAG入门教程 2026 AI效率神器:Superpowers + Claude Code 保姆级教程 本地大模型部署全攻略:从 0 到 1 玩转 Ollama 【从0到1构建一个ClaudeAgent】内存管理-上下文压缩 .NET 高级开发 | 设计、实现一个事件总线框架 电子小白入门之NE555 3. WorkBuddy:隐藏玩法,一键召唤专家,让 AI 以"专家身份"给你干活 和AI一起搞事情#3:Claude Teammate 游戏开发翻车实录 【OpenClaw】通过 Nanobot 源码学习架构---(7)Memory C# .NET 周刊|2026年3月3期 我在 Debian 11 上把 K8s 单机搭起来了,过程没你想的那么顺(/opt 目录版) 深度学习进阶(七)Data-efficient Image Transformer CLI+Skill搭建浏览器AI自动化框架,告别一切重复枯燥任务 告别Token账单无底洞:OpenClaw本地部署,重塑企业数据主权的唯一解 FastAPI+Vue:文件分片上传+秒传+断点续传,这坑我帮你踩平了! SBTI 爆火后,我做了个程序员版的 CBTI。。已开源 + 附开发过程 多模态检索开始进入工程期:用 Sentence Transformers 搭建可落地的 Multimodal RAG 100多行代码实现一个最简单的Agent(用ReAct) Claude Code 通关手册(八):推荐 5 个 Hooks,代码质量提升 3 倍 老板:“有人截图了!”。安全部门:“收到,马上查暗水印!” - why技术 技术之外,皆是人间 C#/.NET/.NET Core技术前沿周刊 | 第 69 期(2026年4.01-4.12)
16. LangChain ChatPromptTemplate多模态应用实战
老陈说编程 · 2026-05-16 · via 博客园_首页

多模态 AI 是具备全感官交互能力的智能系统,集感知、理解、内容生成于一体,全面支持文本、图片、音频、视频等多类型信息的输入输出。

喜欢看视频的,请看《16. LangChain ChatPromptTemplate多模态应用实战》

image

 在实际开发过程中,LangChain框架为多模态交互提供了便捷的支持,其中ChatPromptTemplate组件就原生具备多模态消息格式化的能力,无需额外进行复杂的配置,就能轻松对接多类型输入,大大降低了多模态应用的开发门槛。

image

 实际使用时,我们可以以图片模态为例熟悉具体用法,需要说明的是,图片模态的调用逻辑和写法,与其他模态完全一致,掌握一种就能举一反三,无需重复学习不同模态的调用方式。

image

 该模板在参数注入上也具备很高的灵活性,支持将图片的URL链接、Base64编码,以及本地文件路径等多种形式,作为参数动态注入到模板中,适配不同的开发场景需求,无论是在线图片还是本地图片,都能轻松处理。

prompt_template = ChatPromptTemplate.from_messages([
    {"role": "system", "content": "你是专业的多模态内容分析助手"},
    {"role": "user", "content": [
        {"type": "text", "text": "用中文简短描述图片内容"},
{"type": "image_url", "image_url": {"url": "{image_url}"}}
    ]}
])
prompt_value = prompt_template.invoke(
    {
        "image_url": "图片地址"
    }
)

了解完基础用法后,就进入实战环节,我们可以通过具体的开发案例,感受多模态AI的实际应用价值,将理论知识转化为可落地的功能。

from langchain_core.prompts import ChatPromptTemplate
 
prompt_template = ChatPromptTemplate.from_messages([
    {"role": "system", "content": "你是专业的多模态内容分析助手"},
    {"role": "user", "content": [
        {"type": "text", "text": "用中文简短描述图片内容"},
{"type": "image_url", "image_url": {"url": "{image_url}"}}
    ]}
])
prompt_value = prompt_template.invoke(
    {
        "image_url": "图片地址"
    }
)
res = llm.invoke(prompt_value, config=config)
print(res.content)

在实战中,我们可以将图片识别这一核心功能,集成到基于PySide6开发的AI应用界面中,最终实现对图片中文字、链接等信息的精准识别,让应用具备更实用的交互能力,满足日常开发中的实际需求。完整代码看《16. LangChain ChatPromptTemplate多模态应用实战》