惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

罗磊的独立博客
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
博客园 - 三生石上(FineUI控件)
Hugging Face - Blog
Hugging Face - Blog
小众软件
小众软件
量子位
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
IT之家
IT之家
V
V2EX
阮一峰的网络日志
阮一峰的网络日志
爱范儿
爱范儿
人人都是产品经理
人人都是产品经理
博客园 - Franky
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
博客园_首页
V
Visual Studio Blog
Last Week in AI
Last Week in AI
有赞技术团队
有赞技术团队
WordPress大学
WordPress大学
博客园 - 司徒正美
大猫的无限游戏
大猫的无限游戏
博客园 - 【当耐特】
MyScale Blog
MyScale Blog
月光博客
月光博客

秋码分享

我是如何解决将 c++ 编译成可以在 node.js 中使用的 *.node,中间出现的一大堆问题的(指纹浏览器基石篇) eSIM Plus 爱沙尼亚手机号彻底翻车?“永久有效”悄然变成了一年! 接码平台 SMS-Activate 余额可以转移到新平台使用,截止日期:2026年1月29日 是时候将 hugo-theme-kiwi 主题提交到 themes.gohugo.io 站点上了 Flux2 刚开源就凉了?Z-Image 本地部署狠狠打了个样 声音的未来:Chatterbox —— 用「夸张度旋钮」提升表现力的开源 TTS 向导 还以为那只是换个背景?Qwen-Image-Edit 在 ComfyUI 中能做到更离谱的事 Windows 结合最新版 ComfyUI 部署阿里最新开源的 Qwen-Image 图像大模型 从零样本到跨场景:Seed-VC语音转换技术的革命性突破 大语音模型轻量化革命:MegaTTS3 如何重新定义文本生成语音的技术边界(windows篇) 竞赛级编程大模型OlympicCoder-7B之本地部署(Windows篇) 阿里开源了端到端全模态大模型Qwen-2.5-Omini-7B之本地部署(windows篇) 语音识别之whisper本地部署(实时语音之开篇) 甭管是个人还是企业都能部署的Mistral-Small3.1,远超同级别的模型 文生音乐开源项目DiffRhythm,8G显存本地部署之Windows篇 阿里QwQ-32B本地部署指南:用Ollama轻松运行320亿参数大模型 基于Qwen2.5大模型的Spark-TTS,零样本语音克隆,CPU可运行之本地部署(Windows篇) 基于歌词生成整首歌的开源AI音乐模型,支持中、英、日、韩等多种语言,本地化部署YuE(windows篇) 阿里云开源的文生视频万相 Wan2.1之本地部署Wan2.1-T2V-1.3B模型 互动式开源AI图像编辑神器,Windows11本地部署 MagicQuill 本地部署Qwen2.5-VL-7B-Instruct多模态视觉大模型(Windows篇) 保持角色一致性的绘本生成AI开源项目之Story-Adapter本地部署Windows篇 本地部署 Stable Diffusion 3.5(最新 ComfyUI记录篇) 谁说Win7安装不了Node.js最新版的呢?都2025年,还不更新系统到Win11 vs code远程调试Linux服务器上的php代码 浏览器定制 | Windows11 编译 Chromium 133.0.6885.0(截稿前Chromium最新版之编译篇[一]) 不说是彻底搞懂,至少让你不再惧怕c/c++指针,以及各种奇葩指针变种 解决windows下php8.x及以上版本,在Apache2.4中无法加载CURL扩展的问题 在 Windows8.1 下编译 Chromium (103.0.5060.68 之三) 安装 depot_tools 和 Windows 10 SDK 为在Windows下构建基于 chromium 的浏览器(103.0.5060.68 之二)
智谱开源了文生图CogView4-6B模型,支持中文提示词之本地部署...
一个游离于山间之上的江湖漫行者。A jungle wanderer who wanders above the mountain · 2025-03-07 · via 秋码分享

文生图这个领域里,甭管是开源的Stable Diffusion 3.5,还是闭源的在线绘图平台Midjourney,一度都是不支持中文提示词。

prompt都不支持中文,就别提想要在图中写入中文

虽然SD3.5Midjourney等优秀绘画模型不支持中文提示词,但国内各大厂商一直致力于中文提示词。

CogView4-6B是智谱AI(Zhipu AI)推出的文生图模型,通过结合文本与图像的跨模态生成技术,在中文场景下展现出显著优势。

本地部署

那么,接下来,我们就在本地电脑部署下CogView4-6B这款开源的绘画模型,看看效果是否真有其官方宣传的那么好。

创建虚拟环境

首先,我们创建个python虚拟环境,你可以使用anacondaminiconda来创建虚拟环境。我还是使用python3自带的venv模块搭建的虚拟环境。

我电脑使用的python版本为python 3.10.9,当然你也可以使用python 3.11

python -m venv CogView4-env
cd CogView4-env\Scripts
activate

image-20250306205008542

clone 推理代码及下载模型

git clone https://github.com/THUDM/CogView4
cd CogView4

# 根据自身网络条件 选择以下任一方式来下载模型。
# modelscope
git clone https://www.modelscope.cn/ZhipuAI/CogView4-6B.git
# Huggingface.co
git clone https://huggingface.co/THUDM/CogView4-6B

image-20250306220752257

安装项目所需依赖

其实,如果按照官方的,也就是执行以下这行命令,是无法启动项目的。

pip install -r inference/requirements.txt

image-20250306221135572

按照requirements.txt的依赖来安装torchCPU版本,并不支持GPU,所以我们需要uninstall这个不带GPU版本的torch以及torchao

image-20250306224521933

如果你电脑的显存低于12G的话,那么需要设置set MODE=1

image-20250307213300060

image-20250306222355282

然而,在Terminal下载torchCUDA版本,下载速度总是那么不尽如人意。

image-20250306223548708

那么,我们可以直接去https://download.pytorch.org/whl/torch 下载 对应的whl文件。

image-20250306223905705

image-20250306223621222

我们直接在Terminal直接pip install torch-xxx.whl

image-20250306224141919

卸载CPU版的torchao,安装带有CUDA版本的torchao

image-20250306224758564

运行 inference/gradio_web_demo.py

当我们安装好了CUDA版的torchtorchao后,再次执行python inference/gradio_web_demo.py

会为我们自动在默认浏览器打开一个页签,如下图。

我这里使用了官方的prompt,只是把Happy New Year改成了新春快乐,看看是不是能真正的写上中文字。

为了出图快点,我只修改了图片的widthheight,其他都是默认的,然而,生成的图片,图中的中文文字却了。

image-20250307205026259