惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

AWS News Blog
AWS News Blog
T
Tenable Blog
Project Zero
Project Zero
T
The Exploit Database - CXSecurity.com
L
LINUX DO - 热门话题
T
Threat Research - Cisco Blogs
T
Threatpost
Security Latest
Security Latest
C
Cisco Blogs
L
Lohrmann on Cybersecurity
S
Security @ Cisco Blogs
Google Online Security Blog
Google Online Security Blog
NISL@THU
NISL@THU
AI
AI
V
Vulnerabilities – Threatpost
Google DeepMind News
Google DeepMind News
C
Cyber Attacks, Cyber Crime and Cyber Security
C
CXSECURITY Database RSS Feed - CXSecurity.com
The Last Watchdog
The Last Watchdog
G
GRAHAM CLULEY
Cloudbric
Cloudbric
H
Hackread – Cybersecurity News, Data Breaches, AI and More
H
Hacker News: Front Page
U
Unit 42
A
Arctic Wolf
CTFtime.org: upcoming CTF events
CTFtime.org: upcoming CTF events
MyScale Blog
MyScale Blog
O
OpenAI News
Scott Helme
Scott Helme
V2EX - 技术
V2EX - 技术
P
Proofpoint News Feed
博客园 - 叶小钗
Hugging Face - Blog
Hugging Face - Blog
云风的 BLOG
云风的 BLOG
V
Visual Studio Blog
Application and Cybersecurity Blog
Application and Cybersecurity Blog
Cyberwarzone
Cyberwarzone
博客园 - 【当耐特】
H
Heimdal Security Blog
S
Schneier on Security
阮一峰的网络日志
阮一峰的网络日志
Help Net Security
Help Net Security
D
DataBreaches.Net
Y
Y Combinator Blog
Hacker News - Newest:
Hacker News - Newest: "LLM"
TaoSecurity Blog
TaoSecurity Blog
K
Kaspersky official blog
N
News and Events Feed by Topic
WordPress大学
WordPress大学
P
Palo Alto Networks Blog

Local LLM

跑本地大模型 电费要多少? - V2EX 多机异构显卡组合推理 - V2EX 本地部署 GLM-5.2 的门槛太高了,根本玩不起! - V2EX 开源了一个 LLM 推理服务监控面板 - V2EX 大模型小白推荐一下本地模型 - V2EX GLM5.2 个人感觉有点被吹大了 - V2EX 有支持 6000 Ada 使用 deepseek v4 flash 推理 的框架吗 - V2EX 分享个自己在用的玩具 - V2EX 配置 kiro 的问题 - V2EX 买 macbook pro 笔记本,跑本地模型,怎么配置性价比比较高? - V2EX lama.cpp 目前有重大性能 bug: checkpoint 的巡回逻辑对于混合模型(比如 qwen3.6-27B)无效,从而导致大概率每次对话都要 prefill 全文,严重拖慢速度 GPU 跑 LLM 也会超频吗? DiffusionGemma Gemma4 12b 居然比 Qwen3.5 9b 还快,意料不到 什么? Apple Watch 也能本地跑 Qwen 了? 关于低算力 gpu 推理时 prefill 在总时长中的占比问题 现在大模型主流都用哪些 nVidia GPU? Mac book air M5 32G+1TB 能跑本地大模型? mac mini 跑本地模型,需要什么配置? Gemma4 12B 如何跑在 16G 显存上? mac 64g 能部署哪个本地大模型 消费级显卡(16G A 卡)是不是不适合运行 vllm 和 sglang,好像使用 transformer 推理都比这两个框架快,并且占用显存低 本地大模型最佳 Mac 配置选择 关于 5070ti 模型推理的速度和本地部署思考 有没有能够兼容 Win7 的离线模型工具 想折腾一个 AI 主机,请行家出手 锤子找钉子的项目分享:假想企业本地部署后不用人工洗库接入 llm 的中间层。 gemma4:31b-coding-mtp-bf16 有适合本地跑训练 AI 的电脑配置吗? - V2EX 都 2026 年了,为什么还有人觉得 AMD 比 Nvidia 更适合部署本地大模型? LiteChat 轻量级本地大模型聊天 WebUI,支持 vLLM DGX Spark、ASUS GX10、MSI EdgeXpert 看起来都像是一个母胎的产品,用起来有差别吗? 推荐一个 GPU 推理速度计算器, 可能方便买配件自建本地大模型的人用上 github 看到一个项目, 3090 跑 27B, 129tps,最高 207tps 请问各位大神,在隔离环境中,有本地 qwen 大模型,有没什么解决方案,做本地的知识库的方案,类似谷歌那个 notebooklm ,也勉强可以? 有一台 16 寸 m1max 64g+1T 满 GPU 的 MacBook Pro 适合部署哪个本地模型 - V2EX 私有化部署大模型的“终点”是 Mac 还是 Nvidia? 我自己的电脑是 5070Ti,总感觉跑一些模型算力不够 能一起给本地部署的开源模型做个适配的 coding agent 吗?我憋了口气 用 antirez 的 llama.cpp fork 把 DeepSeek v4 Flash 在本地跑起来了 全球本地部署开发者们一起,打造一个真正属于开源社区的 Coding Agent 了 自己做了一款在线 GPU 推理速度计算器 · TPS Calculator qwen3.6 27b 本地编码测试 xllm 真的比 vllm+plugin 性能好么? 各位推荐一个 32G Macbook air M5 可以跑的 moe 模型 我的开源项目,欢迎大家使用和批评,本地无字典字符型模型训练架构代码完全开源,可形成语义结构 请教一个关于模型训练主机配置的问题 我做了个工具让 8GB 显卡跑 30B 模型从 3 tok/s 提到 21 tok/s,记录一下技术发现 大伙有想过二次训练吗? 用 DGX Spark 做这些事情,是否能力合适/足够,有佬能解答吗?(估算也行) - V2EX 多台 GPU 之间怎么组网互联? 部署本地模型 token 输出万能公式 有没有简单版的 new-api 项目 想在本地部署 OCR 服务,解析美团的外卖订单截图,求推荐一个好用的 OCR 模型 本地部署靠不靠谱? - V2EX 为什么你该停止使用 Ollama - V2EX 本地大模型多大显存够用? 求可靠本地 vibe coding,有八卡的 L20 服务器 - V2EX 想掏一台 Mac mini M4 Pro 64G 跑 gemma4 31b Q4 接 openclaw 处理日常的问题,有人测试过速度吗? - V2EX 32B 本地 vibe coding 有能用的模型吗 - V2EX Gemma4 + LiteRT-LM 真得有点的东西, e2b 内存仅 2G 左右占用, 在 天玑 的安卓机上跑的飞快. - V2EX 闲置 16GB M1 Pro MBP 跑大模型 - V2EX 有人用 mac studio 测试过 gemma4 31b 16 吗 - V2EX gemma4:e4b 的效果出乎意料, 1050ti 也能很好的生成文章 - V2EX 谷歌的 Gemma 4 怎么样,有必须要本地弄一下吗 - V2EX 2 年以后的硬件和本地大模型 - V2EX 为什么 Qwen 吹这么牛,但是用起来体验这么拉啊,它的真实能力究竟怎么样 - V2EX Gemma 4 31B 大概什么水平,本地部署是不是又成为现实了 - V2EX qwen 本地大模型的问题 - V2EX 好奇有没有人用本地模型写代码? macbook 32G 内存, M5 芯片本地跑大模型有推荐的吗? - V2EX 本地部署 deepseek 70B,回答乱码 - V2EX 3090 跑文本向量模型可以么? 3090 是不是有点过剩? 家用机带宽太小玩不转 local llm 啊 想部署本地大模型来分析股票趋势,有没有专门针对股票的大模型? - V2EX minimax 挂了?? qwen3.5 过度思考的问题 [求助] DGX Spark 上 Ollama 推理极慢,改用 llama.cpp 部署是否更合适? 如何在 vs code 上应用自建的 ollama 模型 现在能本地部署最好的 TTS 是哪套, 太多了,没法都去试 本地 8G RTX4060 破卡,可以产多少 tokens? 如何在内网使用 opencode Qwen3.5-35B-A3B microgpt.py 30B 尺寸哪个小模型编码能力会好一些 ClawdBot 保姆级安装指南:从零搭建你的 24/7 私人 AI 助手 [求助] 求成本可控,性能过关的本地 vibe coding 方案 个人玩 ai,显卡最低起步是 5080 嘛? intel b60 48G 可以买吗 - V2EX 现在还有类似 nextchat 这样的 web 工具可以用自定义 api 使用的吗? 3070RTX 32GB i9 内存 1TB 的游戏本 推荐用来跑什么 AI 工具呢? - V2EX 本地大模型目前意义大吗? 寻找本地搭建方案有偿 讨论下自建内网 RAG 知识库和 AGENT 平台 使用 Nexa 提供的 SDK 在手机上运行端侧大模型 想问问大家有没有搭建本地的 LLM,我对应用场景挺困惑的 想学习下大模型,有什么论文网站推荐吗 Q: 关于读大部头 PDF 和 Mac Mini M4 能做的事情有些问题? 目前开源可以本地部署的模型有哪些? V 友们,有没有推荐的本地台式机文生图的方案?
需要购买国产显卡本地部署大模型,哪家的比较好
Flagship9945 · 2026-06-08 · via Local LLM

  • 显卡
  • 大模型
  • 部署

    115 条回复    2026-06-09 20:36:09 +08:00

    DeYiAo

    6

    DeYiAo      5 天前   ❤️ 6

    最合适的是 PPU 1 代,16 卡。 最近涨价了预算不知道够不够。
    PPPU 2 代,刚发布,8 卡,能买得到应该是最佳。
    考虑昇腾系列的前提是,你们技术能力极强且有 10 几人的底层工程师可以调试改 bug ,或者财大气粗让华为的工程师驻场。

    Babbitt

    7

    Babbitt      5 天前 via Android

    最近公司也有这需求,预算差不多,想部署 deepseek v4

    yyttrr

    10

    yyttrr      5 天前

    除了华为卡都支持 cuda,但是 cuda 版本可能很老,而且需要的一些其他基础设施要自己实现,不过有大模型写这些也不算什么难事.避坑一些特殊规格的比如一卡两芯的,选比较新的卡都差不多,海光的挺好用的

    skuuhui

    11

    skuuhui      5 天前

    没经验不推荐国产显卡部署,坑太多了。如果非要部署建议找那种专门承接离线大模型部署业务的公司,直接上门安装包售后那种。

    Clannad0708

    13

    Clannad0708      5 天前   ❤️ 1

    国产显卡性能差,你即使部署了本地大模型效果也远不如网页版的能力,只能说不清楚需求。

    vandort

    14

    vandort      5 天前

    不知道你要部署什么模型,但是现在模型出的这么快,从尽可能支持最新的模型的角度来说,选显存大的,卡内带宽高的( 200W 也做不了多机互联),厂家支持到位的;符合前面三个条件下,选支持 FP8 ,最好能支持 MXFP4 的;这些都满足的情况下,选省电的,便宜的,能稳定供应的

    cpper

    16

    cpper      5 天前

    这种部署最终都是浪费掉的,说实话

    xiaxichen

    24

    xiaxichen      5 天前

    我测过几家的显卡只能说阿里的 ppu 还是能用的,其他的都不太行.尤其吹的锣鼓震天响的华为.

    newaccount

    25

    newaccount      5 天前   ❤️ 1

    政府项目不要瞎搞,你想部署哪个模型,联系对方咨询软硬件环境,人家也乐于多几个样板工程

    mingtdlb

    27

    mingtdlb      5 天前

    国产都有哪些 GPU ?华为昇腾、天数智芯,还有哪些,海光好像也有

    cctvbnm111X1

    28

    cctvbnm111X1      5 天前

    如果现在上项目,那必须是昇腾 950dt ,fp8 都不错了,反正有技术支持,其他几个厂都要慢的多,如果你说自己玩,那还是 ppu ,cuda 生态容易点

    songray

    30

    songray      5 天前

    国内的卡基本都是偏科的,建议先去云服务上租不同型号,把自己的 POC 跑通。

    wskymark

    31

    wskymark      5 天前

    这东西不是只需要考虑一上指标吗?哪家有利润要哪家的

    xiaomushen

    35

    xiaomushen      5 天前

    @cpper 又不是你口袋里的钱,有啥浪费不浪费的。哪怕外企里买了 H100 部署,你能保证大部分情况下,不是浪费么?

    xxmaqzas

    38

    xxmaqzas      5 天前

    我们信创项目都用的昆仑芯 P800 只能说不太好用

    find

    39

    find      5 天前 via Android   ❤️ 1

    看了好多评论,果然是殖人思想。难道一辈子都要受制于别人吗

    codingmiao

    40

    codingmiao      5 天前   ❤️ 2

    用过海光、昇腾、平头哥。昇腾自建生态加上文档稀烂,体验就是一坨。另外两家 cuda 上能跑的代码随便改改就能跑起来,但比起 n 卡来性能和体验还是要差不少。

    cpper

    41

    cpper      5 天前   ❤️ 7

    总有些人以为是在创新和防止卡脖子,其实背后全是利益和勾兑

    cpper

    43

    cpper      5 天前

    有些人揣着明白装糊涂,信创都是些什么东西心里没点数吗

    cpper

    45

    cpper      5 天前   ❤️ 13

    @xiaomushen 外企就是把买的卡扔到水坑里都无所谓,只要不是花的税收的钱。但信创的那些单位花的钱来自于哪里你心里没数?

    jacketma

    46

    jacketma      5 天前

    网上不是爆昇腾 910b 、910c 都是 TSMC 代工的 7nm 么(算能科技发包),工艺品控应该可以,就看你这边部署能不能适应软件生态了

    abel533

    48

    abel533      5 天前

    @songray #33 这两家找过多个入口,都看不到能选 GPU 的地方。。想从头在一台机器部署大模型测试,方便提供一个选择型号的入口界面吗?问过 AI ,说有,根据步骤走不通。

    songray

    51

    songray      5 天前

    @abel533 华为云选购买弹性云服务器,区域选华北三。

    找不到是因为限购,要用公司的账号找客户经理申请。

    CloudnuY

    52

    CloudnuY      5 天前

    平头哥也有坑,vllm 镜像只能用内部分发的,启动之后模型时不时出现各种问题(循环、无法调用 tool 、思考链无法控制、答非所问等等)

    abel533

    53

    abel533      5 天前

    @songray #51 切换不同区能看到带 GPU 的机器,都是 NVIDIA Tesla ,没有国产卡。想适配国产卡很难,卡也不好买。

    a791633597

    54

    a791633597      5 天前

    阿里华为我这边都做,部分卡要后台申请开白才能看到,有兴趣可以聊聊
    v:dmzzx123

    Liftman

    57

    Liftman      5 天前

    如果是有特定的项目,而不是单纯的部署算力需求,我建议你找一家,做成产品,单兵化的设备,他封装好。这样你不需要解释里面是什么牌的算力。。。

    elehayym1618

    58

    elehayym1618      5 天前   ❤️ 4

    昇腾,kunlun ,ppu ,海光,燧原我都适配过,说实话纯粹就是浪费纳税人的钱,适配这些东西你的狂躁程度会高的离谱,各种你想象不到的问题,而且也没有渠道解决。
    比如 kunlun ,他们的 vllm 还是基于 0.15.x 打补丁的,很多新的模型都不适配,然后有些量化的 config 也没有人写,但自己改吧改吧也能用。
    昇腾是纯垃圾的骗钱玩意,我都不知道这东西他们自己有没有测试过,对着官方文档都起不来。他们那个 mindie ,cicd 肯定是没有的,上个版本还能跑的东西新版本就跑不了了,硬件也垃圾,动不动就掉卡,买这个就是纯粹给他们当免费测试当小白鼠。

    xiaomushen

    60

    xiaomushen      5 天前

    @cpper 信创不见得是蛀虫,而是属于没办法。要么让我国放弃国产化诉求,放弃和华盛顿对抗。要么只好捏着鼻子用现阶段的信创产品。有啥办法呢?

    反过来说,谁不想用 N 卡呢?

    zcj920

    63

    zcj920      5 天前

    910B 单机 GLM5 Q8 只有 20tps

    wildwind2333

    65

    wildwind2333      5 天前

    平头哥 PPU 好点 但也一堆问题,还必须阿里工作人员去适配模型,自己目前拿不到测试服务器去适配

    wanghanthu

    68

    wanghanthu      5 天前

    200W 还是买 token 吧,这点钱不够硬件厂商技术支持费用的,新模型出来打算自己 debug 吗?

    xiaomushen

    71

    xiaomushen      5 天前   ❤️ 1

    @xiaxichen 没用,涉密单位不能连外网,物理隔离的。所以才需要本地信创算力。
    真的是一言难尽啊,再说了,正规渠道层面,老美也严禁出售计算卡给那些单位,抓到后,全球追捕全链路经销商,也是神经病。。。

    yinanc

    72

    yinanc      5 天前   ❤️ 1

    感觉这个帖子的讨论很有价值

    Jiajin

    73

    Jiajin      5 天前

    昇腾 910B2 、海光 K100AI 都用过,推荐昇腾 910B2 。950 我不推荐是因为你 200 万买不了 8 卡

    910B2 是能用的。勉强能用的那种。

    JoveYu

    74

    JoveYu      5 天前

    别说国产了,玩 AMD 用 ROCm vLLM 也是差不多的体验

    mofash

    76

    mofash      5 天前   ❤️ 4

    @find #39 粉蛆又破防了,一坨翔逼着让你吃,你还的非说香?

    VeteranCat

    77

    VeteranCat      5 天前

    别折磨自己, 这些国产显卡的技术支持你个人是获取不到的, 个人使用最好跟着社区的支持来,cuda 是你的唯一稳妥选择,ROCm 你都会和吃粑粑一样难受的。

    runzekk

    79

    runzekk      5 天前   ❤️ 2

    真是一堆想润海外,别人都不要的。也就是在国内大家技术素养还不高,没有给一些智商情商有问题的淘汰掉。
    真是不知道搁这口嗨能有什么意义,一个正常适配模型的帖子也能键政,看着都恶心。
    本来对键政是中立的,没有观点的,看了这么多无脑喷子都开始反感键政的了。
    有什么想法就去提,想做什么事就去做,实在不行直接润,搁这影响别人心情。

    xiaomushen

    81

    xiaomushen      5 天前

    @runzekk 也不能这么说呀。总归吐槽吐槽咯,虽然从国家安全的角度上说,能理解信创。但此刻国产计算卡实在是太难用了。而且尤其是 NPU 线路的,当下的昇腾卡,搞基于动态图的 LLM ,哪怕是做推理,也是接近扯淡的存在:累死 AI Infra 打工仔

    PS:也理解西大不允许用 Huawei 的通信设备---国安角度

    Mandelo

    86

    Mandelo      5 天前   ❤️ 1

    都信创了,还管啥好不好,重要不是结果,而是花经费写 PPT

    HojiOShi

    87

    HojiOShi      5 天前

    之前把玩过摩尔线程的卡,跑了一下 llama.cpp ,只能说就是纯电阻丝,毫不夸张。然后它那点可怜的 MUSA SDK 还要登录才能拿到手。

    mmdsun

    89

    mmdsun      5 天前

    你们是做开发?还是只是部署模型?

    我们公司买的昇腾 910B ,先开始的 docker 都拉不下来 一看是内网的。。
    后面就给个了镜像导出的才部署好。不过好在用着没什么问题 qwen\deepseek 都本地部署过。

    smlcgx

    91

    smlcgx      5 天前

    这个数感觉是写材料用的,试试华为那边能不能梭哈了,你跟领导都省心

    ezwangsong

    93

    ezwangsong      5 天前   ❤️ 2

    信创项目选型,图省心直接上**阿里平头哥 PPU**。从帖子里看,PPU 至少延续 CUDA 生态,模型改改就能跑,内部也在吃自己的狗粮,比昇腾的闭门造车强多了。

    如果领导点名或只为交差,那就**华为昇腾 910B2**。虽然大家都说文档稀烂、动不动掉卡,bug 也多,但这是政治正确的最优选,且华为有驻场工程师能给你兜底,这 200 万里必须含原厂技术支持的费用。

    最后提醒一句:**先别急着买,去阿里云或华为云租几块同型号的卡跑一遍**。国产卡兼容性看命,只有自己实测能跑通你要的模型,这钱才不算白烧。

    xiaomushen

    94

    xiaomushen      4 天前

    @zhanying 那玩意儿就是个大号 NPU ,根本不适合跑动态图的 LLM 。950 倒是改成 SIMT 了( GPGPU ),还号称兼容 CUDA ,不知道效果咋样。

    我觉得 910 就是 HW 抄袭寒武纪 NPU 后,最终的进化形态。结果发现 NPU 这条楼基本是死胡同,一咬牙改换门庭,走 SIMT 路线

    coolair

    96

    coolair      4 天前

    我用过华为的昇腾 Atlas 300I Duo 。
    评价就是:垃圾垃圾垃圾垃圾!没本事千万别用华为。
    生态极其混乱,乱七八糟,文档极其垃圾,狗屁不通。
    服务也非常垃圾,有了新卡就放弃旧卡的支持。

    NVIDIA 一行命令几秒钟的事,用华为你可能要折腾一个星期。

    知道最后怎么搞定的吗?找了一台华为原厂工程师部署好了的机器,查看历史命令和他改的配置文件才搞定……
    也怪自己能力差。