





















6 DeYiAo 5 天前最合适的是 PPU 1 代,16 卡。 最近涨价了预算不知道够不够。 |
7 Babbitt 5 天前 via Android最近公司也有这需求,预算差不多,想部署 deepseek v4 |
10 yyttrr 5 天前除了华为卡都支持 cuda,但是 cuda 版本可能很老,而且需要的一些其他基础设施要自己实现,不过有大模型写这些也不算什么难事.避坑一些特殊规格的比如一卡两芯的,选比较新的卡都差不多,海光的挺好用的 |
11 skuuhui 5 天前没经验不推荐国产显卡部署,坑太多了。如果非要部署建议找那种专门承接离线大模型部署业务的公司,直接上门安装包售后那种。 |
13 Clannad0708 5 天前国产显卡性能差,你即使部署了本地大模型效果也远不如网页版的能力,只能说不清楚需求。 |
14 vandort 5 天前不知道你要部署什么模型,但是现在模型出的这么快,从尽可能支持最新的模型的角度来说,选显存大的,卡内带宽高的( 200W 也做不了多机互联),厂家支持到位的;符合前面三个条件下,选支持 FP8 ,最好能支持 MXFP4 的;这些都满足的情况下,选省电的,便宜的,能稳定供应的 |
16 cpper 5 天前这种部署最终都是浪费掉的,说实话 |
24 xiaxichen 5 天前我测过几家的显卡只能说阿里的 ppu 还是能用的,其他的都不太行.尤其吹的锣鼓震天响的华为. |
25 newaccount 5 天前政府项目不要瞎搞,你想部署哪个模型,联系对方咨询软硬件环境,人家也乐于多几个样板工程 |
27 mingtdlb 5 天前国产都有哪些 GPU ?华为昇腾、天数智芯,还有哪些,海光好像也有 |
28 cctvbnm111X1 5 天前如果现在上项目,那必须是昇腾 950dt ,fp8 都不错了,反正有技术支持,其他几个厂都要慢的多,如果你说自己玩,那还是 ppu ,cuda 生态容易点 |
30 songray 5 天前国内的卡基本都是偏科的,建议先去云服务上租不同型号,把自己的 POC 跑通。 |
31 wskymark 5 天前这东西不是只需要考虑一上指标吗?哪家有利润要哪家的 |
35 xiaomushen 5 天前@cpper 又不是你口袋里的钱,有啥浪费不浪费的。哪怕外企里买了 H100 部署,你能保证大部分情况下,不是浪费么? |
38 xxmaqzas 5 天前我们信创项目都用的昆仑芯 P800 只能说不太好用 |
39 find 5 天前 via Android看了好多评论,果然是殖人思想。难道一辈子都要受制于别人吗 |
40 codingmiao 5 天前用过海光、昇腾、平头哥。昇腾自建生态加上文档稀烂,体验就是一坨。另外两家 cuda 上能跑的代码随便改改就能跑起来,但比起 n 卡来性能和体验还是要差不少。 |
41 cpper 5 天前总有些人以为是在创新和防止卡脖子,其实背后全是利益和勾兑 |
43 cpper 5 天前有些人揣着明白装糊涂,信创都是些什么东西心里没点数吗 |
45 cpper 5 天前@xiaomushen 外企就是把买的卡扔到水坑里都无所谓,只要不是花的税收的钱。但信创的那些单位花的钱来自于哪里你心里没数? |
46 jacketma 5 天前网上不是爆昇腾 910b 、910c 都是 TSMC 代工的 7nm 么(算能科技发包),工艺品控应该可以,就看你这边部署能不能适应软件生态了 |
48 abel533 5 天前@songray #33 这两家找过多个入口,都看不到能选 GPU 的地方。。想从头在一台机器部署大模型测试,方便提供一个选择型号的入口界面吗?问过 AI ,说有,根据步骤走不通。 |
52 CloudnuY 5 天前平头哥也有坑,vllm 镜像只能用内部分发的,启动之后模型时不时出现各种问题(循环、无法调用 tool 、思考链无法控制、答非所问等等) |
54 a791633597 5 天前阿里华为我这边都做,部分卡要后台申请开白才能看到,有兴趣可以聊聊 |
57 Liftman 5 天前如果是有特定的项目,而不是单纯的部署算力需求,我建议你找一家,做成产品,单兵化的设备,他封装好。这样你不需要解释里面是什么牌的算力。。。 |
58 elehayym1618 5 天前昇腾,kunlun ,ppu ,海光,燧原我都适配过,说实话纯粹就是浪费纳税人的钱,适配这些东西你的狂躁程度会高的离谱,各种你想象不到的问题,而且也没有渠道解决。 |
60 xiaomushen 5 天前@cpper 信创不见得是蛀虫,而是属于没办法。要么让我国放弃国产化诉求,放弃和华盛顿对抗。要么只好捏着鼻子用现阶段的信创产品。有啥办法呢? 反过来说,谁不想用 N 卡呢? |
63 zcj920 5 天前910B 单机 GLM5 Q8 只有 20tps |
65 wildwind2333 5 天前平头哥 PPU 好点 但也一堆问题,还必须阿里工作人员去适配模型,自己目前拿不到测试服务器去适配 |
68 wanghanthu 5 天前200W 还是买 token 吧,这点钱不够硬件厂商技术支持费用的,新模型出来打算自己 debug 吗? |
71 xiaomushen 5 天前@xiaxichen 没用,涉密单位不能连外网,物理隔离的。所以才需要本地信创算力。 |
72 yinanc 5 天前感觉这个帖子的讨论很有价值 |
73 Jiajin 5 天前昇腾 910B2 、海光 K100AI 都用过,推荐昇腾 910B2 。950 我不推荐是因为你 200 万买不了 8 卡 910B2 是能用的。勉强能用的那种。 |
74 JoveYu 5 天前别说国产了,玩 AMD 用 ROCm vLLM 也是差不多的体验 |
77 VeteranCat 5 天前别折磨自己, 这些国产显卡的技术支持你个人是获取不到的, 个人使用最好跟着社区的支持来,cuda 是你的唯一稳妥选择,ROCm 你都会和吃粑粑一样难受的。 |
79 runzekk 5 天前真是一堆想润海外,别人都不要的。也就是在国内大家技术素养还不高,没有给一些智商情商有问题的淘汰掉。 |
81 xiaomushen 5 天前@runzekk 也不能这么说呀。总归吐槽吐槽咯,虽然从国家安全的角度上说,能理解信创。但此刻国产计算卡实在是太难用了。而且尤其是 NPU 线路的,当下的昇腾卡,搞基于动态图的 LLM ,哪怕是做推理,也是接近扯淡的存在:累死 AI Infra 打工仔 PS:也理解西大不允许用 Huawei 的通信设备---国安角度 |
86 Mandelo 5 天前都信创了,还管啥好不好,重要不是结果,而是花经费写 PPT |
87 HojiOShi 5 天前之前把玩过摩尔线程的卡,跑了一下 llama.cpp ,只能说就是纯电阻丝,毫不夸张。然后它那点可怜的 MUSA SDK 还要登录才能拿到手。 |
89 mmdsun 5 天前你们是做开发?还是只是部署模型? 我们公司买的昇腾 910B ,先开始的 docker 都拉不下来 一看是内网的。。 |
91 smlcgx 5 天前这个数感觉是写材料用的,试试华为那边能不能梭哈了,你跟领导都省心 |
93 ezwangsong 5 天前信创项目选型,图省心直接上**阿里平头哥 PPU**。从帖子里看,PPU 至少延续 CUDA 生态,模型改改就能跑,内部也在吃自己的狗粮,比昇腾的闭门造车强多了。 如果领导点名或只为交差,那就**华为昇腾 910B2**。虽然大家都说文档稀烂、动不动掉卡,bug 也多,但这是政治正确的最优选,且华为有驻场工程师能给你兜底,这 200 万里必须含原厂技术支持的费用。 最后提醒一句:**先别急着买,去阿里云或华为云租几块同型号的卡跑一遍**。国产卡兼容性看命,只有自己实测能跑通你要的模型,这钱才不算白烧。 |
94 xiaomushen 4 天前@zhanying 那玩意儿就是个大号 NPU ,根本不适合跑动态图的 LLM 。950 倒是改成 SIMT 了( GPGPU ),还号称兼容 CUDA ,不知道效果咋样。 我觉得 910 就是 HW 抄袭寒武纪 NPU 后,最终的进化形态。结果发现 NPU 这条楼基本是死胡同,一咬牙改换门庭,走 SIMT 路线 |
96 coolair 4 天前我用过华为的昇腾 Atlas 300I Duo 。 NVIDIA 一行命令几秒钟的事,用华为你可能要折腾一个星期。 知道最后怎么搞定的吗?找了一台华为原厂工程师部署好了的机器,查看历史命令和他改的配置文件才搞定…… |
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。