惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
C
CERT Recently Published Vulnerability Notes
Know Your Adversary
Know Your Adversary
Security Archives - TechRepublic
Security Archives - TechRepublic
Security Latest
Security Latest
P
Privacy & Cybersecurity Law Blog
P
Privacy International News Feed
月光博客
月光博客
Stack Overflow Blog
Stack Overflow Blog
H
Hackread – Cybersecurity News, Data Breaches, AI and More
H
Help Net Security
Recent Commits to openclaw:main
Recent Commits to openclaw:main
AI
AI
O
OpenAI News
M
MIT News - Artificial intelligence
Scott Helme
Scott Helme
U
Unit 42
P
Proofpoint News Feed
罗磊的独立博客
C
Check Point Blog
MongoDB | Blog
MongoDB | Blog
Engineering at Meta
Engineering at Meta
博客园 - 三生石上(FineUI控件)
阮一峰的网络日志
阮一峰的网络日志
Apple Machine Learning Research
Apple Machine Learning Research
T
The Exploit Database - CXSecurity.com
I
InfoQ
云风的 BLOG
云风的 BLOG
aimingoo的专栏
aimingoo的专栏
Google DeepMind News
Google DeepMind News
W
WeLiveSecurity
Webroot Blog
Webroot Blog
P
Palo Alto Networks Blog
C
Cybersecurity and Infrastructure Security Agency CISA
N
News and Events Feed by Topic
Cisco Talos Blog
Cisco Talos Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
博客园 - Franky
A
About on SuperTechFans
美团技术团队
J
Java Code Geeks
T
Tenable Blog
L
LINUX DO - 最新话题
NISL@THU
NISL@THU
G
Google Developers Blog
Forbes - Security
Forbes - Security
爱范儿
爱范儿
S
Security @ Cisco Blogs
Project Zero
Project Zero
有赞技术团队
有赞技术团队

Local LLM

跑本地大模型 电费要多少? - V2EX 多机异构显卡组合推理 - V2EX 本地部署 GLM-5.2 的门槛太高了,根本玩不起! - V2EX 开源了一个 LLM 推理服务监控面板 - V2EX 大模型小白推荐一下本地模型 - V2EX GLM5.2 个人感觉有点被吹大了 - V2EX 有支持 6000 Ada 使用 deepseek v4 flash 推理 的框架吗 - V2EX 分享个自己在用的玩具 - V2EX 配置 kiro 的问题 - V2EX 买 macbook pro 笔记本,跑本地模型,怎么配置性价比比较高? - V2EX lama.cpp 目前有重大性能 bug: checkpoint 的巡回逻辑对于混合模型(比如 qwen3.6-27B)无效,从而导致大概率每次对话都要 prefill 全文,严重拖慢速度 GPU 跑 LLM 也会超频吗? DiffusionGemma Gemma4 12b 居然比 Qwen3.5 9b 还快,意料不到 什么? Apple Watch 也能本地跑 Qwen 了? 关于低算力 gpu 推理时 prefill 在总时长中的占比问题 现在大模型主流都用哪些 nVidia GPU? Mac book air M5 32G+1TB 能跑本地大模型? 需要购买国产显卡本地部署大模型,哪家的比较好 mac mini 跑本地模型,需要什么配置? Gemma4 12B 如何跑在 16G 显存上? mac 64g 能部署哪个本地大模型 消费级显卡(16G A 卡)是不是不适合运行 vllm 和 sglang,好像使用 transformer 推理都比这两个框架快,并且占用显存低 本地大模型最佳 Mac 配置选择 关于 5070ti 模型推理的速度和本地部署思考 有没有能够兼容 Win7 的离线模型工具 想折腾一个 AI 主机,请行家出手 锤子找钉子的项目分享:假想企业本地部署后不用人工洗库接入 llm 的中间层。 gemma4:31b-coding-mtp-bf16 有适合本地跑训练 AI 的电脑配置吗? - V2EX 都 2026 年了,为什么还有人觉得 AMD 比 Nvidia 更适合部署本地大模型? LiteChat 轻量级本地大模型聊天 WebUI,支持 vLLM DGX Spark、ASUS GX10、MSI EdgeXpert 看起来都像是一个母胎的产品,用起来有差别吗? 推荐一个 GPU 推理速度计算器, 可能方便买配件自建本地大模型的人用上 github 看到一个项目, 3090 跑 27B, 129tps,最高 207tps 请问各位大神,在隔离环境中,有本地 qwen 大模型,有没什么解决方案,做本地的知识库的方案,类似谷歌那个 notebooklm ,也勉强可以? 有一台 16 寸 m1max 64g+1T 满 GPU 的 MacBook Pro 适合部署哪个本地模型 - V2EX 私有化部署大模型的“终点”是 Mac 还是 Nvidia? 我自己的电脑是 5070Ti,总感觉跑一些模型算力不够 能一起给本地部署的开源模型做个适配的 coding agent 吗?我憋了口气 用 antirez 的 llama.cpp fork 把 DeepSeek v4 Flash 在本地跑起来了 全球本地部署开发者们一起,打造一个真正属于开源社区的 Coding Agent 了 自己做了一款在线 GPU 推理速度计算器 · TPS Calculator qwen3.6 27b 本地编码测试 xllm 真的比 vllm+plugin 性能好么? 各位推荐一个 32G Macbook air M5 可以跑的 moe 模型 我的开源项目,欢迎大家使用和批评,本地无字典字符型模型训练架构代码完全开源,可形成语义结构 请教一个关于模型训练主机配置的问题 我做了个工具让 8GB 显卡跑 30B 模型从 3 tok/s 提到 21 tok/s,记录一下技术发现 大伙有想过二次训练吗? 用 DGX Spark 做这些事情,是否能力合适/足够,有佬能解答吗?(估算也行) - V2EX 多台 GPU 之间怎么组网互联? 部署本地模型 token 输出万能公式 有没有简单版的 new-api 项目 想在本地部署 OCR 服务,解析美团的外卖订单截图,求推荐一个好用的 OCR 模型 本地部署靠不靠谱? - V2EX 为什么你该停止使用 Ollama - V2EX 本地大模型多大显存够用? 求可靠本地 vibe coding,有八卡的 L20 服务器 - V2EX 想掏一台 Mac mini M4 Pro 64G 跑 gemma4 31b Q4 接 openclaw 处理日常的问题,有人测试过速度吗? - V2EX 32B 本地 vibe coding 有能用的模型吗 - V2EX Gemma4 + LiteRT-LM 真得有点的东西, e2b 内存仅 2G 左右占用, 在 天玑 的安卓机上跑的飞快. - V2EX 闲置 16GB M1 Pro MBP 跑大模型 - V2EX 有人用 mac studio 测试过 gemma4 31b 16 吗 - V2EX gemma4:e4b 的效果出乎意料, 1050ti 也能很好的生成文章 - V2EX 谷歌的 Gemma 4 怎么样,有必须要本地弄一下吗 - V2EX 为什么 Qwen 吹这么牛,但是用起来体验这么拉啊,它的真实能力究竟怎么样 - V2EX Gemma 4 31B 大概什么水平,本地部署是不是又成为现实了 - V2EX qwen 本地大模型的问题 - V2EX 好奇有没有人用本地模型写代码? macbook 32G 内存, M5 芯片本地跑大模型有推荐的吗? - V2EX 本地部署 deepseek 70B,回答乱码 - V2EX 3090 跑文本向量模型可以么? 3090 是不是有点过剩? 家用机带宽太小玩不转 local llm 啊 想部署本地大模型来分析股票趋势,有没有专门针对股票的大模型? - V2EX minimax 挂了?? qwen3.5 过度思考的问题 [求助] DGX Spark 上 Ollama 推理极慢,改用 llama.cpp 部署是否更合适? 如何在 vs code 上应用自建的 ollama 模型 现在能本地部署最好的 TTS 是哪套, 太多了,没法都去试 本地 8G RTX4060 破卡,可以产多少 tokens? 如何在内网使用 opencode Qwen3.5-35B-A3B microgpt.py 30B 尺寸哪个小模型编码能力会好一些 ClawdBot 保姆级安装指南:从零搭建你的 24/7 私人 AI 助手 [求助] 求成本可控,性能过关的本地 vibe coding 方案 个人玩 ai,显卡最低起步是 5080 嘛? intel b60 48G 可以买吗 - V2EX 现在还有类似 nextchat 这样的 web 工具可以用自定义 api 使用的吗? 3070RTX 32GB i9 内存 1TB 的游戏本 推荐用来跑什么 AI 工具呢? - V2EX 本地大模型目前意义大吗? 寻找本地搭建方案有偿 讨论下自建内网 RAG 知识库和 AGENT 平台 使用 Nexa 提供的 SDK 在手机上运行端侧大模型 想问问大家有没有搭建本地的 LLM,我对应用场景挺困惑的 想学习下大模型,有什么论文网站推荐吗 Q: 关于读大部头 PDF 和 Mac Mini M4 能做的事情有些问题? 目前开源可以本地部署的模型有哪些? V 友们,有没有推荐的本地台式机文生图的方案?
2 年以后的硬件和本地大模型 - V2EX
workbest · 2026-04-04 · via Local LLM

这是一个创建于 71 天前的主题,其中的信息可能已经有所发展或是发生改变。

今年内存是大概率不会降价了

随着价格的刺激和产能的提升,以及对本地大模型的需求,2 年以后 256G 内存能否得到普及?

256G 内存,加上本地模型的发展,应该可以在本地运行一些非常不错的 coding 模型了

  • 内存
  • 大模型
  • 本地

    27 条回复    2026-04-20 00:51:50 +08:00

    dmanbu

    2

    dmanbu      4 月 4 日   ❤️ 2

    ???但凡你了解一下硬件市场,就该知道现在内存开始跳水了

    levn

    3

    levn      4 月 4 日

    都用本地模型了,那企业高价买的那些内存显卡谁来使啊

    decade0q

    4

    decade0q      4 月 4 日 via iPhone

    内存前几天都开始降了😓

    icyalala

    5

    icyalala      4 月 4 日

    硬件提升,模型也在提升,最好的模型会越来越大
    更何况云端部署能 Batch, 本地模型性价比会远差于供应商

    workbest

    6

    workbest      4 月 4 日

    如果 2 年后的本地大模型能达到今天的 opus 4.6 或者 gpt 5.4 的水平,我觉得已经足够了

    l1ve

    7

    l1ve      4 月 4 日   ❤️ 1

    @dmanbu 16G 的从 1000 到 700 ,不算跳水吧,并且还叠加季度末回款的影响
    ----
    存储芯片/CPU 这东西,产能固定,扩产周期长,现在 AI 对算力的需求可以说是指数级增加的,一年前大家用 ai 编程用了多少,现在又用了多少。等 agent 落地其他行业的时候算力需求更离谱
    我记得一年前看到 vibe coding 的时候,我觉得这东西傻逼才会用
    现在我只会觉得谁不用谁是傻逼
    预计 3 年内都会维持高位了,哪怕 AI 模型再也不进步就保持目前的水平,需求都不会减少

    Gilfoyle26

    8

    Gilfoyle26      4 月 4 日

    预言一波:其实和手机一样的发展路线,尽管每年都出新款,但是消费者已经无感了。

    june4

    10

    june4      4 月 4 日

    苹果底端 8G 内存机是十几年前了吧,现在还是 8G,说明内存基本不会涨
    甚至硬盘也不怎么涨,内存和存储不再象 20 几年前的定期翻倍涨了,我不觉得再过 5 年会变

    cjun

    11

    cjun      4 月 4 日 via Android

    云端的模型比本地模型更聪明,如果是省事,省时间,还是云端模型好吧

    ntedshen

    13

    ntedshen      4 月 4 日

    我台式机一直是拉满的,不谈
    我的笔记本,
    16 年我就在用 32+8 。。。
    19 年我就在用 64+8 。。。
    22 年我抱怨现在笔记本接口越来越少都装不下 128 了还有人骂我傻逼。。。
    24 年 128 ( 64x2 )的条子价格平了,我没买,其实现在挺后悔的
    而市售机器今年才刚开始普及 32g 。。。

    所以,
    > 2 年以后 256G 内存能否得到普及?
    我感觉你得加个 0 。。。

    zerovoid

    15

    zerovoid      4 月 4 日

    除非本地部署的成本,低于云服务的成本很多,不然为什么我不用云服务呢,
    大部分人都懒得自己折腾,如果价格差不多的话。

    Very0ldMan

    16

    Very0ldMan      4 月 4 日

    chatGPT3.5 的时候,我就在想,如果以后开源的大模型能够有 3.5 的智力就好了。结果没想到现在 14B 的大模型已经超过 3.5 了😂😂

    forisra

    17

    forisra      4 月 4 日

    @kongkongyzt 这个很难了,因为当时内存存储价格低本身也是当然上游厂商对行情误判,产能过剩结果就导致了历史性的低价。

    未来就算价格崩了,我估计也很难崩到这个水平。毕竟按照正常的通胀率一年 2%-3%,十年通胀也有 30%了。

    eastcukt

    18

    eastcukt      4 月 5 日 via Android

    端到端的小模型感觉是未来趋势,有基础智商配合 agent 作为私人助手完全够了。如果后期 memory 层能作用小模型进行微调就更是没必要全知大模型。

    laminux29

    19

    laminux29      4 月 5 日

    256G 内存,加上本地模型的发展,应该可以在本地运行一些非常不错的 coding 模型了
    ===============

    这是严重的错误判断。

    现阶段,各大 Coding 模型,别说架构师了,连高级程序员的层次,都没法在每次 chat 中达到,而且还经常输出一些虽然能 work 但可维护性极差的代码。这个问题的根源还在于训练的数据、推理的算力与推理空间不足导致的,而这一切的训练与推理阶段,又都依赖超大内存,256GB 只是冰山一角,远远不够。

    lete

    24

    lete      4 月 5 日

    @workbest #9 怎么可能 256G 起步,不是人人都必须跑模型,基本上 32G 或 64G ,未来模型只会越来越小

    jark006

    25

    jark006      4 月 5 日

    你这个“非常不错的 coding 模型”最多相当于现在的顶级闭源模型(其实本地能跑 opus4.6 我也挺满足的😁👍),但那时会出现更加顶尖的闭源模型。
    目前的大模型进步速度,我看不到放缓的迹象,模型能力的上升也看不出边际效应。
    所以,大厂的闭源大模型始终会遥遥领先同期可本地部署的开源模型。

    Very0ldMan

    27

    Very0ldMan      4 月 20 日

    @jackqian #26 GPT-3.5 在 2023 年的 MMLU (综合知识)得分大约在 70% 左右,而 Qwen3.5-14B 即使在量化后,在 MMLU 、GSM8K (数学)和 HumanEval (代码)上的得分依然高出一大截