因为最近自己工作上的项目会跑一些开源小规模的模型,比如Qwen 3.6 35BA3B之类的
我发现主要的显存占用和模型规模大小有关
而国内的模型定价里,比如智谱的GLM-5,5.1,5.2,这三个模型其实都是744B(激活 40B)的moe模型,抛开GLM-5.2的1M上下文会更占用资源,其实5和5.1应该资源消耗是一样的,同理Kimi的K2.5-K2.7也都是1T(激活32B)的moe模型
但是定价却有区别,想知道为什么这些厂商不把早点模型都更新到最新的淘汰掉老的,还把资源留在老的模型上呢,特别是一些第三方渠道(比如腾讯和阿里之前的codingplan都还停留在GLM5,KIMIK2.5,实际上更新到5.1甚至限制256K上下文的5.2和KIMIK2.7并不会增加算力消耗)
难道这些厂商都只是因为不想继续升级模型然后让存量用户自己不续订亏钱的codingplan,不惜把算力都留在老模型上吗,因为算力是有限的,他优化掉老的模型,把算力用在并没有增大消耗的新模型上,肯定是有利的吧
HeriX (HeriX) 2
因为阿里就是不想让coding plan用新的, 然后推它的token plan
你看它的token plan新的模型都有
zhongruan (钟阮) 3
有的企业,是要用旧版本的,并不是都和用户一样,只需要最新旗舰
lucyna (lucyna) 4
有的是懒得换了,毕竟模型之间还是有去别的,万一跑不通了呢
Autsun (Autsun) 5
是的,我想过这个理由,但是他不可能一直就这样不更新吧,现在tokenplan里面还有老模型,如果之后为了把算力用到新模型上,把tokenplan里的GLM-5,KIMI-K2.5这种老模型去掉了,难道还会为了这个理由,继续为了codingplan保留GLM-5,KIMI-K2.5的算力吗,而不是干脆一起更新了?
















