惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

小众软件
小众软件
MyScale Blog
MyScale Blog
N
News and Events Feed by Topic
IT之家
IT之家
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
有赞技术团队
有赞技术团队
T
The Blog of Author Tim Ferriss
The Cloudflare Blog
博客园 - 聂微东
Apple Machine Learning Research
Apple Machine Learning Research
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
美团技术团队
V
Visual Studio Blog
M
MIT News - Artificial intelligence
V
V2EX
博客园_首页
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
Blog — PlanetScale
Blog — PlanetScale
F
Full Disclosure
H
Help Net Security
MongoDB | Blog
MongoDB | Blog
博客园 - 叶小钗
S
SegmentFault 最新的问题
博客园 - 三生石上(FineUI控件)
D
Docker
Engineering at Meta
Engineering at Meta
博客园 - Franky
aimingoo的专栏
aimingoo的专栏
Jina AI
Jina AI
N
Netflix TechBlog - Medium
宝玉的分享
宝玉的分享
大猫的无限游戏
大猫的无限游戏
人人都是产品经理
人人都是产品经理
云风的 BLOG
云风的 BLOG
博客园 - 司徒正美
I
InfoQ
G
Google Developers Blog
L
LangChain Blog
F
Fortinet All Blogs
博客园 - 【当耐特】
Hugging Face - Blog
Hugging Face - Blog
H
Hackread – Cybersecurity News, Data Breaches, AI and More
WordPress大学
WordPress大学
A
Arctic Wolf
Martin Fowler
Martin Fowler
G
GRAHAM CLULEY
L
LINUX DO - 热门话题
C
Cisco Blogs
Y
Y Combinator Blog
罗磊的独立博客

博客园 - 码甲哥不卷

1分钟买不了吃亏系列: nginx动态域名解析 3min手搓一个帮助文档,很合理吧! 哈哈哈哈哈打不过我吧,没有办法我(vllm)就是这么强大! GLM模型这么火,咱们用vllm也咧一个呗! 同样都是九年义务教育,他知道的AI算力科普好像比我多耶 higress 这个中登才是AI时代的心头好 MetalLB才是给Ingress这个老登做负重前行的那个男人 超性感的轻量级openclaw平替,我给nanobot打call 我不允许谁还不清楚function call在AI-Agent领域中打手的地位 还有比ollama更傻瓜式的大模型本地部署方式吗 ? 🔎我不允许谁还分不清这三种watch机制的区别 云原生AI算力平台的架构解读 🚀糟糕,我实现的k8s informer好像是依托答辩 🎉在k8s调度的花园里面挖呀挖 🎉卷不过AI算法, AI工程化或许是一个出路 我是新来的,我需要知道这些吗?网关上的限流器 新来的外包,在大群分享了它的限流算法的实现 新来的外包,限流算法用的这么6 面试总被追问k8s调度器工作原理, 收藏 == 学废 kong网关反向代理grpc请求 幂等的双倍快乐,你值得拥有 JWT 这点小秘密,你们肯定知道! Go动态感知资源变更的技术实践,你指定用过!
WorkBuddy已经成国民应用了,我们day0支持了腾讯混元3大模型
神仙别打架 · 2026-07-17 · via 博客园 - 码甲哥不卷

7月6日,腾讯三年磨一剑,发布了混元3大模型,搭配国民应用Workbuddy, 企鹅系后起直追的本性暴露无疑。

作为企业级大模型推理服务和智能引擎平台, Tokengine day0支持了Hy3大模型, 欢迎体验使用。

Hy3 拥有2950亿参数的混合专家架构,激活参数210亿, 权重显存597.6G, 本次使用Hy3-FP8,权重显存299.92G。

本次快闪,两个姿势:

  1. 工程化跑通vllm 推理流程
  2. Workbuddy 和 Hy3在夏天更配哦

1. vllm production stack 工程化实践

前文GLM模型这么火,咱们用vllm也咧一个呗!在公众号平台爆了,文中glm4.7-falsh在vllm推理Pod中下载模型文件并启动, 模型就绪的探针时间不容易估测, 不是一个工程化的实践。

同时为了支持多实例推理,我们需要外挂模型权重启动:

  • 方式1: 由initcontainer初始容器下载, 并自然启动推理服务
  • 方式2: 由k8s原生job下载,并手动启动推理服务

为了让大家看的更清楚,我们本次用k8s原生job下载并手动启动推理服务:

image

定义一个pvc(底层用ceph文件存储)hy3-storage-claim, 这个pvc定义了一个路径/data/modelscope

    apiVersion: v1
    kind: PersistentVolumeClaim
    metadata:
      name: hy3-storage-claim
      namespace: vllm-inference
    spec:
      accessModes:
      - ReadWriteMany
      storageClassName: csi-cephfs-sc
      resources:
        requests:
          storage: 400Gi  # 模型至少需要 1.2TiB,建议配置充足
    ---
    apiVersion: batch/v1
    kind: Job
    metadata:
      name: download-hy3
      namespace: vllm-inference
    spec:
      template:
        spec:
          restartPolicy: Never
          containers:
          - name: downloader
            image: modelscope-registry.cn-hangzhou.cr.aliyuncs.com/modelscope-repo/modelscope:ubuntu22.04-py311-torch2.3.1-1.33.0
            command:
            - /bin/bash
            - -c
            - |
              echo "开始下载Tencent-Hunyuan/Hy3-FP8 模型到 PVC..."
              modelscope download --model  Tencent-Hunyuan/Hy3-FP8  \
                                  --local_dir /data/modelscope/models/Tencent-Hunyuan/Hy3-FP8
              echo "下载完成!"
              ls -lh /data/modelscope/models/Tencent-Hunyuan/Hy3-FP8/
            env:
            - name: NVIDIA_VISIBLE_DEVICES
              value: ""  # 不暴露任何 GPU
            - name: CUDA_VISIBLE_DEVICES
              value: ""  # 禁用 CUDA
            volumeMounts:
            - name: model-storage
              mountPath: /data/modelscope
          volumes:
          - name: model-storage
            persistentVolumeClaim:
              claimName: hy3-storage-claim

kubectl get job download-hy3 -n vllm-inference显示下载Hy3用时3个半小时。

之后定义vllm production-stack helm charts value值:

    grafanaDashboards:
      enabled: false
    prometheus-adapter:
      enabled: false

    routerSpec:
      serviceMonitor:
        enabled: false
      imagePullPolicy: "IfNotPresent"
      env:
      - name: TZ
        value: "Asia/Shanghai"

    servingEngineSpec:
      serviceMonitor:
        enabled: false
      runtimeClassName: "nvidia"
      imagePullPolicy: "IfNotPresent"

      modelSpec:
      - name: "hy3"
        nodeName: node6
        repository: "swr.cn-north-4.myhuaweicloud.com/ddn-k8s/docker.io/vllm/vllm-openai"
        tag: "v0.25.0"
        modelURL: "/data/modelscope/models/Tencent-Hunyuan/Hy3-FP8"
        extraVolumes:
        - name: model-storage
          persistentVolumeClaim:
            claimName: hy3-storage-claim   #  模型下载到pvc(挂载路径:/data/modelscope),完整路径是: /data/modelscope/models/DeepSeek-V4-Flash
        extraVolumeMounts:
        - name: model-storage
          mountPath: /data/modelscope
          readOnly: false

        replicaCount: 1
        requestCPU: 8
        requestMemory: "200Gi"
        requestGPU: 8

        shmSize: "300Gi"
        pvcAnnotations:
          helm.sh/resource-policy: "keep"    # helm uninstall 之后不要删除pvc

        vllmConfig:
          tensorParallelSize: 8
          maxModelLen: "200000"
          extraArgs:
            - "--gpu-memory-utilization"
            - "0.92"                  # 降低此值,减轻显存压力
            - "--max-num-seqs"
            - "3000"                    # 限制最大并发请求数
            - "--speculative-config.method"
            - "mtp"
            - "--speculative-config.num_speculative_tokens"
            - "2"
            - "--trust-remote-code"
            - "--tool-call-parser"
            - "hy_v3"
            - "--enable-auto-tool-choice"
            - "--reasoning-parser"
            - "hy_v3"
            - "--served-model-name"
            - "Tencent-Hunyuan/Hy3"

        env:
        - name: VLLM_USE_MODELSCOPE
          value: "false"
        - name: MODELSCOPE_OFFLINE  # 🔧 新增:只使用本地文件
          value: "true"
        - name: HF_ENDPOINT
          value: "https://hf-mirror.com"  # 当必须联网是,使用hf国内镜像站点
        - name: NCCL_DEBUG
          value: "INFO"
        - name: NCCL_P2P_DISABLE
          value: "0"
        - name: NCCL_IB_DISABLE
          value: "0"
        - name: NCCL_SHM_DISABLE
          value: "0"
        - name: VLLM_FLASHINFER_ALLREDUCE_BACKEND
          value: "trtllm"
        - name: PYTORCH_ALLOC_CONF
          value: "expandable_segments:True"
        - name: NCCL_CUDA_MEM_MANAGE
          value: "0"
        - name: NCCL_CUMEM_HOST_ENABLE       
          value: "0"                          
        - name: TZ
          value: "Asia/Shanghai"
        - name: MODELSCOPE_CACHE
          value: "/data/modelscope"


      startupProbe:
        initialDelaySeconds: 500  
        periodSeconds: 15
        failureThreshold: 60     
        timeoutSeconds: 10
        httpGet:
          path: /health
          port: 8000

注意extraVolumes extraVolumeMounts modelURL三个配置值:

  • extraVolumes 、extraVolumeMounts 搭配将名为hy3-storage-claim的pvc文件挂载进pod内指定路径/data/modelscope
  • modelURL: 指定了Pod内模型权重文件的路径
  • 最后参数记得加上--served-model-name, 避免出现不相干模型名。

最后helm install hy3 vllm/vllm-stack -f hy3.yaml -n vllm-inference启动vllm production stack推理服务。

2. WorkBuddy接入自持混元3大模型

打开WorkBuddy,从以下入口接入自持Hy3大模型, 选择自定义大模型,填入域名和apikey

image

混元3大模型是一个文本模型,结合WorkBuddy 可以玩出各种花样。

昨天利用WorkBuddy + 混元3大模型做了一个《研发部目标和规划ppt》, 全程没去制作一个页面,做出来的效果我给80分,思路清晰,结构稳定。

从WorkBuddy添加PPT制作专家, 作为 PPT 制作专家,他先通读现有两份文件,从「逻辑一致性 + 视觉一致性 + 数据可视化 + 文案措辞」四个维度做一次整体润色诊断。

image

生成的PPT 简洁有力,言简意赅,你觉得呢。