惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Y
Y Combinator Blog
D
Docker
有赞技术团队
有赞技术团队
D
DataBreaches.Net
The GitHub Blog
The GitHub Blog
爱范儿
爱范儿
H
Help Net Security
美团技术团队
MyScale Blog
MyScale Blog
B
Blog RSS Feed
C
Check Point Blog
Microsoft Security Blog
Microsoft Security Blog
阮一峰的网络日志
阮一峰的网络日志
A
About on SuperTechFans
小众软件
小众软件
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
GbyAI
GbyAI
G
Google Developers Blog
月光博客
月光博客
Google DeepMind News
Google DeepMind News
H
Hackread – Cybersecurity News, Data Breaches, AI and More
Blog — PlanetScale
Blog — PlanetScale
MongoDB | Blog
MongoDB | Blog
F
Fortinet All Blogs

V2EX - 技术

Local-first 软件收录站 从 X 上搬运来的白嫖 GPT Plus 教程 阿里云百炼 Coding Plan Pro 套餐 新增当日 token 限制 大家的 Claude 弹了 kyc 嘛 现在 Google 的 Gemini 和 AI 模式降智的厉害啊 用的 TAG 家的 T, ip 跳变是否影响使用 claude 同一 apple 账户能给不同 claude 账号充值么 做了个 Go 的 MCP Server 框架,一行代码把 Gin API 接入 AI 请教各位,想回归技术,如何系统学习 Agent? OpenAI GPT-IMAGE-2 提示词合集 你是说, claude opus4.6 写代码的能力不如 gpt5.4? 关于智谱 Max 套餐要不要升级续费呢? App → CLI → App ? Github 账号被 404 了,现在没法恢复,求各位大佬指点 cursor 的次数套餐以后应该都用不了新模型了 openrouter 使用国外模型 买了咸鱼低价 Gemini pro,账号差点被盗。突然发现国内诈骗成本为零 Gemini 手机版客户端登陆总是在此国家/地区无法使用 gemini 感觉 gpt 这些低价渠道要爆了 claude code 和 codex 在 vibe coding 还有质的区别吗? 阿里 Coding Plan 一天三变, Lite 版本到期不能续费了 RAG 难以让人满意啊 2026 年了,这个世界还存在互联网精神🥹 两个账号阵亡,尼区 Claude Pro 订阅 分享下最近低价 GPT Codex 的来源(源头) OpenAI 发布 Codex 重大更新:支持自动操作电脑与长期任务自动化 使用 claude 从 0 开始开发一个校友会系统可行吗 同一个 appleid 可以给不同 chatGPT 账号订阅 plus 吗? 自动驾驶项目开发建议 终于, 降智几天之后, opus4.7 出来了
开源了一个 LLM 推理服务监控面板
invdan · 2026-06-22 · via V2EX - 技术

开源了一个 LLM 推理服务监控面板 项目地址https://github.com/coolwolfqs/llm-inference-monitor


为什么做这个

最近在用 llama.cpp 跑推理服务,一直缺一个好用的监控面板。

网上方案无非两条路:

  1. Prometheus + Grafana → 太重了,为了看个 GPU 温度搭一套监控体系
  2. nvidia-smi 刷屏 → 原始,但就看个 GPU ,CPU/内存/推理指标全没有

于是自己搓了一个面板,现在整理成开源项目放出来了。不会编程,全程就由 hermes 待开发,不成熟之处各位看官多包涵。

长什么样

一个页面搞定所有监控信息,分成几个区域:

服务概览区

  • 当前运行的模型、上下文长度、量化精度
  • 引擎版本号( llama.cpp / vllm )
  • 健康评分(硬件分 + 系统分 + 推理分)

GPU 区

  • 利用率 / 显存 / 温度 / 功耗 实时曲线图
  • 每张卡的详细信息(频率、PCIe 链路、编码器负载)
  • 带 GPU 进程列表(看一眼就知道谁在吃显存)

系统区

  • CPU 每核利用率热力图
  • 内存 / Swap / 缓存
  • 磁盘读写速度 + 分区使用率
  • 网络实时吞吐量

推理区

  • TPS 实时心电图
  • KV Cache 占用 + 剩余可用 Token 估算
  • TTFT / TPOT / KV 命中率 / MTP 投机解码加速比
  • IP 级 Token 消耗统计

技术栈

后端:Python FastAPI + psutil + nvidia-smi
前端:纯 HTML + CSS + JS (无框架,无需构建)
图表:Canvas 原生绘制(贝塞尔曲线,防抖重绘)
实时:SSE 推送( 2 秒间隔) + HTTP 轮询( 30 秒兜底)
部署:pip install -r requirements.txt 就行

整个项目 30 多个文件,前端零依赖,后端只依赖 FastAPI 、psutil 、aiohttp 三个库。


快速体验

git clone GitHub - coolwolfqs/llm-inference-monitor: Real-time monitoring dashboard for LLM inference services
cd llm-inference-monitor
pip install -r requirements.txt
python -m backend.server

打开 http://localhost:8081 就能看到面板了。

如果需要采集推理指标,旁边跑一个 llama.cpp server (默认 8080 端口)就行,自动对接。


项目地址

https://github.com/coolwolfqs/llm-inference-monitor

欢迎 Star 、Fork 、PR ,觉得有用的话也欢迎转发。


补充说明:项目从生产环境的内部面板整理而来,核心逻辑和 UI 布局都保留了原样,只是把后端从单体改成了模块化采集器架构,方便大家按需增删监控指标。中英文双语文档都有。

有什么问题或者建议可以直接回帖,也可以 GitHub 提 Issue 。