惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

博客园_首页
量子位
D
DataBreaches.Net
博客园 - 司徒正美
J
Java Code Geeks
博客园 - 【当耐特】
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
aimingoo的专栏
aimingoo的专栏
B
Blog
The Cloudflare Blog
D
Docker
I
InfoQ
爱范儿
爱范儿
MongoDB | Blog
MongoDB | Blog
腾讯CDC
月光博客
月光博客
Hugging Face - Blog
Hugging Face - Blog
Microsoft Azure Blog
Microsoft Azure Blog
Vercel News
Vercel News
阮一峰的网络日志
阮一峰的网络日志
小众软件
小众软件
S
SegmentFault 最新的问题
GbyAI
GbyAI
有赞技术团队
有赞技术团队

博客园 - 立体风

autohotkey2.0 Send keys参数分析 autohotkey2.0 盲从模式 windows 10 下 vscode 编写编译一个 nana c++ 库的示例程序 vscode 插件 cmake-tools 输出内容解读 Claude Code 处理中文乱码问题 python 启动器命令 py 答惑 windows 下 python 3.11 的版本问题 pip 安装 老版本 pytorch 的一个容易迷惑的错误 sentence transformer 例子及说明 Sentence Transformers 介绍 Jina Reranker 替代方案:改用 ModelScope 模型 Webnovel Writer 6.2.1 项目分析 windows 10 LTSC 版 安装 Terminal autohotkey2.0 脚本运行机制 windows wsl2 安装 gentoo 的步骤 windows 10 LTSC版 打开 wsl2 autohotkey 提示词 编译安装最新版 perl rust 做到“快并且安全” 的逻辑思路 rust 和 go 语言的核心目的 用 vim 查看文件的格式和编码 python 以字符数量分割文档 (三) python 以字符数量分割文档 (二) python 以字符数量分割文档 (一) GNU Bash 参考手册(中文版)(六) GNU Bash 参考手册(中文版)(五) GNU Bash 参考手册(中文版)(四) GNU Bash 参考手册(中文版)(三) GNU Bash 参考手册(中文版)(二) GNU Bash 参考手册(中文版)(一)
throughput 和 efficient 词义
立体风 · 2026-08-08 · via 博客园 - 立体风

The High-Throughput and Memory-Efficient inference and serving engine for LLMs。

1. throughput

音标:

  • 英式:/ˈθruːpʊt/
  • 美式:/ˈθruːpʊt/

发音拆分:

  • through /θruː/:类似“思如”(舌尖轻触上齿,发清辅音 θ)
  • put /pʊt/:类似“普特”(短促的 u 音)

读音接近:思如-普特(重音在前)

词源与本义:

throughput = through(通过) + put(放置、处理)

本义:通过某个系统的量

最初用于工程领域,表示:

某个系统在单位时间内能够处理、传输、输出的数量。

例如:

  • 工厂:

    The throughput of this factory is 10,000 units per day.
    这个工厂每天产出 10000 个产品。

  • 网络:

    Network throughput is 1 Gbps.
    网络吞吐量是 1Gbps。

  • CPU:

    CPU throughput
    CPU 每秒能处理多少任务。

在 AI / LLM 中:

LLM throughput = 单位时间内模型能够处理的 token 数量

例如:

1000 tokens/sec

表示:

每秒生成或处理 1000 个 token。

所以 vLLM 介绍里的:

High-throughput inference engine

意思:

高吞吐量推理引擎

即:

同样硬件下,让模型每秒处理更多请求/token。


2. efficient

音标:

  • 英式:/ɪˈfɪʃənt/
  • 美式:/ɪˈfɪʃənt/

发音拆分:

ef-fi-cient

音节:

/ɪ/ + /ˈfɪʃ/ + /ənt/

读音接近:

伊-菲-神特

重音在第二音节:

eFFIcient


词源与本义:

efficient 来自拉丁语:

efficere
= ex(出来)
+ facere(做)

原义:

能够做出来的、产生结果的

后来发展为:

用最少资源得到最大效果

核心概念:

efficient = output / input 最大化

即:

效率高

例如:

普通英语:

He is an efficient worker.

不是说:

“他工作很快”

而是:

他用较少时间、精力、资源完成任务。


技术领域含义:

efficient 常表示:

资源利用率高

例如:

Memory-efficient

拆开:

memory + efficient

不是:

“内存速度快”

而是:

节省内存的,内存利用效率高的

例如:

传统模型:

模型大小:70GB
运行需要:140GB RAM

优化后:

模型大小:70GB
运行需要:80GB RAM

称:

memory-efficient inference


原句解析:

The High-Throughput and Memory-Efficient inference and serving engine for LLMs.

逐词:

英文 含义
High
Throughput 吞吐量
Memory 内存
Efficient 高效利用
Inference 推理
Serving 服务化部署
Engine 引擎

整体翻译:

面向大语言模型的高吞吐、内存高效的推理与服务引擎。

技术含义:

  • High-throughput

    • 每秒处理更多 token
    • 支持更多并发用户
  • Memory-efficient

    • 减少显存占用
    • 更好利用 GPU memory
    • 允许更大的模型运行

这两个词在 LLM 推理领域经常成对出现:

Throughput ↑
Memory usage ↓
Latency ↓

也就是:

用更少显存,让 GPU 每秒处理更多请求。

例如 vLLM 的核心优化:

  • PagedAttention(减少 KV Cache 浪费)
  • Continuous batching(动态批处理)

目标就是同时提高:

tokens/sec ↑
requests/sec ↑
GPU memory utilization ↑

所以 throughput 是“处理能力”指标,efficient 是“资源利用方式”指标。