大模型部署需要关注哪些核心指标?

大模型部署需要关注哪些核心指标?延迟、吞吐、显存和成本分别怎么看?
这道题考的是你对大模型部署的全局理解。不是问某个指标怎么算,而是问你能不能把延迟、吞吐、显存、成本这四个维度串起来,明白它们之间的拉扯关系。
大模型推理和传统服务不一样,LLM的请求是变长的、生成是流式的、资源消耗是动态的。所以评价它不能用传统CRUD服务那套思路。
一、延迟三剑客——TTFT、TPOT、尾延迟
很多人在面试时说"我们延迟很低",但一问才发现他说的是平均值。这就有问题了。
大模型延迟要拆成三个指标来看:
TTFT(Time To First Token),首Token时间。就是你发完请求,多久能拿到第一个字。这个指标反映的是"排队+Prefill阶段"的健康度。
TPOT(Time Per Output Token),每个输出Token的耗时。这个指标反映的是模型"吐出答案"的稳定性。
尾延迟(Tail Latency),通常看p95或p99。就是最慢的那5%或1%的请求要多久。这才是真实用户体验。

举个子:点外卖。骑手接单的时间就是TTFT,每公里配送时间是TPOT,你真正吃到饭的时间是尾延迟。你等外卖,真正让你崩溃的不是平均等待时间,而是"为什么别人的都到了我的还没来"。
所以为什么这三个都要看?
TTFT高 → 队列积压严重 or Prefill算力不够
TPOT高 → Decode阶段吞吐不足
尾延迟高 → 系统有瓶颈,请求分布不均匀
只看平均值,三个问题可能被互相抵消,你根本发现不了。
二、Goodput才是真正的吞吐
说到吞吐,很多人第一反应是"每秒生成多少tokens"。这个指标有没有用?有,但不够。
关键概念:Goodput = SLO达标下的有效吞吐
假设系统每秒能生成10000 tokens,听起来很厉害。但如果其中50%的请求都超过了2秒的SLO,那实际有效吞吐只有一半。

连续批处理(Continuous Batching)是个典型例子。它把多个请求凑在一起并行处理,大幅提升原始吞吐。但代价是什么?
批处理会让不同长度的请求"绑在一起"。一个长请求会拖慢整个批次里其他请求的尾延迟。所以你可能看到吞吐上去了,但p99延迟爆炸了。
结论:看吞吐一定要绑定SLO。不谈SLO的吞吐是耍流氓。
三、显存——被忽视的隐形天花板
显存这个问题,很多人到线上出事了才反应过来。
大模型推理的显存消耗主要来自三块:模型权重、KV Cache、运行时激活值。
模型权重是固定的,70B的模型大概140GB左右。运行时激活值和batch size、序列长度相关,但最大的变数是KV Cache。

KV Cache是什么? 模型生成下一个token时,需要看之前所有的token。这个"之前的历史"就存在KV Cache里。每个token的K向量和V向量都要存,而且每个并发序列都要独立存一份。
10个并发请求,每个请求平均长度2K tokens,那KV Cache的占用就是10 × 2K × 层数 × 隐藏维度 × 2(K和V各一份)。
显存设太满会怎样?系统开始拒绝请求,或者OOM崩溃。所以显存水位线要设保守,留20-30%的headroom,给碎片化和异常波动留空间。
四、吞吐优先还是延迟优先——部署策略选择
这个问题是让你展示场景理解能力。
实时交互场景(Chatbot、代码助手)→ 延迟优先策略
- 单请求快速响应
- 队列要短,超时直接拒绝
- 用更小的batch甚至batch=1
- 资源利用率可以低,但响应要快
批量推理场景(文档处理、内容生成)→ 吞吐优先策略
- 请求排队,不着急
- 连续批处理拉满
- 追求单位时间处理量
- 延迟容忍度高

混合部署时,最好按队列隔离。实时请求和批量请求混在一起,批量请求的长时间生成会卡住实时请求的调度。
还有几个高危配置组合要记住:

- 显存设满 + 高并发 → OOM重启
- 混合请求不隔离 → 尾延迟爆炸
- 上下文上限设过大 → 显存碎片化
- 连续批处理 + 严格SLO → 吞吐虚高
面试怎么答
基础版
大模型部署主要看四个核心指标:
延迟,要拆成TTFT、TPOT和p95/p99尾延迟三个维度。TTFT反映队列调度和Prefill效率,TPOT反映Decode阶段稳定性,尾延迟才是真实用户体验。平均值会掩盖问题,必须看分位数。
吞吐,要看Goodput而非原始tokens/s。连续批处理能大幅提升原始吞吐,但会放大尾延迟。所以吞吐必须绑定SLO,不谈SLO的吞吐没意义。
显存,KV Cache是主消耗项,每个并发序列独立占一份。显存水位线要设保守(留20-30% headroom),防止OOM和性能抖动。
成本,和GPU规格、显存利用率、并发能力直接相关。推理成本 = GPU成本 / 有效吞吐,要综合算账而不是只看单卡价格。
加分版
理解连续批处理的双刃剑:提升吞吐但放大尾延迟。知道高风险配置组合:显存设满+高并发、混合请求不隔离、上下文上限过大。理解推理资源契约的核心要素:模型规格、请求限制、资源规格、SLO目标、验收指标。并发安全区由显存和调度策略共同限定,不是算力说了算。
一句话总结
大模型部署的四个指标是互相拉扯的:追求低延迟要牺牲吞吐利用率,追求高吞吐要接受尾延迟波动,显存是硬性天花板,成本是最终约束。
