部署与推理优化篇
大约 1 分钟

部署与推理优化篇
推理为什么慢?KV Cache、量化、vLLM、PagedAttention——让大模型跑得更快更省。
本篇覆盖大模型部署与推理优化的核心技术:推理瓶颈分析、KV Cache 原理、量化方法(INT8/INT4/GPTQ/AWQ)、vLLM 加速原理、PagedAttention、Ollama/LM Studio/vLLM 工具选型、硬件需求、API vs 私有化部署决策,以及成本优化策略。
本篇内容
| 序号 | 文章 | 状态 |
|---|---|---|
| 1 | 大模型推理为什么慢?瓶颈在哪里? | 持续更新中 |
| 2 | KV Cache 是什么?为什么能加速推理? | 持续更新中 |
| 3 | 量化是什么?INT8、INT4、GPTQ、AWQ 有什么区别? | 持续更新中 |
| 4 | vLLM 为什么推理速度快? | 持续更新中 |
| 5 | PagedAttention 解决了什么问题? | 持续更新中 |
| 6 | Ollama、LM Studio、vLLM 分别适合什么场景? | 持续更新中 |
| 7 | 本地部署大模型需要哪些硬件? | 持续更新中 |
| 8 | API 调用和私有化部署怎么选? | 持续更新中 |
| 9 | 如何降低大模型应用成本? | 持续更新中 |
| 10 | 面试高频:大模型推理服务如何做高并发? | 持续更新中 |
