LLM 推理经典论文与前沿进展
本文面向希望系统学习 LLM 推理的工程师和研究者,整理对当前推理栈影响较大的论文、博客和开源项目,并单独跟踪 2024–2026 年的新进展。这里的“经典”指奠定主流方法、被后续系统广泛采用或提供重要基线的工作;“前沿”则包含已发表论文、预印本和快速演进的工程系统,成熟度并不相同。
更新时间:2026 年 8 月。论文链接优先使用 arXiv、USENIX、ACL Anthology 或 DOI 页面;工程资料指向官方博客、文档或代码仓库。
1. 先建立全局视角
1.1 请求生命周期
一次生成请求通常包含两个阶段:
- Prefill:一次性处理输入 Prompt,计算密集,关注 Attention Kernel、并行度和长上下文效率。
- Decode:逐 Token 自回归生成,通常受显存带宽和 KV Cache 访问限制,关注调度、批处理、缓存和解码加速。
常用服务指标:
| 指标 | 含义 | 适用场景 |
|---|---|---|
| TTFT | Time To First Token,首 Token 延迟 | 交互式请求、长 Prompt |
| ITL | Inter-Token Latency,相邻流式 Token 的时间间隔 | 流式输出体验和抖动 |
| TPOT | Time Per Output Token,通常按请求统计的平均输出 Token 时间 | Decode 性能比较 |
| Throughput | tokens/s、requests/s | 离线任务和容量规划 |
| Goodput | 满足延迟 SLO 的有效吞吐 | 在线服务选型 |
| 显存占用 | 权重、KV Cache、激活和通信 Buffer 的总和 | 并发上限和模型放置 |
这一区分解释了为什么同一个优化在 Prefill 和 Decode 阶段的收益可能完全不同:FlashAttention 通常对长 Prompt 的 Prefill 收益更明显;PagedAttention 和连续批处理主要提升 KV Cache 利用率与并发;speculative decoding 则尝试减少串行 Decode 轮数。
1.2 技术地图
阅读论文时先判断它优化的是哪一段数据路径,再检查代价是否转移到了其他阶段。例如 KV Cache Offload 能提高容量,但可能将瓶颈转移到 PCIe 或网络;量化能降低带宽,却可能因为缺少匹配 Kernel 而无法转化为端到端收益。
1.3 资料成熟度
| 类型 | 可以回答的问题 | 使用时的注意事项 |
|---|---|---|
| 同行评审论文 | 方法是否新颖,实验基线是否完整 | 结果通常绑定论文中的硬件、模型和负载 |
| arXiv 预印本 | 近期研究方向和实现思路 | 版本可能变化,结论尚未充分复核 |
| 官方博客/文档 | 当前框架如何实现和配置功能 | 性能数据可能针对自家软硬件最优配置 |
| 开源仓库 | 功能是否真正可运行,接口和限制是什么 | 应固定 Commit/Release,避免只参考主分支 |
站内专题可继续阅读 推理核心指标、连续批处理、KV Cache 管理架构 和 Prefill-Decode 解耦。
2. 经典论文
2.1 服务系统与调度
| 论文 | 年份 | 关键思想与影响 |
|---|---|---|
| Orca: A Distributed Serving System for Transformer-Based Generative Models | 2022 | 提出 iteration-level scheduling 和 selective batching,是连续批处理的早期代表。 |
| DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale | 2022 | 系统结合张量/流水线并行、Kernel Fusion、量化和大模型分层部署。 |
| Efficient Memory Management for LLM Serving with PagedAttention | 2023 | 将 KV Cache 按 Block 管理,减少碎片和预留浪费,直接催生 vLLM。 |
| FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU | 2023 | 将权重、激活和 KV Cache 在 GPU、CPU、磁盘之间分层 Offload。 |
| SGLang: Efficient Execution of Structured Language Model Programs | 2023/NeurIPS 2024 | 通过 RadixAttention、前缀复用和结构化程序执行优化复杂 LLM 应用。 |
| PowerInfer: Fast Large Language Model Serving with a Consumer-grade GPU | 2024 | 利用神经元激活局部性,将高频神经元放在 GPU,面向消费级 GPU 推理。 |
2.2 Attention、KV Cache 与内存
| 论文 | 年份 | 关键思想与影响 |
|---|---|---|
| FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness | 2022 | 使用 IO-aware tiling 减少 HBM 与片上 SRAM 间的数据搬运,不改变 Attention 数学结果。 |
| FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning | 2023 | 改进并行划分和工作负载均衡,进一步提升 GPU 利用率。 |
| Prompt Cache: Modular Attention Reuse for Low-Latency Inference | 2023 | 缓存可复用 Prompt 模块的 Attention 状态,适合系统提示词、模板和 RAG。 |
| CacheGen: KV Cache Compression and Streaming for Fast LLM Serving | 2023/2024 | 压缩并跨设备或网络流式传输 KV Cache,降低长上下文和多轮对话成本。 |
2.3 Speculative Decoding 与生成加速
| 论文 | 年份 | 关键思想与影响 |
|---|---|---|
| Fast Inference from Transformers via Speculative Decoding | 2022/ICML 2023 | 小模型起草、大模型并行验证,在保持目标分布不变的前提下减少解码轮数。 |
| Accelerating Large Language Model Decoding with Speculative Sampling | 2023 | 将 speculative decoding 推广到 sampling,讨论接受/拒绝采样的无损性。 |
| SpecInfer: Accelerating Generative LLM Serving with Tree-based Speculative Inference and Verification | 2023 | 用候选 Token 树进行批量验证,适合多分支 speculative inference。 |
| Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads | 2024 | 在目标模型上增加多个 decoding heads,不依赖独立 draft model。 |
2.4 量化与压缩
| 论文 | 年份 | 关键思想与影响 |
|---|---|---|
| LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale | 2022 | 使用 outlier decomposition 实现大模型混合精度 INT8 推理。 |
| GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers | 2022 | 基于近似二阶信息的一次性权重量化,成为 GPTQ 类方法的基础。 |
| SmoothQuant: Accurate and Efficient Post-Training Quantization for LLMs | 2022 | 将 activation outlier 迁移到权重,实现更易部署的 W8A8 量化。 |
| AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration | 2023 | 根据激活分布识别重要权重,常用于高质量 4-bit weight-only quantization。 |
2.5 Prefill/Decode 分离与集群架构
| 论文 | 年份 | 关键思想与影响 |
|---|---|---|
| Splitwise: Efficient Generative LLM Inference Using Phase Splitting | 2023/ISCA 2024 | 观察到 Prefill 和 Decode 的硬件需求不同,提出阶段分离和异构资源配置。 |
| DistServe: Disaggregating Prefill and Decoding for Goodput-optimized LLM Serving | 2024 | 将两个阶段部署到不同实例,联合优化 TTFT、TPOT 和 Goodput。 |
| Sarathi-Serve: Taming Throughput-Latency Tradeoff in LLM Inference | 2024 | 通过 Chunked Prefill 和调度策略,减少长 Prompt 对 Decode 请求的干扰。 |
2.6 综述入口
- Towards Efficient Generative LLM Serving: A Survey from Algorithms to Systems:从算法、模型压缩到系统架构建立完整地图。
- A Survey on Efficient Inference for Large Language Models:覆盖量化、剪枝、KV Cache、并行和服务优化。
3. 2024–2026 前沿进展
3.1 Attention Engine 与长上下文 Prefill
| 工作 | 年份/状态 | 新进展与关注点 |
|---|---|---|
| FlashAttention-3 | 2024,NeurIPS | 面向 Hopper 引入异步执行和 FP8,说明新一代 Attention Kernel 越来越依赖具体硬件流水线。 |
| FlashInfer: Efficient and Customizable Attention Engine for LLM Inference Serving | 2025,预印本/开源 | 将 Prefill、Decode、Paged KV Cache、采样等能力组织为可组合推理 Kernel,适合作为框架底层执行层来研究。 |
| MInference 1.0 | 2024,NeurIPS | 根据输入动态选择稀疏 Attention 模式,重点降低百万 Token 级上下文的 Prefill 开销。 |
| Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference | 2024 | 以 Query 感知的页级选择减少 Decode 期间需要读取的 KV 数据。 |
| Native Sparse Attention | 2025,ACL | 将压缩、选择和滑动窗口结合为可训练且硬件友好的原生稀疏 Attention。 |
| RetroInfer: A Vector Storage Engine for Scalable Long-Context LLM Inference | 2026,PVLDB | 将长上下文 KV 访问视为向量存储问题,代表存储系统与推理引擎融合的方向。 |
趋势判断:FlashAttention 解决“精确 Attention 如何高效搬运数据”,FlashInfer 进一步解决“服务系统中多种 Attention 形态如何统一执行”,而 MInference、Quest、NSA 等工作开始减少真正需要计算或读取的 Token 数量。
3.2 KV Cache 压缩、复用与数据面
| 工作 | 年份/状态 | 新进展与关注点 |
|---|---|---|
| KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache | 2024,ICML | 针对 Key 和 Value 的分布差异采用非对称 2-bit 量化,降低长上下文 KV 显存。 |
| KVQuant: Towards 10 Million Context Length LLM Inference | 2024 | 从 per-channel、敏感值和非均匀量化角度压缩 KV Cache。 |
| SnapKV | 2024,NeurIPS | 根据 Observation Window 选择重要 KV 位置,压缩生成阶段需要保留的缓存。 |
| CacheBlend | 2024/EuroSys 2025 | 面向 RAG 重用多个知识块的 KV Cache,并选择性重算跨块 Attention。 |
| vAttention | 2024/ASPLOS 2025 | 利用操作系统虚拟内存按需分配连续 KV 地址空间,探索不使用 PagedAttention 的动态管理路线。 |
| Oaken | 2025,ISCA | 联合在线与离线 KV 量化,在服务运行时平衡精度、带宽和容量。 |
当前 KV Cache 优化已经从单机显存分配扩展到三个层次:单 Token 表示压缩、跨请求前缀复用、跨机器缓存传输。三者的瓶颈和质量风险不同,评测时应分开报告。
CacheBlend、vAttention 和 Oaken 在下表的不同主题中再次出现,是因为它们同时涉及缓存算法、内存管理和服务系统;重复出现用于强调交叉影响,不代表独立工作被重复统计。
3.3 Speculative Decoding 2.0
| 工作 | 年份/状态 | 新进展与关注点 |
|---|---|---|
| EAGLE | 2024,ICML | 在特征层而非纯 Token 层预测 Draft,提升接受率和生成速度。 |
| EAGLE-2 | 2024 | 使用动态 Draft Tree,根据上下文置信度调整候选树结构。 |
| LayerSkip | 2024,ACL | 通过 Early Exit 让同一个模型承担 Draft 和 Verify,实现 self-speculative decoding。 |
| EAGLE-3 | 2025,预印本 | 改进训练时特征融合与测试时 Draft,代表 feature-level speculation 的继续演进。 |
新一代方法不再只依赖“小模型猜、大模型验”。研究重点转向动态候选树、同模型 Early Exit、特征层 Draft,以及服务系统中接受率、验证 Batch 和调度策略的联合优化。推理框架的端到端收益仍强依赖具体模型和采样参数。
3.4 低比特推理与系统协同
| 工作 | 年份/状态 | 新进展与关注点 |
|---|---|---|
| QuaRot: Outlier-Free 4-Bit Inference in Rotated LLMs | 2024,NeurIPS | 用旋转变换消除异常值,使权重、激活和 KV Cache 的 4-bit 量化更可行。 |
| SpinQuant | 2024 | 将旋转矩阵变为可学习参数,降低旋转量化的精度损失。 |
| QServe: W4A8KV4 Quantization and System Co-design | 2024 | 同时优化 W4A8KV4 数值格式、Kernel 和服务系统,强调量化必须有硬件 Kernel 配合。 |
| Oaken | 2025,ISCA | 将 KV4 从离线模型压缩问题扩展为在线服务策略。 |
量化选型不能只看“4-bit”标签。Weight-only、W8A8、W4A8 和 KV4 对 Prefill、Decode、显存容量以及硬件支持的影响不同;没有对应高效 Kernel 时,理论位宽降低不一定转化为吞吐提升。
3.5 PD 解耦、分布式缓存与路由
| 工作 | 年份/状态 | 新进展与关注点 |
|---|---|---|
| Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving | 2024/2025 | 将 KV Cache 作为独立数据面,通过分布式缓存池和高速传输连接 Prefill、Decode 实例。 |
| Preble: Efficient Distributed Prompt Scheduling for LLM Serving | 2024 | 根据共享前缀和负载进行分布式 Prompt 路由,在缓存命中与负载均衡间取舍。 |
| CacheBlend | 2024/EuroSys 2025 | 将 RAG 的缓存复用推进到多个非连续知识块组合场景。 |
| vAttention | ASPLOS 2025 | 重新审视 PagedAttention 的软件分页成本,以虚拟内存机制支持动态 KV 分配。 |
这一方向的核心已不只是“把 Prefill 和 Decode 放到不同 GPU”,而是构建独立 KV Cache 数据面,并让路由器感知前缀命中、传输成本、SLO 和异构硬件。
3.6 模型架构开始为推理而设计
| 工作 | 年份 | 与推理相关的变化 |
|---|---|---|
| DeepSeek-V2 | 2024 | Multi-head Latent Attention(MLA)压缩 KV 表示,MoE 降低每 Token 激活参数量。 |
| DeepSeek-V3 Technical Report | 2024/2025 | 延续 MLA/MoE,并使用 Multi-Token Prediction,为后续 speculative decoding 提供结构基础。 |
| DeepSeek-R1 | 2025 | 长 Chain-of-Thought 让输出长度和 Decode 成本显著上升,推动按 Goodput、KV 容量和长输出调度重新评测推理系统。 |
这类工作表明推理优化正在前移到模型设计阶段。未来对服务框架的评测需要区分 MHA、GQA、MLA、Dense、MoE 和 Hybrid SSM 等模型结构,不能只用参数量作为成本代理。
4. 经典博客与工程资料
| 资料 | 推荐理由 |
|---|---|
| vLLM: Easy, Fast, and Cheap LLM Serving | vLLM 官方介绍,适合理解 PagedAttention、连续批处理和服务设计。 |
| Anyscale: Continuous Batching for LLM Inference | 用工程视角解释 iteration-level scheduling 的收益。 |
| NVIDIA: Mastering LLM Techniques — Inference Optimization | 系统覆盖并行、量化、KV Cache、批处理和 speculative decoding。 |
| PyTorch: Flash-Decoding | 解释长序列 Decode 阶段的并行化和 Attention 优化。 |
| PyTorch: Accelerating Generative AI | 介绍 PyTorch SDPA、编译和 Kernel 层面的生成式 AI 优化。 |
| Hugging Face: Assisted Generation | speculative decoding 的直观工程说明。 |
| Hugging Face Text Generation Inference | 生产部署、量化、张量并行和服务接口的实用文档。 |
| LMSYS: SGLang | 解释 RadixAttention、结构化生成和 Prefix Reuse。 |
| TensorRT-LLM | NVIDIA 硬件生态下的高性能推理实现,可与 vLLM 对照学习。 |
4.1 近期工程演进
| 资料 | 时间 | 推荐理由 |
|---|---|---|
| vLLM V1: A Major Upgrade to vLLM's Core Architecture | 2025 | 了解 vLLM 新核心架构、统一调度器、Prefix Cache 和执行路径重构。 |
| NVIDIA Dynamo | 2025– | 面向推理集群的开源运行时,重点覆盖智能路由、PD 解耦、KV 传输和多后端。 |
| llm-d | 2025– | Kubernetes 原生的分布式推理方案,关注推理调度、路由和 KV Cache 基础设施。 |
| FlashInfer | 2025– | 可组合 Attention、采样和通信 Kernel,适合跟踪推理框架底层执行层。 |
| Disaggregated Serving for Hybrid SSM Models in vLLM | 2026 | 说明 PD 解耦如何扩展到 Attention 与 SSM 混合模型,以及状态迁移的新问题。 |
| Keeping vLLM Production Quality | 2026 | 从 CI、性能回归、Benchmark 和发布流程理解生产级推理框架如何保持性能质量。 |
4.2 运行时架构与分布式执行
| 资料 | 推荐理由 |
|---|---|
| Inside vLLM: Anatomy of a High-Throughput LLM Inference System | 从请求进入、调度、KV Block 管理到 Worker 执行理解完整数据路径。 |
| Distributed Inference with vLLM | 解释单节点与多节点 Tensor Parallel、Pipeline Parallel 和部署拓扑。 |
| Introduction to torch.compile and How It Works with vLLM | 理解动态图捕获、编译缓存、Custom Op 和推理框架的编译边界。 |
| Optimizing Inference on LLMs with TensorRT-LLM | 从 NVIDIA Kernel、量化和 In-flight Batching 视角理解另一条推理栈。 |
| Ray Serve LLM | 关注模型副本、自动扩缩、路由和 Python 服务编排,而不只关注单进程 Engine。 |
4.3 KV Cache、连接器与解耦服务
| 资料 | 推荐理由 |
|---|---|
| The State of FP8 KV-Cache and Attention Quantization in vLLM | 说明 FP8 KV Cache 的 Kernel、精度校准和硬件支持现状。 |
| Serving Agentic Workloads at Scale with vLLM x Mooncake | 展示 Agent 多轮工作负载下 Session KV Cache 的跨实例复用。 |
| LMCache Documentation | 包含 vLLM/SGLang 集成、CPU/Disk/Remote Offload 和 KV Connector 实践。 |
| Mooncake | KVCache-centric 分布式存储与传输实现,可用于研究 PD 解耦的数据面。 |
| NIXL | 为 GPU、CPU、对象存储等内存层次提供统一的数据移动接口。 |
4.4 Speculative Decoding、MoE 与量化
| 资料 | 推荐理由 |
|---|---|
| How Speculative Decoding Boosts vLLM Performance | 给出 Draft Model、N-gram 和典型接受率/开销分析。 |
| EAGLE 3.1 in vLLM | 了解 Feature-level Draft 如何进入生产推理框架。 |
| Parallel All the Way Down | 讨论并行 Draft 与多 Token 生成的新工程路径。 |
| Elastic Expert Parallelism in vLLM | 关注 MoE 模型 Expert 放置、负载变化和弹性并行。 |
| TensorRT-LLM Quantization | 对照 FP8、INT8、INT4、AWQ、GPTQ 和 KV Cache 量化的硬件支持。 |
4.5 Benchmark、容量规划与性能回归
| 资料 | 推荐理由 |
|---|---|
| vLLM Bench Serve | 生成请求负载并统计 TTFT、TPOT、ITL 和端到端吞吐。 |
| SGLang Benchmark and Profiling | 覆盖离线吞吐、在线服务和 Nsight Profiling。 |
| TensorRT-LLM Performance Benchmarking | 学习固定输入/输出长度和 IFB 场景的标准化测试。 |
| GenAI-Perf | 对 OpenAI-compatible、Triton 和 TensorRT-LLM 服务进行统一压测。 |
| GuideLLM | 构造并发、请求率和数据集驱动的负载,适合做引擎横向比较。 |
| Vidur | 用模拟器做 GPU 类型、并行度、Batch 和请求分布的容量规划。 |
完整实验路线见 论文方法与工程选型对照。
推荐阅读
- 先读两篇综述,建立术语和技术地图。
- 读 Orca,理解 iteration-level scheduling。
- 读 PagedAttention,理解 KV Cache 为什么成为服务系统核心。
- 从 FlashAttention 读到 FlashAttention-3 和 FlashInfer,理解 Kernel 如何走向硬件专用化和服务化。
- 从 speculative decoding 读到 EAGLE-2/3 与 LayerSkip,理解动态树和 self-speculation。
- 从 GPTQ、SmoothQuant、AWQ 读到 QuaRot、QServe,理解量化与 Kernel 的系统协同。
- 从 DistServe、Splitwise 读到 Mooncake、Preble,理解 KV Cache 数据面和缓存感知路由。
- 按 论文方法与工程选型对照 完成包含真实请求分布的基准实验。
5. 论文方法与工程选型对照
| 目标 | 优先关注的技术 |
|---|---|
| 单卡部署 | AWQ/GPTQ、FlashAttention-2/3、vLLM |
| 多卡部署 | 张量并行、流水线并行、vLLM、SGLang 或 TensorRT-LLM |
| 高并发在线服务 | PagedAttention、Continuous Batching |
| 长 Prompt 或 RAG | Prefix Caching、CacheBlend、Chunked Prefill、MInference |
| 降低输出延迟 | Speculative Decoding、EAGLE、LayerSkip |
| 多租户大规模集群 | PD Disaggregation、Mooncake、Preble、Dynamo、llm-d |
| KV Cache 容量受限 | KIVI、KVQuant、SnapKV、Oaken |
| 低比特端到端推理 | QuaRot、SpinQuant、QServe,确认目标硬件 Kernel 支持 |
| 消费级 GPU 或 CPU Offload | FlexGen、PowerInfer |
6. 阅读和实验时的注意事项
- 论文中的加速比依赖模型大小、输入/输出长度、Batch Size、GPU 型号、量化精度和延迟 SLO,不能直接横向比较。
- 评测至少同时记录 TTFT、TPOT/ITL、吞吐、显存峰值和请求完成率;只看 tokens/s 容易掩盖在线延迟退化。
- Prefill 和 Decode 的瓶颈不同,建议分阶段报告结果,并明确是否启用了 Prefix Cache、量化和 speculative decoding。
- 对量化方法应同时评测困惑度、任务准确率和端到端吞吐,不能只比较模型文件大小。
- 对 PD 解耦系统必须报告 KV 传输带宽、缓存命中率、跨节点拓扑和路由策略;忽略数据面成本会高估收益。
- 对 reasoning model 应报告输出长度分布、推理预算和截断策略,普通短输出基准无法代表其真实 Decode 负载。
- 对 2025–2026 年预印本和快速迭代项目,应复现实验或核对稳定版本文档,不把仓库中的单次性能数字视为通用结论。
总结
当前 LLM 推理优化可以按三条主线理解:
- 减少每一步的工作量:稀疏 Attention、KV 压缩和 speculative decoding。
- 更有效地搬运和复用状态:PagedAttention、Prefix Cache、KV Offload 和分布式 KV 数据面。
- 让硬件持续保持有效工作:Continuous Batching、专用 Kernel、量化、并行和 PD 解耦。
最可靠的学习方式是先用 vLLM 或 SGLang 建立基线,再一次只改变一个变量,最后用真实请求分布验证论文或博客中的性能结论。具体实验步骤见 论文方法与工程选型对照。