Skip to content

LLM 推理经典论文与前沿进展

本文面向希望系统学习 LLM 推理的工程师和研究者,整理对当前推理栈影响较大的论文、博客和开源项目,并单独跟踪 2024–2026 年的新进展。这里的“经典”指奠定主流方法、被后续系统广泛采用或提供重要基线的工作;“前沿”则包含已发表论文、预印本和快速演进的工程系统,成熟度并不相同。

更新时间:2026 年 8 月。论文链接优先使用 arXiv、USENIX、ACL Anthology 或 DOI 页面;工程资料指向官方博客、文档或代码仓库。

1. 先建立全局视角

1.1 请求生命周期

一次生成请求通常包含两个阶段:

  • Prefill:一次性处理输入 Prompt,计算密集,关注 Attention Kernel、并行度和长上下文效率。
  • Decode:逐 Token 自回归生成,通常受显存带宽和 KV Cache 访问限制,关注调度、批处理、缓存和解码加速。

常用服务指标:

指标含义适用场景
TTFTTime To First Token,首 Token 延迟交互式请求、长 Prompt
ITLInter-Token Latency,相邻流式 Token 的时间间隔流式输出体验和抖动
TPOTTime Per Output Token,通常按请求统计的平均输出 Token 时间Decode 性能比较
Throughputtokens/s、requests/s离线任务和容量规划
Goodput满足延迟 SLO 的有效吞吐在线服务选型
显存占用权重、KV Cache、激活和通信 Buffer 的总和并发上限和模型放置

这一区分解释了为什么同一个优化在 Prefill 和 Decode 阶段的收益可能完全不同:FlashAttention 通常对长 Prompt 的 Prefill 收益更明显;PagedAttention 和连续批处理主要提升 KV Cache 利用率与并发;speculative decoding 则尝试减少串行 Decode 轮数。

1.2 技术地图

阅读论文时先判断它优化的是哪一段数据路径,再检查代价是否转移到了其他阶段。例如 KV Cache Offload 能提高容量,但可能将瓶颈转移到 PCIe 或网络;量化能降低带宽,却可能因为缺少匹配 Kernel 而无法转化为端到端收益。

1.3 资料成熟度

类型可以回答的问题使用时的注意事项
同行评审论文方法是否新颖,实验基线是否完整结果通常绑定论文中的硬件、模型和负载
arXiv 预印本近期研究方向和实现思路版本可能变化,结论尚未充分复核
官方博客/文档当前框架如何实现和配置功能性能数据可能针对自家软硬件最优配置
开源仓库功能是否真正可运行,接口和限制是什么应固定 Commit/Release,避免只参考主分支

站内专题可继续阅读 推理核心指标连续批处理KV Cache 管理架构Prefill-Decode 解耦

2. 经典论文

2.1 服务系统与调度

论文年份关键思想与影响
Orca: A Distributed Serving System for Transformer-Based Generative Models2022提出 iteration-level scheduling 和 selective batching,是连续批处理的早期代表。
DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale2022系统结合张量/流水线并行、Kernel Fusion、量化和大模型分层部署。
Efficient Memory Management for LLM Serving with PagedAttention2023将 KV Cache 按 Block 管理,减少碎片和预留浪费,直接催生 vLLM。
FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU2023将权重、激活和 KV Cache 在 GPU、CPU、磁盘之间分层 Offload。
SGLang: Efficient Execution of Structured Language Model Programs2023/NeurIPS 2024通过 RadixAttention、前缀复用和结构化程序执行优化复杂 LLM 应用。
PowerInfer: Fast Large Language Model Serving with a Consumer-grade GPU2024利用神经元激活局部性,将高频神经元放在 GPU,面向消费级 GPU 推理。

2.2 Attention、KV Cache 与内存

论文年份关键思想与影响
FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness2022使用 IO-aware tiling 减少 HBM 与片上 SRAM 间的数据搬运,不改变 Attention 数学结果。
FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning2023改进并行划分和工作负载均衡,进一步提升 GPU 利用率。
Prompt Cache: Modular Attention Reuse for Low-Latency Inference2023缓存可复用 Prompt 模块的 Attention 状态,适合系统提示词、模板和 RAG。
CacheGen: KV Cache Compression and Streaming for Fast LLM Serving2023/2024压缩并跨设备或网络流式传输 KV Cache,降低长上下文和多轮对话成本。

2.3 Speculative Decoding 与生成加速

论文年份关键思想与影响
Fast Inference from Transformers via Speculative Decoding2022/ICML 2023小模型起草、大模型并行验证,在保持目标分布不变的前提下减少解码轮数。
Accelerating Large Language Model Decoding with Speculative Sampling2023将 speculative decoding 推广到 sampling,讨论接受/拒绝采样的无损性。
SpecInfer: Accelerating Generative LLM Serving with Tree-based Speculative Inference and Verification2023用候选 Token 树进行批量验证,适合多分支 speculative inference。
Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads2024在目标模型上增加多个 decoding heads,不依赖独立 draft model。

2.4 量化与压缩

论文年份关键思想与影响
LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale2022使用 outlier decomposition 实现大模型混合精度 INT8 推理。
GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers2022基于近似二阶信息的一次性权重量化,成为 GPTQ 类方法的基础。
SmoothQuant: Accurate and Efficient Post-Training Quantization for LLMs2022将 activation outlier 迁移到权重,实现更易部署的 W8A8 量化。
AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration2023根据激活分布识别重要权重,常用于高质量 4-bit weight-only quantization。

2.5 Prefill/Decode 分离与集群架构

论文年份关键思想与影响
Splitwise: Efficient Generative LLM Inference Using Phase Splitting2023/ISCA 2024观察到 Prefill 和 Decode 的硬件需求不同,提出阶段分离和异构资源配置。
DistServe: Disaggregating Prefill and Decoding for Goodput-optimized LLM Serving2024将两个阶段部署到不同实例,联合优化 TTFT、TPOT 和 Goodput。
Sarathi-Serve: Taming Throughput-Latency Tradeoff in LLM Inference2024通过 Chunked Prefill 和调度策略,减少长 Prompt 对 Decode 请求的干扰。

2.6 综述入口

3. 2024–2026 前沿进展

3.1 Attention Engine 与长上下文 Prefill

工作年份/状态新进展与关注点
FlashAttention-32024,NeurIPS面向 Hopper 引入异步执行和 FP8,说明新一代 Attention Kernel 越来越依赖具体硬件流水线。
FlashInfer: Efficient and Customizable Attention Engine for LLM Inference Serving2025,预印本/开源将 Prefill、Decode、Paged KV Cache、采样等能力组织为可组合推理 Kernel,适合作为框架底层执行层来研究。
MInference 1.02024,NeurIPS根据输入动态选择稀疏 Attention 模式,重点降低百万 Token 级上下文的 Prefill 开销。
Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference2024以 Query 感知的页级选择减少 Decode 期间需要读取的 KV 数据。
Native Sparse Attention2025,ACL将压缩、选择和滑动窗口结合为可训练且硬件友好的原生稀疏 Attention。
RetroInfer: A Vector Storage Engine for Scalable Long-Context LLM Inference2026,PVLDB将长上下文 KV 访问视为向量存储问题,代表存储系统与推理引擎融合的方向。

趋势判断:FlashAttention 解决“精确 Attention 如何高效搬运数据”,FlashInfer 进一步解决“服务系统中多种 Attention 形态如何统一执行”,而 MInference、Quest、NSA 等工作开始减少真正需要计算或读取的 Token 数量。

3.2 KV Cache 压缩、复用与数据面

工作年份/状态新进展与关注点
KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache2024,ICML针对 Key 和 Value 的分布差异采用非对称 2-bit 量化,降低长上下文 KV 显存。
KVQuant: Towards 10 Million Context Length LLM Inference2024从 per-channel、敏感值和非均匀量化角度压缩 KV Cache。
SnapKV2024,NeurIPS根据 Observation Window 选择重要 KV 位置,压缩生成阶段需要保留的缓存。
CacheBlend2024/EuroSys 2025面向 RAG 重用多个知识块的 KV Cache,并选择性重算跨块 Attention。
vAttention2024/ASPLOS 2025利用操作系统虚拟内存按需分配连续 KV 地址空间,探索不使用 PagedAttention 的动态管理路线。
Oaken2025,ISCA联合在线与离线 KV 量化,在服务运行时平衡精度、带宽和容量。

当前 KV Cache 优化已经从单机显存分配扩展到三个层次:单 Token 表示压缩、跨请求前缀复用、跨机器缓存传输。三者的瓶颈和质量风险不同,评测时应分开报告。

CacheBlend、vAttention 和 Oaken 在下表的不同主题中再次出现,是因为它们同时涉及缓存算法、内存管理和服务系统;重复出现用于强调交叉影响,不代表独立工作被重复统计。

3.3 Speculative Decoding 2.0

工作年份/状态新进展与关注点
EAGLE2024,ICML在特征层而非纯 Token 层预测 Draft,提升接受率和生成速度。
EAGLE-22024使用动态 Draft Tree,根据上下文置信度调整候选树结构。
LayerSkip2024,ACL通过 Early Exit 让同一个模型承担 Draft 和 Verify,实现 self-speculative decoding。
EAGLE-32025,预印本改进训练时特征融合与测试时 Draft,代表 feature-level speculation 的继续演进。

新一代方法不再只依赖“小模型猜、大模型验”。研究重点转向动态候选树、同模型 Early Exit、特征层 Draft,以及服务系统中接受率、验证 Batch 和调度策略的联合优化。推理框架的端到端收益仍强依赖具体模型和采样参数。

3.4 低比特推理与系统协同

工作年份/状态新进展与关注点
QuaRot: Outlier-Free 4-Bit Inference in Rotated LLMs2024,NeurIPS用旋转变换消除异常值,使权重、激活和 KV Cache 的 4-bit 量化更可行。
SpinQuant2024将旋转矩阵变为可学习参数,降低旋转量化的精度损失。
QServe: W4A8KV4 Quantization and System Co-design2024同时优化 W4A8KV4 数值格式、Kernel 和服务系统,强调量化必须有硬件 Kernel 配合。
Oaken2025,ISCA将 KV4 从离线模型压缩问题扩展为在线服务策略。

量化选型不能只看“4-bit”标签。Weight-only、W8A8、W4A8 和 KV4 对 Prefill、Decode、显存容量以及硬件支持的影响不同;没有对应高效 Kernel 时,理论位宽降低不一定转化为吞吐提升。

3.5 PD 解耦、分布式缓存与路由

工作年份/状态新进展与关注点
Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving2024/2025将 KV Cache 作为独立数据面,通过分布式缓存池和高速传输连接 Prefill、Decode 实例。
Preble: Efficient Distributed Prompt Scheduling for LLM Serving2024根据共享前缀和负载进行分布式 Prompt 路由,在缓存命中与负载均衡间取舍。
CacheBlend2024/EuroSys 2025将 RAG 的缓存复用推进到多个非连续知识块组合场景。
vAttentionASPLOS 2025重新审视 PagedAttention 的软件分页成本,以虚拟内存机制支持动态 KV 分配。

这一方向的核心已不只是“把 Prefill 和 Decode 放到不同 GPU”,而是构建独立 KV Cache 数据面,并让路由器感知前缀命中、传输成本、SLO 和异构硬件。

3.6 模型架构开始为推理而设计

工作年份与推理相关的变化
DeepSeek-V22024Multi-head Latent Attention(MLA)压缩 KV 表示,MoE 降低每 Token 激活参数量。
DeepSeek-V3 Technical Report2024/2025延续 MLA/MoE,并使用 Multi-Token Prediction,为后续 speculative decoding 提供结构基础。
DeepSeek-R12025长 Chain-of-Thought 让输出长度和 Decode 成本显著上升,推动按 Goodput、KV 容量和长输出调度重新评测推理系统。

这类工作表明推理优化正在前移到模型设计阶段。未来对服务框架的评测需要区分 MHA、GQA、MLA、Dense、MoE 和 Hybrid SSM 等模型结构,不能只用参数量作为成本代理。

4. 经典博客与工程资料

资料推荐理由
vLLM: Easy, Fast, and Cheap LLM ServingvLLM 官方介绍,适合理解 PagedAttention、连续批处理和服务设计。
Anyscale: Continuous Batching for LLM Inference用工程视角解释 iteration-level scheduling 的收益。
NVIDIA: Mastering LLM Techniques — Inference Optimization系统覆盖并行、量化、KV Cache、批处理和 speculative decoding。
PyTorch: Flash-Decoding解释长序列 Decode 阶段的并行化和 Attention 优化。
PyTorch: Accelerating Generative AI介绍 PyTorch SDPA、编译和 Kernel 层面的生成式 AI 优化。
Hugging Face: Assisted Generationspeculative decoding 的直观工程说明。
Hugging Face Text Generation Inference生产部署、量化、张量并行和服务接口的实用文档。
LMSYS: SGLang解释 RadixAttention、结构化生成和 Prefix Reuse。
TensorRT-LLMNVIDIA 硬件生态下的高性能推理实现,可与 vLLM 对照学习。

4.1 近期工程演进

资料时间推荐理由
vLLM V1: A Major Upgrade to vLLM's Core Architecture2025了解 vLLM 新核心架构、统一调度器、Prefix Cache 和执行路径重构。
NVIDIA Dynamo2025–面向推理集群的开源运行时,重点覆盖智能路由、PD 解耦、KV 传输和多后端。
llm-d2025–Kubernetes 原生的分布式推理方案,关注推理调度、路由和 KV Cache 基础设施。
FlashInfer2025–可组合 Attention、采样和通信 Kernel,适合跟踪推理框架底层执行层。
Disaggregated Serving for Hybrid SSM Models in vLLM2026说明 PD 解耦如何扩展到 Attention 与 SSM 混合模型,以及状态迁移的新问题。
Keeping vLLM Production Quality2026从 CI、性能回归、Benchmark 和发布流程理解生产级推理框架如何保持性能质量。

4.2 运行时架构与分布式执行

资料推荐理由
Inside vLLM: Anatomy of a High-Throughput LLM Inference System从请求进入、调度、KV Block 管理到 Worker 执行理解完整数据路径。
Distributed Inference with vLLM解释单节点与多节点 Tensor Parallel、Pipeline Parallel 和部署拓扑。
Introduction to torch.compile and How It Works with vLLM理解动态图捕获、编译缓存、Custom Op 和推理框架的编译边界。
Optimizing Inference on LLMs with TensorRT-LLM从 NVIDIA Kernel、量化和 In-flight Batching 视角理解另一条推理栈。
Ray Serve LLM关注模型副本、自动扩缩、路由和 Python 服务编排,而不只关注单进程 Engine。

4.3 KV Cache、连接器与解耦服务

资料推荐理由
The State of FP8 KV-Cache and Attention Quantization in vLLM说明 FP8 KV Cache 的 Kernel、精度校准和硬件支持现状。
Serving Agentic Workloads at Scale with vLLM x Mooncake展示 Agent 多轮工作负载下 Session KV Cache 的跨实例复用。
LMCache Documentation包含 vLLM/SGLang 集成、CPU/Disk/Remote Offload 和 KV Connector 实践。
MooncakeKVCache-centric 分布式存储与传输实现,可用于研究 PD 解耦的数据面。
NIXL为 GPU、CPU、对象存储等内存层次提供统一的数据移动接口。

4.4 Speculative Decoding、MoE 与量化

资料推荐理由
How Speculative Decoding Boosts vLLM Performance给出 Draft Model、N-gram 和典型接受率/开销分析。
EAGLE 3.1 in vLLM了解 Feature-level Draft 如何进入生产推理框架。
Parallel All the Way Down讨论并行 Draft 与多 Token 生成的新工程路径。
Elastic Expert Parallelism in vLLM关注 MoE 模型 Expert 放置、负载变化和弹性并行。
TensorRT-LLM Quantization对照 FP8、INT8、INT4、AWQ、GPTQ 和 KV Cache 量化的硬件支持。

4.5 Benchmark、容量规划与性能回归

资料推荐理由
vLLM Bench Serve生成请求负载并统计 TTFT、TPOT、ITL 和端到端吞吐。
SGLang Benchmark and Profiling覆盖离线吞吐、在线服务和 Nsight Profiling。
TensorRT-LLM Performance Benchmarking学习固定输入/输出长度和 IFB 场景的标准化测试。
GenAI-Perf对 OpenAI-compatible、Triton 和 TensorRT-LLM 服务进行统一压测。
GuideLLM构造并发、请求率和数据集驱动的负载,适合做引擎横向比较。
Vidur用模拟器做 GPU 类型、并行度、Batch 和请求分布的容量规划。

完整实验路线见 论文方法与工程选型对照

推荐阅读

  1. 先读两篇综述,建立术语和技术地图。
  2. 读 Orca,理解 iteration-level scheduling。
  3. 读 PagedAttention,理解 KV Cache 为什么成为服务系统核心。
  4. 从 FlashAttention 读到 FlashAttention-3 和 FlashInfer,理解 Kernel 如何走向硬件专用化和服务化。
  5. 从 speculative decoding 读到 EAGLE-2/3 与 LayerSkip,理解动态树和 self-speculation。
  6. 从 GPTQ、SmoothQuant、AWQ 读到 QuaRot、QServe,理解量化与 Kernel 的系统协同。
  7. 从 DistServe、Splitwise 读到 Mooncake、Preble,理解 KV Cache 数据面和缓存感知路由。
  8. 论文方法与工程选型对照 完成包含真实请求分布的基准实验。

5. 论文方法与工程选型对照

目标优先关注的技术
单卡部署AWQ/GPTQ、FlashAttention-2/3、vLLM
多卡部署张量并行、流水线并行、vLLM、SGLang 或 TensorRT-LLM
高并发在线服务PagedAttention、Continuous Batching
长 Prompt 或 RAGPrefix Caching、CacheBlend、Chunked Prefill、MInference
降低输出延迟Speculative Decoding、EAGLE、LayerSkip
多租户大规模集群PD Disaggregation、Mooncake、Preble、Dynamo、llm-d
KV Cache 容量受限KIVI、KVQuant、SnapKV、Oaken
低比特端到端推理QuaRot、SpinQuant、QServe,确认目标硬件 Kernel 支持
消费级 GPU 或 CPU OffloadFlexGen、PowerInfer

6. 阅读和实验时的注意事项

  • 论文中的加速比依赖模型大小、输入/输出长度、Batch Size、GPU 型号、量化精度和延迟 SLO,不能直接横向比较。
  • 评测至少同时记录 TTFT、TPOT/ITL、吞吐、显存峰值和请求完成率;只看 tokens/s 容易掩盖在线延迟退化。
  • Prefill 和 Decode 的瓶颈不同,建议分阶段报告结果,并明确是否启用了 Prefix Cache、量化和 speculative decoding。
  • 对量化方法应同时评测困惑度、任务准确率和端到端吞吐,不能只比较模型文件大小。
  • 对 PD 解耦系统必须报告 KV 传输带宽、缓存命中率、跨节点拓扑和路由策略;忽略数据面成本会高估收益。
  • 对 reasoning model 应报告输出长度分布、推理预算和截断策略,普通短输出基准无法代表其真实 Decode 负载。
  • 对 2025–2026 年预印本和快速迭代项目,应复现实验或核对稳定版本文档,不把仓库中的单次性能数字视为通用结论。

总结

当前 LLM 推理优化可以按三条主线理解:

  • 减少每一步的工作量:稀疏 Attention、KV 压缩和 speculative decoding。
  • 更有效地搬运和复用状态:PagedAttention、Prefix Cache、KV Offload 和分布式 KV 数据面。
  • 让硬件持续保持有效工作:Continuous Batching、专用 Kernel、量化、并行和 PD 解耦。

最可靠的学习方式是先用 vLLM 或 SGLang 建立基线,再一次只改变一个变量,最后用真实请求分布验证论文或博客中的性能结论。具体实验步骤见 论文方法与工程选型对照

Maintained by Robin