Tiammomo

大模型推理

从模型骨架、推理优化、KV Cache、调度、投机解码、量化到长上下文,关注延迟、吞吐、成本和质量取舍。

7 个主题 模型骨架 显存与调度 加速解码 成本压缩

专题导航

四条线拆分成独立页面,当前页面只展示“大模型推理”专题内的完整图解。

返回写作中心 →
Line 03

大模型推理

从模型骨架、推理优化、KV Cache、调度、投机解码、量化到长上下文,关注延迟、吞吐、成本和质量取舍。

7 个主题 模型骨架 显存与调度 加速解码 成本压缩
大模型架构 Model Architecture 高密度幻想风知识地图
大模型推理 · Architecture

Model Architecture:模型骨架

把 Transformer、注意力、上下文长度、MoE、多模态和推理成本放进一张架构视图里。

文章待补充
LLM Inference 推理优化高密度幻想风知识地图
大模型推理 · Inference

LLM Inference:推理优化

从首 token 延迟、吞吐、KV Cache、批处理、量化、投机解码、并行和缓存看模型推理性能。

文章待补充
KV Cache PagedAttention 高密度幻想风知识地图
大模型推理 · KV Cache

KV Cache:PagedAttention

理解 Prefill、Decode、Key/Value 缓存、显存占用、分页管理、连续批处理和长上下文推理性能。

文章待补充
Batching Scheduling 推理调度高密度幻想风知识地图
大模型推理 · Scheduling

Batching & Scheduling:推理调度

梳理动态批处理、continuous batching、队列优先级、prefill/decode 分离、SLA、尾延迟和容量规划。

文章待补充
Speculative Decoding 投机解码高密度幻想风知识地图
大模型推理 · Decoding

Speculative Decoding:投机解码

理解 draft model、target model、候选 token、并行验证、接受率、加速比、质量风险和适用场景。

文章待补充
Quantization 模型量化与压缩高密度幻想风知识地图
大模型推理 · Compression

Quantization:模型量化与压缩

从权重量化、激活量化、GPTQ、AWQ、SmoothQuant、KV Cache 量化、蒸馏和质量评估理解压缩取舍。

文章待补充
Long Context 长上下文与注意力优化高密度幻想风知识地图
大模型推理 · Long Context

Long Context:长上下文与注意力优化

理解上下文窗口、RoPE、位置插值、FlashAttention、滑动窗口、KV 压缩、RAG 互补和长文评测。

文章待补充