← all pillarsPillar · session 5 · live

Inference, Serving & Scaling

vLLM, PagedAttention, KV cache, speculative decoding, quantization (AWQ/FP8), FSDP & tensor/pipeline parallelism.