トップダウン
EngineArgs → LLMEngine → EngineCore → Scheduler → Executor → Worker/ModelRunner → モデル読み込み → KV Cache → Attention → サンプリング → 分散、と一層ずつ下へ展開。
vllm-project/vllm という高スループット LLM 推論エンジン全体の設計を、階層ごとに解き明かす日本語学習サイト。各ステップで GitHub の対応するソース行へ直接リンク、バージョンは v0.25.1 で固定。