宣稱省下 106 倍成本:vLLM 怎麼把 Serving 系統校準給 Agentic Workload

vLLM 工程報告宣稱靠 Agentic Serving 優化省下 14.6~106 倍成本,但方法論其實是拿自建硬體 TCO 比 API 零售價。本文拆解真正的技術貢獻:KV Cache 分頁管理、DCP/PCP/DEP 平行化策略、排程去隊首阻塞,以及三個誠實揭露的失敗案例。