Home avatar

宣稱省下 106 倍成本:vLLM 怎麼把 Serving 系統校準給 Agentic Workload

vLLM 工程報告宣稱靠 Agentic Serving 優化省下 14.6~106 倍成本,但方法論其實是拿自建硬體 TCO 比 API 零售價。本文拆解真正的技術貢獻:KV Cache 分頁管理、DCP/PCP/DEP 平行化策略、排程去隊首阻塞,以及三個誠實揭露的失敗案例。

Dream-RSI 解析:把探索歷史當免費模擬器,而不是真正的 World Model

Dream-RSI 把探索歷史當成可重播的免費模擬器,低成本篩選新的探索策略,但論文自稱的「World Model」其實只是精緻的重播評估機制;後半也整理了辨識假 World Model、Planning 與 Policy Learning 取捨、失敗分類框架的可遷移心法。