Purdue 大學論文《Naive Prompt Optimization》問了一個直白的問題:給夠豐富的執行回饋、配一個夠強的 teacher,還需要 GEPA 那套搜索機制嗎?本文檢視 NPO 的方法,以及它「用更少執行次數打贏 GEPA」這個賣點裡沒拆開驗證的混淆變因。
vLLM 工程報告宣稱靠 Agentic Serving 優化省下 14.6~106 倍成本,但方法論其實是拿自建硬體 TCO 比 API 零售價。本文拆解真正的技術貢獻:KV Cache 分頁管理、DCP/PCP/DEP 平行化策略、排程去隊首阻塞,以及三個誠實揭露的失敗案例。
TypeSafe AI 的 Jev 號稱比前沿大模型快 193.6 倍、便宜 444.6 倍,且不會產生幻覺。第三方獨立測試只有 5 到 25 倍——拆解 RLCD 訓練、校準機率與官方數字背後的真相。
Dream-RSI 把探索歷史當成可重播的免費模擬器,低成本篩選新的探索策略,但論文自稱的「World Model」其實只是精緻的重播評估機制;後半也整理了辨識假 World Model、Planning 與 Policy Learning 取捨、失敗分類框架的可遷移心法。
長上下文時代,ICL 範例真的越多越好嗎?本文解析 Many-Shot CoT-ICL 論文的三個反直覺發現:負面 scaling、相似度檢索陷阱、順序敏感度暴增,以及 CDS 曲線排序演算法。
深入拆解 RecursiveMAS:UIUC、Stanford、NVIDIA、MIT 團隊提出的多智能體協作框架,用連續向量取代文字溝通,讓整個 Agent 團隊可微分、可端到端訓練,僅訓練 0.31% 參數就同步提升準確率、速度與 token 效率。
WikiSkill 在 agent 的原始執行紀錄與 skill 文件之間插入一層永不回滾的 wiki 知識層,讓每輪 skill 修改都能站在跨迭代累積的證據上判斷,而不是每次從零分析。