SELF-INDEX 讓 LLM 自己找出索引哪裡寫不好、只修有問題的文件,並驗證通過才寫入。工程價值高,但裁判與生成者是同一顆模型,可信度仍有缺口。
Ctx2Skill 讓出題的 Challenger 與解題的 Reasoner 自我對弈,不靠人工標註與外部反饋,從長文本提煉可重複使用的技能檔,GPT-4.1 解題率由 11.1% 升至 16.5%。
第三方評測 JEV:讓便宜的 LLM 判官先判,信心不足才轉給 GPT-6。簡單任務只需 27% 費用,難任務準確度不掉但只省 9% 到 33%,本文拆解門檻、AUROC 與校準。
讓 LLM 反覆改寫 agent 的 harness,進化題的分數會一路上升,換題目卻未必有效。Google Cloud AI Research 的 RRSI 用七個護欄管住過擬合,本文也檢視證據的缺口。
Microsoft Research 的 Resource2Skill 把教學影片、程式碼、文章與成品蒸餾成階層式技能庫,七個創作領域平均提升 11.9 個百分點;本文一併檢視其對照組與蒸餾細節的缺口。
Purdue 大學論文《Naive Prompt Optimization》問了一個直白的問題:給夠豐富的執行回饋、配一個夠強的 teacher,還需要 GEPA 那套搜索機制嗎?本文檢視 NPO 的方法,以及它「用更少執行次數打贏 GEPA」這個賣點裡沒拆開驗證的混淆變因。
vLLM 工程報告宣稱靠 Agentic Serving 優化省下 14.6~106 倍成本,但方法論其實是拿自建硬體 TCO 比 API 零售價。本文拆解真正的技術貢獻:KV Cache 分頁管理、DCP/PCP/DEP 平行化策略、排程去隊首阻塞,以及三個誠實揭露的失敗案例。