目錄

目錄

便宜判官先判、沒把握才找 GPT-6:JEV 串接真的省錢嗎?

目錄

用 LLM 當判官(LLM-as-a-judge)幫模型輸出打分數,已經是評測的預設做法。問題是強的推理判官(例如 GPT-6)又貴又慢,便宜的判官又不知道自己什麼時候會錯。這篇文章讀的是 JEV-as-a-Judge: Accept When Confident, Escalate When Unsure(Li、Miao、Krishnan、Padman,卡內基美隆大學,arXiv 2609.26550v3,2026 年 9 月)。它想問的是:讓便宜的判官先判,信心夠高就直接採用,信心不夠才轉給強判官,能不能用小得多的成本換到接近強判官的準確度?

這篇論文是第三方評測,不是提出新方法。串接分流和選門檻都是既有做法,它的價值在於把整套流程事先凍結,再拿沒看過的題目驗收,並誠實攤出哪裡成立、哪裡不成立。答案大致是:在答案能從文字直接讀出的任務上成立,在難任務上,只要門檻選對,準確度不掉,但省得很少。

文章依序是:論文的問題、方法、實驗、整體評價,接著是「值得帶走的東西」,最後是「概念詳解」。概念詳解整理了 AUROC、校準、資料切分這些脫離論文也成立的觀念,對工程師的耐用度比論文的具體數字高得多。正文第一次碰到這些術語時,會先用一句話解釋,想看完整推導再跳到概念詳解。

標示約定
「自編例子」是我為了說明自己編的數字,不是論文數字;「推論」是我的判斷,不是論文原文;「論文未說明」是論文沒有交代的地方;「一般知識」是不屬於論文、但這個領域通用的內容。引用論文圖表時,我會標明來源的圖表編號,想看原圖請回原論文。
重點摘要(TL;DR)
  • 問題:強的推理判官準但貴又慢,便宜判官又不知道自己什麼時候會錯。
  • 做法:JEV 先判每一題,把它最大的標籤機率當成信心 q q 。q q 夠高就直接採用,低於門檻 τ \tau 才轉給 GPT-6 重判。
  • 結果:RewardBench 上,串接的準確度略勝 GPT-6(+1.27 個百分點),費用只要 27%。JudgeBench(較難)與兩個全新任務上,準確度追平 GPT-6,但轉出比例高(65% 到 89%),只省約 9% 到 33% 的費用。
  • 兩個要記住的性質:q q 適合拿來排序「誰比較可能錯」,不適合直接當「答對機率」讀。沒有證據可對照的任務,信心完全失效。AUROC 是「信心能不能把錯題排在對題前面」的指標,0.5 等於亂猜,這個任務上是 0.498。
  • 判斷:研究價值低,工程價值中高但有範圍。最值得帶走的是 AUROC 與校準這些通用觀念,以及「讀得出答案 vs 需要推導」的界線。

**LLM 判官**是拿一個 LLM 去評另一個模型的輸出,例如「這兩個回答哪個比較好」,或「這個答案有沒有被給定的證據支持」。它會成為預設做法,是因為人工評分無法大規模進行,而 BLEU 這類自動指標只比對字面重疊,處理不了開放式回答。

判官分兩類:

類型做法特性
推理型判官(reasoning judge)先在內部想一長串再給結論,如 GPT-6難題上比較強,但每次判斷要多花運算,費用高、速度慢
決策型判官(decision-only judge)只輸出判決與每個標籤的機率,不產生任何文字便宜、快。JEV(TypeSafe AI 的託管模型,論文測的是 1.13 版)就是這類

成本與延遲。 論文量到 GPT-6(低推理強度)每千次判斷約 12.182 美元、中位延遲 1.89 秒;JEV 每千次約 0.044 美元、0.15 秒。差距約 277 倍與 13 倍。每換一個模型檢查點、每評一批新回答,這筆帳都要重付。

論文 Table 1 的原表,列出十七種判官配置在各基準上的準確度,以及 timing panel 上的費用與中位延遲。
表 1 — 十七種判官配置的基準準確度,以及費用與中位延遲。(來源:原始論文 Table 1。)

信心不可靠。 直接問 LLM「你有多確定」,它常過度自信,對錯的答案也給很高的機率。大規模使用時,需要判官能分辨哪些判斷是例行的、哪些需要複查。

便宜與準確很難兼得。 單一判官只能二選一,所以論文想用「串接」把兩者的優點組起來。

核心想法就是下面這張流程圖:JEV 先判每一題,q q 達到門檻 τ \tau 就直接把 JEV 的判決當最終答案,沒達到就交給 GPT-6 獨立重判,並以它的判決取代 JEV 的判決。

串接分流的流程示意:請求進入 JEV,輸出判決與各標籤機率;信心 q 大於等於門檻 τ 時直接採用 JEV 的判決,否則升級給較強的 LLM 判官,最後得到最終判決。
圖 1 — 「有把握就採用,沒把握就升級」的流程。圖中的數字只是示意。(來源:原始論文 Figure 2。)

因此論文實際要回答的是四個問題:

  1. JEV 的機率能不能當信心?(q q 排序得出誰比較可能錯嗎?)
  2. 這個信心在換個呈現順序時穩不穩?
  3. 門檻 τ \tau 怎麼選,才能在準確度掉不超過容忍度的前提下省最多錢?
  4. 這些結論在沒看過的題目、新的任務上還成立嗎?

名詞先統一:本文的「轉出」和「升級」是同一件事,指把題目交給強判官;「串接」和「分流」指整套「先便宜、後貴」的流程。

論文同時量四種東西:準確度、機率品質(機率數字準不準)、費用、延遲。

方法有三件事:怎麼公平地測、怎麼定義並驗證信心 q q 、怎麼用 q q 串接並選門檻 τ \tau 。

三種任務,難度由「答案寫在文字裡就能讀出」排到「得自己推導才知道」:

任務判什麼主要資料集
成對偏好(pairwise preference)兩個回答哪個比較好RewardBench(日常偏好)、JudgeBench(較難,對錯可客觀驗證)
證據型事實性答案有沒有被給定證據支持HaluEval(幻覺偵測)
最終答案裁決一段回覆的最終答案對不對作者自己存的 150 筆選擇題回覆

比較對象。 除了 JEV,還有 16 個判官,共 17 個配置:14 個生成式 LLM(含 GPT-6、Claude Sonnet 5、Gemini 3.1 Pro),加 2 個獎勵模型(reward model,不會講話,只替回答打分數)。GPT-6 是主要對照組,因為它最貴、最穩,人工複查也針對它與 JEV 的分歧。

輸出契約,是公平比較的關鍵。 所有 LLM 判官都被要求用 JEV 的格式回答:一個判決加每個標籤的機率,不准寫理由。這樣大家的輸出形狀才一樣,信心才能直接比。(推論:這也限制了推理型判官發揮,所以「GPT-6 的表現」是在這個限制下量到的。)

資料切分。 全部 5,172 筆分成 642 筆 pilot 與 4,530 筆 held-out。held-out 的意思是完全不碰、只拿來最後驗收的資料。pilot 再依來源題目切成 select(40%,專門用來決定門檻)與 test(60%)。規則與門檻候選值,在任何 held-out 結果出現之前就先固定。數字如下(單位是判斷次數):

任務pilot其中 select其中 testheld-out
RewardBench16064961,340
JudgeBench803248270
HaluEval8032482,920
最終答案與控制組322不切分不切分0

最後一列是作者另外準備的最終答案與控制組資料,不切 select/test,也沒有 held-out(論文沒有展開細節)。pilot 的 test 部分做什麼用,論文沒有說明,後面「概念詳解」會專門討論。

論文自己承認的限制
JEV 有沒有看過這些基準的訓練資料,論文並不知道。所以「JEV 在 RewardBench 追平 GPT-6」這類結果,無法排除訓練重疊。

定義。 q q 是 JEV 所有標籤機率中最大的那一個,也就是它對自己所選判決的把握:

q=max⁡kpkq = \max_k p_k
  • pk p_k :JEV 對第 k k 個標籤給的機率,所有標籤的機率加起來是 1
  • max⁡ \max :取最大的那個
  • 白話:判官最看好的那個答案,它有多大把握

例子(流程圖的示意數字):三個標籤的機率是 0.91、0.06、0.03,判決就是 0.91 那個標籤,q=0.91 q = 0.91 。

JEV 其實自帶一個「原生信心」欄位,但論文不用它,原因有兩個:

  • 其他 16 個判官都只有標籤機率,用 q q 才能公平比較
  • 原生信心的公式 TypeSafe 沒公開

論文另外確認原生信心與 q q 的排序很像(三個 Spearman 相關係數是 0.976、0.999、0.958,越接近 1 表示排序越一致),所以換成 q q 損失不大。

成對題要兩個順序各問一次,再取平均。 兩個回答誰先誰後,判官可能受位置影響,所以每一對都問兩次,把機率對齊到同一個回答後平均,再取最大值當 q q (HaluEval 沒有候選順序,只問一次)。

自編例子:A 先時,JEV 說「A 好」的機率 0.90;B 先時,JEV 說「先出現的 B 好」的機率 0.70,換算成「A 好」是 0.30。平均 =(0.90+0.30)/2=0.60 = (0.90 + 0.30) / 2 = 0.60 ,所以 q=0.60 q = 0.60 。一個會偏袒第一個位置的判官,兩次答案互相矛盾,平均後 q q 就掉下來,後面會被轉給強判官。

驗證:q q 到底能不能用? 論文做了三個檢查(論文第 7 節)。

檢查一:q q 越高,是不是真的越準? 把 4,850 題(三個公開基準的原順序判斷:RewardBench 1,500、JudgeBench 350、HaluEval 3,000)依 q q 分組,看 JEV 的正確率。q<0.6 q < 0.6 的 214 題,JEV 只對 55.1%(GPT-6 對 69.6%);q=1 q = 1 的 2,332 題,兩者都對 97.8%,一起對、一起錯,只有 2 題例外。差距集中在 q q 低的地方。

依 JEV 兩順序平均信心 q 分組後,JEV 與 GPT-6 在各分組的正確率,以及各分組的題數。
圖 2 — 信心可以指出 JEV 的錯誤落在哪裡。(來源:原始論文 Figure 5。)

檢查二:q q 能不能把錯的題挑出來? 這要用 AUROC:把題目照 q q 排序,看答錯的題是不是排在答對的題前面,0.5 等於亂猜,1 等於完美(細節見後面的概念詳解)。JEV 的 q q 在 RewardBench、HaluEval、JudgeBench 上分別是 0.88、0.83、0.73(兩順序平均),最難的 JudgeBench 最弱。

檢查三:換順序時 q q 穩不穩? JEV 共有 95 次「換順序後判決翻轉」,只有 3 次發生在 q≥0.9 q \ge 0.9 。翻轉大多出現在本來就不確定的題目上。

依 JEV 在原順序下的信心 q 分組,成對題在候選順序對調後判決改變的比例。
圖 3 — 呈現順序改變時,信心與判決翻轉的關係。(來源:原始論文 Figure 7。)

必須知道的結論:q q 的排序可以信,q q 的數字不能直接當機率讀。 論文 7.2 節把排序能力(AUROC)與機率品質(Brier 分數,越低越好,見後面的概念詳解)分開量:

任務AUROC:JEVAUROC:GPT-6Brier:JEVBrier:GPT-6
RewardBench0.8750.8940.1130.115
JudgeBench0.7450.9070.2970.095
HaluEval0.8270.8310.1960.213

表中的 AUROC 是單次呼叫的結果,跟前面兩順序平均的數字略有差異。Brier 分數是「機率與實際對錯的平方差」的平均,越低表示機率越準。

RewardBench 上兩者接近;JudgeBench 上 JEV 不只排序弱,Brier 還差了三倍。HaluEval 的 Brier 看似 JEV 較好,但論文指出這個優勢經不起標籤修正:人工裁決其中 240 題後,Brier 變成 JEV 0.062、GPT-6 0.032(題數不同,不能與 0.196 直接相減,但方向很清楚)。

更直接的證據是,同樣是 q≥0.9 q \ge 0.9 ,不同任務上對應的錯誤率不同:RewardBench 是 1.8%(20/1,130 題),JudgeBench 是 5.7%(7/123 題,題數少,數字不太穩)。

校準也救不了這件事。溫度縮放是把機率整體調平或調尖的旋鈕(溫度 T>1 T > 1 壓平,T<1 T < 1 拉尖,細節見後面的概念詳解)。論文在三個任務擬合出的 T T 分別是 0.651、2.148、4.452,方向不一致,而且 NLL(一種特別嚴懲「很有把握卻答錯」的機率品質指標,越低越好)在其中兩個任務校準後反而變差。

論文 Table 27 的原表,列出 JEV 在各任務上擬合出的溫度、校準前與校準後的 NLL。
表 2 — 溫度縮放在選擇集上擬合、在 held-out 上驗收的結果。(來源:原始論文 Table 27。)

所以分流用的是 q q 的相對高低。門檻不能憑「q=0.9 q = 0.9 大概就是 90% 會對」來設,必須用各任務自己的標註資料。

規則。 便宜判官先判全部題目,沒把握的才交給強判官:

  1. JEV 判每一題,得到 q q (成對題是兩個順序平均後的 q q )
  2. q≥τ q \ge \tau :JEV 的判決就是最終答案
  3. q<τ q < \tau :交給強判官。強判官不看 JEV 的答案、獨立重判,它的判決整個取代 JEV

τ \tau 是「門檻」(放行線),下面再講怎麼選。

自編例子:6 題,τ=0.9 \tau = 0.9 。

題q q 去向
1、2、3、4≥0.9 \ge 0.9 直接採用 JEV
5、6<0.9 < 0.9 轉給 GPT-6

GPT-6 只收 2 題的費用。但 JEV 本身也要付費(成對題問兩次),所以「省錢」是拿「JEV 全部加轉出去的」跟「全部給 GPT-6」比。論文的費用比例就是這樣算的。

這個設計能成立的前提,是兩個判官錯在不同的題。 以 JudgeBench 全部 350 題的原順序判斷來看,JEV 錯 75 題,GPT-6 在其中答對 60 題;GPT-6 錯 24 題,JEV 在其中答對 9 題;兩邊共同錯的有 15 題。(下一章表中 JudgeBench 的 270 題只是其中 held-out 的部分,所以準確度數字不同。)如果有一個完美的挑題員,每題都挑到比較對的那一個,準確度可達 95.7%。反過來,兩邊都錯的題,串接怎麼轉都修不回來。

各個比較判官能修正多少比例的 JEV 錯誤。
圖 4 — 各比較判官對 JEV 錯誤的修正比例,說明「互補」是轉出有用的前提。(來源:原始論文 Figure 22。)

這只是眾多設計中的一種,而且論文只實測了這一種(其他設計見後面的概念詳解)。

一句話:拿一批有標準答案的題目把串接模擬一遍,挑「最省錢、而且準確度掉不超過 2 個百分點」的 τ \tau 。

把 τ \tau 想成安檢的放行線:

  • q q 高過這條線:直接放行,用 JEV 的答案
  • q q 低於這條線:轉出,改請強判官重判
  • 線設得高:轉出很多題,花錢多,但成績接近強判官
  • 線設得低:轉出很少題,花錢少,但可能放過一些 JEV 會錯的題

做法是對每條候選的線,在標註題上模擬串接,算「轉出的比例(代表花費)」與「串接的總分」,再跟強判官單獨作答的總分比。

自編例子:100 題的練習題,GPT-6 單獨作答得 90 分。

放行線 τ \tau 轉給 GPT-6 的比例串接總分比 GPT-6 差多少
0.9980%900
0.9555%900
0.9035%891
0.8020%864
0.608%837

選線的規則是:在「比 GPT-6 差不超過 2 分」的線裡,挑轉出最少(最省錢)的。0.99、0.95、0.90 都符合,其中 0.90 轉出最少,所以選 τ=0.90 \tau = 0.90 。

論文的實際做法:候選值是 0.5、0.6、…、0.99 共 7 個;在 96 題 pilot 選擇題(64 題 RewardBench、32 題 JudgeBench)上,挑「在強判官的選擇集準確度 2 點之內、接受 JEV 判決最多(coverage 最大)」的 τ \tau ,之後完全不重新擬合。對 GPT-6 選出的是 τ=0.9 \tau = 0.9 。

練習題很少時,量到「只差 2 分」可能是運氣,所以保守規則改問「最壞情況可能差多少」,而不是「量到差多少」。

練習題只有一百題左右時,同一條線換一批題,可能量到差 0 分,也可能差 4 分。保守規則(論文稱 lower-bound rule)把量到的差再往壞的方向扣一個懲罰,懲罰的大小代表這個數字有多不穩,題目越少扣得越多,扣完還要在 2 分以內才通過。

論文的真實例子(PPE 選擇題):

放行線 τ \tau 量到的掉分扣完懲罰後的最壞估計通過嗎
0.902.0 分4.3 分不通過
0.950 分論文未列通過

基本規則下 τ=0.90 \tau = 0.90 剛好壓線通過;保守規則看到最壞可能掉 4.3 分,就改選 τ=0.95 \tau = 0.95 。(懲罰約 2.3 分,是我用論文兩個數字相減得到的。)

一般知識:這類懲罰大致跟題數的平方根成反比,題數從 100 變 1,000,懲罰約縮成原來的三分之一。代價是保守規則通常選更高的 τ \tau ,轉出更多題、花費更高。

兩個規則在論文裡的用法不同:主要的 held-out 實驗用基本規則(96 題選擇集,選出 τ=0.9 \tau = 0.9 );前瞻性實驗用保守規則。

容忍度(掉幾分)是使用者自己訂的,不是模型替你算出來的。論文提到,如果知道答錯一題的成本,門檻應該由「錯誤成本與轉出成本的比值」推出,但沒有實測這個做法。

整套方法可以串成六步:

  1. 資料切成 select 與 held-out
  2. JEV 判每題,得到 q q (成對題兩順序平均)
  3. 用 AUROC 驗 q q 能不能排出錯題,用 Brier、NLL 驗 q q 的數字準不準
  4. 在 select 上選 τ \tau (基本規則或保守規則)
  5. q q 低於 τ \tau 的題轉給 GPT-6
  6. 在 held-out 驗收
名詞一句話回答的問題在哪一步
輸出契約所有判官都只回判決加標籤機率,不寫理由怎麼公平比較1
select / held-outselect 用來選參數,held-out 完全不碰、只驗收怎麼避免自己騙自己1、4、6
q q JEV 對自己所選判決的機率(最大標籤機率)這題 JEV 有多有把握2
兩順序平均成對題問兩次再平均,抵消位置偏見q q 穩不穩2
AUROCq q 把錯題排在對題前面的機率q q 能不能排序3
Brier、NLL機率與實際結果的差距q q 的數字能不能當機率讀3
溫度縮放 T T 一個旋鈕,整體調平或調尖機率能不能修校準3
τ \tau 放行線,q q 高於它就採用 JEV轉多少題4、5
基本規則挑最省錢、掉分不超過 2 點的 τ \tau 怎麼選 τ \tau 4
保守規則同上,但用最壞估計判斷題少時怎麼選 τ \tau 4

幾個關係要記住:q q 的排序決定「轉哪些題」,q q 的數字大小只影響你怎麼解讀。溫度縮放只修校準,不改準確度,二選一時也不改 AUROC,所以不影響分流。τ \tau 是這條流程裡唯一真正決定成本與準確度的旋鈕,而它必須用目標任務自己的標註資料來選。

第 3 步其實是診斷,不是選 τ \tau 的必要條件,原因在後面的概念詳解有專門一節。

論文的實驗很多,這裡只收最能回答「這個串接能不能用」的三組:凍結政策在沒看過的題上的結果、換強判官時規則不通用、前瞻性即時測試。q q 本身好不好用的驗證,已在前面「信心:定義與驗證」一節講過。

先交代幾個名詞:

  • 凍結(frozen):規則與門檻在看到任何 held-out 結果之前就定好,事後不調整。
  • 離線模擬:強判官先對所有題判過,再事後假裝「只有被轉出的題才用強判官的答案」,算出串接的結果。
  • 95% 信賴區間:如果重抽一批題,差距大概落在這個範圍。區間含 0,代表看不出兩者有差。
  • Δ \Delta (delta):串接的準確度減去強判官單獨的準確度。

一句話:用 96 題選出 τ=0.9 \tau = 0.9 ,換到沒碰過的 1,610 題,簡單任務上串接又準又省,難任務上準但省得少。

凍結後的 JEV 加 GPT-6 串接政策(τ = 0.9)在 held-out 偏好對上的結果,依基準分列。
表 3 — 凍結的串接政策在 held-out 偏好對上的表現。(來源:原始論文 Table 4。)

下表是我從原表挑出的重點欄位,原表的欄位更多:

任務JEV 單獨串接GPT-6 單獨串接 − GPT-6(95% 區間)轉出比例費用(GPT-6 = 1)
RewardBench(1,340 題)92.893.792.4+1.27 [0.45, 2.03]25%0.27
JudgeBench(270 題)81.392.293.0−0.74 [−2.22, 0.74]65%0.67

怎麼讀:

  • RewardBench:只轉 25% 的題,費用只要 27%,準確度還略勝 GPT-6,區間不含 0,所以略勝是真的。原因是兩個判官錯在不同題,串接等於挑了各自擅長的部分。
  • JudgeBench:要轉 65%,費用 67%,只省了三分之一。準確度與 GPT-6 看不出差別(區間含 0),但那是靠 GPT-6 補回來的。
  • 小心合計列:論文另有一行「全部 held-out」的合計(串接 93.4,費用 0.41),但 held-out 有 83% 是 RewardBench,合計幾乎只反映 RewardBench,不要用它判斷難任務。

同一套選 τ \tau 的規則,換一個強判官,選出來的 τ \tau 就不同,而且在難任務上可能失效。

三個不同強判官在同樣的 96 題選擇集上,以同一規則選出門檻後的凍結政策結果。
表 4 — 不同強判官下,凍結的兩順序串接政策在 held-out 偏好對上的結果。(來源:原始論文 Table 3。)

下表是原表的摘要。三個強判官,用同樣的規則、同樣的 96 題選擇集:

強判官選出的 τ \tau RewardBench:串接 − 強判官JudgeBench:串接 − 強判官
GPT-5.40.90+0.37(區間含 0)0.00(區間含 0)
GPT-60.90+1.27(區間不含 0)−0.74(區間含 0)
GPT-5.6 Sol0.70+0.82(區間含 0)−4.81 [−8.52, −1.48](區間不含 0)
  • 前兩列在兩個任務上都沒掉分。GPT-5.6 Sol 在 JudgeBench 掉了 4.81 分,超過 2 分的容忍度,而且區間完全在負的那一側,這不是運氣。
  • 規則給它選了比較鬆的 τ=0.70 \tau = 0.70 ,所以在 JudgeBench 只轉出 28.5% 的題,漏掉太多 JEV 會錯的題。
  • 論文的解釋:96 題選擇集裡 JudgeBench 只有 32 題,其餘是 RewardBench。RewardBench 上放寬門檻很安全,規則被這一大塊拉著選出偏鬆的 τ \tau ,結果在難任務上失靈。
  • 另一個結果:當強判官在選擇集上不比 JEV 準(GPT-4.1 mini、GPT-4.1、GPT-OSS 等),規則會選 τ=0.5 \tau = 0.5 ,也就是完全不轉出,因為轉出去沒有好處。

要帶走的重點:τ \tau 不是 JEV 的屬性,而是「第一階段判官、強判官、任務」三者一起決定的,換任何一個都要重新選。

在兩個新任務上,用保守規則選門檻,串接的準確度跟 GPT-6 一模一樣,但因為 JEV 在這兩個任務上本來就弱,只省到約 25% 的費用。

「前瞻性(prospective)」是先把規則寫死,再去測沒看過的資料,沒有事後調整的機會。「即時(live)」是真的呼叫 API 跑串接,不是離線模擬。

設計是先凍結流程,每個任務抽 100 題當選擇集、用保守規則選 τ \tau ,再在剩下的題上即時串接。兩個任務都刻意選 JEV 本來就弱的:

  • PPE 正確性(500 題):同一模型針對同一題產生的一個對答案、一個錯答案,判官要分出哪個對
  • JudgeBench Claude 分組(270 題):JudgeBench 中由 Claude 產生回覆的那一組,之前沒判過

選擇集上 JEV 比 GPT-6 差 12.5 分(PPE)和 17 分(JudgeBench),所以規則選了很嚴的 τ \tau :PPE 是 0.95,JudgeBench 是 0.99。

前瞻性即時串接測試的結果,包含兩個新任務各自的準確度、轉出比例、費用與延遲。
表 5 — 兩個新任務上的前瞻性即時串接結果。(來源:原始論文 Table 5。)

下表是原表的摘要(400、170 題是兩個任務在選出門檻後剩下的 held-out 題數):

任務JEV 單獨串接GPT-6 單獨轉出比例費用(GPT-6 = 1)
PPE(400 題)78.288.288.268%0.69
JudgeBench Claude(170 題)70.994.794.789%0.91
兩者合計(570 題)76.190.290.274%0.76

怎麼讀:

  • 準確度跟 GPT-6 完全一致,保守規則在這兩個任務上沒有選太鬆。
  • 但轉出比例高,JudgeBench 的省錢只有 9%。串接能保住的,只有 JEV 本來就答對的那一小部分。
  • 反事實對照:如果當初沿用前面的通用 τ=0.9 \tau = 0.9 (原表另有一列算這個假設),費用降到 0.62,但準確度掉 0.53 分(區間 [−1.58, 0.35],含 0),在 JudgeBench Claude 分組上掉 1.18 分。所以「換任務要重選 τ \tau 」再次被驗證。
  • 延遲幾乎沒有改善,見下表。p95 是第 95 百分位,也就是最慢那 5% 請求的起點。JudgeBench Claude 上串接甚至略慢,因為轉出的題要先等 JEV 再等 GPT-6。
延遲串接GPT-6 單獨
兩個任務合計:中位延遲1.87 秒1.91 秒
兩個任務合計:p95 延遲4.95 秒5.58 秒
JudgeBench Claude:中位延遲2.41 秒2.35 秒
這個實驗證明的是什麼
這個實驗證明的是「規則在弱任務上會夠嚴、不掉分」,不是「串接在弱任務上很划算」。論文自己也說,省的錢相應變少。

這是一份誠實的第三方評測,不是新方法。它的真正產出,是「便宜判官先過一遍、沒把握才轉給貴的」這套流程在哪裡成立、哪裡不成立。工程價值明顯高於研究價值。

研究價值低。 串接分流與保守選門檻都是既有做法,論文自己就引用了 FrugalGPT 一類的串接工作,以及 2017 年的選擇性分類文獻,沒有提出新演算法。能算貢獻的是做法的嚴謹:規則先凍結再驗收、把失敗案例(GPT-5.6 Sol、JudgeBench)攤出來、畫出「讀得出答案/需要推導」的界線。

工程價值中高,但有範圍。

  • 成立:答案能從文字直接讀出的任務。RewardBench 只轉 25% 的題、費用 27%,準確度還略勝 GPT-6。
  • 失敗時安全:弱任務上(PPE、JudgeBench Claude),串接的準確度仍等於 GPT-6,代價是多花錢(費用 0.69 到 0.91),不是掉分。
  • 不成立:沒有證據可對照的任務,q q 的排序能力等於亂猜,不要用。

串接本身到底帶來什麼,可以看下面這張對照(都是 held-out 或前瞻實驗,不是事後挑的):

場景JEV 單獨串接GPT-6 單獨串接比 JEV 多的準確度(點)
RewardBench(1,340 題)92.893.792.4+0.9
JudgeBench(270 題)81.392.293.0+10.9
前瞻實驗,兩個新任務(570 題)76.190.290.2+14.1

串接的功勞是把 JEV 的弱點補到 GPT-6 的水準。「超過 GPT-6」只出現在 RewardBench(+1.27),JudgeBench 沒超過,前瞻實驗是剛好打平。

小心摘要的挑法
論文結論那句「高於 GPT-6 0.9 點、費用 41%」是 1,610 題的合計,其中 83% 是 RewardBench,也就是最好看的那一組。

另外有幾處要打折,所以數字看方向就好:

  • 對照組是低推理強度的 GPT-6,不是它的最強設定
  • 推廣範圍有限,只涵蓋幾個公開基準與兩個新任務
  • 人工裁決(人工複查 JEV 與 GPT-6 跟基準標籤不一致的題)不是獨立進行的
  • 論文沒有聲明作者與 TypeSafe(JEV 的提供者)的關係,致謝只提到 NIST、CMU 與 OpenAI 的 API 額度。前言說這是第三方評測,這點是讀的時候要留意的

前面說工程價值中高,指的是這套流程在某些任務上能直接拿來用。但論文本身可帶走的新東西很少,真正耐用的收穫在第二類。下面依耐久度排序,最耐久的在前。

流程是:兩個順序平均、在標註題上選 τ \tau 、只轉出 q q 低的題、用沒碰過的題驗收。它不是新方法,論文的價值是把整套流程事前凍結後,在兩個新的弱任務上實測,結果準確度與 GPT-6 一致、費用 0.69 到 0.91。能帶走的經驗是:這個流程在弱任務上不會掉分,只是省得少。

答案能從文字讀出的任務,JEV 跟 GPT-6 差在 2 點內;需要推導或核對的任務落後 7 到 28 點;沒有證據可對照的任務,信心完全失效。這個界線是針對特定版本量的,新版本出來就可能移動,但「判官強弱取決於任務是讀還是推導」這個分法本身成立(見第二類「判官能不能用,先問「答案能不能被讀出來或核對」」一項)。

JEV 的準確度、GPT-6 的費用與延遲,都跟特定模型版本、推理強度與當時定價綁在一起,很快會過期,不用背。

準確度看判決對不對;AUROC 只看 q q 的順序;Brier 與 NLL 看 q q 的數字大小。三者量的是不同的東西,所以一個判官可以在其中一項很好、另一項很差。

要問的問題看什麼缺它會怎樣
判決對不對準確度一切白搭
q q 能不能排出誰比較可能錯AUROC沒辦法用信心挑題
q q 的數字能不能當機率讀Brier、NLL信心數字會誤導

具體例子見後面 AUROC 與 Brier 兩節:兩個判官的排序完全一樣、AUROC 都是 0.78,但一個的信心誠實、一個過度自信,Brier 差很多。

用途決定該看哪個指標:只要判決,看準確度;用信心挑出該複查的題(分流、人工覆核),看 AUROC;把信心當機率讀(風險估算、跟別的系統組合),看 Brier 與 NLL。

溫度縮放把 logit 差 g g 除以 T T ,再轉回機率。二選一時,新的信心是 g g 的遞增函數,所以每題的先後順序、判決都不變:

q′=11+e−g/Tq' = \frac{1}{1 + e^{-g/T}}
  • g g :兩個標籤的 logit(模型原始分數)差,取正值
  • T T :溫度,一個正數;T=1 T = 1 是原本的機率,T>1 T > 1 把機率壓平,T<1 T < 1 把機率拉尖
  • 白話:先把分數差除以 T T ,再照原本方式轉成機率

自編例子:q=0.982 q = 0.982 (g≈4 g \approx 4 )。T=2 T = 2 時 q′=0.881 q' = 0.881 。每一題都被壓平,順序不變,所以準確度與 AUROC 不變,只有 Brier、NLL 會變。

論文的數字就是前面表 2:同一個 JEV,RewardBench 擬合出 T=0.651 T = 0.651 (NLL 由 0.192 變 0.216,變差),JudgeBench 是 T=2.148 T = 2.148 (0.449 變 0.475,變差),HaluEval 是 T=4.452 T = 4.452 (0.496 變 0.304,變好)。方向不一致,其中兩個任務校準後反而更糟。

實務上:只做分流,不需要校準,排序夠好就行;要把 q q 當機率讀,就要用「該任務自己的標註資料」另外校準。

串接的結果是,被接受的題用第一階段的答案,被轉出的題用強判官的答案。如果第一階段錯的題,強判官大多答對,轉出去就能補回來。但兩邊都錯的題,怎麼轉都修不回來。

自編例子:100 題,強判官錯 10 題,JEV 錯 15 題,其中 3 題兩邊都錯。如果有一個完美的挑題員,只轉 JEV 會錯的題,剩下的錯題只有那 3 題,串接準確度 97%,比強判官單獨的 90% 還高。如果兩邊的錯一模一樣(15 題全重疊),串接最好也只能做到強判官的水準。

論文的真實數字在前面「串接分流與門檻怎麼選」一節列過(JudgeBench 350 題:JEV 錯 75 題、GPT-6 錯 24 題、共同錯 15 題),完美挑題員可達 95.7%,高於 GPT-6 單獨的約 93%。

選第一階段時要看:

  • 選第一階段,除了看便宜,還要看它的錯是否跟強判官不同,也要看它的 q q 能讓你放行多少題(便宜但幾乎放行不了,就省不了錢)
  • 串接的天花板是兩者的共同錯,不是強判官自己的準確度
  • 兩個判官越像(同家族、同訓練資料),串接越沒用(推論,論文沒有直接測)

判官的工作是比對,不是從頭解題。答案能直接從文字讀出,小模型就夠;需要自己重新推導才知道對錯,小模型就不及。

自編例子:「這個回答有沒有拒絕使用者?」讀一遍就知道;「這段程式有沒有 bug?」要在腦中執行一遍才知道。

論文的數字:答案能讀出的任務,JEV 跟 GPT-6 差在 2 點內。需要推導的任務落後很多:知識 −7.0、程式 −12.9、數學 −14.3、邏輯謎題 −27.6(JEV 減 GPT-6 的準確度,單位為百分點)。

JEV 與 GPT-6 在不同技能與難度切片上的準確度差異。
圖 5 — JEV 強在哪裡、弱在哪裡(原始論文的切片分析,以原順序單次呼叫計算)。(來源:原始論文 Figure 4。)

上線前的做法:先把任務分成三類。讀得出答案,便宜判官夠用;需要推導,預期要大量轉給強判官;沒有證據可對照,見下一項。

模型的機率反映的是「它對自己輸出的把握」,不是「這個答案跟事實的距離」。判官沒有證據可核對時,它仍然會給一個很有把握的答案。

附錄有一組直接的數字:200 題沒有證據可對照的回答,二選一,丟硬幣是 50%。三個判官都接近丟硬幣,卻都很有把握。JEV 的 AUROC 是 0.498,信心完全分不出對錯。

自然語言回覆的後續實驗結果,包含摘要與一般回覆兩個工作負載下各判官的準確度與機率指標。
表 6 — 摘要與一般回覆的判斷結果,一般回覆(無證據可對照)的準確度接近丟硬幣。(來源:原始論文 Table 18。)
判官準確度平均最高機率
JEV53.5%0.91
GPT-4.1 mini54.0%0.94
GPT-5.456.0%0.96

上線前的檢查:

  • 信心分流的前提是「信心低的題比較容易錯」,上線前先用標註題量 AUROC 驗證
  • AUROC 接近 0.5 時,不要用信心分流;轉出去也沒用,因為強判官也一樣近乎亂猜
  • 限制:只有 200 題,論文自己說只能證明結果跟任務有關,不能斷言差別純粹來自有沒有證據。細節見後面「沒有參考答案的文章」一節

串接的安全性來自一個結構:q q 低就轉給強判官,所以第一階段越不確定,轉出越多,最終答案越接近強判官單獨的結果。第一階段變弱時,系統是把成本推高,而不是把錯誤放行。

支持這點的是前瞻實驗(表 5):兩個任務 JEV 本來就弱,準確度仍與 GPT-6 完全一致,代價是費用接近 GPT-6 單獨的水準(PPE 轉出 68%、費用 0.69;JudgeBench Claude 轉出 89%、費用 0.91)。

這個保證有兩個限制:

  • 只在門檻選對時成立。論文的反例:GPT-5.6 Sol 的 τ \tau 選到 0.70,在 JudgeBench 掉了 4.81 分。
  • 沒有證據可對照的任務,強判官自己也近乎亂猜,轉出去不會變好,所以「失敗時變貴」的保證在這裡也不成立。

設計原則:設計任何分流或升級機制,都要問兩件事。第一階段失靈時,錯誤是被放行,還是被推高成本?門檻設錯時,壞掉的是哪一邊?好的串接設計,應該讓門檻設保守時,壞掉的永遠是成本這一邊。

這一段的每一節都能獨立閱讀,脫離這篇論文也成立。

論文把 642 筆 pilot 資料切成 select(40%)與 test(60%),select 用來選門檻,那 test 的 60% 做什麼用?

論文沒有明確說明 pilot test 部分的獨立用途。 我在主文與附錄都沒找到它單獨出現在任何結果裡;溫度縮放的驗證與門檻的驗收,都是用 held-out,不是用 pilot test。

論文有講的是:pilot 在任何模型推論之前就先凍結;select 只用來擬合溫度與路由門檻。「source-cluster」的意思是,同一個題目的重複回答會留在同一邊,避免同題目同時出現在 select 與 test。數字就是前面「評測設計」那張表,單位是判斷次數。pilot 的 642 筆 = select 128 + test 192 + 不切分的 322。

我的推論(不是論文原文):pilot test 大概沒有獨立角色,只是併進表 1 的總體準確度。證據是 RewardBench 的 160 加 1,340 剛好等於表 1 的 1,500 筆,表示 pilot 的所有題目(含 select 與 test)都算在總體準確度裡。

這個切法有一個後果:select 的 128 筆同時也算進表 1 的準確度,所以那些數字不是完全乾淨的 held-out 結果。不過 128 筆佔 5,172 筆很小,對結論影響有限,不算嚴重缺失。

通用觀念是為什麼要把資料分成不同角色:

角色做什麼為什麼要獨立
select(選擇集)決定參數,例如門檻 τ \tau 、溫度 T T 這份資料已經被「看過」,用來選參數
held-out(驗收集)只在最後驗收一次必須完全沒參與選擇,數字才可信

用來選參數的資料,不能同時拿來證明參數選得好。舉例(自編):你在一批題目上挑出讓準確度最好的 τ \tau ,再在同一批題目上報告準確度,數字當然好看,但那只是在證明「這個 τ \tau 適合這批題」,不是「這個 τ \tau 適合新的題」。把驗收用的題完全隔開,才能知道換到沒看過的題會怎樣。

AUROC 只問一件事:把所有題目照 q q 從低到高排成一排,答錯的題是不是排得比答對的題前面?

它的全名是 Area Under the ROC Curve,在這裡衡量「q q 排序錯題的能力」。白話意思是:隨機抽一題答錯的、一題答對的,答錯那題的 q q 比較低的機率。0.5 等於亂猜,1 等於完美。

自編例子:6 題,JEV 對 3 題答錯、3 題答對,每題有一個 q q 。先照 q q 由低到高排隊:

排序q q 實際
10.55錯
20.60對
30.70錯
40.90錯
50.95對
60.99對

如果 q q 是個完美的錯題偵測器,3 題錯的會全部排在最前面。實際上第 2 名是答對的,混在錯題中間。

要把「排得好不好」變成一個數字,做法是把每一題錯的跟每一題對的配成一對,共 3 × 3 = 9 對,每一對只問「錯的那題,q q 是不是比對的那題低?」

錯題 q q \ 對題 q q 0.600.950.99
0.55✓✓✓
0.70✗✓✓
0.90✗✓✓

9 對裡有 7 對排對了,所以 AUROC = 7 / 9 ≈ 0.78。

數字的感覺如下(一般知識,不是論文內容):

AUROC感覺
0.5q q 跟對錯完全無關,等於丟骰子
0.7有點用,但排錯題的能力不穩
0.8 到 0.9實用等級,大部分錯題會排在對題前面
1.0完美,實務上幾乎不會出現

AUROC 只看順序,不看 q q 的大小。 把上表的 q q 全部改成 0.01、0.02、0.03……只要順序不變,AUROC 還是 0.78。

這個盲點的後果(自編例子):沿用同樣 6 題,實際只答對 50%。判官 X 的 q q 是 0.55、0.60、0.70、0.90、0.95、0.99;判官 Y 的 q q 是 0.950、0.960、0.970、0.980、0.985、0.990。兩者排序一模一樣,AUROC 都是 7/9。但判官 Y 每題都宣稱有 95% 以上的把握,實際只對一半。AUROC 完全看不出兩者的差別,這要靠 Brier 之類的指標(見後面「怎麼量校準」)。

回到論文:HaluEval 上,GPT-6 與 JEV 的 AUROC 幾乎一樣(0.831 對 0.827),但 Brier 並不相同(0.213 對 0.196)。排序能力相同,機率品質不同。(不過前面「信心:定義與驗證」一節提過,這個 Brier 差距經不起標籤修正,這裡只拿來說明「AUROC 相同時 Brier 可以不同」。)

論文裡的數字(單次呼叫的 AUROC)就是前面「信心:定義與驗證」那張表的前兩欄。RewardBench 與 HaluEval 上,JEV 的 q q 排錯題的能力跟 GPT-6 差不多。JudgeBench 才是重點:GPT-6 是 0.907,JEV 是 0.745。這是最難的一組題目,GPT-6 不只答得比較準,也比較「知道自己什麼時候會錯」。

看一個會給信心的分類器,AUROC 只回答「q q 能不能排出誰比較可能錯」,不回答「q=0.9 q = 0.9 是不是真的代表 90% 會對」,也不回答「判決對不對」。三者要分開看。

AUROC 低,代表很難知道哪些題該交給貴的判官,所以要多付錢、或多承擔錯誤,但不是「全部轉出去」。

分流要的就是「把可能錯的題挑出來轉給貴的判官」。AUROC 高,只轉少量題目,就能攔下大部分錯題;AUROC 低,要轉很多題才攔得住,省下的錢就少了。

AUROC 低不代表只能把大部分題目都交給貴的判官。方向上確實要多轉,但實際上是你在「轉出多少題」和「漏掉多少錯題」之間取捨,AUROC 低只是讓這筆交易變貴。

自編例子(粗估,只為說明方向):100 題裡有 10 題 JEV 會答錯。

AUROC 高(約 0.9)AUROC 低(約 0.6)
想攔下 8 題錯題轉約 20 題就夠可能要轉 60 題以上
只轉 20 題能攔下約 8 題錯題只能攔下約 3 到 4 題錯題

AUROC 低時你有兩種選擇:多付錢(轉更多題),或多承擔錯誤(轉一樣多、漏掉更多錯題)。「全部轉」是其中最極端的選法。

論文的實測:門檻 τ=0.9 \tau = 0.9 時,4,850 題裡轉走 1,106 題(約 23%),其餘 3,744 題直接用 JEV 的答案。這 23% 就是「在 JEV 的 q q 排序能力下」選出的取捨點。

校準(calibration)就是模型說「有 90% 把握」的那些題,實際上真的大約有 90% 是對的:

P(判決正確∣q=x)=xP(\text{判決正確} \mid q = x) = x
  • q q :模型給的信心
  • x x :某個具體的信心數值,例如 0.9
  • 左邊:在所有 q q 剛好等於 x x 的題目中,判決正確的比例
  • 白話:信心 0.9 的題目,正確率就該是 0.9

自編例子:判官 Y 對 100 題都說 q≈0.96 q \approx 0.96 ,實際只對 50 題。理想上該有 96 題對,實際只對 50,所以 Y 是過度自信(overconfident)。反過來,如果說 0.6 卻對了 90%,就是信心不足(underconfident)。

排序與校準是兩個獨立的性質:

校準好校準差
排序好理想能排出錯題,但數字不能直接讀
排序差數字誠實,但幫不上忙兩頭落空

評估一個會給信心的分類器,至少有三個獨立的問題:判決對不對看準確度,q q 能不能排出誰比較可能錯看 AUROC,q q 的數字本身可不可信看校準指標(Brier 等)。一個判官可以在其中一項很好、另一項很差。AUROC 只管排序,校準指標見下一節。

量校準有幾種常見工具,差別在於你想看「哪裡偏」還是「總共偏多少」。

把題目依 q q 的大小切成幾個區間,每個區間算一個點,一條曲線就是幾個點連起來:

要算的怎麼算畫在哪
平均信心區間內所有題目 q q 的平均橫軸
實際正確率區間內答對的題數 ÷ 總題數縱軸

完美校準時,每個點都落在 x=y x = y 的對角線上。

自編例子:10 題,q q 與對錯如下,切成 3 個區間。

區間區間內的 q q 平均信心答對正確率
0.5 到 0.70.52、0.58、0.63、0.670.602/40.50
0.7 到 0.90.72、0.78、0.850.782/30.67
0.9 到 1.00.91、0.96、0.990.953/31.00

三個點是 (0.60, 0.50)、(0.78, 0.67)、(0.95, 1.00)。

區間怎麼切有兩種方法(一般知識,不是論文內容):

等寬分組等量分組
做法每組寬度一樣,例如 0.0 到 0.1、0.1 到 0.2……每組題數一樣,邊界由資料決定
優點簡單,橫軸容易讀每個點的可信度相近
缺點題目常堆在少數幾組,其他組只有幾題,點很抖單組的 q q 範圍可能很寬

經驗法則:q q 的分布集中在一端時,用等量分組,或把擠滿題目的那一端切細。

論文裡的可靠度曲線在下面這張圖的下排。圖說只寫了「每組至少要有 5 題才畫」,邊界怎麼切沒有明講。前面圖 2 的邊界不等寬(<0.6、0.6、0.7、0.8、0.9、0.95、0.99、=1),高信心端切得特別細,因為 JEV 的 q q 大量堆在接近 1 的地方(q=1 q = 1 就有 2,332 題)。

上排是 JEV 對答對與答錯的判斷各自的最大機率分布,下排是幾個主要判官的可靠度曲線。
圖 6 — 上排為最大機率分布,下排為可靠度曲線。(來源:原始論文 Figure 6。)
Brier=1N∑i=1N(qi−oi)2\text{Brier} = \frac{1}{N}\sum_{i=1}^{N}(q_i - o_i)^2
  • qi q_i :第 i i 題的信心
  • oi o_i :第 i i 題實際結果,答對 1、答錯 0
  • N N :題數
  • 白話:每題「信心與結果的差」平方後取平均,越低越好

自編例子:沿用 AUROC 那 6 題。判官 X 的 q q 是 0.55、0.60、0.70、0.90、0.95、0.99,結果是 錯、對、錯、錯、對、對,Brier =(0.552+0.402+0.702+0.902+0.052+0.012)/6≈0.294 = (0.55^2 + 0.40^2 + 0.70^2 + 0.90^2 + 0.05^2 + 0.01^2) / 6 \approx 0.294 。判官 Y 的 q q 是 0.95、0.96、0.97、0.98、0.985、0.99,同樣結果,Brier ≈0.468 \approx 0.468 。排序一樣(AUROC 都是 0.78),Brier 卻差很多。

這是簡化版,只看 q q 對不對。論文的 Brier 對所有標籤的機率計算,細節略有不同。

ECE=∑b=1BnbN ∣ accb−confb ∣\text{ECE} = \sum_{b=1}^{B} \frac{n_b}{N}\,\bigl|\,\text{acc}_b - \text{conf}_b\,\bigr|
  • B B :分成幾組
  • nb n_b :第 b b 組有幾題;N N :全部題數
  • accb \text{acc}_b :第 b b 組的實際正確率
  • confb \text{conf}_b :第 b b 組的平均信心
  • 白話:每組算「偏多少」,題目多的組算得重一點,再加總

用上面可靠度曲線的 10 題例子算:

區間題數平均信心正確率差距權重(題數 ÷ 10)貢獻
0.5 到 0.740.600.500.1000.40.040
0.7 到 0.930.782/30.1130.30.034
0.9 到 1.030.951.000.0500.30.015

ECE ≈0.040+0.034+0.015= \approx 0.040 + 0.034 + 0.015 = 0.089,意思是平均偏差約 9 個百分點。

兩個設計值得注意:取絕對值,是為了讓「過度自信」和「信心不足」不會互相抵消;用題數加權,是因為題目少的組本來就不可靠。ECE 的缺點(一般知識)是它的值會隨分組方式改變。

論文的用法:主文以 Brier 和 NLL 為主;附錄也報 ECE(用 10 個最大機率區間)。主文為什麼不選 ECE,論文沒有說明。

每題取「模型給正確答案的機率 p p 」,算 −ln⁡p -\ln p ,再對所有題平均,越低越好。

模型給正確答案的機率 p p −ln⁡p -\ln p
0.90.11
0.50.69
0.12.30
0.014.61

跟 Brier 的差別在於:一個判官有 99% 把握卻答錯,等於給正確答案只有 0.01。Brier 的這題懲罰最多是 1(平方後頂多 1),NLL 是 4.61,而且 p p 越接近 0 它會一直往上衝,沒有上限。所以 NLL 對「很有把握卻答錯」特別嚴格,Brier 比較溫和。論文同時報兩個,就是為了從兩個角度看機率品質。

訓練時沒有任何一項在逼模型「機率要說實話」,而且有些訓練步驟還會推它過度自信。以下是一般知識,不是論文內容。

原因 1:訓練目標只獎勵「答對」,不獎勵「機率誠實」。 類比一下:考試只看你有沒有選對,沒人檢查你寫的「我有幾成把握」,時間久了,你就沒有理由學會把把握度寫準。

底層機制是這樣:分類模型最後會把原始分數(logits)轉成機率(softmax)。訓練用的損失函數 cross-entropy(其實就是 NLL)在答對時,仍然會因為「正確答案的機率還沒到 1」而繼續給獎勵。自編例子,兩個類別的 logits:

logits(對的、錯的)對的那類機率答對時的損失 −ln⁡p -\ln p
[2, 0]0.8810.127
[4, 0]0.9820.018

兩種情況判決都對,但第二種損失更低。所以訓練會一直把分數差拉大,機率越來越靠近 1,但對的機率不會因此真的跟著變高。這是 Guo et al. 2017(論文也引用)指出的現象,現代深度網路普遍偏向過度自信。

原因 2:後訓練(post-training)會把機率推向極端。 預訓練模型的 token 機率通常還算誠實,經過 RLHF 這類以人類偏好為目標的訓練後,輸出會被推向「聽起來很肯定」。

原因 3:校準是「對某一種題目」才成立的。 在 A 類題目上調好的機率,換到 B 類題目就會跑掉,因為模型在不同題目上的難度與錯法不同。論文的直接證據在論文 7.2 節:同一個 JEV、同一套溫度縮放流程,在 RewardBench 上擬合出 T=0.65 T = 0.65 (把機率調尖),在 JudgeBench 和 HaluEval 上卻是 T=2.15 T = 2.15 與 4.45 4.45 (把機率調平)。

二選一時,q q 只由「兩個分數的差距」一個數字決定;溫度縮放就是把這個差距整體除以 T T ,所以判決與題目之間的先後順序都不變,變的只有機率數字。以下針對二選一(論文的主要任務),內容是一般知識,除非特別註明。

logit 是模型對每個標籤的原始分數,softmax 把它們轉成機率。兩個標籤時:

p1=ez1ez1+ez2=11+e−(z1−z2)p_1 = \frac{e^{z_1}}{e^{z_1}+e^{z_2}} = \frac{1}{1+e^{-(z_1-z_2)}}
  • z1 z_1 、z2 z_2 :兩個標籤的 logit
  • z1−z2 z_1 - z_2 :兩者的差,記為 g g
  • 白話:兩個分數的絕對大小不重要,只有差距決定機率

對 JEV 要小心:論文通篇沒有提到 logit,也沒說 JEV 內部怎麼產生機率,所以「JEV 是不是由 logit 差算出」,論文沒有講。但不需要知道,只要有機率,就能反推出 g g ,這叫 log-odds(對數勝算):

g=ln⁡p1p2g = \ln\frac{p_1}{p_2}

自編例子:判官說某題 q=0.982 q = 0.982 ,g=ln⁡(0.982/0.018)≈4.0 g = \ln(0.982 / 0.018) \approx 4.0 。

  1. 拿到機率 p p
  2. 換成分數差 g=ln⁡(p/(1−p)) g = \ln\bigl(p / (1 - p)\bigr)
  3. 除以 T T
  4. 轉回機率 q′=1/(1+e−g/T) q' = 1 / (1 + e^{-g/T})
  5. 在選擇集上試很多個 T T ,挑讓 NLL 最低的
  6. 拿去 held-out 驗收

T>1 T > 1 機率被壓平,比較不自信;T<1 T < 1 機率被拉尖,更自信;T=1 T = 1 是原本的機率。

自編例子,logits 是 [4, 0](g=4 g = 4 ),對的那類機率隨 T T 變化如下:

T T 除完的分數差對的那類機率效果
0.580.9997調尖,更自信
140.982原本
220.881調平
410.731調得更平

白話:判官對某批題目都說 0.982,實際只對 7 成。T=4 T = 4 把機率降到 0.731,接近真實的 0.7,所以 T T 大約落在這一帶。(實際擬合是讓全部題目的 NLL 最低,不是對齊單一數字。)

論文的做法是用 select set 擬合 T T ,再到 held-out 驗收(表 2)。第 2 步用機率反推 g g 是我的推論,論文沒有交代它實際怎麼對 JEV 做縮放。

這裡有兩個不同層次的排序,不能混在一起:

指標不變的原因
準確度判決取的是機率最大的那個標籤。每個分數都除以同一個 T T ,各標籤之間誰大誰小不會變,所以選的標籤不變
AUROC它看的是不同題目之間 q q 的排序。二選一時,q q 是 g g 的遞增函數,調 T T 只是把它整體壓平或拉高,題目之間的先後順序不變

自編例子:3 題,logit 差 g g 分別是 0.5、1.5、3.0。

題目g g T=1 T = 1 的 q q T=2 T = 2 的 q q
甲0.50.6230.562
乙1.50.8180.679
丙3.00.9530.818

T T 從 1 變 2,每一題的 q q 都往 0.5 靠,但甲 < 乙 < 丙 的順序沒變。所以如果原本錯題都排在前面,現在還是排在前面,AUROC 不會變。

調 T T 之後,準確度與 AUROC 不變,Brier、NLL、ECE 會變(這三個都在量「機率數字準不準」)。溫度縮放只修「校準」,這正是準確度、AUROC、校準指標各管一件事的好處。

方法流程裡有「驗證 q q 好不好用」(AUROC、Brier、NLL)這一步,但只要有「在標註題上模擬串接、選 τ \tau 」與「用 held-out 驗收」這兩步,似乎就能選出最好的門檻,為什麼還需要驗證 q q ?

就「選出 τ \tau 」這件事,驗證 q q 不是必要的。 模擬串接時直接量最終結果(花多少錢、掉多少分),已經包含了 q q 好不好用的資訊。驗證 q q 是診斷,不是前置條件。

驗證 q q 能多做的事:

驗證 q q 多給的東西模擬串接能不能給
為什麼會失敗:是排序差,還是機率偏?不能。模擬只會告訴你「沒有 τ \tau 通過」或「通過」
判斷這個任務值不值得做串接部分能。例如沒有參考答案的文章 AUROC 0.498,模擬最後也會得到「全部轉出去」,但你得先跑完兩個判官才知道
換強判官時可以重用(推論,論文沒這樣講)不能,每換一個強判官,模擬都要重做

第一項是主要價值。第二項只是省一點成本:AUROC 只需要第一階段判官跑過、有標準答案,不用付強判官的費用。

Brier 與 NLL 更不是必要的。分流只用到 q q 的排序,不用把 q q 當機率讀,所以它們完全不影響 τ \tau 怎麼選。它們的用處是:你想把 q q 當「答對機率」來報告、跟別的判官比較機率品質,或做別的需要機率數字的事。

工程上的判斷:

  • 要選 τ \tau :只需要「模擬串接」與「驗收」
  • AUROC 當成便宜的前置篩檢就好,Brier、NLL 可以省略
  • 論文把驗證 q q 寫那麼完整,是因為它要回答研究問題「這個做法在哪些任務上成立」,這是研究價值,不是部署必要

一個保留(推論):選 τ \tau 的標註資料很少時,結果會不穩(見前面的「保守規則」),這時 AUROC 可以當作交叉檢查。論文沒有驗證這個用法。

論文只實測了「獨立、替換」這一種,另外兩種沒有驗證,所以不能說它是最好的。論文自己的說法是,融合、讓強判官看 JEV 的判決、以及把兩個判官錯誤的相關性納入規則,都留給未來研究(論文第 7 節末尾)。

三種設計都是「便宜判官先判、沒把握轉給強判官」,差別在強判官怎麼用:

設計做法缺點與來源
獨立、替換(論文選的)強判官不看 JEV 的答案,直接取代強判官也答錯的題,修不回來(論文原文)
讓強判官看 JEV 的判決資訊多,像辯論兩者錯誤變得互相依賴(論文原文)
兩個都判全部再融合取機率平均強判官每題都要付費,省不了錢(我的推論,論文沒有測融合,也沒有算它的費用)

論文實際比較過的,是別的東西:

比較對象在回答什麼能不能說明「這個設計最好」
隨機轉出,花同樣的錢(後面圖 7 的灰線)用 q q 挑題,比亂挑好嗎不能,只證明 q q 有用
換不同的強判官(GPT-5.4、GPT-5.6 Sol、GPT-6)這個設計換判官還成立嗎不能,設計沒變
換不同的第一階段判官JEV 是不是特別適合當第一階段不能,設計沒變

這三組比較都固定在「獨立、替換」之下。所以論文能支持的結論是:在這個設計下,用 q q 分流有效,而不是「這個設計優於其他設計」。

我的看法(推論):這個設計是最簡單、最省錢、最容易部署的一種,但「最簡單」不等於「最好」。要不要換成別種組合,只能靠自己的資料測。

「沒有參考答案」指判官只拿到「問題加回答」,手上沒有任何證據文件或標準答案可以對照,要完全靠自己的知識判斷這段回答有沒有胡說(幻覺)。在這種任務上,JEV 的 q q 既不準,也分不出該轉給誰。

自編例子對照:

有證據可對照沒有參考答案
判官拿到什麼一份文件加一句摘要只有一個問題加一段回答
問什麼摘要有沒有被文件支持?這段回答有沒有胡說?
判官怎麼判把摘要拿去跟文件對照只能靠自己腦中的知識猜

論文的數字見前面表 6 和它下方的小表:200 題沒有參考答案的一般回答,二選一,三個判官都接近丟硬幣,卻都很有把握(平均最高機率 0.91 到 0.96)。JEV 的 Brier 是 0.821,AUROC 是 0.498,也就是 q q 完全分不出哪些題會錯。

這會讓串接失效,因為分流的前提是「q q 低的題比較容易錯」。這裡 q q 都很高,而且高低跟對錯無關,所以沒有任何門檻能把該轉的題挑出來。而且就算轉出去,強判官 GPT-5.4 也只有 56%,轉了也沒用。論文的結論是「沒有任何受測判官能用在這類題目上」,所以這不是 JEV 特有的問題。

要保留的限制:

  • 只有 200 題,95% 信賴區間 [46.5, 60.5]
  • 論文自己說,這組跟有證據的那組在內容和標籤來源上都不同,所以只能說「結果跟任務有關」,不能斷言差別純粹來自有沒有證據

通用觀念:信心反映的是模型對自己輸出的把握,不是答案跟事實的距離。判官沒有東西可核對時,它仍然會給一個很有把握的答案,所以上線前一定要用標註題量 AUROC 驗證信心有沒有用。

任何串接都有成本與準確度的取捨,連把題目隨機轉給強判官也有。論文真正想證明的是:用 q q 挑題,比隨機挑好,而且你能事先知道在哪些任務上成立。

門檻設高,仍然能省一點成本。 表 5 的 JudgeBench Claude 分組,τ=0.99 \tau = 0.99 、轉出 89.4% 的題,準確度跟 GPT-6 完全一樣(94.7%),費用只省到 0.91。

直接用強判官是最穩的基準,但不一定最快:

  • 最穩:準確度最高的就是直接用強判官
  • 延遲:轉出去的題要先等 JEV 再等 GPT-6,JudgeBench Claude 的中位延遲 2.41 秒,比 GPT-6 單獨的 2.35 秒還慢

用 q q 挑題比隨機好,下面這張事後掃描可以看到。它是在同一批題上讀出的,所以偏樂觀:τ=0.9 \tau = 0.9 時串接 90.2%,隨機轉出同樣費用只有 89.0%。曲線形狀才是重點,不是權衡本身。

在原順序的公開題目上,JEV 加 GPT-6 串接在不同信心門檻下的準確度與費用曲線,並與隨機轉出和 GPT-6 單獨比較。
圖 7 — 事後掃描:用信心挑題的串接,與隨機轉出同樣比例的對照。(來源:原始論文 Figure 8。)

選門檻看起來只是窮舉,但難點不在搜尋。τ \tau 只有一個參數、候選值才 7 個,窮舉本身很便宜。真正難的是標註題很少時,量到的掉分很不穩,論文用保守規則處理(見前面「門檻怎麼選」一節)。這個規則不是新方法,容忍度是人訂的,也沒有統計保證;論文提到若知道錯誤成本,門檻應由成本比推出,但沒有實測。

這篇論文證明了一件有範圍的事:用 JEV 的最大標籤機率 q q 當信心,沿著「有把握就採用、沒把握就轉給 GPT-6」分流,在答案能從文字讀出的任務上又準又省(RewardBench 費用 27%、準確度略勝 GPT-6),在難任務與新任務上,門檻選對時準確度不掉、但省得有限(9% 到 33%)。

幾個要記住的點:q q 只適合排序,不適合當機率讀;τ \tau 是第一階段判官、強判官、任務三者的函數,換任何一個都要用自己的標註資料重選;沒有證據可對照的任務,信心完全失效,不要用。具體的準確度與費用數字會很快過期,真正耐用的是 AUROC 與校準的分工、資料切分的紀律,以及「好的串接失敗時是變貴,而不是變錯」這個設計原則。