# 便宜判官先判、沒把握才找 GPT-6：JEV 串接真的省錢嗎？


<!--more-->

## 前言

用 LLM 當判官（[LLM-as-a-judge](../llm-as-a-verifier/)）幫模型輸出打分數，已經是評測的預設做法。問題是強的推理判官（例如 GPT-6）又貴又慢，便宜的判官又不知道自己什麼時候會錯。這篇文章讀的是 *JEV-as-a-Judge: Accept When Confident, Escalate When Unsure*（Li、Miao、Krishnan、Padman，卡內基美隆大學，arXiv 2609.26550v3，2026 年 9 月）。它想問的是：讓便宜的判官先判，信心夠高就直接採用，信心不夠才轉給強判官，能不能用小得多的成本換到接近強判官的準確度？

這篇論文是第三方評測，不是提出新方法。串接分流和選門檻都是既有做法，它的價值在於把整套流程事先凍結，再拿沒看過的題目驗收，並誠實攤出哪裡成立、哪裡不成立。答案大致是：在答案能從文字直接讀出的任務上成立，在難任務上，只要門檻選對，準確度不掉，但省得很少。

文章依序是：論文的問題、方法、實驗、整體評價，接著是「值得帶走的東西」，最後是「概念詳解」。概念詳解整理了 AUROC、校準、資料切分這些脫離論文也成立的觀念，對工程師的耐用度比論文的具體數字高得多。正文第一次碰到這些術語時，會先用一句話解釋，想看完整推導再跳到概念詳解。

{{< admonition info "標示約定" >}}
「自編例子」是我為了說明自己編的數字，不是論文數字；「推論」是我的判斷，不是論文原文；「論文未說明」是論文沒有交代的地方；「一般知識」是不屬於論文、但這個領域通用的內容。引用論文圖表時，我會標明來源的圖表編號，想看原圖請回原論文。
{{< /admonition >}}

## 三十秒版本

{{< admonition abstract "重點摘要（TL;DR）" >}}
- **問題**：強的推理判官準但貴又慢，便宜判官又不知道自己什麼時候會錯。
- **做法**：JEV 先判每一題，把它最大的標籤機率當成信心 \( q \)。\( q \) 夠高就直接採用，低於門檻 \( \tau \) 才轉給 GPT-6 重判。
- **結果**：RewardBench 上，串接的準確度略勝 GPT-6（+1.27 個百分點），費用只要 27%。JudgeBench（較難）與兩個全新任務上，準確度追平 GPT-6，但轉出比例高（65% 到 89%），只省約 9% 到 33% 的費用。
- **兩個要記住的性質**：\( q \) 適合拿來排序「誰比較可能錯」，不適合直接當「答對機率」讀。沒有證據可對照的任務，信心完全失效。AUROC 是「信心能不能把錯題排在對題前面」的指標，0.5 等於亂猜，這個任務上是 0.498。
- **判斷**：研究價值低，工程價值中高但有範圍。最值得帶走的是 AUROC 與校準這些通用觀念，以及「讀得出答案 vs 需要推導」的界線。
{{< /admonition >}}

## 問題與背景

### 先弄清楚什麼是 LLM 判官

**[LLM 判官](../chateval/)**是拿一個 LLM 去評另一個模型的輸出，例如「這兩個回答哪個比較好」，或「這個答案有沒有被給定的證據支持」。它會成為預設做法，是因為人工評分無法大規模進行，而 BLEU 這類自動指標只比對字面重疊，處理不了開放式回答。

判官分兩類：

| 類型 | 做法 | 特性 |
| --- | --- | --- |
| 推理型判官（reasoning judge） | 先在內部想一長串再給結論，如 GPT-6 | 難題上比較強，但每次判斷要多花運算，費用高、速度慢 |
| 決策型判官（decision-only judge） | 只輸出判決與每個標籤的機率，不產生任何文字 | 便宜、快。**[JEV](../../ai-concept/jev-overview/)**（TypeSafe AI 的託管模型，論文測的是 1.13 版）就是這類 |

### 三個痛點

**成本與延遲。** 論文量到 GPT-6（低推理強度）每千次判斷約 12.182 美元、中位延遲 1.89 秒；JEV 每千次約 0.044 美元、0.15 秒。差距約 277 倍與 13 倍。每換一個模型檢查點、每評一批新回答，這筆帳都要重付。

{{< image src="table1.png" alt="論文 Table 1 的原表，列出十七種判官配置在各基準上的準確度，以及 timing panel 上的費用與中位延遲。" caption="表 1 — 十七種判官配置的基準準確度，以及費用與中位延遲。（來源：原始論文 Table 1。）" >}}

**信心不可靠。** 直接問 LLM「你有多確定」，它常過度自信，對錯的答案也給很高的機率。大規模使用時，需要判官能分辨哪些判斷是例行的、哪些需要複查。

**便宜與準確很難兼得。** 單一判官只能二選一，所以論文想用「串接」把兩者的優點組起來。

### 論文怎麼問問題

核心想法就是下面這張流程圖：JEV 先判每一題，\( q \) 達到門檻 \( \tau \) 就直接把 JEV 的判決當最終答案，沒達到就交給 GPT-6 獨立重判，並以它的判決取代 JEV 的判決。

{{< image src="figure1.png" alt="串接分流的流程示意：請求進入 JEV，輸出判決與各標籤機率；信心 q 大於等於門檻 τ 時直接採用 JEV 的判決，否則升級給較強的 LLM 判官，最後得到最終判決。" caption="圖 1 — 「有把握就採用，沒把握就升級」的流程。圖中的數字只是示意。（來源：原始論文 Figure 2。）" >}}

因此論文實際要回答的是四個問題：

1. JEV 的機率能不能當信心？（\( q \) 排序得出誰比較可能錯嗎？）
2. 這個信心在換個呈現順序時穩不穩？
3. 門檻 \( \tau \) 怎麼選，才能在準確度掉不超過容忍度的前提下省最多錢？
4. 這些結論在沒看過的題目、新的任務上還成立嗎？

名詞先統一：本文的「轉出」和「升級」是同一件事，指把題目交給強判官；「串接」和「分流」指整套「先便宜、後貴」的流程。

論文同時量四種東西：**準確度**、**機率品質**（機率數字準不準）、**費用**、**延遲**。

## 方法

方法有三件事：怎麼公平地測、怎麼定義並驗證信心 \( q \)、怎麼用 \( q \) 串接並選門檻 \( \tau \)。

### 評測設計

**三種任務**，難度由「答案寫在文字裡就能讀出」排到「得自己推導才知道」：

| 任務 | 判什麼 | 主要資料集 |
| --- | --- | --- |
| 成對偏好（pairwise preference） | 兩個回答哪個比較好 | RewardBench（日常偏好）、JudgeBench（較難，對錯可客觀驗證） |
| 證據型事實性 | 答案有沒有被給定證據支持 | HaluEval（幻覺偵測） |
| 最終答案裁決 | 一段回覆的最終答案對不對 | 作者自己存的 150 筆選擇題回覆 |

**比較對象。** 除了 JEV，還有 16 個判官，共 17 個配置：14 個生成式 LLM（含 GPT-6、Claude Sonnet 5、Gemini 3.1 Pro），加 2 個獎勵模型（reward model，不會講話，只替回答打分數）。GPT-6 是主要對照組，因為它最貴、最穩，人工複查也針對它與 JEV 的分歧。

**輸出契約，是公平比較的關鍵。** 所有 LLM 判官都被要求用 JEV 的格式回答：一個判決加每個標籤的機率，不准寫理由。這樣大家的輸出形狀才一樣，信心才能直接比。（推論：這也限制了推理型判官發揮，所以「GPT-6 的表現」是在這個限制下量到的。）

**資料切分。** 全部 5,172 筆分成 642 筆 pilot 與 4,530 筆 held-out。held-out 的意思是完全不碰、只拿來最後驗收的資料。pilot 再依來源題目切成 select（40%，專門用來決定門檻）與 test（60%）。規則與門檻候選值，在任何 held-out 結果出現之前就先固定。數字如下（單位是判斷次數）：

| 任務 | pilot | 其中 select | 其中 test | held-out |
| --- | --- | --- | --- | --- |
| RewardBench | 160 | 64 | 96 | 1,340 |
| JudgeBench | 80 | 32 | 48 | 270 |
| HaluEval | 80 | 32 | 48 | 2,920 |
| 最終答案與控制組 | 322 | 不切分 | 不切分 | 0 |

最後一列是作者另外準備的最終答案與控制組資料，不切 select／test，也沒有 held-out（論文沒有展開細節）。pilot 的 test 部分做什麼用，論文沒有說明，後面「概念詳解」會專門討論。

{{< admonition warning "論文自己承認的限制" >}}
JEV 有沒有看過這些基準的訓練資料，論文並不知道。所以「JEV 在 RewardBench 追平 GPT-6」這類結果，無法排除訓練重疊。
{{< /admonition >}}

### 信心 q：定義與驗證

**定義。** \( q \) 是 JEV 所有標籤機率中最大的那一個，也就是它對自己所選判決的把握：

$$q = \max_k p_k$$

- \( p_k \)：JEV 對第 \( k \) 個標籤給的機率，所有標籤的機率加起來是 1
- \( \max \)：取最大的那個
- 白話：判官最看好的那個答案，它有多大把握

例子（流程圖的示意數字）：三個標籤的機率是 0.91、0.06、0.03，判決就是 0.91 那個標籤，\( q = 0.91 \)。

JEV 其實自帶一個「原生信心」欄位，但論文不用它，原因有兩個：

- 其他 16 個判官都只有標籤機率，用 \( q \) 才能公平比較
- 原生信心的公式 TypeSafe 沒公開

論文另外確認原生信心與 \( q \) 的排序很像（三個 Spearman 相關係數是 0.976、0.999、0.958，越接近 1 表示排序越一致），所以換成 \( q \) 損失不大。

**成對題要兩個順序各問一次，再取平均。** 兩個回答誰先誰後，判官可能受位置影響，所以每一對都問兩次，把機率對齊到同一個回答後平均，再取最大值當 \( q \)（HaluEval 沒有候選順序，只問一次）。

自編例子：A 先時，JEV 說「A 好」的機率 0.90；B 先時，JEV 說「先出現的 B 好」的機率 0.70，換算成「A 好」是 0.30。平均 \( = (0.90 + 0.30) / 2 = 0.60 \)，所以 \( q = 0.60 \)。一個會偏袒第一個位置的判官，兩次答案互相矛盾，平均後 \( q \) 就掉下來，後面會被轉給強判官。

**驗證：\( q \) 到底能不能用？** 論文做了三個檢查（論文第 7 節）。

**檢查一：\( q \) 越高，是不是真的越準？** 把 4,850 題（三個公開基準的原順序判斷：RewardBench 1,500、JudgeBench 350、HaluEval 3,000）依 \( q \) 分組，看 JEV 的正確率。\( q < 0.6 \) 的 214 題，JEV 只對 55.1%（GPT-6 對 69.6%）；\( q = 1 \) 的 2,332 題，兩者都對 97.8%，一起對、一起錯，只有 2 題例外。差距集中在 \( q \) 低的地方。

{{< image src="figure2.png" alt="依 JEV 兩順序平均信心 q 分組後，JEV 與 GPT-6 在各分組的正確率，以及各分組的題數。" caption="圖 2 — 信心可以指出 JEV 的錯誤落在哪裡。（來源：原始論文 Figure 5。）" >}}

**檢查二：\( q \) 能不能把錯的題挑出來？** 這要用 AUROC：把題目照 \( q \) 排序，看答錯的題是不是排在答對的題前面，0.5 等於亂猜，1 等於完美（細節見後面的概念詳解）。JEV 的 \( q \) 在 RewardBench、HaluEval、JudgeBench 上分別是 0.88、0.83、0.73（兩順序平均），最難的 JudgeBench 最弱。

**檢查三：換順序時 \( q \) 穩不穩？** JEV 共有 95 次「換順序後判決翻轉」，只有 3 次發生在 \( q \ge 0.9 \)。翻轉大多出現在本來就不確定的題目上。

{{< image src="figure3.png" alt="依 JEV 在原順序下的信心 q 分組，成對題在候選順序對調後判決改變的比例。" caption="圖 3 — 呈現順序改變時，信心與判決翻轉的關係。（來源：原始論文 Figure 7。）" >}}

**必須知道的結論：\( q \) 的排序可以信，\( q \) 的數字不能直接當機率讀。** 論文 7.2 節把排序能力（AUROC）與機率品質（Brier 分數，越低越好，見後面的概念詳解）分開量：

| 任務 | AUROC：JEV | AUROC：GPT-6 | Brier：JEV | Brier：GPT-6 |
| --- | --- | --- | --- | --- |
| RewardBench | 0.875 | 0.894 | 0.113 | 0.115 |
| JudgeBench | 0.745 | 0.907 | 0.297 | 0.095 |
| HaluEval | 0.827 | 0.831 | 0.196 | 0.213 |

表中的 AUROC 是單次呼叫的結果，跟前面兩順序平均的數字略有差異。Brier 分數是「機率與實際對錯的平方差」的平均，越低表示機率越準。

RewardBench 上兩者接近；JudgeBench 上 JEV 不只排序弱，Brier 還差了三倍。HaluEval 的 Brier 看似 JEV 較好，但論文指出這個優勢經不起標籤修正：人工裁決其中 240 題後，Brier 變成 JEV 0.062、GPT-6 0.032（題數不同，不能與 0.196 直接相減，但方向很清楚）。

更直接的證據是，同樣是 \( q \ge 0.9 \)，不同任務上對應的錯誤率不同：RewardBench 是 1.8%（20／1,130 題），JudgeBench 是 5.7%（7／123 題，題數少，數字不太穩）。

校準也救不了這件事。溫度縮放是把機率整體調平或調尖的旋鈕（溫度 \( T > 1 \) 壓平，\( T < 1 \) 拉尖，細節見後面的概念詳解）。論文在三個任務擬合出的 \( T \) 分別是 0.651、2.148、4.452，方向不一致，而且 NLL（一種特別嚴懲「很有把握卻答錯」的機率品質指標，越低越好）在其中兩個任務校準後反而變差。

{{< image src="table2.png" alt="論文 Table 27 的原表，列出 JEV 在各任務上擬合出的溫度、校準前與校準後的 NLL。" caption="表 2 — 溫度縮放在選擇集上擬合、在 held-out 上驗收的結果。（來源：原始論文 Table 27。）" >}}

所以分流用的是 \( q \) 的相對高低。門檻不能憑「\( q = 0.9 \) 大概就是 90% 會對」來設，必須用各任務自己的標註資料。

### 串接分流與門檻怎麼選

**規則。** 便宜判官先判全部題目，沒把握的才交給強判官：

1. JEV 判每一題，得到 \( q \)（成對題是兩個順序平均後的 \( q \)）
2. \( q \ge \tau \)：JEV 的判決就是最終答案
3. \( q < \tau \)：交給強判官。強判官不看 JEV 的答案、獨立重判，它的判決整個取代 JEV

\( \tau \) 是「門檻」（放行線），下面再講怎麼選。

自編例子：6 題，\( \tau = 0.9 \)。

| 題 | \( q \) | 去向 |
| --- | --- | --- |
| 1、2、3、4 | \( \ge 0.9 \) | 直接採用 JEV |
| 5、6 | \( < 0.9 \) | 轉給 GPT-6 |

GPT-6 只收 2 題的費用。但 JEV 本身也要付費（成對題問兩次），所以「省錢」是拿「JEV 全部加轉出去的」跟「全部給 GPT-6」比。論文的費用比例就是這樣算的。

**這個設計能成立的前提，是兩個判官錯在不同的題。** 以 JudgeBench 全部 350 題的原順序判斷來看，JEV 錯 75 題，GPT-6 在其中答對 60 題；GPT-6 錯 24 題，JEV 在其中答對 9 題；兩邊共同錯的有 15 題。（下一章表中 JudgeBench 的 270 題只是其中 held-out 的部分，所以準確度數字不同。）如果有一個完美的挑題員，每題都挑到比較對的那一個，準確度可達 95.7%。反過來，兩邊都錯的題，串接怎麼轉都修不回來。

{{< image src="figure4.png" alt="各個比較判官能修正多少比例的 JEV 錯誤。" caption="圖 4 — 各比較判官對 JEV 錯誤的修正比例，說明「互補」是轉出有用的前提。（來源：原始論文 Figure 22。）" >}}

這只是眾多設計中的一種，而且論文只實測了這一種（其他設計見後面的概念詳解）。

#### 門檻 τ 怎麼選：基本規則

一句話：拿一批有標準答案的題目把串接模擬一遍，挑「最省錢、而且準確度掉不超過 2 個百分點」的 \( \tau \)。

把 \( \tau \) 想成安檢的放行線：

- \( q \) 高過這條線：直接放行，用 JEV 的答案
- \( q \) 低於這條線：轉出，改請強判官重判
- 線設得**高**：轉出很多題，花錢多，但成績接近強判官
- 線設得**低**：轉出很少題，花錢少，但可能放過一些 JEV 會錯的題

做法是對每條候選的線，在標註題上模擬串接，算「轉出的比例（代表花費）」與「串接的總分」，再跟強判官單獨作答的總分比。

自編例子：100 題的練習題，GPT-6 單獨作答得 90 分。

| 放行線 \( \tau \) | 轉給 GPT-6 的比例 | 串接總分 | 比 GPT-6 差多少 |
| --- | --- | --- | --- |
| 0.99 | 80% | 90 | 0 |
| 0.95 | 55% | 90 | 0 |
| 0.90 | 35% | 89 | 1 |
| 0.80 | 20% | 86 | 4 |
| 0.60 | 8% | 83 | 7 |

選線的規則是：在「比 GPT-6 差不超過 2 分」的線裡，挑轉出最少（最省錢）的。0.99、0.95、0.90 都符合，其中 0.90 轉出最少，所以選 \( \tau = 0.90 \)。

論文的實際做法：候選值是 0.5、0.6、…、0.99 共 7 個；在 96 題 pilot 選擇題（64 題 RewardBench、32 題 JudgeBench）上，挑「在強判官的選擇集準確度 2 點之內、接受 JEV 判決最多（coverage 最大）」的 \( \tau \)，之後完全不重新擬合。對 GPT-6 選出的是 \( \tau = 0.9 \)。

#### 門檻 τ 怎麼選：保守規則

練習題很少時，量到「只差 2 分」可能是運氣，所以保守規則改問「最壞情況可能差多少」，而不是「量到差多少」。

練習題只有一百題左右時，同一條線換一批題，可能量到差 0 分，也可能差 4 分。保守規則（論文稱 lower-bound rule）把量到的差再往壞的方向扣一個懲罰，懲罰的大小代表這個數字有多不穩，題目越少扣得越多，扣完還要在 2 分以內才通過。

論文的真實例子（PPE 選擇題）：

| 放行線 \( \tau \) | 量到的掉分 | 扣完懲罰後的最壞估計 | 通過嗎 |
| --- | --- | --- | --- |
| 0.90 | 2.0 分 | 4.3 分 | 不通過 |
| 0.95 | 0 分 | 論文未列 | 通過 |

基本規則下 \( \tau = 0.90 \) 剛好壓線通過；保守規則看到最壞可能掉 4.3 分，就改選 \( \tau = 0.95 \)。（懲罰約 2.3 分，是我用論文兩個數字相減得到的。）

一般知識：這類懲罰大致跟題數的平方根成反比，題數從 100 變 1,000，懲罰約縮成原來的三分之一。代價是保守規則通常選更高的 \( \tau \)，轉出更多題、花費更高。

兩個規則在論文裡的用法不同：主要的 held-out 實驗用基本規則（96 題選擇集，選出 \( \tau = 0.9 \)）；前瞻性實驗用保守規則。

> 容忍度（掉幾分）是使用者自己訂的，不是模型替你算出來的。論文提到，如果知道答錯一題的成本，門檻應該由「錯誤成本與轉出成本的比值」推出，但沒有實測這個做法。

### 整合：完整流程與名詞總表

整套方法可以串成六步：

1. 資料切成 select 與 held-out
2. JEV 判每題，得到 \( q \)（成對題兩順序平均）
3. 用 AUROC 驗 \( q \) 能不能排出錯題，用 Brier、NLL 驗 \( q \) 的數字準不準
4. 在 select 上選 \( \tau \)（基本規則或保守規則）
5. \( q \) 低於 \( \tau \) 的題轉給 GPT-6
6. 在 held-out 驗收

| 名詞 | 一句話 | 回答的問題 | 在哪一步 |
| --- | --- | --- | --- |
| 輸出契約 | 所有判官都只回判決加標籤機率，不寫理由 | 怎麼公平比較 | 1 |
| select / held-out | select 用來選參數，held-out 完全不碰、只驗收 | 怎麼避免自己騙自己 | 1、4、6 |
| \( q \) | JEV 對自己所選判決的機率（最大標籤機率） | 這題 JEV 有多有把握 | 2 |
| 兩順序平均 | 成對題問兩次再平均，抵消位置偏見 | \( q \) 穩不穩 | 2 |
| AUROC | \( q \) 把錯題排在對題前面的機率 | \( q \) 能不能排序 | 3 |
| Brier、NLL | 機率與實際結果的差距 | \( q \) 的數字能不能當機率讀 | 3 |
| 溫度縮放 \( T \) | 一個旋鈕，整體調平或調尖機率 | 能不能修校準 | 3 |
| \( \tau \) | 放行線，\( q \) 高於它就採用 JEV | 轉多少題 | 4、5 |
| 基本規則 | 挑最省錢、掉分不超過 2 點的 \( \tau \) | 怎麼選 \( \tau \) | 4 |
| 保守規則 | 同上，但用最壞估計判斷 | 題少時怎麼選 \( \tau \) | 4 |

幾個關係要記住：\( q \) 的排序決定「轉哪些題」，\( q \) 的數字大小只影響你怎麼解讀。溫度縮放只修校準，不改準確度，二選一時也不改 AUROC，所以不影響分流。\( \tau \) 是這條流程裡唯一真正決定成本與準確度的旋鈕，而它必須用目標任務自己的標註資料來選。

第 3 步其實是診斷，不是選 \( \tau \) 的必要條件，原因在後面的概念詳解有專門一節。

## 實驗

論文的實驗很多，這裡只收最能回答「這個串接能不能用」的三組：凍結政策在沒看過的題上的結果、換強判官時規則不通用、前瞻性即時測試。\( q \) 本身好不好用的驗證，已在前面「信心：定義與驗證」一節講過。

先交代幾個名詞：

- **凍結（frozen）**：規則與門檻在看到任何 held-out 結果之前就定好，事後不調整。
- **離線模擬**：強判官先對所有題判過，再事後假裝「只有被轉出的題才用強判官的答案」，算出串接的結果。
- **95% 信賴區間**：如果重抽一批題，差距大概落在這個範圍。區間含 0，代表看不出兩者有差。
- **\( \Delta \)（delta）**：串接的準確度減去強判官單獨的準確度。

### 凍結政策在沒看過的題上的結果

一句話：用 96 題選出 \( \tau = 0.9 \)，換到沒碰過的 1,610 題，簡單任務上串接又準又省，難任務上準但省得少。

{{< image src="table3.png" alt="凍結後的 JEV 加 GPT-6 串接政策（τ = 0.9）在 held-out 偏好對上的結果，依基準分列。" caption="表 3 — 凍結的串接政策在 held-out 偏好對上的表現。（來源：原始論文 Table 4。）" >}}

下表是我從原表挑出的重點欄位，原表的欄位更多：

| 任務 | JEV 單獨 | 串接 | GPT-6 單獨 | 串接 − GPT-6（95% 區間） | 轉出比例 | 費用（GPT-6 = 1） |
| --- | --- | --- | --- | --- | --- | --- |
| RewardBench（1,340 題） | 92.8 | 93.7 | 92.4 | +1.27 [0.45, 2.03] | 25% | 0.27 |
| JudgeBench（270 題） | 81.3 | 92.2 | 93.0 | −0.74 [−2.22, 0.74] | 65% | 0.67 |

怎麼讀：

- **RewardBench**：只轉 25% 的題，費用只要 27%，準確度還略勝 GPT-6，區間不含 0，所以略勝是真的。原因是兩個判官錯在不同題，串接等於挑了各自擅長的部分。
- **JudgeBench**：要轉 65%，費用 67%，只省了三分之一。準確度與 GPT-6 看不出差別（區間含 0），但那是靠 GPT-6 補回來的。
- **小心合計列**：論文另有一行「全部 held-out」的合計（串接 93.4，費用 0.41），但 held-out 有 83% 是 RewardBench，合計幾乎只反映 RewardBench，不要用它判斷難任務。

### 換強判官時，同一套規則不一定通用

同一套選 \( \tau \) 的規則，換一個強判官，選出來的 \( \tau \) 就不同，而且在難任務上可能失效。

{{< image src="table4.png" alt="三個不同強判官在同樣的 96 題選擇集上，以同一規則選出門檻後的凍結政策結果。" caption="表 4 — 不同強判官下，凍結的兩順序串接政策在 held-out 偏好對上的結果。（來源：原始論文 Table 3。）" >}}

下表是原表的摘要。三個強判官，用同樣的規則、同樣的 96 題選擇集：

| 強判官 | 選出的 \( \tau \) | RewardBench：串接 − 強判官 | JudgeBench：串接 − 強判官 |
| --- | --- | --- | --- |
| GPT-5.4 | 0.90 | +0.37（區間含 0） | 0.00（區間含 0） |
| GPT-6 | 0.90 | +1.27（區間不含 0） | −0.74（區間含 0） |
| GPT-5.6 Sol | 0.70 | +0.82（區間含 0） | **−4.81 [−8.52, −1.48]（區間不含 0）** |

- 前兩列在兩個任務上都沒掉分。GPT-5.6 Sol 在 JudgeBench 掉了 4.81 分，超過 2 分的容忍度，而且區間完全在負的那一側，這不是運氣。
- 規則給它選了比較鬆的 \( \tau = 0.70 \)，所以在 JudgeBench 只轉出 28.5% 的題，漏掉太多 JEV 會錯的題。
- 論文的解釋：96 題選擇集裡 JudgeBench 只有 32 題，其餘是 RewardBench。RewardBench 上放寬門檻很安全，規則被這一大塊拉著選出偏鬆的 \( \tau \)，結果在難任務上失靈。
- 另一個結果：當強判官在選擇集上不比 JEV 準（GPT-4.1 mini、GPT-4.1、GPT-OSS 等），規則會選 \( \tau = 0.5 \)，也就是完全不轉出，因為轉出去沒有好處。

要帶走的重點：\( \tau \) 不是 JEV 的屬性，而是「第一階段判官、強判官、任務」三者一起決定的，換任何一個都要重新選。

### 前瞻性即時測試

在兩個新任務上，用保守規則選門檻，串接的準確度跟 GPT-6 一模一樣，但因為 JEV 在這兩個任務上本來就弱，只省到約 25% 的費用。

「前瞻性（prospective）」是先把規則寫死，再去測沒看過的資料，沒有事後調整的機會。「即時（live）」是真的呼叫 API 跑串接，不是離線模擬。

設計是先凍結流程，每個任務抽 100 題當選擇集、用保守規則選 \( \tau \)，再在剩下的題上即時串接。兩個任務都刻意選 JEV 本來就弱的：

- **PPE 正確性（500 題）**：同一模型針對同一題產生的一個對答案、一個錯答案，判官要分出哪個對
- **JudgeBench Claude 分組（270 題）**：JudgeBench 中由 Claude 產生回覆的那一組，之前沒判過

選擇集上 JEV 比 GPT-6 差 12.5 分（PPE）和 17 分（JudgeBench），所以規則選了很嚴的 \( \tau \)：PPE 是 0.95，JudgeBench 是 0.99。

{{< image src="table5.png" alt="前瞻性即時串接測試的結果，包含兩個新任務各自的準確度、轉出比例、費用與延遲。" caption="表 5 — 兩個新任務上的前瞻性即時串接結果。（來源：原始論文 Table 5。）" >}}

下表是原表的摘要（400、170 題是兩個任務在選出門檻後剩下的 held-out 題數）：

| 任務 | JEV 單獨 | 串接 | GPT-6 單獨 | 轉出比例 | 費用（GPT-6 = 1） |
| --- | --- | --- | --- | --- | --- |
| PPE（400 題） | 78.2 | 88.2 | 88.2 | 68% | 0.69 |
| JudgeBench Claude（170 題） | 70.9 | 94.7 | 94.7 | 89% | 0.91 |
| 兩者合計（570 題） | 76.1 | 90.2 | 90.2 | 74% | 0.76 |

怎麼讀：

- 準確度跟 GPT-6 完全一致，保守規則在這兩個任務上沒有選太鬆。
- 但轉出比例高，JudgeBench 的省錢只有 9%。串接能保住的，只有 JEV 本來就答對的那一小部分。
- 反事實對照：如果當初沿用前面的通用 \( \tau = 0.9 \)（原表另有一列算這個假設），費用降到 0.62，但準確度掉 0.53 分（區間 [−1.58, 0.35]，含 0），在 JudgeBench Claude 分組上掉 1.18 分。所以「換任務要重選 \( \tau \)」再次被驗證。
- 延遲幾乎沒有改善，見下表。p95 是第 95 百分位，也就是最慢那 5% 請求的起點。JudgeBench Claude 上串接甚至略慢，因為轉出的題要先等 JEV 再等 GPT-6。

| 延遲 | 串接 | GPT-6 單獨 |
| --- | --- | --- |
| 兩個任務合計：中位延遲 | 1.87 秒 | 1.91 秒 |
| 兩個任務合計：p95 延遲 | 4.95 秒 | 5.58 秒 |
| JudgeBench Claude：中位延遲 | 2.41 秒 | 2.35 秒 |


{{< admonition tip "這個實驗證明的是什麼" >}}
這個實驗證明的是「規則在弱任務上會夠嚴、不掉分」，不是「串接在弱任務上很划算」。論文自己也說，省的錢相應變少。
{{< /admonition >}}

## 整體評價

這是一份誠實的第三方評測，不是新方法。它的真正產出，是「便宜判官先過一遍、沒把握才轉給貴的」這套流程在哪裡成立、哪裡不成立。工程價值明顯高於研究價值。

**研究價值低。** 串接分流與保守選門檻都是既有做法，論文自己就引用了 FrugalGPT 一類的串接工作，以及 2017 年的選擇性分類文獻，沒有提出新演算法。能算貢獻的是做法的嚴謹：規則先凍結再驗收、把失敗案例（GPT-5.6 Sol、JudgeBench）攤出來、畫出「讀得出答案／需要推導」的界線。

**工程價值中高，但有範圍。**

- **成立**：答案能從文字直接讀出的任務。RewardBench 只轉 25% 的題、費用 27%，準確度還略勝 GPT-6。
- **失敗時安全**：弱任務上（PPE、JudgeBench Claude），串接的準確度仍等於 GPT-6，代價是多花錢（費用 0.69 到 0.91），不是掉分。
- **不成立**：沒有證據可對照的任務，\( q \) 的排序能力等於亂猜，不要用。

串接本身到底帶來什麼，可以看下面這張對照（都是 held-out 或前瞻實驗，不是事後挑的）：

| 場景 | JEV 單獨 | 串接 | GPT-6 單獨 | 串接比 JEV 多的準確度（點） |
| --- | --- | --- | --- | --- |
| RewardBench（1,340 題） | 92.8 | 93.7 | 92.4 | +0.9 |
| JudgeBench（270 題） | 81.3 | 92.2 | 93.0 | +10.9 |
| 前瞻實驗，兩個新任務（570 題） | 76.1 | 90.2 | 90.2 | +14.1 |

串接的功勞是把 JEV 的弱點補到 GPT-6 的水準。「超過 GPT-6」只出現在 RewardBench（+1.27），JudgeBench 沒超過，前瞻實驗是剛好打平。

{{< admonition warning "小心摘要的挑法" >}}
論文結論那句「高於 GPT-6 0.9 點、費用 41%」是 1,610 題的合計，其中 83% 是 RewardBench，也就是最好看的那一組。
{{< /admonition >}}

另外有幾處要打折，所以數字看方向就好：

- 對照組是低推理強度的 GPT-6，不是它的最強設定
- 推廣範圍有限，只涵蓋幾個公開基準與兩個新任務
- 人工裁決（人工複查 JEV 與 GPT-6 跟基準標籤不一致的題）不是獨立進行的
- 論文沒有聲明作者與 TypeSafe（JEV 的提供者）的關係，致謝只提到 NIST、CMU 與 OpenAI 的 API 額度。前言說這是第三方評測，這點是讀的時候要留意的

## 值得帶走的東西

前面說工程價值中高，指的是這套流程在某些任務上能直接拿來用。但論文本身可帶走的新東西很少，真正耐用的收穫在第二類。下面依耐久度排序，最耐久的在前。

### 第一類：這篇論文本身的貢獻

#### 一套可照做、且有前瞻驗證的串接流程

流程是：兩個順序平均、在標註題上選 \( \tau \)、只轉出 \( q \) 低的題、用沒碰過的題驗收。它不是新方法，論文的價值是把整套流程事前凍結後，在兩個新的弱任務上實測，結果準確度與 GPT-6 一致、費用 0.69 到 0.91。能帶走的經驗是：這個流程在弱任務上不會掉分，只是省得少。

#### 針對 JEV 1.13 量出來的適用界線

答案能從文字讀出的任務，JEV 跟 GPT-6 差在 2 點內；需要推導或核對的任務落後 7 到 28 點；沒有證據可對照的任務，信心完全失效。這個界線是針對特定版本量的，新版本出來就可能移動，但「判官強弱取決於任務是讀還是推導」這個分法本身成立（見第二類「判官能不能用，先問「答案能不能被讀出來或核對」」一項）。

#### 具體數字最不耐久

JEV 的準確度、GPT-6 的費用與延遲，都跟特定模型版本、推理強度與當時定價綁在一起，很快會過期，不用背。

### 第二類：脫離這篇論文也成立的東西

#### 評估「會給信心的分類器」，要分三件事看，三者互相獨立

準確度看判決對不對；AUROC 只看 \( q \) 的順序；Brier 與 NLL 看 \( q \) 的數字大小。三者量的是不同的東西，所以一個判官可以在其中一項很好、另一項很差。

| 要問的問題 | 看什麼 | 缺它會怎樣 |
| --- | --- | --- |
| 判決對不對 | 準確度 | 一切白搭 |
| \( q \) 能不能排出誰比較可能錯 | AUROC | 沒辦法用信心挑題 |
| \( q \) 的數字能不能當機率讀 | Brier、NLL | 信心數字會誤導 |

具體例子見後面 AUROC 與 Brier 兩節：兩個判官的排序完全一樣、AUROC 都是 0.78，但一個的信心誠實、一個過度自信，Brier 差很多。

用途決定該看哪個指標：只要判決，看準確度；用信心挑出該複查的題（分流、人工覆核），看 AUROC；把信心當機率讀（風險估算、跟別的系統組合），看 Brier 與 NLL。

#### 校準只動數字，不動排序，而且校準綁在任務上

溫度縮放把 logit 差 \( g \) 除以 \( T \)，再轉回機率。二選一時，新的信心是 \( g \) 的遞增函數，所以每題的先後順序、判決都不變：

$$q' = \frac{1}{1 + e^{-g/T}}$$

- \( g \)：兩個標籤的 logit（模型原始分數）差，取正值
- \( T \)：溫度，一個正數；\( T = 1 \) 是原本的機率，\( T > 1 \) 把機率壓平，\( T < 1 \) 把機率拉尖
- 白話：先把分數差除以 \( T \)，再照原本方式轉成機率

自編例子：\( q = 0.982 \)（\( g \approx 4 \)）。\( T = 2 \) 時 \( q' = 0.881 \)。每一題都被壓平，順序不變，所以準確度與 AUROC 不變，只有 Brier、NLL 會變。

論文的數字就是前面表 2：同一個 JEV，RewardBench 擬合出 \( T = 0.651 \)（NLL 由 0.192 變 0.216，變差），JudgeBench 是 \( T = 2.148 \)（0.449 變 0.475，變差），HaluEval 是 \( T = 4.452 \)（0.496 變 0.304，變好）。方向不一致，其中兩個任務校準後反而更糟。

實務上：只做分流，不需要校準，排序夠好就行；要把 \( q \) 當機率讀，就要用「該任務自己的標註資料」另外校準。

#### 串接的價值，來自「兩個判官錯在不同的題」

串接的結果是，被接受的題用第一階段的答案，被轉出的題用強判官的答案。如果第一階段錯的題，強判官大多答對，轉出去就能補回來。但兩邊都錯的題，怎麼轉都修不回來。

自編例子：100 題，強判官錯 10 題，JEV 錯 15 題，其中 3 題兩邊都錯。如果有一個完美的挑題員，只轉 JEV 會錯的題，剩下的錯題只有那 3 題，串接準確度 97%，比強判官單獨的 90% 還高。如果兩邊的錯一模一樣（15 題全重疊），串接最好也只能做到強判官的水準。

論文的真實數字在前面「串接分流與門檻怎麼選」一節列過（JudgeBench 350 題：JEV 錯 75 題、GPT-6 錯 24 題、共同錯 15 題），完美挑題員可達 95.7%，高於 GPT-6 單獨的約 93%。

選第一階段時要看：

- 選第一階段，除了看便宜，還要看它的錯是否跟強判官不同，也要看它的 \( q \) 能讓你放行多少題（便宜但幾乎放行不了，就省不了錢）
- 串接的天花板是兩者的共同錯，不是強判官自己的準確度
- 兩個判官越像（同家族、同訓練資料），串接越沒用（推論，論文沒有直接測）

#### 判官能不能用，先問「答案能不能被讀出來或核對」

判官的工作是比對，不是從頭解題。答案能直接從文字讀出，小模型就夠；需要自己重新推導才知道對錯，小模型就不及。

自編例子：「這個回答有沒有拒絕使用者？」讀一遍就知道；「這段程式有沒有 bug？」要在腦中執行一遍才知道。

論文的數字：答案能讀出的任務，JEV 跟 GPT-6 差在 2 點內。需要推導的任務落後很多：知識 −7.0、程式 −12.9、數學 −14.3、邏輯謎題 −27.6（JEV 減 GPT-6 的準確度，單位為百分點）。

{{< image src="figure5.png" alt="JEV 與 GPT-6 在不同技能與難度切片上的準確度差異。" caption="圖 5 — JEV 強在哪裡、弱在哪裡（原始論文的切片分析，以原順序單次呼叫計算）。（來源：原始論文 Figure 4。）" >}}

上線前的做法：先把任務分成三類。讀得出答案，便宜判官夠用；需要推導，預期要大量轉給強判官；沒有證據可對照，見下一項。

#### 信心很高，不代表可靠，尤其在判官手上沒有東西可核對的時候

模型的機率反映的是「它對自己輸出的把握」，不是「這個答案跟事實的距離」。判官沒有證據可核對時，它仍然會給一個很有把握的答案。

附錄有一組直接的數字：200 題沒有證據可對照的回答，二選一，丟硬幣是 50%。三個判官都接近丟硬幣，卻都很有把握。JEV 的 AUROC 是 0.498，信心完全分不出對錯。

{{< image src="table6.png" alt="自然語言回覆的後續實驗結果，包含摘要與一般回覆兩個工作負載下各判官的準確度與機率指標。" caption="表 6 — 摘要與一般回覆的判斷結果，一般回覆（無證據可對照）的準確度接近丟硬幣。（來源：原始論文 Table 18。）" >}}

| 判官 | 準確度 | 平均最高機率 |
| --- | --- | --- |
| JEV | 53.5% | 0.91 |
| GPT-4.1 mini | 54.0% | 0.94 |
| GPT-5.4 | 56.0% | 0.96 |

上線前的檢查：

- 信心分流的前提是「信心低的題比較容易錯」，上線前先用標註題量 AUROC 驗證
- AUROC 接近 0.5 時，不要用信心分流；轉出去也沒用，因為強判官也一樣近乎亂猜
- 限制：只有 200 題，論文自己說只能證明結果跟任務有關，不能斷言差別純粹來自有沒有證據。細節見後面「沒有參考答案的文章」一節

#### 設計串接要看「失敗時的樣子」，好的設計失敗時是花更多錢，而不是掉分

串接的安全性來自一個結構：\( q \) 低就轉給強判官，所以第一階段越不確定，轉出越多，最終答案越接近強判官單獨的結果。第一階段變弱時，系統是把成本推高，而不是把錯誤放行。

支持這點的是前瞻實驗（表 5）：兩個任務 JEV 本來就弱，準確度仍與 GPT-6 完全一致，代價是費用接近 GPT-6 單獨的水準（PPE 轉出 68%、費用 0.69；JudgeBench Claude 轉出 89%、費用 0.91）。

這個保證有兩個限制：

- 只在門檻選對時成立。論文的反例：GPT-5.6 Sol 的 \( \tau \) 選到 0.70，在 JudgeBench 掉了 4.81 分。
- 沒有證據可對照的任務，強判官自己也近乎亂猜，轉出去不會變好，所以「失敗時變貴」的保證在這裡也不成立。

設計原則：設計任何分流或升級機制，都要問兩件事。第一階段失靈時，錯誤是被放行，還是被推高成本？門檻設錯時，壞掉的是哪一邊？好的串接設計，應該讓門檻設保守時，壞掉的永遠是成本這一邊。

## 概念詳解

這一段的每一節都能獨立閱讀，脫離這篇論文也成立。

### 資料切分：pilot 剩下的部分做什麼用

論文把 642 筆 pilot 資料切成 select（40%）與 test（60%），select 用來選門檻，那 test 的 60% 做什麼用？

**論文沒有明確說明 pilot test 部分的獨立用途。** 我在主文與附錄都沒找到它單獨出現在任何結果裡；溫度縮放的驗證與門檻的驗收，都是用 held-out，不是用 pilot test。

論文有講的是：pilot 在任何模型推論之前就先凍結；select 只用來擬合溫度與路由門檻。「source-cluster」的意思是，同一個題目的重複回答會留在同一邊，避免同題目同時出現在 select 與 test。數字就是前面「評測設計」那張表，單位是判斷次數。pilot 的 642 筆 = select 128 + test 192 + 不切分的 322。

我的推論（不是論文原文）：pilot test 大概沒有獨立角色，只是併進表 1 的總體準確度。證據是 RewardBench 的 160 加 1,340 剛好等於表 1 的 1,500 筆，表示 pilot 的所有題目（含 select 與 test）都算在總體準確度裡。

這個切法有一個後果：select 的 128 筆同時也算進表 1 的準確度，所以那些數字不是完全乾淨的 held-out 結果。不過 128 筆佔 5,172 筆很小，對結論影響有限，不算嚴重缺失。

通用觀念是為什麼要把資料分成不同角色：

| 角色 | 做什麼 | 為什麼要獨立 |
| --- | --- | --- |
| select（選擇集） | 決定參數，例如門檻 \( \tau \)、溫度 \( T \) | 這份資料已經被「看過」，用來選參數 |
| held-out（驗收集） | 只在最後驗收一次 | 必須完全沒參與選擇，數字才可信 |

用來選參數的資料，不能同時拿來證明參數選得好。舉例（自編）：你在一批題目上挑出讓準確度最好的 \( \tau \)，再在同一批題目上報告準確度，數字當然好看，但那只是在證明「這個 \( \tau \) 適合這批題」，不是「這個 \( \tau \) 適合新的題」。把驗收用的題完全隔開，才能知道換到沒看過的題會怎樣。

### AUROC：用排隊看懂它

AUROC 只問一件事：把所有題目照 \( q \) 從低到高排成一排，答錯的題是不是排得比答對的題前面？

它的全名是 Area Under the ROC Curve，在這裡衡量「\( q \) 排序錯題的能力」。白話意思是：隨機抽一題答錯的、一題答對的，答錯那題的 \( q \) 比較低的機率。0.5 等於亂猜，1 等於完美。

自編例子：6 題，JEV 對 3 題答錯、3 題答對，每題有一個 \( q \)。先照 \( q \) 由低到高排隊：

| 排序 | \( q \) | 實際 |
| --- | --- | --- |
| 1 | 0.55 | 錯 |
| 2 | 0.60 | 對 |
| 3 | 0.70 | 錯 |
| 4 | 0.90 | 錯 |
| 5 | 0.95 | 對 |
| 6 | 0.99 | 對 |

如果 \( q \) 是個完美的錯題偵測器，3 題錯的會全部排在最前面。實際上第 2 名是答對的，混在錯題中間。

要把「排得好不好」變成一個數字，做法是把每一題錯的跟每一題對的配成一對，共 3 × 3 = 9 對，每一對只問「錯的那題，\( q \) 是不是比對的那題低？」

| 錯題 \( q \) ＼ 對題 \( q \) | 0.60 | 0.95 | 0.99 |
| --- | --- | --- | --- |
| 0.55 | ✓ | ✓ | ✓ |
| 0.70 | ✗ | ✓ | ✓ |
| 0.90 | ✗ | ✓ | ✓ |

9 對裡有 7 對排對了，所以 AUROC = 7 / 9 ≈ 0.78。

數字的感覺如下（一般知識，不是論文內容）：

| AUROC | 感覺 |
| --- | --- |
| 0.5 | \( q \) 跟對錯完全無關，等於丟骰子 |
| 0.7 | 有點用，但排錯題的能力不穩 |
| 0.8 到 0.9 | 實用等級，大部分錯題會排在對題前面 |
| 1.0 | 完美，實務上幾乎不會出現 |

**AUROC 只看順序，不看 \( q \) 的大小。** 把上表的 \( q \) 全部改成 0.01、0.02、0.03……只要順序不變，AUROC 還是 0.78。

這個盲點的後果（自編例子）：沿用同樣 6 題，實際只答對 50%。判官 X 的 \( q \) 是 0.55、0.60、0.70、0.90、0.95、0.99；判官 Y 的 \( q \) 是 0.950、0.960、0.970、0.980、0.985、0.990。兩者排序一模一樣，AUROC 都是 7/9。但判官 Y 每題都宣稱有 95% 以上的把握，實際只對一半。AUROC 完全看不出兩者的差別，這要靠 Brier 之類的指標（見後面「怎麼量校準」）。

回到論文：HaluEval 上，GPT-6 與 JEV 的 AUROC 幾乎一樣（0.831 對 0.827），但 Brier 並不相同（0.213 對 0.196）。排序能力相同，機率品質不同。（不過前面「信心：定義與驗證」一節提過，這個 Brier 差距經不起標籤修正，這裡只拿來說明「AUROC 相同時 Brier 可以不同」。）

論文裡的數字（單次呼叫的 AUROC）就是前面「信心：定義與驗證」那張表的前兩欄。RewardBench 與 HaluEval 上，JEV 的 \( q \) 排錯題的能力跟 GPT-6 差不多。JudgeBench 才是重點：GPT-6 是 0.907，JEV 是 0.745。這是最難的一組題目，GPT-6 不只答得比較準，也比較「知道自己什麼時候會錯」。

看一個會給信心的分類器，AUROC 只回答「\( q \) 能不能排出誰比較可能錯」，不回答「\( q = 0.9 \) 是不是真的代表 90% 會對」，也不回答「判決對不對」。三者要分開看。

### AUROC 低時，分流會變成什麼樣

AUROC 低，代表很難知道哪些題該交給貴的判官，所以要多付錢、或多承擔錯誤，但不是「全部轉出去」。

分流要的就是「把可能錯的題挑出來轉給貴的判官」。AUROC 高，只轉少量題目，就能攔下大部分錯題；AUROC 低，要轉很多題才攔得住，省下的錢就少了。

AUROC 低不代表只能把大部分題目都交給貴的判官。方向上確實要多轉，但實際上是你在「轉出多少題」和「漏掉多少錯題」之間取捨，AUROC 低只是讓這筆交易變貴。

自編例子（粗估，只為說明方向）：100 題裡有 10 題 JEV 會答錯。

| | AUROC 高（約 0.9） | AUROC 低（約 0.6） |
| --- | --- | --- |
| 想攔下 8 題錯題 | 轉約 20 題就夠 | 可能要轉 60 題以上 |
| 只轉 20 題 | 能攔下約 8 題錯題 | 只能攔下約 3 到 4 題錯題 |

AUROC 低時你有兩種選擇：多付錢（轉更多題），或多承擔錯誤（轉一樣多、漏掉更多錯題）。「全部轉」是其中最極端的選法。

論文的實測：門檻 \( \tau = 0.9 \) 時，4,850 題裡轉走 1,106 題（約 23%），其餘 3,744 題直接用 JEV 的答案。這 23% 就是「在 JEV 的 \( q \) 排序能力下」選出的取捨點。

### 校準：機率說 90%，實際是不是 90%

校準（calibration）就是模型說「有 90% 把握」的那些題，實際上真的大約有 90% 是對的：

$$P(\text{判決正確} \mid q = x) = x$$

- \( q \)：模型給的信心
- \( x \)：某個具體的信心數值，例如 0.9
- 左邊：在所有 \( q \) 剛好等於 \( x \) 的題目中，判決正確的比例
- 白話：信心 0.9 的題目，正確率就該是 0.9

自編例子：判官 Y 對 100 題都說 \( q \approx 0.96 \)，實際只對 50 題。理想上該有 96 題對，實際只對 50，所以 Y 是**過度自信**（overconfident）。反過來，如果說 0.6 卻對了 90%，就是**信心不足**（underconfident）。

排序與校準是兩個獨立的性質：

| | 校準好 | 校準差 |
| --- | --- | --- |
| **排序好** | 理想 | 能排出錯題，但數字不能直接讀 |
| **排序差** | 數字誠實，但幫不上忙 | 兩頭落空 |

評估一個會給信心的分類器，至少有三個獨立的問題：判決對不對看準確度，\( q \) 能不能排出誰比較可能錯看 AUROC，\( q \) 的數字本身可不可信看校準指標（Brier 等）。一個判官可以在其中一項很好、另一項很差。AUROC 只管排序，校準指標見下一節。

### 怎麼量校準：可靠度曲線、Brier、ECE、NLL

量校準有幾種常見工具，差別在於你想看「哪裡偏」還是「總共偏多少」。

#### 可靠度曲線（reliability curve）：看哪裡偏

把題目依 \( q \) 的大小切成幾個區間，每個區間算一個點，一條曲線就是幾個點連起來：

| 要算的 | 怎麼算 | 畫在哪 |
| --- | --- | --- |
| 平均信心 | 區間內所有題目 \( q \) 的平均 | 橫軸 |
| 實際正確率 | 區間內答對的題數 ÷ 總題數 | 縱軸 |

完美校準時，每個點都落在 \( x = y \) 的對角線上。

自編例子：10 題，\( q \) 與對錯如下，切成 3 個區間。

| 區間 | 區間內的 \( q \) | 平均信心 | 答對 | 正確率 |
| --- | --- | --- | --- | --- |
| 0.5 到 0.7 | 0.52、0.58、0.63、0.67 | 0.60 | 2/4 | 0.50 |
| 0.7 到 0.9 | 0.72、0.78、0.85 | 0.78 | 2/3 | 0.67 |
| 0.9 到 1.0 | 0.91、0.96、0.99 | 0.95 | 3/3 | 1.00 |

三個點是 (0.60, 0.50)、(0.78, 0.67)、(0.95, 1.00)。

區間怎麼切有兩種方法（一般知識，不是論文內容）：

| | 等寬分組 | 等量分組 |
| --- | --- | --- |
| 做法 | 每組寬度一樣，例如 0.0 到 0.1、0.1 到 0.2…… | 每組題數一樣，邊界由資料決定 |
| 優點 | 簡單，橫軸容易讀 | 每個點的可信度相近 |
| 缺點 | 題目常堆在少數幾組，其他組只有幾題，點很抖 | 單組的 \( q \) 範圍可能很寬 |

經驗法則：\( q \) 的分布集中在一端時，用等量分組，或把擠滿題目的那一端切細。

論文裡的可靠度曲線在下面這張圖的下排。圖說只寫了「每組至少要有 5 題才畫」，邊界怎麼切沒有明講。前面圖 2 的邊界不等寬（<0.6、0.6、0.7、0.8、0.9、0.95、0.99、=1），高信心端切得特別細，因為 JEV 的 \( q \) 大量堆在接近 1 的地方（\( q = 1 \) 就有 2,332 題）。

{{< image src="figure6.png" alt="上排是 JEV 對答對與答錯的判斷各自的最大機率分布，下排是幾個主要判官的可靠度曲線。" caption="圖 6 — 上排為最大機率分布，下排為可靠度曲線。（來源：原始論文 Figure 6。）" >}}

#### Brier 分數：總共偏多少，一個數字

$$\text{Brier} = \frac{1}{N}\sum_{i=1}^{N}(q_i - o_i)^2$$

- \( q_i \)：第 \( i \) 題的信心
- \( o_i \)：第 \( i \) 題實際結果，答對 1、答錯 0
- \( N \)：題數
- 白話：每題「信心與結果的差」平方後取平均，越低越好

自編例子：沿用 AUROC 那 6 題。判官 X 的 \( q \) 是 0.55、0.60、0.70、0.90、0.95、0.99，結果是 錯、對、錯、錯、對、對，Brier \( = (0.55^2 + 0.40^2 + 0.70^2 + 0.90^2 + 0.05^2 + 0.01^2) / 6 \approx 0.294 \)。判官 Y 的 \( q \) 是 0.95、0.96、0.97、0.98、0.985、0.99，同樣結果，Brier \( \approx 0.468 \)。排序一樣（AUROC 都是 0.78），Brier 卻差很多。

這是簡化版，只看 \( q \) 對不對。論文的 Brier 對所有標籤的機率計算，細節略有不同。

#### ECE（期望校準誤差）：把可靠度曲線壓成一個數字

$$\text{ECE} = \sum_{b=1}^{B} \frac{n_b}{N}\,\bigl|\,\text{acc}_b - \text{conf}_b\,\bigr|$$

- \( B \)：分成幾組
- \( n_b \)：第 \( b \) 組有幾題；\( N \)：全部題數
- \( \text{acc}_b \)：第 \( b \) 組的實際正確率
- \( \text{conf}_b \)：第 \( b \) 組的平均信心
- 白話：每組算「偏多少」，題目多的組算得重一點，再加總

用上面可靠度曲線的 10 題例子算：

| 區間 | 題數 | 平均信心 | 正確率 | 差距 | 權重（題數 ÷ 10） | 貢獻 |
| --- | --- | --- | --- | --- | --- | --- |
| 0.5 到 0.7 | 4 | 0.60 | 0.50 | 0.100 | 0.4 | 0.040 |
| 0.7 到 0.9 | 3 | 0.78 | 2/3 | 0.113 | 0.3 | 0.034 |
| 0.9 到 1.0 | 3 | 0.95 | 1.00 | 0.050 | 0.3 | 0.015 |

ECE \( \approx 0.040 + 0.034 + 0.015 = \) **0.089**，意思是平均偏差約 9 個百分點。

兩個設計值得注意：取絕對值，是為了讓「過度自信」和「信心不足」不會互相抵消；用題數加權，是因為題目少的組本來就不可靠。ECE 的缺點（一般知識）是它的值會隨分組方式改變。

論文的用法：主文以 Brier 和 NLL 為主；附錄也報 ECE（用 10 個最大機率區間）。主文為什麼不選 ECE，論文沒有說明。

#### NLL（負對數似然）：特別嚴懲「很有把握卻答錯」

每題取「模型給正確答案的機率 \( p \)」，算 \( -\ln p \)，再對所有題平均，越低越好。

| 模型給正確答案的機率 \( p \) | \( -\ln p \) |
| --- | --- |
| 0.9 | 0.11 |
| 0.5 | 0.69 |
| 0.1 | 2.30 |
| 0.01 | 4.61 |

跟 Brier 的差別在於：一個判官有 99% 把握卻答錯，等於給正確答案只有 0.01。Brier 的這題懲罰最多是 1（平方後頂多 1），NLL 是 4.61，而且 \( p \) 越接近 0 它會一直往上衝，沒有上限。所以 NLL 對「很有把握卻答錯」特別嚴格，Brier 比較溫和。論文同時報兩個，就是為了從兩個角度看機率品質。

### 為什麼模型常常校準不好

訓練時沒有任何一項在逼模型「機率要說實話」，而且有些訓練步驟還會推它過度自信。以下是一般知識，不是論文內容。

**原因 1：訓練目標只獎勵「答對」，不獎勵「機率誠實」。** 類比一下：考試只看你有沒有選對，沒人檢查你寫的「我有幾成把握」，時間久了，你就沒有理由學會把把握度寫準。

底層機制是這樣：分類模型最後會把原始分數（logits）轉成機率（softmax）。訓練用的損失函數 cross-entropy（其實就是 NLL）在答對時，仍然會因為「正確答案的機率還沒到 1」而繼續給獎勵。自編例子，兩個類別的 logits：

| logits（對的、錯的） | 對的那類機率 | 答對時的損失 \( -\ln p \) |
| --- | --- | --- |
| [2, 0] | 0.881 | 0.127 |
| [4, 0] | 0.982 | 0.018 |

兩種情況判決都對，但第二種損失更低。所以訓練會一直把分數差拉大，機率越來越靠近 1，但對的機率不會因此真的跟著變高。這是 Guo et al. 2017（論文也引用）指出的現象，現代深度網路普遍偏向過度自信。

**原因 2：後訓練（post-training）會把機率推向極端。** 預訓練模型的 token 機率通常還算誠實，經過 RLHF 這類以人類偏好為目標的訓練後，輸出會被推向「聽起來很肯定」。

**原因 3：校準是「對某一種題目」才成立的。** 在 A 類題目上調好的機率，換到 B 類題目就會跑掉，因為模型在不同題目上的難度與錯法不同。論文的直接證據在論文 7.2 節：同一個 JEV、同一套溫度縮放流程，在 RewardBench 上擬合出 \( T = 0.65 \)（把機率調尖），在 JudgeBench 和 HaluEval 上卻是 \( T = 2.15 \) 與 \( 4.45 \)（把機率調平）。

### 二選一時 q 與 logit 差、溫度縮放、為什麼不改準確度與 AUROC

二選一時，\( q \) 只由「兩個分數的差距」一個數字決定；溫度縮放就是把這個差距整體除以 \( T \)，所以判決與題目之間的先後順序都不變，變的只有機率數字。以下針對二選一（論文的主要任務），內容是一般知識，除非特別註明。

#### q 與 logit 差的關係

logit 是模型對每個標籤的原始分數，softmax 把它們轉成機率。兩個標籤時：

$$p_1 = \frac{e^{z_1}}{e^{z_1}+e^{z_2}} = \frac{1}{1+e^{-(z_1-z_2)}}$$

- \( z_1 \)、\( z_2 \)：兩個標籤的 logit
- \( z_1 - z_2 \)：兩者的差，記為 \( g \)
- 白話：兩個分數的絕對大小不重要，只有差距決定機率

對 JEV 要小心：論文通篇沒有提到 logit，也沒說 JEV 內部怎麼產生機率，所以「JEV 是不是由 logit 差算出」，論文沒有講。但不需要知道，只要有機率，就能反推出 \( g \)，這叫 log-odds（對數勝算）：

$$g = \ln\frac{p_1}{p_2}$$

自編例子：判官說某題 \( q = 0.982 \)，\( g = \ln(0.982 / 0.018) \approx 4.0 \)。

#### 溫度縮放怎麼做

1. 拿到機率 \( p \)
2. 換成分數差 \( g = \ln\bigl(p / (1 - p)\bigr) \)
3. 除以 \( T \)
4. 轉回機率 \( q' = 1 / (1 + e^{-g/T}) \)
5. 在選擇集上試很多個 \( T \)，挑讓 NLL 最低的
6. 拿去 held-out 驗收

\( T > 1 \) 機率被壓平，比較不自信；\( T < 1 \) 機率被拉尖，更自信；\( T = 1 \) 是原本的機率。

自編例子，logits 是 [4, 0]（\( g = 4 \)），對的那類機率隨 \( T \) 變化如下：

| \( T \) | 除完的分數差 | 對的那類機率 | 效果 |
| --- | --- | --- | --- |
| 0.5 | 8 | 0.9997 | 調尖，更自信 |
| 1 | 4 | 0.982 | 原本 |
| 2 | 2 | 0.881 | 調平 |
| 4 | 1 | 0.731 | 調得更平 |

白話：判官對某批題目都說 0.982，實際只對 7 成。\( T = 4 \) 把機率降到 0.731，接近真實的 0.7，所以 \( T \) 大約落在這一帶。（實際擬合是讓全部題目的 NLL 最低，不是對齊單一數字。）

論文的做法是用 select set 擬合 \( T \)，再到 held-out 驗收（表 2）。第 2 步用機率反推 \( g \) 是我的推論，論文沒有交代它實際怎麼對 JEV 做縮放。

#### 為什麼不改準確度與 AUROC

這裡有兩個不同層次的排序，不能混在一起：

| 指標 | 不變的原因 |
| --- | --- |
| 準確度 | 判決取的是機率最大的那個標籤。每個分數都除以同一個 \( T \)，各標籤之間誰大誰小不會變，所以選的標籤不變 |
| AUROC | 它看的是不同題目之間 \( q \) 的排序。二選一時，\( q \) 是 \( g \) 的遞增函數，調 \( T \) 只是把它整體壓平或拉高，題目之間的先後順序不變 |

自編例子：3 題，logit 差 \( g \) 分別是 0.5、1.5、3.0。

| 題目 | \( g \) | \( T = 1 \) 的 \( q \) | \( T = 2 \) 的 \( q \) |
| --- | --- | --- | --- |
| 甲 | 0.5 | 0.623 | 0.562 |
| 乙 | 1.5 | 0.818 | 0.679 |
| 丙 | 3.0 | 0.953 | 0.818 |

\( T \) 從 1 變 2，每一題的 \( q \) 都往 0.5 靠，但甲 < 乙 < 丙 的順序沒變。所以如果原本錯題都排在前面，現在還是排在前面，AUROC 不會變。

調 \( T \) 之後，準確度與 AUROC 不變，Brier、NLL、ECE 會變（這三個都在量「機率數字準不準」）。溫度縮放只修「校準」，這正是準確度、AUROC、校準指標各管一件事的好處。

### 驗證 q 的那一步，是選門檻的必要條件嗎

方法流程裡有「驗證 \( q \) 好不好用」（AUROC、Brier、NLL）這一步，但只要有「在標註題上模擬串接、選 \( \tau \)」與「用 held-out 驗收」這兩步，似乎就能選出最好的門檻，為什麼還需要驗證 \( q \)？

**就「選出 \( \tau \)」這件事，驗證 \( q \) 不是必要的。** 模擬串接時直接量最終結果（花多少錢、掉多少分），已經包含了 \( q \) 好不好用的資訊。驗證 \( q \) 是診斷，不是前置條件。

驗證 \( q \) 能多做的事：

| 驗證 \( q \) 多給的東西 | 模擬串接能不能給 |
| --- | --- |
| 為什麼會失敗：是排序差，還是機率偏？ | 不能。模擬只會告訴你「沒有 \( \tau \) 通過」或「通過」 |
| 判斷這個任務值不值得做串接 | 部分能。例如沒有參考答案的文章 AUROC 0.498，模擬最後也會得到「全部轉出去」，但你得先跑完兩個判官才知道 |
| 換強判官時可以重用（推論，論文沒這樣講） | 不能，每換一個強判官，模擬都要重做 |

第一項是主要價值。第二項只是省一點成本：AUROC 只需要第一階段判官跑過、有標準答案，不用付強判官的費用。

Brier 與 NLL 更不是必要的。分流只用到 \( q \) 的排序，不用把 \( q \) 當機率讀，所以它們完全不影響 \( \tau \) 怎麼選。它們的用處是：你想把 \( q \) 當「答對機率」來報告、跟別的判官比較機率品質，或做別的需要機率數字的事。

工程上的判斷：

- 要選 \( \tau \)：只需要「模擬串接」與「驗收」
- AUROC 當成便宜的前置篩檢就好，Brier、NLL 可以省略
- 論文把驗證 \( q \) 寫那麼完整，是因為它要回答研究問題「這個做法在哪些任務上成立」，這是研究價值，不是部署必要

一個保留（推論）：選 \( \tau \) 的標註資料很少時，結果會不穩（見前面的「保守規則」），這時 AUROC 可以當作交叉檢查。論文沒有驗證這個用法。

### 串接有哪幾種設計、論文驗證了哪些

論文只實測了「獨立、替換」這一種，另外兩種沒有驗證，所以不能說它是最好的。論文自己的說法是，融合、讓強判官看 JEV 的判決、以及把兩個判官錯誤的相關性納入規則，都留給未來研究（論文第 7 節末尾）。

三種設計都是「便宜判官先判、沒把握轉給強判官」，差別在強判官怎麼用：

| 設計 | 做法 | 缺點與來源 |
| --- | --- | --- |
| 獨立、替換（論文選的） | 強判官不看 JEV 的答案，直接取代 | 強判官也答錯的題，修不回來（論文原文） |
| 讓強判官看 JEV 的判決 | 資訊多，像辯論 | 兩者錯誤變得互相依賴（論文原文） |
| 兩個都判全部再融合 | 取機率平均 | 強判官每題都要付費，省不了錢（我的推論，論文沒有測融合，也沒有算它的費用） |

論文實際比較過的，是別的東西：

| 比較對象 | 在回答什麼 | 能不能說明「這個設計最好」 |
| --- | --- | --- |
| 隨機轉出，花同樣的錢（後面圖 7 的灰線） | 用 \( q \) 挑題，比亂挑好嗎 | 不能，只證明 \( q \) 有用 |
| 換不同的強判官（GPT-5.4、GPT-5.6 Sol、GPT-6） | 這個設計換判官還成立嗎 | 不能，設計沒變 |
| 換不同的第一階段判官 | JEV 是不是特別適合當第一階段 | 不能，設計沒變 |

這三組比較都固定在「獨立、替換」之下。所以論文能支持的結論是：在這個設計下，用 \( q \) 分流有效，而不是「這個設計優於其他設計」。

我的看法（推論）：這個設計是最簡單、最省錢、最容易部署的一種，但「最簡單」不等於「最好」。要不要換成別種組合，只能靠自己的資料測。

### 沒有參考答案的文章是什麼意思、為什麼信心會失效

「沒有參考答案」指判官只拿到「問題加回答」，手上沒有任何證據文件或標準答案可以對照，要完全靠自己的知識判斷這段回答有沒有胡說（幻覺）。在這種任務上，JEV 的 \( q \) 既不準，也分不出該轉給誰。

自編例子對照：

| | 有證據可對照 | 沒有參考答案 |
| --- | --- | --- |
| 判官拿到什麼 | 一份文件加一句摘要 | 只有一個問題加一段回答 |
| 問什麼 | 摘要有沒有被文件支持？ | 這段回答有沒有胡說？ |
| 判官怎麼判 | 把摘要拿去跟文件對照 | 只能靠自己腦中的知識猜 |

論文的數字見前面表 6 和它下方的小表：200 題沒有參考答案的一般回答，二選一，三個判官都接近丟硬幣，卻都很有把握（平均最高機率 0.91 到 0.96）。JEV 的 Brier 是 0.821，AUROC 是 0.498，也就是 \( q \) 完全分不出哪些題會錯。

這會讓串接失效，因為分流的前提是「\( q \) 低的題比較容易錯」。這裡 \( q \) 都很高，而且高低跟對錯無關，所以沒有任何門檻能把該轉的題挑出來。而且就算轉出去，強判官 GPT-5.4 也只有 56%，轉了也沒用。論文的結論是「沒有任何受測判官能用在這類題目上」，所以這不是 JEV 特有的問題。

要保留的限制：

- 只有 200 題，95% 信賴區間 [46.5, 60.5]
- 論文自己說，這組跟有證據的那組在內容和標籤來源上都不同，所以只能說「結果跟任務有關」，不能斷言差別純粹來自有沒有證據

通用觀念：信心反映的是模型對自己輸出的把握，不是答案跟事實的距離。判官沒有東西可核對時，它仍然會給一個很有把握的答案，所以上線前一定要用標註題量 AUROC 驗證信心有沒有用。

### 串接的成本與準確度怎麼取捨

任何串接都有成本與準確度的取捨，連把題目隨機轉給強判官也有。論文真正想證明的是：**用 \( q \) 挑題，比隨機挑好，而且你能事先知道在哪些任務上成立。**

**門檻設高，仍然能省一點成本。** 表 5 的 JudgeBench Claude 分組，\( \tau = 0.99 \)、轉出 89.4% 的題，準確度跟 GPT-6 完全一樣（94.7%），費用只省到 0.91。

**直接用強判官是最穩的基準，但不一定最快：**

- 最穩：準確度最高的就是直接用強判官
- 延遲：轉出去的題要先等 JEV 再等 GPT-6，JudgeBench Claude 的中位延遲 2.41 秒，比 GPT-6 單獨的 2.35 秒還慢

用 \( q \) 挑題比隨機好，下面這張事後掃描可以看到。它是在同一批題上讀出的，所以偏樂觀：\( \tau = 0.9 \) 時串接 90.2%，隨機轉出同樣費用只有 89.0%。曲線形狀才是重點，不是權衡本身。

{{< image src="figure7.png" alt="在原順序的公開題目上，JEV 加 GPT-6 串接在不同信心門檻下的準確度與費用曲線，並與隨機轉出和 GPT-6 單獨比較。" caption="圖 7 — 事後掃描：用信心挑題的串接，與隨機轉出同樣比例的對照。（來源：原始論文 Figure 8。）" >}}

**選門檻看起來只是窮舉，但難點不在搜尋。**\( \tau \) 只有一個參數、候選值才 7 個，窮舉本身很便宜。真正難的是標註題很少時，量到的掉分很不穩，論文用保守規則處理（見前面「門檻怎麼選」一節）。這個規則不是新方法，容忍度是人訂的，也沒有統計保證；論文提到若知道錯誤成本，門檻應由成本比推出，但沒有實測。

## 結論

這篇論文證明了一件有範圍的事：用 JEV 的最大標籤機率 \( q \) 當信心，沿著「有把握就採用、沒把握就轉給 GPT-6」分流，在答案能從文字讀出的任務上又準又省（RewardBench 費用 27%、準確度略勝 GPT-6），在難任務與新任務上，門檻選對時準確度不掉、但省得有限（9% 到 33%）。

幾個要記住的點：\( q \) 只適合排序，不適合當機率讀；\( \tau \) 是第一階段判官、強判官、任務三者的函數，換任何一個都要用自己的標註資料重選；沒有證據可對照的任務，信心完全失效，不要用。具體的準確度與費用數字會很快過期，真正耐用的是 AUROC 與校準的分工、資料切分的紀律，以及「好的串接失敗時是變貴，而不是變錯」這個設計原則。


