JEV-as-a-Judge: 확신하면 받고, 모르면 넘기는 판정기¶
- 논문: JEV-as-a-Judge: Accept When Confident, Escalate When Unsure
- 저자: Yubo Li, Yidi Miao, Ramayya Krishnan, Rema Padman (Carnegie Mellon University, 4명)
- arXiv: 2609.26550 [cs.AI], 2026-09-22 제출, v1
- 평가 대상: TypeSafe AI의 호스티드 판정 서비스 JEV 1.13.0 (구현 비공개)
- 실험 환경: 비교 판정기 16종(호스티드 12종 + 로컬 4종), 기본 문항 1,312건, 지연·요금은 120건 고정 패널
- 읽은 날짜: 2026-09-28
- 태그: #LLMasJudge #Calibration #Cascade #SelectivePrediction #EvalCost
한 줄 요약¶
근거 문장은 빼고 판정과 라벨 확률만 돌려주는 싼 판정기를 1차로 쓰고, 확신도가 낮은 문항만 비싼 LLM 판정기로 넘기면 GPT-6 정확도의 99%를 요금 57%로 유지한다. 다만 이 방식이 통하는 작업 범위는 좁고, 임계값도 작업마다 다시 맞춰야 한다.
읽는 방식¶
원문 목차를 그대로 따라간다. 절 번호와 제목이 원문과 같다. 마지막 세 절만 읽는 쪽에서 덧붙인 것이다.
1. Introduction¶
LLM 판정기가 평가의 기본 도구가 되면서 두 가지 비용이 커졌다.
- 추론 비용: 추론 모델은 판정 한 줄을 내려고 긴 사고 토큰을 쓴다. 토큰 과금이면 요금이 늘고, 순차 생성이라 지연도 늘어난다. 쉬운 문제에도 긴 추론을 쓴다
- 확신도 신뢰성: LLM이 말로 밝힌 확신도는 과신하는 경향이 있다. 보정 상태는 모델·과제·질문 방식에 따라 달라지는 실측 성질이다
그래서 묻는다. 판정만 내는 판정기(decision-only judge)가 싼 1차 관문 역할을 하면서, 더 강한 판정이 필요한 문항을 스스로 가려낼 수 있는가. 이를 위해 정확도, 확률 품질, 운영 비용을 함께 잰다. 확률 형태로 출력한다고 보정됐다는 뜻은 아니라는 점을 저자들이 먼저 짚는다.
2. Related work¶
세 갈래의 선행 연구를 정리한다.
- LLM 판정기와 제시 편향: MT-Bench와 Chatbot Arena가 위치·장황함·자기선호 편향을 기록했다. 이 논문은 출력 계약을 하나로 고정하고 그 안에서 순서 뒤집기, 루브릭 바꿔 쓰기, 문체 민감도를 잰다
- 보상 모델과 판정 벤치마크: PairRM, Skywork-Reward-V2, RewardBench(1, 2), JudgeBench, HaluEval, RM-Bench를 모두 쓴다. 오래된 PairRM이 효율적 판정의 기준선이 되지 않게 최신 보상 모델도 넣었다
- 확신도와 단계적 호출: 온도 스케일링, 선택적 분류(selective classification), FrugalGPT, RouteLLM. 가장 가까운 것은 사람 합의 보장을 두고 판정기를 단계 호출하는 Jung et al.(2025)과, 보상 모델이 불확실할 때 강한 LLM 판정기에 묻는 Xu et al.(2025)이다
기여를 스스로 좁혀 둔다. 새 라우팅 알고리즘이 아니라, 호스티드 판정기 하나의 운영 특성을 동결된 임계값과 실측 요금으로 기록한 것이다.
3. Tasks and experimental protocol¶
판정기의 출력 형태와 평가 과제는 별개다. 라벨만 내는 판정기도 자유 텍스트를 평가할 수 있다. 그래서 평가받는 답의 형식과 판정기 출력을 분리한다.
| 데이터 | 규모 | 과제 |
|---|---|---|
| RewardBench | 400쌍 (chat, chat-hard, safety, reasoning 각 100) | 두 응답 중 나은 것 고르기 |
| JudgeBench | 350쌍 (GPT-4o 분할 전체) | 객관적 정답이 있는 쌍 비교 |
| HaluEval | 240건 (QA 120문항 × 정답·환각 답) | 근거 문서 대비 사실성 |
| 기존 라벨 응답 | 150건 (정답 99 / 오답 25 / 무응답 26) | 최종 답 판정 |
| GSM8K 궤적 | 108건 (전부 정답) | 대조군 |
| 합성 근거 판정 | 64건 | 대조군 |
동결 순서가 이 논문의 설계 핵심이다.
- 642건 파일럿은 추론 전에 동결했고, 공개 과제를 원문 질문 단위로 40/60 나눠 선택 집합(온도·임계값 적합 전용)과 파일럿 테스트 집합으로 썼다
- 670건 확장 집합은 파일럿 정확도를 보기 전에 동결했고 어떤 적합에도 쓰지 않았다
- 다만 여러 모델 계열을 추가한 확장 비교는 초기 결과를 본 뒤에 했으므로 탐색적 분석이라고 저자들이 직접 밝힌다
판정기마다 진단용 894건을 추가로 돌린다. 선호 쌍 750개를 순서 뒤집어 한 번 더, 고정 예시 48개에 반복 요청 두 번과 루브릭 바꿔 쓰기 한 번이다.
4. Judges and measurement¶
JEV와 공통 계약¶
JEV는 구조화된 상태, 자연어 지시, 허용 출력 타입을 받는 호스티드 서비스다. 출력 타입은 세 가지다.
- Choice: 지정 라벨들에 대한 확률
- Noul: yes 확률 하나
- Score: 순서 있는 루브릭 등급별 확률
주 실험은 요청당 Choice 질문 하나를 보낸다. 수집 시점 요금은 입력 100만 토큰당 $0.042, 출력 무료였다.
JEV는 자체 confidence 값도 주는데, 최대 라벨 확률과의 Spearman 상관이 0.971 / 0.999 / 0.948(RewardBench / JudgeBench / HaluEval)이라 논문 전체에서 q = max_k p_k를 확신도로 쓴다.
비교 판정기¶
호스티드 13종(JEV 포함)과 로컬 4종, 합계 17개 구성이다.
- 호스티드: GPT-4.1 mini, 4.1, 5.2, 5.4, 5.6 Sol, 6 Astra, GPT-OSS 120B, Qwen3.6·3.8 27B(Groq), Claude Sonnet 5, Gemini 3 Flash, 3.1 Pro
- 로컬: Qwen3-32B, Qwen3.5-27B(H100, vLLM, 비사고 모드), PairRM, Skywork-Reward-V2-Qwen3-8B
생성형 판정기에도 JEV와 같은 지시와 상태를 주고, 근거 설명 없이 판정과 라벨 확률만 JSON으로 받는다. 이들의 확률은 말로 추정한 값이다. 추론 모델은 낮은 effort로 돌렸고, 그 차이는 요금·지연 측정에 그대로 반영된다.
유효성과 지표¶
- 스키마, 라벨 소속, 유한 확률, 합 허용오차 0.025, 판정과 argmax 일치를 검사한다
- 무효 출력은 정확도에서 오답으로 센다. 확률 지표는 유효 출력만으로 계산하되 분모를 따로 보존한다
- 재시도는 전송 실패에만 최대 3회, 더 나은 답을 얻으려는 재실행은 없다
- 지표: 정확도, macro-F1, 다중 클래스 Brier, NLL(하한 10⁻⁶), 10구간 ECE, 오류 탐지 AUROC(오답을 양성, 1−q를 점수로)
- 차이 비교는 원문 질문 단위 클러스터 부트스트랩 2,000회
지연과 요금¶
대량 실행의 타이밍은 클라이언트 경합이 있어 쓰지 않는다. 대신 120건 고정 패널(과제당 40건)을 모델 그룹 하나씩, 워커 8개, 최소 시작 간격 0.12초로 돌린다. 요금은 보고된 사용량과 수집 시점 가격으로 계산하고, 사용량이 빠진 경우 0이 아니라 보수적 예약값을 청구한다. 모든 금액은 추정치이며 청구서가 아니다.
5. Quality and operational trade-offs¶
기본 정확도 (Table 1 발췌)¶
| 판정기 | RewardBench | JudgeBench | HaluEval | 기존 라벨 |
|---|---|---|---|---|
| JEV 1.13 | 92.2 | 78.6 | 87.5 | 94.0 |
| GPT-4.1 mini | 89.0 | 64.0 | 86.2 | 84.0 |
| GPT-5.6 Sol | 93.2 | 93.1 | 89.2 | 95.3 |
| GPT-6 Astra | 93.5 | 93.1 | 86.7 | 96.7 |
| Claude Sonnet 5 | 91.2 | 88.9 | 85.8 | 94.7 |
| Gemini 3.1 Pro | 94.5 | 87.4 | 87.1 | 94.7 |
| Qwen3.8 27B | 93.8 | 74.3 | 87.9 | 95.3 |
| PairRM (로컬) | 68.0 | 54.3 | – | – |
Skywork는 본문 기준 RewardBench 94.0, JudgeBench 71.1이다.
일반 선호와 근거 기반 사실성¶
RewardBench에서 JEV 92.2% 대 GPT-6 93.5%(차이 −1.25, 95% 구간 [−3.8, 1.5]), HaluEval에서 87.5% 대 86.7%(+0.83)다.
벤치마크 라벨을 그대로 믿지 않고, 두 판정기의 정오가 갈린 문항을 저자 한 명이 라벨과 판정 결과를 가린 채 재판정했다. 결과는 GPT-6 쪽으로 기운다.
- RewardBench 불일치 29건: GPT-6 편 17, JEV 편 5, 판정 불가 7 → 사람 기준 차이 −3.0
- HaluEval 불일치 10건: GPT-6 편 8 → 사람 기준 차이 −2.5
- HaluEval에서 두 판정기가 모두 틀린 26건 중 24건은 라벨 자체가 근거와 맞지 않았다. 라벨을 고치면 JEV 95.8%, GPT-6 98.3%
HaluEval의 동률은 상한 근처 라벨 잡음 탓이 크다. 두 라벨 기준 모두에서 살아남는 결론은 JEV가 GPT-6와 3%p 안쪽이라는 것이다.
어려운 정답 판정¶
JudgeBench에서 판정기들이 갈린다. JEV 78.6% 대 GPT-5.6·GPT-6 93.1%, 차이 −14.6([−18.9, −10.3]).
- 추론 68.4% 대 95.9%, 코딩 76.2% 대 97.6%로 가장 벌어지고, 지식은 84.4% 대 90.9%로 가장 좁다
- 라벨 잡음이 아니다. 사람 재판정이 69건 중 57건에서 GPT-6 편, JEV 편은 1건. 추론·코딩·수학은 27:0, 9:0, 7:0
기존 라벨과 대조군¶
기존 라벨 150건에서 JEV 94.0%(macro-F1 0.923), GPT-6 96.7%(0.947). 대조군은 포화됐다. 15개 구성 중 14개가 GSM8K 108/108, 합성 근거 64/64다. 기본 처리 능력만 확인할 뿐 변별력은 거의 없다.
더 어려운 선택과 답변 문체¶
- RewardBench 2 4지선다 100건: JEV 73.0% 대 GPT-6 75.0%
- RM-Bench: 두 답의 문체가 같으면 JEV 84.0%, 오답 쪽이 더 공들여 쓰였으면 74.8%(−9.2). GPT-6는 93.3% → 94.6%로 오히려 오른다. 어려운 쌍에서 격차는 −19.8
정답을 고르는 능력과 그럴듯한 문체에 넘어가지 않는 능력은 별개라는 것이 저자들의 정리다.
답 형식과 정답을 가린 추출¶
- 객관식 응답을 정답과 직접 대조하는 방식과, 정답을 안 보여주고 선택지만 뽑은 뒤 코드로 비교하는 방식을 비교했다. JEV는 91.3% → 86.0%로 오히려 떨어졌고 GPT-4.1 mini는 87.3%로 같았다. 추출 방식은 애매 판정이 늘고 결과를 들여다보기 쉬워질 뿐, 일치율 이득은 없다
- 같은 HaluEval 40문항을 객관식과 자유 응답으로 바꿔 보면 JEV가 100.0% → 92.5%(−7.5)
근거 유무에 따른 자연어 산문¶
| 판정기 | 문서 기반 요약 80건 | 참조 없는 일반 응답 80건 |
|---|---|---|
| JEV | 71.2 | 52.5 |
| GPT-4.1 mini | 62.5 | 53.8 |
| GPT-5.4 | 72.5 | 55.0 |
참조가 없으면 셋 다 찍기 수준인데 확신도는 높다. 평균 최대 확률이 0.90 / 0.95 / 0.96이고 JEV의 오류 탐지 AUROC는 0.518이다.
유효 판정 자체가 별도 지표¶
JEV는 모든 기본 문항에서 계약을 지켰다. 제약 생성을 쓴 생성형 판정기 여럿도 마찬가지라 유효성이 네이티브 타입 인터페이스만의 장점은 아니다. 실패는 제공자 쪽 생성 오류, HTTP 200인데 계약 위반, 전송 실패로 나뉜다. Qwen3.6 27B는 1,312건 중 1,206건만 유효했다. 실패한 호출은 추론 오류는 아니지만 판정도 아니다.
지연과 요금 실측¶
| 판정기 | 중앙값 지연 | 1,000건당 요금 |
|---|---|---|
| JEV | 0.152초 | $0.044 |
| GPT-4.1 mini | 0.548초 | $0.390 |
| GPT-6 Astra | 1.885초 | $12.182 |
이 작업 기준으로 GPT-4.1 mini보다 약 9배, GPT-6보다 약 277배 싸다. 초록의 "요금 0.36%"가 이 비율이다.
운영 범위 (Table 2)¶
| 작업 | JEV | 가장 강한 비교 대상 | 차이 | 저자 권고 |
|---|---|---|---|---|
| 일반 선호 (RewardBench) | 92.2 | GPT-6 93.5 | −1.3 | JEV 사용 |
| 근거 기반 사실성 (HaluEval) | 87.5 | GPT-6 86.7 | +0.8 | JEV 사용 |
| 최종 답 판정 (기존 라벨) | 94.0 | GPT-6 96.7 | −2.7 | JEV 사용 |
| 어려운 정답 (JudgeBench) | 78.6 | GPT-6 93.1 | −14.6 | 상위 판정기로 |
| 문체 함정 쌍 (RM-Bench hard) | 74.8 | GPT-6 94.6 | −19.8 | 상위 판정기로 |
| 같은 문체 쌍 (RM-Bench normal) | 84.0 | GPT-6 93.3 | −9.4 | 상위 판정기로 |
| 4지선다 (RewardBench 2) | 73.0 | Skywork 79.0 | −6.0 | 먼저 검증 |
| 근거 기반 요약 | 71.2 | GPT-5.4 72.5 | −1.2 | 먼저 검증 |
| 참조 없는 산문 | 52.5 | GPT-5.4 55.0 | −2.5 | 지원 안 됨 |
1,000건당 $1 미만 호스티드 판정기 중에서 JEV는 JudgeBench 1위, HaluEval 공동 1위, RewardBench 1위와 0.6%p 차다. 답 형식(객관식 대 자유 응답)이 설명하는 격차 7.5%p는 작업 종류 간 격차보다 훨씬 작다.
6. Stability and probability quality¶
반복 요청과 후보 순서¶
- 같은 요청 96번 반복: 판정 변화 0건. 루브릭 바꿔 쓰기 48건: 4건 변화
- 순서 뒤집기: RewardBench 3.25%, JudgeBench 11.14%의 판정이 바뀐다. 두 순서 모두 맞힌 비율은 91.0%, 74.0%
- 첫 번째 위치를 고른 비율이 48.9%, 48.4%라 위치 편향은 아니다. JudgeBench 불일치 39쌍 중 14쌍은 항상 첫 번째, 25쌍은 항상 두 번째를 골랐다
정확도 순위와 불확실성 순위는 다르다¶
| RewardBench | JudgeBench | HaluEval | |
|---|---|---|---|
| JEV Brier | 0.111 | 0.297 | 0.176 |
| GPT-6 Brier | 0.104 | 0.095 | 0.245 |
| JEV 오류 탐지 AUROC | 0.869 | 0.745 | 0.863 |
| GPT-6 오류 탐지 AUROC | 0.891 | 0.907 | 0.899 |
- GPT-6는 어려운 비교에서 더 정확하고 보정도 좋지만, 근거 기반 사실성에서는 JEV 확률이 더 낫다
- q ≥ 0.9에서 HaluEval 오답이 JEV 199건 중 10건, GPT-6 233건 중 28건이다
- 그런데 HaluEval 오류 순위 매기기(AUROC)는 GPT-6가 더 낫다. 보정과 오류 순위는 다른 성질이다
온도 스케일링은 옮겨지지 않는다¶
선택 집합에서 맞춘 온도가 확장 집합에서 고르게 통하지 않는다. HaluEval NLL은 0.333 → 0.284로 좋아졌지만 JudgeBench 0.449 → 0.475, RewardBench 0.205 → 0.232로 나빠졌다. 맞춘 온도도 0.65(RewardBench를 날카롭게), 2.15와 4.45(JudgeBench·HaluEval을 무디게)로 방향이 반대다. 하나의 온도로는 안 되고 작업마다 따로 검증해야 한다.
같은 뜻의 인터페이스도 어긋난다¶
48건 감사에서 Choice와 Noul, 이진 Score의 확률이 서로 다르다. Choice와 Noul의 평균 차이 0.055, Noul 여집합 잔차 평균 0.045, 판정 불일치 1건.
7. Error complementarity and deferral¶
비싼 판정기는 1차 판정기의 오류를 고칠 때만 돈값을 한다. JudgeBench에서 GPT-6는 JEV 오류 75건 중 60건을 고치고, JEV는 GPT-6 오류 24건 중 9건을 고친다. 라벨을 아는 오라클 합집합은 95.7%다. 실제 배치에서는 판정 시점에 쓸 수 있는 신호로 오류를 찾아야 하고, 그 신호가 q다.
확신도가 오류를 정렬한다¶
990건 기본 판정을 q 구간별로 나누면 정확도가 단조 증가한다.
| q 구간 | 문항 수 | JEV 정확도 |
|---|---|---|
| < 0.6 | 65 | 47.7% |
| [0.7, 0.8) | 85 | 76.5% |
| [0.95, 0.99) | 147 | 93.9% |
| = 1 | 322 | 99.1% |
같은 문항에서 GPT-6는 78.5%에서 99.1%로만 움직인다. GPT-6의 우위는 JEV가 불확실한 곳에 몰려 있다. q ≥ 0.9인 문항에서는 둘이 거의 같고(95.8% 대 96.5%), 넘길 문항에서는 GPT-6가 15%p 앞선다(67.9% 대 82.6%).
단일 순서 단계 호출 (사후 분석)¶
q ≥ τ면 JEV 판정을 받고 아니면 GPT-6를 부른다.
- τ = 0.9, 세 과제 합산: 34%를 넘기고 91.3% 대 GPT-6 단독 91.7%(99.6% 유지), 요금은 GPT-6의 47%, 1,000건당 약 $6.3
- 같은 34%를 무작위로 넘기면 88.1%, 오라클이면 94.4%. q가 얻을 수 있는 이득의 절반을 잡는다
- RewardBench에서는 단계 호출이 GPT-6 단독보다 낫다(94.0% 대 93.5%, 요금 22%). 둘이 틀리는 문항이 달라서다
- JudgeBench는 평균 q가 0.81이라 같은 임계값에서 61%를 넘기고 98.2% 유지, 요금 62%
- HaluEval은 어떤 임계값도 라벨 기준 정확도를 못 움직인다. 확신도가 낮은 문항이 대체로 라벨이 틀린 문항이라서다. 사람 교정 라벨로는 τ = 0.8에서 11%만 넘기고 GPT-6의 98.3%와 같아진다(요금 13%)
- 상위 판정기가 꼭 가장 비쌀 필요는 없다. GPT-5.6으로 넘기면 91.9%, 1,000건당 약 $3.4
이 임계값들은 채점하는 문항에서 직접 고른 것이라 낙관적이다. 아래 동결 정책이 사전 명시된 검증이다.
두 순서 동결 정책¶
쌍마다 두 순서로 판정하고 같은 응답 기준으로 맞춘 확률을 평균한다.
임계값은 파일럿 선택 집합 96쌍에서, 선택 집합 정확도가 상위 판정기와 2%p 안쪽인 범위에서 수용률을 최대화하도록 골랐다. 무효 출력은 항상 넘긴다. 확장 집합 510쌍에서 평가한다.
| 상위 판정기 | τ | 수용률 | 단계 호출 | 상위 단독 | 차이 | 요금 비율 (보고 / 보수) |
|---|---|---|---|---|---|---|
| GPT-5.4 | 0.90 | 53.7% | 91.4 | 91.6 | −0.2 | 0.639 / 1.096 |
| GPT-5.6 Sol | 0.70 | 81.0% | 91.0 | 93.3 | −2.4 | 0.288 / 0.380 |
| GPT-6 Astra | 0.90 | 53.7% | 92.5 | 93.1 | −0.6 | 0.568 / 0.622 |
- GPT-6 정책이 결론의 "99% 정확도, 57% 요금"이다
- 규칙이 항상 옮겨지지는 않는다. GPT-5.6 정책은 81%를 받아들이지만 2%p 허용치를 넘겨 2.35%p를 잃는다. τ = 0.5 정책 셋은 상위 판정기를 전혀 부르지 않고 순서 평균만 하는 꼴이 됐다
- GPT-5.4의 보수 요금 비율이 1을 넘는 것은 빠진 사용량을 예약값으로 청구했기 때문이다
신호가 약해지는 곳¶
단계 호출은 JEV가 틀리는 곳에서 불확실해야 통한다. 그 조건은 운영 범위 안에서만 성립한다.
- RM-Bench q의 AUROC: 쉬운 쌍 0.918, 보통 쌍 0.902, 어려운 쌍 0.770
- 어려운 쌍에서 JEV는 q가 [0.9, 0.95)인 문항의 3분의 1, [0.95, 0.99)인 문항의 15%를 틀린다
- τ = 0.9로 GPT-6에 넘기면 어려운 쌍에서 96.5%만 유지된다(90.8% 대 94.2%). 98.7%까지 가려면 τ = 0.95에 58%를 넘겨야 한다
- 참조 없는 산문은 AUROC 0.518이라 어떤 임계값도 소용없다
확신도는 1차 판정기가 유능하지만 불확실한 곳에서는 잘 가르고, 확신에 차서 속는 곳에서는 못 가른다.
8. Conclusion¶
일반 선호, 근거 기반 사실성, 최종 답 판정에서는 JEV로 충분하다. 도출 과정을 검산해야 하거나 공들여 쓴 오답을 걸러야 하면 넘기고, 참조 없는 산문 채점은 어떤 판정기에도 맡기지 않는다.
저자들이 남긴 점검 목록이다.
- 선호 쌍은 두 순서로 판정하고 맞춘 확률을 평균한다
- 넘김 임계값은 로컬 선택 집합에서 고르고 별도 문항에서 다시 확인한다
- 판정기를 비교할 때 무효 출력을 오답으로 센다
- 확신도는 넘김 신호이지 보증서가 아니다. 문체 함정 쌍에서 확인하고 온도는 작업마다 검증한다
- 새 작업으로 범위를 넓히기 전에 작은 로컬 검증부터 돌린다
쓸 수 있는 판정, 맞는 판정, 믿을 수 있는 불확실성은 서로 다른 세 가지이고 각각 확인해야 한다.
Limitations (원문)¶
- 비공개 JEV 한 버전을 고른 구성들과 비교했다. 학습 데이터 중복과 벤치마크 오염 여부는 모른다
- 추론 effort, 모델 크기, 컨텍스트 한도, 서빙 방식이 모두 달라 연산량을 맞춘 구조 비교가 아니다
- 판정만 받는 프롬프트라 생성된 설명, 설명의 충실도, 긴 숙고는 다루지 않는다
- 확장 비교는 원 연구 결과를 본 뒤 진행한 탐색적 분석이다
- 사람 재판정 183건은 판정 불일치로 고른 문항이지 무작위 감사가 아니다. 작성자 한 명이 전부 판정했고, 그 사람은 집계 결과를 본 저자다. RewardBench에서 사람과 LLM 평가자의 κ는 0.29
- 지연은 한 지역, 한 수집 기간 기준이고 120건 패널로는 꼬리 지연 추정이 약하다. 시뮬레이션한 단계 호출 요금은 실제 순차 지연을 말해주지 않는다
읽을 때 감안할 것¶
- 상용 서비스 하나를 평가한 논문이다. JEV는 구현이 비공개인 호스티드 서비스이고, 주요 수치가 그 서비스의 특정 버전(1.13.0)과 수집 시점 가격에 묶여 있다. 저자와 TypeSafe AI의 관계는 논문에 적혀 있지 않다(감사의 글에는 NIST, CMU, OpenAI API 크레딧만 있다). 버전이나 가격이 바뀌면 "277배 저렴"도 그대로 남지 않는다.
- "99% 유지, 57% 요금"과 "99.6% 유지, 47% 요금"은 다른 실험이다. 앞의 것은 두 순서 동결 정책(확장 510쌍, 선호 과제만), 뒤의 것은 채점 문항에서 임계값을 고른 단일 순서 사후 분석(세 과제 990건)이다. 인용할 때는 앞의 것을 써야 한다. 두 순서 정책은 쌍마다 JEV를 두 번 부르고, 요금 비율에도 그 두 번 호출이 들어가 있다.
- 단계 호출이 통하는 범위가 실제로는 좁다. 저자 권고가 "JEV 사용"인 작업은 9개 중 3개이고, 어려운 정답 판정·문체 함정·참조 없는 산문처럼 판정기가 가장 필요한 곳에서는 넘기거나 쓰지 말라고 결론 낸다. 문체 함정 쌍에서는 q의 AUROC가 0.77로 떨어진다. 확신에 차서 틀리는 영역은 q로 걸러지지 않는다.
- 사람 재판정은 한 명, 그것도 저자다. 라벨 교정 결과(HaluEval 24/26건이 라벨 오류 등)가 결론을 받치는 데 쓰이지만, 판정자 간 합의를 거치지 않은 한 사람의 판단이다. 저자들도 민감도 분석으로만 쓴다고 선은 그어 두었다.
- 비교 판정기에 근거 설명을 금지했다. 생성형 판정기는 설명 없이 판정과 확률만 내라는 계약을 받았고 낮은 effort로 돌았다. 추론을 충분히 쓰게 하면 GPT 계열의 정확도와 확률 품질이 달라질 수 있지만, 그만큼 요금도 오른다. 이 논문에 나온 GPT-6 요금은 "낮은 effort, 설명 없음" 설정 기준이다.
- 요금은 청구서가 아닌 추정이다. 사용량이 빠진 호출은 보수적 예약값으로 채웠다. 로컬 모델에는 API 환산 가격도 없다.
- Table 1 캡션은 Skywork 행이 있다고 하는데, 텍스트 추출본에서는 그 행이 보이지 않는다. 그래서 이 정리의 Skywork 수치(94.0, 71.1)는 본문 5절에서 옮겼고, PDF 렌더링은 직접 확인하지 못했다.
가져갈 지점¶
- 판정기 출력에서 판정과 확신도를 분리해 쓰는 구조
판정은 후보 결론, 확신도는 "이 결론을 받을지 넘길지" 정하는 게이트다. 평가 파이프라인을 설계할 때는 판정기 하나의 정확도보다 확신도 구간별 정확도 표를 먼저 그려 본다. 단계 호출이 가능한 작업인지 거기서 바로 보인다. 구간별 정확도가 단조 증가하지 않으면 단계 호출은 고려할 이유가 없다.
- 정확도, 보정, 오류 순위는 세 가지 다른 성질이다
GPT-6가 HaluEval에서 Brier는 더 나쁜데 AUROC는 더 좋았다. 넘김 게이트에는 주로 오류 순위(AUROC)가 필요하고, 확률값을 그대로 쓰려면 보정(Brier, ECE)까지 갖춰야 한다. Logits as Confidence 노트와 Know When You're Wrong 노트가 다룬 logprob 신뢰도 문제를 판정기 쪽에서 다시 확인한 셈이다.
- 임계값과 온도는 작업마다 다시 맞춘다
한 작업에서 맞춘 온도가 다른 작업에서는 반대 방향으로 움직였고, 동결 임계값도 상위 판정기에 따라 허용치를 넘겼다. 선택 집합과 평가 집합을 원문 질문 단위로 나누고, 적합에 쓴 데이터로 채점하지 않는 동결 순서를 그대로 가져갈 만하다. Conformal LM 노트가 보장을 거는 쪽이라면 이 논문은 보장 없이 실측으로 확인하는 쪽이다.
- 무효 출력을 오답으로 센다
판정기 비교에서 실패한 호출을 빼고 정확도를 계산하면 불안정한 모델이 좋아 보인다. Qwen3.6 27B는 유효 출력만 보면 RewardBench 93.3%지만 전체 기준으로는 87.0%다. 분모를 두 개 유지하는 규칙은 단순하지만 중요하다.
- 두 순서 평균으로 순서 민감도를 흡수
쌍 비교 판정기는 순서를 뒤집으면 판정이 바뀐다(JudgeBench 11%). 위치 편향이 아니어도 그렇다. 두 순서 확률을 같은 응답 기준으로 맞춰 평균하면, 식 하나로 게이트 입력이 안정된다. llm-as-a-verifier 노트의 logprob 기반 채점에도 같은 처리를 붙일 수 있다.
결론¶
이 논문은 새 방법이 아니라 운영 기록이다. "싼 판정기를 먼저 쓰고 불확실한 것만 비싼 판정기로 넘긴다"는 발상 자체는 FrugalGPT 이후 익숙하다. 이 논문의 값어치는 그 발상이 어느 작업에서 통하고 어느 작업에서 안 통하는지를 동결 절차와 실측 요금으로 선 그어 놓은 데 있다.
실무에서 가져갈 것은 JEV라는 제품보다 점검 목록 다섯 줄과 확신도 구간별 정확도 표를 먼저 그리는 습관이다. 제품 수치는 버전과 가격에 묶여 있어 금방 낡지만, "확신에 차서 틀리는 영역은 확신도로 걸러지지 않는다"는 관찰은 어떤 판정기에도 적용된다.