arXiv 2511.09803 — TARG: Training-Free Adaptive Retrieval Gating¶
제목: TARG: Training-Free Adaptive Retrieval Gating for Efficient Retrieval-Augmented Generation
베뉴: arXiv (Nov 2025, preprint)
평가 범위: English open-domain QA (NQ-Open, TriviaQA, PopQA, MuSiQue, ASQA) — Wikipedia 기반
핵심 아이디어¶
RAG에서 매 쿼리마다 retrieval을 실행하는 것은 과도하다. 모델의 logit 신호로 "이미 아는 것"을 걸러내 retrieval call을 대폭 줄이자.
동작 방식¶
1. 20-token prefix를 retrieval 없이 생성
2. prefix에 대한 uncertainty score 계산
3. score > threshold τ → retrieval 실행
score ≤ threshold τ → retrieval 생략 (모델 자체 지식 사용)
세 가지 Uncertainty Signal 비교¶
| Signal | 정의 | 주요 특성 |
|---|---|---|
| Margin (top-1/top-2 gap) | p_1 - p_2 |
instruction-tuned 모델에서 판별력 유지 |
| Entropy | −Σ p_i log p_i |
instruction tuning 후 압축되어 판별력 저하 |
| Small-N variance | N=5 prefix 샘플 간 분산 | margin 대비 계산 비용 높음, 예산 극히 제한 시 |
핵심 실험 결과 (Llama-3.1-8B, TriviaQA): - Margin: retrieval 0.1% 유발 (동일 품질) - Entropy: retrieval 52.4% 유발 (동일 품질) → Margin이 entropy보다 ~524× 효율적
Adversarial Fact-Check 결과¶
1. "Training-free" 레이블 — 오해 소지 있음¶
논문에서 "학습 불필요"라고 하지만, threshold τ 결정에 dev set 캘리브레이션이 필요. empirical CDF tuning을 통해 τ를 per-dataset으로 설정해야 한다. → deployment domain마다 레이블된 캘리브레이션 데이터 필요
2. "70–90% retrieval reduction" 범위 — cherry-picked¶
| Dataset | 실제 reduction |
|---|---|
| TriviaQA | 66.2% (70% 미만) |
| NQ-Open | 69.6% (70% 미만) |
| MuSiQue | 98.4% (90% 초과) |
| ASQA | 94% (90% 초과) |
논문 abstract: "up to 90%"라는 표현 사용 (aspirational max, not typical range)
3. "small-NN variance" 명칭 오류¶
논문 원문: small-N variance (N=5 stochastic prefix samples)
NN이 아니라 sample count N=5 의미. Neural network 컴포넌트 없음.
핵심 제약 (논문 내 인정)¶
- OOD query에서 hallucination 위험 증가 — retrieval을 억제할 때
- 평가 범위: English open-domain QA (Wikipedia), Qwen2.5-7B / Llama-3.1-8B만 테스트
- Logit method + OOD shift: OOD 데이터의 entropy/margin 분포가 ID와 통계적으로 구분 불가한 케이스 존재
비교 baseline¶
TARG가 비교 우위를 보인 adaptive RAG 방법들:
- Self-RAG
- FLARE
- CRAG-lite
- SKR
메모¶
Margin > Entropy 주장에 반박하는 2024–2025 논문은 체계적 검색에서 발견되지 않음.
단, 주장의 일반화 범위는 instruction-tuned 7–8B 모델 + English Wikipedia QA로 한정해야 안전.