LLM-as-a-Verifier:DeepSeek V4 Flash 自我驗證超越 Claude Code
- URL: https://www.threads.com/share/BALnGEYC7y/
- Date Saved: 2026-08-20
- Source: Threads (@ryanchou0210)
- Tags: ai-engineering
Summary
Jacky Kwok 展示 DeepSeek V4 Flash 用 LLM-as-a-Verifier 方法在 Terminal-Bench 2.1 達到 88.0%(Best-of-5),超越 Claude Code Fable 5 xhigh 的 83.8%,且成本僅為前沿模型的 1/11。
核心概念
- 同一模型分兩階段:第一階段 sampling 產生多條候選軌跡,第二階段用驗證器選出最佳結果
- 瓶頸已從「能不能產生正確解法」移到「能不能辨認哪個解法可行」
- 理想選擇器可達 98.9%,目前 88.0% 仍有差距
LLM-as-a-Verifier vs LLM-as-a-Judge
- 傳統 Judge:整數分數 1-5,27% 平手率,壓縮模型的細微差異
- Verifier:使用更細分數刻度 + 保留 token 完整機率分布,計算期望值得到連續分數
- 20 級分數時,正確排名 77/100,無平手
Verification Scaling 三個方向
- 分數粒度:1→20 級,準確率 73.1%→77.5%
- 重複評估:1→16 次再平均,74.7%→77.4%
- 評估準則分解:Specification/Output/Errors 分開判斷再合併,78.3%
成本控制:PPT 演算法
- N 條軌跡兩兩比較需 O(N²)
- Pivot-based Pairwise Tournament:先環狀賽找 Pivot,再只跟 Pivot 比較,降至 O(Nk)
限制
- 需要 token-level 評分機率(閉源 API 多不提供)
- 評估準則靠人工設計,尚無自動學習
啟示
AI 實作方向不只是選模型,而是設計工作流:候選怎麼生成、錯誤怎麼辨認、怎麼選出可交付結果。