Threads (@ryanchou0210)
ai-engineering
Original source

LLM-as-a-Verifier:DeepSeek V4 Flash 自我驗證超越 Claude Code

Summary

Jacky Kwok 展示 DeepSeek V4 Flash 用 LLM-as-a-Verifier 方法在 Terminal-Bench 2.1 達到 88.0%(Best-of-5),超越 Claude Code Fable 5 xhigh 的 83.8%,且成本僅為前沿模型的 1/11。

核心概念

  • 同一模型分兩階段:第一階段 sampling 產生多條候選軌跡,第二階段用驗證器選出最佳結果
  • 瓶頸已從「能不能產生正確解法」移到「能不能辨認哪個解法可行」
  • 理想選擇器可達 98.9%,目前 88.0% 仍有差距

LLM-as-a-Verifier vs LLM-as-a-Judge

  • 傳統 Judge:整數分數 1-5,27% 平手率,壓縮模型的細微差異
  • Verifier:使用更細分數刻度 + 保留 token 完整機率分布,計算期望值得到連續分數
  • 20 級分數時,正確排名 77/100,無平手

Verification Scaling 三個方向

  1. 分數粒度:1→20 級,準確率 73.1%→77.5%
  2. 重複評估:1→16 次再平均,74.7%→77.4%
  3. 評估準則分解:Specification/Output/Errors 分開判斷再合併,78.3%

成本控制:PPT 演算法

  • N 條軌跡兩兩比較需 O(N²)
  • Pivot-based Pairwise Tournament:先環狀賽找 Pivot,再只跟 Pivot 比較,降至 O(Nk)

限制

  • 需要 token-level 評分機率(閉源 API 多不提供)
  • 評估準則靠人工設計,尚無自動學習

啟示

AI 實作方向不只是選模型,而是設計工作流:候選怎麼生成、錯誤怎麼辨認、怎麼選出可交付結果。