aiposthub.com (by Philo)
ai-engineeringbusiness
Original source

AlphaSense 實測:Context、搜尋與模型路由比模型本身更重要

Summary

AlphaSense(金融研究平台)用 245 道多步驟金融研究題測試多模型,核心發現:企業 AI 瓶頸不在模型能力,而在 Context、搜尋、Harness 與模型路由。

關鍵測試結果(成對比較偏好比)

配置偏好比 vs baseline
換搜尋(向量→AlphaSense Search)1.7:1
+ 最佳單模型1.8:1
+ 完整 Harness(查詢生成、規劃、搜尋分數傳遞)2.1:1
+ 模型路由(依任務選模型)2.8:1

單模型排名(僅限本測試):GPT-5.6 Sol 1.73 > Claude Opus 4.8 1.60 > Kimi K3 1.44 > Gemma 4-31B / Claude Sonnet 5 1.34

核心洞察

  1. Context ≠ Context Window — 能塞多少 ≠ 能用好多少。重要的是「最小但足夠」的證據集合

  2. 搜尋失敗三類:

    • 問題沒轉成正確搜尋條件
    • 語意相似但來源權威性不同(財報 vs 新聞 vs 傳聞)
    • 不知何時停止搜尋(太早或太多都傷)
  3. Token 單價便宜 ≠ 整題便宜 — Kimi K3 單價低但每題成本反而高(用更多 token 組 context);Claude Opus 5 抓太多資料,品質低於 Opus 4.8 且成本高數倍

  4. 模型路由 > 單一最強模型 — 沒有單一模型贏過半題目,不同模型分別擅長數字擷取、篩選、長篇綜合

企業 AI 5 個投資重點

  1. 先建來源層級再談 RAG(官方申報 vs 新聞 vs 傳聞)
  2. 把 Context 當有限預算管理
  3. 用真實任務持續評測(30-100 題)
  4. 依任務路由,不要每題都叫最貴模型
  5. 高頻重複問題預先計算成結構化資料

實際建議順序

固定一個模型 → 整理 30 道真實題 → 加入可追蹤檢索流程 → 比較改搜尋 vs 換模型各帶來多少改善