AlphaSense 實測:Context、搜尋與模型路由比模型本身更重要
- URL: https://www.aiposthub.com/alphasense-frontier-ai-context-search-model-routing/
- Date Saved: 2026-08-24
- Source: aiposthub.com (by Philo)
- Tags: ai-engineering, business
Summary
AlphaSense(金融研究平台)用 245 道多步驟金融研究題測試多模型,核心發現:企業 AI 瓶頸不在模型能力,而在 Context、搜尋、Harness 與模型路由。
關鍵測試結果(成對比較偏好比)
| 配置 | 偏好比 vs baseline |
|---|---|
| 換搜尋(向量→AlphaSense Search) | 1.7:1 |
| + 最佳單模型 | 1.8:1 |
| + 完整 Harness(查詢生成、規劃、搜尋分數傳遞) | 2.1:1 |
| + 模型路由(依任務選模型) | 2.8:1 |
單模型排名(僅限本測試):GPT-5.6 Sol 1.73 > Claude Opus 4.8 1.60 > Kimi K3 1.44 > Gemma 4-31B / Claude Sonnet 5 1.34
核心洞察
-
Context ≠ Context Window — 能塞多少 ≠ 能用好多少。重要的是「最小但足夠」的證據集合
-
搜尋失敗三類:
- 問題沒轉成正確搜尋條件
- 語意相似但來源權威性不同(財報 vs 新聞 vs 傳聞)
- 不知何時停止搜尋(太早或太多都傷)
-
Token 單價便宜 ≠ 整題便宜 — Kimi K3 單價低但每題成本反而高(用更多 token 組 context);Claude Opus 5 抓太多資料,品質低於 Opus 4.8 且成本高數倍
-
模型路由 > 單一最強模型 — 沒有單一模型贏過半題目,不同模型分別擅長數字擷取、篩選、長篇綜合
企業 AI 5 個投資重點
- 先建來源層級再談 RAG(官方申報 vs 新聞 vs 傳聞)
- 把 Context 當有限預算管理
- 用真實任務持續評測(30-100 題)
- 依任務路由,不要每題都叫最貴模型
- 高頻重複問題預先計算成結構化資料
實際建議順序
固定一個模型 → 整理 30 道真實題 → 加入可追蹤檢索流程 → 比較改搜尋 vs 換模型各帶來多少改善