NVIDIA LocateAnything-3B — 視覺定位模型
- URL: https://www.threads.com/@techsundries/post/DaDmEfzAQPN
- Date Saved: 2026-06-27
- Source: Threads
- Tags: ai-tools, ai-engineering
Summary
@techsundries (英伟达) 介紹 NVIDIA 開源的視覺定位模型 LocateAnything-3B。
核心亮點:並行邊界框解碼
傳統 AI 視覺模型生成 bounding box 的方式是逐個數字輸出座標 (x1→y1→x2→y2),像手寫數字一樣順序生成。問題:
- 速度慢
- 早期生成的數字影響後面的,框越多累積誤差越大
LocateAnything-3B 改用並行解碼:一步直接輸出完整檢測框(不是順序生成,是同時生成)。結果:框更穩,密集場景下不亂。
訓練數據範圍廣:
- 不只常規目標檢測
- 還包括 UI 識別、OCR、頁面理解
- 同一個模型可以框實物、界面元素、文字區域
Demo: 幾十個小黃人密密麻麻堆在一起,一個不漏全部框出來。
互動: 3 likes, 1 reply, 4 reposts