Threads
ai-toolsai-engineering
Original source

NVIDIA LocateAnything-3B — 視覺定位模型

Summary

@techsundries (英伟达) 介紹 NVIDIA 開源的視覺定位模型 LocateAnything-3B。

核心亮點:並行邊界框解碼

傳統 AI 視覺模型生成 bounding box 的方式是逐個數字輸出座標 (x1→y1→x2→y2),像手寫數字一樣順序生成。問題:

  • 速度慢
  • 早期生成的數字影響後面的,框越多累積誤差越大

LocateAnything-3B 改用並行解碼:一步直接輸出完整檢測框(不是順序生成,是同時生成)。結果:框更穩,密集場景下不亂。

訓練數據範圍廣:

  • 不只常規目標檢測
  • 還包括 UI 識別、OCR、頁面理解
  • 同一個模型可以框實物、界面元素、文字區域

Demo: 幾十個小黃人密密麻麻堆在一起,一個不漏全部框出來。

互動: 3 likes, 1 reply, 4 reposts