NVIDIA відкрила вихідний код моделі візуальної локалізації LocateAnything-3B.
NVIDIA відкрила вихідний код моделі візуальної локалізації LocateAnything-3B.
NVIDIA представила відкритий код для моделі візуальної локалізації LocateAnything-3B, яка здатна ефективно знаходити об'єкти в щільних сценах.
NVIDIA відкрила вихідний код моделі візуальної локалізації LocateAnything-3B.
Модель здатна знаходити об'єкти навіть у дуже щільних сценах. Наприклад, на зображенні з десятками міньйонів, які стоять близько один до одного, вона коректно виділяє кожного окремою рамкою.
Головна відмінність від більшості існуючих моделей - це спосіб генерації обмежувальних рамок. Зазвичай координати (x1, y1, x2, y2) передбачаються послідовно, що уповільнює роботу, а помилки на ранніх етапах можуть впливати на наступні координати, особливо якщо об'єктів багато.
У LocateAnything-3B використовується паралельне декодування: модель одразу передбачає готові рамки цілком, а не будує їх поетапно. Це робить детекцію стабільнішою, особливо в сценах з великою кількістю об'єктів.
Модель містить 3 млрд параметрів і поширюється з відкритим вихідним кодом. 💜
Чому це важливо
АналітикаЦя модель може значно покращити точність візуальної локалізації в складних сценах, що є важливим для розробки нових AI-додатків у сфері комп'ютерного зору.
Обговорити новину у спільноті
Діліться своїм досвідом та думками з ШІ-розробниками