NVIDIA открыла исходный код модели визуальной локализации LocateAnything-3B.
NVIDIA открыла исходный код модели визуальной локализации LocateAnything-3B.
NVIDIA представила открытый код для модели визуальной локализации LocateAnything-3B, которая способна эффективно находить объекты в плотных сценах.
NVIDIA открыла исходный код модели визуальной локализации LocateAnything-3B.
Модель способна находить объекты даже в очень плотных сценах. Например, на изображении с десятками миньонов, которые стоят близко друг к другу, она корректно выделяет каждого отдельной рамкой.
Главное отличие от большинства существующих моделей - это способ генерации ограничительных рамок. Обычно координаты (x1, y1, x2, y2) предсказываются последовательно, что замедляет работу, а ошибки на ранних этапах могут влиять на последующие координаты, особенно если объектов много.
В LocateAnything-3B используется параллельное декодирование: модель сразу предсказывает готовые рамки целиком, а не строит их поэтапно. Это делает детекцию стабильнее, особенно в сценах с большим количеством объектов.
Модель содержит 3 млрд параметров и распространяется с открытым исходным кодом. 💜
Почему это важно
АналітикаЭта модель может значительно улучшить точность визуальной локализации в сложных сценах, что важно для разработки новых AI-приложений в области компьютерного зрения.
Обсудить в сообществе
Діліться своїм досвідом та думками з ШІ-розробниками