NVIDIA lanza el código fuente del modelo de localización visual LocateAnything-3B.
NVIDIA lanza el código fuente del modelo de localización visual LocateAnything-3B.
NVIDIA ha presentado el código abierto para el modelo de localización visual LocateAnything-3B, capaz de identificar objetos de manera efectiva en escenas densas.
NVIDIA ha lanzado el código fuente del modelo de localización visual LocateAnything-3B.
El modelo puede localizar objetos incluso en escenas muy densas. Por ejemplo, en una imagen con docenas de minions de pie cerca uno del otro, destaca correctamente a cada uno con un cuadro delimitador separado.
La principal diferencia con la mayoría de los modelos existentes es el método de generación de cuadros delimitadores. Normalmente, las coordenadas (x1, y1, x2, y2) se predicen secuencialmente, lo que ralentiza el proceso, y los errores en las etapas iniciales pueden afectar a las coordenadas posteriores, especialmente cuando hay muchos objetos.
LocateAnything-3B utiliza decodificación paralela: el modelo predice cuadros delimitadores completos de una vez en lugar de construirlos paso a paso. Esto hace que la detección sea más estable, particularmente en escenas con un gran número de objetos.
El modelo contiene 3 mil millones de parámetros y se distribuye con código fuente abierta. 💜
Por qué es importante
АналітикаEste modelo puede mejorar significativamente la precisión de la localización visual en escenas complejas, lo cual es crucial para desarrollar nuevas aplicaciones de IA en el campo de la visión por computadora.
Debatir en la comunidad
Діліться своїм досвідом та думками з ШІ-розробниками