Tencent lanza WeMM-Embedding — un modelo multimodal para el procesamiento de consultas
Tencent lanza WeMM-Embedding — un modelo multimodal para el procesamiento de consultas
Tencent ha presentado WeMM-Embedding, un nuevo modelo multimodal que procesa alrededor de 1 mil millones de consultas diarias. El modelo admite texto, imágenes y video, ofreciendo flexibilidad en la dimensionalidad para diversas tareas.
Tencent ha lanzado WeMM-Embedding — un modelo multimodal que procesa aproximadamente 1 mil millones de consultas por día dentro de Weixin.
El modelo trabaja con texto, imágenes y videos, teniendo en cuenta el orden en que aparecen.
La versión de 9B ocupó el primer lugar en MMEB-v2 con una puntuación de 80,6.
La versión más pequeña de 2B mantiene el 98,7% de calidad incluso con una dimensionalidad de 256.
Además, la dimensionalidad se puede reducir a 64 para una búsqueda rápida o aumentar a 2048 para un ranking más preciso, sin necesidad de volver a entrenar el modelo.
Ahora, WeMM-Embedding está disponible en acceso abierto.
Por qué es importante
АналітикаEste modelo abre nuevas posibilidades para el procesamiento de consultas multimedia, lo que puede mejorar significativamente la experiencia del usuario en diversas aplicaciones. El acceso abierto al modelo también fomentará el desarrollo de tecnologías de IA.
Debatir en la comunidad
Діліться своїм досвідом та думками з ШІ-розробниками