Tencent представила WeMM-Embedding — мультимодальную модель для обработки запросов
Tencent представила WeMM-Embedding — мультимодальную модель для обработки запросов
Tencent представила новую мультимодальную модель WeMM-Embedding, которая обрабатывает около 1 миллиарда запросов в день. Модель поддерживает текст, изображения и видео, предлагая гибкость в размерности для различных задач.
Tencent открыла WeMM-Embedding — мультимодальную модель, которая уже обрабатывает около 1 миллиарда запросов в день внутри Weixin.
Модель работает с текстом, изображениями и видео и учитывает порядок, в котором они появляются.
Версия на 9B заняла первое место в MMEB-v2 с результатом 80,6.
Младшая версия на 2B сохраняет 98,7% качества даже при размерности 256.
При этом размерность можно уменьшить до 64 для быстрого поиска или увеличить до 2048 для более точного ранжирования — без переобучения модели.
Теперь WeMM-Embedding доступна в открытом доступе.
Почему это важно
АналітикаЭта модель открывает новые возможности для обработки мультимедийных запросов, что может значительно улучшить пользовательский опыт в различных приложениях. Открытый доступ к модели также будет способствовать развитию технологий AI.
Обсудить в сообществе
Діліться своїм досвідом та думками з ШІ-розробниками