Tencent представила WeMM-Embedding — мультимодальну модель для обробки запитів
Tencent представила WeMM-Embedding — мультимодальну модель для обробки запитів
Tencent представила нову мультимодальну модель WeMM-Embedding, яка обробляє близько 1 мільярда запитів на день. Модель підтримує текст, зображення та відео, пропонуючи гнучкість у розмірності для різних завдань.
Tencent відкрила WeMM-Embedding — мультимодальну модель, яка вже обробляє близько 1 мільярда запитів на день у Weixin.
Модель працює з текстом, зображеннями та відео, враховуючи порядок, в якому вони з'являються.
Версія на 9B зайняла перше місце в MMEB-v2 з результатом 80,6.
Молодша версія на 2B зберігає 98,7% якості навіть при розмірності 256.
При цьому розмірність можна зменшити до 64 для швидкого пошуку або збільшити до 2048 для більш точного ранжування — без переобучення моделі.
Тепер WeMM-Embedding доступна в відкритому доступі.
Чому це важливо
АналітикаЦя модель відкриває нові можливості для обробки мультимедійних запитів, що може суттєво покращити користувацький досвід у різних додатках. Відкритий доступ до моделі також сприятиме розвитку технологій AI.
Обговорити новину у спільноті
Діліться своїм досвідом та думками з ШІ-розробниками