Новый дроп от DeepSeek: выложили полностью открытый стек для ускорения генерации LLM
Новый дроп от DeepSeek: выложили полностью открытый стек для ускорения генерации LLM
DeepSeek представила открытый стек для ускорения генерации LLM, включая алгоритмы, обучение и пайплайн для данных. Алгоритм DSpark уже используется в продуктах компании и демонстрирует значительное увеличение скорости генерации.
Внутри готовые алгоритмы, обучение, эвал и даже пайплайн для данных. Бери и пользуйся, супер практично. github.com/deepseek-ai/DeepSpec
Основная суть — в алгоритме DSpark. Его DeepSeek уже использует для DeepSeek-V4 Flash и Pro в продакшене, и, по их данным, относительно старого бейзлайна скорость генерации для пользователя выросла примерно на 60–85%.
Как устроен алгоритм:
– Фундаментально, это небольшая модель, которая пишет черновики для основной LLM. Это называется драфт-модель.
– Такой подход сейчас в моде, но DeepSeek выводят его на новый уровень. Их драфт-модель работает необычно, в два этапа. Сначала параллельно набирается блок токенов, а затем легкий марковский модуль уточняет зависимости между соседними токенами. Благодаря такому подходу драфтер работает быстро и не сильно проседает на длинных хвостах.
– После того, как драфтер набросал черновик, основная LLM его проверяет и принимает только правильный префикс, корректируя остальное. При этом DSpark сам решает, сколько токенов отправить на проверку, основываясь на оценках уверенности по токенам и текущей нагрузке на железо.
В результате получаем ускорение минимум в 1.5 раза абсолютно без потери качества. Снимаем шляпу перед DeepSeek за такой опенсорс.
Почему это важно
АналітикаЭтот новый стек от DeepSeek может значительно улучшить производительность генерации LLM, что важно для разработчиков и исследователей в области искусственного интеллекта. Открытость технологий способствует более быстрому развитию и внедрению инноваций в этой области.
Обсудить в сообществе
Діліться своїм досвідом та думками з ШІ-розробниками