Новий дроп від DeepSeek: виклали повністю відкритий стек для прискорення генерації LLM
Новий дроп від DeepSeek: виклали повністю відкритий стек для прискорення генерації LLM
DeepSeek представила відкритий стек для генерації LLM, що включає алгоритм DSpark, який значно підвищує швидкість генерації.
Всередині готові алгоритми, навчання, евал і навіть пайплайн для даних. Бери і користуйся, супер практично. github.com/deepseek-ai/DeepSpec
Основна суть – в алгоритмі DSpark. Його DeepSeek вже використовує для DeepSeek-V4 Flash і Pro в продакшені, і, за їхніми даними, відносно старого бейзлайна швидкість генерації для користувача зросла приблизно на 60–85%.
Як влаштований алгоритм:
– Фундаментально, це невелика модель, яка пише чернетки для основної LLM. Це називається драфт-модель.
– Такий підхід зараз у моді, але DeepSeek виводять його на новий рівень. Їхня драфт-модель працює незвично, в два етапи. Спочатку паралельно набирається блок токенів, а потім легкий марковський модуль уточнює залежності між сусідніми токенами. Завдяки такому підходу драфтер працює швидко і не дуже скидає в хвостах.
– Після того, як драфтер накинув чернетку, основна LLM її перевіряє і приймає тільки правильний префікс, коригуючи решту. При цьому DSpark сам вирішує, скільки токенів відправити на перевірку, базуючись на оцінках впевненості по токенах і поточному навантаженні на залізо.
В результаті отримуємо прискорення мінімум в 1.5 рази абсолютно без втрати якості. Скидаємо капелюха перед DeepSeek за таку опенсорс.
Чому це важливо
АналітикаЦей новий стек від DeepSeek може суттєво змінити підходи до генерації LLM, зменшуючи час обробки без втрати якості, що є критично важливим для розробників та компаній, які працюють у цій сфері.
Обговорити новину у спільноті
Діліться своїм досвідом та думками з ШІ-розробниками