🤖 ЭТО КАК LLM, НОdLLM
ㅤ
Заручились помощью учёных из SberAI и команды AIRI
. Теперь можно отправляться в путь!
ㅤ
Параллельная генерация действительно открывает новые возможности. Но каждое преимущество необходимо отдельно превращать в работающую технологию.
ㅤ
Подробное расследование коллег — в статье ↖️
ㅤ
Объяснение исчерпывающее, но нам захотелось глубже понять, как оценивать альтернативные архитектуры языковых моделейㅤ
Заручились помощью учёных из SberAI и команды AIRI
. Теперь можно отправляться в путь!
ㅤ
ВЫДАЁМ БАЗУㅤ
В отличие от привычных LLM, которые генерируют текст токен за токеном слева направо, dLLM могут восстанавливать несколько токенов параллельно и заполнять пропуски внутри текста. Теоретически это даёт кратное ускорение
ЗАДАЁМ ВОПРОСЫㅤ
Обещания эффективности хороши, но можно ли доверять красивым цифрам? Учёные решили выяснить это на практике: воспроизвели несколько существующих подходов и обнаружили, что опубликованные результаты не всегда удаётся достоверно повторить
НАХОДИМ ОТВЕТЫㅤ
На общий итог влияют гиперпараметры обучения, данные, детали реализации, sampler и даже численная точность вычислений. Некоторые метрики могут создавать иллюзию хорошего результата: например, генеративная перплексия (GenPPL) снижается, когда модель начинает повторять слова и фразы.
Вывод: для оценки dLLM недостаточно одних только цифр. Необходимо комплексно смотреть на перплексию, разнообразие и энтропию, а в задачах с однозначным ответом проверять и фактическую точность
СОЗДАЁМ РЕШЕНИЯㅤ
Коллеги протестировали собственный метод IDLM — дистилляцию диффузионной модели в короткую траекторию, которая задействует для обучения три модели: учитель, ученик и fake model. Вместо сотен или тысяч шагов генерации модель-ученик учится получать сопоставимый результат за гораздо меньшее число шагов.
Эксперименты на моделях с 169 млн параметров, обученных на OpenWebText с помощью IDLM, показали кратное сокращение шагов:
🤩 SEDD — в 4 раза
🤩 MDLM — в 64 раза
🤩 Duo + DCD — в 128 / 256 раз
Адаптация GigaChat 3B по другому подходу — ReFusion — дала ещё один результат: ускорение реального времени генерации в 2,7 раза и более чем двукратный рост качества на GSM8K
Параллельная генерация действительно открывает новые возможности. Но каждое преимущество необходимо отдельно превращать в работающую технологию.
ㅤ
Подробное расследование коллег — в статье ↖️