MXStat
MXStat
Введите текст для поиска
Расширенный поиск каналов
  • Вход на сайт
  • Каталог
    Каталог каналов Региональные подборки Поиск каналов
    Добавить канал
  • Рейтинги
    Рейтинг каналов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Max
Sber AI

21 Sep, 13:45

Открыть в Max Поделиться

00:05
Видео недоступно для предпросмотра
Смотреть в Max
00:05
Видео недоступно для предпросмотра
Смотреть в Max
00:05
Видео недоступно для предпросмотра
Смотреть в Max
00:05
Видео недоступно для предпросмотра
Смотреть в Max
Prev Next
🤖 ЭТО КАК LLM, НОdLLM
ㅤ
Объяснение исчерпывающее, но нам захотелось глубже понять, как оценивать альтернативные архитектуры языковых моделей
ㅤ
Заручились помощью учёных из SberAI и команды AIRI
. Теперь можно отправляться в путь!
ㅤ
ВЫДАЁМ БАЗУ

В отличие от привычных LLM, которые генерируют текст токен за токеном слева направо, dLLM могут восстанавливать несколько токенов параллельно и заполнять пропуски внутри текста. Теоретически это даёт кратное ускорение
ㅤ
ЗАДАЁМ ВОПРОСЫ

Обещания эффективности хороши, но можно ли доверять красивым цифрам? Учёные решили выяснить это на практике: воспроизвели несколько существующих подходов и обнаружили, что опубликованные результаты не всегда удаётся достоверно повторить
ㅤ
НАХОДИМ ОТВЕТЫ

На общий итог влияют гиперпараметры обучения, данные, детали реализации, sampler и даже численная точность вычислений. Некоторые метрики могут создавать иллюзию хорошего результата: например, генеративная перплексия (GenPPL) снижается, когда модель начинает повторять слова и фразы.

Вывод:
для оценки dLLM недостаточно одних только цифр. Необходимо комплексно смотреть на перплексию, разнообразие и энтропию, а в задачах с однозначным ответом проверять и фактическую точность
ㅤ
СОЗДАЁМ РЕШЕНИЯ

Коллеги протестировали собственный метод IDLM — дистилляцию диффузионной модели в короткую траекторию, которая задействует для обучения три модели: учитель, ученик и fake model. Вместо сотен или тысяч шагов генерации модель-ученик учится получать сопоставимый результат за гораздо меньшее число шагов.

Эксперименты на моделях с 169 млн параметров, обученных на OpenWebText с помощью IDLM, показали кратное сокращение шагов:

🤩 SEDD — в 4 раза
🤩 MDLM — в 64 раза
🤩 Duo + DCD — в 128 / 256 раз

Адаптация GigaChat 3B по другому подходу — ReFusion — дала ещё один результат: ускорение реального времени генерации в 2,7 раза и более чем двукратный рост качества на GSM8K
ㅤ
Параллельная генерация действительно открывает новые возможности. Но каждое преимущество необходимо отдельно превращать в работающую технологию.
ㅤ
Подробное расследование коллег — в статье ↖️

786 8
Каталог
Каталог каналов Подборки каналов Поиск каналов Добавить канал
Рейтинги
Рейтинг каналов Max
Контакты
Написать в Max Написать в Telegram Написать на почту
Всякая всячина
Пользовательское соглашение Политика конфиденциальности
Наши каналы
MXStat в Telegram MXStat в Max
Наши боты
MXAuthBot MXAnalyticsBot
Made by TGStat