MXStat
MXStat
Введите текст для поиска
Расширенный поиск каналов
  • Вход на сайт
  • Каталог
    Каталог каналов Региональные подборки Поиск каналов
    Добавить канал
  • Рейтинги
    Рейтинг каналов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Max
Нейронавт | Нейросети в творчестве

8 Oct, 12:15

Открыть в Max Поделиться

00:10
Видео недоступно для предпросмотра
Смотреть в Max
00:15
Видео недоступно для предпросмотра
Смотреть в Max
Prev Next
Open-VC Attention

Открытая реализация VC-Attention (возможно, этого) от MachGen для NVIDIA Blackwell. Почти 2× быстрее BF16 FlashAttention-4 на B200 при генерации видео-моделей вроде MiniMax H3. Плюс ещё ~20% к оригинальному методу из статьи.

Как ускоряет
• ExpCast — вероятности softmax считаются без экспоненты, одной FMA-инструкцией
• Поиск максимума в середине окна ключей — меньше рескейлов
• Варп-специализированный конвейер: загрузка, матричные умножения и softmax разнесены по варпам
• Упакованный V в транспонированном виде — тензорные ядра читают непрерывно
• Fusion подготовки входов в CUDA-граф

Вместо V-Smooth из статьи — «V residual repair»: чинит только худшие токены V, что дает почти тот же эффект за меньшую цену. На MiniMax-H3 в 15-сек ролике без ремонта лицо за визором схлопывалось в темную дыру — с ремонтом 0.5% рендерится верно.

github.com/MachGen/open-vc-attention

#optimization

45
Каталог
Каталог каналов Подборки каналов Поиск каналов Добавить канал
Рейтинги
Рейтинг каналов Max
Контакты
Написать в Max Написать в Telegram Написать на почту
Всякая всячина
Пользовательское соглашение Политика конфиденциальности
Наши каналы
MXStat в Telegram MXStat в Max
Наши боты
MXAuthBot MXAnalyticsBot
Made by TGStat