Нейронавт | Нейросети в творчестве


Гео и язык канала: Россия, Русский
Категория: Технологии


Канал про нейросети в компьютерной графике, в кино и вообще
ТГ: https://telegram.me/GreenNeuralRobots

Связанные каналы

Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика

AutoClip

Еще один инструмент для монтажа, нарезает длинные видео на клипы. Подкаст, интервью или лекцию превращает в короткие ролики под соцсети

• Авто-нарезка на клипы с субтитрами, обложкой и текстом поста
• Адаптация под Douyin, TikTok, Reels, YouTube Shorts
• Кадр следует за говорящим
• До 10 готовых клипов на ролик
• Файл или ссылка на YouTube/Bilibili

• Монтаж и рендер локально, анализ модель на выбор
• Часовое видео — 10 клипов за 7-30 минут на M-серии Mac
• Десктоп, веб, CLI/MCP

MIT, платишь только за модели по своему ключу. v1.5.0 добавила десктоп, #CLI и #MCP

#videoediting #agent


Tesseract by Mirage

Видеоредактор для ИИ-агентов. Агент монтирует видео, делает моушен-графику и дизайн в проекте Premiere или After Effects. В итоге получаешь редактируемый проект

• Агент монтирует видео и анимацию по брифу и референсам
• Редактируемые слои: текст, фигуры, маски, ключевые кадры, adjustment layers
• Правка одного элемента без пересоздания всего проекта
• Импорт/экспорт проектов Premiure Pro и After Effects
• Превью до финального рендера, правки по ходу работы
• Экспорт в 4K 60 fps

Важные параметры
• Нативное ядро для macOS, Windows, Linux
• Работает с любым агентом: ChatGPT, Claude, Muse, Grok Bot, Instinct
• Локальный движок бесплатный, подписка агента отдельно
• Без Adobe-подписки

Тот же движок, что питает Captions (миллионы видео). Не генерирует футаж и аватары — только редактирует существующее и делает графику. Конвертация Adobe частичная, экспорт After Effects экспериментальный

mirage.app/tesseract/converters

#videoediying #plugin


Youtu-Parsing-Omni

Компактная омнимодальная парсинг-модель от Tencent: один 5B трансформер превращает в структурированный JSON почти что угодно — документ, картинку, график, чертеж, аудио и видео.

• Парсинг документов: лейаут, текст, таблицы, формулы, порядок чтения
• Картинки, графики, блок-схемы, геометрические фигуры
• Аудио: ASR, спикеры, сцены, акустические события
• Видео: кадры, OCR+ASR, отчёт о клипе
• Один унифицированный JSON-конверт для семи семейств задач
• Распознавание химструктур (ChemOCR) и нот (PDMX)

• 5B параметров, один энкодер на все модальности
• #SOTA на OmniDocBench v1.6 (96.96)
• Лучшая опенсорс на OmniParsingBench (75.08), после Gemini-3-Pro
• vLLM-плагин для быстрого сервинга

github.com/TencentCloudADP/youtu-parsing
learn2play.fun

#omnimodal #multimodal #any2json #vlm #alm


Видео недоступно для предпросмотра
Смотреть в Max
PAMI

Генерация взаимодействий человека с объектами по тексту и мешу объекта. Из фразы вроде «возьми штатив, перенеси и поставь обратно» получается анимированное движение тела плюс точная траектория объекта. Тюбинген + MPI.

• Полное тело + объект, скоординированные во времени
• Часть-якорное голосование: движение объекта привязывается к частям тела (корпус, запястья, лодыжки)
• Точный контакт рук с объектом — без дрейфа, проваливания и «парящих» предметов
• Рекурсивный рефайнер доводит геометрию контакта, сенсоры ближнего и дальнего действи

Код ждем

#HOI #animation


SynthID Detector

Google открыл всем детектор для проверки картинок и видео на ИИ. Раньше SynthID был доступен только избранным партнёрам и инструментам Google, теперь попробовать может любой.

#detection #watermark


#humor


Видео недоступно для предпросмотра
Смотреть в Max
LIFT

Фреймворк для контролируемой генерации видео. Добавляет к управлению камерой контроль будущего лейаута: ты задаешь, что и где появится в финальном кадре.

• Задаешь траекторию камеры + лейаут финального кадра рамками и подписями
• Видео идет от первого кадра к заданному последнему, следуя камере
• Работает при больших сменах ракурса, когда камера открывает невидимые в начале области
• Боксы объектов в последнем кадре как явный сигнал управления
• Два режима: только камера / камера + лейаут

Гитхаб
HF
Демо

#t2v #cameracontrol #layoutcontrol


Видео недоступно для предпросмотра
Смотреть в Max
ROME (Building Rome from a Single Image)

Метод от Applied Intuition + университетов

• Из одного фото — детальный 3D-меш всей сцены
• Завершает геометрию за пределами того, что видно на снимке
• Интерактивное измерение расстояний в метрах прямо во вьюере
• Сравнивалось с World Tracing, GenRecon, VolFill, Lyra 2.0

• Адаптивные чанки: мелкие вблизи, крупные для дальних зданий
• Автогрессивная генерация — соседние чанки переиспользуют латенты, геометрия согласованна
• 2D-3D кондиционирование: каждый воксель знает, свободен он, видим или скрыт

В веб-вьювере меши упрощены до ~1.5M граней, в статье и видео — полное разрешение

Код ждем

#scenereconstruction #imageto3d #image2mesh


Iris-3B

Генератор картинок от Sperid Labs, который рисует каждый пиксель напрямую — без VAE и латентного пространства. Prompt → 1024px картинка, ничего не теряется в сжатом латенте.

• Генерация изображений из текста напрямую в пиксели
• Монокулярная оценка глубины
• Реставрация и апскейл изображений
• Все на одном бэкбоне без изменения архитектуры, просто финтюн под задачу

• 3B параметров + замороженный текстовый энкодер Qwen3-VL-4B (Apache 2.0)
• Веса ~12 ГБ на text-to-image, еще по ~12 ГБ на depth и upscaler
• Нужен NVIDIA GPU с CUDA

Альтернатива vision-фундаментам вроде DINOv2

huggingface.co/speridlabs/iris-3b
github.com/speridlabs/iris-3b

Спасибо @m_franz

#imagerestoration #i2d #depth


Видео недоступно для предпросмотра
Смотреть в Max
nanoMuse

Открытый аналог метовского Muse — персональный агент на каждом твоем устройстве. Один агент, одни руки на экране телефона и компьютера, память в файлах, модель на твой выбор.

Определяет персонального агента через пять вопросов и три горизонта

• Действует на экране телефона и компьютера
• Общий диалог между устройствами через релей, который можно поднять самому
• Память — обычные Markdown-файлы, которые человек может читать и править
• Модель выбираешь любую
• Знает твои аккаунты и устройства, помнит контекст неделями
• Sentinel проверяет каждое действие

• GPL-3.0
• Полная аналогия Muse: один разговор на все устройства
• Память с провенансом, оценка «рук», открытая модель для них — в роадмапе

github.com/nano-muse/nanoMuse

#agent #computeruse


Видео недоступно для предпросмотра
Смотреть в Max
Odyssey-3 уже можно попробовать (через квн)
Писал о нем в сентябре

Но на многое хоть что-нибудь не рассчитывайте
Даже начеррипиканые миры работают через пень-колоду, а свой создать - вообще ничего не шевелится

#world #interactive #agent


Принимать по одной ложке на ночь пока не слиопнется

#humor


Видео недоступно для предпросмотра
Смотреть в Max
Magnific One

Генератор картинок с арт-дирекшеном от Magnific. Создаtшь идею, а creative-direction слой принимает решения, как арт-директор. Фокус на брендинг

• Изображения до 4K: фото, иллюстрации, макеты
• До 10 рефов на вход, из них максимум 5 на стиль
• Хорошо рендерит текст
• Brand Kit: загружаешь лого, PDF, сайт — модель держит фирменный стиль в каждом кадре
• Draft-режим: 8-16 вариаций из одного промта по цене одного изображения
• Auto-layers: картинка разбивается на слои, можно менять типографику, текст, цвета и элементы без перегенерации
• Простые промты без деталей, есть промт-гайд

~1.5 минуты на картинку
Про дрейф картинки при множестве правок ничего не сказано

Попробовать
Промпт-гайд

#t2i #imageediting


Видео недоступно для предпросмотра
Смотреть в Max
WallGS Pro

Плагин для #UE
Умеет рендерить и анимировать гауссианы. UE 5.3–5.8, от ПК до Android и VR. В Pro-версии появилось главное — #relighting

Что нового в Pro
• Релайтинг: пересветить скан можно двумя способами — через proxy-меш или автоматически по нормалям
• Сплаты попадают в Lumen-отражения
• Импорт сплатов на лету
• Culling volumes: обрезка сцен объемами
• 4DGS-анимации, LOD и DLSS-пресеты

Что вообще умеет
• 3DGS и 4DGS, коллизии в один клик, авто-LOD
• Android и Meta Quest через Vulkan
• Подготовка ассетов в 10 раз быстрее NanoGS, файлы на треть меньше

Есть бесплатный Windows-вьюер без установки Unreal.

Pro-версия — на FAB, релайтинг пока экспериментальный

#gaussian #plugin


Видео недоступно для предпросмотра
Смотреть в Max
GRACE

Метод сжатия латентов от KAIST AI и Kakao Corp: сжимает видео-автоэнкодер так, что DiT работает на 8× меньшем числе токенов. Ускорение 11.1× при том же качестве по VBench.

• Сжимает предобученный автоэнкодер #Wan21 без потери совместимости с DiT
• Генерация видео с 8× меньшим числом латент-токенов
• Качество на уровне полного пайплайна по VBench
• Без переобучения DiT с нуля — легкая адаптация LoRA

• Wan2.1-I2V-14B: 32.8k → 4.3k токенов
• Ускорение 11.1× при 480×832, 15.5× при 736×1280
• Инференс 78 с против 863 с на A100 80GB
• Асимметричный денойзинг: база чистится раньше остатка

github.com/cvlab-kaist/GRACE
huggingface.co/chimaharicox/GRACE

#optimiozation #t2v #i2v


#Yue2 / #minimaxMusic / #acestep15

github.com/jplenio/Plenio-Music-Production-System - Plenio 0.3: описание песни → локальная LLM пишет, YuE2/Minimax Music 3 исполняет, Plenio сводит/мастерит. Все в #ComfyUI, без облака. Редактор партитуры (пианолла, нотация, ABC), стемы с фейдерами и эффектами, графический EQ с матчингом референса, мастеринг до −14 LUFS. Шесть шаблонов, режим ревью. Refine и Stems пока экспериментальные

github.com/Garionhk/GoKuk - Gokuk: портативное Windows-приложение для полных песен на YuE2 без ComfyUI. Чипы стиля, кавер с SheetSage2, редактор партитуры до генерации, библиотека. Windows 10/11, NVIDIA 12GB+, ~25GB диска. Лицензии CC BY-NC — только некоммерческое

github.com/yeufonic/yeufonic - Yeufonic: веб-приложение вокруг ComfyUI/YuE2 без проводов, Docker или Windows-инсталлятор, локальный трейн LoRA

github.com/HerkulesTerminator/comfyui-music-generator/tree/main - ACE-Step 1.0 + YuE2 - эйсстеп хорош креативно, прогоняем его ноты через YuE2 = хороший звук #workflow

#LoRA

huggingface.co/pduncan/YuE2_Deathmetalv1_lora -дэт-металл

Обновления

github.com/pytraveler/YuE2-ComfyUI/releases/tag/v0.12.0 - YuE2-ComfyUI 0.12.0: точнее распознавание слов (поле language — русский больше не переводится на английский; second_hearing: Whisper слушает второй раз, ошибки 9% вместо 15%). RTX 20xx/GTX 16: последняя стадия в FP16 — длинные песни доходят до конца. Фикс падения при отмене в первую секунду

huggingface.co/deAPI-ai/minimax-music3-11b-int8 - MiniMax Music 3 ужат до ~12Gb (int8)

#musicediting


#krea2

Инструменты

github.com/capitan01R/ComfyUI-Krea2T-Enhancer - Krea2T Enhancer: нода улучшения следования промпту. Текстовый энхансер — младшая версия. Прирост качества и точности промпта
Есть для #klein github.com/capitan01R/ComfyUI-Flux2Klein-Enhancer

civitai.com/articles/35976/comfyui-tutorial-qwen-image-2-1-vs-flux-2-krea-turbo-which-makes-better-character-sheets - сравнение #charactersheet: Qwen 2.1 против FLUX.2 Krea Turbo. Схожая консистентность, но Qwen в ~3 раза быстрее. Оба подхода в одном воркфлоу

huggingface.co/lvladikov/Krea2-Turbo-Distill-2step-LoRA - 2-шаговая дистилляция, детали на уровне учителя, до 2048×2048. Мелкие объекты — слабое место

pastebin.com/raw/S6ziW7yZ - вариативность Krea 2 без лор: текстовый энкодер как LLM для разворачивания промпта. Два рычага: seed промпта (сильно) и seed сэмплера (тонко). Qwen 2.1 PE-системный промпт работает, обычный Qwen3VL цензуре почти не мешает. +4 сек на генерацию

lumenastrum.github.io/clio-style-preview/gallery/ - галерея стилей Clio с превью

civitai.red/models/2961766/moonmaster-krea2-turbo-model-suite - Narrative Drift: чекпоинт Krea 2 Turbo под иллюстрацию и диджитал-арт. Насыщенные цвета, графические тени, арт-дирекшн. Без триггера, Euler · Simple · 8 шагов · CFG 1. BF16/FP8/INT8


Видео недоступно для предпросмотра
Смотреть в Max
Google Labs Playground

Платформа для создания игр с помощью ИИ в браузере. Описываешь идею — получаешь играбельную игру, которую можно публиковать и шерить

• Генерация игр по описанию
• Разные жанры: платформеры, аркады, квизы, головоломки, спорт
• Публикация и общий доступ по ссылке
• Раздел Discovery — игры других пользователей за вдохновением

В Discovery уже лежат готовые примеры: платформер про сонные облака, ретро-танчики, пиксельный шутер с осьминогом и другие. Игры запускаются в браузере, без установки

#gamedev #game


Vidu Q4 Preview

Новый флагманский видеогенератор от Vidu.
Экспрессивная актерская игра, киношная работа камерой и сочные VFX


• Кинематографичный язык камеры
• Выразительная мимика и движения персонажей
• Высококонтрастные VFX-эффекты
• Генерация видео флагманского уровня

Все это хорошо но но ноги блуждающие по телу, аморфная анатомия - нехорошо

• От $0.014 за секунду видео
• Промокод для новых пользователей: VIDUQ4PV1

Ретвит и комментарий под анонсом в X приносит 200 кредитов в личку, акция на 72 часа

Кажется уже на Fal, wavespeed.ai

#t2v #i2v


Open-VC Attention

Открытая реализация VC-Attention (возможно, этого) от MachGen для NVIDIA Blackwell. Почти 2× быстрее BF16 FlashAttention-4 на B200 при генерации видео-моделей вроде MiniMax H3. Плюс ещё ~20% к оригинальному методу из статьи.

Как ускоряет
• ExpCast — вероятности softmax считаются без экспоненты, одной FMA-инструкцией
• Поиск максимума в середине окна ключей — меньше рескейлов
• Варп-специализированный конвейер: загрузка, матричные умножения и softmax разнесены по варпам
• Упакованный V в транспонированном виде — тензорные ядра читают непрерывно
• Fusion подготовки входов в CUDA-граф

Вместо V-Smooth из статьи — «V residual repair»: чинит только худшие токены V, что дает почти тот же эффект за меньшую цену. На MiniMax-H3 в 15-сек ролике без ремонта лицо за визором схлопывалось в темную дыру — с ремонтом 0.5% рендерится верно.

github.com/MachGen/open-vc-attention

#optimization

Показано 20 последних публикаций.