MXStat
MXStat
Введите текст для поиска
Расширенный поиск каналов
  • Вход на сайт
  • Каталог
    Каталог каналов Региональные подборки Поиск каналов
    Добавить канал
  • Рейтинги
    Рейтинг каналов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Max
Нероботы

4 Aug, 19:10

Открыть в Max Поделиться

00:43
Видео недоступно для предпросмотра
Смотреть в Max
Роботам опять предлагают думать

Исследователи Массачусетского технологического университета (MIT) разработали систему VLASH, которая позволяет роботам планировать следующее движение, не останавливая выполнение предыдущего. Как это происходит обычно: робот получает изображение с камеры и команду, рассчитывает серию действий, выполняет её — и только после этого снова принимается за анализ и формирование новой команды. Отсюда возникают паузы.

Запустить расчёты параллельно с движением можно и без VLASH, но появляется другая проблема: пока модель размышляет, рука уже успевает переместиться. В итоге новая команда рассчитана для положения, в котором робота больше нет, и движения становятся дёргаными 👆🏻 VLASH заранее прокручивает уже запланированные действия и вычисляет, какое положение нужно занять к моменту выполнения следующей команды.

Чтобы модель действительно учитывала эти данные, её дополнительно обучали на одном и том же изображении, но с разными будущими положениями робота и соответствующими действиями. А для дальнейшего ускорения несколько мелких движений объединяли в одно крупное: вместо десятка коротких шажков манипулятор сразу переходил к следующей важной точке траектории.

Метод проверили с несколькими VLA-моделями, включая π0.5 от Physical Intelligence, GR00T N1.6 от NVIDIA и SmolVLA от Hugging Face, а также на двуруком роботе Galaxea R1 Lite и небольшом манипуляторе LeRobot SO-101. При перекладывании, сортировке и складывании кубиков задачи выполнялись в 1,5-2 раза быстрее без ухудшения результата, а максимальная задержка реакции сократилась до 11,8 раза.

Для наглядности робота отправили играть в пинг-понг: стандартная VLA-модель, которая рассчитывает движения и только потом их выполняет, не отбила ни одной из двадцати подач. VLASH же справился с одиннадцатью. Ещё система заметно лучше показала себя в игре Whac-A-Mole (это та, где надо успевать ударить крота по темечку) — но это уже другой вопрос, насколько достойно мы применяем большие языковые модели.

@anti_robots

84
Каталог
Каталог каналов Подборки каналов Поиск каналов Добавить канал
Рейтинги
Рейтинг каналов Max
Контакты
Написать в Max Написать в Telegram Написать на почту
Всякая всячина
Пользовательское соглашение Политика конфиденциальности
Наши каналы
MXStat в Telegram MXStat в Max
Наши боты
MXAuthBot MXAnalyticsBot
Made by TGStat