
Современные роботы, которые работают на основе так называемых vision‑language‑action (VLA)‑моделей искусственного интеллекта, часто двигаются рывками: потянулся — застыл — скорректировал — снова застыл. Причина в том, как обычно устроена работа таких моделей: робот завершает текущий набор действий и только потом просит модель «подсказать», что делать дальше. Пока ИИ просчитывает следующую порцию команд, движение замирает — отсюда характерный режим «старт‑стоп», который плохо подходит для задач, подразумевающих непрерывное взаимодействие с окружающей средой.
VLASH устраняет эту паузу за счет параллельного планирования. Пока робот выполняет уже вычисленные действия, система заранее просчитывает следующий шаг, исходя из текущего состояния и запланированной траектории. Проще говоря, робот «придумывает, куда идти дальше, еще до того, как нога коснулась пола», а не ждет окончания шага. Важный момент: VLASH предсказывает не весь мир вокруг, а только будущее состояние самого робота. Это гораздо легче с вычислительной точки зрения, чем полноценные «мировые модели» среды, и позволяет уложиться в те же вычислительные ресурсы, что работают для VLA‑моделей.
Специалисты MIT, Nvidia, Калтеха, Калифорнийских университетов в Беркли и Сан-Диего, а также Цинхуа (Китай) протестировали VLASH на двух разных роботах и двух VLA‑моделях, используя ноутбук с видеокартой RTX 5090. Роботы выполняли задачи захвата и перекладывания предметов, сортировки и штабелирования (по 20 прогонов для каждого метода), а также быстрые сценарии — например, играли в настольный теннис. Отдельно измеряли задержку реакции на разных типах процессоров и графических ускорителей. В новых, более реалистичных тестах выигрыш по максимальной задержке достигал 11,8 раза; более ранние эксперименты на медленном оборудовании и с длинными последовательностями действий давали более чем 30‑кратное ускорение.

Помимо оптимизации времени отклика, команда переорганизовала обучающие данные, чтобы ускорить «дообучение» моделей: в одном из бенчмарков каждый шаг обучения выполнялся в 3,26 раза быстрее при сопоставимой точности. Но авторы предупреждают: это не означает столь же кратного удешевления всего обучения — итоговая стоимость зависит и от модели, и от объема данных, и от числа шагов.
При этом более быстрая реакция не означает автоматически повышения безопасности. «Реагировать раньше — это реальное преимущество, но утверждать, что оно делает роботов безопаснее, я бы не стала», — отмечает Рошни Лулла из Institute for Humane Robotics, не принимавшая участия в работе. По ее мнению, критическим тестом станет работа таких систем рядом с людьми, когда обстановку может внезапно изменить другой агент.
Сами авторы подчеркивают, что пока можно «честно говорить о снятии узкого места по времени обработки при сохранении возможностей», но не о скачке в «интеллекте» или надежности. Наиболее очевидная область применения новой системы — манипуляции, где важны непрерывные движения и быстрые реакции: производство, сортировка, быстро меняющиеся конвейерные линии. В будущем VLASH можно будет сочетать с продвинутыми мировыми моделями, которые предсказывают изменения окружающей среды, но сначала систему предстоит обкатать на большем числе роботов, задач и реальных условий — с длительными испытаниями и непредвиденными помехами.
Пока же работа наглядно показывает, что VLA‑роботы могут тратить гораздо меньше времени на раздумья между действиями — и это важный шаг к более плавным, быстрым и отзывчивым машинам.
Ранее ученица из России разработала робота-садовника.
