
Американский стартап Generalist AI показал GEN-1.5 — модель, которая учит роботов новым действиям без месяцев тренировок. Роботу достаточно один раз увидеть, как выполняется задача, чтобы тут же попытаться ее повторить — даже если объекты, положение или условия изменились.
Ключевая способность модели называется «обучение с одного примера» (one-shot learning). Чтобы освоить новый навык — снять крышку с банки, расстегнуть молнию на пенале или достать купюры из кошелька, — GEN-1.5 хватает 3–12 секунд видеозаписи демонстрации. Никакого дообучения и обновления весов не требуется: модель просто «удерживает» пример в контексте объемом 30 секунд и мгновенно применяет его к новой ситуации. В компании это называют «физическим промптингом» — по аналогии с текстовыми подсказками для языковых моделей вроде GPT.
Именно с GPT-3 разработчики и сравнивают свое достижение: несколько лет назад та же способность — решать задачи по паре примеров без переобучения — стала неожиданным прорывом для языковых моделей. Теперь, по словам создателей GEN-1.5, нечто похожее происходит и в робототехнике впервые в таком масштабе.
На тесте из десяти разноплановых задач одноразовая демонстрация в среднем дает 59% успешных попыток. Если же добавить короткое дообучение — всего 1–10 шагов градиентного спуска на 5 минутах записи (около 50 повторов), — точность вырастает до 83%. Для сравнения, прежним моделям для похожего результата требовались тысячи шагов обучения и часы размеченных данных.
Помимо копирования, GEN-1.5 умеет импровизировать. В одном из экспериментов модель научили сметать кубик в миску кисточкой — а затем подсунули ей банан и совок. Робот сообразил использовать банан как импровизированную щетку, а совком — зачерпывать кубик и высыпать его в миску, хотя ничего подобного в обучающих данных не было. Модель также способна «сшивать» две разные демонстрации в одно длинное действие, переносить навыки из симуляции в реальный мир и даже копировать движения человека, который показывает задачу голыми руками перед камерой робота.
GEN-1.5 — третья модель Generalist AI, стартапа, который основал бывший старший научный сотрудник DeepMind Пит Флоренс при поддержке венчурного фонда Nvidia. Модель обучалась на данных из домов, складов и заводов непрерывно более восьми месяцев и пришла на смену GEN-0 и GEN-1. Успехи пока скромные — задачи короткие и несложные, а надежность уступает специально дообученным системам, — но авторы называют это первым доказательством того, что роботы способны схватывать физические навыки «на лету», как это делают люди.
