Google DeepMind работает над системой управления роботами, которая обходится без нового обучения при смене корпуса. Gemini Robotics 2 управляет несколькими платформами: гуманоидом Apptronik Apollo 2 в разных конфигурациях и двухрукой системой Franka Duo. Один и тот же контрольный слепок модели адаптируется к новому телу за несколько часов.
На практике это выглядит так: Gemini Robotics On-Device 2 требует менее 200 примеров для обучения на новой платформе. DeepMind проверила перенос навыков на роботах Dexmate, SO101 и Trossen с разной механикой, формой и числом степеней свободы. Раньше приходилось собирать отдельный массив данных для каждой конструкции.
Система состоит из трёх компонентов. Gemini Robotics 2 преобразует изображение и текстовую команду в движения. Gemini Robotics ER 2 планирует многошаговые задачи и отслеживает их выполнение. Gemini Robotics On-Device 2 работает локально и быстро приспосабливается к новому корпусу.
Результаты показывают реальные ограничения. Apollo 2 отвинчивал лампочку в 92% попыток, но завинчивал её только в 36%. Комплектование совком получалось в 32% случаев. На Franka Duo с двухпальцевым захватом точная вставка деталей достигла 89,6%, а комплектование инструментов 78,9%.
С движениями всего тела ситуация похожа. Apollo 2 брал предмет с полки в 76,3% испытаний, со стола в 68,4%, а с пола только в 45,7%. DeepMind признаёт, что скорость и многопалая манипуляция остаются слабыми местами.
Главная проблема в асимметричности данных. Модели получают огромный объём зрительной информации, но намного меньше данных о прикосновении, силе и положении суставов. Робот видит предмет и выбирает движение, но хуже человека чувствует момент, когда что-то начинает скользить, гнуться или разрушаться.
На высокоуровневом уровне DeepMind использует «воплощённое рассуждение», когда система оценивает обстановку, разбивает задачу на этапы и меняет план после ошибки. В апреле это расширили в Gemini Robotics-ER 1.6, добавив лучшее пространственное понимание и проверку результатов.
Gemini Robotics ER 2 теперь ведёт последовательности длиной в несколько минут и сотни решений. Может координировать несколько роботов одновременно. Для работы рядом с людьми добавлены проверки безопасности: остановка при приближении человека и отказ от опасных действий. Пока это проверяется в контролируемых условиях.
Доступность остаётся ограниченной. Gemini Robotics ER 2 можно тестировать через Google AI Studio. Доступ через Gemini Enterprise Agent Platform закрыт. Основная VLA-модель и On-Device 2 доступны партнёрам раннего доступа. Цель DeepMind — отделить интеллект робота от его корпуса и сделать навыки переносимыми между машинами.
