"Google DeepMind представили Gemini Robotics 2 С релиза версии 1.5 прошел почти год. Довольно долгий перерыв по сегодняшим меркам. Посмотрим, чего Google добились за это время. Самое важное: VLA-модель, которая лежит в основе, впервые управляет полным телом гуманоида от стоп до пальцев рук, а не только верхней частью корпуса. При этом у рук моторика достаточно мелкая, 22 степени свободы. Нельзя сказать, что робот получается супер-ловким (success rate на multi-finger задачах в районе 30-40%), но это прогресс. Поверх VLA-модели также работает оркестратор Gemini Robotics ER 2. Это отдельная модель поколения, и тут уже просто VLM. То есть, если у VLA на выходе готовые моторные команды, то ER – это более высокий уровень, но котором выполняется ризонинг, разбиение задачи на подзадачи, распознавание объектов и их координат и прочая ""интеллектуальная"" работа. Эту модель тоже существенно прокачали и добавили ей киллер-фичу в виде способности координировать работу сразу нескольких разнотипных роботов для выполнения одной задачи. Кроме того, теперь ER может вмешиваться в действия VLA на любом этапе выполнения задачи, что критично для self-correction. Еще в поколении появилась модель Gemini Robotics On-Device 2 – облегченная VLA для локального инференса. Основное отличие Gemini Robotics – универсальность. Модели обучают на гетерогенных мультиэмбодимент-данных, поэтому они могут работать на роботах самых разных типов без тюнинга. Так вот GR2 On-Device выводит это свойство на практический уровень: вы можете взять эту модель и буквально за несколько часов и ~200 демонстраций заставить ее хорошо работать на любом новом теле (с кастомными сенсорами, DoF, кинематикой и тд). https://deepmind.google/blog/gemini-robotics-2-brings-whole-body-intelligence-to-robots/ А еще из забавного: Google сделали первый бенчмарк для оценки безопасности роботов и назвали его ASIMOV-Agentic. Свою модель они, естественно, заявили как ""самую безопасную в мире"" по этому тесту ☕️"