"Робот 140 лет играл в футбол в симуляции против самого себя, и теперь забивает голы людям в реальной жизни Стартап Skild AI занимается разработкой ""общего робо-интеллекта"". Месяц назад они выпустили модель S1, главная фишка которой была в том, что она была способна дообучаться без файнтюнинга, просто по нескольким демонстрациям. Теперь они решили воскресить опыт Google, которые когда-то обучали AlphaGo с помощью техники self-play – игры модели против самой себя. Skild AI полигоном выбрали футбол: www.skild.ai/blogs/physical-self-play. Сначала S1 дообучили базовым ударам по мячу и дриблингу, а затем отпустили в свободное плавание: гуманоид 140 симуляционных лет играл против предыдущих версий себя. И самое интересное, что отдельных ревордов за выучивание каких-то приемов не было, и единственное, за что робот получал награду – это голы. Несмотря на это робот выучил обводки защитников, закрывание мяча корпусом, перехваты, много новых ударов и так далее. В предварительных матчах 4 агентов уже появляются пасы и координация. А ведь пространство действий в футболе огромное: модель 50 раз в секунду должна выдавать углы для каждого сустава. То есть на основе self-play получилась автоматическая учебная программа, которая усложняется сама. Авторы верят, что эту технику можно масштабировать и переносить на любые другие домены, где есть понятная цель и симулятор."