Исследователи Технологического института Джорджии (Georgia Tech) разработали новую архитектуру машинного обучения, которая позволяет гуманоидному роботу уверенно передвигаться по песку, гравию, мокрой траве, склонам, лестницам и скользким поверхностям, значительно сокращая время и вычислительные мощности, необходимые для обучения контроллера.
Метод, получивший название «Learn to Teach» («Учись, чтобы учить»), представляет собой усовершенствованную версию популярного подхода «учитель-ученик» в обучении с подкреплением. Главное отличие – обе нейросети обучаются одновременно, а не последовательно.

В традиционном подходе сначала полностью обучается «учитель» – модель, имеющая доступ к детальным симуляционным данным. Лишь после этого её знания передаются «ученику» – модели, которая управляет реальным роботом.
Ведущий исследователь Фэйян Ву указал на два недостатка такого подхода: «Это занимает слишком много времени, так как обучение происходит последовательно. Кроме того, теряется большой объём информации, которую собрал учитель».
Обучение роботизированных контроллеров через симуляцию может требовать многих часов вычислений на дорогих GPU, что делает процесс дорогим и длительным.
Вместо того чтобы ждать, пока учитель освоит задачу полностью, команда Georgia Tech запустила обучение обеих моделей параллельно. По мере того как учитель постепенно учится, он сразу же начинает передавать знания ученику, что существенно ускоряет весь процесс.
«Вам не нужно ждать, пока учитель станет экспертом, чтобы он начал учить ученика, – пояснил Ву. – Учитель может постепенно передавать ученику то, что узнаёт по ходу дела».
Кроме того, исследователи позволили учителю учиться на опыте ученика. Это сократило так называемый «разрыв подражания» – ситуацию, когда ученик сталкивается с условиями, отличными от идеализированной симуляции учителя.
Новый контроллер был развёрнут на полноразмерном гуманоидном роботе в лаборатории доцента Йе Чжао. Робот успешно преодолел пересечённую outdoor-местность и скользкие indoor-поверхности без использования отдельных контроллеров для разных типов среды.
Ву отметил, что команда не ожидала столь высокой эффективности от единого контроллера: «Для этого массивного, очень высокого гуманоидного робота ещё не было доказано, что возможно устойчивое передвижение по столь сложному рельефу. Но наш эффективный рецепт обучения работает для всех типов местности и окружения».
По словам Чжао, созданный контроллер даже превзошёл программное обеспечение, предоставленное производителем робота, что демонстрирует ценность сочетания исследований в области машинного обучения с практической робототехникой.
Исследование было представлено на Международной конференции IEEE по робототехнике и автоматизации (ICRA). Разработчики полагают, что фреймворк «Learn to Teach» может быть адаптирован для других типов роботов и задач, требующих надёжного передвижения в непредсказуемой среде.
Источник: Interesting Engineering
Оцените новость
0
0
0
0
0
0
0





