RAIBO 2

KAIST动态机器人控制设计研究室开发的基于强化学习的四足步行机器人RAIBO的后续机型

RAIBO 2

概述

RAIBO 2(라이보2)是由韩国科学技术院(KAIST)动态机器人控制设计研究室(DRCD Lab)开发的基于人工智能的四足步行机器人。作为2023年公开的第一代RAIBO(라이보)的后续机型,它搭载了通过强化学习(reinforcement learning)训练得到的步态控制策略,目标是在崎岖地形行走和高速奔跑两方面同时实现。它被评为代表所谓“仿真到现实”(SIM-to-Real)路径的案例,即在仿真中大规模训练控制器,并无需额外的现场调参即可迁移到真实机器人上。

主要内容

开发背景

RAIBO系列由KAIST机械工程系教授皇甫济民(황보제민)领导的动态机器人控制设计研究室开发。研究团队以瑞士苏黎世联邦理工学院(ETH Zürich)四足步行机器人研究(ANYmal系列)中积累的动态步态控制经验为基础,一直研究无需依赖专门的精密地形感知传感器,也能在崎岖地形上稳定行走的基于学习的控制器。第一代RAIBO因展现出仅凭强化学习即可通过碎石地、台阶、斜面等非结构化地形的性能而受到关注,RAIBO 2则是继承这些成果并扩展速度、耐久性和地形适应范围的机型。

硬件与机构设计

RAIBO 2是一台拥有四条腿的中型四足步行机器人,机体规格与大型犬相似。它采用兼顾高速行走与落地冲击吸收的连杆结构和高输出执行器,据悉应用了可直接控制关节扭矩的本体感知执行器(proprioceptive actuator)系列设计。框架为轻量化采用碳纤维复合材料和铝合金部件混用的方式,电池和运算计算机布置在机体上部。主要传感器默认配备惯性测量单元(IMU)和各关节编码器,并可根据需要加装摄像头和激光雷达(LiDAR),以扩展基于感知的自主导航功能。

控制技术:基于强化学习的行走

RAIBO 2的核心是基于神经网络的步态控制器。研究团队使用在仿真器中并行训练数千个机器人实例的大规模强化学习方法,训练直接输出关节扭矩指令的控制策略。在训练过程中应用域随机化(domain randomization),随机改变地形摩擦、质量分布、驱动器延迟、传感器噪声等,以缩小仿真与现实之间的差距。因此,RAIBO 2无需专门的地形地图,也能在碎石、草地、泥地、台阶、坡道、晃动踏板等多种环境中保持平衡并移动。此外,还报告了当检测到跌倒时能够自行恢复姿态的起身控制功能这一研究成果。

主要性能与实验

第一代RAIBO在平地上实现超过每小时10公里的高速行走,并在约20秒内跑完100米,据悉达到了四足步行机器人中名列前茅的速度。RAIBO 2在保持这种速度性能的同时,性能向克服更高台阶、更窄踏板和更大凹凸的方向扩展。实验视频中演示了上下台阶、在倾斜地形上转向、受到外部冲击后的姿态恢复等,这些结果已通过国际会议和期刊发表。

应用领域与展望

四足步行机器人可用于轮式移动难以进行的灾害现场搜索、工业设施检查、建筑工地监测、国防侦察、农业与物流等领域。RAIBO 2与其说是商用产品,不如说更具大学研究室平台的性质,但作为在真实硬件上验证基于强化学习控制技术的参考,正在对国内外机器人研究产生影响。未来,与机器人基础模型结合、端侧AI计算,以及通过视觉、触觉等多感官融合提升自主性,被视为主要课题。

最新动向

2024—2025年,机器人产业处于对人形机器人投资激增的时期,但同时四足步行机器人被评价为相对成熟的技术,已进入实用化阶段。随着波士顿动力的Spot、中国宇树科技(Unitree)和Deep Robotics(云深处科技)的产品系列进入工业现场,价格竞争加剧,以KAIST为首的韩国研究团队正试图在学习型控制算法和软件能力上,而非这类通用硬件上实现差异化。将强化学习与大规模仿真相结合的Sim-to-Real方式如今已成为步行机器人控制事实上的标准;最近,关注点正转向用少量真实数据微调预训练通用策略的微调方法,以及理解自然语言指令并执行移动目标的机器人基础模型研究。此外,随着将训练数据和模型权重开源的趋势扩散,RAIBO系列的研究成果也被用于学术界的复现研究和后续研究。

相关主题

  • [[RAIBO]]
  • [[四足步行机器人]]
  • [[强化学习]]
  • [[KAIST]]
  • [[HUBO]]
  • [[波士顿动力]]