1. 感知技术栈
- 视觉感知:目标检测、语义分割、3D 重建、视觉定位(VSLAM)
- 力觉与触觉感知:力/力矩估计、接触检测、材质识别
- 多模态融合:将视觉、力觉、本体感知等异构数据融合为统一表征
2. 决策与控制技术栈
- 表示学习:学习环境与任务的紧凑表征,支撑下游决策
- 策略学习:通过模仿学习、强化学习等方法学习控制策略
- 运动规划:路径规划、轨迹优化、碰撞规避
- VLA 模型:端到端的视觉-语言-动作模型,实现从指令到动作的直接映射。其发展历经三代:第一代端到端 VLA(统一感知-理解-行动建模)、第二代增强型 VLA(融合世界模型,实现"行动前预测")、第三代类脑 VLA(引入类脑机制,大脑/小脑/躯干分工协同)。代表性模型包括 Google RT-2(较早的端到端 VLA,将动作作为 token 输出)、π0(Physical Intelligence,采用流匹配生成连续动作)、OpenVLA(斯坦福,开源 7B 级 VLA 基础模型)、Figure Helix(面向人形机器人,可运行于嵌入式低功耗 GPU)。值得关注的是,世界模型正与 VLA 深度融合——如国产公司极佳视界 2025 年底开源的 GigaWorld-0,将世界模型生成的训练数据在 VLA 训练中的占比提升至约 90%,在新纹理、新视角、新物体位置等泛化维度上带来显著性能提升。
3. 训练与仿真技术栈
- 仿真训练平台:如 NVIDIA Isaac Sim,提供高保真的物理仿真环境
- 域随机化与域适应:解决仿真与真实环境的差异(Sim-to-Real 转移)
- 数据飞轮:通过真实数据反馈持续优化模型
4. 基础设施技术栈
- 边缘计算:满足实时推理的算力需求
- 云-边协同:复杂推理上云,实时控制在边
- 机器人操作系统(ROS):提供标准化的软件框架与通信接口