商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > 机器人学会“脑补”触感,叠衣服端茶水成功率暴涨90%

机器人学会“脑补”触感,叠衣服端茶水成功率暴涨90%

  发布于2026-05-28 阅读(0)

扫一扫,手机访问

人形机器人的进化,正经历一场从“走得好”到“干得巧”的深刻转变。实验室里奔跑跳跃的身影固然令人惊叹,但一遇到叠衣服、用工具、端茶倒水这类需要精细接触的家务活,往往就露了怯。问题的核心在于,当机器人的上半身忙于各种复杂操作、与外界频繁发生物理接触时,如何还能让全身稳稳当当地保持平衡?这成了制约其真正走入现实场景的关键瓶颈。

最近,来自卡内基梅隆大学与博世人工智能中心的研究团队,带来了一项颇具启发性的突破。他们提出的HTD模型,全称是“Humanoid Transformer with Touch Dreaming”,直译过来就是“具备触觉梦境的人形Transformer”。这个模型让机器人学会了“预判”触觉,从而在整理书籍、铲猫砂、端茶送水等五项真实任务中,将成功率相对提升了惊人的90.9%。


图 | 人形机器人进行不同任务测试(来源:上述论文)

长久以来,人形机器人在执行精密任务时可谓困难重重。全身关节相互牵连,手上一用力,身体就容易晃动甚至失去平衡。许多操作不仅需要“看见”,更需要“感知”到接触的力道、物体的滑动乃至形变,单靠视觉系统是远远不够的。因此,现有的系统要么只能完成简单动作,要么被限制在固定基座上,难以实现“边走边干”的全身协调操作。

为了打破这个僵局,研究团队构建了一套从硬件到软件的完整解决方案。

先站稳脚跟:一个可靠的下半身

一切灵巧操作的前提,是稳定的身体支撑。团队首先训练了一个基于强化学习的下身控制器。他们采用了一种“师生”训练框架:先在仿真环境中训练一个“教师”模型,让它掌握重心分布、足部接触状态等深层信息,学会稳健的下肢运动逻辑;随后,通过知识蒸馏技术,将这种能力迁移到“学生”模型上,使得后者在现实世界中,仅依靠关节角度、身体姿态等可直接观测的信息,就能实现稳定行走。

最终的效果是,机器人能够精准控制身高、躯干的俯仰、倾斜与旋转,无论是弯腰、下蹲还是侧身,都能稳稳完成,从而让上半身从平衡的束缚中解放出来,专注于操作本身。


(来源:上述论文)

向人类学习:高效的数据采集

有了稳定的下半身,如何让上半身学会像人一样灵巧操作?团队搭建了一个VR远程操控数据采集平台。操作人员戴上VR设备,其头部、手腕、手指及身体的姿态被实时映射到机器人身上,机器人则同步复刻人类的动作。整个过程同时记录下多视角的视觉信息、全身关节运动数据、手部受力以及分布式触觉信号。

这种方法无需复杂的编程,就能快速积累大量贴近真实场景的操作数据,让机器人直接学习人类的动作逻辑和操作习惯,极大地提升了动作的自然度和对任务的适应性。

值得一提的是,机器人的双手配备了高精度的分布式触觉传感器,每只手能提供高达1062维的触觉信号,覆盖手指各节和整个手掌,能够精准捕捉接触的位置和压力大小。

核心创新:让机器人“梦见”触觉

整个系统最核心、也最具创新性的部分,是名为HTD的多模态Transformer模型。它能够同时处理多视角视觉、本体感觉、手部力反馈和触觉信号。而其灵魂在于一项名为“触觉梦境”的机制。

这就像人类在做一个动作前,大脑会下意识地预判下一秒手会碰到什么、需要用多大的力气。HTD模型让机器人也拥有了这种“预判”能力——它能在“脑海”中想象未来几秒内的触觉和受力情况,从而提前规划并调整动作,真正掌握接触式操作的诀窍。

实战检验:五项挑战见真章

为了验证这套系统的实际能力,研究人员在实验室中设置了五项颇具挑战性的任务:

高精度插零件: 机器人需要抓起一个T型块,将其插入间隙仅有3.5毫米的T型底座中,任何微小偏差都会导致失败。HTD凭借触觉预判,能够实时微调位置和力度,成功率远超传统模型。

整理书籍: 平放在桌面上的书难以直接抓取。机器人需要先将书本推出桌边,再将其抓起放入书架。HTD能够精准控制推力和抓握力,避免书本掉落或损坏。

折叠毛巾: 面对柔软易变形的毛巾,需要多步骤、持续接触的调整。HTD通过预判毛巾的变形和接触变化,能够稳定完成折叠,并适应多种初始摆放状态。

铲猫砂: 这个任务涉及弯腰、使用工具和全身协调。机器人需要蹲下拿起铲子,铲起猫砂并倒入垃圾桶。HTD完美平衡了动作幅度与身体稳定性,高效完成了任务。

端茶送水: 机器人需要端着两杯茶行走,全程保持平衡且茶水不洒。HTD能够预判移动中杯子的晃动和受力变化,协调双手与全身动作,稳稳当当地完成端送。

实验数据给出了有力的证明:HTD模型在这些任务上的平均成功率,比当前主流的最强基准模型提升了约90.9%。通过进一步的消融实验(即通过移除特定组件来评估其贡献的方法),团队还证实,在模型的潜空间中进行触觉预测,比直接预测原始触觉信号要有效得多,这一设计带来了约30%的成功率增益。


(来源:GitHub)

据悉,该系统的部分底层代码已在GitHub上开源,供其他研究人员参考和使用。

展望未来,研究团队计划进一步扩展其学习框架的规模,并将在涉及人机协作的场景中进行测试。这意味着系统需要吸收更多的视觉数据和人类示教数据。从长远目标看,团队致力于开发能够轻松适配不同身体结构和传感器配置的通用AI框架,并最终创建出能够灵活应对各种复杂操控任务的智能系统。

参考资料:
1.https://arxiv.org/pdf/2604.13015
2.https://humanoid-touch-dream.github.io/

本文转载于:https://www.163.com/dy/article/KST3LQSA05119734.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

产品推荐

热门关注