发布于2026-08-21 阅读(0)
扫一扫,手机访问
你有没有想过,机器人是怎么把视觉理解转化成具体动作的?这个问题看似简单,但实现起来远比想象中复杂。6月30日,自变量机器人拿出了他们的最新方案——跨模态具身动作分词器 X-Tokenizer。这项工作的核心突破在于:他们不再把VLA(视觉-语言-动作)模型中的动作离散化当作一个单纯的"压缩-重建"问题,而是重新定义为"多模态推理与动作之间的语义接口学习"问题。说白了,就是让机器人在理解图像和语言后,能更好地"表达"出应该做什么动作。

根据披露的信息,这个动作分词器的成败,直接决定了拆分出的动作Token是否具备语义。如果Token没有语义,预训练模型就难以有效收敛,最终VLA模型在输出连续动作时的性能也会大打折扣。自变量机器人在这个环节上的发现,可以说抓住了具身智能落地的关键痛点。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9