商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > 自变量发布跨模态具身动作分词器X-Tokenizer

自变量发布跨模态具身动作分词器X-Tokenizer

  发布于2026-08-21 阅读(0)

扫一扫,手机访问

你有没有想过,机器人是怎么把视觉理解转化成具体动作的?这个问题看似简单,但实现起来远比想象中复杂。6月30日,自变量机器人拿出了他们的最新方案——跨模态具身动作分词器 X-Tokenizer。这项工作的核心突破在于:他们不再把VLA(视觉-语言-动作)模型中的动作离散化当作一个单纯的"压缩-重建"问题,而是重新定义为"多模态推理与动作之间的语义接口学习"问题。说白了,就是让机器人在理解图像和语言后,能更好地"表达"出应该做什么动作。

自变量发布跨模态具身动作分词器X-Tokenizer

根据披露的信息,这个动作分词器的成败,直接决定了拆分出的动作Token是否具备语义。如果Token没有语义,预训练模型就难以有效收敛,最终VLA模型在输出连续动作时的性能也会大打折扣。自变量机器人在这个环节上的发现,可以说抓住了具身智能落地的关键痛点。

本文转载于:https://www.163.com/dy/article/L0N3ADQ10519DFFO.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注