视频原生世界动作模型(VAM)

视频原生世界动作模型(VAM)

视频动作模型(VAM)是机器人世界模型τ0-WM的一个组件,由罗剑岚的团队于2026年5月底发布。VAM能够根据图像和当前信息生成动作并预测未来,其控制指令可直接下发给机器人执行 。该模型使用约27000小时异构数据进行预训练 。

在技术路线上,视频原生VAM是当前具身智能人形机器人“四路并进”格局中的一路,侧重于端到端大模型。其技术路线已演进为“视频原生VAM + 端到端VLA融合”的全栈神经化架构 。

想要了解更多“视频原生世界动作模型(VAM)”的信息,请点击:视频原生世界动作模型(VAM)百科

标签:视频原生世界动作模型(VAM),VAM,原生,视频