跳到正文
千机 API
原文
通义千问 Qwen· QwenTeam·· 2026-05-29

Qwen 发布通用视觉-语言-动作模型 Qwen-VLA

Qwen-VLA:从看懂世界走向执行动作

AI 导读

Qwen 团队发布通用视觉-语言-动作模型 Qwen-VLA,将机器人操作与视觉语言导航统一为依据视觉观察、语言指令和机器人形态预测动作或轨迹的任务。团队称其在多项操作与导航基准、真实 ALOHA 双臂机器人及动态操控评测中取得成绩;强化学习阶段仅在 SimplerEnv 进行,真实世界长程任务和失败恢复等仍具挑战。

来源:通义千问 Qwen · qwen.ai