近日,一份在GitHub上匿名发布的仿真测评报告引发了具身智能领域的广泛关注:混合使用的GPT-6 Astra架构以62.6分遥遥领先,竞争对手的得分仅为38.26分。这一巨大的性能差距不仅是简单的微调优化,而是表明了架构设计上的重大突破。研究中并未将GPT-6 Astra直接用于机械臂控制,而是巧妙地让其在语义判断与修正方面发挥作用,与物理空间的执行架构相互补充。银河通用团队对Astra模型的深度评测显示其在通用性方面取得了显著进展。虽然在轨迹质量和实时性上仍有不足,但Astra能够在没有样板的情况下,以高成功率在多种机器人上完成各种新任务,并具备较强的错误恢复能力。这说明具身智能的未来已经不再遥远,在数万亿的模型参数下,机器人的通用性跃升至与ChatGPT相近的水平。
此次测评由银河通用团队的研究员撰写,以该团队创始人及CTO王鹤教授的博士生为第一作者,整个实验基于严谨的闭环控制对比。研究分析了两种用于双臂操作的闭环控制架构:直接模式,GPT-6 Astra通过视觉和状态信息直接生成双臂的动作;混合模式则先由VLA模型π0.5生成候选动作,Astra在分析环境与历史执行后再选择是否进行修正。该混合模式的成功率达到48%,平均得分为62.60,远超第二名的64%。
在RoboDojo实验中,团队选定了10类复杂机器人操作任务,包括整理、分类、排序等,每项任务执行5次。在两种模式的对比中,直接模式的成功率为26%,而经过π0.5优化后成功率提升至48%。重要的是,Astra只在必要的关键节点上进行了14.4%的步骤修正,展现出两种模型的协同作用。Astra在语义理解和任务规划方面表现突出,但在需要精密控制的任务中其短板逐渐显露。添加了π0.5的帮助后,操作控制的成功率显著提高,特别是在涉及精细接触的任务上。 千亿球友会
RoboLab实验进一步验证了Astra在理解物体关系和空间结构等语义任务上的能力。在50次实验中,GPT-6 Astra Direct的成功率达到了98%,而混合模式的成功率为92%。相较之下,传统模型的表现则显得乏力。此实验阐明了大模型在机器人策略上的显著进步,但实际上对物理操作的理解仍需要更强的能力。