Featured image of post 共生知行用卡丁车Demo检验人形机器人的“全身智能”

共生知行用卡丁车Demo检验人形机器人的“全身智能”

双足机器人驾驶卡丁车,展示端到端具身智能路线。

8月17日,具身智能初创公司共生知行(Symbiosis Robotics)发布双足人形机器人驾驶卡丁车Demo,并同步上线官方网站,首次较完整地展示其技术方向与阶段性成果。

用赛车场景压测“全身智能”

用赛车场景压测“全身智能”

公开视频中,人形机器人进入卡丁车驾驶位,双手接触方向盘,双脚置于踏板区域,在封闭赛道上完成车辆行驶。这个场景的重点并不是“机器人会开卡丁车”,而是把多个能力放进同一条连续任务链:机器人要根据环境变化调整方向,在狭窄座舱中维持身体稳定,同时协调手部转向与脚部油门、刹车动作。

共生知行将其定义为一次面向全身智能的综合测试。所谓全身智能,可以理解为机器人不只让某个关节或机械臂完成动作,而是综合调用视觉感知、身体平衡、四肢协同和力控制,在真实物理环境中完成任务。公司也强调,卡丁车并不是其商业应用方向,而是一种压力测试载体。

从“能运动”到“能完成任务”

当前人形机器人公开视频常见两类展示:一类是行走、奔跑等运动能力,主要考验本体结构和运动控制;另一类是固定位置的上肢抓取,更多体现视觉识别和机械臂操作。二者都重要,但距离复杂任务仍有差距。

一旦机器人需要在移动或受限空间中同时理解环境、保持平衡、连续操作,难度会显著上升。以卡丁车为例,机器人不是站在实验台前抓取物体,而是坐进车辆、接触方向盘和踏板,并在行驶过程中持续修正动作。这会放大模型、运动控制和硬件之间的耦合问题,也更接近人形机器人未来在真实场景中面对的长链条任务。

端到端路线与阶段性边界

围绕这一问题,共生知行将自身定位为面向双足人形机器人的全身智能基座模型公司,探索从视觉等感知信息到机器人全身动作输出的端到端技术路线。端到端的意思是,系统尽量减少传统分层架构中“感知、规划、控制”等模块之间的手工拆分,让模型更直接学习身体、环境与动作之间的关系。

这一思路的潜在好处,是降低模块适配成本,并通过扩大数据规模获得跨任务能力。但它并不等于通用智能已经实现。端到端模型仍需要大量数据、底层控制能力、真机训练基础设施以及严格评测来支撑。因此,这次赛车Demo更适合被看作阶段性验证,而不是机器人已经具备通用驾驶能力的证明。公司表示,后续将通过技术报告披露模型架构、测试条件和评测方式。

可公开信息显示,这次发布涉及的关键事实包括:

  • 发布时间:8月17日;
  • 展示主体:双足人形机器人;
  • 场景:封闭赛道内驾驶卡丁车;
  • 目标:验证视觉感知、多接触点平衡、手眼脚协同与精细力控;
  • 后续计划:发布技术进展、Demo、开源项目和研究报告。

团队背景与开源积累

作为一家成立时间不长的公司,共生知行试图同时推进模型、运动控制和数据链路。其核心成员来自智源研究院、港科大、极佳视界、小米、达摩院、蚂蚁、清华等机构,均为博士研究者。成员创业前已持续合作两年以上,研究覆盖视觉—语言—动作模型(VLA)、全身运动控制、力位统一控制、跨本体学习和数据利用等方向。

其中,创始人丁鹏翔参与的ReconVLA获得AAAI-26杰出论文奖;其主导的VLA-Adapter尝试以更小模型和训练成本实现VLA能力,开源项目在GitHub已获得超过2200颗星。团队还曾发起并运营OpenHelix Robotics开源社区,公开多个VLA及具身智能项目。VLA即视觉—语言—动作模型,目标是让机器人把看到的环境、理解的指令与可执行动作连接起来。

行业看点:视频之后还要看可复现结果

对仍处早期阶段的双足人形机器人行业来说,一段Demo视频无法回答任务成功率、泛化能力、成本和规模化部署等问题。但它传递了一个趋势:竞争正在从“本体能否做出动作”,转向“模型能否调动全身,在真实环境中持续完成任务”。

共生知行选择卡丁车作为首个公开测试,价值在于把多模态感知、全身控制和连续物理交互放到同一场景中展示。接下来更关键的是,技术报告能否说明评测条件,更多案例能否覆盖移动操作、高精度视觉对准、接触式力控和长链条任务。只有当这些结果可持续迭代、可被清晰评估,所谓全身智能才可能从演示走向工程能力。