宇树科技上市后第二天,其创始人王兴兴在2026世界机器人大会发表题为《从展品到产品:人形机器人产业的下一个十年》主题演讲。他认为,当前机器人产业正站在人工智能加速发展的新起点,而现阶段该领域最大的发展瓶颈仍然是具身智能的泛化能力不足。

“从发展周期来看,快则两到三年,慢则五到十年,行业有望迎来关键突破。”关于具身智能迎来类似ChatGPT的产业临界点的时间,王兴兴给出了相对乐观的判断。

而谈及通用机器人何时真正走进家庭,王兴兴认为,全世界目前最大瓶颈还是泛化能力不够。“如果哪一天大家能看到把一台机器人带到一个任意的陌生环境,它基本可以实现80%左右的任务,我觉得就差不多已经实现了具身智能的ChatGPT时刻”。

以下为演讲内容为PANews整理:

回顾宇树十年:从四足机器人到人形机器人

尊敬的各位领导、各位嘉宾,大家好。非常荣幸在这里做分享。首先简单回顾一下公司的情况。宇树科技成立于2016年8月,到今年8月差不多整整10年。我们最早做的是四足机器人,最近几年开始做人形机器人。

近几年比较成功的一款产品,是我们2024年推出的G1。G1推出以后,基本成为了全球人形机器人领域比较有代表性的产品。现在大家看到的很多人形机器人产品,无论是整体形态还是设计思路,都和G1有一些相似之处。

今年年初比较有代表性的一个项目,是我们在春晚上表演的《武BOT》。这个节目融合了中国非常经典的传统功夫和武术文化。我们提前采集了几十个有代表性的中国功夫动作,再进行AI训练,最后把比较精彩的动作放到整个舞台上。这个节目最大的亮点,是把当前比较前沿的人形机器人技术与中国传统功夫、武术文化结合在一起。这个视频在海外的传播也非常好,可能有数百亿次播放。我觉得这是一个科技和文化融合得比较好的例子。

2月份,我们还在天坛做了一次演示。当时现场大概有49台机器人进行全自动表演。天坛本身有几百年的文化和历史,机器人在这样的场景里表演,会形成一种非常强烈的穿越时空感——把中国过去几百年的文化和当前最新的技术交融在一起,视觉和感受上都非常震撼。

过去几年,我们也一直在推动机器人真正走进生活、走进工厂。2024年,我们就开始和汽车工厂合作做一些落地应用,也在自己的工厂里部署机器人,做一些简单的测试和应用。现在公司绝大部分AI团队,都在围绕机器人如何真正进入家庭或者工厂干活做研发。

为什么目前还没有大规模推广?最主要的原因,是机器人的效率和泛化能力还不够。现在机器人已经能够做一些简单装配,但效率和人相比仍然偏低;另外,每次遇到一个新的任务,往往还需要重新训练,这会进一步降低整体效率。所以我们还是希望先把技术的泛化能力做得更好,再进行大规模推广。这也是目前全球机器人行业共同面对的一个核心瓶颈。

今年4月份,我们还刷新了人形机器人奔跑速度纪录。这款机器人是在我们2023年第一代人形机器人H1的基础上改制的。H1是宇树第一款人形机器人,也是比较经典的一款产品。后续我们也在它的基础上尝试不同形态,比如增加轮式结构,让机器人在一些场景下能够更加灵活。

驱动机器人:AI、数据与真实场景

大家也知道,现在的机器人基本都是AI驱动,而AI本质上又是数据驱动。数据有多少,尤其是高质量数据有多少,很大程度上就决定了AI能力能做到什么程度。所以我们一方面自己采集数据,另一方面也和第三方公司合作,希望获得更多数据,既给行业使用,也给我们自己使用。

我个人认为,真正用于AI机器人训练的数据,应该以大量真人数据或者互联网数据作为主要的预训练数据,再叠加一部分真机数据。这两部分数据都是刚需。从数据规模上看,真人数据会更多,也更加重要;但真机数据同样不可缺少,因为最终还是需要把机器人和真实物理世界匹配起来。

今年5月份,我们发布了全球首款量产级载人变形机甲GD01。这款机器人身高3米多,载人以后重量大概500公斤。大家可能会好奇这类机器有什么应用。简单做一个比喻,它有点像一辆“越野车”,并不是主要面向家庭或者城市里的日常使用,而更适合户外、复杂环境以及一些运输场景。比如出去户外徒步,或者在地形比较复杂的地方运输物资,都可以考虑使用它。

GD01还有一个比较有意思的特点,就是可以变形成四足模式。切换到四足模式以后,稳定性会更好,越障能力也比较强。这也是我们为什么愿意把它真正拿出来预售的一个原因:在四足模式下,它已经具备相对比较好的稳定性和复杂地形通过能力。简单来说,可以把它理解成机器人形态的“越野车”。

前几个月,我们还演示过一个基于多模态模型的端到端AI动作生成系统。过去很多机器人动作演示,都是提前采集、提前训练好的;而这套系统的动作可以根据实时语音指令生成。语音首先需要被识别,再上传到云端做AI动作生成,之后还要对动作进行验证,确认没有问题再下发给机器人,所以整个过程目前还会有几秒钟延迟。

我们希望未来机器人真正落地应用的时候,动作能够完全实时生成,而不是依赖提前编程。现在这种自动生成方式还有一个特点:即使输入完全相同的指令,每一次生成的动作也可能略有差异。也就是说,你今天和明天对机器人说同一句话,它做出来的动作可能不会完全一样。

我们也在推动机器人真正进入会议室等日常场景干活。比如公司里的会议室有时候会比较乱,那么会议室整理就是一个比较明确、也有实用价值的任务。我们的训练目标是:把一个会议室任意打乱以后,机器人都能够把它恢复到干净整洁的状态。

这个任务目前是完全端到端实现的,所以机器人的运动效率还比较慢。但它不是单任务系统。在这个场景里,我们大概设置了7到8个不同任务,用一个模型让机器人在不同任务之间自动切换并直接执行,同时具备一定的抗干扰能力。因为AI需要实时识别、实时生成和持续推理,所以动作暂时还没有那么流畅,每走一步、每做一个动作都需要推理,这会影响整体“丝滑度”。不过演示视频本身是一镜到底,没有做剪辑,也加入了环境干扰。

在此基础上,我们又把语音驱动和多模态模型结合起来,让机器人不仅能根据语音生成动作,还能够真正完成交互和操作任务。现场演示中,机器人可以识别眼前物体的颜色、判断不同药盒的位置,再根据语言指令把指定物体拿出来。这种情况下,机器人执行的就不是一个预先设定好的固定动作,而是需要理解语言、识别环境,再完成操作。

前段时间,我们还发布了最新一代轮足四足机器人As2-W。这款机器人比较轻量化,带电池重量大约25公斤,负载能力和续航能力都比较强,同时具备IP54防尘防水能力,可以覆盖室内和室外场景。

我们把一些在人形机器人上积累的技术重新应用到了四足机器人上,希望进一步提升四足机器人的灵活性,同时把负载、续航和复杂环境适应能力做得更好。我们也希望这款机器人未来能够真正用于户外徒步、运输以及一些工业场景。

与此同时,我们也持续升级R1这类轻量化人形机器人,让它的运动和灵活性进一步提高。R1本身的性价比比较高,也已经可以通过京东、淘宝等渠道购买。

前段时间,我们还展示了一款新的机器人。这款机器人开发时间很短,到现在大约只用了三个多月,还不是正式发布版本。它的最高速度已经达到12.65米/秒,超过了人类历史上最快运动员的峰值奔跑速度;按照目前的测试结果,它的跳跃高度也已经超过了人类历史上的最高跳跃水平。202