王兴兴在2026世界机器人大会演讲:迈向具身智能的“ChatGPT时刻”,破解物理世界最后1毫米
SmartHey8月20日消息,8月20日,王兴兴现身2026世界机器人大会主论坛。他身着白衬衫、步履轻盈走上台,发表了主题为《从展品到产品:人形机器人产业的下一个十年》的演讲。
以下为演讲全文:
从展品到产品:人形机器人产业的下一个十年
我们公司成立于2016年8月,至今恰逢十年。初创阶段聚焦四足机器人研发,近年来全面转向人形机器人技术攻坚。
过去几年,我们成功推出标志性产品——东方机器人。该机型已成全球人形机器人设计与功能演进的重要参考标准。目前国际主流人形机器人在外观结构、运动逻辑与交互范式上,普遍与其高度同源。
今年年初广受关注的《武BOT》节目,首次系统性融合中国经典传统功夫文化与前沿人形机器人控制技术。团队前期采集数十种代表性武术动作,构建高质量动作语料库,并通过AI多模态训练实现高保真复现。节目不仅展现技术实力,更成为科技赋能传统文化出海的标杆案例,在海外平台累计播放量超百亿次,引发全球观众共鸣。
同样在今年2月,我们在北京天坛完成一场震撼性实景演示:49台人形机器人同步执行编队动作。数百年的皇家礼制空间与最新人形机器人技术形成强烈时空张力,生动诠释了“古老文明”与“未来科技”的深度对话。
过去数年,我们持续推动机器人从实验室走向真实场景——走进工厂产线、走进办公空间、走进家庭环境。2024年,我们已与头部汽车制造商合作落地柔性装配应用;同时在自建智能工厂中部署多台机器人开展常态化作业测试。当前,公司超八成AI研发资源正集中投入于提升机器人的泛化能力与任务鲁棒性,目标是让机器人真正成为可信赖的生产力伙伴。
现阶段尚未大规模商用,核心瓶颈在于任务效率与环境适应性仍待突破:当前机器人虽能完成基础装配,但节拍效率尚低于熟练工人;面对新任务时仍需人工干预调参,部署成本偏高。我们坚持“能力先行”策略——唯有当机器人具备足够强的通用性与自主性,才启动规模化推广。这一挑战,也是全球具身智能产业共同面临的攻坚焦点。
今年4月,宇树科技刷新人形机器人奔跑速度纪录,超越2016年旧标。创下纪录的是我们的第一代人形机器人——我国首款量产型人形机器人,当年售价100万元,既是技术起点,也奠定了后续迭代的底层架构与工程范式。
所有能力跃迁均由AI驱动。当前共识是:高质量数据规模直接决定AI能力上限。我们一方面自主构建涵盖动作、触觉、语音、环境感知的多维真机数据集;另一方面与高校、科研机构及行业伙伴共建数据协作网络,实现数据采集—标注—训练—反馈的闭环流通。数据驱动,已成为我们技术演进的核心引擎。
从数据维度看,真人行为数据(如人体运动力学、日常操作习惯)具有不可替代性;而真实物理世界交互数据(如抓取反馈、地面摩擦、物体形变)则关乎机器人能否真正“落地”。二者缺一不可,共同构成具身智能的基石。
今年5月,我们发布一款高载重特种人形机器人:身高约3米,窄体构型下整机质量约500公斤。其定位并非家用或城市服务,而是面向复杂野外作业场景——如山地物资运输、灾后救援通道开辟、极地科考设备转运等。
该机型支持动态构型切换:四足模式下稳定性与越障能力显著增强,兼具高负载与强适应性,被团队内部称为“物理世界的越野车”。这也是我们首次开放预售的特种机器人型号。
值得一提的是,现场演示中的实时语音驱动动作,全部由端云协同AI链路生成:语音输入→本地ASR识别→云端多模态大模型生成动作序列→安全校验→下发执行。全程存在数秒级端到端延迟,属当前技术条件下的合理响应区间。
我们追求的终极形态,是完全端侧实时推理的动作生成——无需预编程、不依赖固定脚本,真正实现“听令即动”。但这也带来新特性:同一指令在不同时间可能生成略有差异的动作路径。这种“非确定性”恰是自主决策系统的自然表征,而非缺陷。
目前,我们正加速推进机器人进入高价值办公场景——例如会议室自主整理。针对典型杂乱环境(散落文件、倾倒水杯、错位座椅),机器人可端到端完成识别、规划、抓取、归位全流程。单次任务涵盖7–8类子动作,由统一多任务模型动态调度,并具备抗视觉干扰与轻微碰撞恢复能力。
受限于当前运动控制精度,动作流畅度仍有优化空间。需特别说明:所有演示视频均为1:1原速录制,未做任何加速、插帧或后期增强处理,真实反映当前系统性能边界。
相比早期纯动作展示,本次演示的机器人已集成多模态大模型,不仅能“动”,更能“干”——如精准完成倒水、开合抽屉、插拔USB设备等具身操作。整机轻量化设计兼顾功能性与实用性,为家庭与跨场景部署奠定基础。
2025年,我本人、公司核心技术成果及整体发展影响力,共同入选《时代》周刊年度全球最具影响力榜单。
回望具身智能AI模型演进路径,当前主流技术流派聚焦两大方向:VLA(视觉-语言-动作)联合建模与世界模型(World Model)。后者因能模拟物理因果关系、支撑长程规划,正成为业界新焦点。
公司在AI模型研发上持续高强度投入,是当前研发预算与人才配置的第一优先级。早在2024年初,我们即启动基于视频理解的世界模型研发;虽初期效果未达预期而短暂调整方向,但自2025年起重启攻关,并已在仿真环境与真机验证中取得关键进展。
破解具身智能“ChatGPT时刻”:如何跨越物理世界的最后1毫米?
公众常问:通用人形机器人何时真正走入家庭与职场?答案取决于一个核心指标——泛化能力的临界突破。
当前AI模型在固定场景下任务成功率可达99%以上;但一旦物品形态、光照条件、桌面倾斜角等微小变量发生变化,成功率便急剧下滑。我们认为:当一台机器人被带入任意陌生工作环境,仅凭自然语言指令即可自主完成约80%常规任务时,“具身智能的ChatGPT时刻”即宣告到来——这将是整个产业爆发的奇点。
达成该目标的最大障碍,在于AI输出与物理执行之间的“最后一毫米对齐”。例如指令“把杯子放到托盘上”,模型可准确理解语义并生成路径规划,但在最终几厘米的抓取力控、接触反馈修正、姿态微调环节,现有系统仍易因触觉信号延迟、关节伺服误差或建模偏差导致失败。
根本原因在于:语言模型运行于无损数字空间,而机器人必须在充满噪声、延迟与不确定性的物理世界中行动。每一次传感器输入与执行器输出都伴随信息损耗,这种固有偏差正是泛化瓶颈的物理根源。
值得乐观的是,这一问题本质可解。随着仿真精度提升、多模态感知增强及神经控制算法进化,未来2–5年有望实现质的突破。
此外,我们正在实践一项更具颠覆性的探索:让AI大模型直接驱动物理世界的“自我进化”。具体路径为——设定安全约束与工具接口后,由大模型自主检索最新论文、开源代码与工程方案,编写机器人控制逻辑;代码先经高保真仿真验证,再部署至实体机器人实测;结果由AI评估模块+人类专家双轨打分,并将反馈闭环注入模型训练体系。
左下角界面即为该系统实时代码生成过程示例。它已能产出含运动学求解、力矩分配、异常处理等复杂逻辑的完整控制程序。
相较于传统强化学习或自动编程框架,该闭环体系具备三大优势:其一,随基础模型能力升级而自然进化,形成正向飞轮;其二,高效融合仿真数据、真机数据与人类经验数据,大幅提升数据利用密度;其三,支持技能持续沉淀——今日生成的装配能力,明日可复用于新产线,避免重复造轮。
这不仅是开发范式的变革,更是开启“物理世界AI对话”的新纪元。我们坚信,这是通向通用具身智能最坚实、最可持续的路径之一。
Physical AI开启人机共生的下一个黄金十年
自2017年起,我们连续九年参与世界机器人大会。十年躬耕,见证行业从概念验证走向产业落地。站在AI大模型与机器人硬件双重爆发的历史交汇点,我们确信:未来十年,将是Physical AI定义人机共生范式的黄金十年——速度之快,或将远超所有人预期。
