银河通用发布具身智能“AlphaGo时刻”:人形机器人全自主打网球、转笔、做早餐,2028年冲刺具身智能ChatGPT
SmartHey8月20日消息,2026世界机器人大会论坛于8月19日-22日在北京举办,银河通用机器人股份有限公司创始人、首席技术官、北京大学研究员王鹤在主论坛分享了具身智能与人形机器人领域的核心突破进展。
非常荣幸今天能在WRC主论坛上与各位共同探讨具身智能与人形机器人迈向通用化的关键路径与坚定实践。
在座的每一位嘉宾与听众,都憧憬着人形机器人深度融入千行百业、走进千家万户的未来图景。实现这一愿景的核心,在于以大模型驱动人形机器人走向真正通用——这既依赖机器人本体的高度灵活性与自由度,更取决于能否构建出具备通用能力的‘人形机器人大脑’与精准协调全身动作的‘小脑’。大小脑协同,正是人形机器人的灵魂所在,也是具身智能产业最具战略价值的核心环节。
今天,我们重点阐述银河通用对‘通用化’路线图的理解与实践。第一阶段里程碑,是通过一项高难度任务,充分验证并释放人形身体的独特价值。今年3月,银河通用在全球首次公开人形机器人全自主打网球成果:机器人全程自主跑动、动态维持全身平衡,并实现毫米级腕部精准控制——击球落点稳定、球体始终落在拍面甜区,更具备战术意识,能主动调球(前后/左右调动),与人类对手展开策略博弈。底层是毫秒级全身运动控制,顶层是实时决策与对抗能力,完整呈现了人形机器人从‘能动’到‘会想’的跃迁。该成果发布后引发全球广泛关注,埃隆·马斯克第一时间评价为‘inference’;随后有独立研究者指出:‘这标志着面向运动智能的AlphaGo时刻已然到来’,马斯克随即回应‘Yes’。
正如2016年DeepMind用围棋定义AI新范式,我们以网球这一兼具物理复杂性与策略深度的真实场景,正式释放人形机器人自主能力。其背后,是银河通用多年深耕的仿真+强化学习技术体系:从基础回球动作学习,进阶至策略自对抗训练;目前网球仿真训练累计时长已超1万年——难度远超围棋,因其不仅需在数字空间建模,更须完成‘仿真→真实’的高保真迁移,这项能力目前处于全球领先水平。
本届大会开幕式上,银河通用将首发新一代网球对打技术:拟人化程度更高,支持人机混双协作,并将在央视全网直播。奥运冠军与科技文化代表将共同参与这场全球首次公开展示的‘人形机器人AlphaGo时刻’,诚邀各界见证。
针对‘仅握拍’的质疑,我们在2024年春晚已通过自研‘银河星脑’大模型中的灵巧手脑区,向全球展示高难度动态操作——自主旋转核桃。核桃质地松紧变化、表面摩擦力动态波动,无法依靠固定轨迹完成,稍有不慎即捏碎或滑脱。该能力源于强化学习在真实世界持续回流数据驱动下的模型进化,体现的是物理闭环下的智能生长。
横向对比国际顶尖团队:Figure团队的灵巧手开瓶盖动作属‘抓取+单次旋转’离散操作,此类动作可通过遥操作采集数据实现;而银河通用实现的则是连续、多指协同、力觉自适应的精细操作——此类高维连续控制无法靠人工遥操采集,必须依赖仿真器内端到端强化学习(same-trial learning)。越复杂的灵巧手任务,越凸显same-trial技术的不可替代性。
再看转笔任务:英伟达2023年发布的方案受限于仿真中笔与手指高频碰撞导致的保真度不足;而银河通用在全球首次实现灵巧手高动态转笔——包括笔飞离指尖、空中翻转、精准回落至指尖等极限操作。所有动作均无遥操介入,完全由强化学习+same-trial技术驱动。灵巧操作被誉为机器人皇冠上的明珠,银河通用再次树立全球应用级里程碑。
下一步关键,在于从‘专用专精’迈向‘通用泛化’。数字世界中GPT定义了大模型范式,那么具身智能的GPT是什么?如何让具身大模型兼容海量任务与异构数据,实现真正通用?这正是当前行业最关注的核心命题。
为此,银河通用提出‘银河星脑’仿生架构:为人形机器人构建分层协同的‘大脑’(高层意图生成与粗粒度轨迹规划)与‘小脑’(全身高频控制与抗扰响应),二者通过‘脑桥’高效耦合,形成慢思考与快执行的统一基座。其中,大脑与小脑均为亿级参数大模型,各自探索属于自己的GPT范式。
‘大脑的GPT’需融合两类数据:谷歌VLA模型擅长利用带动作标签的数据,但覆盖有限;OpenAI世界模型可吸收海量无标签视频,却无法输出关节级控制指令。银河通用首创‘世界动作模型(World Action Model, WAM)’——同步建模人类行为语义与机器人运动学,打通有标签动作数据与无标签人类场景视频,让模型真正学会‘人类怎么干、机器人怎么学’。该范式由银河通用于2025年3月首发(ICCV 2025录用),目前全球相关论文已达171篇,首篇原创归属银河通用。
最新一代银河星脑ON模型,进一步在隐空间建模跨本体、跨任务、跨场景的通用操作能力:同一模型可驱动无指搬运机器人完成物流任务,也可适配多指人形机器人执行厨房作业。其背后是融合仿真数据、真实世界数据与人类行为数据的新型具身大模型训练范式。实验证明:仅使用无标注人类视频数据,机器人动作预测损失仍持续下降,验证了‘人类数据即黄金燃料’的可行性。该能力已在展台实时演示——观众可随意干扰机器人做早餐(抽走面包、遮盖水瓶),机器人全程自主应对,零预设、零干预。
即将发布的‘十分钟级全自动早餐系统’,涵盖水果切配、沙拉制作、三明治组装全流程,既是机模能力的集中体现,更是真实世界强化学习训练成果的终极检验。
关于‘小脑’:它需实时将大脑意图转化为丝滑、鲁棒的身体动作。银河通用‘全身控制脑区’是真正的通用小脑——亿级参数大模型,支持远程遥控执行家庭陪护(如铲猫砂)、应急支援、高动态舞蹈等任务,无需预先录制轨迹,全程实时响应。相比传统‘单任务轨迹拟合’小脑,银河通用通用小脑在延迟、精度、高难度平衡稳定性上全面领先。十万小时人类数据训练下,其损失曲线持续收敛,验证‘通用小脑Scaling Law’成立。
昨日分论坛发布的轻量级人形机器人‘银河·星仔Galbot ET1’,正是通用小脑的实体载体:可实时捕捉人类舞姿,即时复现倒立、地面动作等高难度舞蹈,实现‘感知—识别—生成—执行’全链路闭环。当小脑真正通用,机器人便获得即兴发挥与深度人机共舞的能力,迈向‘物理世界原生智能体’新阶段。
那么,具身智能的‘ChatGPT时刻’何时到来?我们定义其标准为:在人类无需专门学习的任务中,成功率稳定达70%–80%;更进一步,通过极简后训练,使非专业人士也能快速将模型适配至特定场景,达成100%可用的生产力水平。
达成该目标,关键在于‘机模’(Joint Model)的持续进化。银河通用构建‘五级具身智能金字塔’——涵盖互联网数据、人类行为数据、合成数据、真机遥操数据及真机回流数据。其中,人类双手操作数据自2022年起系统性采集(头戴+双手传感器),至今仍是全球规模最大的带标注人手操作数据集。
今日同步发布‘Astra Set’高精度头戴+双手UMI采集设备,大幅提升数据质量与采集效率。目前已有上千套设备部署于制造业、医疗、物流等一线场景,配合在线数据管理、自动标注与智能筛选系统,已积累高精度UMI数据50万小时、无器械辅助纯人手视频数据50万小时,总计百万小时高质量人类动作‘教科书’。
机器人动作源头始于合成数据。银河通用‘银河星防’平台,构建了全球领先的仿真资产库、动作生成引擎、仿真验证系统及same-trial训练管线。从柔性物体交互、灵巧手洗牌,到转笔等极限操作,均依托业界最强仿真器实现——没有顶级仿真,就没有全球首次same-trial突破。
在仿真基础上,银河通用已在6省市建立真机训练场,持续采集工业、医疗、康养等场景数据;落地项目如‘银河太空仓’智慧药房(覆盖45城200点位)、宁德时代工厂、医疗康复中心等,累计回收真实世界运行数据8万小时,推动机器人实现‘干得好—知道好—持续变好’的正向循环。
依托‘银河星树’数据基建,我们判断:行业数据正进入爆发期。从银河视角看,机模已加速逼近ChatGPT水平,唯一瓶颈在于落地效率。为此,我们推出‘WAM-TTT’(World Action Model - Task Tuning via Teaching)技术:客户仅需拍摄日常作业视频,无需任何遥操、无需动作标注,模型即可自动完成场景化后训练。零门槛、零专业背景,戴上摄像头即刻开始数据采集,大幅缩短模型从实验室到产线的时间周期。
综合研判,银河通用预计:具身智能的ChatGPT时刻将于2028年到来。届时,行业规模化落地将呈指数级增长——至‘十五五’规划期末(2030年),银河通用人形机器人有望在各领域部署数十万台,真正开启轮式、双足、灵巧手多元形态协同的多场景智能时代。
当前建设的千行百业应用生态,只是起点;下一步将全面开放二开生态:提供机模、硬件、数采设备、数据管理平台与后训练工具链,赋能企业自建具身智能研发能力,让每个行业都能定制专属技能、影响下一代技术演进。通过‘世界人工智能奥林匹克竞赛’等顶级赛事,培育青年人才梯队,携手全行业共同迎接具身智能AGI时代的黎明——实现‘手机级普及量、汽车级普惠价、大模型级智能增益’,撬动十万亿级市场,引领第四次工业革命浪潮。
我的分享到此结束,感谢大家!
