乐享科技街头直播一小时:用真实“翻车”重塑具身智能信任标准
如果给过去两年的具身智能行业找一个关键词,“内卷”大概得票最高。只不过,卷的方向有点奇怪:大家卷的不是机器人在真实世界里能干什么,而是谁的演示视频更吸睛、更炫技。
视频越来越精致,配乐越来越激昂,剪辑越来越丝滑。机器人在镜头前叠衣服、冲咖啡、翻跟头,每一帧都经过千锤百炼。行业内甚至悄然形成一条“演示特供链”:专属拍摄场地、定制灯光系统、精心筛选道具,以及一支专攻“拍一百遍、挑一遍”的幕后团队。大众看到的是第一百次成功,而前九十九次的卡顿、脱手、误判,全被静静拖进剪辑软件的回收站。
9月16日,乐享科技以一场近乎“自曝式”的实践,撕开了这层精心修饰的幕布。
01、一场全程不设滤镜的街头直播
搭载乐享科技以太大模型的机器人,在上海开放式街头环境完成近一小时不间断直播,完整执行点单、备料、烧烤、上菜全流程。过程中,机器人端盘时突然晃动、路径规划临时调整、与顾客即兴互动——所有“不完美”均未规避,镜头如实记录。恰恰是这些未经修饰的瞬间,让技术承诺真正落地可感。

这场直播处处“反Demo”:Demo追求封闭理想环境,它选择完全开放的公共街巷;Demo依赖剪辑剔除失误,它坚持全程无剪辑直播;Demo观众被动观看,它允许现场3桌共6名顾客随时提出新需求、移动物品、临时变更流程;Demo每个环节均有预设预案,它甚至在原定顾客缺席后,随机邀请围观路人补位参与。
换言之,行业Demo中极力回避的所有不确定性,这场直播主动将其全部纳入——别人为机器人铺平道路,它却主动设置真实世界的“路障”。
02、为什么“精修Demo”成了默认游戏规则?
演示视频成为行业通行做法,有其现实基础:具身智能的真实场景验证成本极高,环境变量不可控,任何企业都难以确保直播零失误。而融资推介、公众传播、人才吸引,又高度依赖“确定性”内容输出。久而久之,业内形成一种心照不宣的共识:用最优质的影像说话,至于成功率与容错率,则不必深究。
这种默契的代价,是整个行业的可信度持续稀释。当每支视频都被默认“已剪辑”,真正具备真实鲁棒性的技术反而难以脱颖而出。
乐享此次直播的价值,正在于以最高风险投入,换取最坚实的技术公信力。
直播期间,弹幕不乏质疑:“是不是提前排练?”“镜头外是否有人遥控?”对此,乐享科技创始人郭人杰直接带镜头环场巡检:四周为完全开放街景,无隔离围挡;全场唯一可藏人的角落——背后一间小屋——被镜头直击:空无一人、无备用设备、无远程操控痕迹。这段“透明化验场”行动,彻底封堵了所有人为干预的想象空间。
03、真实,反而催生更惊艳的智能涌现
这场“高难度赛制”并未导致翻车,反而触发多个引发弹幕刷屏的真实智能时刻:顾客中途插话要水,机器人送完水后无缝续接原订单;面对陌生调料瓶,烧烤机器人自主试抓数次,快速习得最优握持方式;烤串与上菜由两台异构机器人协作完成,交接全程无脚本、无预设指令,纯靠实时感知与任务协同;最易被忽略却最具分量的一幕发生在送水之后——无人提示,机器人主动递上纸巾。这一动作未写入任何服务流程,却精准指向“吃烧烤需擦手”的场景逻辑。
这意味着模型不再停留于“指令—执行”的工具层级,而是基于对“人在吃烧烤”这一完整语境的理解,自主推导出未明说的用户需求。从“听懂指令”跃升至“预判意图”,正是工具与智能的本质分野。工具等待指令,智能主动思考。
直播尾声还有一段自然花絮:主持人宣布结束,技术人员临时起意示意机器人致意,机器人随即面向镜头与观众挥手告别。因全程无预设流程,这一即兴动作反而极具说服力——它并非程序设定的“结束动作”,而是对“社交收尾”情境的自主理解与人性化回应。
这些瞬间之所以珍贵,正因其无法被设计:剪辑可复刻完美动作,却无法生成“被打断后仍记得主线任务”的连续性思维,更无法模拟“无人吩咐却主动递纸巾”的场景推理能力——这背后,是模型对任务本质、环境动态与人类意图的深度建模。
04、“敢不敢直播?”正成为行业新暗语
直播结束后,一个新问题在从业者社群中迅速扩散:若将自家模型置于同等条件下,能稳定运行多久?十分钟?半小时?还是根本不敢开机?
这个问题没有标准答案,但它的出现本身,已悄然重构行业对话范式。过去见面聊参数、比数据量、晒Demo效果;未来,第一句可能变成——你敢不敢直播?
支撑本次直播的“以太大模型”,据乐享介绍,是一款跨本体通用具身大模型,采用以神经元分配为核心的能量驱动架构,区别于主流VLA(Vision-Language-Action)路线,强调感知、记忆、推理与运动控制的闭环连续性;训练仅依赖200小时人类行为视频数据,零真机采集,模型体积仅4B。当同行仍在比拼真机数据规模与参数体量时,它已切换赛道,聚焦效率与泛化能力。
比技术路径更深远的影响,在于它为行业立下新契约:具身大模型的真实能力,从此拥有了公开、可重复、可证伪的检验标尺——即:能否在真实世界、无人接管、连续作业、抗干扰的环境中完成端到端任务?
可以预见,更多企业将面临“跟进或解释”的双重压力:跟进,意味着接受同等不确定性;不跟进,则必须直面“为何不敢”的拷问。而第一个把考场公开摆上台的人,自然成为新规则的定义者。
Demo内卷的时代或许不会戛然而止,但看过这场直播的观众与投资人,再审视那些精修视频时,心中难免浮现同一个问题:敢不敢直播?
作为长期追踪具身智能发展的媒体,SmartHey认为:乐享科技这场直播所颠覆的,并非某项单一性能指标,而是整个具身大模型的能力衡量体系——评价尺度,已从“演示视频里的几十秒完美片段”,升级为“真实世界中持续一小时的鲁棒表现”;从“曾做到过一次”,转变为“扛住所有意外,依然把事做完”。标准一旦重写,行业便无法退回旧轨道。
对乐享科技而言,这场直播更是一次历史性坐标锚定:从此,提及具身智能大模型,行业首个联想对象,将是那套装进机器人、在上海街头稳稳烤满一小时串的“以太”系统。由乐享科技开启的具身智能新纪元,规则已然落笔。接下来,是追赶者的时间。
