小鹏发布第二代VLA大模型:首次实现4D时空理解,XOS 6.3.0全球首发

SmartHey8月27日消息,今日,小鹏集团举办以“TIME 时间”为主题的物理AI分享暨第二代VLA全新版本体验日活动。小鹏第二代VLA大模型迎来首次重大升级,全新XOS 6.3.0系统将率先搭载于小鹏G9L全球首发。此次升级的核心突破在于——让AI真正理解“时间”:从过去对物理世界的静态3D空间感知,跃升为动态4D时空建模与推理能力。

小鹏集团持续验证自动驾驶领域的Scaling Law,显著提升智驾系统的体验流畅度、安全冗余性与跨场景泛化能力。即将发布的XOS 6.3.0大版本,端侧模型参数量提升至原版的3.5倍,远超行业主流小模型数量级;依托超长时序上下文记忆能力,AI司机实现“看得准、会思考、反应快”的质变,标志着小鹏物理AI基座正式完成从空间智能到时空智能的底层跃迁。新版本同步引入整车级智能中枢——Master Agent,深度融合视觉语言模型(VLM)与视觉-语言-动作大模型(VLA),并将Robotaxi级别的L4能力下放至量产车型,带来更自然、更可靠的高阶智驾体验。

从理解空间到理解时空,第二代VLA首次赋予AI“时间感”

物理AI的本质挑战,是在复杂、动态、受限的真实世界中持续感知、推理并行动。真实世界并非静止图像的堆叠,而是一个连续演进、因果交织的时间流。要像人类一样理解环境,模型必须首先建立对“时间”的结构化认知。

传统模型虽能识别车辆、行人、红绿灯等静态要素,但面对真实驾驶中的连续决策(如预判前车制动趋势、判断行人折返意图),仅靠瞬时感知远远不足。本次升级首次将“时间维度”深度嵌入VLA基座模型——AI的世界观,由此从“3D空间”全面升级为“4D时空”。

新架构采用Infini-VLA长时序建模技术,支持长达30秒的有效历史记忆。驾驶决策不再孤立于单帧画面,而是基于连续动作、轨迹变化与场景演进构建完整时序逻辑链,使模型对道路事件的理解具备连贯性与因果性。

为匹配现实世界的动态节奏,第二代VLA同步优化推理范式:采用Streaming Inference(流式自回归推理),实现从“离散推理”到“连续推理”的转变,端到端响应速度提升300%。传统模型遵循“看→算→输出→再看”的串行流程,而新模型可实时并行执行“边看、边想、边行动”,在前车急刹、行人突变向、旁车强插等高风险场景中,响应敏捷度接近经验丰富的真人驾驶员。

为支撑更可靠决策,小鹏X-Foresight预测世界模型首次上车,可对6秒内交通参与者的运动轨迹、交互行为进行多模态联合推演,综合目标物位置、速度、加速度、道路结构及历史动线,生成高置信度未来状态预测。

通过“记住过去、理解现在、预判未来”,小鹏物理世界基座模型真正建立起时间意识。同时,新版引入MoT(Mixture of Tasks)混合架构,依据城区通行、园区泊车、高速领航等不同任务动态调度专用子模型,有效隔离场景干扰,提升多任务切换下的稳定性与鲁棒性。

“为何需要更大模型?”答案在于泛化力——更强的参数规模是支撑全球道路适应性、长尾场景覆盖与快速市场落地的基础。第二代VLA端侧参数量达主流VLA的15倍以上,结合6秒前瞻预测、30秒长时序记忆与300%响应提速,驱动多维综合安全能力提升20倍。

本次升级不止于智驾进化,更是一次整车智能范式的重构:小鹏首次推出整车大脑Master Agent,基于自研Omni全模态大模型,实现VLA与VLM的深度驾舱融合。它不仅能解析自然语言与模糊指令(如“有点热,找个地方停一下”),更能主动拆解用户意图,协同调度智驾、底盘、座舱、车身控制等垂直Agent,完成从“听懂一句话”到“理解一件事、执行一整套动作”的闭环。这是车辆首次拥有统一智能中枢,迈向自主意图理解与任务协同执行的新阶段。

功能层面,新版同步上线“语音靠边停车”“语音控制就近泊入”等无感交互能力——用户仅需一句语音指令,车辆即可在智驾状态下自主搜索合规车位、规划路径并完成泊车,真正实现“指令即服务”。Robotaxi的L4级核心能力,正通过同源技术持续反哺量产车,推动高阶智驾体验走向普惠化、自然化。

一套AI底座,打通汽车与机器人:物理AI进入规模化复用新阶段

小鹏集团定位为“物理AI世界的出行探索者,面向全球的具身智能公司”。其核心价值不仅在于单点任务性能,更在于将真实世界中习得的通用能力,跨本体、跨任务、跨地域持续迁移复用,推动物理AI从专用智能迈向通用智能。

基于统一技术底座,第二代VLA已实现L2–L4能力贯通,并加速向更高阶演进。搭载该模型的小鹏Robotaxi近日获颁广州市智能网联汽车远程测试许可,可在广州一、二、三级道路开展主驾无安全员测试,正式迈入“主驾无人”关键验证阶段。

该能力亦正延伸至机器人领域:小鹏通用人形机器人IRON搭载3颗图灵AI芯片,端侧算力高达2250 TOPS。依托行业领先的硬件基础,小鹏物理世界基座模型已完成端侧部署,无需云端依赖或远程遥操作,即可独立完成复杂作业任务,在保障低时延与数据安全前提下,实现真正的自主具身智能。

8月24日,小鹏机器人业务完成首轮股权融资,金额超9亿美元,投后估值逾63亿美元,刷新中国具身智能领域单轮私募融资纪录。IDG资本领投,高榕创投参投,并获腾讯、阿里巴巴战略支持——资本市场高度认可小鹏在物理AI领域的技术纵深、量产转化能力与长期商业潜力,也印证了“汽车→机器人”技术延伸路径的可行性与领先性。

物理AI基座的持续进化,亦致力于科技普惠:小鹏通过学习式Token压缩与蒸馏训练,在不损失输入信息质量与模型容量的前提下,以更精简的计算开销实现高质量视觉理解。蒸馏版图灵VLA 2.0 Lite已具备显著城区智驾能力提升,预计9月起向老车主推送,小鹏G9L Max版本将首发搭载。

全球化部署同步加速:小鹏第二代VLA近期在德国完成本地化验收测试。这套基于中国海量城市场景训练的模型,在极少新增本地数据条件下,德国城市道路实测表现与国内高度一致。小鹏计划于2027年上半年率先在欧洲获得监管批准,并向海外用户交付第二代VLA,推动高阶智驾真正实现全球普惠。

物理AI是长期工程,护城河在于AI Infra的持续沉淀与复利效应

物理AI的终极竞争,不在单次模型峰值性能,而在支撑其持续进化的AI基础设施(AI Infra)能力。小鹏过去数年持续投入建设覆盖数据采集、模型训练、仿真验证、实车评估、边缘部署与异构算力的全栈AI Infra体系,以自动驾驶为首个规模化落点,构建“真实世界采集→模型训练→闭环验证→用户反馈→持续迭代”的正向飞轮。

依托百万级车队与十亿级真实路测数据资产,小鹏构建高效数据飞轮:通过统一存储、多模态检索与规模化挖掘,将原始数据转化为高质量训练资产。当前单次模型训练数据吞吐量已达1亿clips,半年内增长10倍。经结构化、语义化与问题标签化处理,海量数据可精准定位未知Corner Case,并快速反哺模型迭代,形成“数据越多→问题发现越深→模型进化越快→产出更多优质数据”的强正循环。

随着数据规模、训练效率、工具链成熟度与算力基建的协同提升,小鹏AI Infra的规模效应与复利价值日益凸显——数据壁垒正逐步固化,成为难以复制的长期护城河。

模型会迭代,产品会更新,但真正构筑长期竞争力的,是支撑其不断进化的基础设施能力。第二代VLA的每一次升级,都是这一体系高效运转的结果;其价值也不再局限于单一车型,而是正跨越汽车、人形机器人、飞行汽车等多元本体,持续拓展物理AI与真实世界交互的广度与深度——从一辆智能汽车,到一个通用智能体,最终通向更广阔的物理世界智能生态。