- 全球智能网联解决方案提供商 | 车联网软件生态服务 - 全球智能网联解决方案提供商 | 车联网软件生态服务

新闻中心

引入时间维度,小鹏模型迭代提供探索物理世界新思路

发布时间:2026-08-27 19:05:46  /  浏览次数:13次

  8月27日,小鹏集团举办了一场以Time(时间)为主题的技术分享会。

  这一技术分享围绕着集团第二代VLA(视觉语言动作)大模型的最新迭代成果。不同于以往侧重视觉、空间能力的升级,“时间”成为这次迭代的核心关键词,模型在底层设计上通过新增时序认知能力,优化模型架构与推理逻辑。而这也为模型探索物理AI(人工智能)提供了一种新思路。

小鹏集团发布物理AI新探索。企业供图

  从“捕捉画面”转向“理解过程”

  过去,不少智能驾驶模型,更像是一台快照相机。

  模型通过抓取道路上某一瞬间的3D画面,识别当下的车辆、行人、障碍物,从而做出决策。但它很难串联起前几秒、几十秒里发生的一连串路况变化。

  本次小鹏第二代VLA模型最核心的调整,便是在三维空间的基础上,把时间参数纳入认知框架,搭建起新的长时序架构。模型可以调取前后30秒的连续视频信息,把碎片化的画面串成完整的事件链条。

  简单来说,不再只看“这一刻路上有什么”,而是试着看懂“刚刚发生了什么,事情正如何演变”。

  分享会上,小鹏集团通用智能中心负责人刘先明谈及近一年的研发心路:“一年前,我们还在讨论怎么去追上行业标杆。今天,我们思考的问题变了:能不能面向物理AI这条赛道,拿出自己的一份探索答案。”

  智驾预判与交互逻辑优化

  新增时间维度的理解能力,最终要落到真实的行车场景里。第二代VLA调整了原有处理链路,不再严格遵循先感知、再决策、最后执行的串行流程,向着边看、边推演、边输出决策的并行模式演进,以此缩短系统整体响应耗时,尝试实现更及时的路况应对。

  企业介绍,迭代后的模型实现端到端响应提速300%。例如,一只轮胎突然从前车滚落至车道,实现“边看边想边输出决策”的车辆能够快速做出避让反应。

  除了路况预判,人车交互同样是迭代重点。新版本尝试打通视觉模型与语言模型,试着读懂驾驶员模糊、口语化的表达。例如,用户说出“帮我找附近好吃的粤菜餐厅”,系统就能够拆解需求,检索信息并规划路线。

  9月分批推送到各车型

  按照规划,第二代VLA模型将于9月分批推送至车型。

  其中,高端车型将获得完整的全量化版本。算力相对有限的单芯片车型,将获得经过模型蒸馏得到的轻量化版本。通俗来讲,蒸馏就是让完整版大模型把核心推理逻辑、判断思路沉淀下来,训练出更小的模型,在有限算力条件下,尽量保留核心能力,让更多车主能够体验到新模型带来的变化。

  更重要的是,第二代VLA模型并不只是为汽车量身定做。同样的时序理解、环境感知能力,也正在小鹏自研人形机器人IRON上开展验证。机器人需要持续感知周边环境的动态变化,避开移动障碍,规划行走路线。

  在刘先明看来,汽车和机器人面对的都是不断变化的物理世界。真正要走远,需要搭建一套能够理解动态物理世界的通用模型,汽车只是第一个落地场景。

  智能驾驶行业走到当下,单纯堆砌算力、扩充数据的红利正在逐步收窄。各家企业开始把目光投向对物理世界更深层的理解能力。小鹏第二代VLA的更新,正是国内企业在时序世界模型方向上一次具体的尝试。它在真实、复杂的城市道路中究竟表现如何,等待验证。

  来源:北京日报客户端

特别声明:以上文章内容仅代表作者本人观点,不代表新浪网观点或立场。如有关于作品内容、版权或其它问题请于作品发表后的30日内与新浪网联系。