8月27日,小鹏集团举办了一场以Time(时间)为主题的技术分享会。
这一技术分享围绕着集团第二代VLA(视觉语言动作)大模型的最新迭代成果。不同于以往侧重视觉、空间能力的升级,“时间”成为这次迭代的核心关键词,模型在底层设计上通过新增时序认知能力,优化模型架构与推理逻辑。而这也为模型探索物理AI(人工智能)提供了一种新思路。
小鹏集团发布物理AI新探索。企业供图从“捕捉画面”转向“理解过程”
过去,不少智能驾驶模型,更像是一台快照相机。
模型通过抓取道路上某一瞬间的3D画面,识别当下的车辆、行人、障碍物,从而做出决策。但它很难串联起前几秒、几十秒里发生的一连串路况变化。
本次小鹏第二代VLA模型最核心的调整,便是在三维空间的基础上,把时间参数纳入认知框架,搭建起新的长时序架构。模型可以调取前后30秒的连续视频信息,把碎片化的画面串成完整的事件链条。
简单来说,不再只看“这一刻路上有什么”,而是试着看懂“刚刚发生了什么,事情正如何演变”。
分享会上,小鹏集团通用智能中心负责人刘先明谈及近一年的研发心路:“一年前,我们还在讨论怎么去追上行业标杆。今天,我们思考的问题变了:能不能面向物理AI这条赛道,拿出自己的一份探索答案。”
智驾预判与交互逻辑优化
新增时间维度的理解能力,最终要落到真实的行车场景里。第二代VLA调整了原有处理链路,不再严格遵循先感知、再决策、最后执行的串行流程,向着边看、边推演、边输出决策的并行模式演进,以此缩短系统整体响应耗时,尝试实现更及时的路况应对。
企业介绍,迭代后的模型实现端到端响应提速300%。例如,一只轮胎突然从前车滚落至车道,实现“边看边想边输出决策”的车辆能够快速做出避让反应。
除了路况预判,人车交互同样是迭代重点。新版本尝试打通视觉模型与语言模型,试着读懂驾驶员模糊、口语化的表达。例如,用户说出“帮我找附近好吃的粤菜餐厅”,系统就能够拆解需求,检索信息并规划路线。
9月分批推送到各车型
按照规划,第二代VLA模型将于9月分批推送至车型。
其中,高端车型将获得完整的全量化版本。算力相对有限的单芯片车型,将获得经过模型蒸馏得到的轻量化版本。通俗来讲,蒸馏就是让完整版大模型把核心推理逻辑、判断思路沉淀下来,训练出更小的模型,在有限算力条件下,尽量保留核心能力,让更多车主能够体验到新模型带来的变化。
更重要的是,第二代VLA模型并不只是为汽车量身定做。同样的时序理解、环境感知能力,也正在小鹏自研人形机器人IRON上开展验证。机器人需要持续感知周边环境的动态变化,避开移动障碍,规划行走路线。
在刘先明看来,汽车和机器人面对的都是不断变化的物理世界。真正要走远,需要搭建一套能够理解动态物理世界的通用模型,汽车只是第一个落地场景。
智能驾驶行业走到当下,单纯堆砌算力、扩充数据的红利正在逐步收窄。各家企业开始把目光投向对物理世界更深层的理解能力。小鹏第二代VLA的更新,正是国内企业在时序世界模型方向上一次具体的尝试。它在真实、复杂的城市道路中究竟表现如何,等待验证。
来源:北京日报客户端
- 全球智能网联解决方案提供商 | 车联网软件生态服务