- 全球智能网联解决方案提供商 | 车联网软件生态服务 - 全球智能网联解决方案提供商 | 车联网软件生态服务

新闻中心

何小鹏:TuringViT给物理世界一双“看得懂”的眼睛|快讯

发布时间:2026-08-27 20:08:50  /  浏览次数:11次

  封面新闻记者 李继龙

  随着人工智能加速进入汽车、机器人等真实物理场景,行业竞争也开始从智能驾驶、智能座舱等应用层,进一步向大模型、视觉感知等底层能力延伸。特别是在高分辨率、多摄像头以及连续视频成为重要输入信息后,视觉模型的效率与场景适配能力也成为行业关注的重点。

  8月27日,小鹏集团正式发布TuringViT高效视觉编码器,进一步完善其物理AI底层技术布局。据悉,TuringViT将面向智能驾驶、智能座舱以及IRON人形机器人三大业务场景应用。今年上半年,小鹏还陆续发布了多视角生成式世界模型X-World、世界模型推理加速引擎X-Cache、预测式世界模型X-Foresight及X-Mind技术框架。

  此次发布的TuringViT,主要从模型架构、数据治理和训练方式三个方面进行调整。其中,针对传统视觉模型在高分辨率场景下计算成本较高的问题,TuringViT采用以线性注意力为主的混合架构,使计算复杂度由二次方下降至接近线性。官方测试数据显示,在1536×1536分辨率下,TuringViT-18L的推理吞吐量达到Seed1.5-ViT的3.04倍,相比SigLIP2-ViT-L提升2.16倍。

  数据效率则是此次技术发布的另一看点。不同于单纯扩大训练数据规模,小鹏通过VISTA-Curation多模态数据治理流程,对图片、文本及视频数据进行筛选和处理。据官方披露,TuringViT仅使用0.85B图文对,约为SigLIP2-L训练数据规模的10%,便在ImageNet-1K等六项零样本分类基准上取得83.6%的平均准确率,并超过使用10B数据训练的主流开源基线。

  值得关注的是,TuringViT并非只服务于智能汽车。在智能驾驶领域,其将作为第二代VLA系统的核心视觉编码器,处理多路摄像头采集的动态道路信息,为窄路通行、复杂路口以及长尾交通参与者识别等场景提供支持;在智能座舱领域,则将进一步强化视觉与语言模型之间的协同。

  与此同时,在小鹏IRON人形机器人的技术体系中,TuringViT也将承担视觉感知功能,用于物体识别、空间关系理解以及动态环境追踪等,并尝试将智能驾驶领域积累的视觉能力迁移至机器人场景。

  从智能汽车到人形机器人,小鹏正在尝试以统一的视觉底座连接不同物理AI业务场景。随着AI技术进一步向真实物理场景渗透,汽车行业的竞争维度也正在从功能体验,进一步延伸至模型效率、数据能力和底层技术体系。

特别声明:以上文章内容仅代表作者本人观点,不代表新浪网观点或立场。如有关于作品内容、版权或其它问题请于作品发表后的30日内与新浪网联系。