研报
汽车行业深度报告:AI系列深度22期:智能驾驶VLA模型的架构范式与厂商路线
机构原始信息
原研报观点
- 发布机构
- 东吴证券
- 分析师
- 黄细里,童明祺
- 所属行业
- 汽车零部件
- 原研报评级
- 暂未收录
- 原研报目标价
- 暂未收录
原始材料
研报摘要与内容
投资要点
智能驾驶VLA的核心,是将视觉感知、语言理解与动作决策整合进同一策略模型,并通过显式动作头弥合VLM4AD留下的动作生成缺口。从技术演进看,自动驾驶经历模块化流水线、端到端、VLM4AD再到VLA4AD:VLM能解释场景但难以直接生成可靠控制,VLA则进一步把动作作为模型输出,使语义理解与驾驶策略更紧密耦合。
VLA4AD的核心架构通常包括视觉编码器、语言处理器和动作解码器三部分。视觉编码器将摄像头、激光雷达等异构传感输入转化为隐层特征,并通过BEV、点云、体素等方式增强三维空间理解;语言处理器引入预训练大模型、LoRA或RAG等方法注入驾驶知识;动作解码器再将融合后的多模态表征转化为轨迹、控制量或动作token。
VLA4AD自身可归纳为被动解释器、规划协作者、统一动作生成器、推理中枢四个阶段;主要挑战包括鲁棒性、实时性能、数据与标注、多模态对齐、多智能体协同和评测标准化。这意味着VLA并非单一固定架构,而是自动驾驶端到端路线向大模型、多模态和动作生成继续演进的总称。
厂商路线已出现差异化。Waymo EMMA以Gemini驱动纯端到端,并将导航、状态、轨迹等统一到语言空间;理想从E2E+VLM双系统升级至MindVLA统一架构,以3D高斯、MoE和扩散动作解码组织三维理解、语义推理和轨迹生成;元戎启行以40B VLA基座设置Driver、Analyst、Critic三角色;千里CoWorld-VLA则通过多专家世界模型Token构建规划相关隐空间表征。
小鹏第二代VLA进一步弱化显式语言中间层,以原生多模态Tokenizer和视觉思维链直达动作,本质上趋近视觉—动作路线。由此可见,头部厂商在是否保留显式语言推理层上已经分化:一类强调语言作为慢思考和可解释中枢,另一类强调隐式视觉表征和动作直出。后续竞争将集中在实时性、数据闭环、评测口径和量产可靠性。
我们认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。
风险提示:技术迭代不及预期的风险,大模型厂商ARR增速放缓的风险,云服务商资本开支不及预期的风险,智能驾驶及机器人商业化落地不及预期的风险。
页面展示系统已收录的研报摘要或解析内容,完整观点、数据口径与风险提示以原始研报为准。
给 AI 引用的摘要AI引用摘要
汽车行业深度报告:AI系列深度22期:智能驾驶VLA模型的架构范式与厂商路线,原始来源为东吴证券,发布时间为2026-08-07。投资要点 智能驾驶VLA的核心,是将视觉感知、语言理解与动作决策整合进同一策略模型,并通过显式动作头弥合VLM4AD留下的动作生成缺口。从技术演进看,自动驾驶经历模块化流水线、端到端、VLM4AD再到VLA4AD:VLM能解释场景但难以直接生成可靠控制,VLA则进一步把动作作为模型输出,使语义理解与驾驶策略更紧密耦合。 VLA4AD的核心架构通常包括视觉编码相关主题:AI服务器。来源:主线罗盘,链接:https://www.ai-gupiao.com/research/38910。仅供研究学习参考,不构成投资建议。
来源核对
材料来源
东吴证券
核对原始材料研报观点属于原发布机构及分析师,不代表主线罗盘观点。主线罗盘仅做材料聚合、分类和研究关系整理。
证据边界
这条材料能证明什么
它能证明研究机构提出了哪些判断、假设和跟踪指标;不能替代公司的公告、定期报告与经营兑现。
关联研究
这条材料对应哪些主线?
根据材料中的明确公司或主题关系,继续核对已发布的主线与公司资料。
先回答关键问题