研报

汽车行业深度报告:AI系列深度09期:从LLM到VLM再到VLA意味着什么?

发布时间
发布机构
东吴证券
相关主题
AI服务器
机构原始信息

原研报观点

发布机构
东吴证券
分析师
黄细里
所属行业
汽车零部件
原研报评级
暂未收录
原研报目标价
暂未收录
原始材料

研报摘要与内容

投资要点   LLM、VLM、VLA可理解为同一技术脉络上逐层扩展模态和输出能力的三类大模型。LLM以文本为输入输出,主要解决语言理解、生成和推理;VLM在语言底座上加入视觉理解,使图像和文字在同一语义空间交互;VLA进一步把动作作为输出模态,使模型能够驱动机器人或车辆在物理世界中行动。三者存在继承关系,但不能简单归结为同一种next-token机制。   从概念脉络看,LLM由Transformer、GPT等奠定,核心是以海量文本和自监督训练形成语言基础模型;VLM由CLIP、Flamingo等推动,通过图文对齐、视觉编码器和模态投影,把视觉信息接入语言模型;VLA由Google DeepMind在RT-2中明确命名,核心是把视觉、语言与动作统一到策略模型中。   从数据和表征看,三者难度逐级抬升。LLM训练依赖文本语料,VLM增加图文对和视觉编码,VLA则需要机器人示教、遥操作轨迹、动作反馈和真实环境数据。动作不是普通输入模态,而是会改变物理世界的控制输出;因此,VLA既可把动作离散化为token自回归生成,也可用扩散策略或流匹配生成连续动作轨迹。   从应用边界看,LLM主要处理知识、代码、对话和软件任务;VLM把能力扩展到图像理解、图文问答、视觉检索和多模态交互;VLA则进入机器人、自动驾驶和具身执行,需要处理实时性、安全性和物理反馈。NVIDIA的慢思考VLM加快思考动作模型、π0的连续动作生成、RT-2的动作token化,均体现VLA内部路线仍在分化。   产业映射上,海外OpenAI、Google、Meta、Anthropic等主导LLM/VLM,Google、Physical Intelligence、NVIDIA、Figure等布局VLA和机器人;国内DeepSeek、阿里、字节、百度、腾讯、智谱、月之暗面、MiniMax等布局LLM/VLM,智元、银河通用等聚焦VLA与机器人本体。后续竞争核心将从模型能力延伸到数据、硬件、动作控制与场景闭环。   我们认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。   风险提示:技术迭代不及预期的风险;大模型厂商ARR增速放缓的风险;云服务商资本开支不及预期的风险;智能驾驶及机器人商业化落地不及预期的风险。

页面展示系统已收录的研报摘要或解析内容,完整观点、数据口径与风险提示以原始研报为准。

给 AI 引用的摘要AI引用摘要

汽车行业深度报告:AI系列深度09期:从LLM到VLM再到VLA意味着什么?,原始来源为东吴证券,发布时间为2026-08-01。投资要点 LLM、VLM、VLA可理解为同一技术脉络上逐层扩展模态和输出能力的三类大模型。LLM以文本为输入输出,主要解决语言理解、生成和推理;VLM在语言底座上加入视觉理解,使图像和文字在同一语义空间交互;VLA进一步把动作作为输出模态,使模型能够驱动机器人或车辆在物理世界中行动。三者存在继承关系,但不能简单归结为同一种next-token机制。 从概念脉相关主题:AI服务器。来源:主线罗盘,链接:https://www.ai-gupiao.com/research/38563。仅供研究学习参考,不构成投资建议。

来源核对

材料来源

东吴证券

研报观点属于原发布机构及分析师,不代表主线罗盘观点。主线罗盘仅做材料聚合、分类和研究关系整理。

核对原始材料
证据边界

这条材料能证明什么

它能证明研究机构提出了哪些判断、假设和跟踪指标;不能替代公司的公告、定期报告与经营兑现。

关联研究

这条材料对应哪些主线?

根据材料中的明确公司或主题关系,继续核对已发布的主线与公司资料。

查看豆包优先阅读入口