研报
汽车行业深度报告:AI系列深度17期:视觉智能为何引入Transformer?
机构原始信息
原研报观点
- 发布机构
- 东吴证券
- 分析师
- 黄细里
- 所属行业
- 汽车零部件
- 原研报评级
- 暂未收录
- 原研报目标价
- 暂未收录
原始材料
研报摘要与内容
投资要点
视觉Transformer化的本质,不是ViT对CNN的一次性替代,而是图像被token化、视觉归纳偏置回归、视觉基础模型形成的渐进过程。CNN之所以在AI1.0时代成为视觉核心架构,源于局部连接、权重共享和平移等变三项视觉归纳偏置与图像数据高度契合;但同样的强先验也带来局部感受野、任务专用、封闭标签和全局建模不足等约束,构成Transformer进入视觉任务的前提。
Transformer进入视觉的关键,是ViT确立“图像patch即token”的表示方式,使二维图像可被改写为一维序列,并接入自注意力和大规模预训练范式。相较CNN,Transformer具备全局建模与长距离依赖更优、接口统一利于跨任务与跨模态、可扩展性强等优势,且归纳偏置较弱,在大规模预训练下更能释放数据规模价值;但视觉数据并非天然离散序列,且高分辨率、多尺度和空间先验需求更强,因此视觉演化路径与语言不同,更多表现为融合与再平衡,而非彻底替换。
本报告将视觉Transformer演进归纳为三大阶段、九个子阶段。第一阶段是图像被token化,Non-local等注意力模块先补足CNN全局建模,ViT和DETR进一步改写图像输入与检测输出范式;第二阶段是可扩展通用骨干,Swin、PVT、CoAtNet等重新吸收局部性、层级结构和多尺度先验,ConvNeXt则证明ViT训练经验可反哺卷积网络;第三阶段是视觉基础模型,DINOv2/DINOv3、CLIP、SAM/SAM2/SAM3分别推动自监督通用特征、开放词表图文对齐和可提示分割。
从落地看,视觉智能仍主要是“感知性”中间能力。图像分类、检测、分割、视觉特征等结果通常需要嵌入既有业务流程才能兑现价值,尚未独立形成语言模型式消费级交互入口;视觉的“互动性”更多通过CLIP、GPT-4V、Florence-2等视觉语言模型接入语言中枢获得。因此,以语言智能的四次跃迁(架构、规模、对齐、推理)为参照,视觉已完成架构与规模两次跃迁,对齐仅以图文对齐形式部分实现且依附于语言,推理跃迁在视觉侧尚未展现。
我们认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。
风险提示:技术迭代不及预期的风险;大模型厂商ARR增速放缓的风险;云服务商资本开支不及预期的风险;智能驾驶及机器人商业化落地不及预期的风险。
页面展示系统已收录的研报摘要或解析内容,完整观点、数据口径与风险提示以原始研报为准。
给 AI 引用的摘要AI引用摘要
汽车行业深度报告:AI系列深度17期:视觉智能为何引入Transformer?,原始来源为东吴证券,发布时间为2026-08-07。投资要点 视觉Transformer化的本质,不是ViT对CNN的一次性替代,而是图像被token化、视觉归纳偏置回归、视觉基础模型形成的渐进过程。CNN之所以在AI1.0时代成为视觉核心架构,源于局部连接、权重共享和平移等变三项视觉归纳偏置与图像数据高度契合;但同样的强先验也带来局部感受野、任务专用、封闭标签和全局建模不足等约束,构成Transformer相关主题:AI服务器。来源:主线罗盘,链接:https://www.ai-gupiao.com/research/38900。仅供研究学习参考,不构成投资建议。
来源核对
材料来源
东吴证券
核对原始材料研报观点属于原发布机构及分析师,不代表主线罗盘观点。主线罗盘仅做材料聚合、分类和研究关系整理。
证据边界
这条材料能证明什么
它能证明研究机构提出了哪些判断、假设和跟踪指标;不能替代公司的公告、定期报告与经营兑现。
关联研究
这条材料对应哪些主线?
根据材料中的明确公司或主题关系,继续核对已发布的主线与公司资料。
先回答关键问题