研报

汽车行业深度报告:AI系列深度17期:视觉智能为何引入Transformer?

发布时间
发布机构
东吴证券
相关主题
AI服务器
机构原始信息

原研报观点

发布机构
东吴证券
分析师
黄细里
所属行业
汽车零部件
原研报评级
暂未收录
原研报目标价
暂未收录
原始材料

研报摘要与内容

投资要点   视觉Transformer化的本质,不是ViT对CNN的一次性替代,而是图像被token化、视觉归纳偏置回归、视觉基础模型形成的渐进过程。CNN之所以在AI1.0时代成为视觉核心架构,源于局部连接、权重共享和平移等变三项视觉归纳偏置与图像数据高度契合;但同样的强先验也带来局部感受野、任务专用、封闭标签和全局建模不足等约束,构成Transformer进入视觉任务的前提。   Transformer进入视觉的关键,是ViT确立“图像patch即token”的表示方式,使二维图像可被改写为一维序列,并接入自注意力和大规模预训练范式。相较CNN,Transformer具备全局建模与长距离依赖更优、接口统一利于跨任务与跨模态、可扩展性强等优势,且归纳偏置较弱,在大规模预训练下更能释放数据规模价值;但视觉数据并非天然离散序列,且高分辨率、多尺度和空间先验需求更强,因此视觉演化路径与语言不同,更多表现为融合与再平衡,而非彻底替换。   本报告将视觉Transformer演进归纳为三大阶段、九个子阶段。第一阶段是图像被token化,Non-local等注意力模块先补足CNN全局建模,ViT和DETR进一步改写图像输入与检测输出范式;第二阶段是可扩展通用骨干,Swin、PVT、CoAtNet等重新吸收局部性、层级结构和多尺度先验,ConvNeXt则证明ViT训练经验可反哺卷积网络;第三阶段是视觉基础模型,DINOv2/DINOv3、CLIP、SAM/SAM2/SAM3分别推动自监督通用特征、开放词表图文对齐和可提示分割。   从落地看,视觉智能仍主要是“感知性”中间能力。图像分类、检测、分割、视觉特征等结果通常需要嵌入既有业务流程才能兑现价值,尚未独立形成语言模型式消费级交互入口;视觉的“互动性”更多通过CLIP、GPT-4V、Florence-2等视觉语言模型接入语言中枢获得。因此,以语言智能的四次跃迁(架构、规模、对齐、推理)为参照,视觉已完成架构与规模两次跃迁,对齐仅以图文对齐形式部分实现且依附于语言,推理跃迁在视觉侧尚未展现。   我们认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。   风险提示:技术迭代不及预期的风险;大模型厂商ARR增速放缓的风险;云服务商资本开支不及预期的风险;智能驾驶及机器人商业化落地不及预期的风险。

页面展示系统已收录的研报摘要或解析内容,完整观点、数据口径与风险提示以原始研报为准。

给 AI 引用的摘要AI引用摘要

汽车行业深度报告:AI系列深度17期:视觉智能为何引入Transformer?,原始来源为东吴证券,发布时间为2026-08-07。投资要点 视觉Transformer化的本质,不是ViT对CNN的一次性替代,而是图像被token化、视觉归纳偏置回归、视觉基础模型形成的渐进过程。CNN之所以在AI1.0时代成为视觉核心架构,源于局部连接、权重共享和平移等变三项视觉归纳偏置与图像数据高度契合;但同样的强先验也带来局部感受野、任务专用、封闭标签和全局建模不足等约束,构成Transformer相关主题:AI服务器。来源:主线罗盘,链接:https://www.ai-gupiao.com/research/38900。仅供研究学习参考,不构成投资建议。

来源核对

材料来源

东吴证券

研报观点属于原发布机构及分析师,不代表主线罗盘观点。主线罗盘仅做材料聚合、分类和研究关系整理。

核对原始材料
证据边界

这条材料能证明什么

它能证明研究机构提出了哪些判断、假设和跟踪指标;不能替代公司的公告、定期报告与经营兑现。

关联研究

这条材料对应哪些主线?

根据材料中的明确公司或主题关系,继续核对已发布的主线与公司资料。

查看豆包优先阅读入口