研报

汽车行业深度报告:AI系列深度07期:CNN与ViT两类视觉骨干有何差异?

发布时间
发布机构
东吴证券
相关主题
AI服务器
机构原始信息

原研报观点

发布机构
东吴证券
分析师
黄细里
所属行业
汽车零部件
原研报评级
暂未收录
原研报目标价
暂未收录
原始材料

研报摘要与内容

投资要点   视觉骨干网络是机器视觉系统的核心模块,其作用是把原始像素转化为高层语义特征,并决定分类、检测、分割等下游任务上限。CNN与ViT是过去十余年最重要的两代视觉骨干,分别代表“将图像先验写入结构”和“将关系学习交给数据与规模”两种设计哲学;二者之争本质上是先验、数据和算力如何分工。   视觉架构大体经历四个阶段:手工特征时代依赖SIFT、HOG等专家设计;CNN崛起后,AlexNet、VGG、ResNet推动机器自动学习视觉特征;ViT通过把图像切成patch并当作token输入Transformer,使注意力机制进入视觉;2021年后,Swin、CoAtNet、ConvNeXt等推动CNN与ViT相互吸收,进入融合时代。   CNN的优势来自三项视觉归纳偏置:局部连接、权值共享和平移等变性。这些结构假设使模型在数据有限时更高效,也更适合端侧和实时部署;约束在于局部感受野逐层扩大,长程依赖建模较弱。ViT以自注意力实现第一层全局交互,弱先验、强规模化,在大数据预训练下上限更高,但对数据、算力和位置编码依赖更强。   核心争议在于ViT是否真正“强于”CNN,还是更多受益于更大数据和现代训练范式。ConvNeXt证明纯卷积配合现代训练技巧仍可追平部分ViT,MLP-Mixer也提示注意力未必是唯一变量;因此更准确的理解是,视觉架构正在从“强先验”与“弱先验”两端走向任务、数据、算力约束下的动态平衡。   产业落地呈现分层:多模态大模型和研究前沿普遍采用ViT或类Transformer视觉编码器,CLIP、SigLIP、Qwen-VL等均沿此方向推进;自动驾驶量产系统则受车端算力、时延和安全约束影响,更多采用CNN前端、BEV/Transformer融合和混合骨干。研究前沿偏ViT,车端量产偏混合,是当前现实分工。   我们认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。   风险提示:技术迭代不及预期的风险,大模型厂商ARR增速放缓的风险,云服务商资本开支不及预期的风险,智能驾驶及机器人商业化落地不及预期的风险。

页面展示系统已收录的研报摘要或解析内容,完整观点、数据口径与风险提示以原始研报为准。

给 AI 引用的摘要AI引用摘要

汽车行业深度报告:AI系列深度07期:CNN与ViT两类视觉骨干有何差异?,原始来源为东吴证券,发布时间为2026-07-30。投资要点 视觉骨干网络是机器视觉系统的核心模块,其作用是把原始像素转化为高层语义特征,并决定分类、检测、分割等下游任务上限。CNN与ViT是过去十余年最重要的两代视觉骨干,分别代表“将图像先验写入结构”和“将关系学习交给数据与规模”两种设计哲学;二者之争本质上是先验、数据和算力如何分工。 视觉架构大体经历四个阶段:手工特征时代依赖SIFT、HOG等专家设计;相关主题:AI服务器。来源:主线罗盘,链接:https://www.ai-gupiao.com/research/38493。仅供研究学习参考,不构成投资建议。

来源核对

材料来源

东吴证券

研报观点属于原发布机构及分析师,不代表主线罗盘观点。主线罗盘仅做材料聚合、分类和研究关系整理。

核对原始材料
证据边界

这条材料能证明什么

它能证明研究机构提出了哪些判断、假设和跟踪指标;不能替代公司的公告、定期报告与经营兑现。

关联研究

这条材料对应哪些主线?

根据材料中的明确公司或主题关系,继续核对已发布的主线与公司资料。

查看豆包优先阅读入口