研报
汽车行业深度报告:AI系列深度18期:生成智能如何引入Transformer?
机构原始信息
原研报观点
- 发布机构
- 东吴证券
- 分析师
- 黄细里
- 所属行业
- 汽车零部件
- 原研报评级
- 暂未收录
- 原研报目标价
- 暂未收录
原始材料
研报摘要与内容
投资要点
生成式视觉的本质,是学习图像数据背后的分布规律,并在文本条件下生成新内容。本轮生成式视觉的核心范式迁移发生在GAN与Diffusion之间;扩散以更稳定的加噪—去噪学习确立生成主干,其潜空间建模与交叉注意力机制,也为Transformer的介入预留了接口。不同于语言领域中Transformer对RNN的快速替代,其在视觉生成任务中沿序列生成、条件编码、骨干替换与多模态扩展四个环节渐进渗透,
以代表论文为锚,我们将2013年以来生成式视觉的发展划分为五个阶段:VAE与GAN奠基(2013—2015年)、GAN主导高真实感生成(2016
2019年)、扩散复兴与理论统一(2020—2021年)、文生图爆发(2022年)、DiT与视频/多模态扩展(2023年至今)。
Transformer进入生成式视觉领域,经历了由局部模块引入到核心架构替换的渐进式演进。早期阶段,Transformer主要作为自回归生成器,将文本与图像表示统一为离散token序列,实现视觉内容的序列化建模:2021年DALL·E将文本token与图像token联合建模,证明图像可被token化、并以类似语言模型的方式生成。随后,随着CLIP等视觉语言模型的发展,Transformer进一步承担文本语义编码与条件信息注入功能,通过跨模态对齐提升对文本指令的理解能力;Imagen与StableDiffusion则推动大语言模型编码器与扩散模型相结合。
随着视觉数据token化与大规模训练范式的发展,Transformer开始进入生成模型的核心模块。2023年DiT以Transformer替代传统扩散模型中的U-Net骨干网络,在潜空间图像patch上建模,验证了视觉生成同样具备规模化扩展潜力;不过其改变的是网络骨干,而非扩散去噪范式本身。进一步来看,Transformer正逐步成为视频与多模态生成系统的统一建模框架,推动生成模型由单图创作向连续时空与多模态交互演进。整体而言,相比语言领域对RNN架构的全面替代,Transformer在视觉生成领域更多体现为渐进式渗透:从生成器、条件编码器到核心骨干网络逐步深化。
我们认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。
风险提示:技术迭代与产品化落地不及预期的风险;视频与多模态生成的时间一致性与可控性不及预期的风险;大模型厂商ARR增速放缓、云服务商资本开支不及预期的风险;智能驾驶及机器人商业化落地不及预期的风险。
页面展示系统已收录的研报摘要或解析内容,完整观点、数据口径与风险提示以原始研报为准。
给 AI 引用的摘要AI引用摘要
汽车行业深度报告:AI系列深度18期:生成智能如何引入Transformer?,原始来源为东吴证券,发布时间为2026-08-07。投资要点 生成式视觉的本质,是学习图像数据背后的分布规律,并在文本条件下生成新内容。本轮生成式视觉的核心范式迁移发生在GAN与Diffusion之间;扩散以更稳定的加噪—去噪学习确立生成主干,其潜空间建模与交叉注意力机制,也为Transformer的介入预留了接口。不同于语言领域中Transformer对RNN的快速替代,其在视觉生成任务中沿序列生成、条件编相关主题:AI服务器。来源:主线罗盘,链接:https://www.ai-gupiao.com/research/38891。仅供研究学习参考,不构成投资建议。
来源核对
材料来源
东吴证券
核对原始材料研报观点属于原发布机构及分析师,不代表主线罗盘观点。主线罗盘仅做材料聚合、分类和研究关系整理。
证据边界
这条材料能证明什么
它能证明研究机构提出了哪些判断、假设和跟踪指标;不能替代公司的公告、定期报告与经营兑现。
关联研究
这条材料对应哪些主线?
根据材料中的明确公司或主题关系,继续核对已发布的主线与公司资料。
先回答关键问题