研报

汽车行业深度报告:AI系列深度25期:从模仿学习到强化学习的范式跃迁

发布时间
发布机构
东吴证券
相关主题
AI服务器
机构原始信息

原研报观点

发布机构
东吴证券
分析师
黄细里,童明祺
所属行业
汽车零部件
原研报评级
暂未收录
原研报目标价
暂未收录
原始材料

研报摘要与内容

投资要点   模仿学习的能力上限在数字AI与物理AI之间存在结构性分野。大语言模型预训练本质上是对互联网级人类知识的规模化模仿,学习对象覆盖公开语料中的多领域知识,广度上限高于单一专家,因此可形成较高能力底座;自动驾驶端到端模型主要学习人类驾驶轨迹,而L4安全目标要求显著超越平均人类表现,模仿学习天花板约束更强。   闭环驾驶会放大模仿学习的结构性缺陷。行为克隆在训练分布内表现稳定,但一旦进入示范数据未覆盖状态,模型输出偏差会推动车辆进入新的状态分布,形成协变量漂移;长尾、危险和事故场景也难以依靠真实道路主动采集。强化学习因而不只是后训练补强,而是驾驶模型突破模仿边界的重要环节。   强化学习与世界模型在物理AI中形成双向共生。真实道路无法承担反复试错、失败重置和危险事件注入,世界模型因此成为策略训练、奖励设计与安全验证的闭环试错场;同时,真实数据回流与策略训练也会暴露仿真偏差,推动世界模型持续校准。   产业实践正在向“端到端+世界模型仿真+强化学习后训练”收敛,但具体路线仍有分化。特斯拉、小鹏、理想、Momenta、地平线、千里科技、卓驭、元戎启行等均已公开将强化学习纳入训练链路;小鹏、理想、元戎、千里更偏向VLA或多模态路线,华为、Momenta、地平线相对弱化语言中介,更强调世界模型构建与强化学习闭环。   L4Robotaxi路线更关注大规模闭环仿真、安全冗余和超越人类驾驶水平。小马智行PonyWorld等公开表述突出强化学习范式和世界模型仿真,Waymo、文远知行则更多强调基础模型、大规模仿真和端到端能力建设。行业共性是以仿真环境承载闭环训练,差异集中在语言中介、强化学习披露程度和量产辅助驾驶/L4运营定位。   我们认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。   风险提示:技术迭代不及预期的风险;大模型厂商ARR增速放缓的风险;云服务商资本开支不及预期的风险;智能驾驶及机器人商业化落地不及预期的风险。

页面展示系统已收录的研报摘要或解析内容,完整观点、数据口径与风险提示以原始研报为准。

给 AI 引用的摘要AI引用摘要

汽车行业深度报告:AI系列深度25期:从模仿学习到强化学习的范式跃迁,原始来源为东吴证券,发布时间为2026-08-07。投资要点 模仿学习的能力上限在数字AI与物理AI之间存在结构性分野。大语言模型预训练本质上是对互联网级人类知识的规模化模仿,学习对象覆盖公开语料中的多领域知识,广度上限高于单一专家,因此可形成较高能力底座;自动驾驶端到端模型主要学习人类驾驶轨迹,而L4安全目标要求显著超越平均人类表现,模仿学习天花板约束更强。 闭环驾驶会放大模仿学习的结构性缺陷。行为克隆在训相关主题:AI服务器。来源:主线罗盘,链接:https://www.ai-gupiao.com/research/38918。仅供研究学习参考,不构成投资建议。

来源核对

材料来源

东吴证券

研报观点属于原发布机构及分析师,不代表主线罗盘观点。主线罗盘仅做材料聚合、分类和研究关系整理。

核对原始材料
证据边界

这条材料能证明什么

它能证明研究机构提出了哪些判断、假设和跟踪指标;不能替代公司的公告、定期报告与经营兑现。

关联研究

这条材料对应哪些主线?

根据材料中的明确公司或主题关系,继续核对已发布的主线与公司资料。

查看豆包优先阅读入口