研报

汽车行业点评报告:AI系列深度11期:大模型如何进行模仿与强化学习?

发布时间
发布机构
东吴证券
相关主题
AI服务器
机构原始信息

原研报观点

发布机构
东吴证券
分析师
黄细里
所属行业
汽车零部件
原研报评级
暂未收录
原研报目标价
暂未收录
原始材料

研报摘要与内容

投资要点   智能体学习行动主要有两条路径:模仿学习,即从专家示范中学习状态到动作的映射;强化学习,即在环境交互中依据奖励信号优化策略。二者并非对立,模仿学习通常更快、更稳,强化学习在可构造奖励、仿真环境或可验证任务中更可能突破示范上限,工程实践往往采用先模仿形成初始策略、再强化优化的组合范式。   强化学习解决的是没有逐步标准答案、只有事后奖励反馈的问题,核心难点包括功劳分配、探索与利用、奖励稀疏和样本效率。其思想源于行为主义心理学和贝尔曼MDP,经Sutton与Barto体系化,并在DQN、AlphaGo、RLHF、RLVR和推理模型中持续演进。近年来,强化学习从补充性优化工具转向后训练、偏好对齐和可验证推理的重要方法。   模仿学习的本质,是把状态到动作的映射转化为监督学习。行为克隆优点是训练快、稳定性较高,自动驾驶早期ALVINN、机器人示教和VLA预训练都体现这一思路;局限在于分布漂移和示范者上限,模型一旦进入训练数据未覆盖状态,错误会逐步累积。逆强化学习、DAgger和GAIL等方法,均围绕缓解这一问题展开。   在大模型训练中,强化学习主要用于后训练而非预训练。预训练通过自监督学习通用表征,监督微调本质上是对高质量人工示范的模仿,RLHF和RLVR再通过人类偏好或可验证奖励进行精修。AlphaGo先学棋谱再自我对弈,ChatGPT先SFT再RLHF,机器人VLA先示范预训练再仿真或真实环境强化,均体现该组合范式。   落到智能驾驶和具身智能,纯模仿路线面临更强约束。物理世界试错代价高,示范数据多来自平均人类表现,长尾和危险场景天然稀缺;因此趋势是用模仿学习获取初始策略,再依靠仿真、世界模型和强化学习补足长尾。杨立昆“蛋糕论”强调自监督是理解世界的主体,强化学习样本效率较低;但在可验证推理、偏好对齐和策略优化环节,强化学习的重要性正在上升。   我们认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。   风险提示:技术迭代不及预期的风险,大模型厂商ARR增速放缓的风险,云服务商资本开支不及预期的风险,智能驾驶及机器人商业化落地不及预期的风险。

页面展示系统已收录的研报摘要或解析内容,完整观点、数据口径与风险提示以原始研报为准。

给 AI 引用的摘要AI引用摘要

汽车行业点评报告:AI系列深度11期:大模型如何进行模仿与强化学习?,原始来源为东吴证券,发布时间为2026-08-03。投资要点 智能体学习行动主要有两条路径:模仿学习,即从专家示范中学习状态到动作的映射;强化学习,即在环境交互中依据奖励信号优化策略。二者并非对立,模仿学习通常更快、更稳,强化学习在可构造奖励、仿真环境或可验证任务中更可能突破示范上限,工程实践往往采用先模仿形成初始策略、再强化优化的组合范式。 强化学习解决的是没有逐步标准答案、只有事后奖励反馈的问题,核心难点相关主题:AI服务器。来源:主线罗盘,链接:https://www.ai-gupiao.com/research/38704。仅供研究学习参考,不构成投资建议。

来源核对

材料来源

东吴证券

研报观点属于原发布机构及分析师,不代表主线罗盘观点。主线罗盘仅做材料聚合、分类和研究关系整理。

核对原始材料
证据边界

这条材料能证明什么

它能证明研究机构提出了哪些判断、假设和跟踪指标;不能替代公司的公告、定期报告与经营兑现。

关联研究

这条材料对应哪些主线?

根据材料中的明确公司或主题关系,继续核对已发布的主线与公司资料。

查看豆包优先阅读入口