研报
人工智能行业:OpenAI推出新一代音视频工具Sora 2-月度跟踪
机构原始信息
原研报观点
- 发布机构
- 爱建证券
- 分析师
- 许亮
- 所属行业
- 综合
- 原研报评级
- 16
- 原研报目标价
- 暂未收录
原始材料
研报摘要与内容
<p>引子:2025 年 9 月 30 日,OpenAI 推出新一代音频、视频生成模型 Sora 2,并同步上线独</p><p>立 iOS 应用。Sora 2 被 OpenAI 誉为"视频领域的 GPT-3.5 时刻",此次更新不仅在视频生成</p><p>质量上实现了显著提升,更首次支持了与画面精准匹配的原生音频生成,标志着 AI 视频生成</p><p>技术迈入一个全新的发展阶段。</p><p> Sora 采用 DIT 架构,性能优于同期发布模型。2024 年 2 月 16 日,OpenAI 发布首个文本</p><p>生成视频模型 Sora,其核心采用 Diffusion Transformer 深度融合架构,依托自注意力机制</p><p>等设计,可增强视频帧间连贯性与文本与视觉语义的匹配精准度。相较于 Gen-2、Lumiere</p><p>等同期模型,Sora 的优势尤为突出:1)生成时长达 60 秒,远超 Gen-2(18 秒)、Lumiere</p><p>(5 秒)、MoonValley(6 秒)的上限,能承载更具叙事性的创作需求;2)生成类型覆盖</p><p>T2V(文生视频)、I2V(图生视频)、V2V(视频生视频),并额外支持 VFI(视频插帧),</p><p>多模态创作能力更全面;3)技术架构上,凭借 Diffusion Transformer 的特性,时序一致性</p><p>表现更佳,可减少画面闪烁、物体运动不连贯等问题,让动态视觉效果更贴近真实场景。</p><p> OpenAI Sora 2 相较于初代实现了多维度的卓越升级。1)在音视频同步方面,其彻底解决</p><p>了初代的无声局限,可基于文本指令原声生成贴合场景的完整音效,无论是人物说话时的语</p><p>音与环境音、奔跑场景的脚步声与风声,还是钢琴演奏的琴键声与空间回响等,均能自动匹</p><p>配,无需后期额外配音,实现“声画一体”的创作体验;2)物理模拟精度上,Sora 2 实现</p><p>了突破性提升:针对初代水流不自然问题,升级水、烟雾等流体模拟使其更贴合现实场景;</p><p>通过精准模拟重力、惯性与摩擦力,修正了物体飘浮、碰撞反馈不真实等缺陷;同时让人物</p><p>动作严密符合人体工学,有效解决动作僵硬问题。对比测试显示,其在人物走路、水流动态</p><p>等场景的真实度提升 36%-70%,其中水流动态提升最为显著。3)此外,Sora 2 新增“Cameo”</p><p>功能,用户通过短暂的视频与音频采集,即可将自身或他人的形象与声音植入模型,后续能</p><p>在任意场景中高度保真地呈现该角色,极大拓展了角色互动可能性,丰富了个性化创作与社</p><p>交体验</p><p><br/></p>
页面展示系统已收录的研报摘要或解析内容,完整观点、数据口径与风险提示以原始研报为准。
给 AI 引用的摘要AI引用摘要
人工智能行业:OpenAI推出新一代音视频工具Sora 2-月度跟踪,原始来源为爱建证券,发布时间为2025-10-21。<p>引子:2025 年 9 月 30 日,OpenAI 推出新一代音频、视频生成模型 Sora 2,并同步上线独</p><p>立 iOS 应用。Sora 2 被 OpenAI 誉为"视频领域的 GPT-3.5 时刻",此次更新不仅在视频生成</p><p>质量上实现了显著提升,更首次支持了与画面精准匹配的原生音频生成,标志着 AI 视频生相关主题:AI服务器。来源:主线罗盘,链接:https://www.ai-gupiao.com/research/15734。仅供研究学习参考,不构成投资建议。
来源核对
材料来源
爱建证券
核对原始材料研报观点属于原发布机构及分析师,不代表主线罗盘观点。主线罗盘仅做材料聚合、分类和研究关系整理。
证据边界
这条材料能证明什么
它能证明研究机构提出了哪些判断、假设和跟踪指标;不能替代公司的公告、定期报告与经营兑现。
关联研究
这条材料对应哪些主线?
根据材料中的明确公司或主题关系,继续核对已发布的主线与公司资料。
先回答关键问题