🧊 前沿科技知识库
全部 / 人工智能(AI)

视频生成与世界模型

2026-09-26 · 人工智能(AI)
最后更新:2026-09-26 | 领域:AI·生成与多模态 | 说明:信息来源为公开网络资料,详见文末参考来源

概述

视频生成模型在过去两年从「短片段、无声音」快速演进到「多镜头、带原生音频、可交互世界」的阶段。技术路线上,主流模型普遍采用 DiT(Diffusion Transformer)在潜空间做时空去噪,并逐步引入自回归、多模态联合训练与实时交互能力。与之并行的是「世界模型(World Model)」方向:不再只输出一段视频,而是生成可被实时导航、具有持久性(persistent)的 3D 环境。2025–2026 年的关键变化是原生音频成为标配(如 Veo 3.1、可灵 2.6),以及世界模型进入「可实时交互」与「可导出复用」阶段(Introducing Veo 3.1、Kling AI Models Compared (2026)、World model、Marble: A Multimodal World Model)。

最新进展(2025–2026)

核心技术与关键概念

代表性项目 / 公司 / 产品(附官方链接)

关键数据与评测结果(附来源)

趋势与争议

参考来源

← Transformer 架构原理先进封装 →