07. 最新论文追踪 (Paper Tracker)
本页追踪 arXiv/GitHub 上关于世界模型 (非具身智能)、交互视频生成、游戏模拟的最新研究。按发布日期从新到旧排列。
📌 按年月折叠浏览(默认展开最近 3 个月)。
🗂️ 按月折叠浏览
📅 2026年2月
很多“从视频里学动作”的方法,会学出一套只在某个场景里好用的“暗号”:换个房间、换个视角,同一个动作的 latent 表示就变了。Olaf‑World 的目标是把 latent action “摆正方向”:让同一个动作在不同场景里仍对应同一语义,这样才能把世界模型从“会复现”升级为“会迁移”。
- 问题:latent actions 不可迁移:标准 latent action learning 目标多在 clip 内优化,缺乏跨上下文对齐机制,导致 latent action 纠缠了场景外观/布局等“clip-specific basis”。[来源]
- 关键洞察:用“可观测的控制效果”做共享参考:虽然 action 本身不可观测,但 action 带来的语义效果可通过视频表征的时间差分来捕捉,并用于跨上下文对齐。[来源]
- 方法:Seq∆‑REPA:提出 sequence-level 的 control-effect alignment,把“整段 latent action(integrated latent action)”锚定到冻结的自监督视频编码器所产生的 temporal feature differences 上,从而对齐动作语义。[来源]
- 效果(可追溯口径):论文宣称学到更结构化的 latent action space,从而带来更强的 zero-shot action transfer,以及对新控制接口更省标注的数据高效适配。[来源]
做 GUI 智能体(点按钮、填表单)最怕“手滑一步错、后面全崩”。Code2World 提供一个“沙盒世界模型”:给当前界面 + 一个动作,模型先预测下一屏会变成什么样,让智能体像人一样先“脑内预演”,再决定要不要真的点下去。它的关键做法不是直接画下一张截图,而是生成可渲染的 HTML 代码。
- 表征选择:renderable code:作者认为 text-based 过于抽象、pixel-based 难以保证结构可控,提出用可渲染代码生成来模拟下一状态,从而兼顾视觉保真与结构可控。[来源]
- 数据:AndroidCode(80K+ screen-action pairs):将 GUI 轨迹翻译为高保真 HTML,并通过 visual-feedback revision 机制提升合成代码质量,以缓解数据稀缺。[来源] [Dataset]
- 训练:Render-Aware RL:先做 SFT 冷启动格式/布局跟随,再用“渲染结果”作为 reward 信号,约束视觉语义保真与 action consistency。[来源]
- 结果(可追溯口径):论文报告 Code2World‑8B 在 next‑UI prediction 上表现强,并宣称可提升下游导航成功率(例如提升 Gemini‑2.5‑Flash 在 AndroidWorld navigation 上 +9.5%)。[来源]
Code2World 代表了“世界模型”在 GUI 领域的一条很务实路线:用可执行/可渲染的中间表示(HTML)替代“纯文本想象”或“像素涂鸦”。这对工程落地特别关键:它天然支持结构约束、可编辑、可对齐 action 语义。建议后续把它当作“可控预测器”接入代理系统的回归测试:预测正确率、关键控件一致性、以及高风险动作(支付/删除)前的预演可靠性。
机器人“想象未来再行动”常见问题是:想象得像,但不一定几何上真实;而且“从想象到动作”的反推也可能一对多很难。MVISTA‑4D 的方向是:从单视角 RGBD 出发,先想象出其它视角并融合成更完整的 3D,再用“测试时优化”反向求出最匹配的动作轨迹。
- 多视角 + 跨模态一致的 4D 预测:给定单视角 RGBD,生成任意视角的未来 RGBD,并通过 cross-view / cross-modality feature fusion 强化 RGB‑Depth 一致与几何对齐。[来源]
- 动作推断:test-time action optimization:将整段动作轨迹表示为低维 latent code,通过对生成模型反向传播优化该 latent,使其与预测未来匹配,并用 residual inverse dynamics 将先验转成可执行动作。[来源]
- 结果(可追溯口径):作者报告在 4D 场景生成与下游 manipulation 上取得强表现,并提供消融分析关键设计选择。[来源]
这篇更偏“具身/操作”,但它给交互世界模型一个很强的系统信号:动作不是逐步 token,而是轨迹级结构。用 test-time optimization 反推动作 latent 的做法,也提醒我们:world model 不一定要显式输出动作序列,反而可以把动作当成“可搜索的潜变量”,用规划/优化闭环来对齐未来。这条路线的工程代价(反向优化的延迟预算)会是落地关键。
要做“能边玩边生成”的交互视频,大家常见做法是:把一个很强的离线视频扩散模型“蒸馏”成少步数、可流式的自回归模型。但这篇论文指出:如果直接把“能看未来帧”的老师,硬蒸馏成“只能看过去”的学生,学生会学歪——画面就会糊、动作也不稳。Causal Forcing 的核心是:先造一个同样因果的老师,再做蒸馏,把架构差异从源头解决。
- 问题:蒸馏的“架构鸿沟”:现有方法把双向(full attention)视频扩散 teacher 蒸馏为因果(causal attention)的 AR student;作者指出这种做法在 ODE distillation 的理论前提上会出错。[来源]
- 关键分析:frame-level injectivity:对 AR student 来说,ODE 初始化需要“每个 noisy frame 在 AR teacher 的 PF-ODE 下对应唯一 clean frame”;若从双向 teacher 蒸馏,容易违反该条件,导致学到 conditional expectation 形式的退化解。[来源]
- 方法:Causal Forcing:用 AR teacher 做 ODE 初始化(“因果 ODE 蒸馏”),以此桥接架构鸿沟;并强调 teacher forcing 相比 diffusion forcing 更适合 AR diffusion 训练(论文给出理论与实证对比)。[来源]
- 结果(可追溯口径):作者报告相对 SOTA Self Forcing,在 Dynamic Degree、VisionReward、Instruction Following 上分别提升 19.3%、8.7%、16.7%。[来源]
这篇论文的价值不在“又一次蒸馏提速”,而在把一个长期被忽略的坑讲清楚:双向 teacher → 因果 student 不是“换个 mask 就完事”,它会直接破坏 ODE 初始化的可逆性假设,从而让 student 学到退化解。对做交互世界模型/神经游戏引擎的人来说,这意味着:你要追求实时与稳定,就必须把“架构差异”当成一等公民处理,而不是靠后续 DMD/奖励对齐去补洞。
很多“视频世界模型”短期看起来很聪明,但一跑长就会崩:小错误越积越多,最后整个世界漂移、逻辑断裂。LIVE 的思路更像“做闭环体检”:先让模型往前滚很长一段,再让它倒回去把起点还原出来;如果还原不回来,就说明中途误差已经不可控,于是训练会强迫模型把误差压在可控范围内。
- 问题:长时误差累积(error accumulation):AR video world models 在 short horizon 有效,但长 horizon 会出现误差传播并持续放大。[来源]
- 方法:cycle-consistency 约束长时误差:LIVE 先从 GT frames 做 forward rollout,再做 reverse generation 重建初始状态;在重建的 terminal state 上计算 diffusion loss,以显式约束 long-horizon error propagation,并声称无需 teacher-based distillation。[来源]
- 训练稳定性:progressive curriculum:论文给出一个统一视角涵盖不同 approach,并用 progressive 训练课程稳定训练过程。[来源]
- 结果(可追溯口径):作者在 long-horizon benchmarks 上报告 SOTA,并强调能生成“远超训练 rollout length”的稳定高质量视频;Fig.1 展示 baseline 随长度退化而 LIVE 保持更稳定的趋势。[来源]
LIVE 的信号很明确:把“长时一致性”从“希望模型自己学会”变成训练目标里可被惩罚的系统性约束。如果它的 cycle-consistency 能在交互(action-conditioned)场景下稳定工作,那么它更像一种“世界模型的回归测试”:你不需要无限长 rollout,也能用“能否回到起点”来诊断 drift。后续我会重点关注:reverse generation 的计算开销、以及在分布外动作/视角切换时是否仍能保持“可逆”约束有效。
自回归视频扩散要生成很长的视频时,会越来越卡:因为它把过去所有帧的“记忆”(KV cache)越存越多,注意力计算和显存都线性爆炸。这篇论文的核心就是三件事:把重复的记忆压缩、只看真正相关的文本 token、让注意力只连到语义相近的历史片段,从而做到“越生成越不慢”。
- 瓶颈:KV cache 增长导致 latency/显存随时间上升:AR video diffusion 的 attention 随 rollout 变长会越来越慢、越来越占显存,从而迫使短 context window 并伤害 long-range consistency。[来源]
- 发现:三类持久冗余:近重复 cached keys、缓慢演化(语义主导)的 Q/K 导致重复 attention 计算、以及 cross-attention 对长 prompt 的无效计算。[来源]
- 方法(training-free):TempCache 用 temporal correspondence 压缩 KV cache;AnnCA 用 ANN 匹配选 frame-relevant prompt tokens 加速 cross-attention;AnnSA 用 ANN 做语义匹配稀疏化 self-attention。三者可组合,且声称与现有 AR diffusion/world model backbone 兼容。[来源]
- 结果(可追溯口径):报告端到端 5×–10× 加速,并强调长 rollout 下 throughput 稳定、峰值显存“几乎常数”,同时保持 near-identical 视觉质量;Fig.1 给出多分钟生成与世界模型场景的加速示例。[来源]
对交互世界模型来说,“长时一致性”最终会被系统吞吐与显存曲线卡住:如果你做不到“越跑越不慢”,分钟级一致性就只能停留在 demo。TempCache/ANN 稀疏化这条路线的优势是training-free(更像工程 patch),适合作为推理侧的可插拔加速层。后续我会重点验证两点:ANN 匹配带来的质量/稳定性边界(是否引入难以察觉的漂移),以及它在不同 backbone(DiT/AR 扩散)的迁移成本。
📅 2026年1月
这篇工作主打一个关键词:“开源世界模型”。作者把一个源自视频生成的“可交互世界模拟器”开源出来,并宣称它既能保持画面/动力学质量,也能做分钟级的长时一致性,还能在交互时做到16 FPS且延迟低于 1 秒。
- 定位/目标:提出并开源 LingBot‑World,把“从视频生成出发的 world simulator”产品化为可用的开源世界模型,试图缩小开源与闭源世界模型的能力差距。[来源]
- 能力主张(可追溯的硬口径):覆盖多风格环境(现实/科学/卡通等)、分钟级 horizon 的长期一致性(long-term memory)、交互生成 16 FPS 且端到端延迟 < 1s。[来源]
- 可复现入口(工程侧):作者在仓库提供推理脚本与示例数据,并在 README 中给出多分辨率(如 480p/720p)与多 GPU 推理(FSDP/DeepSpeed Ulysses)路径;模型权重提供 HuggingFace 与 ModelScope 入口。[来源: GitHub][来源: HF][来源: ModelScope]
对“神经游戏引擎/交互世界模型”赛道而言,开源 + 权重可拿到的价值极高:它让社区能把讨论从“看 demo”推进到“做系统回归与延迟预算”。但要警惕两个常见陷阱:其一,16 FPS + <1s latency 的口径强依赖硬件/并行策略/分辨率与上下文长度;其二,“分钟级一致性”需要在失败模式上讲清楚(漂移、回滚、重锚定),否则容易只停留在展示视频层面。
很多推理系统只会“用文字想问题”(verbal CoT)。这篇论文提出:在一些物理/空间任务里,让模型先“画出来/生成出可视化的中间过程”,反而更像人类的“脑内小剧场”,推理会更稳。
- 核心主张:Visual Superiority Hypothesis:对某些物理世界相关任务,视觉生成能更自然地作为内部 world model;纯文字 world model 可能因表示能力或先验不足而出现瓶颈。[来源]
- 方法视角:把“内部 world modeling”形式化为 CoT 推理的核心组件,并讨论不同形式 world model 的差异。[来源]
- 评测与结论:构建 VisWorld‑Eval,并在 SOTA UMM 上做 controlled experiments,发现交错的视觉‑语言 CoT在“偏视觉 world modeling”的任务上显著优于纯文字 CoT,但在其它任务上优势不明显。[来源]
- 可复现入口:项目页提供代码仓库与评测数据集(HF Datasets)。[来源: GitHub][来源: Dataset]
这篇不直接解决“视频世界模型的长时一致性/交互延迟”,但它给了一个更上层的启发:如果未来世界模型要支持“规划/推理”,中间状态不一定只用 token/文本表达,可生成的可视化中间过程可能是更稳的“工作记忆”。工程上建议把 VisWorld‑Eval 里的任务形态拆出来,转化为你自己的 world model regression:哪些任务确实需要视觉中间表征,哪些只是“多模态噱头”。
很多世界模型在“看视频学世界”时容易被纹理/颜色等无关因素带偏。作者借鉴认知科学:人类会把连续观察切成一段段“事件”(发生了什么、什么时候开始/结束),再用这些事件做决策。EAWM 就是把这种“事件切分”做进世界模型里。
- 问题:现有 MBRL 世界模型难以跨结构相似场景泛化,且对纹理/颜色等 spurious variations 敏感。[来源]
- 方法:Event-Aware World Model (EAWM):用自动 event generator 从原始观测中导出事件,并用 Generic Event Segmentor (GES) 识别 event boundary(事件段起止)。通过 event prediction 约束表征空间,让其捕捉有意义的时空转移。[来源]
- 统一视角:论文声称给出了“看似不同”的 world model 架构的统一表述,从而让方法更通用。[来源]
- 结果(摘要口径):在 Atari 100K、Craftax 1M、DeepMind Control 500K、DMC‑GB2 500K 上,使强 MBRL baseline 提升 10%–45%,并声称取得 SOTA。[来源]
- 可复现入口:代码开源于 GitHub。[来源: GitHub]
“事件”是一个很实用的中间层:它把连续像素流压成更稳的决策单位,天然有助于跨场景泛化与抗纹理扰动。真正的看点不只是分割器,而是它如何与 world model 的预测目标/训练信号对齐(event prediction 的监督从哪来、噪声怎么控)。如果你在做交互视频世界模型,也可以把“事件边界”当成一种可回滚/可重锚定的系统节点:漂移累积到某个 boundary 时强制重同步,比盲目扩大窗口更可控。
LoL 盯住了一个“长视频流式生成的怪病”:为了稳定长序列,很多方法会保留一些attention sink 帧当锚点,但跑着跑着画面会突然“回到锚点”,像时间循环一样不断重复——作者把它叫做 sink-collapse。这篇工作的目标就是让视频能一直往前跑,而不是在某些时刻被锚点拽回去。
- 问题定义:sink-collapse:使用 attention sink 稳定 AR/流式生成时,模型在特定 latent frame index 会突然回归到 sink frame,出现“场景重置/循环运动”。论文指出 LongLive 与 Self-Forcing++ 等在相同索引处出现 collapse。[来源]
- 根因分析(关键结论):作者认为根因来自 RoPE 的周期结构 与 multi-head attention 的冲突:当多头在某些相位对齐点产生“同质化注意力”时,会共同把权重集中到 sink,触发 collapse。并用 phase concentration 分析显示 collapse 点与局部最大值相关。[来源]
- 方法:multi-head RoPE jitter(训练无关/轻量):在不同 attention head 上对 RoPE base frequency 做轻微偏移(围绕原始 \(\theta\) 抖动),打破跨头注意力同质化,从而抑制 sink-collapse。[来源]
- 结果主张:论文声称实现“real-time, streaming, infinite-length generation”,并展示持续生成到 12 小时 的视频样例。[来源]
LoL 的价值点在“把超长流式生成的 failure mode 命名并可诊断化”,然后给出一个训练无关的补丁。它也暴露了一个现实:长时稳定性不只靠更大窗口/更多数据,位置编码与注意力头的几何结构本身就能制造系统性崩溃。风险是泛化:如果模型不用 RoPE 或不用 sink,这个补丁未必适用;即便适用,也需要量化“抖动幅度 ↔ 质量退化”的曲线。
这篇论文很“数据工程”:作者发现游戏里的物理 Bug/画面异常(glitch)其实是天然的“物理常识反例库”。把这些反例做成问答数据,就能教模型更好地判断“这个视频哪里不符合物理”。
- 核心范式:用 gameplay videos 里的 glitch(违反预定义物理规律的异常)作为可规模化监督源,构建物理理解数据集 PhysGame。[来源]
- 数据规模:PhysGame 包含 140,057 条围绕 glitch 的 QA,覆盖 5 个物理域与 16 个细粒度类别;并提供专家标注评测集 GameBench(880 条 glitch 视频)。[来源]
- 关键工程点:meta-information–guided prompting:利用 gameplay 的标题/描述等元信息提升自动生成 QA 的质量与准确性(降低“瞎编物理”的噪声)。[来源]
- 结果(论文给出的硬数字):对 Qwen2.5-VL 的 PhysBench 提升 +2.5%,MVBench 提升 +1.9%,GameBench 提升 +3.7%(绝对值)。[来源]
这条线的意义不在“又一个 benchmark”,而在于提供了一种可规模化的反事实/反常识监督:glitch 让“违反物理”变成可见信号。最大风险是标签偏差:游戏 glitch 的分布可能过度集中在渲染/碰撞实现细节,迁移到真实世界需要严格的 domain gap 分析;因此更建议把它当作“物理异常检测”能力的增量训练源,而不是万能物理理解。
StableWorld 的直觉非常“工程”:世界模型越跑越崩,往往不是因为动作太复杂,而是同一场景里那一点点“跑偏”在不断累积。它做的事很像“视频世界的垃圾回收”——滑动窗口里别把已经变脏的历史帧当参考,否则你等于把错误一代代传下去。
- 问题根因(不是泛泛而谈):作者先在“静态交互”设定下量化漂移:相邻帧差异很小,但在同一场景里逐步累积,最终导致 scene collapse。并用 inter-frame MSE(latent/pixel)展示“越往后越偏离初始干净状态”。[来源]
- 关键观察:窗口变大为啥会更稳?:扩大 KV-cache window 可以让模型看到更早、更“干净”的帧,从而抑制 drift;但直接加大窗口会显著增算力/降速度。作者进一步指出稳定性主要来自“窗口里保留了几帧干净的 early frames”。[来源]
- 核心贡献:Dynamic Frame Eviction(动态逐出机制):不再“窗口一滑就丢最老帧”,而是:永远保留最近帧保证局部运动连续;对更早的中间帧,用几何一致性判定哪些是“视角相近但已被污染/冗余”的帧,并优先逐出,避免把 drift 继续写进历史缓冲。[来源]
- 几何一致性打分(可复现公式链):以窗口内最早帧 \(P_0\) 为 reference,对中间帧 \(P_k\) 提 ORB 特征,ratio test 得到匹配对 \(G\),再用 RANSAC 同时拟合 Homography 与 Fundamental matrix,取两者 inlier ratio 的最大值 \(s(P_0,P_k)=\max(r_H,r_F)\)。若 \(s \ge \theta\) 则继续检查更远帧;首次低于阈值时,逐出“失败点前一帧”,否则逐出最远中间帧。论文默认阈值 \(\theta=0.75\)。[来源]
- 落地参数(不同模型如何接):Matrix-Game KV-cache=9,最早 6 帧为 earlier frames;因每步生成 3 帧,检查第 3/6 帧决定逐出。Open-Oasis window=16,最早 12 帧为 earlier,检查第 1/6/12 帧。Hunyuan-GameCraft 每步生成 33 帧并形成新窗口,按对应帧相似度决定是否把 earlier frames 合并进新窗口。[来源]
- 量化提升(关键数字):在 VBench-Long 上,Matrix-Game 的 Image Quality 从 63.39→73.52、Aesthetic 从 38.83→53.44;Open-Oasis 的 Image Quality 66.37→73.75;Hunyuan-GameCraft 的 Aesthetic 48.38→57.44;总体额外开销仅 1.00–1.02× latency。[来源]
StableWorld 的强点不是“提出一个更大的模型”,而是把长期漂移拆成“滑窗里参考帧被污染/冗余”的系统问题,并给出一个可落地的逐出判据。真实落地最大的坑在视觉特征鲁棒性:低纹理/强模糊/大视差时 ORB+RANSAC 可能不稳定,建议工程上增加 fallback(例如保守保留 early clean frames 或引入更鲁棒的 learned matching)。
Memory-V2V 解决的是“多轮改视频越改越不像同一个片子”的痛点:你改完一段再改下一段,模型往往记不住之前已经确定的角色/风格/细节,导致跨轮次漂移。它的思路很直白:把你之前编辑过的视频当成一个“外部记忆库”,每次新一轮编辑前先检索出最相关的历史片段来“对齐记忆”,再做本轮去噪。
- 任务定义(作者强调是第一次系统化讨论):Multi-turn video editing 的“跨轮次一致性(cross-consistency)”——每轮独立去噪生成,但最终结果要和所有历史编辑版本在关键视觉属性上保持一致(例如长视频分段编辑的外观不漂移、novel view 合成的跨视角区域一致)。[来源]
- 核心框架:外部视频记忆 + 检索条件化:维护一个外部 cache 存储“之前编辑过的视频”;当前轮次先做 retrieval,挑出和当前编辑最相关的历史结果,再把这些历史结果编码为 conditioning tokens 注入到当前轮次的 V2V 扩散去噪中。[来源]
- 表示选择(工程取舍):作者对比了 3D 重建型编码器、NVS 模型的 encoder-decoder 表示、以及视频扩散常用的 video VAE latent,结论是 video VAE latent 在 fidelity 与效率上最平衡,适合做“记忆表示”。[来源]
- 动态 tokenizer:按相关性自适应 token 密度:直接把所有历史视频都全量 token 化会爆算力且引入冗余;Memory‑V2V 引入可学习的 dynamic tokenizers,对检索到的历史视频按相关性使用不同 kernel size 进行 tokenization(相关性越高 → token 越密)。[来源]
- token compressor:把“低响应 token”压缩而不是丢弃:作者计算 per-frame attention responsiveness 评估 token 重要性,并发现直接丢低响应 token 会损失一致性;改为在 DiT backbone 的特定 blocks 中加入可学习压缩层,压掉冗余但保留关键视觉线索,整体带来约 30% speedup。[来源]
- 验证场景:Video novel view synthesis 与 text-guided long video editing(多段/多轮编辑),目标是“跨轮次一致性显著提升,同时任务内质量不降甚至提升”。[来源]
Memory‑V2V 把“视频编辑”推进到真正的多轮交互系统:上一轮结果变成下一轮约束。它最可取的设计是“检索 + 动态 token 密度”——记忆不是越多越好,而是要把最相关的信息以可控带宽注入到去噪过程。落地风险在检索误差:一旦 retrieval 选错,模型会被强行对齐到错误外观,反而放大漂移;产品层面需要暴露“记忆命中/置信度”给用户做校正。
Cosmos Policy 的野心是把“会生成视频的模型”直接变成“会控制机器人的策略”。它的关键点是不另外加一套 action 模块:把动作也当成“视频序列里的帧”去生成;同时让模型顺便“想象”执行动作后的未来观测,并给出成功概率(value)。这样在测试时就能像“先想一想再做”一样:多生成几条候选动作,挑最可能成功的那条执行。
- 训练范式(单阶段 + 无结构改动):从 NVIDIA 的 Cosmos‑Predict2‑2B 预训练视频模型出发,仅用目标平台采集的 imitation demonstrations 做一轮 post-training;作者强调不做任何架构修改,所有模态(多视角相机、proprio、action、future state、value)都通过“视频 latent diffusion 的序列建模”统一学习。[来源]
- 动作如何接入“视频扩散”:将 robot action chunk 编码为 latent frames,和图像观测的 latent 一起构成扩散序列;模型通过同一套去噪目标学习高维、多峰的动作分布(与“另起 action diffusers/逆动力学模块”的路线对比)。[来源]
- 同时学 world model + value:除动作外,还生成未来 state(图像观测 + proprio)与 value(未来 state 的 reward-to-go),同样编码成 latent frames;这让模型具备“可用于规划”的最小三件套:\(a_{t:t+k}\)、\(s_{t+\Delta}\)、\(V(s_{t+\Delta})\)。[来源]
- 测试时规划(best-of-N):采样 N 组候选动作 → 想象对应未来 state → 用 value 排序 → 执行最高 value 的动作(或动作 chunk 的首段)。作者报告:在两项真实世界高难任务上,加入规划后平均+12.5% task completion。[来源]
- 关键结果(直接政策形态):LIBERO 平均成功率 98.5%,RoboCasa 平均成功率 67.1%;真实世界双臂操作任务平均成功率 93.6%,并声称超过同数据微调的 VLA 与从零训练 diffusion policy。[来源]
- 可复现入口:作者声明开源 code、models、training data(统一放在项目页)。[来源]
把 action 也当作 video latent 来扩散生成,是一个非常强的“统一建模”信号:它利用生成模型天然擅长的多峰分布来表示动作不确定性。真正决定能否落地的是推理预算:best-of-N 到底要多大的 N、想象多远、在多视角输入下延迟是否可控——这些如果不透明,很容易变成“只在 benchmark 成立”。后续建议优先补齐 N–成功率–延迟的三维曲线与失败案例分类。
S2DiT 的目标很明确:把“服务器上才能跑的 DiT 视频生成”做成手机端可流式生成。它的做法像“三明治”:高分辨率阶段用“便宜但够强的注意力”保细节,低分辨率阶段用“稀疏/下采样注意力”吸收全局信息,再用蒸馏把大模型能力压进一个小模型里。
- 目标指标(给出硬数字):作者声称在 iPhone 上可流式 >10 FPS;表格里 S2DiT-AR 的 streaming 约 ~11 FPS,VBench 83.26(与服务器级模型接近)。[来源]
- 优化点 1:LCHA(LinConv Hybrid Attention)——线性复杂度但不丢局部:两条并行分支: - Linear path:用可学习的正核 \(\phi(x)=softplus(Wx+b)\) 做线性注意力,并配 QK norm 与 3D RoPE; - Local conv path:深度可分离 3D conv + 线性混合,且做 temporal causal padding 以支持 streaming; 两路输出用门控系数 \(\alpha\)(FusionGate)融合。[来源]
- 优化点 2:SSA(Stride Self-Attention)——用结构化稀疏换吞吐:对 QKV 做均匀 stride 下采样,在更低 token 数下建模全局,再通过上采样恢复分辨率;作者强调“只用低分辨率 SSA 会掉质”,因此要与 LCHA 混合。[来源]
- 优化点 3:Budget-aware DP Search(把算力预算变成结构):把 block 类型(LCHA/SSA)的 latency \(\ell_t\) 与 memory \(m_t\) 显式建模,在总 block 数 K 下用动态规划选出 \((N_{LCHA},N_{SSA})\) 使其最贴近设备 \((L_{max},M_{max})\) 预算;再用组级 mask 搜索模块分布(什么时候切换分支)。[来源]
- 优化点 4:2-in-1 Distillation(把大老师“搬到离线”):第一阶段做 cached offline distillation:用 Wan 2.2-14B 预计算并缓存 diffusion tuples 与 text embeddings,避免训练时跑 teacher;第二阶段面向 streaming,引入 self-forcing + distribution-matching distillation(少步数)并探索 adversarial fine-tuning 以增强跨 segment 的时序一致性。[来源]
S2DiT 最稀缺的是“把端上预算写进结构搜索里”,这比单点换注意力更接近产品化。需要警惕的是复现路径:FPS 往往依赖特定端侧算子实现与量化/编译参数(Metal kernel、算子融合、内存布局)。如果论文/代码不把这部分讲清楚,读者很难在自己的设备上达到同级 streaming 速度。
VerseCrafter 把“生成视频”升级成“生成一个带 4D 世界状态的视频”。你不再只用文字说“往左转、车开过去”,而是直接给模型一个可编辑的 4D 几何控制信号:相机怎么走、每个物体怎么动,统一在同一个世界坐标里。
- 核心贡献:4D Geometric Control(统一相机 + 多物体运动):用静态背景点云表达场景几何,用每个物体的 3D Gaussian 轨迹表达动态(均值=路径,协方差=体积/朝向/占据概率),相比 3D box/SMPL 等更柔性、类目无关、可编辑。[来源]
- 模型注入方式:GeoAdapter(ControlNet 风格轻量分支):将 4D 控制渲染成多视角 conditioning signal,并通过 GeoAdapter 注入到冻结的 Wan2.1-14B 视频扩散骨干,以“几何驱动”方式约束相机与物体运动,同时保留大模型的视觉先验。[来源]
- 数据瓶颈的解决:VerseControl4D 自动标注引擎:从 in-the-wild 视频自动提取相机/物体轨迹并构建 4D 控制,从而获得大规模训练数据(解决“真实世界没有 4D 标注”的硬伤)。[来源]
- 评测关注点(别只看画质):是否真正按指定相机轨迹与多物体轨迹走(view-consistency、遮挡鲁棒性),并与 Yume/Uni3C 等 3D-aware baselines 对比。[来源]
VerseCrafter 的关键意义是把“控制”从 prompt 拉回到可编辑的几何信号:这才是世界模型真正需要的接口。但要警惕两点:一是 4D 控制信号的获取成本(即使自动标注,也需要稳定的 SfM/轨迹估计);二是控制-画质 tradeoff(控制越硬,视觉先验越容易被牺牲)。后续更值得追踪它在遮挡与快速相机运动下的失败模式。
📅 2025年12月
ChronoDreamer 让机器人可以"做白日梦"来练习操作。它能根据机械臂的动作指令,想象出接下来会发生什么画面,帮助机器人在行动前先"脑补"一遍。
- 架构: Spatio-temporal Transformer,多模态输入 (RGB, Contact Map, Joint State)。
- 特点: 针对高频接触的机器人操作场景优化。
- 注意: 属于具身智能边界,但 World Model 架构可复用。
这类“机器人白日梦”工作的分水岭不在生成质量,而在闭环可用性:模拟是否能支撑规划/评估,并且误差不会在 rollout 中爆炸。建议后续更新时重点补齐:rollout horizon、计划代价函数、以及在接触丰富场景下的失败分类(滑动/卡住/遮挡)。
这是一个"加速外挂"。它能把原本要 1 分钟生成的 AI 视频,缩短到不到 1 秒,而且画质几乎不变。是 Vidu 实时生成的核心技术。
- 目标(“100–200×”到底加速了什么):加速的是扩散采样阶段的端到端 latency(论文说明统计时不含 text encoding 与 VAE decoding)。[来源]
- 加速点 1:Attention 加速(SageAttention2++ + SLA):先用可训练的 Sparse-Linear Attention (SLA) 替换 full attention 并做适配微调;推理阶段再用基于 SageAttention 的 CUDA 实现(论文称 SageSLA)把“稀疏性”与“低比特 TensorCore”叠加起来。[来源]
- 加速点 2:步数蒸馏(rCM):用 rCM 做 step distillation,把采样步数从 100 缩到 4/3(论文实践里用 3 steps,并建议在 4 steps 下更稳)。[来源]
- 加速点 3:W8A8(线性层 INT8):权重与激活都量化到 INT8,且采用 block-wise 粒度(论文给出 block size 128×128),配合 Tensor Cores 提升线性层吞吐并将模型体积约减半。[来源]
- 关键超参(决定“快”与“崩”):Top-K ratio=0.1(对应 90% attention sparsity)、3 sampling steps;作者建议 Top-K \([0.1, 0.15]\) 且 steps=4 更稳定。[来源]
- 量化结果(不是一句话):在单张 RTX 5090 上,对 Wan2.1/2.2 多个模型报告接近 100–200× 的速度提升(例如 Wan2.1-T2V-14B-720P 的 final 版本速度提升到 199×),并给出逐项叠加(CPU offload → W8A8 & fused norm → rCM → SageSLA)。[来源]
TurboDiffusion 的思路是“加速栈叠满”:注意力稀疏化 + 少步数蒸馏 + 端侧量化,最终把瓶颈推到 VAE 解码与 I/O。它对行业的意义在于证明“实时视频扩散不是玄学”,但也要清醒:100× 往往依赖特定 GPU/Kernel(SageAttention 系列)与统计口径;真正产品化要看端到端延迟(含 VAE/编码/调度)以及不同硬件的退化曲线。
RELIC 让 AI 生成的视频世界拥有"长期记忆"。你走出房间再回来,东西还会在原位。这是目前视频模型最缺失的能力之一。
- 关键问题: 解决 Long-horizon 场景下的 Temporal Consistency。
- 方法: 引入显式 Memory Bank,而不仅依赖 Autoregressive 上下文。
“显式记忆”几乎是交互世界模型绕不过去的路线:纯靠隐式上下文迟早会在长交互下崩。评价 RELIC 这类工作的关键不是“记忆模块存在”,而是它是否提供可读写的接口、如何检索/融合、以及失败恢复策略(记错了怎么办)。后续值得补齐其记忆容量、检索代价与错误传播的分析。
📅 2025年9月
关键词是“长视频 + 可交互 + 实时”。它想解决的是:你不只是生成一段 10 秒短片,而是像玩游戏一样,在一个持续很久的“可播放视频世界”里边操作边生成,而且几乎不卡顿。
- 核心设定(为什么选 AR):LongLive 用 frame-level causal AR(因果注意力)替代双向注意力的扩散模型,核心收益是可以 KV cache,把“长视频推理成本”从“整段反复算”变成“增量续写”。[来源]
- 贡献 1:KV-recache(解决交互式换 prompt):在 prompt 切换边界,如果直接清空 KV cache 会导致画面突变;如果保留全部 cache 又会“粘住旧 prompt”。LongLive 的做法是在边界处用“已生成帧 + 新 prompt”重新计算/刷新 cache,把新 prompt 的语义重新写入 cross-attn,再让 self-attn 传播,从而做到“不断片 + 快速贴合新 prompt”。[来源]
- 贡献 2:Streaming Long Tuning(train-long → test-long):训练阶段就按流式长视频方式对齐推理,缓解 train-test gap。[来源]
- 贡献 3:Short-window Attention + Frame Sink(加速且保一致):缩短注意力窗口提吞吐,引入 frame-level attention sink 保留长程一致性。[来源]
- 工程指标(必须看):论文报告单卡 H100 推理 20.7 FPS,最长支持 240 秒,并支持 INT8 量化推理。[来源]
LongLive 把“交互式长视频”写成了可复现的系统工程:KV cache 是前置条件,KV-recache 解决换指令边界,Streaming Long Tuning 对齐 train-test。它的关键风险仍是长时 drift 与失败恢复:没有显式 state/memory 时,越长越容易累计误差;因此后续更值得关注其回滚/重锚定接口与评测。
WorldGym 把世界模型变成了一个"虚拟健身房"。AI Agent 可以在里面反复练习,而不用真的去操作机器人或开真车,省钱又安全。
- 架构: Autoregressive, Action-conditioned 视频生成。
- 评估方式: 使用 VLM (Vision-Language Model) 作为 Reward Function。
- 验证: 在 World Model 中的策略成功率与真实世界高度相关。
WorldGym 的价值在“把世界模型变成评测基础设施”,这比单篇论文的指标更接近产业需求:我们缺的是可重复的 policy regression test。需要警惕的是 reward 代理:VLM reward 的偏差会把评测导向“看起来对”的策略,而不一定是“真的对”。后续更新建议补齐 reward 校准、OOD 场景鲁棒性与相关性统计口径。
📅 2025年8月 (里程碑月)
这就是把 GTA5 喂给了一个画图 AI。当你按 "W" 键时,它就画出下一帧向前的画面。因为画得非常快 (25 FPS),所以你感觉像在玩游戏。而且是开源的!
- 问题定义(为什么“实时交互”难):双向注意力 + 多步去噪导致每帧都要看“全片”,延迟爆炸;而纯 AR 又容易误差累积导致越玩越崩。[来源]
- 贡献 1:数据管线(这篇最硬的护城河):提出 UE + GTA5 的可规模化数据生产与标注,论文给出规模约 ~1200 hours 的带交互标注视频数据;UE 管线包含 NavMesh 路径规划(增强轨迹多样性)、相机控制的 Quaternion 精度优化等;GTA5 侧通过 Script Hook 级集成做“画面-操作”同步录制。[来源]
- 贡献 2:模型骨干 + 动作注入:Video Diffusion Transformer 内集成 action control module,把键鼠输入做 frame-level 条件,通过注入模块让“动作→画面变化”具有因果一致性。[来源]
- 贡献 3:Few-step auto-regressive diffusion(KV cache + 少步数):使用 causal few-step AR diffusion,并基于 Self-Forcing 训练范式把“推理时 KV cache 的滚动生成”对齐到训练中,从而在速度与稳定性之间取平衡。[来源]
- 硬指标(别只说“很快”):论文报告在单张 H100 上可达 25 FPS,并支持 minute-level 视频滚动生成。[来源]
这是 2025 年最重要的开源项目之一。它证明了只要你有足够的 UE/GTA 合成数据,Diffusion Model 真的能学会物理引擎的逻辑。缺点: 没有显式 Memory Bank,长时一致性差。
Genie 3 能把你的一句话变成一个可探索的 3D 梦境。你可以像玩游戏一样在里面走动,而且走出房间再回来,东西还在原位。这是目前的天花板。
- 公开规格(官方口径):官方写明“给定文本提示即可生成可导航的动态世界”,并能以 24 FPS 实时导航(real time),分辨率为 720p,并能保持 a few minutes 级一致性。[来源]
- 长时稳定性补充(官方口径):博客进一步写到环境可在 “several minutes” 内保持 largely consistent,并称其 visual memory 可回溯到 “as far back as one minute ago”。[来源]
- 未披露信息(重要边界):公开博客未披露完整模型架构(Tokenizer/Backbone/动作表示/训练细节)、训练数据规模与来源、毫秒级延迟预算、以及失败恢复(回滚/重锚定)机制的系统说明。
- 意义(可验证的结论):它把“世界模型”从论文概念推到可被大众直观理解的“可探索交互体验”,并把行业讨论的重点拉回到 long-horizon consistency 与交互实时性约束。[来源]
Genie 3 的意义更多是“把可玩性带到公众视野”:分钟级一致性、可探索的交互演示会强烈抬高市场预期。但从工程角度仍要回到两个问题:一是 state 是否可读写(还是隐式上下文);二是失败恢复(回滚/重锚定)有没有系统化机制。没有这两件事,很容易仍停留在“很强的视频预测器”而非可长期运行的世界系统。
📅 2025年6月
很多“边生成边播放”的视频模型都会越生成越崩,本质原因是:训练时看的是正确答案(真视频),推理时吃的是自己生成的东西,吃着吃着就越吃越偏。Self Forcing 的核心就是把推理时那套“自己滚动生成”的过程搬进训练里,让模型在训练期就学会面对自己的错误并纠正。
- 问题:Exposure Bias / Train-Test Gap:传统 Teacher Forcing / Diffusion Forcing 训练都用 ground-truth context 去预测未来帧,但推理时 context 其实来自模型自身输出,造成分布不匹配并引发误差累积。[来源]
- 核心机制:训练期做“自回归自滚动”(Self-rollout):训练时用 KV cache 做 autoregressive rollout,让下一帧的去噪条件来自“前面自己生成出来的帧”,而不是 GT 帧(Fig.1(c))。[来源]
- 监督信号:视频级整体损失(Holistic, video-level):不是只做 frame-wise 目标,而是在完整生成序列上施加分布匹配损失(文中举例 SiD / DMD / GAN 等),直接评价整段视频的质量,逼近“推理时分布”。[来源]
- 算力可承受的关键:Few-step diffusion + Stochastic Gradient Truncation:为避免训练期自回归 rollout 过慢,作者用 few-step diffusion backbone,并引入随机梯度截断来平衡计算成本与效果。[来源]
- 长视频外推:Rolling KV Cache:提出 rolling KV cache 以支持更高效的视频外推(extrapolation),让 streaming 生成可以持续滚动。[来源]
- 结果(硬指标):作者报告在单张 H100 上实现 17 FPS 的实时流式生成,并达到 sub-second latency,同时画质可匹配/超过更慢的非因果扩散模型。[来源]
Self Forcing 这条线真正有价值的是它把“流式生成能否长期稳定”从 trick 拉回到训练分布与推理分布一致这个根因上。对落地团队来说,建议重点复用两件事:① train-time rollout(把 KV cache/滚动链路写进训练);② 评价口径从帧级转向视频级(否则很容易在早期帧好看、后面崩)。另外它强调 data-free 的 post-training 路径,对快速迭代非常友好,但也要警惕:无数据并不等于无偏差,prompt 分布与真实使用分布的 gap 仍会反噬。
📅 2025年3月
可以把 WAN 2.2 当作对 2.1 的“工程化升级”:更像产品可用的版本,重点通常会落在更稳的长时一致性与更低的生成延迟,以及更完整的控制能力。
- 改进点 1:MoE(Mixture-of-Experts)扩容但不涨算力:官方 README 明确强调把 MoE 引入视频扩散,并用“跨 timestep 的专门 expert”拆分去噪过程,使总体容量变大但计算成本维持不变。[来源]
- 改进点 2:美学可控(数据 + 标签):引入精细美学数据与标签(光照、构图、对比度、色调等),使“电影感风格”更可控而不仅是随机抽样到好看。[来源]
- 改进点 3:复杂运动泛化(数据扩容):相比 Wan2.1,训练数据规模提升(+65.6% images,+83.2% videos),旨在提升 motion / semantics / aesthetics 的泛化。[来源]
- 关键工程信号:720P@24fps 的 TI2V-5B + 高压缩 VAE:Wan2.2 开源一个 5B 的 hybrid TI2V 模型,配套 Wan2.2-VAE 的压缩比 16×16×4,支持 720P/24fps,并宣称可在 4090 等消费卡运行。[来源]
WAN 2.2 的 MoE 更像“把容量做上去”的战略动作,但交互世界模型的瓶颈往往不在参数量,而在端到端系统预算(VAE 解码、采样步数、注意力/缓存、调度)。因此评价 2.2 的关键不是“更清晰”,而是它是否把这些系统瓶颈一起工程化解决,并给出可复现的延迟/稳定性指标。
WAN 2.1 更像“打底版本”:先把画面质量与基础可控性做上去,但在长视频和强交互场景里,通常还会遇到“玩久了就跑偏”的问题。
- 系统拆解:VAE(决定 token 长度/吞吐的第一层):Wan 报告提出 Wan-VAE(3D causal VAE),把视频从 \([1+T, H, W, 3]\) 压缩到 \([1+T/4, H/8, W/8, C]\),即时域 4×、空域 8×8× 的压缩;并强调第一帧只做空间压缩以更好兼容图像先验。[来源]
- 关键优化 1:因果性 + RMSNorm(让“流式编码/解码”成立):用 RMSNorm 替换 GroupNorm 以保持时序因果,从而可实现feature cache机制,提高长视频编码/解码效率。[来源]
- 关键优化 2:Chunk-wise + Feature Cache(支持任意长视频 VAE 推理):将输入按 \(1+T/4\) 的 chunk 处理,每个 chunk 最多 4 帧;用“上一 chunk 的末尾特征”作为缓存拼到下一 chunk,避免长序列显存爆炸。论文还给出 kernel=3 时缓存两帧的示意。[来源]
- 训练细节(不是泛泛而谈):Wan-VAE 采用三阶段:先训 2D image VAE → inflate 成 3D causal VAE → 高质量视频微调;损失包含 L1、KL、LPIPS(权重分别 3、3e-6、3),最终加入 3D discriminator 的 GAN loss。[来源]
- 2.1 ↔ 2.2 的对比抓手(从“瓶颈”角度):如果 2.2 的 MoE 扩容提升质量/泛化,那么要想真正跨到“可交互门槛”,还得同时在采样步数、注意力/缓存、VAE 解码上做系统级协同(TurboDiffusion 就是典型例子)。[来源]
WAN 2.1 最值得抄的不是某个模型结构细节,而是把 VAE 作为“系统第一层”认真工程化:因果性 + cache 让长视频/流式成为可能。很多团队只盯 backbone,最后会发现真正卡住的是 VAE 解码与端到端吞吐。用这条线去读 2.2/端侧蒸馏/量化,会更接近产品化的真实问题。
📅 2024年12月
传统“高画质视频扩散”像是一次性把整段视频都算完:你必须等到最后一帧算完才能看到结果,所以交互完全没戏。CausVid 的目标是把它变成“边算边出”:先等 1.3 秒出第一屏,然后以约 9.4 FPS 持续流式生成,把视频生成从“离线渲染”变成“可交互工作流”。
- 问题根因:双向注意力导致“单帧=全片”:bidirectional DiT 生成当前帧需要处理包含未来在内的整段序列,128 帧全片生成延迟可达 219s(Fig.1)。[来源]
- 路线:从 bidirectional teacher → causal student:把预训练的双向扩散 Transformer 适配成因果自回归 Transformer,实现 on-the-fly 逐帧生成,并可用 KV cache 加速。[来源]
- 关键加速:把 DMD 扩展到视频,50-step → 4-step:用 distribution matching distillation 将 50 步扩散蒸馏到 4 步生成器,显著降低推理延迟。[来源]
- 稳定蒸馏:ODE 轨迹初始化 + 非对称蒸馏:用 teacher 的 ODE trajectories 做学生初始化,并用“bidirectional teacher 监督 causal student”的 asymmetric distillation,降低 AR 误差累积、支持 long-duration 外推(即使训练用短 clip)。[来源]
- 能力外延(交互产品很重要):支持 streaming 的 T2V/I2V/V2V 与 dynamic prompting(Fig.2),让用户可在生成过程中改变 prompt 而不必重算整段。[来源]
- 结果(硬指标):初始延迟约 1.3s,之后以约 9.4 FPS 流式生成;并在 VBench-Long 上报告 84.27 总分。[来源]
CausVid 的价值不是“又一个视频模型”,而是给出了把 bidirectional 画质转成 causal 交互 的一条可复现工程路径:teacher-student +(视频版)DMD + ODE init + 非对称监督。对产品端最关键的,是它把初始延迟与持续帧率作为一等指标,并明确写进图 1——这正是交互世界模型的 KPI。后续跟踪点:在更复杂动作控制/动态 prompt 下的失败模式(漂移、角色一致性崩坏)以及端到端延迟是否被 VAE/编码/调度重新卡住。
“latent action 不可迁移”是把视频生成模型改造成世界模型时最容易踩的坑:你以为学到了控制,其实学到的是场景特征的捷径。Olaf‑World 值得关注的点在于它把对齐目标从“重建”拉到“跨上下文语义一致”,更接近交互系统真正需要的控制接口。下一步我会盯:这种对齐在长时 rollout 与复杂动作组合下是否仍稳定,以及对 encoder 选择/冻结策略有多敏感。