05. 落地路线图与商业化 (Roadmap)
本章为你规划一份 "按周执行" 的工程进度表。该路线图假设你已经有了 4 张 H100/A100 和一个 6-8 人的精英团队。
⏰ 最后更新时间: 2026-01-31 | 本页内容将每日更新「世界模型工程落地路线图、里程碑与商业化信号」。
5.1 90天攻坚甘特图 (Gantt Chart)
以下是分阶段的工程落地计划。横轴滚动可查看完整图表。
gantt
title 世界模型工程落地计划
dateFormat YYYY-MM-DD
axisFormat %m/%d
tickInterval 1week
section Infra
UE Plugin Dev :active, a1, 2026-02-01, 7d
QA Scripts : a2, after a1, 5d
WebDataset Conv : a3, after a2, 3d
section Algorithm
Baseline DiT : b1, 2026-02-15, 14d
Action Injection : b2, after b1, 10d
Turbo Distill : b3, 2026-03-15, 14d
section Demo
Overfit Room Demo :crit, c1, 2026-02-28, 5d
Action Acc Test : c2, 2026-03-10, 7d
24fps Stream Demo : c3, 2026-04-01, 10d
5.2 阶段拆解与交付物 (Deliverables)
Phase 1: 冷启动 (Week 1-2)
目标:跑通"UE -> 数据 -> 训练代码"的 Hello World。
URecorderComponent.cpp: 导出 RGB 和 JSON (含 Pose/Action)。dataset_v0.tar: 100 个 10 秒的视频片段(建议选简单的室内场景,如走廊)。train_debug.py: 跑通 Video DiT 的 Forward Pass,Loss 能下降。
Phase 2: 可控性验证 (Week 3-6)
目标:模型不再是随机生成视频,而是"听话"的。
- Action Acc 指标: 训练一个简单的分类器,判断生成的视频是否符合输入 Action (e.g. 输入 'W',光流应该向前)。
- Overfit Demo: 在单一场景下,模型能完美响应键盘操作(哪怕只能在那个房间里走)。
避坑: 这一阶段尽量拿掉 Text Prompt,只用 Action 和 Image Condition,逼迫模型学习物理规律。
Phase 3: 实时化与泛化 (Week 7-12)
目标:从"能玩"到"好玩"。
- Distilled Checkpoint: 经过 LCM/Turbo 蒸馏的模型,推理步数 < 4 步。参考 TurboDiffusion。
- Streaming Pipeline: 基于 WebSocket/WebRTC 的前端 Demo,延迟 < 100ms。
- Long-term Memory: 引入 KV Cache 机制,解决"回头看"的一致性问题。
5.3 团队分工矩阵 (RACI)
| 角色 | 关键职责 (R: Responsible) | 核心指标 (KPI) |
|---|---|---|
| UE 工程师 | 开发 Recorder 插件,优化导出性能,搭建多样化关卡 | 数据吞吐量 (GB/hour), 场景丰富度 |
| 算法研究员 | 训练 DiT 模型,调试 Action Injection,实现蒸馏 | Action Acc, FID/FVD, Inference Steps |
| Infra 工程师 | 搭建训练集群环境,优化 DataLoader,部署推理服务 | GPU 利用率, 端到端 Latency |
| 数据工程师 | 清洗坏数据,维护 Dataset 版本 | Inlier Ratio, 数据纯净度 |
🧠 AntiGravity's 最终建议
"Data is the new Code."
不要一开始就去卷模型架构(DiT/U-Net/Transformer)。Matrix-Game 2.0 成功的核心不在于架构多先进,而在于他们从 GTA5 和 UE 里"洗"出了高质量的 Action-Labelled Video。
请把 70% 的精力放在 UE 采集管线和数据清洗上。 模型是会迭代的,但高质量的数据资产是永恒的护城河。
如果你只有 100 张卡的预算,我会建议你买 500TB 的 SSD 和雇 10 个外包玩游戏,而不是全部买 H100。 记住:ShengShu Vidu 的壁垒不是 U-ViT,而是他们积累了数年的视频对数据。
Risk 1: 最大的风险点在于 "Overfit Room Demo" (2月底)。如果你连只有一个房间、一种动作的简单场景都训练不好,千万不要往下走去扩数据。很多团队死在好高骛远,数据搞了 100TB,模型连走直线都走不直。先 Overfit,再 Generalize。
Risk 2: 不要一开始就去卷模型架构。Matrix-Game 2.0 成功的核心不在于架构多先进,而在于他们从 GTA5 和 UE 里"洗"出了高质量的 Action-Labelled Video。