06. 核心公司深度调研 (Company Research)
🏢 公司概况
| 成立时间 | 2023年3月 |
| 总部 | 北京 |
| 官网 | shengshu.com | vidu.studio |
| 核心技术 | U-ViT 架构 (Diffusion + Transformer 融合) |
| 学术背景 | 清华大学人工智能研究院 |
👥 核心团队
💰 融资历程
🚀 核心产品: Vidu
- Vidu 2.0: 4秒视频片段,生成时间 <10秒 [来源]
- 分辨率: 支持 1080P 高清
- 核心能力: 多相机生成, 时序一致性, 多实体一致性
- 加速技术: TurboDiffusion (100-200x 加速)
🏢 公司概况
| 成立时间 | 2023年4月 |
| 总部 | 深圳 |
| 团队规模 | ~50人 (截至 2025年3月) [来源] |
| 官网 | pixverse.ai |
👥 核心团队
💰 融资历程
🚀 核心产品: PixVerse V5.5
- Multi-Shot Workflow: 单次生成多镜头序列,自动分镜
- Native Audio: 音频与视觉事件同步生成 (Frame-perfect Sync)
- V5Fast Mode: 1080P 高清视频,~30秒生成
- 时长: 支持最长 10秒
王长虎在字节的履历意味着爱诗从 Day 1 就懂如何做消费级产品。PixVerse 的产品逻辑是"让普通人也能当导演",而不是卖 API 给开发者。阿里领投 B 轮,说明大厂认可了这条"C 端 SaaS"的路线。短剧风口 + 音画一体,爱诗是最贴近变现的玩家之一。
🏢 项目/公司概况(以官方可追溯信息为准)
| 官网 | sand.ai | About |
| 产品 | Magi Product |
| 核心论文 | MAGI-1: Autoregressive Video Generation at Scale (arXiv:2505.13211) |
| 技术报告 PDF | MAGI_1.pdf |
| 开源代码 / 权重 | GitHub: SandAI-org/MAGI-1 | HuggingFace: sand-ai/MAGI-1 |
🧩 技术路线拆解:为什么 MAGI-1 值得被当作“工程样板”
MAGI-1 的关键,不是“又一个视频扩散模型”,而是把自回归 + 流式生成做成系统级可运行方案:按固定长度 chunk 生成,并允许 chunk 之间并行去噪,从而天然支持 streaming 与更强的因果时序建模(官方描述见 About 与技术报告)。[来源]
- Chunk-wise 自回归(核心范式):以固定长度片段作为生成单元(官方示例为每 chunk 24 帧),逐 chunk 预测,下一 chunk 可在当前 chunk 去噪到一定程度后启动,实现“流式并行”推理。 [来源]
- 时空压缩(Tokenizer/表示):其 VAE 使用 transformer 架构,提供 8× 空间压缩与 4× 时间压缩,直指“推理吞吐”瓶颈。 [来源]
- DiT 架构与训练稳定性补丁:包括 Block-Causal Attention、GQA、QK-Norm、SwiGLU、FFN Sandwich Norm 等一系列面向规模训练的稳定性与效率设计。 [来源]
- 蒸馏与多预算推理:采用 shortcut distillation,让单一 velocity 模型支持不同推理步数预算,并引入 CFG distillation 保持条件一致性。 [来源]
⚙️ 落地工程与 Infra(能直接复用的细节)
- Docker 推理环境:官方提供镜像与一键启动命令,体现“开源即工程可跑”。[来源]
- 硬件预算透明:官方 Model Zoo 明确给出各模型推荐机器(例如 24B 需要 H100/H800×8;4.5B 可在单张 RTX 4090 上运行)。 [来源]
- 加速组件:针对 Hopper 架构推荐安装 MagiAttention 以加速推理。[来源]
🧪 评测信号(为什么它不像“只会拍短片”的模型)
- Human Eval 位置:官方宣称在开源模型中达到较强水平,并将自身定位为对闭源商用模型(如 Kling)的竞争者之一。 [来源]
- Physics-IQ:官方给出了在 Physics-IQ benchmark 上的物理行为预测表现,强调“自回归结构”的优势。 [来源]
Sand.ai/MAGI-1 值得重点研究的原因很现实:它把“世界模型”的关键问题从算法迁移到系统——chunk、并行、缓存、可流式推理、可落地的硬件预算。对想做交互/长视频的人来说, MAGI-1 更像一份“工程蓝图”:你可以不复现它的全部指标,但可以直接复用它的分块生成范式 + 推理栈 + 配置透明度,把团队从“堆 prompt”拉回到“做系统”。
🏢 公司与产品入口(可追溯来源)
| 公司官网 | Meitu Inc.(meitu.com) |
| 产品 | MOKI - 我用AI做短片(moki.cn) |
| 发布与功能描述 | IT之家:美图公司推出 AI 短片创作工具 MOKI |
🧩 产品定位:为什么“先分镜再生成”更适合做短片
主流文生视频工具的痛点是“生成不可控”:你很难稳定复现同一角色、同一镜头语言与叙事节奏。MOKI 的产品取向更接近传统短片制作:先把脚本/风格/角色定下来,再让 AI 生成分镜图,最后将分镜转换为视频素材并通过智能剪辑与音频/字幕功能完成成片。 [来源]
⚙️ 关键工作流(按官方公开描述拆解)
- 前期设定: 在脚本、视觉风格、角色等前期设定完成后,进入生成流程。 [来源]
- 分镜生成: AI 自动生成分镜图,并将分镜图转为可用视频素材。 [来源]
- 成片串联: 通过智能剪辑、AI 配乐、AI 音效、自动字幕等功能把素材串联成片。 [来源]
- 价值主张: 美图强调 MOKI 相比“常规文生视频产品”更强调内容与成本可控。 [来源]
MOKI 值得跟踪的点不在“某次生成效果”,而在它把 AIGC 视频产品化成工作流:把不可控的连续生成,拆成可控的离散工序(脚本→分镜→素材→剪辑→音频/字幕)。这更贴近真实商业场景(短剧/广告/品牌内容),也更容易沉淀为团队的“可复用生产线”。
🏢 公司与产品入口(可追溯来源)
| 公司 | Kuaishou Technology Investor Relations |
| 产品官网 | klingai.kuaishou.com | klingai.com |
🧩 产品能力面(从官网功能列表反推“系统到底做了什么”)
Kling 的一个重要信号是:它把“视频生成”拆成多种可调用能力(不仅是 T2V / I2V),并将这些能力以网站与 API 形态对外组织——这意味着它更接近“视频生成引擎”,而非单一模型 demo。 [来源]
- Text to Video / Image to Video:基础生成入口(文本/图片条件)。[来源]
- Video Extension:视频续写/扩展(本质是 video continuation 或 prefix-conditioned generation)。 [来源]
- Lip-Sync:口型对齐(音频/语音条件 + 人脸/身份保持),是“可商用视频应用”典型刚需模块。[来源]
- Video Effects:视频特效(更偏模板化/风格化/可规模化玩法)。[来源]
- Multi-Image to Video:多参考图驱动(往往用于角色/服饰/元素一致性)。[来源]
- Audio Generation / Multi-Elements:音频生成与多元素组合(强调可组合能力,而不是只靠 prompt)。 [来源]
- Image Generation + Virtual Try-on:把“电商场景”作为显式目标(图片生成 + 虚拟试穿为电商闭环铺路)。 [来源]
⚙️ 工程/商业落地信号
- 开发者平台导向:官网将能力拆成可调用的“API 能力模块”(对外可集成)。[来源]
- 版本与 API 更新提示:官网信息包含 “Video V2.5 Turbo model API” 等升级提示,说明其对外接口在持续迭代。 [来源]
Kling 最值得深挖的并不是“某个 demo 是否惊艳”,而是它把产品拆成可组合的能力层:续写、口型、特效、多参考、多元素。对真实商业项目来说,这比单一的 T2V/I2V 更重要—— 因为业务要的不是“生成一段视频”,而是“在可控约束下生成可交付视频”。后续调研我会重点盯:每个能力的输入/输出约束(分辨率、时长、参考图数量、身份保持)以及 API 的稳定性与计费模型。
🏢 公司与产品入口(可追溯来源)
| 公司 | ByteDance - Inspire Creativity, Enrich Life |
| 产品官网 | 即梦AI(jimeng.jianying.com) |
| iOS App(产品描述与权益) | App Store:即梦AI - 抖音旗下AI图片和视频工具 |
🧩 产品定位:把“生成”做成“创作社区”
即梦的差异化并不只在生成能力,而在“平台化”:官网与 App 描述都强调图片生成 + 视频生成 + 作品分享 + 探索社区 + 做同款,把 AIGC 从工具变成社区生产内容的闭环。 [来源] [来源]
⚙️ 能力拆解(从官方文案反推核心模块)
- AI 图片创作 + 编辑:自然语言生成图片,并支持编辑增强(“不满意?支持编辑功能”)。[来源]
- 视频创作:输入想法生成视频,多轮尝试以获得满意结果(强调迭代式创作)。[来源]
- 分享与传播:支持链接分享/保存本地(利于二次传播)。[来源]
- 探索与同款:探索页浏览作品、复用提示词做同款(典型“社区驱动增长”机制)。[来源]
- 会员权益:App 描述包含“视频延长、去水印”等权益,反映其商业化与生产需求(视频时长与水印是常见付费点)。[来源]
即梦的战略价值在“发行与分发”:它天然可以借力抖音生态,把 AIGC 产出的内容更低摩擦地进入内容池。后续深挖我会关注两件事:(1)同款机制对提示词/参数的可见性与可复现性(这决定社区能否真正“教学”而不是只刷作品),以及(2)视频延长/去水印等权益背后的系统约束(时长、分辨率、队列、风控)。
🏢 公司与产品入口(可追溯来源)
| 集团官网 | Alibaba Group Official Website |
| 产品入口 | 绘蛙(ihuiwa.com) |
| 发布/介绍(阿里系渠道) | 阿里上线AI电商工具“绘蛙” - 阿里云开发者社区 |
🧩 产品定位:把“电商内容生产”做成 AI 工厂
绘蛙的定位非常明确:面向电商营销内容生产,把商拍图、虚拟模特、种草文案、视频口播文案统一在一个平台里,并强调“降低拍摄成本/快速上新”。 [来源] [来源]
⚙️ 核心能力拆解(从官网能力描述反推模块)
- AI 商拍图生成:以商品图为输入,生成电商主图/跨境主图/小红书图等营销图片形态。 [来源]
- 虚拟模特与换装:提供海量虚拟模特,并支持一键换装/换背景等操作,把“拍摄”转成“可编辑的参数化生产”。 [来源]
- 商品模型/模特模型训练:官网明确提到可训练自己的商品模型与模特模型(核心价值:复用资产,稳定一致性)。 [来源]
- 种草文案与视频口播文案:把“图”与“文案/脚本”一起产出,直接服务投放与内容分发。 [来源]
- 一键工具链:去水印、智能消除、换脸、高清修复等,形成电商内容常用的“后期工具箱”。 [来源]
🧠 工程视角:绘蛙的“数据与资产”飞轮
对电商来说,真正的护城河往往不在单次生成效果,而在“资产复用”:商品/模特模型一旦训练完成,就可以在不同主题、不同背景、不同文案下批量生产素材。绘蛙把“训练入口”放进产品里,这是很强的系统信号。 [来源]
绘蛙值得持续追踪的核心是:它把 AIGC 的价值锚定在电商 ROI(更快上新、更低拍摄成本、更可控的素材生产)。后续深挖我会重点看两点:(1)“训练商品模型/模特模型”的数据与版权边界(可商用合规是电商的生命线),以及(2)生成内容的投放闭环(是否与平台素材投放/AB 测试/素材版本管理结合)。
🏢 公司与产品入口(可追溯来源)
| 公司官网 | MiniMax(minimaxi.com) |
| 产品官网 | 海螺视频(hailuoai.com) |
🧩 产品定位:把“视频生成”做成可选型的多模型平台
海螺的视频产品形态更像“模型超市”:官网页面中出现 Hailuo 2.3 / Hailuo 2.3-Fast 等模型名称,并给出分辨率与时长选项(如 768p/1080p 与 6s/10s)。 [来源]
⚙️ 规格/成本信号(从官网配置项提取)
以页面配置中的 Hailuo 2.3(示例项)为例:默认分辨率为 768p,可升级至 1080p;时长为 6s,可升级至 10s;对应的积分成本呈梯度上升(768p/6s 为 25,768p/10s 为 50,1080p/6s 为 80)。 [来源]
| 选项 | 示例成本(积分) | 备注 |
|---|---|---|
| 768p / 6s | 25 | 默认选项之一(示例) |
| 768p / 10s | 50 | 时长升级(示例) |
| 1080p / 6s | 80 | 分辨率升级(示例) |
🧠 产品化机制:闲时模式“无限生成”
官网文案中出现“无限图像和视频生成”以及“用完积分后仍可在闲时模式下使用 Hailuo 系列模型无限生成”的描述,这是典型的“通过队列与时段管理”换取低边际成本的策略。 [来源]
海螺最值得学的是它的产品化定价与队列策略:把模型能力、分辨率、时长与成本做成明确梯度,同时用“闲时无限生成”把长尾需求留在平台上。对做 AIGC 产品的人来说,这比“某次生成更惊艳”更有参考价值。 后续我会补齐:不同模型(2.3 vs 2.3-Fast)在速度/质量/成本上的差异,以及它是否暴露更明确的可控接口(镜头/运动/参考图数量)。
🏢 公司与产品入口(可追溯来源)
| 产品官网 | loopit.me |
| App Store | Loopit - Make playables(开发者:SeedLeap) |
| Google Play | Loopit - Make Playables(开发者:SeedLeap) |
| 支持邮箱 | support@loopit.me [来源] |
🧩 产品定位:从“观看内容”到“玩内容”
Loopit 在商店页的自我描述非常明确:它不是“做一段视频”,而是把点子做成可玩的互动体验(playables / mini-apps),并强调用户会“play, touch, and remix”。 [来源] [来源]
避混淆:存在多个同名 “Loopit/LoopIt” 应用或品牌。本公司卡片仅覆盖 SeedLeap 出品的这款 “Loopit - Make Playables”(以上官网与商店链接为准)。
⚙️ 核心机制拆解(从官方/条款反推)
- Remix(复刻/二创):官方文案强调 “Remix it in one tap”,隐私政策也描述了发布后可被其他用户 remix 并产生衍生作品,同时会对原作者提供 credit。[来源] [来源]
- UGC + 社区分发:隐私政策提到发布内容后可对“更广泛的 App 用户社区”可见,并支持分享、评论、互动等社交功能。[来源]
- AI 功能与免责声明:条款里单列 AI-Generated Outputs,指出 AI 输出可能不准确且不保证适用性,同时允许使用 prompts/outputs 改进服务。[来源]
🔐 数据与合规(公开可追溯口径)
- 隐私政策:公开说明会收集/处理登录信息、用户提交内容(含 prompts/媒体片段)、设备信息、活动数据等。[来源]
- Google Play 数据安全声明:数据安全页显示“开发者声明该应用不收集或分享用户数据”,并说明数据传输加密、可请求删除数据。[来源]
SeedLeap/Loopit 值得放进“世界模型/交互内容”公司池里跟踪的原因是:它把 AIGC 的输出形态从“内容”推进到“可交互对象”。如果后续它能把 playables 的表达能力做强(更复杂的状态机/更稳定的交互反馈),并让 Remix 形成持续的内容网络效应,那么它会成为一个很典型的“交互内容平台”样本。
生数最大的护城河不是模型架构,而是清华血统。朱军团队在贝叶斯机器学习领域积累了十数年,U-ViT 就是他们 2022 年发表的。这种"学术-产业"双轮驱动的模式,让他们能第一时间把最新论文变成产品。竞争对手需要追赶的不仅是代码,还有整个 Lab。