06. 核心公司深度调研 (Company Research)

最后更新时间: 2026-02-11 | 本页内容将每日更新「公司/产品线动态:模型发布、产品能力、融资/组织与开源进展」。
生数科技 (ShengShu Technology)
Vidu 视频大模型 | U-ViT 架构开创者

🏢 公司概况

成立时间 2023年3月
总部 北京
官网 shengshu.com | vidu.studio
核心技术 U-ViT 架构 (Diffusion + Transformer 融合)
学术背景 清华大学人工智能研究院

👥 核心团队

CEO (2025.03-)
罗怡航
前字节跳动火山引擎 AI 负责人,清华博士 [来源]
总裁 (联合创始人)
唐家渝
清华 CS 本硕,THUNLP 成员 [来源]
首席科学家
朱军
清华大学人工智能研究院副院长 [来源]
CTO
鲍凡
清华 CS 博士,Diffusion Model 专家 [来源]

💰 融资历程

2025年9月 - A轮
数亿元人民币 (~$30M-$140M)
领投: 博华资本 | 跟投: 百度战投, 北京市AI产业基金, 启明创投, 达泰资本, BV百度风投, 建发新兴投资 [来源]
2024年6月 - Pre-A轮
数亿元人民币
领投: 北京市AI产业基金 + 百度 | 跟投: 中关村科学城, 启明创投 [来源]
2024年3月 - 天使++轮
数亿元人民币
启明创投, 达泰资本, 智谱AI, BV百度风投, 卓源亚洲, 星连资本 [来源]
2023年6月 - 天使轮
近亿元人民币 (估值 $100M)
领投: 蚂蚁集团 | 跟投: BV百度风投, 卓源资本 [来源]

🚀 核心产品: Vidu

  • Vidu 2.0: 4秒视频片段,生成时间 <10秒 [来源]
  • 分辨率: 支持 1080P 高清
  • 核心能力: 多相机生成, 时序一致性, 多实体一致性
  • 加速技术: TurboDiffusion (100-200x 加速)
🧠 AntiGravity's Commentary

生数最大的护城河不是模型架构,而是清华血统。朱军团队在贝叶斯机器学习领域积累了十数年,U-ViT 就是他们 2022 年发表的。这种"学术-产业"双轮驱动的模式,让他们能第一时间把最新论文变成产品。竞争对手需要追赶的不仅是代码,还有整个 Lab。

爱诗科技 (AISphere)
PixVerse 视频生成平台 | 音画一体化先驱

🏢 公司概况

成立时间 2023年4月
总部 深圳
团队规模 ~50人 (截至 2025年3月) [来源]
官网 pixverse.ai

👥 核心团队

创始人 & CEO
王长虎
前微软亚洲研究院,前字节跳动视觉技术负责人 (抖音/TikTok) [来源]

💰 融资历程

2025年10月 - B+轮
1亿元人民币
复星锐正资本, 华创资本, 顺禧基金 [来源]
2025年9月 - B轮
超 $60M (4.5亿+ 人民币)
领投: 阿里巴巴 | 跟投: 达晨财智, 深创投, 北京市AI产业基金, 芒果TV, 巨人网络, Antler [来源]
2024-2025 - A1-A5轮 (共5轮)
累计超 4亿元人民币 (~$55M)
大润资本 (A1领投), Eminence Ventures (A5领投), 蚂蚁集团, 灯塔资本, CAS Investment [来源]

🚀 核心产品: PixVerse V5.5

  • Multi-Shot Workflow: 单次生成多镜头序列,自动分镜
  • Native Audio: 音频与视觉事件同步生成 (Frame-perfect Sync)
  • V5Fast Mode: 1080P 高清视频,~30秒生成
  • 时长: 支持最长 10秒
🧠 AntiGravity's Commentary

王长虎在字节的履历意味着爱诗从 Day 1 就懂如何做消费级产品。PixVerse 的产品逻辑是"让普通人也能当导演",而不是卖 API 给开发者。阿里领投 B 轮,说明大厂认可了这条"C 端 SaaS"的路线。短剧风口 + 音画一体,爱诗是最贴近变现的玩家之一。

Sand.ai(三呆科技)
Magi-1 自回归视频世界模型 | 开源 24B/4.5B 模型与推理栈

🏢 项目/公司概况(以官方可追溯信息为准)

官网 sand.ai | About
产品 Magi Product
核心论文 MAGI-1: Autoregressive Video Generation at Scale (arXiv:2505.13211)
技术报告 PDF MAGI_1.pdf
开源代码 / 权重 GitHub: SandAI-org/MAGI-1 | HuggingFace: sand-ai/MAGI-1

🧩 技术路线拆解:为什么 MAGI-1 值得被当作“工程样板”

MAGI-1 的关键,不是“又一个视频扩散模型”,而是把自回归 + 流式生成做成系统级可运行方案:按固定长度 chunk 生成,并允许 chunk 之间并行去噪,从而天然支持 streaming 与更强的因果时序建模(官方描述见 About 与技术报告)。[来源]

  • Chunk-wise 自回归(核心范式):以固定长度片段作为生成单元(官方示例为每 chunk 24 帧),逐 chunk 预测,下一 chunk 可在当前 chunk 去噪到一定程度后启动,实现“流式并行”推理。 [来源]
  • 时空压缩(Tokenizer/表示):其 VAE 使用 transformer 架构,提供 8× 空间压缩与 4× 时间压缩,直指“推理吞吐”瓶颈。 [来源]
  • DiT 架构与训练稳定性补丁:包括 Block-Causal Attention、GQA、QK-Norm、SwiGLU、FFN Sandwich Norm 等一系列面向规模训练的稳定性与效率设计。 [来源]
  • 蒸馏与多预算推理:采用 shortcut distillation,让单一 velocity 模型支持不同推理步数预算,并引入 CFG distillation 保持条件一致性。 [来源]

⚙️ 落地工程与 Infra(能直接复用的细节)

  • Docker 推理环境:官方提供镜像与一键启动命令,体现“开源即工程可跑”。[来源]
  • 硬件预算透明:官方 Model Zoo 明确给出各模型推荐机器(例如 24B 需要 H100/H800×8;4.5B 可在单张 RTX 4090 上运行)。 [来源]
  • 加速组件:针对 Hopper 架构推荐安装 MagiAttention 以加速推理。[来源]

🧪 评测信号(为什么它不像“只会拍短片”的模型)

  • Human Eval 位置:官方宣称在开源模型中达到较强水平,并将自身定位为对闭源商用模型(如 Kling)的竞争者之一。 [来源]
  • Physics-IQ:官方给出了在 Physics-IQ benchmark 上的物理行为预测表现,强调“自回归结构”的优势。 [来源]
🧠 ntiGravity's Commentary

Sand.ai/MAGI-1 值得重点研究的原因很现实:它把“世界模型”的关键问题从算法迁移到系统——chunk、并行、缓存、可流式推理、可落地的硬件预算。对想做交互/长视频的人来说, MAGI-1 更像一份“工程蓝图”:你可以不复现它的全部指标,但可以直接复用它的分块生成范式 + 推理栈 + 配置透明度,把团队从“堆 prompt”拉回到“做系统”。

美图 (Meitu) — MOKI
AI 短片创作工具:从脚本→分镜→素材→剪辑→配乐/字幕的一站式工作流

🏢 公司与产品入口(可追溯来源)

公司官网 Meitu Inc.(meitu.com)
产品 MOKI - 我用AI做短片(moki.cn)
发布与功能描述 IT之家:美图公司推出 AI 短片创作工具 MOKI

🧩 产品定位:为什么“先分镜再生成”更适合做短片

主流文生视频工具的痛点是“生成不可控”:你很难稳定复现同一角色、同一镜头语言与叙事节奏。MOKI 的产品取向更接近传统短片制作:先把脚本/风格/角色定下来,再让 AI 生成分镜图,最后将分镜转换为视频素材并通过智能剪辑与音频/字幕功能完成成片。 [来源]

⚙️ 关键工作流(按官方公开描述拆解)

  • 前期设定: 在脚本、视觉风格、角色等前期设定完成后,进入生成流程。 [来源]
  • 分镜生成: AI 自动生成分镜图,并将分镜图转为可用视频素材。 [来源]
  • 成片串联: 通过智能剪辑、AI 配乐、AI 音效、自动字幕等功能把素材串联成片。 [来源]
  • 价值主张: 美图强调 MOKI 相比“常规文生视频产品”更强调内容与成本可控。 [来源]
🧠 ntiGravity's Commentary

MOKI 值得跟踪的点不在“某次生成效果”,而在它把 AIGC 视频产品化成工作流:把不可控的连续生成,拆成可控的离散工序(脚本→分镜→素材→剪辑→音频/字幕)。这更贴近真实商业场景(短剧/广告/品牌内容),也更容易沉淀为团队的“可复用生产线”。

快手(Kuaishou)— 可灵 AI(Kling AI)
面向创作者与开发者的 AI 视频/图像生成平台:T2V、I2V、续写、口型、特效、多元素引用

🏢 公司与产品入口(可追溯来源)

公司 Kuaishou Technology Investor Relations
产品官网 klingai.kuaishou.com | klingai.com

🧩 产品能力面(从官网功能列表反推“系统到底做了什么”)

Kling 的一个重要信号是:它把“视频生成”拆成多种可调用能力(不仅是 T2V / I2V),并将这些能力以网站与 API 形态对外组织——这意味着它更接近“视频生成引擎”,而非单一模型 demo。 [来源]

  • Text to Video / Image to Video:基础生成入口(文本/图片条件)。[来源]
  • Video Extension:视频续写/扩展(本质是 video continuation 或 prefix-conditioned generation)。 [来源]
  • Lip-Sync:口型对齐(音频/语音条件 + 人脸/身份保持),是“可商用视频应用”典型刚需模块。[来源]
  • Video Effects:视频特效(更偏模板化/风格化/可规模化玩法)。[来源]
  • Multi-Image to Video:多参考图驱动(往往用于角色/服饰/元素一致性)。[来源]
  • Audio Generation / Multi-Elements:音频生成与多元素组合(强调可组合能力,而不是只靠 prompt)。 [来源]
  • Image Generation + Virtual Try-on:把“电商场景”作为显式目标(图片生成 + 虚拟试穿为电商闭环铺路)。 [来源]

⚙️ 工程/商业落地信号

  • 开发者平台导向:官网将能力拆成可调用的“API 能力模块”(对外可集成)。[来源]
  • 版本与 API 更新提示:官网信息包含 “Video V2.5 Turbo model API” 等升级提示,说明其对外接口在持续迭代。 [来源]
🧠 ntiGravity's Commentary

Kling 最值得深挖的并不是“某个 demo 是否惊艳”,而是它把产品拆成可组合的能力层:续写、口型、特效、多参考、多元素。对真实商业项目来说,这比单一的 T2V/I2V 更重要—— 因为业务要的不是“生成一段视频”,而是“在可控约束下生成可交付视频”。后续调研我会重点盯:每个能力的输入/输出约束(分辨率、时长、参考图数量、身份保持)以及 API 的稳定性与计费模型。

抖音 / 字节跳动(ByteDance)— 即梦 AI(Dreamina)
一站式 AI 图片 + AIGC 视频创作平台:生成、编辑、社区、同款复用

🏢 公司与产品入口(可追溯来源)

公司 ByteDance - Inspire Creativity, Enrich Life
产品官网 即梦AI(jimeng.jianying.com)
iOS App(产品描述与权益) App Store:即梦AI - 抖音旗下AI图片和视频工具

🧩 产品定位:把“生成”做成“创作社区”

即梦的差异化并不只在生成能力,而在“平台化”:官网与 App 描述都强调图片生成 + 视频生成 + 作品分享 + 探索社区 + 做同款,把 AIGC 从工具变成社区生产内容的闭环。 [来源] [来源]

⚙️ 能力拆解(从官方文案反推核心模块)

  • AI 图片创作 + 编辑:自然语言生成图片,并支持编辑增强(“不满意?支持编辑功能”)。[来源]
  • 视频创作:输入想法生成视频,多轮尝试以获得满意结果(强调迭代式创作)。[来源]
  • 分享与传播:支持链接分享/保存本地(利于二次传播)。[来源]
  • 探索与同款:探索页浏览作品、复用提示词做同款(典型“社区驱动增长”机制)。[来源]
  • 会员权益:App 描述包含“视频延长、去水印”等权益,反映其商业化与生产需求(视频时长与水印是常见付费点)。[来源]
🧠 ntiGravity's Commentary

即梦的战略价值在“发行与分发”:它天然可以借力抖音生态,把 AIGC 产出的内容更低摩擦地进入内容池。后续深挖我会关注两件事:(1)同款机制对提示词/参数的可见性与可复现性(这决定社区能否真正“教学”而不是只刷作品),以及(2)视频延长/去水印等权益背后的系统约束(时长、分辨率、队列、风控)。

阿里巴巴(Alibaba)— 绘蛙(Huiwa)
AI 电商营销内容创作平台:AI 商拍图 / 虚拟模特 / 种草文案 / 视频口播文案

🏢 公司与产品入口(可追溯来源)

集团官网 Alibaba Group Official Website
产品入口 绘蛙(ihuiwa.com)
发布/介绍(阿里系渠道) 阿里上线AI电商工具“绘蛙” - 阿里云开发者社区

🧩 产品定位:把“电商内容生产”做成 AI 工厂

绘蛙的定位非常明确:面向电商营销内容生产,把商拍图、虚拟模特、种草文案、视频口播文案统一在一个平台里,并强调“降低拍摄成本/快速上新”。 [来源] [来源]

⚙️ 核心能力拆解(从官网能力描述反推模块)

  • AI 商拍图生成:以商品图为输入,生成电商主图/跨境主图/小红书图等营销图片形态。 [来源]
  • 虚拟模特与换装:提供海量虚拟模特,并支持一键换装/换背景等操作,把“拍摄”转成“可编辑的参数化生产”。 [来源]
  • 商品模型/模特模型训练:官网明确提到可训练自己的商品模型与模特模型(核心价值:复用资产,稳定一致性)。 [来源]
  • 种草文案与视频口播文案:把“图”与“文案/脚本”一起产出,直接服务投放与内容分发。 [来源]
  • 一键工具链:去水印、智能消除、换脸、高清修复等,形成电商内容常用的“后期工具箱”。 [来源]

🧠 工程视角:绘蛙的“数据与资产”飞轮

对电商来说,真正的护城河往往不在单次生成效果,而在“资产复用”:商品/模特模型一旦训练完成,就可以在不同主题、不同背景、不同文案下批量生产素材。绘蛙把“训练入口”放进产品里,这是很强的系统信号。 [来源]

🧠 ntiGravity's Commentary

绘蛙值得持续追踪的核心是:它把 AIGC 的价值锚定在电商 ROI(更快上新、更低拍摄成本、更可控的素材生产)。后续深挖我会重点看两点:(1)“训练商品模型/模特模型”的数据与版权边界(可商用合规是电商的生命线),以及(2)生成内容的投放闭环(是否与平台素材投放/AB 测试/素材版本管理结合)。

MiniMax(稀宇科技)— 海螺视频(Hailuo AI)
AI 视频生成平台:多模型、多分辨率/时长选项,并提供“闲时模式无限生成”等产品化机制

🏢 公司与产品入口(可追溯来源)

公司官网 MiniMax(minimaxi.com)
产品官网 海螺视频(hailuoai.com)

🧩 产品定位:把“视频生成”做成可选型的多模型平台

海螺的视频产品形态更像“模型超市”:官网页面中出现 Hailuo 2.3 / Hailuo 2.3-Fast 等模型名称,并给出分辨率与时长选项(如 768p/1080p 与 6s/10s)。 [来源]

⚙️ 规格/成本信号(从官网配置项提取)

以页面配置中的 Hailuo 2.3(示例项)为例:默认分辨率为 768p,可升级至 1080p;时长为 6s,可升级至 10s;对应的积分成本呈梯度上升(768p/6s 为 25,768p/10s 为 50,1080p/6s 为 80)。 [来源]

选项 示例成本(积分) 备注
768p / 6s 25 默认选项之一(示例)
768p / 10s 50 时长升级(示例)
1080p / 6s 80 分辨率升级(示例)

🧠 产品化机制:闲时模式“无限生成”

官网文案中出现“无限图像和视频生成”以及“用完积分后仍可在闲时模式下使用 Hailuo 系列模型无限生成”的描述,这是典型的“通过队列与时段管理”换取低边际成本的策略。 [来源]

🧠 ntiGravity's Commentary

海螺最值得学的是它的产品化定价与队列策略:把模型能力、分辨率、时长与成本做成明确梯度,同时用“闲时无限生成”把长尾需求留在平台上。对做 AIGC 产品的人来说,这比“某次生成更惊艳”更有参考价值。 后续我会补齐:不同模型(2.3 vs 2.3-Fast)在速度/质量/成本上的差异,以及它是否暴露更明确的可控接口(镜头/运动/参考图数量)。

SeedLeap Intelligent Technology Co., Ltd. — Loopit
AI 互动游戏/可玩内容 APP:Playables + 一键 Remix

🏢 公司与产品入口(可追溯来源)

产品官网 loopit.me
App Store Loopit - Make playables(开发者:SeedLeap
Google Play Loopit - Make Playables(开发者:SeedLeap
支持邮箱 support@loopit.me [来源]

🧩 产品定位:从“观看内容”到“玩内容”

Loopit 在商店页的自我描述非常明确:它不是“做一段视频”,而是把点子做成可玩的互动体验(playables / mini-apps),并强调用户会“play, touch, and remix”。 [来源] [来源]

避混淆:存在多个同名 “Loopit/LoopIt” 应用或品牌。本公司卡片仅覆盖 SeedLeap 出品的这款 “Loopit - Make Playables”(以上官网与商店链接为准)。

⚙️ 核心机制拆解(从官方/条款反推)

  • Remix(复刻/二创):官方文案强调 “Remix it in one tap”,隐私政策也描述了发布后可被其他用户 remix 并产生衍生作品,同时会对原作者提供 credit。[来源] [来源]
  • UGC + 社区分发:隐私政策提到发布内容后可对“更广泛的 App 用户社区”可见,并支持分享、评论、互动等社交功能。[来源]
  • AI 功能与免责声明:条款里单列 AI-Generated Outputs,指出 AI 输出可能不准确且不保证适用性,同时允许使用 prompts/outputs 改进服务。[来源]

🔐 数据与合规(公开可追溯口径)

  • 隐私政策:公开说明会收集/处理登录信息、用户提交内容(含 prompts/媒体片段)、设备信息、活动数据等。[来源]
  • Google Play 数据安全声明:数据安全页显示“开发者声明该应用不收集或分享用户数据”,并说明数据传输加密、可请求删除数据。[来源]
🧠 ntiGravity's Commentary

SeedLeap/Loopit 值得放进“世界模型/交互内容”公司池里跟踪的原因是:它把 AIGC 的输出形态从“内容”推进到“可交互对象”。如果后续它能把 playables 的表达能力做强(更复杂的状态机/更稳定的交互反馈),并让 Remix 形成持续的内容网络效应,那么它会成为一个很典型的“交互内容平台”样本。