帧跃科技拿下千万美元天使轮:华为云老兵押注“可交互视频”

导语:华为云老兵创业,帧跃科技瞄准交互式视频平台。

AI视频赛道又挤进来一支很有辨识度的新队伍。主攻 AI 交互式视频的初创公司帧跃科技,已经完成千万美金级天使轮融资,投资方包括创新工场、国谦资本、零一万物、璞跃中国及盈动资本等机构。按照帧跃科技的规划,这笔钱不会简单砸向单一视频模型训练,而会集中投入三件事:视频推理平台持续迭代、应用层产品开发,以及全球化人才团队建设。

这家公司成立于 2025 年 6 月,时间很短,但团队履历不轻。它切入的也不是普通“文生视频”叙事,而是更难啃的交互式视频:视频不再只是一次性生成的片段,而要能根据用户输入、场景变化、物理约束和实时反馈动态调整。说白了,生成视频从“出一段好看的画面”,往“构建一个可控制、可响应、可运行的视觉过程”走。

华为云媒体与多模态模型班底,是帧跃科技最硬的筹码

帧跃科技创始人兼 CEO 杨昌鹏,是南洋理工大学与加州大学伯克利分校联合培养博士,曾担任华为云媒体创新 Lab 首任主任,也是交互式媒体方向的 1 号位。在华为期间,他主导搭建了首个实时交互媒体基础设施团队,技术体系覆盖生成式视频、实时渲染与物理引擎等底层模块。

这个背景很关键。交互式视频并不是把视频生成模型做大就能解决的题,它涉及实时系统、渲染管线、推理调度、物理一致性、交互延迟和终端体验。杨昌鹏此前在华为负责的是底层媒体基础设施,这类经验往往不显山露水,但在产品真正进入复杂场景时,会直接决定系统能不能跑起来、能不能稳住成本、能不能支撑实时体验。

他还曾凭借媒体基础设施领域的重大突破获得 Franz Edelman 奖。这个奖在资源调度领域分量很重,行业内常把它类比为该领域的“诺贝尔”奖。对一家刚成立不久的 AI 视频公司来说,这意味着创始团队不是只会讲生成式 AI 故事,而是有过大规模系统与产业级问题的实战经验。

CTO 李明磊补上模型侧能力:从盘古大模型到多模态工程化

帧跃科技联合创始人兼 CTO 李明磊,同样来自华为体系。他曾任华为云多模态方向首席科学家,主导过华为初版盘古大模型训练,并发表 40 余篇 CCF-A 论文,拥有 50 余项专利。此外,他曾 3 次获得最佳论文奖、3 次拿下世界级赛事冠军。

如果把杨昌鹏的能力看作“实时交互媒体基础设施”,李明磊更像是“多模态大模型与生成式模型训练”的核心拼图。他覆盖的是从前沿研究、模型训练到工程化落地的完整链条。AI 视频创业公司最怕两头不靠:会做 Demo 但没有系统能力,或者懂工程但缺模型能力。帧跃科技这组搭配,至少从纸面上看,避开了这个常见短板。

这也是它为什么会被视为“华为系”创业项目的原因。不是简单因为创始团队来自华为,而是因为它带出的能力组合,恰好踩中了交互式视频真正难做的区域:底层系统、视频生成、多模态模型、实时渲染、物理引擎,以及大规模工程交付。

交互式视频不是更长的视频,而是更可控的视觉系统

过去一年,AI 视频行业的主线更多围绕清晰度、时长、镜头语言和文本遵循能力展开。用户输入一句话,模型生成几秒到几十秒的视频,这是典型的离线生成逻辑。但交互式视频要解决的问题更复杂。

举个更直观的例子:如果只是生成一段“机器人在客厅里走动”的视频,模型可以根据提示词输出一个漂亮片段;但如果用户在视频过程中改变指令,让机器人绕过桌子、拿起杯子、避开地毯边缘,同时保持动作连贯、空间关系正确、物理反馈可信,这就不是单个扩散模型能轻松吃下的任务了。

帧跃科技看中的正是这个“深水区”。它提出的方向不是让视频模型孤军奋战,而是把生成模型、程序化生成、实时渲染和物理规则放进同一个底层架构里,按任务需求动态调度。

“三位一体”架构:把 DiT、代码生成和物理渲染放到一张桌上

帧跃科技提出了一个“三位一体”架构,核心判断是:下一代视频生成不会只依赖一种技术路线,而会由三条路径协同完成。

  • DiT 生成模型:以 Diffusion Transformer 为代表的生成模型,直接生成视频内容,适合处理画面表现力、风格化表达、复杂视觉纹理等任务。
  • Coding 生成:通过代码、程序化规则和可执行逻辑生成视频过程,更适合强调结构控制、交互反馈、规则变化和可复现流程的场景。
  • 渲染与物理生成:借助三维空间、物理规则和实时渲染,处理空间一致性、动作稳定性、碰撞关系、光照反馈和物理真实感。

这套思路的价值在于,它没有把 AI 视频简单理解成“模型参数越大越好”。真实的交互体验里,模型负责想象力,代码负责逻辑,渲染和物理引擎负责稳定的空间世界。三者缺一块,产品都会露怯:画面很美但不可控,逻辑很清楚但视觉贫瘠,物理关系对了但生成效率跟不上,都会影响最终体验。

Leadde 将在 2026 年下半年发布,目标不是单个视频模型

按照目前披露的信息,帧跃科技计划在 2026 年下半年发布首个平台级产品 Leadde,面向全球专业用户与企业用户。这个时间点不算激进,反而说明公司很清楚交互式视频不是短周期冲榜项目,它需要底层平台、任务调度、模型能力、实时推理和应用场景一起打磨。

Leadde 的定位也很有意思。它并不是一个单纯依赖某个视频模型的生成工具,而是一个会根据任务输入、场景约束和体验需求进行统一编排的系统。具体来说,Leadde 会在 DiT 模型生成、Coding 生成、渲染/物理生成之间做调度,并在离线高质量生成与实时低延迟生成之间动态选择。

这意味着,同样是“生成视频”,系统会根据需求采用不同的执行路径:

  • 当任务更强调画面表现力、风格效果、视觉细节时,系统会更多调用模型生成能力;
  • 当任务更强调逻辑控制、交互反馈、流程可控时,系统会更多依赖 Coding 生成;
  • 当任务更强调空间关系、动作稳定和物理一致性时,系统会调动实时渲染与物理引擎能力。

这种平台化思路,对企业客户尤其有吸引力。企业并不只想要一段惊艳视频,它们更关心可控性、可复用性、延迟、成本、接口能力和业务系统集成。Leadde 如果能把这些能力压到统一平台里,帧跃科技就不只是“又一家视频生成创业公司”,而是在争夺下一代交互式内容生产基础设施的位置。

为什么投资人会押注这个方向

AI 视频已经从早期的惊艳样片阶段,进入更现实的产品竞争阶段。单纯拼生成质量,头部大模型公司和资金雄厚的平台型玩家优势明显。创业公司如果还沿着“训练一个更强文生视频模型”的路线硬冲,成本、数据、算力和分发都会承压。

帧跃科技选择交互式视频,本质上是在寻找差异化入口。这个入口更靠近专业生产、企业应用、游戏化内容、虚拟人、数字孪生、教育训练、交互广告、空间计算等复杂场景。它要求视频不只是被观看,而是能被操作、被修改、被实时驱动。

从投资方组合看,创新工场、零一万物等机构本身就高度关注 AI 原生应用和大模型基础设施。帧跃科技拿到千万美金级天使轮,某种程度上说明资本正在重新评估 AI 视频赛道:下一轮机会不一定只在“谁生成得更像电影”,也可能在“谁能把生成视频做成可交互、可部署、可商业化的平台”。

真正的考验在产品发布后

帧跃科技眼下讲清楚了方向,也拿出了足够亮眼的团队牌面。但交互式视频是个难题密集区。实时低延迟与高质量画面之间怎么取舍,物理一致性和生成自由度如何兼容,平台调度成本能不能压下来,专业用户是否愿意改变现有工作流,这些都要等 Leadde 真正发布后才有答案。

不过,这家公司有一个清晰的判断值得关注:视频生成不会停在“输入提示词、等待成片”的阶段。下一步更像是把视频、代码、三维空间和物理系统揉在一起,形成可以被实时操控的内容引擎。帧跃科技如果能把这套架构跑通,它面对的就不只是内容创作工具市场,而是更广的一层 AI 交互式视觉基础设施。

© 版权声明

相关文章