MirageLSD:实时无限视频生成技术,开启AI影像新篇章

MirageLSD:全球首个实时、无限长AI视频生成模型已上线。

原文标题:世界首个「实时、无限」扩散视频生成模型,Karpathy投资站台

原文作者:数据派THU

冷月清谈:

MirageLSD是Decart公司推出的一款革命性AI视频生成模型。它首次实现了视频的“实时”和“无时长限制”生成,并且支持接收任何视频流作为输入。这意味着,无论是摄像头、视频聊天画面、电脑屏幕还是游戏内容,MirageLSD都能在极低的延迟(40毫秒以内)下,将其转化为用户通过文本提示所希望的任何视觉风格和内容。

这项技术突破性地将AI视频带入了类似“滤镜”的应用范畴,能够实时调整画面风格和内容,极大地拓展了AI视频的应用边界。前特斯拉AI总监、OpenAI创始团队成员安德烈·卡帕西(Andrej Karpathy)对此寄予厚望,并已作为天使投资人入局。他设想了诸多未来应用场景,包括将摄像头画面转变为“另一个世界”、实现自导自演的实时电影、极大地简化游戏开发中的美工环节,以及对任意视频流进行风格迁移,甚至在AR眼镜中实时卡通化现实世界。可以说,MirageLSD为“覆盖现实世界的幻想画面”奠定了技术基础,预示着AI视频“杀手级应用”的无限可能。

技术上,MirageLSD突破了现有模型在视频生成时长和延迟方面的限制。它基于定制的“实时流扩散(Live Stream Diffusion,LSD)”模型,通过Diffusion Forcing技术实现逐帧去噪,并引入历史增强方法纠正误差,从而解决了传统模型自回归特性导致的质量下降问题,实现了不受限的视频生成长度。同时,通过定制CUDA内核、快捷蒸馏(shortcut distillation)和模型剪枝等优化,LSD将每帧生成时间控制在40毫秒以内,实现了24帧/秒的实时生成速率,响应速度比以往模型提升16倍以上。这种因果反馈机制使其能够对输入变化即时响应,保持时间一致性并持续适应画面内容。

尽管强大,MirageLSD仍有改进空间。例如,当前系统依赖有限的历史帧窗口,未来可引入更长期的记忆机制以提升长序列中的角色和场景连贯性。此外,对于特定物体或区域的精细控制仍有待加强,可整合关键点或场景标注等结构化控制信号。并且,在极端风格变换下,语义一致性和几何稳定性也需要进一步优化。

怜星夜思:

1、MirageLSD让实时视频生成变得触手可及,除了文章里提到的电影制作、游戏美工和视频会议,你觉得在数字内容创作领域,它还有哪些我们现在可能还没想到的“颠覆性”应用?比如,它会改变传统的制作流程吗?
2、这项技术能实时改变视频内容,听起来很酷,但如果它真的普及了,会不会对我们认识“真实”世界产生影响?比如,信息真伪辨别、数字身份安全、甚至是个人心理层面,你有什么担忧吗?
3、文章提到了MirageLSD未来需要改进的地方,比如长序列连贯性和对象精细控制。如果你是Decart的技术负责人,你认为当前最核心、最难攻克的下一个技术挑战是什么?为什么这对模型的实用性和普及至关重要?

原文内容

图片
来源:机器之心
本文约2200字,建议阅读5分钟
本文为你介绍世界首个「实时、无限」扩散视频生成模型。


一觉起来世界已经进化成这样了?  


每个人都能懂点魔法,能够随意穿梭在各个平行时空和幻想世界里。



读者朋友们看到这说不定撇撇嘴,「这不就是 AI 视频吗?」


但如果加上两个关键词,这将成为 AI 视频生成领域革命性的突破!


近期,Decart 发布了世界上首个「实时的」「无时长限制的」并且支持「任意视频流」的扩散视频模型 MirageLSD!



输入任何视频流,无论是相机或视频聊天、电脑屏幕还是游戏,MirageLSD 都能在 40 毫秒延迟以内将其转化为你想要的任何世界。


这一切都看上去不可思议,AI 视频已经能够实现和滤镜一样的应用方式,实时智能调整画面风格和画面内容,并且能够通过文本提示任意地进行控制。


实时视频魔法

解锁全新应用可能


前特斯拉 AI 总监,OpenAI 的创始团队成员 Andrej Karpathy 为此技术展开了广泛的想象:



  1. 摄像头画面变为 “另一个世界”;

  2. 自导自演实时电影:拿起道具、演绎场景,AI 负责实时布景和风格化,秒看回放,边演边剪;

  3. 游戏开发轻松起步:用简单的球体 / 方块编码游戏机制,再用实时扩散模型为游戏生成精美贴图;

  4. 任意视频流的风格迁移:例如:只需一句提示词就能让《上古卷轴》看起来 “更史诗”,让《毁灭战士 2》拥有现代虚幻引擎画质;

  5. 视频会议背景和实时虚拟试衣;

  6. AR 眼镜升级:实时将现实世界卡通化;

  7. 哈利波特的「厄里斯魔镜」:现实中看似普通的镜子,实际上会显示出 AI 根据你 “深层欲望” 生成的理想自己或世界。


Karpathy 表示自己已经成为了这个 MirageLSD 项目的天使投资人,在他看来这项技术通用且强大。


也许这些都只是开始,真正的 “杀手级应用” 还没被发现 —— 这个领域值得无限想象!


这一切让我想起了「刀剑神域」,似乎覆盖现实世界的幻想画面真的要实现了?


Decart 也展示了一些构想的演示,充分满足了各种可能:


比如在沙漠里滑雪?



比如可以花上 30 分钟写个游戏代码,然后让 Mirage 处理图形?

              


Decart 推文中笑称,使用 Mirage「从提示词制作 GTA VII,比 GTA VI 发售还快。」


目前 Mirage 已正式上线,与其观看屏幕上的魔法,不如亲手创造魔法。 


Decart 将持续发布模型升级和新功能,包括面部一致性、语音控制和精确物体操控等。与此同时,平台还将上线一系列新特性 —— 如流媒体支持(以任意角色进行直播)、游戏集成、视频通话等功能。


体验链接:https://mirage.decart.ai/


魔法背后

MirageLSD技术原理


MirageLSD 主要在视频生成的时长和延迟两大角度产生了突破,基于定制的模型 —— 实时流扩散(Live Stream Diffusion,LSD),该模型能够逐帧生成并保持时间连贯性。


在视频时长方面,先前的视频模型在生成 20-30 秒后就会因错误累积而严重降低质量。


在生成延时方面,它们往往需要几分钟的处理时间才能输出几秒钟的视频。即使是今天最接近实时速度的系统,通常也是分块生成视频,从而引入不可避免的延迟,完全无法实现交互应用。


无限长视频生成


MirageLSD 是第一个能够生成无限长视频的视频生成模型。


由于模型的自回归特性,会导致误差逐步累积,从而限制输出的长度。


为了实现无限自回归生成:


  • MirageLSD 基于 Diffusion Forcing 技术,实现逐帧去噪;

  • 我们引入历史增强方法,在训练中对输入历史帧进行扰动,使模型学会预判并纠正输入中的伪影,从而增强其对自回归生成中常见偏移的鲁棒性。


这两者结合,使 LSD 成为第一个能够无限生成视频而不会崩溃的模型 —— 稳定、可提示,并始终与场景和用户输入保持一致。


零延时视频生成


响应性是指最坏情况下的响应延迟,即使是之前的自回归模型响应速度也比 MirageLSD 慢 16 倍以上,导致实时交互无法实现。


实时生成要求每帧的生成时间控制在 40 毫秒以内,以避免被人眼察觉。我们通过以下方式实现这一目标:


  • 设计定制的 CUDA mega kernels,以最小化开销并最大化吞吐;

  • 基于 shortcut distillation 模型剪枝技术,减少每帧所需的计算量;

  • 优化模型架构,使其与 GPU 硬件高度对齐,实现效率最大化。


通过上述技术,我们在响应速度上相较于以往模型提升了 16 倍,实现了以 24 帧 / 秒的速率实时生成视频。


扩散模型与 LSD


扩散模型通过一系列逐步去噪操作,将随机噪声逐渐还原为图像或视频。在视频生成中,这通常意味着一次性生成固定长度的视频片段,这有助于保持时间一致性,但会带来延迟。一些系统尝试通过所谓的 “自回归生成” 方式,逐段顺序生成帧片段,以提高灵活性。然而,这种方式仍需在每一段帧生成完毕后才能响应新的输入,限制了交互性和实时应用的能力。



LSD 采用了不同的方法。它一次生成一帧,使用因果性的自回归结构,每一帧都依赖于此前生成的帧以及用户提示。这种方式支持即时反馈、零延迟交互,并且可以持续生成视频,无需预先设定终点。


在每一个时间步,模型会接收一组过去生成的帧、当前输入帧以及用户定义的提示词,然后预测下一帧输出,该帧会立即作为输入传递到下一轮生成中。



这种因果反馈机制使 LSD 能够保持时间上的一致性,持续适应画面中的动作与内容变化,并在实时遵循用户提示的同时,生成无限长度的视频序列。


此外,它还使 LSD 能够对输入作出即时响应 —— 无论是文本提示还是视频内容的变化 —— 实现真正的零延迟。这正是实时编辑与转换成为可能的关键。


技术缺陷与改进方向


首先,当前系统依赖于有限的历史帧窗口。引入更长期的记忆机制有望提升长序列中的连贯性,从而在角色身份、场景布局和长期动作等方面实现更一致的表现。


此外,尽管 MirageLSD 支持基于文本的风格变换,但对于特定物体、空间区域或动作的精细控制仍较为有限。若能整合关键点或场景标注等结构化控制信号,将有助于在实时环境中实现更细粒度、用户可控的编辑操作。


在语义一致性和几何稳定性方面,特别是在面对极端风格变换时,仍需进一步优化。MirageLSD 在极端风格变化下,可能会出现物体结构或布局被扭曲的情况。



编辑:于腾凯

校对:龚力


关于我们

数据派THU作为数据科学类公众号,背靠清华大学大数据研究中心,分享前沿数据科学与大数据技术创新研究动态、持续传播数据科学知识,努力建设数据人才聚集平台、打造中国大数据最强集团军。




新浪微博:@数据派THU

微信视频号:数据派THU

今日头条:数据派THU

从法律和社会角度看,侵犯肖像权、名誉权的问题会更突出。如果有人用我的视频实时生成一些不好的内容,我怎么维权?版权问题也复杂了,模型训练用的数据源,生成出来的东西归谁?还有就是,如果人人都沉浸在这种虚拟现实中,会不会削弱人际交流和社会的凝聚力?社会运行的基础规则可能都需要重新思考,不然真会乱套啊。

针对“MirageLSD在数字内容创作领域会有哪些意想不到的颠覆性应用?”这个问题,我觉得最颠覆的会是直播行业和个人IP打造。以前直播间要布景、换装,现在AI可以实时帮你切换场景,甚至角色造型,比如你可以在直播中一秒变二次元人物,或者把自己的脸实时投到游戏角色上。这大大降低了内容创作门槛,让“人人都是导演”不再是空话,但可能也会出现内容同质化。传统影视和游戏工业流程也可能被重塑,预生产和后期制作的界限会变得模糊,更多工作会前置或内化到拍摄环节。

对于"这项技术普及后,会不会对我们认识‘真实’世界产生影响?"这个问题,担忧肯定有。最大的担忧就是“眼见不再为实”。当任何人都能实时修改视频内容时,深伪技术(Deepfake)的应用门槛会降到极低。这会导致虚假信息、谣言甚至是敲诈勒索的视频满天飞,社会信任体系可能会受到严重冲击。辟谣会变得异常困难,甚至无效。我们需要更强大的AI检测工具来鉴别真伪,同时公众也得培养起更强的批判性思维。

如果我是技术负责人,我可能会把**进一步的计算效率优化和模型压缩(Computational Efficiency & Model Compression)**放在首位。虽然现在已经很快了,但要达到能在普通消费级硬件上流畅运行,甚至集成到手机或眼镜这类边缘设备中,仍然有很大的距离。这涉及到模型架构的极致瘦身、推理速度的再提升,以及如何在小体积模型下保持甚至提升生成质量。如果不能让它广泛部署到大众设备上,它的“魔法”就只能停留在少数人的实验室或高端工作站里,无法真正普及和变革我们的生活。毕竟,要成为“杀手级应用”,得先能飞入寻常百姓家。

说到意想不到的应用,我脑子里立刻蹦出“实时互动体验”!比如在博物馆里,游客对着历史文物拍照,AR眼镜或手机就能实时把文物“复活”成它刚被创造时的样子或者模拟历史场景;或者在教育领域,复杂的科学实验可以实时模拟,学生直接在虚拟环境中操作,根据结果实时调整参数。这让学习和体验变得超级直观和沉浸式。想想看,孩子们可以“亲手”体验恐龙时代,这比看书强太多了。

要我说啊,最难搞的应该是精细化的对象级控制(Fine-grained Object Control)。现在AI能做风格迁移,但如果我想让视频里某个特定杯子变成金色,或者只让主角的头发变长,而背景其他人不变,这就很难了。这需要模型能精确识别和隔离画面中的各个元素,并理解用户指令是针对哪个特定对象的。如果不能实现这一点,创作者在使用时就会觉得“差点意思”,因为它不是一个“精密工具”,而更像一个“模糊滤镜”,适用范围就会大大受限。这对于专业影视制作或广告定制尤其重要,因为细节决定成败。

针对“最核心、最难攻克的下一个技术挑战是什么?”这个问题,我个人认为最核心且最难攻克的是长序列时间连贯性(Long-term Temporal Coherence)。目前模型依赖有限的历史帧窗口来保持连贯性,但在连续数分钟甚至数小时的视频中,如何保证角色特征、场景布局、甚至特定物体的一致性而不发生“闪烁”或“身份漂移”是一个巨大的挑战。这不仅涉及模型对过去信息的有效记忆和编码,更需要深层次理解物理世界中的对象持久性和因果关系。没有这个,再酷炫的实时风格转换,一旦人物开始“变脸”,就会瞬间出戏,极大限制了其在专业内容生产中的应用。

我认为广告和个性化定制服务可能会迎来爆发。比如广告可以在你看的时候实时根据你的喜好、当前情绪调整风格和内容;还有在线购物的“虚拟试穿”会更逼真,甚至能实时生成你穿上新衣服在各种场景下的效果。这玩意儿的实时性让它超越了传统剪辑工具,真正做到了“所见即所得”,并且是“所思即所得”。

从个人心理层面看,我觉得影响也不可小觑。如果大家都能轻松地把自己“美化”成完美的虚拟形象,或者频繁活在AI构建的“理想世界”里,会不会导致更多人对现实产生不满和焦虑?“完美滤镜”用得多了,容易让人脱离现实。当虚拟身份和现实身份的界限越来越模糊时,个人身份认同可能会变得混乱,甚至引发更多心理健康问题。感觉这就像一层数字海市蜃楼,美则美矣,但可能让人迷失心智。