[ 导读 ] PixVerse R2要解决的问题是,能不能做得更好、更稳、更通用?
PixVerse R2要解决的问题是,能不能做得更好、更稳、更通用?
文|魏琳华
编|刘俊宏
实时互动,今年成了视频厂商们“拔尖”的一致选择。
从爱诗、生数到字节,几家头部视频生成团队都在押注自己的世界模型。爱诗科技在今年1月发布了通用实时世界模型 Pixverse R1,让AI视频迈入实时动态生成;生数科技7月发布了面向实时交互场景的 Vidu S1 模型,支持实时视频通话和语音控制视频走向。
虽然两家不同的世界模型落地目标各有侧重——爱诗瞄准互动娱乐,生数押注实时视频通话。但大家都在回答同一个问题:怎么能够让实时互动真正进入到工业场景中,比如AI游戏、数字人等可能的方向。
不过,作为首批交卷的产品,这些模型暴露的问题也一目了然。
最典型的是“遗忘”,模型生成视频时会忘记用户最初的指令要求,上一秒还是古风世界,角色穿着长袍在竹林里漫步,下一秒画面突然跳到了现代街道;另一个普遍问题是指令遵循效果不理想,比如用户要角色站起来继续探索,角色却仍然纹丝不动。
归根结底,模型每生成一段新内容,都在用自己之前生成的、带误差的历史作为条件,偏差像滚雪球一样越滚越大,最终导致场景漂移、角色失忆、控制失灵。为了解决这些问题,模型厂商还在迭代中。
昨天,爱诗科技发布了新一代视觉模型Pixverse R2,它目前还没办法直接体验,官方只放出了少量demo和技术报告。
和上一代模型R1相比,R2要解决的问题是:能不能做得更好、更稳、更通用? 能不能让实时互动的质量、长度、可控性持续提升,而不是单单停留在“能跑”的demo阶段?
和R1比,R2好在哪?
由于Pixverse R2目前还没有正式上线体验,只有官方放出的demo。光锥智能的测试以过往使用Pixverse R1的体验和后者演示效果做对比,来评估后者的表现。
先从场景稳定性来对比,Pixverse R2上了一个台阶。
我们要求Pixverse R1生成一个仙侠古风世界,角色穿着道袍行走在云雾缭绕的山间,眼前的场景跟着继续生成——角色往前走,路随之延伸,竹林、石阶、远山在视野中渐次展开。
但随运行时间一长,画面开始“脱缰”:主角经常会突然变成场景中其它NPC,场景切换也并不符合物理逻辑规律。上一秒人物还在台阶上行走,下一秒就从湖中凭空“浮现”出来。
人物直接在青石板路上下沉消失
相比之下,R2在仙侠场景demo的演示中稳定多了,也没有出现逻辑硬伤。在30多秒的演示中,视频展示的场景风格基本一致,中途即使输入“开启南天门”的指令,模型沿着前面的场景继续生成,人物和环境保持延续——角色还是那个角色,世界还是那个世界,没有出现R1体验中的场景漂移问题。
场景稳定的基础上,指令遵循的问题,是上代R1被吐槽最多的短板。
以R2演示的“老虎坐骑”和让角色“骑上去”的指令做测试,我们给R1下达了同样的指令,但R1的生成并不符合要求。虽然老虎坐骑按照要求生成了,但让角色“骑上去”的时候,画面却变成了主角骑上摩托车,完全忘记了上一个指令的要求。
但交给R2就能完整地完成这两个指令。
R2怎么做到的?这里有个根本矛盾:模型要记住历史才能保持连贯,但历史越攒越长,全记住的话算力和显存根本扛不住;可如果砍掉太多,角色是谁、场景长什么样这些关键信息又丢了。这就像一个人过日子——如果把每一秒的经历都事无巨细记下来,脑子早炸了;但如果啥都不记,出门就忘了自己叫什么名字。
这里有个根本矛盾:模型要记住历史才能保持连贯,但历史越攒越长,全记住的话算力和显存根本扛不住;可如果砍掉太多,角色是谁、场景长什么样等关键信息又会丢失。
R2的解法是不搞极端,而是给不同时间尺度的信息安排好长期记忆、短期记忆——官方叫多时间尺度记忆。
三层各有分工:Sink Memory存长期记忆,角色长什么样、世界什么规则、什么画风都锁在这层,确保模型从头到尾都在同一个世界里生成;Rolling History相当于短期记忆,只盯最近的动态,角色刚才做了什么动作、环境有什么变化,保证当前画面跟上一帧接得上;object KV Cache则把已经算过的历史信息压缩复用,只留真正影响后续走向的关键状态,不浪费算力预算。
三层协同,R2同时拿到了长期身份稳定、短程运动连续和可控的运行成本。
不过,R2还是一个中间阶段的产物。官方技术报告坦承,R2当前的单次生成质量与前沿离线视频模型相比仍有差距,尤其在复杂场景细节、运动自然度和物理一致性上。但官方也强调,这些差距更多反映了当前所处的Scaling阶段,而非框架本身的能力上限——随着数据和算力持续投入,差距会持续缩小。
从实测效果来看,爱诗科技在Harness层做的优化,确实直观地反馈到了实际体验上。对实时互动来说,要想落地,这些约束是必须的。
以AI游戏来说,玩家按下WASD键的那一刻,画面切换的延迟要低,同时也要保证画面和任务的稳定。R1时期,这些问题还没有被系统性解决。
R2做的,正是把这些问题一个个堵上。每一项单独拿出来都不算什么颠覆性突破,但加在一起,才能让爱诗科技找到快速落地的途径,比如它押注的互动影游。
能跑demo和能跑产品之间,差的不是模型多聪明,而是工程够不够硬。R1证明了前者,R2在补的是后者。
详解R2技术路线,统一底座+工程补位
爱诗科技这次在PixVerse R2上的技术关键,一是把模型框架改了,二是塞进各种机制解决生成质量问题,让“实时世界模型”这件事真正能跑起来。
从底层模型的改变来说,AI 想做实时视频生成,传统训练流程是一条长长的“流水线”:
先训练一个能看到过去与未来所有帧的双向模型,它画质高、理解强,但它有个致命问题——必须等所有帧都生成完才能给结果,根本没法"边体验边生成"。于是工程师们再把它转成 AR(自回归)模型获得流式输出能力,接着再训练一个教师模型、做蒸馏压缩、回头修正偏差……每多一道工序,上游模型好不容易攒出来的画质、稳定性、长程一致性,都会在迁移中漏掉一点。
R2的解法很直接,它把这个链条简化成两步:先训练一个统一所有能力的底座Omni Causal AR,再通过蒸馏压缩,降低延迟,实现实时互动的效果。
先从模型来说,Pixverse R2相当于在双向模型的能力基础上继续训练,它继承了前者已经学到的画面质量、多模态理解等能力,再模拟真实的时间因果链实现实时输出。
但这里有个绕不开的矛盾:双向模型和 AR 模型需要的数据其实不一样。前者需要大量高质量短视频来学“怎么生成高画质”,后者则需要长视频、连续交互轨迹来学“怎么连贯地推演下去”。把这两种形态截然不同的数据塞进同一个模型训练,常规做法是行不通的。
R2这次框架改造的重点不仅是简化架构,统一的架构,也为爱诗科技后续世界模型的Scaling打下基础。
传统多阶段Pipeline的问题在于,每当需要增加新数据、新任务,训练要经过内部多个环节的适配才能实现理想效果。这解释了过去几年,尽管全球投入视频生成的算力在指数级增长,但模型“能做的事”并没有相应指数级变多——大量算力被消耗在了内部的能力迁移和折损补偿上。
而Pixverse R2把这一切收敛到一个持续预训练+蒸馏的极简结构中,这意味着Scaling的边际成本从整个流水线的重构降到了喂数据 + 训算力——这才是真正意义上的可持续 Scaling。
但仅有框架还不够,为了进一步优化生成内容的质量,爱诗科技做的另一层是围绕底座搭的工程机制,这些属于对模型Harness的改动,包括管模型在推理时怎么组织记忆、怎么喂训练数据、怎么切分输入。
首先是逐误差累积问题。 世界模型有一个共性痛点:一帧里如果出了一个微小错误,这个错误不会消失,反而会像滚雪球一样在后续几十帧、几百帧里被持续继承和放大。
在视频生成里,这个问题直接影响了后续一连串的交互体验,比如一开始画面还很正常,结果后面就出现角色变形、场景跳变、动作断裂等问题。
对此,R2 的应对思路有两个部分,一是在模型训练阶段就加入干净数据和带噪数据一起训练,让模型同时适应并学会怎么应对,二是“Error Bank”(误差库),它相当于一个错题集,主动收集各种翻车状态,它们被人工挑选出来作为典型样本,沉淀进误差库,让模型面向失败模式形成持续改进闭环。
在生成具体细节的优化上,爱诗科技根据当前的互动模式做了动态分块(Dynamic Chunk)。
考虑到世界模型的输入不是单一一种:它要同时处理文本或简单或复杂的描述、键盘的 WASD 操作等。这些输入的响应时间差异大:键盘需要即时反馈,文本描述可能是几秒甚至几十秒的事件。如果用固定长度的时间块,要么键盘操作响应迟钝,要么长视频语义不完整。
Pixverse R2 的解法是让模型自己决定怎么切。动态 Chunk 机制会根据当前控制信号的语义边界和持续时间,自适应地切分音视频序列。短输入切成小块,保证毫秒级响应;长输入切成大块,保留完整语义。
回过头看Pixverse R2 这次的所有改动,本质上都是为了爱诗科技本身的叙事服务——怎么让实时交互模型能够真正进入现实真实的产业中。至于是否能够做到上述优化,还要等Pixverse R2真正开放后体验。