
PixVerse R2 是一款由爱诗科技推出的实时全模态世界模型,定位为可交互的实时视频生成与互动娱乐平台。版本 v2.0.0,2026 年 8 月发布技术报告和演示 Demo,前代 R1 于 2026 年 1 月首发,是全球首个实时世界模型。R2 将多阶段训练流水线收敛为 Omni Causal AR 和 Real-Time Acceleration 两步,注意力稀疏度提升 90% 以上,亮度漂移指标从 0.201 降至 0.129 降幅 35.8%。爱诗科技上月完成阿里巴巴领投的 29.8 亿元 C 轮融资。官网 pixverse.ai,GitHub 地址 github.com/PixVerseAI,MIT 许可证,Star 数持续增长。
核心技术与架构升级
Omni Causal AR 统一训练
- R2 将原先五阶段接力流水线收敛为两个核心训练过程,减少能力迁移折损
- Omni Causal AR 持续预训练统一模型,吸收多模态数据、多任务和长时间交互轨迹
- Text、Reference、Audio 与 Action 作为因果信号持续推动世界演化
- Teacher、Student 与真实自回归推理共享同一套因果建模基础
Dynamic Chunk 多模态输入
R2 引入 Dynamic Chunk 机制,根据控制信号的语义边界和持续时间自适应切分音视频序列。短 Chunk 处理方向键等毫秒级动作反馈,长 Chunk 保留复杂提示词的完整演出结构。用户可以同时输入语音、文字、图片参考和方向控制,实现边跑边打字的交互体验。
多尺度记忆系统
- Sink Memory 保存角色、场景、风格和世界规则等长期锚点,类似编剧
- Rolling History 处理近期动作、姿态和镜头衔接,类似分镜师
- Object KV Cache 压缩并复用已计算的对象级历史表征,类似场记
- 三通道协同在固定预算内维持世界身份与局部连续性
抗漂移训练与 Error Bank
训练阶段加入 Hybrid Teacher Forcing 和 Diffusion Forcing,模型同时学习干净历史和带噪历史,提前适应真实运行中的小误差。R2 还建立 Error Bank 存储代表性错误历史状态,按比例放回训练过程。亮度漂移指标从 0.201 降至 0.129 降幅 35.8%,29 个长序列样例中 20 个获得改善,5 个静止场景样例全部减少错误运动。
实时加速与成本优化
Block-sparse Attention
R2 采用 Block-sparse Attention 技术,将注意力计算集中到当前控制、近期运动和关键世界状态相关的少量计算块上。注意力稀疏度提升到 90% 以上,画面质量、动作连续性和长时稳定性没有明显退化。思路类似游戏渲染中的看不见的不画策略。
Pyramid Ultra-few-step Distillation
先用低分辨率阶段确定场景布局、主体运动和镜头结构,再通过高分辨率阶段恢复纹理和局部细节。类似游戏研发的白模到贴图流程,减少高分辨率空间的重复计算,降低生成延迟。
DDMD 对抗正则化
条件对齐确保模型准确响应 Prompt 和 Action,分布匹配继承 Teacher 生成能力,对抗正则用真实数据帮助模型维持纹理和运动真实感。三部分共同保证极少生成步数下指令响应依然精准。
开箱即用的 API
R2 最新版本将 AI 知识库和语音集成进模型内部,实现音画同步输出。厂商只需接一个 API 即可获得完整模型能力,无需额外付费或外挂能力模块。
应用场景与产品方向
世界探索
用户通过 WASD 控制角色移动,方向键调整镜头,路随之延伸生成。可以输入提示词改变世界,如生成密道并配开门 UI,实现低成本做游戏的可能。
互动影游
Demo 有明确的打 Boss 主线,AI 主动抛出选项,玩家像玩互动影游那样做选择题或输入提示词开新分支。导演监制下的作品如中世纪魔法题材 Zero Mark 和科幻恐怖题材畸变回声,生成质量显著提升。
实时数字人
直播带货 Demo 中用户可随时文字打断提问,主播自然接话。闺蜜交流 Demo 中发语音让角色挎包,动作神态接近真人。R2 走视频生成路线,每帧由 AI 算出,不依赖建模或预设动作。
与 Sora 和 GameGen 对比
| 对比维度 | PixVerse R2 | Sora | GameGen |
|---|---|---|---|
| 开发方 | 爱诗科技 | OpenAI | 腾讯 |
| 模型定位 | 实时交互世界模型 | 离线视频生成 | 交互式游戏生成 |
| 实时交互 | 支持多模态实时输入 | 不支持实时交互 | 支持有限交互 |
| 最大分辨率 | 1080P | 1080P | 720P |
| 注意力优化 | Block-sparse 90%+ | 未公开 | 未公开 |
| 开源许可 | MIT(MCP工具) | 闭源 | 闭源 |
对比来看,PixVerse R2 和 Sora 的区别在于实时交互能力。Sora 专注于离线视频生成质量,R2 则让视频从生成后播放走向边生成边交互。GameGen 聚焦游戏场景生成,R2 的世界探索和互动影游方向更具开放性。
常见问题
问,PixVerse R2 是什么
PixVerse R2 是爱诗科技推出的实时全模态世界模型,版本 v2.0.0,支持语音、文字、图片和方向控制等多模态同时输入,实现可交互的实时视频生成。亮度漂移降幅 35.8%,注意力稀疏度 90% 以上。
问,PixVerse R2 如何体验
访问官网 pixverse.ai 点击体验 PixVerse 申请试用,或在网页端输入提示词生成视频。开发者可通过 API 接入,GitHub 地址 github.com/PixVerseAI 提供 MCP 工具,MIT 许可证。
问,PixVerse R2 和 R1 区别是什么
R1 是全球首个实时世界模型,2026 年 1 月发布,支持 1080P 实时视频生成。R2 将五阶段流水线收敛为两步,新增 Dynamic Chunk 多模态输入、多尺度记忆系统和 Error Bank 抗漂移训练,生成延迟大幅降低,画面稳定性显著提升。
问,PixVerse R2 免费吗
PixVerse 网页端提供免费体验额度,累计全球用户超 6000 万,月活跃用户 1600 万。API 接入需付费,R2 已将知识库和语音集成进模型,一个 API 即可获得全部能力,无需额外付费外挂模块。
PixVerse 官网地址 https://pixverse.ai/
作者爱诗科技,GitHub 地址 github.com/PixVerseAI,MIT 许可证
最后更新 2026 年 8 月,版本 v2.0.0,更新日志见 PixVerse 官方技术报告,star 和 fork 数据见 GitHub。