Vivix 发布 Vivix-A1 与 Vivix-W1:两款约 300 亿激活参数的实时交互模型,角色会做事,故事能被改写
官方称可见反应延迟低于 0.6 秒、支持无限时长流式生成。API 平台同步上线,两款模型私有内测。
- 今天的视频模型是半双工的:你把条件给完,等它算完,拿到一段拍好的片子,中间插不进手。
- Vivix 同天发布 Vivix-A1、Vivix-W1 和 API 平台,两款模型激活参数均约 300 亿,它交出的是一个你可以随时插手的过程。
- A1 是首个面向交互式 AI 角色的实时全双工模型:角色能走动、拿东西、边说边听,支持无限时长流式生成。
- W1 把原生音画联合生成、多模态参考、多镜头叙事和实时交互装进同一个流式模型,故事在你介入后继续长。
- 官方口径:可见反应延迟低于 0.6 秒,端到端首次反应低于 1.7 秒,实时视频推理成本落在每小时 1 美元以内的大众娱乐价格带。
你问它接下来去哪,它拿起地图边走边指
屏幕里的角色正在陪你逛一片风景。你随口问一句接下来去哪,它没有停下来等你说完再原地答话,而是转身走向旁边,顺手拿起一张旅游地图,边走边指着身旁的景物讲下去。
这段画面不是提前录好的。角色是实时生成的,你说出口的每一句都直接改变它接下来讲什么、做什么。
2026 年 7 月 24 日,Vivix 一次放出三样东西:两款激活参数均约 300 亿的实时交互多模态模型 Vivix-A1 和 Vivix-W1,加一个 API 平台。这是这家公司第一次把自己的模型成果摊开给外面看。Vivix 成立于 2025 年 1 月,创始人刘宇此前是商汤的研究执行总监,目前已完成 A 轮融资。
A1 让数字人不只会说话,而是有真实活人感、能在场景里真正做事;W1 让角色、场景和故事在你以任意方式介入之后继续变化。
等它算完再看,和一边生成一边改
今天主流的 AI 模型都是半双工的:你输入一段提示词,被推理阻塞着等几秒到几分钟,然后拿到输出。写文字的模型是这样,生成图片和视频片段的模型也是这样。
实时交互多模态模型不一样。内容在交互过程中同步生成,边生成边给你,不必等全部完成再呈现。这种边听边说的方式业内叫全双工。你可以在生成过程中继续输入、打断当前内容、改变接下来的发展方向;角色、声音、动作、镜头和剧情会持续响应新的输入。不同的人拿到的也不再是同一段固定视频,而是各自不同的互动过程。
所有条件在开拍前给完。生成开始,方向锁死。
不满意 = 重写提示词,整条重来。
条件持续生效。生成一边往前跑,你的新输入一边进来。
不满意 = 当场改后面那一段,前面照播。
直播、游戏,都可以理解为实时交互内容的一种形态。Vivix 认为要用模型重构这类内容的底层引擎,至少得同时满足四个条件:
模型在运行过程中一直往下产出,不停在某一个片段上收工。
用户能在生成过程中用多种方式打断、调整、改变发展方向。
声音、画面、文字、手势、鼠标键盘一起参与理解和生成,不必先翻成语言。
延迟、稳定性和推理成本,要撑得住消费级应用长时间在线。
所以这件事的核心是把「体验」当成生成的基本单位:内容消费力、泛化性、交互方式、速度和成本,是一起算的。把视频生成做得更快,只是其中一项。
拆成活来看是三层,Vivix 这次三层一起交:
让一个角色听懂你并采取行动:走动、拿东西、边说边听。
让角色之外的环境、事件、镜头也跟着你的输入继续变。
让这些变化在多久之内真的出现在你屏幕上,并且长时间运行的成本扛得住。
为什么先做人,再做世界
一段有沉浸感的互动内容里有三个元素:人是主体,场景是舞台,时间带来变化和故事。Vivix 的第一步选了人。
理由有两条。逻辑上,人是体验和故事发生的中心。数据上,Vivix 统计过人在消费短视频、短剧和游戏时,有七到八成的注意力落在与人有关的部分。
像真实的人与人互动一样,把大量原本只能发生在线下的体验复制、扩展、重组。线下体验今天依然是高成本、稀缺的,AI 有机会把它们变成一种可以规模化的新体验。
下一步才是把人、物、场景和时间一起处理,并且要能实时响应。实时在这里不只是一个工程指标,它直接决定你信不信自己正在参与一个活的世界。而一个世界光有舞台还不够,还需要一个聪明的导演:不只是生成元素,而是组织元素;不只是让画面动起来,还要调度事件、组织节奏、理解你的意图,把故事自然接下去。
A1 和 W1 就是这两步的产物。
A1:从一张会说话的脸,到一个会做事的角色
现在市面上的数字人,重点通常在脸、口型和声音,做得好的能加几个简单的四肢动作。A1 把能力空间扩到了完整身体和开放场景:角色不只说话,还能听见环境、产生情绪、行走、转身、改变姿态、跳舞、走近或拿起物体,而且这些动作发生的同时还在接收你的新输入。
而且它是从一张人物图起步的,生成的是全身可驱动的角色,不是半身像或大头像。下面四段演示各证明一件事,读法统一:你给了什么、画面变了什么、这说明模型具备什么能力。
环境里的一阵风,直接变成它的反应
走过去,把东西拿起来
它还在说,你就插话
互动到一半,丢一张商品图进去
表情和情绪也是一起生成的。A1 把面部表情、视线、手势和全身动作放在同一次生成里,覆盖写实人物、3D 角色和动漫形象三类风格。角色开心、惊讶或生气时,变化会同时落在眉毛、眼神、嘴角、语气和身体姿态上,不是从一套预设表情里挑一个播。加上长期一致性上的处理,它支持无限时长的流式生成,不是只能出几十秒的片段。
同一套能力换到真实业务上是这样:线上看房时,AI 销售可以带你看完户型,再自然走出房间展示外立面;露营场景里,AI 向导会随手拿起一盏营灯,边展示边讲。官方给的应用面还包括 AI 角色、游戏、虚拟主播、教育培训和数字展陈,共同点是讲解跟着人的行动展开,不用被钉在一个机位前。
A1 把四段接力换成一个循环
这些能力以前做不出来,是因为业内通行的做法是把四件事排成一条接力。接力越长,等待越久,每次交接还会丢掉一部分信息。
每多一段接力,就多一次等待和一次交接。更麻烦的是第二段:把声音压成文字这一步,会把大量信息直接扔掉。你说话的语气和停顿、屋子里突然响起的雷声、画面里一个手势。文字装不下这些,模型也就无从反应。
A1 没有去优化这几段之间的衔接。它把整条链换成了一个循环:声音、图片、交互信号直接进同一个模型,模型直接吐出音频和画面的小片段。中间不再绕道文字。
图上那个 Director Agent 负责慢的那部分判断:推理、调用工具、决定角色接下来该说什么做什么,同时记住此前的对话和场景状态。模型本体负责快的那部分:在约 300 毫秒的最小时间片里,直接对当前听到看到的东西作出反应。你中途换了话题,角色从当前状态继续接,不必回头重算。
一小段一小段往外吐,怎么不越跑越偏
流式生成有个天生的麻烦。传统视频模型一次生成 5 到 10 秒的完整片段,它能提前看到整段,前后动作和画面容易统一。改成一小段一小段往外发之后,模型不知道三秒后会发生什么,只能看着已经生成的画面接着往下猜。时间一长,误差会累积:人物的脸慢慢变形,背景飘,动作幅度越来越小。
一边铺铁轨一边开火车。铺得越久,偏差越容易一节一节攒起来,最后火车还在跑,方向已经不对了。
业内常用的解法是加固定的参考锚点把画面按住。稳是稳了,代价是角色也变得不敢动。一个不敢转身、不敢伸手碰东西的角色,谈不上有身体。
A1 的做法是把「让画面连得上」和「让角色敢动」这两件事分开管:相邻的小片段之间用局部连续性先验接住,保证动作和画面接得自然;更长的时间尺度上用全局序列先验,管住角色身份、场景和物体关系不漂。这样一来,保证稳定的那部分约束只作用在相邻片段之间,不会顺带把角色的动作幅度也一起限制住。
让生成跑得够快的办法叫多维联合蒸馏:拿 8 步采样的版本当质量基线,把不同去噪阶段各自负责的能力一起压进 2 步模型。只盯着单帧画质压是压不出来的。这样压完,短时间的画质、听指令的准确度、动作表现和长时间的稳定性都尽量保住。
W1:提示词决定开场,交互改变后续
A1 让一个角色跟着你的要求继续行动。W1 把你能改变的范围从这个角色扩大到整个场景、正在发生的事件,以及镜头怎么切。
A1 和 W1 改的是同一步,只是 W1 管的范围更大。今天的视频模型把文字、图片、音频统统当成开拍前的条件,条件给完,剩下的就是等。W1 让同一种输入在生成过程中继续生效:一张图可以是第一帧的场景,也可以是半路塞进来的一个新物体;一段文字可以是开头设定,也可以是中途的一次转折。
官方给 W1 的用户交互响应延迟口径是低于 1 秒。能插进去的东西也比现在讲互动生成的产品多得多。那类产品的交互面基本停在导航和运镜:按方向键走两步、把镜头转一转。W1 的清单要长得多:说话、打字、上传新图片、点击画面里的物体、触屏拖动、控制镜头和人物移动,而且全都能在世界已经跑起来之后再进来,不用重新开始生成。
说一句、点一下、丢一张图
声音跟着画面一起长,参考随时能进,镜头自己会切
W1 把三件通常分开处理的事放进了同一个流式模型。三件事都做到,一段内容才能一直演下去而不散架。
一、画面和声音在同一条流里出来
画面里开始下雨,雨声同时就有,不需要再让另一个音频模型事后补上。对白、环境音、空间音效、口型、节奏都是一起生成的,也就不存在音画各做各的、最后对不上的问题。W1 同时支持多种语言的对白。
二、参考不只定开场,中途也能进
文字、图片、音频、视频都能当生成的依据,共同定义世界里的人、物、环境、动作和视觉风格。下面这组案例用三张参考图定义一个世界,再生成一段视频:
关键在于这些参考不限于开头。一张图能在半路引入一个新物体或新环境,一段视频能提供动作或视觉上下文,一段音频能加一个声音参考。它们会被带进正在进行的流里,成为已有世界的一部分,不会另开一段新片。
三、镜头由模型自己调度
故事往下走的时候,模型自己决定什么时候切镜头、切给谁、镜头怎么移,并在切的过程中接住对白的节奏和人物的反应。产出的是一段有调度的序列,不是几段孤立片段拼在一起。Vivix 把这个能力称作模型自带的导演。配上长期一致性上的处理,W1 同样支持无限长度的流式生成。这套能力对应的应用面是互动短剧、游戏、沉浸式文旅和数字内容创作。
让它长时间跑而不散架:Vivix-Turbo
内容演得越久,人物、场景和声音越容易慢慢走样。W1 为此配了一套叫 Vivix-Turbo 的加速与一致性方案,同时做四件事:用超低步数蒸馏压掉每一段的推理开销;把镜头规划和时间连续性放在一起优化,让长的多镜头序列走到后面也不断掉故事线;压住长时间生成里的误差累积,稳住角色长相、场景、镜头和动作;再加强多模态参考的一致性,让人物、声音、风格、环境在世界继续演变时不走样。
改的永远是还没播出去的那一段
W1 的接口文档里有一处设计,把实时生成的根本限制写得最清楚:你用一个事件往正在跑的世界里发指令,这个事件有四种状态,但没有「已完成」这一种。
与之配套,默认的改写方式叫 steer:已经播出去的画面保留原样,被改写的只有还没播出去的未来。
这条约束正是实时生成比离线难的地方。离线出片可以生成一百次,从里面挑一条最好的发出去,观众只看见那条 9 分的;模型平均 7 分也没关系,人替它兜住了下限。实时生成没有这个机会:生成即消费,模型平均 7 分,观众收到的就是 7 分。
门槛不在模型的上限有多高,在它的失败率能压到多低。每一次都得及格,因为没有第二次机会重来。
难在哪:每秒要处理的信息多出三到四个数量级
以 DiT 为代表的主流视频生成架构,是为一次性离线生成设计的:你先给完整条件,模型再围绕整段视频统一计算和优化。这样有利于画质和前后一致,但它有个默认前提,生成目标在开始时就已经基本定了。
实时交互把这个前提拿掉了。你可能随时说话、打断、改变角色行为,模型得知道之前发生过什么、理解此刻正在进行的交互,再生成下一帧。问题就不只是生成得更快,而是要在持续生成的同时实时理解输入、更新状态、改变后续结果。
这一改,信息吞吐压力直接上了几个台阶。文字交互里,人每秒只能消费三到五个 token;音视频交互里,你每秒接收的是数万个视觉 token 加上同步的音频 token,吞吐量高出大约一千到一万倍。
在这个量级上还要保持毫秒级时延,持续完成理解、生成、记忆更新和响应,围绕「输入指令、完成推理、输出片段」设计的离线架构就搬不过来了。模型架构、交互层和基础设施必须一起重构,这也是下一节要讲的事。
三层基础设施:训练、推理、数据
模型算得快,不等于你马上看得到。一条新指令还要经过处理、生成、解码、推流,才变成屏幕上的画面和声音。Vivix 在这一层攒的东西分三块。
为什么生成到一半能被打断
系统把输入编码和实时视频解码拆成了两部分。新的语音、动作、人物参考和镜头信息交给 Encoder Service 处理;真正在实时链路上的 Decoder Loop 持续生成音视频,并允许调度器追加新输入、中止正在执行的生成步骤。所以「打断」是进到了模型的流式生成链路里面。播放器切掉旧视频再重新生成,是另一回事。
当你在角色行动或故事进行中突然改变要求,系统不必等当前片段生成完。新输入进入正在运行的循环,模型从当前状态调整接下来的画面和声音。
还要以足够低的成本一直跑
低精度计算、Vivix Sparse Attention、缓存管理、通信与计算重叠、预填充与解码解耦,这些放在一起回答的是另一个问题:跑出效果之后,能不能一直跑得起。其中数值精度这一项走得比较远:推理侧对降噪过程的累计误差做了免训练矫正,首次实现 4 位精度(4-bit,Blackwell 显卡上的 NVFP4 格式)的无损推理,配合视频流式推理的预填充与解码分离,把推理成本压了下来。
落到这个价格带的意义是:AI 实时互动娱乐可以规模化地服务普通消费者,而不只是做几个演示。同一张图上也标了标准视频 CDN 约每小时 0.1 美元、短视频 CDN 约 0.01 美元,Vivix 自己把「逼近 CDN 量级」写成下一个里程碑。
模型决定角色和故事会做什么,基础设施决定这些变化能不能及时发生。在实时视频里,延迟本身就是模型能力是否成立的一部分,不能等模型做完再当成工程指标去优化。
官方成绩:优势最明显的两维,和还要打磨的那一维
A1 建了自己的评测集 Vivix-Bench,1000 条样本,覆盖写实、艺术、动漫等多种画风和人类与非人类主体,统一输入条件,用成对人评打 Good / Same / Bad。三场对照的整体结果:
逐维度看,优势最集中的是两项:动作动态和音画同步。对 LiveAvatar 那一场,动作动态有 96.4% 判 A1 更好,音画同步 56.4%;对 LongCat-Video-Avatar1.5,音画同步 87.5%、动作动态 64.3%。这跟它主打的全身运动是一致的。
另外两项则有相当比例被评为持平:角色一致性和开放世界自由行为。三场里角色一致性判 A1 更好的分别是 35.7%、32.1%、30.4%,持平占了 41% 到 46%。这和它的设计取舍对得上:让角色敢走、敢转身、敢碰东西,长时间保持同一张脸就更难。这组数字适合用来看优势具体出现在哪些维度,不适合读成全面碾压。
| 对照系统 | 整体判 A1 更好 | 角色一致性判 A1 更好 |
|---|---|---|
| LiveAvatar | 85.2% | 35.7% |
| LongCat-Video-Avatar1.5 | 76.8% | 32.1% |
| SoulX-LiveAct | 46.4% | 30.4% |
边界,和现在能拿到什么
当前版本仍处于持续开发阶段,两份技术报告都写了自己的边界。
在快速复杂运动、空间移动和精细物体交互中,仍可能出现动作不一致或物理关系偏移。
实时版本在专业级视觉质感、复杂运动和高密度场景上,与训练数据和优化周期更大的头部离线视频模型仍有差距。
API 平台已经上线,两款模型都在私有内测,官网挂着排队入口。定价页只有 Developer Preview 免费试用和 Enterprise 定制两档,没有公开单价。模型编号和规格已经写进开发者文档:
vivix-a1-stream / vivix-a1-stream-litevivix-a1 / vivix-a1-lite,由脚本、音频和图片驱动vivix-w1 / vivix-w1-fast,参考驱动vivix-w1 和 vivix-w1-fast,但流式世界的创建会话示例里,模型字段写的是 vivix-w1-stream,总览页上没有这一条。把这次发布放回行业里看:A1 把数字人和开放场景行动能力融合进了一个模型,在完整身体运动、开放场景行动、物体交互和实时全双工这几个维度上,超出了目前市面上相关概念产品和传统 talking avatar 的能力边界;W1 则把原生音画、多镜头叙事、多模态参考和实时交互整合进了同一个流式模型。
把角色行动、用户交互、持续生成、音画协同和在线推理放进同一个模型与系统里,靠模型、训练、推理、数据四层一起攒出来。单看某一个画质或速度指标,看不出这件事。