全双工音视频数字人
本 topic 围绕全双工语音 / Omni 交互、评测与交互式 Avatar 路线组织论文;重点工作配套精读笔记,便于后续做架构比较与选题判断。
主题综述
- 全双工实现机制梳理:按实现机制重组当前 topic,覆盖语音全双工、omni 共享时间轴、可控行为、可见写作、Avatar / motion 输出和评测框架。
全双工语音 / Omni 交互模型
| 论文 | 发表 | 状态 | 总结 | 评论 |
|---|---|---|---|---|
| A Full-duplex Speech Dialogue Scheme Based On Large Language Models | NeurIPS 2024 / arXiv 2024.05 | ✅ 已读 | 用 LLM + perception/motor modules + neural FSM 做边听边说和打断决策,是早期把 full-duplex 明确定义进 LLM 语音对话的系统。 | |
| Beyond Turn-Based Interfaces | arXiv 2024.09 | ⏳ 待读 | 从 synchronous LLM 角度处理 backchannel、重叠语音和动态 turn-taking,可作为“全双工不只是低延迟”的概念基础。 | |
| Moshi | arXiv 2024.09 | ✅ 已读 | 双音频流 + speech/text token 联合建模,代表端到端 speech-to-speech full-duplex 路线,也是很多后续系统的基座参照。 | |
| Freeze-Omni | arXiv 2024.11 | ⏳ 待读 | 用 frozen LLM 搭建低延迟 speech-to-speech,并通过多任务训练引入 duplex dialogue 能力。 | |
| VITA-1.5 | arXiv 2025.01 | ✅ 已读 | 把视觉和语音能力放到近实时交互框架里,可作为 GPT-4o 式 open-source vision-speech interaction 的背景工作。 | |
| Vision-Speech Models | CVPR 2026 / arXiv 2025.03 | ⏳ 待读 | 在 Moshi 语音对话模型上接入图像输入,路线贴近“会看图并实时说话”的 vision-speech agent。 | |
| Efficient and Direct Duplex Modeling for Speech-to-Speech Language Model | arXiv 2025.05 | ⏳ 待读 | 关注 speech-to-speech LM 的直接 duplex 建模效率,可和 Moshi/Freeze-Omni 对比系统复杂度和延迟。 | |
| Qwen3-Omni Technical Report | arXiv 2025.09 | ⏳ 待读 | Thinker-Talker 架构统一 text/image/audio/video 理解与实时语音生成,是 MiniCPM-o 4.5 的重要对照背景。 | |
| F-Actor | arXiv 2026.01 | ⏳ 待读 | 强调用 instruction 控制 backchannel、interruptions、dialogue initiation 等对话行为,补上“全双工可控性”问题。 | |
| PersonaPlex | arXiv 2026.02 | ⏳ 待读 | NVIDIA 的 role + voice conditioning full-duplex speech model,面向客服/角色化语音代理场景。 | |
| Qwen3.5-Omni Technical Report | arXiv 2026.04 | ✅ 已读 | Qwen Omni 后续技术报告,适合跟 MiniCPM-o 4.5 比较 omni-modal 数据规模、延迟和音视频能力边界。 | |
| MiniCPM-o 4.5 | arXiv 2026.04 | ✅ 已读 | 你提供的起点论文;核心是 Omni-Flow,把输入/输出多模态流对齐到共享时间轴,实现看、听、说同时进行。 | |
| Interaction Models | Thinking Machines 2026.05 | ✅ 已读 | 用 200ms micro-turns 把音频/视频/文本连续流和模型输出交织进同一时间轴,并以前台 interaction model + 后台 reasoning/tool agent 兼顾低延迟和深任务;价值在把 interactivity 从 VAD harness 变成可 scale 的模型能力,局限是 276B MoE serving、长 session context 和内部评测仍待开放验证。 | |
| Liberating LLM Capabilities in Full-Duplex Speech Models | arXiv 2026.06 | ⏳ 待读 | LWS 用 Listen-Write-Speak token schema 让模型持续听、在屏幕写结构化文本、同时说口头摘要;创新是区分 listening-phase 与 reply-phase cognition,不改架构释放文本能力,局限是 speech-only 输入、实时预算限制深推理且写说一致性仍非满分。 | |
| DuplexOmni | arXiv 2026.06 | ⏳ 待读 | 以 480 ms time-sliced Qwen3-Omni 交互层持续听、看、说,并异步调度可插拔 S2 / 工具,Writer–Director 监督打断、等待与结果回流;72.6% ToR / 0.506 s 验证快慢分层可行,但公开 35B 模型低延迟需至少 8×H20,且仍不生成视频。 | |
| Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs | arXiv 2026.07 | ⏳ 待读 | Lychee-FD 将 native CDM 的退化定位为深层声学—语义梯度冲突与稀疏文本监督稀释,用 24 层共享骨干后并行的语义、声学、控制头和连续 semantic channel 保持知识与语音质量;S2S QA 较此前 native SOTA 高 7.4 个百分点、FullDuplexBench 1.5 平均高 28.5%,但依赖合成双人数据与多 GPU DAG-PP,open-mic side-talk 仍会被误判为打断。 |
评测 / Benchmark / 发展判断
| 论文 | 发表 | 状态 | 总结 | 评论 |
|---|---|---|---|---|
| Daily-Omni | arXiv 2025.05 | ⏳ 待读 | 评测 audio-video temporal reasoning,说明当前 MLLM 仍容易只用单模态 shortcut;适合支撑“音视频全双工难在同步理解”。 | |
| FD-Bench | arXiv 2025.07 | ⏳ 待读 | 用 interruptions、delay、noise 等场景评测 Moshi/Freeze-Omni/VITA-1.5,指出开源 FDSDS 在频繁打断和噪声下仍不稳。 | |
| HumDial-FDBench | ICASSP 2026 / arXiv 2026.04 | ⏳ 待读 | 全双工评测: 基于真实双通道对话构建 full-duplex challenge,覆盖 interruption、overlap 和动态 turn negotiation。 | |
| Synchronization and Turn-Taking in Full-Duplex Speech Dialogue Models | arXiv 2026.05 | ⏳ 待读 | 专门分析 full-duplex speech dialogue models 的同步与 turn-taking,适合作为机制和评价指标线索。 | |
| VideoFDB | arXiv 2026.05 | ⏳ 待读 | 第一个面向 AV2AV conversational agents 的 full-duplex audio-visual benchmark,直接指出现有系统存在 captioning collapse 和视觉流忽略。 |
数字人 / Avatar / 动作与表情生成
| 论文 | 发表 | 状态 | 总结 | 评论 |
|---|---|---|---|---|
| VASA-1 | NeurIPS 2024 / arXiv 2024.04 | ⏳ 待读 | 单图 + 音频生成实时 talking face,代表“高拟真脸部动态 + 低延迟渲染”的数字人基础路线。 | |
| MuseTalk | arXiv 2024.10 | ⏳ 待读 | 实时唇形同步: latent space inpainting 做实时高质量 lip-sync,适合做工程基线或实时 Avatar pipeline 的口型模块参照。 | |
| TaoAvatar | CVPR 2025 / arXiv 2025.03 | ⏳ 待读 | 全身 Avatar: 3DGS-based full-body talking avatar,重点是高保真、轻量化和 AR 设备实时渲染。 | |
| Live Avatar | arXiv 2025.12 | ⏳ 待读 | 流式 Avatar: 大规模 diffusion avatar 的实时流式与无限时长生成,关键在系统并行和长程一致性。 | |
| JoyStreamer-Flash | arXiv 2025.12 | ⏳ 待读 | 用 14B→1.3B DMD 蒸馏把音频驱动 Wan DiT 转成 4-step causal generator,PSB 前置更多首块去噪、MCI 传递加噪上块末帧、URCR 动态重编码缓存 K,实现单卡 DiT 16.2 FPS 并从结构上解除 RoPE 长度上限;但 16 FPS 不是完整单卡端到端速度,长时稳定性主要靠定性证据,复杂场景与细脸仍受 1.3B 容量限制。 | |
| SoulX-FlashTalk | arXiv 2025.12 | ⏳ 待读 | 流式 Avatar: 14B audio-driven avatar 系统,关注 real-time infinite streaming、低启动延迟和高保真数字人输出。 | |
| Beyond Monologue | arXiv 2026.04 | ⏳ 待读 | 直接把 talking 与 listening 双音频流纳入 avatar generation,用 conversational audio context-aware kernels 处理说话/聆听时间尺度差异。 | |
| DyaPlex | arXiv 2026.06 | ⏳ 待读 | 在 full-duplex speech 基座上接入 streaming motion pathway,建模 dyadic interaction 里的语音、动作、互相反应。 | |
| Avatar Forcing | CVPR 2026 | ⏳ 待读 | 在 512D head-motion latent 中用 blockwise causal Diffusion Forcing 联合条件化用户音频 / 头动与外部 avatar audio,并以 talking-only motion 为 losing sample 做 DPO;可作为约 0.5 秒的 fast nonverbal executor,但 avatar audio 外供、延迟只测预提特征后的 10-NFE motion,非原生音视频全双工。 | |
| InteractiveAvatar | arXiv 2026.06 | ⏳ 待读 | ASR→LLM / RRM 产出回复音频与 Action / Stable prompts,再由带 LSVM、Cache-Switching 和 DMD 的 Wan2.2-5B 流式执行动作并保持长时状态;视频端 26.68 FPS 但端到端 TTFF 约 2.6 秒、训练需 64×H100 / 约 300 万 clips,属于级联意图动作视频执行器而非原生 AV 全双工。 | |
| FacePlex | arXiv 2026.06 | ⏳ 待读 | 在 PersonaPlex 的 80 ms 语音流旁用 Rolling Flow Matching 运动队列与 Rolling Cross-Attention 滑动语音条件联合发出 FLAME 面动;冻结 7B 后训练小分支、N=2 仅 7.9 ms,但只有音频输入和参数输出,L=4 带来约 240 ms 缓冲,且缺少完整视频 / 端到端延迟与同任务 baseline。 |
已在其他 Topic 的相关论文
这些论文已经在 vault 里有 PDF 或笔记,本 topic 不重复下载。
| 论文 | 发表 | 状态 | 总结 | 评论 |
|---|---|---|---|---|
| OmniHuman-1 | arXiv 2025.02 | ⏳ 待读 | 已有精读笔记;可作为 audio-driven human animation 的 scale-up 训练范式参照。 | |
| AniPortrait | arXiv 2024 | ⏳ 待读 | 已有精读笔记;可作为 diffusion portrait animation 的较早基线。 | |
| Hallo | arXiv 2024 | ⏳ 待读 | 已有精读笔记;适合作为 hierarchical audio-driven portrait animation 基线。 |