求索札记

Last update

全双工音视频数字人

本 topic 围绕全双工语音 / Omni 交互、评测与交互式 Avatar 路线组织论文;重点工作配套精读笔记,便于后续做架构比较与选题判断。

主题综述

  • 全双工实现机制梳理:按实现机制重组当前 topic,覆盖语音全双工、omni 共享时间轴、可控行为、可见写作、Avatar / motion 输出和评测框架。

全双工语音 / Omni 交互模型

论文发表状态总结评论
A Full-duplex Speech Dialogue Scheme Based On Large Language ModelsNeurIPS 2024 / arXiv 2024.05✅ 已读用 LLM + perception/motor modules + neural FSM 做边听边说和打断决策,是早期把 full-duplex 明确定义进 LLM 语音对话的系统。
Beyond Turn-Based InterfacesarXiv 2024.09⏳ 待读从 synchronous LLM 角度处理 backchannel、重叠语音和动态 turn-taking,可作为“全双工不只是低延迟”的概念基础。
MoshiarXiv 2024.09✅ 已读双音频流 + speech/text token 联合建模,代表端到端 speech-to-speech full-duplex 路线,也是很多后续系统的基座参照。
Freeze-OmniarXiv 2024.11⏳ 待读用 frozen LLM 搭建低延迟 speech-to-speech,并通过多任务训练引入 duplex dialogue 能力。
VITA-1.5arXiv 2025.01✅ 已读把视觉和语音能力放到近实时交互框架里,可作为 GPT-4o 式 open-source vision-speech interaction 的背景工作。
Vision-Speech ModelsCVPR 2026 / arXiv 2025.03⏳ 待读在 Moshi 语音对话模型上接入图像输入,路线贴近“会看图并实时说话”的 vision-speech agent。
Efficient and Direct Duplex Modeling for Speech-to-Speech Language ModelarXiv 2025.05⏳ 待读关注 speech-to-speech LM 的直接 duplex 建模效率,可和 Moshi/Freeze-Omni 对比系统复杂度和延迟。
Qwen3-Omni Technical ReportarXiv 2025.09⏳ 待读Thinker-Talker 架构统一 text/image/audio/video 理解与实时语音生成,是 MiniCPM-o 4.5 的重要对照背景。
F-ActorarXiv 2026.01⏳ 待读强调用 instruction 控制 backchannel、interruptions、dialogue initiation 等对话行为,补上“全双工可控性”问题。
PersonaPlexarXiv 2026.02⏳ 待读NVIDIA 的 role + voice conditioning full-duplex speech model,面向客服/角色化语音代理场景。
Qwen3.5-Omni Technical ReportarXiv 2026.04✅ 已读Qwen Omni 后续技术报告,适合跟 MiniCPM-o 4.5 比较 omni-modal 数据规模、延迟和音视频能力边界。
MiniCPM-o 4.5arXiv 2026.04✅ 已读你提供的起点论文;核心是 Omni-Flow,把输入/输出多模态流对齐到共享时间轴,实现看、听、说同时进行。
Interaction ModelsThinking Machines 2026.05✅ 已读用 200ms micro-turns 把音频/视频/文本连续流和模型输出交织进同一时间轴,并以前台 interaction model + 后台 reasoning/tool agent 兼顾低延迟和深任务;价值在把 interactivity 从 VAD harness 变成可 scale 的模型能力,局限是 276B MoE serving、长 session context 和内部评测仍待开放验证。
Liberating LLM Capabilities in Full-Duplex Speech ModelsarXiv 2026.06⏳ 待读LWS 用 Listen-Write-Speak token schema 让模型持续听、在屏幕写结构化文本、同时说口头摘要;创新是区分 listening-phase 与 reply-phase cognition,不改架构释放文本能力,局限是 speech-only 输入、实时预算限制深推理且写说一致性仍非满分。
DuplexOmniarXiv 2026.06⏳ 待读以 480 ms time-sliced Qwen3-Omni 交互层持续听、看、说,并异步调度可插拔 S2 / 工具,Writer–Director 监督打断、等待与结果回流;72.6% ToR / 0.506 s 验证快慢分层可行,但公开 35B 模型低延迟需至少 8×H20,且仍不生成视频。
Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMsarXiv 2026.07⏳ 待读Lychee-FD 将 native CDM 的退化定位为深层声学—语义梯度冲突与稀疏文本监督稀释,用 24 层共享骨干后并行的语义、声学、控制头和连续 semantic channel 保持知识与语音质量;S2S QA 较此前 native SOTA 高 7.4 个百分点、FullDuplexBench 1.5 平均高 28.5%,但依赖合成双人数据与多 GPU DAG-PP,open-mic side-talk 仍会被误判为打断。

评测 / Benchmark / 发展判断

论文发表状态总结评论
Daily-OmniarXiv 2025.05⏳ 待读评测 audio-video temporal reasoning,说明当前 MLLM 仍容易只用单模态 shortcut;适合支撑“音视频全双工难在同步理解”。
FD-BencharXiv 2025.07⏳ 待读用 interruptions、delay、noise 等场景评测 Moshi/Freeze-Omni/VITA-1.5,指出开源 FDSDS 在频繁打断和噪声下仍不稳。
HumDial-FDBenchICASSP 2026 / arXiv 2026.04⏳ 待读全双工评测: 基于真实双通道对话构建 full-duplex challenge,覆盖 interruption、overlap 和动态 turn negotiation。
Synchronization and Turn-Taking in Full-Duplex Speech Dialogue ModelsarXiv 2026.05⏳ 待读专门分析 full-duplex speech dialogue models 的同步与 turn-taking,适合作为机制和评价指标线索。
VideoFDBarXiv 2026.05⏳ 待读第一个面向 AV2AV conversational agents 的 full-duplex audio-visual benchmark,直接指出现有系统存在 captioning collapse 和视觉流忽略。

数字人 / Avatar / 动作与表情生成

论文发表状态总结评论
VASA-1NeurIPS 2024 / arXiv 2024.04⏳ 待读单图 + 音频生成实时 talking face,代表“高拟真脸部动态 + 低延迟渲染”的数字人基础路线。
MuseTalkarXiv 2024.10⏳ 待读实时唇形同步: latent space inpainting 做实时高质量 lip-sync,适合做工程基线或实时 Avatar pipeline 的口型模块参照。
TaoAvatarCVPR 2025 / arXiv 2025.03⏳ 待读全身 Avatar: 3DGS-based full-body talking avatar,重点是高保真、轻量化和 AR 设备实时渲染。
Live AvatararXiv 2025.12⏳ 待读流式 Avatar: 大规模 diffusion avatar 的实时流式与无限时长生成,关键在系统并行和长程一致性。
JoyStreamer-FlasharXiv 2025.12⏳ 待读用 14B→1.3B DMD 蒸馏把音频驱动 Wan DiT 转成 4-step causal generator,PSB 前置更多首块去噪、MCI 传递加噪上块末帧、URCR 动态重编码缓存 K,实现单卡 DiT 16.2 FPS 并从结构上解除 RoPE 长度上限;但 16 FPS 不是完整单卡端到端速度,长时稳定性主要靠定性证据,复杂场景与细脸仍受 1.3B 容量限制。
SoulX-FlashTalkarXiv 2025.12⏳ 待读流式 Avatar: 14B audio-driven avatar 系统,关注 real-time infinite streaming、低启动延迟和高保真数字人输出。
Beyond MonologuearXiv 2026.04⏳ 待读直接把 talking 与 listening 双音频流纳入 avatar generation,用 conversational audio context-aware kernels 处理说话/聆听时间尺度差异。
DyaPlexarXiv 2026.06⏳ 待读在 full-duplex speech 基座上接入 streaming motion pathway,建模 dyadic interaction 里的语音、动作、互相反应。
Avatar ForcingCVPR 2026⏳ 待读在 512D head-motion latent 中用 blockwise causal Diffusion Forcing 联合条件化用户音频 / 头动与外部 avatar audio,并以 talking-only motion 为 losing sample 做 DPO;可作为约 0.5 秒的 fast nonverbal executor,但 avatar audio 外供、延迟只测预提特征后的 10-NFE motion,非原生音视频全双工。
InteractiveAvatararXiv 2026.06⏳ 待读ASR→LLM / RRM 产出回复音频与 Action / Stable prompts,再由带 LSVM、Cache-Switching 和 DMD 的 Wan2.2-5B 流式执行动作并保持长时状态;视频端 26.68 FPS 但端到端 TTFF 约 2.6 秒、训练需 64×H100 / 约 300 万 clips,属于级联意图动作视频执行器而非原生 AV 全双工。
FacePlexarXiv 2026.06⏳ 待读在 PersonaPlex 的 80 ms 语音流旁用 Rolling Flow Matching 运动队列与 Rolling Cross-Attention 滑动语音条件联合发出 FLAME 面动;冻结 7B 后训练小分支、N=2 仅 7.9 ms,但只有音频输入和参数输出,L=4 带来约 240 ms 缓冲,且缺少完整视频 / 端到端延迟与同任务 baseline。

已在其他 Topic 的相关论文

这些论文已经在 vault 里有 PDF 或笔记,本 topic 不重复下载。

论文发表状态总结评论
OmniHuman-1arXiv 2025.02⏳ 待读已有精读笔记;可作为 audio-driven human animation 的 scale-up 训练范式参照。
AniPortraitarXiv 2024⏳ 待读已有精读笔记;可作为 diffusion portrait animation 的较早基线。
HalloarXiv 2024⏳ 待读已有精读笔记;适合作为 hierarchical audio-driven portrait animation 基线。