求索札记

Last update

音视频生成编辑

参考报告

路线一:统一音视频联合生成底座

论文发表状态总结评论
LTX-2arXiv 2026.01✅ 已读Lightricks 开放 joint AV 底座,用 14B 视频流 + 5B 音频流的非对称 dual-stream DiT,在每层做双向 AV cross-attention,并用 modality-aware CFG 分离文本遵循与跨模态同步控制;它是 AVControl/OmniForcing 的 base,适合作强联合先验参考,但本身没有 mask/source-to-target 编辑目标。 对话记录音视频联合建模,非对称 dual-stream DiT+双向音视频cross-attn,非共享latent
NAVAarXiv 2026.05⏳ 待读将音视频联合生成拆成“先在专用音视频空间做 native self-attention 对齐、再用外部文本/音色 context cross-attention 条件化”的 Align-then-Fuse MMDiT,6.3B 在 Verse-Bench 同步和视频质量领先且 Seed-TTS 音色可控强;局限是长尾声音、音乐/歌唱和复杂混合声仍依赖更广高质数据。
OmniForcingarXiv 2026.03✅ 已读JD Explore Academy 等将 LTX-2 teacher 蒸馏成实时 joint AV streaming generator,用 1 秒 macro-block 对齐 3 FPS 视频 latent 与 25 FPS 音频 latent,并通过 Global Prefix、Audio Sink Token、三阶段 DMD/Self-Forcing 和 rolling KV cache 实现约 25 FPS;价值在低延迟预览,局限是生成实时化而非对象级编辑。 对话记录蒸馏 LTX-2,实现实时推理
Wan-StreamerarXiv 2026.06✅ 已读把全双工音视频交互从 ASR/LLM/TTS/Avatar 级联改成单 Transformer 的 text/audio/video 输入输出 causal stream,配合因果 VAE/encoder/decoder、block-causal attention 和 thinker-performer KV 交换达到约 200ms 模型侧、550ms 总交互延迟;价值在把响应时机、打断和可见聆听纳入统一建模,局限是 v0.1 只验证 192p proof-of-concept,缺少质量指标、消融和编辑控制。全双工交互底座,非对象级编辑
Wan-Streamer v0.2arXiv 2026.07✅ 已读保留 v0.1 的原生全双工 causal stream,用单 GPU thinker 守住感知/状态/KV/解码关键路径,将高分辨率视频 latent 去噪迁到预分片 KV cache 的多 GPU Ulysses performer,将输出升到 640×368@25 FPS 且仍报告约 200 ms 模型侧延迟;创新在低延迟控制面/高吞吐生成面的计算分区,但缺少硬件配置、latency breakdown、质量指标和消融,“同延迟”依赖更多并行硬件。
Wan-Streamer v0.3arXiv 2026.07⏳ 待读把 v0.1/v0.2 的 causal stream 重构为一次 prefill 的持久 world(场景、角色、声学与音色)和在线 event stream(行为、语音与声音),用普通视频的 world 摘要和时间对齐事件做通用预训练,再以括号内自然语言行为加口语形成开放词表 action 并条件化同步音视频生成;沿用 v0.2 的 640×368@25 FPS 与约 200 ms 模型侧延迟,但跨 roaming/操控迁移、数据构造和行为质量只有概念与定性证据。
JoyAI-EchoTech Report 2026.05⏳ 待读面向 5 分钟多镜头音视频生成,用 slot-paired 视觉/音频 memory 保存人物外观与声纹,并以 memory-aware SFT/RLHF/DMD、Director Agent 和一跳音视频 SR 实现低延迟可对话修改;价值是把 LTX-2/OmniForcing 生态推进到长故事系统,局限是数据、评测、agent 和 SR 细节多为技术报告级证据,未覆盖对象级音视频编辑。分钟级长视频,跨模态memory+agent+SR
ApolloarXiv 2026.01✅ 已读用 single-tower MM-DiT + Omni-Full Attention 统一音频、视频、音频文本和视频文本条件,并通过随机模态 masking 支持 T2AV/TI2AV/TI2V/T2V/T2A 多任务训练,缓解音画同步和口型对齐问题;局限是复现依赖 26B 模型、8100 万级 dense-caption 数据和重数据工程。 对话记录多任务联合训练+多模态数据做self-attn,模型26B+大规模数据;多文本条件可借鉴
UniFormICML 2025✅ 已读把音频 VAE latent 和视频 VAE latent 拼接进同一个 DiT,通过任务 token、任务特定噪声方案和 modality mask loss 统一 T2AV/A2V/V2A,在多任务共享参数下取得接近或超过单任务模型的音画生成质量,但视频质量、A2V 对齐和自动 caption 依赖仍是主要短板。 对话记录早期工作,多任务统一建模联合训练
JavisDiTarXiv 2025.03⏳ 待读用双分支 DiT 同时去噪视频和 mel-spectrogram,并从文本估计随机 spatial/temporal prior 注入每层 ST-CrossAttn;核心价值是把 JAVG 的同步从全局语义对齐推进到对象位置和事件时间的隐式约束,JavisBench/JavisScore 也可复用,但 240P/4 秒、约 0.6M AV 数据和高推理成本限制了实用编辑。
UniVerse-1arXiv 2025.09⏳ 待读将 Wan2.1 视频专家和 Ace-step 音频专家用 block-level 双向 connector 缝成 joint AV 模型,并用在线 clip-level 标注、低质视频数据 timestep 门控和独立噪声采样稳住训练;适合作“专家拼接”路线对照,优势是复用开放底座,局限是双流接口仍难处理长时因果和复杂多声源。
OviarXiv 2025.10⏳ 待读用同构音频/视频 DiT twin backbone 在每个 block 做双向 cross-attention,并用 scaled RoPE 对齐 31 帧视频 latent 与 157 个音频 token,摆脱 A2V/V2A 串联和后处理同步;Verse-Bench 人评显著胜过 JavisDiT/UniVerse-1,但仍限 5 秒 720p/24fps、16 kHz 音频和高采样成本。
HarmonyarXiv 2025.11⏳ 待读将 joint AV diffusion 的同步失败解释为两个 noisy latent 同时演化导致的 correspondence drift,用 audio-driven/video-driven 辅助任务提供 clean-condition 对齐先验,再用 RoPE-aligned local attention、reference-audio 全局风格通道和 SyncCFG 放大跨模态动态;同步指标强,但依赖大规模自收集/Gemini 标注和短 clip 评测。
JavisDiT++arXiv 2026.02⏳ 待读在 Wan2.1-T2V 内用共享 self-attention + 模态专属 FFN 的 MS-MoE 扩成 T2AV,TA-RoPE 直接把音频/视频 token 放到同一时间轴且避免位置重叠,再用 audio/video/AV 三维 reward 构造 AV-DPO;比 JavisDiT/UniVerse-1 更高效,局限是任务主要是 text-to-AV,细粒度音乐/语音/编辑控制还未覆盖。

路线二:统一视频生成/编辑接口

论文发表状态总结评论
LTX-VideoarXiv 2025.01⏳ 待读LTX 系列的视频侧底座,把 patchifying 前移进 32×32×8 高压缩 Video-VAE,让 transformer 在 1:8192 pixels-to-token latent 上做 full spatiotemporal self-attention,并让 VAE decoder 承担最后一步 pixel-space denoising;不含音频,但解释了 LTX-2/AVControl 的视频效率和 per-token timestep 条件机制。
Omni-Video 2arXiv 2026.03✅ 已读用 MLLM 将编辑指令解释成显式 target caption,再把 MLLM token、原始指令和源视频 reference 通过轻量 adapter 注入预训练 T2V DiT,在保留生成 prior 的同时统一视频生成与复杂指令编辑;局限是模块消融、数据细节和长视频/多轮编辑评估仍不足。 对话记录结构上偏connector拼接,未说明数据构建流程;多任务联合训练
BerniniarXiv 2026.05⏳ 待读用 MLLM 在原生 ViT embedding 空间做 target semantic planning,再由 Wan2.2 DiT 结合 text/source VAE features 渲染视频;SA-3D RoPE 解决多参考段位置混淆,reasoning/vision-text 中间态提升复杂编辑,局限是强依赖内部数据、GPT-style prompt rewriter 和大底座。
LoomVideoarXiv 2026.06⏳ 待读用 Qwen3-VL 深层注入、源视频 latent Scale-and-Add 和负 Temporal RoPE 统一多模态视频生成/编辑,在参考图编辑、TIV2V 和电商 FashionVideoBench 上强且推理显著加速;局限是开放域 MI2V、复杂动态和内部电商数据依赖仍是主要短板。
LiveEditarXiv 2026.06✅ 已读将 Wan2.1 双向离线编辑 prior 经 foundation tuning、chunk-wise teacher forcing 和 DMD 蒸馏为 4-step causal streaming editor,再用源/编辑 latent 差异生成 AR-oriented Mask Cache,在 Self-Attention 复用未编辑区域 token,达到 12.66 FPS/79ms;价值在实时局部视频编辑,局限是只处理视觉且依赖局部编辑与稳定背景假设。
SANA-StreamingarXiv 2026.05✅ 已读在 SANA-Video/LongSANA streaming 底座上用 15 个 GDN 全局递归记忆 + 5 个 window-sink softmax 局部匹配组成 hybrid DiT,再用 Cycle-Reverse Regularization 从未配对长源视频约束时序一致性,并配合 fused GDN kernel/MPQ 在 RTX 5090 上达到 1280x704 24 FPS;价值是实时 V2V 工程闭环,局限是不含音频、强依赖高质量长编辑数据和 Blackwell 优化。
LongLivearXiv 2025.09✅ 已读在 prompt 切换时用“已生成视觉 + 新指令”重建 KV cache,并以跨迭代 streaming long tuning 配合 short-window + frame sink,在单 H100 上实现 20.7 FPS 的分钟级交互长视频;但训练只含一次同场景温和切换,且只能控制未来续写,不支持回溯式 co-editing。 对话记录
Anchor ForcingarXiv 2026.03✅ 已读用 sink/junction/local 三类 KV anchor 热启动 prompt-switch re-cache,并以 tri-region RoPE 将长时位置重新对齐到预训练范围,显著保持 60 秒 T2V 的运动与画质;局限是只覆盖未来全局 prompt switch,没有 source、局部范围或 rollback。
TempActarXiv 2026.06✅ 已读用 LLM planner、hierarchical group exploration 和局部 transition reward 联合优化 step-prompt 规划与 AR executor,使 Self-Forcing/LongLive 的 Temporal-Following Score 明显提高;但仍是 open-loop 预排 T2V schedule,不处理异步反馈或 source-conditioned revision。 对话记录
Memory-V2VarXiv 2026.01⏳ 待读将每轮 V2V 输出保存为可检索 VAE-latent memory,再以任务相关 retrieval、分级 tokenization 和 attention-responsive compression 保持非相邻轮次及 200+ 帧分段编辑一致;局限是每轮完整去噪且依赖任务微调,没有在线 causal state 或 commit/rollback。
Prompt RelayarXiv 2026.04⏳ 待读在 cross-attention logits 上加入按时间段平滑衰减的 Gaussian penalty,无训练地隔离多事件 prompt 并软化边界;适合作 target-span routing baseline,但完整 schedule 必须预先给定,也不修改 causal KV/latent state。
RFDMarXiv 2026.02⏳ 待读将 2D I2I 改造成 source-conditioned causal frame editor,以 previous edited frame 作为 shifted diffusion mean 和 clean condition来学习 inter-frame residual transport;状态简单高效,但长时记忆弱且只支持静态 instruction。
StreamEditarXiv 2026.05⏳ 待读把编辑改写为 source-conditioned noise-to-target generation,以 source/target dual branches、attention bridge、grounding/boosting 和 source guidance 在 5-15 steps 中完成长视频 V2V;training-free 且 source state 清楚,但需要手工 triggers、非实时,并没有在线 state revision。
Kiwi-EditarXiv 2026.05✅ 已读从已有视频编辑三元组自动合成参考图,构造 RefVIE 四元组数据和 RefVIE-Bench,并用冻结 MLLM+DiT 的双 connector、源视频 latent 注入、参考图 token 拼接和三阶段训练统一文本/参考图视频编辑;价值在开源 reference-guided 数据闭环,局限是强依赖合成参考图、MLLM 评测和较窄任务范围。 对话记录开源带参考图的视频编辑数据。然后用MLLM提取编辑指令和参考图特征注入到WAN里
VACEarXiv 2025.03✅ 已读将 T2V、I2V、参考控制、局部编辑、inpainting/outpainting 等统一成 text + frames + masks 的视频任务接口,通过 Context Blocks 额外分支注入条件,让一个视频 DiT 覆盖多种创建/编辑;对本主题的价值是视觉编辑接口参考,局限是不含音频轨同步,需另接 V2A/AV editor 才能处理声画联动。 对话记录将多种视频生成和编辑任务统一为了(text, frames, masks) 的统一入口序列;Context Blocks 额外分支来注入特征
Omni-VideoarXiv 2025.07⏳ 待读用 text/vision heads 让视频 MLLM 生成文本或连续视觉 token,再经 lightweight adapter 对齐到 Wan2.1 diffusion decoder 条件空间,统一视频理解、生成和编辑;价值是低成本连接理解与生成模型,局限是 MLLM-diffusion 表示错位和长时高保真视频仍受数据/显存限制。
UniVideoarXiv 2025.10⏳ 待读用 frozen Qwen2.5-VL 理解多模态指令、HunyuanVideo MMDiT 负责生成,并把 MLLM hidden states 与 VAE 视觉细节双流注入生成端,统一 T2V/I2V、in-context generation、mask-free editing 和 visual prompting;创新在统一接口和多任务迁移,局限是仍不含音频同步且生成质量略低于专用 T2V。
AVControlarXiv 2026.03⏳ 待读在冻结 LTX-2 joint audio-visual backbone 上为每种控制信号单独训练 LoRA,把参考视频/音频作为 clean timestep 的 parallel canvas tokens 注入 self-attention,支持 depth、pose、camera、editing、audio intensity、speech-to-ambient 和 who-is-talking;优势是低成本扩展控制,局限是音频质量和复杂运动仍受 base model/vocoder 限制。

路线三:视频到音频与 Foley 声音随动

论文发表状态总结评论
Diff-FoleyarXiv 2023.06⏳ 待读用 CAVP 的语义/时间对比预训练让视觉特征携带声音事件线索,再以该特征条件化 spectrogram latent diffusion,并用 split-merge 增强和 double guidance 提升同步;是扩散式 V2A 的早期强基线,局限是音质与规模仍受 paired AV 数据约束。
FoleyGenarXiv 2023.09⏳ 待读把 V2A 写成 EnCodec 离散音频 token 的条件语言建模,用单个 decoder-only Transformer 生成 waveform token,并比较多种视觉 encoder/attention;音质和语义相关优于早期 baseline,但同步主要靠 attention mask,仍会漏掉显著动作。
FoleyCrafterarXiv 2024.07⏳ 待读冻结预训练 T2A latent diffusion,用并联 visual cross-attention 做 semantic adapter,再用 timestamp detector + ControlNet-like temporal adapter 控制 onset,从而兼顾音质、文本可控和同步;瓶颈在 timestamp detector 与二值 sound/silence 表达能力。
MMAudioarXiv 2024.12⏳ 待读用 flow-matching multimodal transformer 联合训练 AVT 与 AT 数据,缺失模态用 empty token,Synchformer 高帧率特征通过 adaLN 做 token-level 同步调制;证明 audio-text 数据可提升 V2A 音质/语义,但视频侧仍受 VGGSound 等公开 AV 数据规模限制。
MultiFoleyarXiv 2025.03⏳ 待读将 Foley 定义为视频引导的可控 sound design,联合 VGGSound 与高质量 SFX 文本音频库,支持文本/负提示/参考音频/参考视频/音频延展并生成 48 kHz 声效;优势是创作控制,局限是多声源复杂事件和私有 SFX 数据复现。
HunyuanVideo-FoleyarXiv 2025.08⏳ 待读构建约 100k 小时 TV2A 数据管线,用音画 joint self-attention + 文本 cross-attention 的 MMDiT 平衡模态,并以 interleaved RoPE、Synchformer 调制和 ATST-Frame REPA 提升音质/视觉语义/同步;代表工业级 V2A,但数据和训练资源复现门槛高。

路线四:音频驱动视觉与音视频协同编辑

论文发表状态总结评论
Vidu S1arXiv 2026.07✅ 已读用参考首帧+语音/文本条件做可随时修改未来的流式数字人联合音视频生成,从双向 teacher 经 Teacher/Diffusion Forcing 改造为 causal teacher,再以 DMD+PCM 蒸馏到 3-step;TwinCache 在中间步用 noisy history 抑制误差累积、最终步用 clean history 恢复细节,结合滑窗/RoPE 重定位与 TurboDiffusion/TurboServe 栈报告 540p 42 FPS;局限是无长时漂移曲线、指令响应延迟、音频质量、组件消融和公开 benchmark/复现细节。
OmniHuman-1arXiv 2025.02⏳ 待读用 MMDiT 和 omni-condition training 将 text/audio/pose 按运动条件强弱混合训练,利用弱条件数据扩大人体动画训练规模,并让单模型覆盖人像、半身、全身、唱歌、手势和物体交互;核心价值是 scale-up 训练范式,局限是 audio 对身体运动弱相关导致动作仍可能不协调。
EMOarXiv 2024.02⏳ 待读直接用 reference portrait + vocal audio 驱动 SD 视频化 UNet,避免 3DMM/landmark 强中间表示,并用 face locator、speed layers、motion frames 等弱条件稳定长视频和头动;优势是表达性强,局限是几何可控性和精确 lip-sync 不如强约束路线。
AniPortraitarXiv 2024.03⏳ 待读先由 wav2vec 预测 3D facial mesh 与 head pose 并投影为 2D landmarks,再用 SD/AnimateAnyone 风格的 landmark-to-video 扩散模型生成照片级人像动画;优势是可控和可编辑,局限是表情上限受 mesh/landmark 中间表示限制且系统量化证据较少。
HalloarXiv 2024.06⏳ 待读在 SD/ReferenceNet talking-head 框架中把音频分别对齐到 lip、expression、pose 三个层级,并用 zero-conv/adaptive weighting 融合,使同步、表情/姿态多样性和视频质量同时提升;局限是复杂运动和实时效率仍不足。

路线五:对象级音视频联合编辑与声画同步删除

论文发表状态总结评论
SAVEarXiv 2025.12⏳ 待读最贴近“删物体也删声音”的端到端工作:用 Qwen-VL/MMAudio/GroundingDINO/SAM2/inpainting 构造 SAVEBench paired before/after 数据,再以 text+mask 条件和 Schrödinger Bridge Flow Matching 直接学习 source AV mixture 到删除后 AV mixture;DeSync/ImageBind 优于单模态 editor 拼接,但目前主要覆盖 removal、128×128 视觉和合成声场。
Object-AVEditarXiv 2025.10⏳ 待读支持对象添加、替换、删除,关键是训练 word-to-sounding-object 对齐的音频生成模型,让音频也能通过 object word attention map 做 inversion-regeneration 控制,并用 repeated inversion + midpoint velocity 保留源结构;任务覆盖比 SAVE 广,但音频/视频仍是不同 backbone 的组合,跨模态耦合主要靠结果语义对齐。
CoherentAVEditarXiv 2025.12⏳ 待读将音视频联合编辑拆成“先改视频、再按已编辑视频条件生成音频”,用层级响度结构特征、detail-temporal masking 和基于 ImageBind editability 的自适应条件强度,在 AVED-Bench 上取得更好的视听对齐、文本一致性与源音频结构保留权衡;局限是质量仍受前级视频编辑错误和文本-视频语义冲突限制。
AV-EditarXiv 2025.11⏳ 待读只编辑视频音轨,不改画面:用 CAV-MAE-Edit 的帧级音视频相关性和 audio mixing 训练学会识别视觉相关声音,再用 correlation-based feature gating + MM-DiT 添加、删除或替换 sound effects;适合作视觉编辑后的音频修复模块,局限是缺少对象 mask 且原音频保真仍会受损。
AVEDWACV 2026⏳ 待读把 DDS 扩展为跨模态 patch 级 delta denoising:用 cross-attention 定位 prompt-relevant 音频/视频区域并构造正负对比约束,在 AVED-Bench 上提升同步与一致性;优势是 training-free joint editing,局限是每样本优化较慢且依赖注意力定位和小规模基准。
Audio-Visual Object Removal in 360-Degree VideosThe Visual Computer 2020⏳ 待读早期传统方法,用户在 360° 视频首帧框选目标,系统用 SiamMask/视频 inpainting 删除视觉对象,再把目标视觉方向映射到 Ambisonics/DirAC 的 time-frequency bins 中减去对应方向声音;价值是定义了“只删画面不删声音”的体验问题,局限是依赖 4-channel 空间声、方向分离和简单场景。

路线六:评测与诊断

论文发表状态总结评论
FiVEarXiv 2025.03⏳ 待读构建 100 个视频、6 类对象级编辑和 420 对 source-target prompts/masks,并用 VLM Yes/No + multiple-choice 的 FiVE-Acc 判断 source 是否消失、target 是否出现;价值是补足 CLIP 对细粒度编辑不敏感的问题,结论显示 RF-based Wan-Edit 在对象编辑成功率和速度上强,但 object removal 仍普遍失败。
GokuarXiv 2026.06⏳ 待读从 1M Koala-36M 源片经 task-specific expert cascade 与三层过滤(最终淘汰约 88%)构造 2M 条、10 类离线 edit pairs,并以双分支 Goku-Edit 和 1,000 例/7 指标 Goku-Bench 验证 structural/multi-task editing;可作静态编辑原语与 benchmark seed,但无 arrival time、target span、连续中间状态或 causal state,不能直接作为在线 feedback trajectory。
VBench-2.0arXiv 2025.03⏳ 待读将视频生成评测从 superficial faithfulness 扩展到 Human Fidelity、Creativity、Controllability、Physics、Commonsense 五大 intrinsic faithfulness 维度,结合 VLM/LLM 问答和 anomaly/geometry specialists;揭示复杂剧情、动态属性/空间关系、物理和常识仍是 SOTA 模型短板。
VABencharXiv 2025.12⏳ 待读建立 T2AV、I2AV 和 stereo audio 三类任务,覆盖七类内容与 15 个指标,用专家模型和 MLLM 评估文本-视频/文本-音频/音视频对齐、同步、唇形、QA、真实感、表现力和空间声;价值是综合体检,局限是 MLLM judge 与模型版本依赖。
AVGen-BencharXiv 2026.04⏳ 待读从真实用户任务构造复杂 T2AV prompts,用 specialist models + MLLM 评估视觉/音频质量、同步、文字渲染、人脸一致、音高、语音、物理和整体语义;揭示当前模型美学强但细粒度文本、音高、物理和多约束控制弱。
Do Joint Audio-Video Generation Models Understand Physics?arXiv 2026.05⏳ 待读提出 AV-Phys Bench,用 steady state、event transition、environment transition 和 anti-physics prompts 评估视觉、音频与跨模态物理常识;结论是模型语义强于物理、静态强于转变,AV-PC 跨模态物理一致性是开放前沿。
MSAVBencharXiv 2026.05⏳ 待读面向 multi-shot audio-video generation 构建 286 prompts/2198 shots,覆盖 video、audio、shot、reference 四维,并用 shot self-correction、instance-wise rubrics 和 tool-grounded agentic scoring 评估叙事、跨镜头一致性、音画同步、音色和参考 fidelity;结论是导演级控制和细粒度 AV alignment 仍是核心瓶颈。