图像生成与编辑
高分辨率生成与适配
| 论文 | 发表 | 状态 | 总结 | 评论 |
|---|---|---|---|---|
| PiD: Fast and High-Resolution Latent Decoding with Pixel Diffusion | arXiv 2026.05 | ⏳ 待读 | 把 VAE/RAE latent 解码改写成 text-conditioned pixel diffusion,以 noisy-latent conditioning 和 sigma-aware gate 支持上游 LDM 提前停止,再用 DMD2 蒸馏为 4 步,直接完成 4×/8× 高分辨率解码;2K 在 GB200 上约 210 ms,但依赖昂贵的 pixel prior 与文本条件,生成式补细节也可能偏离原 latent。 | |
| Ultra-Resolution Adaptation with Ease | arXiv 2025.03 | ✅ 已读 | 给出超高分辨率适配的三条实践准则:优质教师合成数据可加速收敛,缺少合成数据时微调权重矩阵次要分量优于常规 LoRA,引导蒸馏模型微调时应关闭 CFG;仅用约 3K 样本和 2K 步实现 2K/4K 生成,但效果仍取决于教师偏差与高分辨率数据质量。 |
模型原生多轮交互式编辑
| 论文 | 发表 | 状态 | 总结 | 评论 |
|---|---|---|---|---|
| Pico-Banana-400K: A Large-Scale Dataset for Text-Guided Image Editing | arXiv 2510.19808 | ⏳ 待读 | ||
| AnyEdit: Mastering Unified High-Quality Image Editing for Any Idea | arXiv 2411.15738 | ⏳ 待读 | ||
| Multi-turn Consistent Image Editing | arXiv 2505.04320 | ⏳ 待读 | ||
| Edit-Compass & EditReward-Compass: A Unified Benchmark for Image Editing and Reward Modeling | arXiv 2605.13062 | ⏳ 待读 | ||
| RewardHarness: Self-Evolving Agentic Post-Training | arXiv 2605.08703 | ⏳ 待读 | ||
| AlphaGRPO: Unlocking Self-Reflective Multimodal Generation in UMMs via Decompositional Verifiable Reward | arXiv 2605.12495 | ⏳ 待读 | ||
| ImgEdit | arXiv 2502.17503 | ⏳ 待读 |
循环一致性
方向概览
循环一致性最初用于缓解无配对图像翻译的欠约束问题:只匹配目标域分布不足以保证内容保持,因此需要某种“翻译后还能回到原输入”的约束。后续发展逐渐从像素级重建,转向内容表示、路径几何、共享 latent、ODE 轨迹和 diffusion 过程一致性。
主题笔记
论文材料
PDF 已统一放在 papers/。后续如果需要精读单篇论文,再按常规 topic 结构补充到 notes/<PaperID>/<PaperID>.md。
| 路线 | 代表问题 | 状态 |
|---|---|---|
| GAN 时代的像素级/latent cycle | 无配对图像翻译如何保持内容结构 | 已有 survey |
| Cycle 替代约束 | 是否可以用对比学习、路径约束、语义一致性替代严格 cycle | 已有 survey |
| Diffusion 时代的 cycle | cycle 发生在 latent、ODE、denoising step 还是语义桥上 | 已有 survey |