求索札记

Last update

图像生成与编辑

高分辨率生成与适配

论文发表状态总结评论
PiD: Fast and High-Resolution Latent Decoding with Pixel DiffusionarXiv 2026.05⏳ 待读把 VAE/RAE latent 解码改写成 text-conditioned pixel diffusion,以 noisy-latent conditioning 和 sigma-aware gate 支持上游 LDM 提前停止,再用 DMD2 蒸馏为 4 步,直接完成 4×/8× 高分辨率解码;2K 在 GB200 上约 210 ms,但依赖昂贵的 pixel prior 与文本条件,生成式补细节也可能偏离原 latent。
Ultra-Resolution Adaptation with EasearXiv 2025.03✅ 已读给出超高分辨率适配的三条实践准则:优质教师合成数据可加速收敛,缺少合成数据时微调权重矩阵次要分量优于常规 LoRA,引导蒸馏模型微调时应关闭 CFG;仅用约 3K 样本和 2K 步实现 2K/4K 生成,但效果仍取决于教师偏差与高分辨率数据质量。

模型原生多轮交互式编辑

循环一致性

方向概览

循环一致性最初用于缓解无配对图像翻译的欠约束问题:只匹配目标域分布不足以保证内容保持,因此需要某种“翻译后还能回到原输入”的约束。后续发展逐渐从像素级重建,转向内容表示、路径几何、共享 latent、ODE 轨迹和 diffusion 过程一致性。

主题笔记

论文材料

PDF 已统一放在 papers/。后续如果需要精读单篇论文,再按常规 topic 结构补充到 notes/<PaperID>/<PaperID>.md

路线代表问题状态
GAN 时代的像素级/latent cycle无配对图像翻译如何保持内容结构已有 survey
Cycle 替代约束是否可以用对比学习、路径约束、语义一致性替代严格 cycle已有 survey
Diffusion 时代的 cyclecycle 发生在 latent、ODE、denoising step 还是语义桥上已有 survey