求索札记

Last update

畸变修复

Topic Materials

几何与相机基础

论文发表状态总结评论
Correction of Geometric Perceptual Distortions in PicturesSIGGRAPH 1995⏳ 待读从感知公理出发,证明 viewing transformation 可分解为透视/平行投影加 2D 后处理,并用单参数 λ 在“直线保直”和“形状正确”之间连续折中。对我有用的是它给了广角校正的理论边界;短板是中心对称假设很强,非对称畸变和投影中心估计都没有真正解决。
A Flexible New Technique for Camera CalibrationTPAMI 2000⏳ 待读用多张不同姿态的平面棋盘图,通过 homography 先闭式求内参,再用最大似然/LM 最小化重投影误差并估计径向畸变。它是廉价标定的经典范式;但两参数径向模型对广角/鱼眼不够,且畸变估计依赖图案覆盖范围和拍摄姿态。
PanniniCAe 2010⏳ 待读从 vedutismo 绘画反推投影规律,用 panosphere 到 cylinder 再到 plane 的双重投影,以参数 d 压缩水平方向,同时保持垂直线和径向线为直线。优点是封闭形式、无需优化和交互;不足是横向水平线天然弯曲,垂直压缩只是补救,参数仍需人工调。

单图广角人像校正

论文发表状态总结评论
Distortion-Free Wide-Angle Portraits on Camera PhonesSIGGRAPH 2019✅ 已读把人脸区域用球极投影、背景用透视投影,再通过网格能量优化做平滑过渡;多人脸用 per-face 隐变量相似变换协调,背景用线弯曲正则保护直线。它奠定了“人脸和背景应分区投影”的问题设定;短板是依赖检测/参数,容易漏小脸,脸旁直线和身体区域会出现不一致。对话记录奠定了“人脸和背景应分区投影”的问题设定
Practical Wide-Angle Portraits Correction with Deep Structured ModelsCVPR 2021✅ 已读首个 calibration-free 深度方案:LineNet 学 Input->Projection 的背景直线 flow,ShapeNet 学 Projection->Correction 的人脸/过渡区 flow,TM 传递上游 projection 上下文。贡献在于把 Shih 的优化式混合投影蒸馏成两阶段端到端网络并提出 LineAcc/ShapeAcc;短板是 GT 依赖 enhanced Shih+人工修正,LAM/FAM 增益较弱,过渡约束仍是隐式学习。对话记录深度学习版的背景+人脸分别处理;shih工作的延续,似乎可以忽略人脸mask的作用;也可以参考类似方案将mask预测融入到网络中

半监督与生成/几何先验

论文发表状态总结评论
Semi-Supervised Wide-Angle Portraits Correction by Multi-Scale TransformerCVPR 2022✅ 已读用少量 flow 标注加大量无标注数据训练:把 flow 回归转成方向/幅度分割代理任务做 DRC,再用 RC 保持回归一致性;网络上用 MS-Unet/MSTB 结合 window attention 和 dense local features。价值是把半监督引入广角人像校正;短板是阈值和代理任务设计较手工,仍只处理单图,没有时序一致性。对话记录似乎主要作用仍来自于监督学习,但通过构造软约束进行半监督也可借鉴
Combining Generative and Geometry Priors for Wide-Angle Portrait CorrectionECCV 2024✅ 已读真正有价值的是把 StyleGAN2 多尺度中间特征注入 U-Net decoder 来指导人脸 correction flow,消融显示多尺度 prior 同时改善 landmark 与 PSNR/SSIM;LineCNet 的对称性只是全监督整图 flow 学习上的轻量正则,LineAcc 提升很小。整体 pipeline 依赖检测、ParseNet 贴脸和外部 LaMa/diffusion 补洞,系统完整性和融合鲁棒性不足。对话记录人脸生成prior也可以利用,但是需要的是如何把畸变人脸图像得到对应的好的非畸变的人脸prior;
Semi-Supervised Coupled Thin-Plate Spline Model for Rotation Correction and BeyondTPAMI 2024✅ 已读诊断单次 TPS 的控制点瓶颈,改成多次迭代搜索控制点,并把多次 TPS 通过 warping flow 组合成“一次插值”的整体变换;旋转校正上再用对偶变换一致性做半监督。这个“多次灵活变形但避免多次采样”的思想很可复用;短板是半监督收益主要限于旋转校正,广角人像的 LineAcc 并未领先。对话记录多次迭代TPS,人像畸变校正借鉴意义不大

视频与时序相关基础

论文发表状态总结评论
RAFTECCV 2020⏳ 待读抛弃 coarse-to-fine,在单一高分辨率 flow 上用 all-pairs 4D correlation volume 加轻量循环更新算子反复细化,测试时可增加迭代次数换精度。它是后续光流/稠密对应的重要基础模块;短板是 correlation 内存随分辨率平方增长,遮挡和大面积无纹理区域没有显式建模。
Deep Iterative Frame Interpolation for Full-frame Video StabilizationTOG 2020⏳ 待读把视频稳定化重写成迭代帧插值:中间帧生成相当于时域低通滤波,同时能合成边界 missing view,从而实现无裁剪全帧稳定;训练上用随机平移构造无监督信号。亮点是绕开“稳定必须裁剪”的老问题;短板是大幅旋转/zoom/剧烈抖动时边界合成会模糊,skip 和迭代次数还需手调。
Correcting Face Distortion in Wide-Angle VideosarXiv 2021.11✅ 已读Shih 2019 的视频扩展版:仍用人脸局部 stereographic、背景 perspective 的网格优化,但把 mesh 顶点、per-face similarity transform 和背景线段放进全视频时空优化,解决逐帧校正的漏检闪烁和直线抖动;短板是非因果、优化慢,且仍只校正脸不校正身体。主要优化时序一致性
Reference-based Video Super-Resolution Using Multi-Camera Video TripletsCVPR 2022⏳ 待读利用手机多摄 triplets,把宽角/长焦视频作为超广角 VSR 的参考源:DCSR 式 patch-match 对齐参考纹理,BasicVSR 式双向循环传播时序信息,中间用置信度门控的 propagative temporal fusion 避免错误参考特征污染。可借鉴的是“参考对齐+时序传播+自监督适配”;短板是全局匹配内存大,长焦 FoV 太小,真实 8K GT 不可得。无参考价值
Beyond Wide-Angle Images: Structure-to-Detail Video Portrait Correction via Unsupervised Spatiotemporal AdaptationarXiv 2025.08✅ 已读ImagePC 先用 Transformer 学全局结构 flow,再用扩散模型补局部细节;VideoPC 在无视频标注下做时空适应,用空间一致性和轨迹平滑约束把单图校正迁移到视频,重点解决逐帧校正的 temporal shake。价值是把广角人像校正推进到视频;短板是时序平滑会轻微牺牲 LineAcc/ShapeAcc,扩散推理慢,视频训练集仍小。对话记录将图像校正过渡到视频校正,校正能力本身无提升,但扩展思路可借鉴