随着生成式人工智能技术的飞速演进,AI 在图像处理领域的应用已从单纯的生成迈向了精细化的编辑与修复。其中,基于扩散模型的“图像修复”技术,即俗称的“橡皮擦”技术,能够将画面中不需要的物体移除,并智能地填充背景,使其看起来天衣无缝。然而,近期小米 MiLM Plus 团队发布的一项研究揭示了该领域长期存在的一个痛点:现有的评估指标已无法跟上算法进步的步伐。
长期以来,研究人员和开发者主要依赖 PSNR、SSIM 和 LPIPS 等传统指标来衡量图像修复的质量。这些指标主要关注像素级的差异,即比较生成图像与原始图像在像素值上的接近程度。然而,随着扩散模型在处理复杂场景时的表现力越来越强,这些传统指标逐渐暴露出局限性。例如,当模型成功移除物体并完美重构了阴影、反射以及被遮挡的背景结构时,这些指标却往往无法正确反映其高质量,甚至将输出结果排名错误。
造成这一现象的根本原因在于“病态问题”的本质。图像修复本质上是一个“逆问题”,即从一个不完整的观察结果推导出原始场景。对于同一个被移除的物体,可能存在无数种合理的填充方案,因此不存在一个绝对唯一的“真值”标准。现有的指标试图用单一的标准去衡量这种多解性,自然会导致评估失效。为了解决这一行业难题,小米 MiLM Plus 团队推出了全新的 PROVE 框架。
PROVE 框架的核心在于引入了两个感知对齐的指标:RC-S 和 RC-T。RC-S 可能侧重于空间维度或单视角的一致性评估,而 RC-T 则可能专注于纹理或时间维度的连贯性。更重要的是,该框架配套了一个基于真实世界视频的基准测试。与以往依赖合成数据集不同,真实世界的视频往往包含更复杂的自然光影变化和动态背景,这为评估模型在复杂环境下的鲁棒性提供了更严苛的考验。
这一突破对于 AI 图像处理领域具有深远的影响。通过建立一套更符合人类视觉感知的评估体系,PROVE 框架能够帮助研究人员更准确地定位当前算法的短板,从而推动模型向更逼真、更自然的方向发展。对于普通用户而言,这意味着未来我们在使用 AI 进行照片编辑、视频剪辑甚至虚拟现实(VR)内容生成时,将获得更加真实、细腻且令人信服的体验。这项研究不仅为图像修复领域树立了新的标杆,也为计算机视觉中“评估标准”的制定提供了宝贵的参考范本。
信息来源:MarkTechPost,原文链接:https://www.marktechpost.com/2026/08/11/xiaomis-milm-plus-releases-prove-perception-aligned-object-removal-metrics-rc-s-and-rc-t-with-a-real-world-video-benchmark/