Py学习  »  aigc

东南大学 & 小红书提出Imposter:更强大的伪造样本助力AIGC检测新SOTA

CVer • 8 小时前 • 10 次点击  

点击下方卡片,关注“CVer”公众号

AI/CV重磅干货,第一时间送达

扫描下方二维码,加入CVer学术星球可以获得最新顶会/顶刊上的论文ideaCV从入门到精通资料及应用!发论文/搞科研/涨薪,强烈推荐!

图片

篡改数据集太“假”?这个 Agent 框架让 AIGC 篡改样本更逼真|10 万图像新基准 + 新 SOTA

论文题目:Impostor: An Agent-Curated Benchmark for Realistic AIGC Manipulation Localization

论文:https://arxiv.org/abs/2606.04545

作者机构:东南大学、小红书、清华大学

导读:随着 FLUX、Qwen-Image-Edit 等生成式编辑模型快速演进,"以假乱真"的局部篡改图像正快速泛滥,而现有图像篡改检测与定位(IMDL)基准在视觉真实感、编辑多样性与生成器覆盖上仍明显滞后,已难以充分反映新一代 AIGC 编辑带来的挑战。为此,本文提出 Impostor,通过闭环 CraftAgent 构建大规模、高真实度的 AIGC 局部篡改基准,并进一步提出 PANet,从局部相位结构与语义—取证一致性中挖掘更隐蔽、更可靠的篡改线索,在多个数据集上取得领先的检测与定位性能。面向持续演进的生成模型,Impostor 与 PANet 为更真实、更复杂的 AIGC 场景提供了新的取证基准与方法,使高真实度局部篡改也无处遁形。

一、痛点:现有 IMDL 基准为什么"不够用"?

作者指出,随着生成式图像编辑模型不断进化,局部篡改已经从“容易看出破绽”走向“视觉上高度自然”。但现有 IMDL 基准的构建方式仍明显滞后,主要体现在三个方面:

视觉真实感不足:现有数据集中的篡改样本往往依赖较简单的编辑指令或粗粒度类别替换,容易留下不自然的边界、纹理或结构异常。模型在这类数据上取得高性能,并不一定意味着真正学会了可泛化的取证线索,也可能只是利用了数据集中相对明显的“伪影捷径”。

篡改多样性不足:许多现有基准仅覆盖少量篡改类型,且大多聚焦于单区域编辑,难以涵盖添加、删除、替换及多区域联合编辑等更复杂的操作。随着 AIGC 模型编辑能力持续增强,这种单一化的数据设定与真实编辑场景之间的差距正在扩大,也使现有基准难以全面评估模型面对复杂篡改时的定位能力。

生成器覆盖有限:现有数据集通常只由少量甚至单一生成模型构建,容易让检测模型学习到特定生成器留下的“指纹”,而不是更本质、更具迁移性的篡改线索。一旦面对新的编辑模型,这类依赖 generator-specific artifacts 的方法往往容易出现明显性能下降。

这意味着,一个模型在旧基准上拿到高分,并不代表它真的看穿了 AIGC 篡改;它可能只是记住了旧数据留下的破绽。基准不升级,排行榜越漂亮,反而越可能制造虚假的安全感。因此,问题已经不再只是“数据够不够多”,而是现有基准是否真的足以代表今天的 AIGC 局部编辑。如图 1 所示,Impostor 正是围绕视觉真实感、篡改多样性和生成器覆盖这三个核心维度,重新定义了现代 AIGC 篡改定位基准应有的难度与代表性。

图 1:Impostor 与现有 AIGC 图像篡改定位数据集的对比。Impostor 在视觉真实感、篡改多样性以及生成器覆盖范围方面表现更佳,为基于AIGC的现代图像篡改提供了更具代表性的基准。

二、Impostor 数据集:面向真实 AIGC 局部篡改的高质量数据集

面对不断升级的生成式编辑能力,仅靠“增加数据规模”已经不足以构建真正具有代表性的 IMDL 基准。Impostor 更关注三个核心问题:篡改是否足够真实、编辑场景是否足够丰富、生成来源是否足够多样。围绕这三个目标,作者最终构建了包含 10 万张 AIGC 局部篡改图像的 Impostor,覆盖 7 个先进图像编辑模型Add / Remove / Inpaint 三类典型操作,并支持单张图像 1–9 个篡改区域,使数据能够覆盖更复杂、更接近真实用户需求的局部编辑场景。

2.1 CraftAgent:让数据工厂学会反思

图 2:Impostor 的生成流程。基于 LVLM 的 CraftAgent 通过感知、规划、执行、验证、反思的迭代闭环,生成多样且高质量的篡改图像。

Impostor 的核心并不是简单调用多个生成器批量生成图像,而是设计了  CraftAgent,将原本一次性的篡改生成流程改造成一个可持续反馈和纠错的闭环。传统数据构建通常遵循“给定图像与编辑指令 → 调用生成模型 → 筛选结果”的单向流程。一旦指令与场景不匹配,生成结果就容易出现明显伪影,这类静态流程很难主动纠正。CraftAgent 则将感知、规划、执行、验证和反思串联起来,使上一轮的生成结果持续影响下一轮决策,从而不断优化后续样本的质量与分布。

CraftAgent 包含五个关键环节:

感知(Perception):首先分析场景语义与编辑可行性,并结合历史生成状态,决定采用何种篡改类型(Add / Remove / Inpaint)。

规划(Planning):结合目标区域及其场景上下文生成区域级编辑指令,并进一步描述目标对象的形状、材质、颜色和纹理等细粒度视觉属性,使编辑指令更加符合真实用户的编辑意图;

执行(Execution):根据具体任务调用合适的图像编辑模型完成篡改生成;

验证(Validation):从语义一致性、掩码对齐与背景一致性、几何与结构完整性、整体真实感四个维度对生成结果进行质量筛选,过滤存在明显伪影或不合理编辑的样本;

反思(Reflection):总结数据生成中的类别分布、篡改类型统计和失败原因等反馈信息,并将其用于后续规划与生成,使篡改规划更加均衡、多样,形成持续迭代的闭环。

这套机制把过去“批量生成、事后筛选”的单向流水线,升级成了一个会自检、会纠错、还会根据失败经验持续进化的闭环数据构建系统。总体来说,CraftAgent 不只负责生成篡改图像,还会像一个极其挑剔的质检员一样反复验货:哪里不自然、掩码哪里没对齐、哪类样本生成过多,都会被反馈给下一轮生成。

2.2 Impostor:更丰富,也更难被识破

表 1:Impostor 与现有图像篡改定位数据集的综合对比。除数据规模与篡改覆盖外,右侧进一步比较了不同数据集在现有检测与定位模型下的识别难度。

最终构建的 Impostor 包含 10 万张 AIGC 局部篡改图像。相比现有数据集,Impostor 在编辑类型、区域复杂度、生成器来源和语义覆盖上更加丰富。更重要的是,现有 LVLM 与专用 IMDL 方法在 Impostor 上的检测与定位性能均明显下降,表明这些样本暴露出的可利用伪影更少、视觉真实感更高。Impostor 不只是规模更大,更重要的是把 AIGC 局部篡改真正做到了“更真实、更自然、更难识破”。

三、PANet:语义—取证双流框架

图 3:PANet 的整体架构。语义分支提取多尺度语义表征,LFCE 增强的取证分支进一步捕获残差与局部相位线索;两类特征通过 MGCA 进行双向交互与融合,并由 FPN Decoder 完成像素级篡改定位。训练过程中,FSC Loss 显式约束语义—取证一致性,使模型能够更敏感地发现 AIGC 编辑中细微的局部异常。

PANet 的核心判断很直接:一张图可以在视觉和语义上毫无破绽,但它的底层取证特征未必也能配合得天衣无缝。视觉上看起来合理,不等于取证上也合理。围绕这一判断,PANet 的三项设计各有分工:LFCE 负责从残差和局部相位中提取微弱痕迹,FSC Loss 负责判断语义与取证证据是否“对得上”,MGCA 则让两类线索互相引导、协同定位。三者共同解决一个问题:如何从越来越逼真的 AIGC 图像中,找出肉眼难以察觉的局部异常。

3.1 局部相位建模:捕捉更细微的结构扰动

传统图像取证方法多依赖噪声残差或频域统计,但随着 AIGC 编辑质量持续提升,显著高频伪影不断被削弱,单纯依赖幅度或能量异常已难以捕捉更细微的局部结构变化。为此,PANet 创新性地引入局部相位建模 ,通过 Log-Gabor 滤波与二维 Riesz 变换提取空间对齐的局部相位表征,显式刻画边缘、轮廓与纹理等结构的局部组织一致性。相较于传统频域方法主要关注“响应强不强”,局部相位进一步回答“结构是否仍然自然、连续且协调”,从而对高真实度 AIGC 编辑引入的细粒度结构扰动更加敏感,并与残差线索形成互补。

3.2 FSC Loss:把“语义合理、取证异常”变成监督信号

高质量 AIGC 编辑往往能够保留自然、合理的视觉语义,却会扰动原本与之对应的底层取证线索,使语义表征与取证表征之间的协调关系发生偏移。基于这一现象,PANet 提出 Forensic-Semantic Consistency(FSC)Loss,显式建模真实区域与篡改区域之间的语义—取证一致性差异。模型一方面强化真实区域中的一致性响应,另一方面通过排序约束拉开真实区域与篡改区域的相对差距,从而将原本隐性的“语义—取证失配”转化为可学习的局部篡改定位信号。

3.3 MGCA:让语义与取证线索双向引导

语义特征与取证特征关注的线索具有明显互补性,简单拼接或直接相加难以充分发挥二者优势。为此,PANet 设计 Mutual Guided Cross Attention(MGCA) 模块,通过通道引导与空间引导实现双向交互:语义分支提供通道级指导,强化取证特征中的关键响应;取证分支则提供空间级指导,使语义特征更聚焦于潜在篡改区域。随后,双向 Cross-Attention 进一步建模跨分支依赖,并结合空间自适应门控完成位置感知的动态融合,从而实现语义信息与取证线索的深度协同,提升细粒度局部篡改定位能力。

四、实验与结果

作者从像素级篡改定位、图像级篡改检测、鲁棒性与消融实验三个方面对 PANet 进行了系统评估。整体结果表明,PANet 不仅在 Impostor 上取得最优表现,在多个公开数据集和未知生成域上也保持了较强的泛化能力。

表 2:在 Impostor 及跨数据集测试集上的像素级篡改定位结果。粗体和下划线分别表示最佳和次佳结果。

表 3:AIGCDetectBenchmark 上的跨域图像级检测结果。粗体和下划线分别表示最佳和次佳结果。

表 4:左:常见后处理操作下的鲁棒性分析;右:PANet 消融实验

在像素级篡改定位任务中,所有方法均在 Impostor 上训练,并直接在 Impostor、SID-Set、BR-Gen、CocoGlide 和 AutoSplice 五个数据集上进行评估。PANet 在 5 个测试集上均取得第一名,相比最强基线,PANet 的平均 IoU 和 F1 分别提升 5.99 和 5.94 个百分点,这表明 PANet 学到的不是某个数据集或生成器留下的固定“指纹”,而是更具迁移性的篡改线索。

为了进一步检验模型对未知生成域的适应能力,作者在 AIGCDetectBenchmark 上进行了跨域图像级检测实验。PANet 的平均准确率达到 92.68%,较此前表现最好的基线 AIDE 高 1.43 个百分点。即使面对难度更高的 Impostor,PANet 仍以 68.91% 的准确率取得第一。这意味着,PANet 不只会定位“哪里被改了”,还能够把在一个生成域中学到的取证能力迁移到新的生成器和未知图像域中。

在 Resize、Blur、Noise 和 JPEG Compression 等常见图像后处理条件下,PANet 均取得最高的平均 IoU,说明模型在图像经过缩放、模糊、噪声或压缩后,仍能保持较稳定的篡改定位能力。消融实验进一步验证了各模块的有效性。

总体来看,PANet 在定位精度、跨域泛化和后处理鲁棒性三个维度上都保持了稳定领先。结合 Impostor 提供的高真实度训练与评测环境,PANet 展现出了面向新一代 AIGC 局部篡改更强、更稳定的取证能力。

五、总结

总体来看,Impostor 并不是简单把 AIGC 篡改数据集“做得更大”,而是重新思考了一个更关键的问题:当生成式编辑已经越来越逼真,我们究竟应该用什么样的数据,去评估下一代图像篡改检测与定位方法?

相比单纯追求数据规模,Impostor 更强调真实性、多样性以及对新生成器的覆盖能力;而 PANet 也不再只依赖显眼的生成伪影,而是进一步挖掘局部相位与语义—取证失配等更细微的线索。这或许也意味着,随着 AIGC 编辑逐渐走向“无痕化”,未来图像取证真正需要解决的,不只是如何把模型做得更强,而是如何找到那些不会随着生成模型迭代而迅速消失的稳定证据。

论文:https://arxiv.org/abs/2606.04545

声明:本文为个人学术分享,部分作者所属机构包含小红书,但内容仅代表论文本身研究结论,不代表任何机构官方立场或产品能力承诺。

本文系学术转载,如有侵权,请联系CVer小助手删文

何恺明在MIT授课的课件PPT下
在CVer公众号后台回复: 何恺明,即可下载566页课件PPT!大家赶紧学起来!
CVPR 2026 所有论文和代码下载
在CVer公众号后台回复:CVPR2026,即可下载CVPR 2026 所有论文和代码!

CV垂直方向和论文投稿交流群成立

扫描下方二维码,或者添加微信号:CVer2233,即可添加CVer小助手微信,便可申请加入CVer-垂直方向和论文投稿微信交流群。另外其他垂直方向已涵盖:目标检测、图像分割、目标跟踪、人脸检测&识别、OCR、姿态估计、超分辨率、SLAM、医疗影像、Re-ID、GAN、NAS、深度估计、自动驾驶、强化学习、车道线检测、模型剪枝&压缩、去噪、去雾、去雨、风格迁移、遥感图像、行为识别、视频理解、图像融合、图像检索、论文投稿&交流、PyTorch、TensorFlow和Transformer、NeRF、3DGS、Mamba等。


一定要备注:研究方向+地点+学校/公司+昵称(如Mamba、多模态学习或者论文投稿+上海+上交+卡卡),根据格式备注,可更快被通过且邀请进群

图片

▲扫码或加微信号: CVer2233,进交流群


CVer计算机视觉(知识星球)人数破万!如果你想要了解最新最快最好的CV/DL/AI论文、实战项目、行业前沿、从入门到精通学习教程等资料,一定要扫描下方二维码,加入CVer知识星球!最强助力你的科研和工作!


Image

扫码加入星球学习

▲点击上方卡片,关注CVer公众号

整理不易,请点赞和在看图片

Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/200657