arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 3055 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 85 篇

2606.18249 2026-06-19 cs.CV 新提交 77%

Unified Multimodal Autoregressive Modeling with Shared Context-Visual Tokenizer is Key to Unification

统一多模态自回归建模:共享上下文-视觉分词器是实现统一的关键

Wujian Peng, Lingchen Meng, Yuxuan Cai, Xianwei Zhuang, Yuhuan Yang, Rongyao Fang, Chenfei Wu, Junyang Lin, Zuxuan Wu, Shuai Bai

机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身AI研究院,复旦大学) Shanghai Innovation Institute(上海创新研究院) Qwen Team, Alibaba Inc.(通义实验室,阿里公司)

专题命中 图像编辑 :image generation(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 提出UniAR框架,通过单一离散视觉分词器桥接视觉理解与生成,采用并行位预测和扩散解码,在图像生成和编辑上达到最优,同时保持多模态理解竞争力。

Comments ICML2026. Project page https://sharelab-sii.github.io/uniar-web

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11643 2026-07-14 cs.RO cs.AI 新提交 75%

Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model

小米机器人-U0:基于世界基础模型的统一具身合成

Xinghang Li, Jun Guo, Qiwei Li, Long Qian, Hang Lai, Yueze Wang, Hongyu Yan, Jiahang Cao, Xi Chen, Jingen Qu, Jiaxi Song, Nan Sun, Hanye Zhao, Futeng Liu, Wanli Peng, Heyun Wang, Yunhong Wang, Caoyu Xia, Jack Zhao, Diyun Xiang, Hangjun Ye, Heng Qu, Huaping Liu, Jason Li

机构 * Xiaomi Robotics(小米机器人)

专题命中 图像编辑 :image generation(abstract);text-to-image(abstract);image editing(abstract)

AI总结 研究针对基础模型应用于具身场景受限问题,提出小米机器人-U0多模态自回归模型,将具身生成扩展为基础图像和视频生成的形式,联合优化多种生成任务,在多方面取得领先成果,证明基础世界模型可用于具身智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06075 2026-08-07 cs.CV cs.AI 新提交 74%

Domain-Grounded Candidate Selection for Agentic Image Editing: A Shadow Removal Case

面向智能体图像编辑的领域 grounded 候选选择:以阴影去除为例

Shilin Hu, Jingyi Xu, Dimitris Samaras, Hieu Le

机构 * Stony Brook University(石溪大学) UNC Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 图像编辑 :image editing(title);分类 cs.CV

AI总结 该研究以阴影去除为例,提出领域 grounded 的智能体候选选择流程,结合物理原理约束商用视觉-语言模型的生成,在 ShadowRemovalRefine 基准上使 CDD 降低至少 47%,证明经典低级视觉先验仍具实用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18787 2026-07-22 cs.CV 新提交 74%

Image Editing Models are Numerical Solvers

图像编辑模型是数值求解器

Ulysse Mizrahi

机构 * Tel Aviv University(特拉维夫大学)

专题命中 图像编辑 :image editing(title);分类 cs.CV

AI总结 研究预训练生成式图像编辑模型能否为数值模拟提供通用接口,通过既定求解器监督,将相同架构和协议应用于多种方程,结果显示该模型可表示多样物理映射,还识别了相关基本约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04840 2026-08-06 cs.CV cs.AI 新提交 70%

Towards a satellite image manipulation and deepfake localization benchmark dataset

面向卫星图像篡改与深度伪造定位的基准数据集

Jacob Arndt, Debvrat Varshney, Philipe Dias, Nivedita Nukavarapu

机构 * Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 图像编辑 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 针对遥感领域缺乏合适卫星图像篡改定位基准数据集的问题,构建含60张图像的原型数据集,支持像素级定位等分析,以推动相关研究。

Comments Accepted at IEEE IGARSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17140 2026-07-21 cs.CV 新提交 70%

STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs

STBridge:用于在统一多模态模型中弥合理解与生成的共享目标对齐

Ye Wang, Hongjun Wang, Hao Fang, Tongyuan Bai, Zuwei Long, Peixian Chen, Wei Liu, Weibo Gu, Xing Sun, Rui Ma

专题命中 图像编辑 :image generation(abstract);image editing(abstract);分类 cs.CV

AI总结 研究统一多模态模型中理解与生成的对齐差距,提出STBridge共享目标对齐框架,通过共同目标状态连接二者,采用对齐然后优化策略,经实验验证该框架能缩小模型描述与生成间差距,有效弥合理解与生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12450 2026-07-15 cs.CV 新提交 70%

Let RGB Be the Language of Vision

让 RGB 成为视觉的语言

Timing Yang, Jinrui Yang, Xinlong Li, Yuhan Wang, Haoran Li, Yanqing Liu, Guoyizhe Wei, Jixuan Ying, Chen Wei, Rama Chellappa, Yuyin Zhou, Cihang Xie, Alan Yuille, Feng Wang

机构 * Johns Hopkins University(约翰·霍普金斯大学) UC Santa Cruz(加州大学圣克鲁兹分校) Carnegie Mellon University(卡内基梅隆大学) Rice University(莱斯大学)

专题命中 图像编辑 :image generation(abstract);image editing(abstract);分类 cs.CV

AI总结 该研究为视觉模型引入统一表述 RGB In and RGB Out(RINO),将多种视觉信息转为 RGB 图像编辑问题,共享架构参数,基于通用主干无需微调,在多视觉任务上有强大零样本性能,为统一视觉语言系统提供见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00410 2026-07-02 cs.CV cs.LG 新提交 70%

MindAU: EEG-Conditioned Facial Action Unit Editing via Dual-Stream Manifold Alignment

MindAU: 基于双流流形对齐的脑电条件面部动作单元编辑

Zhenhang Li, Xin Zhou, Hao Deng, Lijun Yin

机构 * Binghamton University(宾汉姆顿大学) Massachusetts General Hospital(马萨诸塞综合医院) Harvard Medical School(哈佛医学院)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 提出MindAU框架,通过双流流形对齐将EEG特征与AU文本语义和视觉位移对齐,实现高保真身份保持的面部动作单元编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31278 2026-07-01 cs.CV 新提交 70%

Editing Everything Everywhere All at Once

一次性编辑所有内容

Fabio Quattrini, Carmine Zaccagnino, Enis Simsar, Marta Tintoré Gazulla, Rita Cucchiara, Alessio Tonioni, Silvia Cascianelli

机构 * University of Modena and Reggio Emilia(摩德纳和雷焦艾米利亚大学) ETH Zurich(苏黎世联邦理工学院) Google(谷歌)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 提出MICE方法,通过修改联合注意力机制中的加性偏置来调控多实例编辑中的交互,实现无需训练的多实例图像编辑,在保持全局一致性的同时增强属性绑定。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24441 2026-06-24 cs.CV 新提交 70%

S1-Omni-Image: A Unified Model for Scientific Image Understanding, Generation, and Editing

S1-Omni-Image:面向科学图像理解、生成与编辑的统一模型

Qingxiao Li, Zikai Wang, Qingli Wang, Nan Xu

机构 * XScience Lab(XScience实验室) Wenge AI(文阁人工智能)

专题命中 图像编辑 :image generation(abstract);image editing(abstract);分类 cs.CV

AI总结 提出S1-Omni-Image,基于S1-VL-32B和“先思考后生成”范式,统一实现科学图像的理解、生成与编辑,在多个基准上达到领先性能。

Comments 32 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22304 2026-06-23 cs.LG 新提交 67%

Encoder-Decoder Manifold Alignment for Idempotent Generation

用于幂等生成的编码器-解码器流形对齐

Dareen Alharthi, Abdul Waheed, Bhiksha Raj

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 图像编辑 :image generation(abstract);image editing(abstract)

AI总结 针对生成模型中幂等性不足导致的重复应用不稳定问题,提出通过对齐编码器和解码器学习的流形来训练模型,显著降低幂等误差并提升生成稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19637 2026-08-21 cs.CV 新提交 57%

TextRefine: Improving Textual Fidelity, Spatial Placement, and Glyph Rendering for Text Editing in Product Posters

TextRefine:提升产品海报文本编辑中的文本保真度、空间位置与字形渲染

Honglie Wang, Jia Sun, Zijun Li, Junlong Wu, Pengcheng Wei, Jiyuan Wang, Yongrui Heng, Boheng Zhang, Huaiqing Wang, Dewen Fan, Qianqian Gan, Fan Yang, Tingting Gao, Yan-Ming Zhang

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 研究针对产品海报文本编辑中通用模型的缺陷,提出TextRefine框架与OpenTextEdit数据集,在文本保真度、位置可靠性等指标上优于基线方法,提升了产品海报文本编辑效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18215 2026-08-20 cs.CV 新提交 57%

LumiTokens: 3D Relighting via Token-Space Lighting Transformation

LumiTokens:基于标记空间光照变换的三维重光照

Yiwen Chen, Matheus Gadelha, Huaizu Jiang

机构 * Northeastern University(东北大学) Adobe Research(奥多比研究院)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 LumiTokens是将三维重光照转化为潜在场景标记直接变换的框架,支持渐进式可组合光照编辑,重光照质量优于或媲美现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12876 2026-08-14 cs.CV cs.AI 新提交 57%

SPARED: Reasoning-Based AI-Generated Image Detection via Adversarially Edited Data

SPARED:基于推理的AI生成图像检测方法,采用对抗编辑数据

Yicheng Bao, Xiahui Guo, Xuhong Wang, Xin Tan

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出对抗强化学习框架SPARED,通过扩散图像编辑器与推理型MLLM的交替博弈,训练出能抗捷径、泛化能力强的AI生成图像检测器,在三个外部基准上性能单调提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10870 2026-08-12 cs.CV 新提交 57%

NullEdit: Stealthy Image Protection via VLM Condition Redirection

NullEdit:通过视觉语言模型条件重定向实现隐秘图像保护

Weiyao Huang, Liqin Wang, Ziqi Sheng, Wei Lu

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 NullEdit针对VLM表示进行重定向,可隐秘抑制图像编辑且保留源内容,在基准模型上平均降低EditReward IF分数0.813,实现了高效的图像保护。

Comments 9 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08487 2026-08-11 cs.CV 新提交 57%

RenderMatte: Exact-Alpha Rendering and Group-Relative Alignment for Image Matting

RenderMatte:用于图像抠图的精确Alpha渲染与组相对对齐

Zecheng Ren, Yafei Hu, Jianing Zhao, Ruichen Cong, Qun Jin, Yiren Song

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出RenderMatte框架,通过微调FLUX.1 Kontext实现精确Alpha渲染,引入组相对Alpha对齐优化,并构建专属数据集,在抠图基准测试中取得最优性能,解决开放世界场景的抠图难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02841 2026-08-05 cs.CV 新提交 57%

Localize, Don't Beautify: Client-Side Control of Image-Editing APIs for Cosmetic Surgery Previews

聚焦定位,而非美化:面向整容预览的图像编辑API的客户端控制

Sukhrobbek Ilyosbekov

专题命中 图像编辑 :inpainting(abstract);分类 cs.CV

AI总结 本文针对公开图像编辑API无法提供模型内部信息的问题,提出客户端通过掩码合成可实现整容预览的区域定位,在保证身份保留的同时提升编辑区域的准确性,且效果优于仅用提示词的方式。

Comments 9 pages, 7 figures, 2 tables. Pilot study; no surgeon ratings. Code and paper source: https://github.com/suxrobGM/localize-dont-beautify

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01113 2026-08-04 cs.CV 新提交 57%

CoT-Edit: Let CoT Guide Instruction Video Editing

CoT-Edit:让思维链(CoT)指导指令视频编辑

Sen Liang, Fengbin Guan, Youliang Zhang, Xin Li, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy(中关村学院) Tsinghua University(清华大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 本文提出CoT-Edit的plan--guide--edit框架,以CoT增强的MLLM为规划器生成空间先验,结合扩散编辑器实现高保真指令视频编辑,性能优于多个基准方法

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25537 2026-07-29 cs.CV cs.AI 新提交 57%

Visual prompt engineering for video models

视频模型的视觉提示工程

Robert Geirhos, Yuxuan Li, Thaddäus Wiedemer, Neha Kalibhat, Zi Wang, Mani Malek, Oyvind Tafjord, Kevin Swersky, Been Kim, Priyank Jaini

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 研究视频模型能否从视觉提示工程中受益,通过自动修改任务图像提升性能,如视觉物理推理任务。发现视觉提示工程(VIPE)能提高视频推理性能,比传统方法更有效,为提升视频模型视觉推理性能提供简单高效途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23920 2026-07-28 cs.CV 新提交 57%

What Can I Edit? Open-Ended Strategy Discovery and the Emotion Editability Landscape

我能编辑什么?开放式策略发现与情感可编辑性景观

Qing Li, Zeyu Dong, Yin Cui, Chuan Yan, Xiaojiang Peng

机构 * School of Artificial Intelligence, Shenzhen Technology University(深圳技术大学人工智能学院) School of Innovation Design, Shenzhen Technology University(深圳技术大学创新设计学院) Stanford University(斯坦福大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 研究情感图像编辑,EmoScope多智能体框架将任务转变为‘能编辑什么’,先发现可编辑空间,再平衡内容与情感,通过情感条件作用的可供性推理选择策略,在大规模评估中受青睐,还指出相关指标盲点及优势变化情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22864 2026-07-28 cs.CV cs.AI 新提交 57%

Spatial-IQ: Deconstructing Spatial Intelligence via Hierarchical Capability Tests

空间智商:通过分层能力测试解构空间智能

Patrick Rim, Tom Long, Ekta Prashnani, Ruth Rosenholtz, Ben Boudaoud, Peter Xenopoulos, Alex Wong, Joohwan Kim, Jae-Hyun Jung

机构 * NVIDIA Research(英伟达研究院) Yale University(耶鲁大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 研究针对多模态大语言模型空间推理能力不足问题,提出Spatial-IQ分层诊断框架,分解物体计数任务为子任务,生成数据集评估模型,发现模型存在问题,且用思维链监督和强化学习训练可提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19777 2026-07-23 cs.CV 新提交 57%

Look Before You Edit: Attention-Guided Camera Placement and Multi-View Alignment for 3D Gaussian Splatting Editing

编辑前先观察:用于3D高斯点渲染编辑的注意力引导相机放置和多视图对齐

Jaeyeon Park, Taeho Kang, Youngki Lee

机构 * Seoul National University(首尔国立大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 针对3D高斯点渲染编辑受固定相机限制的问题,提出LB-Edit框架。通过注意力引导相机放置确定编辑相机位置,多视图注意力对齐使视图编辑一致。实验表明该方法在多方面表现优,减少视图数量并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18227 2026-07-21 cs.CV 新提交 57%

FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry

FlowMimic:基于像素对扭曲流场的无掩码视觉编辑与生成,用于在线视频编辑数据生成及模态模仿

Dingyun Zhang, Lixue Gong, Wei Liu

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 研究探索在单一模型中整合视频和图像模态的生成与编辑能力,开发像素对时间扭曲流场实时生成视频编辑样本,设计模态模仿损失对齐模态能力,引入相关任务及损失让模型内化基于语言的视觉编辑能力。

Comments Due to file size constraints, the figures in the arXiv file have been heavily lossy-compressed. Please visit the uncompressed file at: https://huggingface.co/datasets/FlowMimic/Uncompressed/blob/main/main.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14681 2026-07-17 cs.CV 新提交 57%

ReBind: Multi-Reference Video Editing via Structured Instructions with Explicit Reference Relationships

ReBind:通过具有显式参考关系的结构化指令进行多参考视频编辑

Xinyu Liu, Shihao Li, Weihong Lin, Xinlong Chen, Yang Shi, Yujin Han, Yiyang Cai, Yanghao Wang, Ruibin Yuan, Yuanxing Zhang, Pengfei Wan, Wenhan Luo, Yike Guo

机构 * HKUST(香港科技大学) Kling Team(克林团队) NJU(南京大学) UCAS(中国科学院大学) PKU(北京大学) HKU(香港大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 研究针对多参考图像条件视频编辑中现有方法难以协调多视觉源信息的问题,提出ReBind框架,通过带嵌入参考令牌的语义指令及两阶段渐进方案学习建立显式绑定,实现轻量级适配,在指令质量和性能上表现出色。

Comments Project Page: https://rebind-mrv2v.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12539 2026-07-15 cs.CV 新提交 57%

DiTailed: Ensuring Visual Object Consistency in Text-Image-to-Image Flow Matching Models

DiTailed:在文本-图像到图像流匹配模型中确保视觉对象一致性

Francesco Taioli, Daniel Coelho, Iaroslav Melekhov, Roberto Alcover-Couso, Jose Miguel Grande Saiz, Virginia Fernandez Arguedas, Artur Bekasov

机构 * Amazon(亚马逊) Faculty(学院)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 研究文本引导图像编辑中生成模型视觉对象一致性问题,提出ABO-Edit数据集,发现图像编辑整流流模型条件嵌入空间特性,进而提出FlowMirror无参数辅助损失,无需架构改变提升了生成质量。

Comments Accepted to ECCV 2026. Project page: https://francescotaioli.github.io/DiTailed/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11281 2026-07-14 cs.CV 新提交 57%

The Devil Is in the Leakage: A Disentangled Dual-Purification Framework for High-Fidelity Hairstyle Transfer

问题出在泄漏中:用于高保真发型转移的解缠双净化框架

Jijie Li, Jiankuo Zhao, Xiangyu Zhu, Zhen Lei

机构 * SAI, UCAS(中国科学院大学 模式识别国家重点实验室) MAIS, CASIA(中国科学院自动化所 模式识别国家重点实验室) CAIR, HKSIS, CAS(中国科学院香港创新研究院 计算机与信息工程实验室) SCSE, FIE, M.U.S.T(澳门科技大学 资讯科技学院)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 研究发型转移中参考发型与源身份纠缠及现有方法泄漏问题,提出双净化框架,含对抗发型净化和对比几何净化两个正则化器,实现高保真、身份保留的发型转移并达领先性能。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10301 2026-07-14 cs.CV cs.CL 新提交 57%

ChartSync: A Benchmark for Visuo-Logical Cascading Chart Editing

ChartSync:视觉逻辑级联图表编辑的基准测试

Jiakang Yu, Yixuan Chai, Tianci Wang, Rihui Jin, Guangkai Xu, Hongtao Deng, Xun Zhu, Wang Gao, Xinrun Guo, Haipang Wu

机构 * Jianghan University(江汉大学) HiThink Research(海思睿研) University of Science and Technology of China(中国科学技术大学) Southeast University(东南大学) Zhejiang University(浙江大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 研究针对生成式图像编辑模型处理结构化统计图的困难,提出视觉逻辑级联编辑任务。引入ChartSync基准测试,含多种图表类别和任务类型。通过两层框架评估模型,发现开源与专有模型能力差距,分析误差以指导多模态架构发展,数据集和代码已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08227 2026-07-10 cs.CV 新提交 57%

Multimodal 3D LUT Generation via StatLUT with Statistical Features for Photorealistic Style Transfer

通过具有统计特征的StatLUT进行多模态3D LUT生成以实现逼真的风格迁移

Yifan Wang, Zhixiang Hao, Yu Wang, Congchao Zhu

机构 * Honor Device Co., Ltd.(荣耀终端有限公司)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 研究针对逼真风格迁移中现有方法的瓶颈,提出StatLUT框架,通过提取统计特征、基于Transformer的Seq2Seq任务预测3D LUT及用H-Diffuser从自然语言提示合成特征,实现多模态逼真风格迁移,性能优于现有方法。

Comments 17 pages, 9 figures, 7 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06603 2026-07-09 cs.CV cs.AI 新提交 57%

Do Counterfactually Fair Image Classifiers Satisfy Group Fairness? -- A Theoretical and Empirical Study

反事实公平的图像分类器是否满足群体公平性?——理论与实证研究

Sangwon Jung, Sumin Yu, Sanghyuk Chun, Taesup Moon

机构 * Seoul National University(首尔国立大学) NAVER AI Lab(NAVER人工智能实验室) ASRI/INMC/IPAI/AIIS, Seoul National University(首尔国立大学ASRI/INMC/IPAI/AIIS)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 研究图像分类中反事实公平与群体公平的关系,构建新数据集评估二者,发现CF不意味着GF,原因是潜在属性G,提出CKD基线,实验表明减少对G的依赖可使实现CF的模型满足GF。

Comments NeurIPS 2024 Track Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03562 2026-07-07 cs.CV 新提交 57%

XPlainVerse: A Million-Scale Benchmark for Explainable Deepfake Detection

XPlainVerse:用于可解释深度伪造检测的百万规模基准测试

Abhijeet Narang, Kartik Kuckreja, Shreya Ghosh, Muhammad Haris Khan, Jianfei Cai, Abhinav Dhall

机构 * Monash University(墨尔本大学) MBZUAI(穆斯林人工智能研究所) The University of Queensland(昆士兰大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 针对深度伪造检测模型解释缺乏视觉依据的问题,引入XPlainVerse基准测试,含百万图像及多阶段验证流程,提出新评估指标,能支持可信赖、可解释模型的研究。

详情

展开后加载摘要…

URL PDF HTML 收藏