PROVE: Training-Free Prompt Recovery using Verifiable Evidence
PROVE:基于可验证证据的无训练提示词恢复
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 该研究提出无训练的黑盒提示词反转攻击PROVE,通过可验证场景描述重建提示词,在多数据集上优于基线方法,可用于版权保护相关研究。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
PROVE:基于可验证证据的无训练提示词恢复
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 该研究提出无训练的黑盒提示词反转攻击PROVE,通过可验证场景描述重建提示词,在多数据集上优于基线方法,可用于版权保护相关研究。
顺序很重要:LVLMs作为图像序列时间推理的评判者
机构 * University of Bologna(博洛尼亚大学) ; NOVA School of Science and Technology(NOVA科技学院) ; NOVA Laboratory for Computer Science and Informatics(NOVA计算机科学与信息实验室)
专题命中 文生图 :image synthesis(abstract);分类 cs.CV
AI总结 本研究发现大视觉语言模型(LVLMs)作为多模态评判者存在时间顺序判别缺陷,受首因、近因等结构性偏差影响,呼吁构建时间感知的视觉序列评估范式。
Comments 34 pages, camera-ready
OTLesMix:用于生成形状与位置多样化合成病灶的Wasserstein重心与最优传输映射
机构 * Univ. Lyon(里昂大学) ; INSA Lyon(里昂国立应用科学学院) ; UCBL(里昂第一大学) ; CNRS(法国国家科学研究中心) ; Inserm(法国国家健康与医学研究院) ; CREATIS
专题命中 文生图 :image synthesis(abstract);分类 cs.CV
AI总结 本研究提出OTLesMix方法,利用Wasserstein重心与最优传输映射生成多样化合成病灶,在三项脑病灶分割任务上使Dice分数提升2.9至6.6个百分点,性能优于现有混合类方法。
LC-GRPO:通过朗之万校正弥合基于流的GRPO的训练-推理差距
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 LC-GRPO 是带朗之万校正的基于流的 GRPO 框架,通过对齐推理的 ODE 欧拉步加朗之万校正,缩小流模型训练与推理的样本差距,在多任务上提升奖励优化并保留生成质量。
面向连贯性的梦境场景可视化
机构 * School of Electronic Engineering and Computer Science, Queen Mary University of London(伦敦玛丽女王大学电子工程与计算机科学学院)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 该研究提出DSV系统,通过大型语言模型拆分梦境描述为四部分,结合文本到图像模型生成连贯的四面板图像序列,经DreamBank数据集50次可视化评估,用CLIP等模型指标验证了其质量、保真度与连贯性。
Comments short paper accepted at ICCC 2026
零样本图像描述中合成监督的实体忠实修复
机构 * Guangxi University(广西大学) ; School of Computer, Electronics and Information(计算机与电子信息学院)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 针对零样本图像描述中合成监督的实体级错位问题,提出即插即用框架ReCap,通过实体级重对齐与自适应加权策略优化合成数据,在两类基准上实现最优性能。
Comments Accepted to the 34th ACM International Conference on Multimedia (ACM MM 2026). 16 pages, 7 figures
开放集AIGC检测的测试时课程
机构 * Baidu Inc.(百度公司)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 本研究针对开放集AIGC检测的分布偏移问题,提出Test-Time Curriculum框架,结合跨尺度伪标签细化技术,构建AIGCGuard基准,经实验验证可显著提升未见生成器偏移下的检测性能。
FiRE:利用细粒度上下文学习增强多模态大语言模型(MLLMs)以实现复杂图像检索
机构 * Shandong University(山东大学) ; City University of Hong Kong(香港城市大学) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Shandong Jianzhu University(山东建筑大学)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 本研究针对MLLMs在复杂图像检索任务中细粒度建模不足的问题,提出自动化细粒度多模态五元组数据集构建流程与两阶段微调策略,在零样本设置下于五个数据集上取得优于现有方法的性能。
Journal ref Proceedings of the ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2025)
MPIE-Bench:解剖学上合理的多人交互编辑基准测试
机构 * University of Science and Technology of China(中国科学技术大学) ; Metastone Technology(元石科技)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 该研究针对多人交互编辑的解剖学与几何错误问题,构建了MPIE-Bench基准,提出MPIE-Eval评估方法,发现现有编辑模型在两个维度表现不均衡,且其评估比VLM清单更贴合人类判断。
OrganLens:用于CT基础模型的器官特异性表征学习
机构 * Rice University(莱斯大学) ; University of Washington(华盛顿大学)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 研究针对CT检查中特定器官表征需求,提出OrganLens通过自监督学习,用器官标识调节共享编码器,经器官特异性蒸馏等方法获取器官特异性表征,在多数据集评估中提升指标,提供了可扩展方法和 reusable 框架。
Comments 16 pages, 7 figures, 5 tables
MicroZoom:极端尺度下的结构保留细节合成
机构 * University of Washington(华盛顿大学)
专题命中 文生图 :image synthesis(abstract);分类 cs.CV
AI总结 MicroZoom旨在解决微观尺度下基于参考的极端尺度超分辨率问题,通过两阶段级联设计,第一阶段恢复全局图案连贯性,第二阶段细化局部纹理细节,辅以分割掩码指导合成,实现了全局连贯、基于物质的千兆像素图像合成。
Comments Project page: https://microzoom-sr.github.io/
打破合成-真实域捷径用于无训练生成重放的类增量学习
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 研究类增量学习中合成旧数据与真实新数据混合导致性能下降的问题,提出DREAM模型,利用无训练生成器合成旧数据,通过子空间校正、正交投影及真实锚定原型正则化消除域捷径并加强语义对齐,取得最优性能。
Comments Accepted by ICML 2026
NWaaS:一种具有自适应资源调度的非侵入性和隐私保护水印即服务系统
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 研究针对机器学习即服务中保护知识产权的挑战,提出NWaaS框架。核心方法包括$\mathtt{ShadowMark}$算法、协作分区机制和比例差异联合调度算法。贡献是能在多样模态中提供强大所有权验证,保障隐私并提升系统性能。
SymbOmni:通过符号概念学习进化智能全能模型
机构 * South China University of Technology(华南理工大学) ; Westlake University(西湖大学) ; Johns Hopkins University(约翰·霍普金斯大学) ; The Chinese University of Hong Kong(香港中文大学) ; Shenzhen Loop Area Institute(深圳河套学院)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 针对视觉生成模型无法累积学习与自主进化的问题,提出SymbOmni智能全能模型,通过符号概念学习和归纳-转导循环运行,经言语反向传播训练。实验验证其在多方面性能优越,能有效降低令牌消耗并实现持续学习。
Comments ECCV 2026 (49 pages, 10 figures, project page: https://spherelab.ai/symbomni)
DynEval:对自然环境下的文本到图像生成模型进行全面评估
机构 * Indian Institute of Science(印度科学研究所) ; Hugging Face(拥抱脸)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 研究针对文本到图像生成模型评估难题,提出DynEval动态评估框架,通过构建两个数据集,利用课程学习策略微调评估器,在多基准测试中与人类判断相关性更高,可对多个T2I模型进行细粒度分析。
Comments Accepted at ECCV 2026. Project page: https://vcl-iisc.github.io/dyneval/
TIIF-Bench:你的文本到图像模型如何遵循指令?
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Tsinghua University(清华大学) ; OPPO Research Institute(OPPO研究院)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 研究旨在评估T2I模型遵循指令能力,提出TIIF-Bench基准,含多维度、多难度提示及新评估指标,利用大语言模型知识开发可重现评估器,通过对主流模型测试分析其优缺点及现有基准局限性。
Comments 35 pages, 14 figures, 9 tables
超越轮椅和眼罩:使用INCLUDE - BENCH研究文本到图像模型中的残疾刻板印象
机构 * Utrecht University(乌得勒支大学)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 研究文本到图像模型中的残疾刻板印象,引入INCLUDE - BENCH基准,涵盖多维度偏见提示设计的大量图像,评估多个模型,揭示模型在残疾相关表现上的问题,如轮椅描绘占比高、多样性少等,并引入SCM分数反映刻板关联。
基于部分信息分解指导的解耦量化半UNet的多模态T1加权和FLAIR MRI生成可解释的tau-PET
机构 * Department of Mechanical Engineering, University of Washington(华盛顿大学机械工程系) ; Department of Radiology, University of Washington(华盛顿大学放射学系)
专题命中 文生图 :image synthesis(abstract);分类 cs.CV
AI总结 本文提出一种可解释的多模态图像合成框架,通过部分信息分解指导的解耦量化半UNet生成tau-PET,结合向量量化编码器和半UNet解码器,实现了在ADNI-3和OASIS-3数据集上的最佳性能。
生成内容丰富化
机构 * University of Waterloo(滑铁卢大学)
专题命中 文生图 :image synthesis(abstract);分类 cs.CV
AI总结 提出生成内容丰富化任务,通过显式场景表示丰富稀疏场景描述,再用对抗框架生成语义更丰富、结构连贯的图像。
PortraitGen: 基于示例驱动的双奖励引导GRPO的逼真肖像生成
机构 * Dalian University of Technology(大连理工大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Zhejiang University(浙江大学) ; WeChat, Tencent Inc.(腾讯微信)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 提出PortraitGen框架,通过将真实图像引入GRPO采样组并设计双奖励机制(OmniReward和AI-Portrait),有效抑制AI伪影,实现逼真肖像生成。
推进面向艺术字的场景文本识别:数据集与方法
机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) ; Shanghai Key Laboratory of Multimodal Embodied AI, Fudan University(复旦大学上海市多模态具身人工智能重点实验室) ; WeChat Vision, Tencent Inc.(腾讯微信视觉团队) ; South China University of Technology(华南理工大学)
专题命中 文生图 :image synthesis(abstract);分类 cs.CV
AI总结 针对艺术字场景文本识别(WATER)的挑战,构建了百万级合成数据集WATER-S,并提出支持任意形状输入和自回归解码的WATERec模型,在WordArt-Bench上达到90.40%准确率。
Comments Accepted by ECCV 2026
快乐年轻女性,暴躁老年男性?合成人脸生成中情绪驱动的人口统计偏见
机构 * University of Oulu(奥卢大学) ; ELLIS Alicante(阿利坎特ELLIS)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 本研究系统审计了文本到图像模型在情绪提示下生成人脸的人口统计偏见,发现模型过度代表年轻面孔和白人特征,负面情绪提示加剧了特定群体的缺失,并降低了感知吸引力。
Comments 39 pages, 16 figures, 24 tables
基于血管概率引导衰减学习的稀疏视角动态DSA图像三维血管重建
机构 * School of Biomedical Engineering \& State Key Laboratory of Advanced Medical Materials ; Devices, ShanghaiTech University, Shanghai, China ; National Engineering Research Center for Multimedia Software, School of Computer Science, Wuhan University, Wuhan, China ; School of Electronic Information ; Communications, Huazhong University of Science ; Department of Computer Science \& Engineering, Texas A\&M University, USA
专题命中 文生图 :image synthesis(abstract);分类 cs.CV
AI总结 提出血管概率引导衰减学习框架,通过静态与动态衰减场互补加权实现稀疏视角DSA重建,降低辐射剂量,并采用渐进训练和时间扰动损失提升质量。
Comments Accepted by Medical Image Analysis (MedIA), 2026; code: https://github.com/ShanghaiTech-IMPACT/VPAL
MapDream: 面向视觉-语言导航的任务驱动地图学习
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 文生图 :image synthesis(abstract);分类 cs.CV
AI总结 提出MapDream框架,通过自回归鸟瞰图生成联合学习地图与动作预测,在R2R-CE和RxR-CE上达到单目最优性能。
Pix2Pix-Hybrid: 结构引导的多通道条件与弱属性监督的朝觐人群图像条件合成
机构 * King Abdulaziz University(阿卜杜勒阿齐兹国王大学) ; Jouf University(焦夫大学)
专题命中 文生图 :image synthesis(abstract);分类 cs.CV
AI总结 提出Pix2Pix-Hybrid条件GAN,通过多通道结构线索和上下文属性条件合成朝觐人群图像,用于数据增强,在减少人工标注的同时提升合成质量,并验证了合成数据对人群计数模型的改进效果。
MirrorCheck: 视觉-语言模型的高效对抗防御
机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫扎伊德大学人工智能大学) ; NVIDIA ; École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) ; Michigan State University(密歇根州立大学)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 提出MirrorCheck框架,利用文本到图像模型和随机化策略检测并防御针对视觉-语言模型的自适应对抗攻击。
MCR-VQGAN:一种用于阿尔茨海默病成像的可扩展且经济高效的Tau PET合成方法
机构 * Department of Biomedical Engineering, Wake Forest University School of Medicine(生物医学工程系,威克森林大学医学院) ; Department of Radiology, Wake Forest School of Medicine(放射学系,威克森林医学院) ; Department of Radiology and Biomedical Imaging, Yale School of Medicine(放射学与生物医学成像系,耶鲁医学院)
专题命中 文生图 :image synthesis(abstract);分类 cs.CV
AI总结 提出MCR-VQGAN模型,通过多尺度卷积、ResNet块和CBAM模块改进VQGAN,从T1加权MRI合成高保真tau PET图像,在ADNI数据集上优于cGAN等方法,且合成图像保留诊断特征,区域SUVR等效分析显示与真实图像高度一致。
Comments Accepted for publication in IEEE Access. 14 pages, 5 figures, 8 tables
双域等变生成对抗网络用于多模态CT-PET合成
专题命中 文生图 :image synthesis(abstract);分类 cs.CV
AI总结 提出双域等变生成对抗网络(DDE-GAN),联合空间与频域学习并融入旋转等变性,实现高保真多模态CT-PET图像合成。
Comments 4 pages, 3 figures, 1 table, 2026 IEEE 23rd International Symposium on Biomedical Imaging (ISBI)
基于跨图像多对比度特征记忆库检索增强的分割辅助脑MRI合成
机构 * South China University of Technology(华南理工大学) ; University of Technology Sydney(悉尼科技大学)
专题命中 文生图 :image synthesis(abstract);分类 cs.CV
AI总结 提出分割辅助的闭环生成对抗框架,通过辅助分割分支和双库检索增强策略,提高多对比度脑MRI中肿瘤区域的合成保真度。
你能相信你所见的吗?人类与AI对合成法律证据的检测
机构 * Faculty of Law, McGill University(麦吉尔大学法学院)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 研究人类和前沿多模态大模型在民事纠纷场景中区分真实照片与AI生成图像的能力,发现两者均不可靠,提出结合人工审查、MLLM筛查和来源认证的解决方案。