Reliable and Responsible Foundation Models: A Comprehensive Survey
可靠且负责任的基础模型:全面综述
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 本文综述了基础模型的可靠和负责任发展,探讨了偏见、安全、不确定性等关键问题,并提出了未来研究方向。
Comments TMLR camera-ready version
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
可靠且负责任的基础模型:全面综述
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 本文综述了基础模型的可靠和负责任发展,探讨了偏见、安全、不确定性等关键问题,并提出了未来研究方向。
Comments TMLR camera-ready version
PromptSplit: 暴露生成模型中的提示级分歧
机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(计算机科学与工程系,香港中文大学)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 PromptSplit通过核方法检测生成模型在提示层面的分歧,提供可解释的分析工具以识别模型行为差异。
AI生成的数据污染侵蚀病理变异性与诊断可靠性
专题命中 文生图 :image synthesis(abstract);分类 cs.CV
AI总结 AI生成的数据污染导致病理变异性下降和诊断可靠性降低,需政策强制的人类监督以防止医疗数据生态系统的退化。
Comments *Corresponding author: Dianbo Liu (dianbo@nus.edu.sg)
序列到序列生成神经渲染的扩展
机构 * Meta AI
专题命中 文生图 :image synthesis(abstract);分类 cs.CV
AI总结 Kaleido通过统一的解码器-only rectified flow transformer实现了序列到序列生成神经渲染的扩展,能够在无显式3D表示的情况下生成多视角视图,并在多个视图设置中达到与场景优化方法相当的性能。
Comments Published at ICLR 2026. Project Page: https://shikun.io/projects/kaleido
对MRI重建中Vanilla GAN、DCGAN和WGAN架构进行基准测试:一项定量分析
专题命中 文生图 :image synthesis(abstract);分类 cs.CV
AI总结 本研究通过定量分析比较了Vanilla GAN、DCGAN和WGAN在MRI重建中的性能,发现DCGAN和WGAN在图像质量和准确性方面表现更优。
Comments 20 pages
Journal ref Edelweiss Applied Science and Technology January 2026
一种视觉隐喻的计算方法
机构 * University of Cincinnati(辛辛那提大学)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 本文提出了一种基于符号学理论的计算方法,通过构建ViMET数据集评估多模态语言模型在理解视觉隐喻方面的认知推理能力,并揭示了机器在处理间接视觉参考上的局限性。
Comments EACL 2026
理解视觉基础模型的迁移限制
机构 * University College London(伦敦大学学院)
专题命中 文生图 :image synthesis(abstract);分类 cs.CV
AI总结 本文研究了视觉基础模型在迁移时的限制,发现预训练目标与下游任务需求的匹配程度影响迁移性能,提出通过改进预训练目标以提升模型效果。
Comments accepted in ISBI 2026
不确定性引导的暗场放射图像生成
专题命中 文生图 :image synthesis(abstract);分类 cs.CV
AI总结 本文提出基于不确定性引导的生成对抗网络,从标准衰减X光片生成暗场图像,提升图像生成的可解释性和可靠性。
聚合多样化线索专家用于AI生成图像检测
专题命中 文生图 :image synthesis(abstract);分类 cs.CV
AI总结 本文提出MCAN框架,通过整合多种互补线索提升AI生成图像检测的泛化能力,实验显示在GenImage数据集上性能优于现有方法。
Comments Accepted by AAAI 2026
通过伪标签解混和合成辅助学习提升重叠类器官实例分割
机构 * School of Biomedical Engineering, Sun Yat-sen University(中山大学生物医学工程学院) ; Peng Cheng Laboratory(鹏城实验室) ; The First Affiliated Hospital of Shenzhen University, Shenzhen Second People's Hospital(深圳大学第一附属医院、深圳第二人民医院) ; The Research Center of Clinical Medicine, Affiliated Hospital of Nantong University, Medical School of Nantong University(临床医学研究中心、南通大学附属医院、南通大学医学院) ; Cixi Institute of Biomedical Engineering, Ningbo Institute of Materials Technology and Engineering, Chinese Academy of Sciences(慈溪生物医学工程研究所、宁波材料技术与工程研究所、中国科学院)
专题命中 文生图 :image synthesis(abstract);分类 cs.CV
AI总结 本文提出通过伪标签解混和合成辅助学习提升类器官实例分割,解决重叠问题,实现高效率的标注数据利用。
多任务跨模态学习用于胸部X射线图像检索
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 本文提出多任务学习框架,通过改进BiomedCLIP模型,提升胸部X射线图像与文本的跨模态检索性能。
UniCorn:通过自生成监督实现自我改进的统一多模态模型
机构 * MoE Key Lab of BIPC, USTC(脑智能基础与应用联合实验室,中国科学技术大学) ; FDU(复旦大学) ; ECNU(华东师范大学) ; CUHK(香港中文大学) ; NJU(南京大学) ; SUDA(上海大学)
专题命中 文生图 :image generation(abstract);分类 cs.CV
AI总结 UniCorn通过自生成监督实现统一多模态模型的自我改进,提升多模态生成质量与理解能力。
CoFi-Dec:通过粗到细的生成反馈在大视觉-语言模型中实现抗幻觉解码
机构 * Researcher(研究者)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 CoFi-Dec通过粗到细的生成反馈机制,在大视觉-语言模型中减少幻觉,提升解码的鲁棒性和准确性。
终端条目目标检测在工业应用中的合成训练数据影响研究
专题命中 文生图 :image synthesis(abstract);分类 cs.CV
AI总结 本文研究了终端条目目标检测中合成训练数据的影响,通过合成图像与真实数据结合,验证了DINO模型在复杂工业环境中的高效检测性能。
VA-$π$: 变分策略对齐用于像素感知自回归生成
机构 * Huazhong University of Science & Technology(华中科技大学) ; National University of Singapore(新加坡国立大学)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 VA-$π$通过变分优化和像素空间目标提升自回归生成的质量和多样性。
Comments 21 pages, 24 figures
RMLer: 通过强化混合学习跨多样类别合成新物体
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 RMLer通过强化混合学习框架,有效解决跨类别文本到图像生成中的概念混合问题,提升合成物体的连贯性和保真度。
Comments accepted by AAAI2026
实例级组合图像检索
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 BASIC通过无训练方法利用预训练视觉-语言模型,在实例级组合图像检索中实现了新的状态。
Comments NeurIPS 2025
使用可微奖励对3D纹理生成进行端到端微调
机构 * Mila – Quebec AI Institute(魁北克AI研究所) ; Concordia University(康科迪亚大学)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 本文提出了一种端到端的可微框架,通过可微奖励函数优化3D纹理生成,提升对3D结构的理解和生成质量。
CoCoIns: 通过对比实例概念实现一致主体生成
机构 * University of California, Merced(加州大学默塞德分校) ; Google DeepMind(谷歌DeepMind)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 CoCoIns通过对比学习实现一致主体生成,提升多生成内容的一致性与灵活性。
Comments TMLR 2025. Project page: https://contrastive-concept-instantiation.github.io
SYNTHIA:基于功能连贯性的新型概念设计
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of California Los Angeles(加州大学洛杉矶分校)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 SYNTHIA通过分层概念本体和课程学习方案,实现基于功能连贯性的新颖设计生成。
Comments ACL 2025 Main, Code is available https://github.com/HyeonjeongHa/SYNTHIA
重新思考推理时的提示设计以实现文本到视觉生成的扩展
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 PRIS通过自适应修改提示以实现文本到视觉生成的推理时扩展,提高生成质量并解决提示固定导致的质量停滞问题。
Comments Visualizations are available at the website: https://subin-kim-cv.github.io/PRIS
基于成语的视觉双关:一个迭代的LLM-T2IM-MLLM框架
机构 * Dalian University of Technology(大连理工大学) ; Xinjiang Normal University(新疆师范大学)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 本文提出一个迭代框架,结合LLM、T2IM和MLLM,实现基于成语的视觉双关的自动生成与评估,实验表明MLLM选择对性能影响最大。
Comments Submitted to ICASSP 2026 (under review)
IntrinsiX: 基于图像先验的高质量PBR生成
机构 * Technical University of Munich(慕尼黑技术大学)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 IntrinsiX通过图像先验生成高质量PBR图像,提升内容创作中的重新照明和纹理生成能力。
Comments Project page: https://peter-kocsis.github.io/IntrinsiX/ Video: https://youtu.be/b0wVA44R93Y
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
Comments 9 pages, 4 figures, accepted by AAAI 2026
机构 * MIT(麻省理工学院)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
机构 * Harvard University(哈佛大学) ; MIT(麻省理工学院) ; Cornell University(康奈尔大学)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
机构 * Cornell Tech(康奈尔科技) ; Cornell University(康奈尔大学) ; Department of Radiology, Stanford University(斯坦福大学放射科) ; Oxford University(牛津大学) ; Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey(视觉、语音和信号处理中心(CVSSP)、塞维利亚大学)
专题命中 文生图 :image synthesis(abstract);分类 cs.CV
机构 * Department of Robotics, University of Michigan(机器人学系,密歇根大学)
专题命中 文生图 :image synthesis(abstract);分类 cs.CV
机构 * University of Maryland, College Park(马里兰大学学院公园分校) ; University of Pennsylvania(宾夕法尼亚大学) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; University of Michigan(密歇根大学) ; University of Southern California(南加州大学)
专题命中 文生图 :image synthesis(abstract);分类 cs.CV
Comments Project Page: https://roverbench.github.io/
机构 * University of Siena, Department of Information Engineering and Mathematics(锡耶纳大学信息工程与数学系) ; IMT School(IMT学院)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
Comments 14 pages, 4 figures, 1 table, accepted at "The 17th IEEE INTERNATIONAL WORKSHOP ON INFORMATION FORENSICS AND SECURITY (WIFS2025)", Perth, Australia