arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86714 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3486 篇

2601.04498 2026-06-09 cs.LG cs.CV 版本更新 57%

IGenBench: Benchmarking the Reliability of Text-to-Infographic Generation

IGenBench:文本到信息图生成可靠性基准测试

Yinghao Tang, Xueding Liu, Boyuan Zhang, Tingfeng Lan, Yupeng Xie, Jiale Lao, Yiyao Wang, Haoxuan Li, Tingting Gao, Bo Pan, Luoxuan Weng, Xiuqi Huang, Minfeng Zhu, Yingchaojie Feng, Yuyu Luo, Wei Chen

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室) UESTC University of Virginia(弗吉尼亚大学) HKUST(GZ)(香港科技大学(广州)) Cornell University(康奈尔大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 提出IGENBENCH基准,包含30种信息图类型和600个测试用例,通过多模态大语言模型分解为10类原子问题评估10种T2I模型,发现数据完整性等维度是普遍瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06828 2026-06-08 cs.CV cs.LG 新提交 57%

AdaGRPO: A Capability-Aware Adaptive Enhancement for Flow-based GRPO

AdaGRPO: 一种面向基于流的GRPO的能力感知自适应增强方法

Jiazi Bu, Pengyang Ling, Yujie Zhou, Yibin Wang, Yuhang Zang, Tianyi Wei, Xiaohang Zhan, Jiaqi Wang, Tong Wu, Xingang Pan, Dahua Lin

机构 * Shanghai Jiao Tong University(上海交通大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室) Shanghai AI Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Stanford University(斯坦福大学) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) CPII under InnoHK(InnoHK下的CPII) Adobe Research(Adobe研究)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 提出AdaGRPO,通过在线课程过滤策略和跨层级优势融合,解决流模型GRPO中提示选择随机和优势估计缺乏全局视角的问题,提升训练稳定性和性能。

Comments Project Website: https://bujiazi.github.io/adagrpo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05949 2026-06-08 cs.CV 版本更新 57%

Faithful, Enriched, and Precise: Benchmarking Natural-Science Illustration Generation by T2I models

忠实、丰富且精确:T2I模型在自然科学插图生成中的基准测试

Yifan Chang, Jiaxin Ai, Jianwen Sun, Yuandong Pu, Siqi Luo, Liangliang Zhao, Yuchen Ren, Minghao Liu, Yunfei Yu, Yu Qiao, Kaipeng Zhang, Yihao Liu

机构 * Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Wuhan University(武汉大学) Nankai University(南开大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) ZODA Alaya Studio(Alaya工作室)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 提出FEPBench基准,通过细粒度原子集标注和三维评估(指令忠实性、推理丰富性、语义精确性)系统评估T2I模型在自然科学插图生成中的表现,发现即使最先进的闭源模型仍存在文本渲染瓶颈、推理丰富性有限以及生成丰富性与精确性难以平衡的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05491 2026-06-05 cs.CV cs.RO 57%

Unpaired RGB-Thermal Gaussian-Splatting Using Visual Geometric Transformers

无配对RGB-热成像高斯泼溅使用视觉几何变换器

Jean Cordonnier, Chenghao Xu, Olga Fink, Malcolm Mielle

机构 * Ecole Polytechnique Federale de Lausanne(瑞士联邦理工学院洛桑分校) Schindler EPFL Lab(施耐德EPFL实验室)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 提出一种无配对RGB-热成像新视角合成框架,利用VGGT估计各模态相机位姿并通过Procrustes对齐,结合多模态3D高斯泼溅实现联合重建,在保持RGB保真度的同时实现热成像视图合成。

Comments Accepted at ICRA 2026's Workshop MM-SpatialAI: Multi-Modal Spatial AI for Robust Navigation and Open-World Understanding

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04479 2026-06-04 cs.CV cs.AI cs.CL 57%

Evaluating Reasoning Fidelity in Visual Text Generation

评估视觉文本生成中的推理保真度

Jiajun Hong, Jiawei Zhou

机构 * Stony Brook University(石桥大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 通过长文本渲染、事实知识探测、上下文理解和多步推理等任务,评估当前文本到图像模型在视觉文本生成中是否忠实保持推理能力,发现其常产生语义错误和逻辑不一致,与纯文本模型存在显著差距。

Comments Peer reviewed and accepted at CVPR 2026 at the GRAIL-V (Grounded Retrieval and Agentic Intelligence for Vision-Language) workshop (non-archival track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20807 2026-06-02 cs.CV cs.RO 57%

RU4D-SLAM: Reweighting Uncertainty in Gaussian Splatting SLAM for 4D Scene Reconstruction

RU4D-SLAM:面向4D场景重建的高斯溅射SLAM不确定性重加权

Yangfan Zhao, Hanwei Zhang, Ke Huang, Qiufeng Wang, Zhenzhou Shao, Dengyu Wu

机构 * Capital Normal University(首都师范大学) Saarland University(萨尔兰大学) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) King’s College London(伦敦国王学院)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 提出RU4D-SLAM框架,通过引入时间因子、不确定性感知和语义引导重加权机制,解决动态环境中3D高斯溅射SLAM的跟踪与4D场景重建问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24078 2026-06-02 cs.CV 57%

Beyond Objects: Contextual Synthetic Data Generation for Fine-Grained Classification

超越对象:面向细粒度分类的上下文合成数据生成

William Yang, Xindi Wu, Zhiwei Deng, Esin Tureci, Olga Russakovsky

机构 * Princeton University(普林斯顿大学) Google DeepMind(谷歌DeepMind)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 提出BOB微调策略,通过提取并条件化类不可知属性(如场景背景和物体姿态)来缓解过拟合,提升细粒度分类中合成训练数据的质量,在多个数据集上达到最优性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31302 2026-06-01 eess.IV cs.CV eess.SP 57%

MoE-dqINR: A Unified Mixture-of-Experts Implicit Neural Representation Framework for Scan-Specific Dynamic and Quantitative MRI Reconstruction

MoE-dqINR:用于特定扫描动态和定量MRI重建的统一混合专家隐式神经表示框架

Yinzhe Wu, Fanwen Wang, Zhenxuan Zhang, Zi Wang, Chengyan Wang, Guang Yang

机构 * Department of Bioengineering and I-X, Imperial College London(生物工程系和I-X,帝国理工学院伦敦分校) Cardiovascular Research Centre, Royal Brompton Hospital(心脏血管研究中心,皇家布隆特医院) National Heart and Lung Institute, Imperial College London(国家心脏和肺研究所,帝国理工学院伦敦分校) School of Biomedical Engineering & Imaging Sciences, King’s College London(生物医学工程与成像科学学院,伦敦国王学院) Shanghai Pudong Hospital and Human Phenome Institute, Fudan University(上海浦东医院和人类表型研究所,复旦大学) International Human Phenome Institute (Shanghai), Shanghai, China(国际人类表型研究所(上海),上海,中国)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 提出MoE-dqINR框架,通过共享空间专家和状态条件路由路径,实现高效、统一的特定扫描多线圈动态和定量MRI重建,优化时间约30秒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29891 2026-05-29 cs.CV 57%

DVSM: Decoder-only View Synthesis Model Done Right

DVSM: 正确的仅解码器视图合成模型

Cheng Sun, Jaesung Choe, Min-Hung Chen, Ryo Hachiuma, Yu-Chiang Frank Wang

机构 * NVIDIA National Taiwan University(国立台湾大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 提出仅解码器架构DVSM,通过隐式KV-cache表示场景,在相同渲染复杂度下以更少参数超越编码器-解码器变体,并利用共享权重、基础模型先验和分阶段块大小优化效率与质量,在多个基准上实现新视点合成的最优结果。

Comments Code at https://github.com/NVLabs/dvsm

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05729 2026-05-27 cs.CV 57%

TAGRPO: Boosting GRPO on Image-to-Video Generation with Direct Trajectory Alignment

TAGRPO: 通过直接轨迹对齐提升图像到视频生成中的GRPO

Jin Wang, Jianxiang Lu, Guangzheng Xu, Comi Chen, Haoyu Yang, Linqing Wang, Peng Chen, Mingtao Chen, Zhichao Hu, Longhuang Wu, Shuai Shao, Qinglin Lu, Ping Luo

机构 * The University of Hong Kong(香港大学) Tencent Hunyuan(腾讯文心)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 针对图像到视频生成中GRPO优化效果不佳的问题,提出基于对比学习的TAGRPO框架,通过中间潜变量对齐高奖励轨迹并远离低奖励轨迹,结合记忆库提升多样性,显著优于DanceGRPO。

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25479 2026-05-26 cs.CV 57%

MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models

MAIL++: 视觉语言模型的多模态双向智能体层

Kaixiang Chen, Pengfei Fang, Hui Xue

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其交叉应用国家重点实验室(东南大学),中华人民共和国教育部,中国)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 提出MAIL/MAIL++方法,通过将跨模态耦合嵌入VLM内在计算模块并引入双向桥接,实现参数高效微调,在少样本分类和跨域检索中超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24687 2026-05-26 cs.CV cs.AI 57%

HoloFair: Unified T2I Fairness Evaluation and Fair-GRPO Debiasing

HoloFair: 统一的T2I公平性评估与Fair-GRPO去偏

Ruyi Chen, Lu Zhou, Xiaogang Xu, Chiyu Zhang, Jiafei Wu, Liming Fang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) School of Software Technology, Zhejiang University, Ningbo, China(浙江大学宁波校区软件学院) Ningbo Global Innovation Center, Zhejiang University, Ningbo, China(浙江大学宁波全球创新中心) Collaborative Innovation Center of Novel Software Technology and Industrialization(新型软件技术与产业化协同创新中心)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 提出HoloFair基准框架,通过多属性组间偏差指数(MGBI)评估文本到图像模型的公平性,并引入基于强化学习的Fair-GRPO方法进行去偏,在SD3.5-Medium模型上显著提升多维公平性且保持图像质量。

Comments Accepted to ICML 2026. Code and dataset are available at https://github.com/1059684669/HoloFair

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08039 2026-05-14 cs.CV cs.AI cs.LG 57%

LINE: LLM-based Iterative Neuron Explanations for Vision Models

LINE:基于语言模型的视觉模型迭代神经元解释

Vladimir Zaigrajew, Michał Piechota, Gaspar Sekula, Paweł Gelar, Przemysław Biecek

机构 * Centre for Credible AI(可信AI中心) Warsaw University of Technology(华沙理工大学) University of Warsaw, Poland(波兰华沙大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 LINE提出一种无需训练的迭代方法,通过大语言模型和图像生成器,在黑盒环境下闭环提出和优化概念,提升视觉模型的开放词汇概念标注性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12517 2026-05-14 cs.CL cs.AI cs.CV 57%

Bridging the Missing-Modality Gap: Improving Text-Only Calibration of Vision Language Models

弥合缺失模态的差距:改进纯文本校准的视觉语言模型

Mingyeong Kim, Jungwon Choi, Chaeyun Jang, Juho Lee

机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本文提出Latent Imagination Module,通过预测文本输入的潜在嵌入来提升纯文本环境下视觉语言模型的准确性和校准性能。

Comments 9 pages, 16 figures. Accepted at the ICLR 2026 Workshop on Principled Design for Trustworthy AI: Interpretability, Robustness, and Safety across Modalities

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12112 2026-05-13 cs.CV 57%

When Policy Entropy Constraint Fails: Preserving Diversity in Flow-based RLHF via Perceptual Entropy

当策略熵约束失效时:通过感知熵在基于流的RLHF中保持多样性

Xiaofeng Tan, Jun Liu, Bin-Bin Gao, Yuanting Fan, Xi Jiang, Chengjie Wang, Hongsong Wang, Feng Zheng

机构 * Southeast University(东南大学) Tencent Youtu Lab(腾讯云图实验室) Southern University of Science and Technology(南方科技大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文研究了基于流的RLHF中策略熵与多样性之间的关系,提出感知熵作为新的约束方法,通过在感知空间中保持多样性提升模型质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01675 2026-05-13 cs.CV 57%

GRASP: Guided Residual Adapters with Sample-wise Partitioning

GRASP:基于样本划分的引导残差适配器

Felix Nützel, Mischa Dombrowski, Bernhard Kainz

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(埃朗根-纽伦堡弗里德里希-亚历山大大学) Imperial College London(伦敦帝国理工学院)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 GRASP通过样本层面的划分和残差适配器提升长尾场景下的生成质量与多样性,有效解决传统方法在长尾设置中的性能下降问题。

Comments 16 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08836 2026-05-12 cs.MM 57%

Accelerating Multi-Condition T2I Generation via Adaptive Condition Offloading and Pruning

通过自适应条件卸载和剪枝加速多条件T2I生成

Yuxin Kong, Peng Yang, Chongbin Yi, Fan Wu, Feng Lyu

专题命中 文生图 :text-to-image(abstract);分类 cs.MM

AI总结 本文提出一种端边协作系统,通过自适应条件卸载和剪枝减少多条件T2I生成的延迟并提升生成质量。

Comments accepted by IEEE ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08493 2026-05-12 cs.CV 57%

CapCLIP: A Vision-Language Representation Alignment Approach for Wireless Capsule Endoscopy Analysis

CapCLIP:一种用于无线胶囊内镜分析的视觉-语言表示对齐方法

Haroon Wahab, Irfan Mehmood, Hassan Ugail

机构 * School of Computer Science, AI and Electronics Faculty of Engineering and Digital Technologies(计算机科学与电子工程学院,工程与数字技术学院) School of Management Faculty of Mgmt, Law & Social Sciences(管理学院,管理、法律与社会科学学院) Centre for Visual Computing and Intelligent Systems(视觉计算与智能系统中心)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 CapCLIP通过将内镜图像与临床标准术语生成的文本描述对齐,提升无线胶囊内镜分析的泛化能力和语义解释性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04676 2026-05-11 cs.CV cs.AI 57%

Decoding the Pulse of Reasoning VLMs in Multi-Image Understanding Tasks

解码多图像理解任务中推理视觉语言模型的脉冲

Chenjun Li

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出PulseFocus方法,通过规划和聚焦块结构及软注意力门控,提升多图像推理任务性能,实现在BLINK和MuirBench上分别提升3.7%和1.07%。

Comments This article is withdrawn because the experimental results and analysis require substantial revision. The current version should not be cited as a reliable representation of the work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06143 2026-05-08 cs.CV cs.AI 57%

AI-Generated Images: What Humans and Machines See When They Look at the Same Image

AI生成图像:当人类和机器注视同一张图像时的所见

Silvia Poletti, Justin Ilyes, Marcel Hasenbalg, David Fischinger, Martin Boyer

机构 * Austrian Institute of Technology(奥地利技术研究院)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文探讨了如何通过多种架构和微调策略开发更有效的AI生成图像检测器,提供人类可理解的解释。研究基于大规模逼真伪造图像数据集,评估了最新文本到图像AI生成器的性能,并整合16种可解释AI方法,通过调查100名参与者收集的文本和视觉反馈,优化解释清晰度。

Comments Included in the main conference proceedings published by Springer Nature (CCIS Series)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25636 2026-04-29 cs.CV 57%

Refinement via Regeneration: Enlarging Modification Space Boosts Image Refinement in Unified Multimodal Models

通过再生进行细化:扩大修改空间提升统一多模态模型中的图像细化

Jiayi Guo, Linqing Wang, Jiangshan Wang, Yang Yue, Zeyu Liu, Zhiyuan Zhao, Qinglin Lu, Gao Huang, Chunyu Wang

机构 * Tsinghua University(清华大学) Tencent HY(腾讯HY)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出通过再生进行细化的新框架,通过扩大修改空间提升统一多模态模型的图像细化效果,实验表明在多个基准测试中性能显著提升。

Comments GitHub: https://github.com/LeapLabTHU/RvR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08598 2026-04-28 cs.IR cs.CV 57%

Pretrain-then-Adapt: Uncertainty-Aware Test-Time Adaptation for Text-based Person Search

预训练后再适应:面向基于文本的人脸搜索的不确定性感知测试时间适应

Jiahao Zhang, Shaofei Huang, Yaxiong Wang, Zhedong Zheng

机构 * University of Macau(澳门大学) Hefei University of Technology(合肥工业大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出一种预训练后再适应方法,通过离线测试时间适应减少对目标域标注数据的依赖,引入不确定性感知测试时间适应框架以提升人像搜索系统的鲁棒性和效率。

Comments Accepted to ACM SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21523 2026-04-24 cs.CV cs.CL 57%

Seeing Isn't Believing: Uncovering Blind Spots in Evaluator Vision-Language Models

看到并不等于相信:揭示评估者视觉-语言模型的盲区

Mohammed Safi Ur Rahman Khan, Sanjay Suryanarayanan, Tushar Anand, Mitesh M. Khapra

机构 * Nilekani Centre at AI4Bharat(AI4Bharat的Nilekani中心) Indian Institute of Technology Madras(印度理工学院马德拉斯分校) BITS Pilani, Hyderabad(海得拉巴 BITS学院)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文系统评估了评估者视觉-语言模型在I2T和T2I任务中的可靠性,通过引入针对性扰动测试其在对象幻觉、空间推理等关键错误维度上的检测能力,发现当前模型存在显著盲区。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19976 2026-04-23 cs.CV 57%

Lucky High Dynamic Range Smartphone Imaging

幸运高动态范围智能手机成像

Baiang Li, Ruyu Yan, Ethan Tseng, Zhoutong Zhang, Adam Finkelstein, Jiawen Chen, Felix Heide

机构 * Princeton University(普林斯顿大学) Adobe(Adobe公司)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本文提出一种基于轻量级网络的智能手机成像方法,通过线性RAW像素间接捕捉高动态范围,避免幻觉伪影,验证了其在合成和真实图像上的泛化能力。

Comments 13 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11314 2026-04-21 cs.CV cs.CL 57%

CROC: Evaluating and Training T2I Metrics with Pseudo- and Human-Labeled Contrastive Robustness Checks

CROC:通过伪标签和人工标注的对比鲁棒性检查评估和训练T2I度量

Christoph Leiter, Yuki M. Asano, Margret Keuper, Steffen Eger

机构 * University of Mannheim(曼海姆大学) University of Technology Nuremberg(纽伦堡技术大学) Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息研究所,萨尔兰信息校园)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出CROC框架,通过合成对比测试案例评估和训练T2I度量,生成超过100万对对比提示-图像对的伪标签数据集,并训练出CROCScore指标,展示其在开放源方法中的最佳性能。

Comments pre-MIT Press publication version; Accepted at TACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13305 2026-04-16 cs.CV 57%

Bias at the End of the Score

评分末尾的偏见

Salma Abdel Magid, Grace Guo, Esin Tureci, Amaya Dharmasiri, Vikram V. Ramaswamy, Hanspeter Pfister, Olga Russakovsky

机构 * Princeton University(普林斯顿大学) Harvard University(哈佛大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 研究揭示奖励模型在文本到图像生成中因编码人口偏见导致性别和种族刻板印象强化及多样性崩溃的问题。

Comments Accepted to The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05217 2026-04-14 cs.CV 57%

Organizing Unstructured Image Collections using Natural Language

用自然语言组织无结构图像集合

Mingxuan Liu, Zhun Zhong, Jun Li, Gianni Franchi, Subhankar Roy, Elisa Ricci

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) ENSTA Paris, Institut Polytechnique de Paris(巴黎高等先进技术学院,巴黎综合理工学院) Hefei University of Technology(合肥工业大学) University of Bergamo(贝加莫大学) Technical University of Munich(慕尼黑工业大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出OpenSMC任务,通过自然语言发现图像的多种语义聚类标准,并实现自动组织。X-Cluster框架通过文本推理代理,发现多种聚类标准并生成有意义的簇。

Comments Accepted to CVPR 2026 Findings. Project page: https://oatmealliu.github.io/xcluster.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09531 2026-04-13 cs.CV cs.AI cs.CL 57%

VisionFoundry: Teaching VLMs Visual Perception with Synthetic Images

VisionFoundry: 通过合成图像教授VLMs的视觉感知

Guanyu Zhou, Yida Yin, Wenhao Chai, Shengbang Tong, Xingyu Fu, Zhuang Liu

机构 * Princeton University(普林斯顿大学) New York University(纽约大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出VisionFoundry,通过任务关键词生成合成数据,提升VLMs在空间理解和视角识别等视觉感知任务上的性能,构建了包含10k图像-问题-答案三元组的VQA数据集,并在多个基准测试中取得显著提升。

Comments Project Page: https://zlab-princeton.github.io/VisionFoundry/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08008 2026-04-10 cs.CV cs.AI cs.LG 57%

SearchAD: Large-Scale Rare Image Retrieval Dataset for Autonomous Driving

SearchAD:大规模稀有图像检索数据集用于自动驾驶

Felix Embacher, Jonas Uhrig, Marius Cordts, Markus Enzweiler

机构 * Mercedes-Benz AG(梅赛德斯-奔驰集团) Institute for Intelligent Systems, Esslingen University of Applied Sciences(埃斯林根应用技术大学智能系统研究所)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 SearchAD为自动驾驶提供大规模稀有图像检索数据集,包含423k帧和513k个标注框,针对稀有类别检索问题,支持文本到图像和图像到图像检索及少样本学习。

Comments To be published in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06285 2026-04-09 cs.CR cs.AI cs.CV 57%

Harnessing Hyperbolic Geometry for Harmful Prompt Detection and Sanitization

利用双曲几何进行有害提示检测与净化

Igor Maljkovic, Maria Rosaria Briglia, Iacopo Masi, Antonio Emanuele Cinà, Fabio Roli

机构 * University of Genoa(热那亚大学) Sapienza University of Rome(罗马大学) University of Cagliari(卡利亚里大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本文提出HyPE和HyPS方法,利用双曲几何空间检测和净化有害提示,提升视觉语言模型的安全性与鲁棒性。

Comments Paper accepted at ICLR 2026. Webpage available at: https://hype-vlm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏