arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 250 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 250 篇

2608.07535 2026-08-11 cs.LG cs.AI cs.CY 新提交 73%

Evolving Safety Landscape of Multi-modal Large Language Models: A Survey of Emerging Threats and Safeguards

多模态大语言模型的演进安全态势:新兴威胁与防护措施综述

Xi Li, Shu Zhao, Xiaohan Zou, Fei Zhao, Fuxiao Liu, Yusen Zhang, Cheng Han, Yushun Dong, Jiaqi Wang

机构 * University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) NVIDIA(英伟达公司) Penn State University(宾夕法尼亚州立大学) Columbia University(哥伦比亚大学) University of Missouri-Kansas City(密苏里大学堪萨斯分校) Florida State University(佛罗里达州立大学) Auburn University(奥本大学)

专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本综述针对多模态大语言模型(MLLMs)的新型安全威胁,提出多模态安全威胁分类法,梳理安全策略进展,探讨未来安全机制的研究方向。

Comments Accepted at the ICLR 2026 Workshop on Principled Design for Trustworthy AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24017 2026-07-28 cs.CV cs.AI 新提交 73%

Disentangling Semantic Attention from Structural Bias in the Attention Manifold

在注意力流形中分离语义注意力与结构偏差

Pengkun Jiao, Bin Zhu, Jingjing Chen, Yu-gang Jiang

机构 * Fudan University(复旦大学) Singapore Management University(新加坡管理大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 研究多模态大语言模型中注意力机制对无信息视觉 tokens 关注过多的问题,提出无需训练的 SPAR 方法,通过净化噪声和重分配注意力,有效恢复真实视觉基础且计算开销小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22745 2026-07-28 cs.CV cs.AI 新提交 73%

AI-generated Images Challenge Visual Trust in High-risk Scenarios

人工智能生成的图像在高风险场景中挑战视觉信任

Yi-Zhi Wang, Yichen Xiao, Linan Yue, Weibo Gao, Yichao Du, Pengfei Fang, Shimin Di, Min-Ling Zhang

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 研究聚焦人工智能生成图像在高风险场景下对视觉信任的挑战,提出SafeIMG基准,涵盖12个安全场景。评估专门探测器和视觉语言模型,发现它们检测可靠性不足,模型解释覆盖低,表明当前探测器在多方面欠缺,难以可靠评估此类图像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22716 2026-07-28 cs.CV cs.LG 新提交 73%

Visual Token Compression Enhances Robustness of MLLMs

视觉令牌压缩增强多模态大语言模型的鲁棒性

Shishen Gu, Jiequan Cui, Wenbo Hu, Zenglin Shi, Zhenzhen Hu, Richang Hong

机构 * Hefei University of Technology(合肥工业大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV、cs.LG

AI总结 研究如何增强多模态大语言模型的鲁棒性,核心方法是通过测量视觉令牌与语言特征空间的距离来识别并剪枝分布外视觉令牌,该方法能有效防御越狱攻击、减轻幻觉,提升模型在通用数据集上的表现。

Comments 20 pages, 16 figures. Accepted at ACM Multimedia 2026. Code: https://github.com/Eurek001/OOD-VTP

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16243 2026-07-21 cs.LG cs.AI 新提交 73%

RobustMAD: Evaluating Real-World Robustness of Multimodal Small Language Models for Deployable Anomaly Detection Assistants

RobustMAD:评估用于可部署异常检测助手的多模态小语言模型的现实世界鲁棒性

Anushiya Arunan, Xin Li, Yan Qin, U-Xuan Tan, Nhu Khue Vuong, Xiaoli Li, Chau Yuen

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局) Nanyang Technological University(南洋理工大学) Chongqing University(重庆大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对多模态小语言模型现场部署的鲁棒性评估问题,开发RobustMAD基准测试,通过多种开放式查询评估模型,发现最佳模型虽有潜力但仍存差距及三种失败模式,为下一代多模态工业检测助手设计提供指导。

Comments Accepted for publication in Transactions on Machine Learning Research (TMLR), 2026 at https://openreview.net/forum?id=skrA9UYNIZ

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15657 2026-07-20 cs.CR cs.CV cs.LG 新提交 73%

Do Agents Dream of False Memories? Black-box Visual Attacks on Long-term Memory in Multimodal AI Agents

智能体是否会梦到虚假记忆?对多模态人工智能智能体长期记忆的黑盒视觉攻击

Halima Bouzidi, Mboutidem Ekemini Mkpong, Mohammad Abdullah Al Faruque

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 幻觉与鲁棒性 :grounding(abstract);MLLM(abstract);分类 cs.CV、cs.LG

AI总结 研究针对多模态人工智能智能体长期记忆的黑盒视觉攻击,提出Lucid框架,通过制作扰动实现记忆中毒和注入两种攻击模式,在多种对话领域和架构上评估,揭示了多模态记忆管道的结构漏洞。

Comments 34 pages, 5 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31966 2026-07-01 cs.MA cs.AI cs.CL cs.CV 新提交 73%

MECoBench: A Systematic Study of Multimodal Agent Collaboration in Embodied Environments

MECoBench:具身环境中多模态智能体协作的系统研究

Qingyun Liu, Jiwen Zhang, Jingyi Hu, Siyuan Wang, Zhongyu Wei

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出MECoBench基准,通过多任务、多结构、多模式的实验,系统研究多模态大模型在具身环境中的协作机制,发现协作能提升任务完成度但需平衡收益与复杂度,通信是关键,且协作增强鲁棒性。

Comments Project website: https://q-i-n-g.github.io/MECoBench-Website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07647 2026-06-09 cs.CV cs.CL cs.LG 新提交 73%

Steer Where It Matters: Token-Level Visual-Sensitivity Steering for LVLMs Hallucination Mitigation

关键位置引导:基于令牌级视觉敏感度引导的LVLMs幻觉缓解

Ruipeng Zhang, Zhihao Li, C. L. Philip Chen, Tong Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);vision language model(abstract);分类 cs.CV、cs.LG

AI总结 提出令牌级视觉敏感度引导(TLVS)方法,通过提取令牌级引导向量并自适应调整引导强度,仅在关键解码步骤抑制幻觉,在多个基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14854 2026-08-18 cs.CV 新提交 70%

Zero-MELO: Test-Time Evidence Calibration with Multimodal LLMs for Zero-Shot Micro-Gesture Recognition

Zero-MELO:基于多模态大语言模型的测试时证据校准用于零样本微手势识别

Chengyan Wang, Hanliang Xie, Yueyi Yang, Haoyu Chen

机构 * University of Oulu(奥卢大学) Peking University(北京大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract,abstract_cn);分类 cs.CV

AI总结 该研究针对多模态大语言模型在微手势识别中局部证据不足、分数偏差的瓶颈,提出Zero-MELO框架,结合树搜索、测试时校准与多线索融合,在iMiGUE和MA-52数据集上显著优于Qwen2.5-VL基线。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14070 2026-08-17 cs.CV 新提交 70%

InstructVVT: Instruction-Driven Video Virtual Try-On without Auxiliary Spatial Priors

InstructVVT:无需辅助空间先验的指令驱动视频虚拟试穿

Dingbao Shao, Song Wu, Xinyu Chen, Qian Wang, Jiahang Li, Kuai Jiang, Jiang Lin, Yuhang Liu, Ziyu Chen, Duo Li, Jiaxin Hu, Shengrong Gu, Ziheng Tang, Rongrong Liu, Yanlun Peng, Liang Li, Junlan Feng, Lujia Jin, Ting Zhang, Jian Yang, Zili Yi

专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 InstructVVT是基于DiT的视频虚拟试穿框架,通过双层级参考调控方案无需推理时空间先验,在ViViD-S等数据集上优于现有开源方法,解决了现有方法依赖辅助先验的问题。

Comments 23 pages, 10 figures. Dingbao Shao and Song Wu contributed equally. Zili Yi is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12158 2026-08-13 cs.CV 新提交 70%

Context Blindness in DPO: Mitigating Object Hallucination in MLLMs via Context-Calibrated Preference Optimization

DPO中的上下文盲区:通过上下文校准的偏好优化缓解多模态大语言模型(MLLMs)中的物体幻觉

Byungoh Ko, Jinyoung Park, Jongha Kim, Jeehye Na, Jaewon Cho, Hyunwoo J. Kim

机构 * Korea University(高丽大学) KAIST(韩国科学技术院)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract,abstract_cn);分类 cs.CV

AI总结 本研究针对MLLMs的物体幻觉问题,提出C²-DPO方法,通过最大化上下文偏好增益降低幻觉率,使Qwen2-VL-Instruct-2B的幻觉率相对降低36%且不损害通用推理能力。

Comments Accepted at ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08045 2026-08-11 cs.AI 新提交 70%

Lingjing: A Simulation Testbed for Multi-Agent Embodied Tasks in Open-Ended Cities

Lingjing:面向开放城市多智能体具身任务的仿真测试平台

Xiaohe Li, Yiru Wang, Junhao Fan, Mingyuan Liu, Jie Huang, Kaixin Zhang, Jiahao Li, Chen Qian, Zide Fan

专题命中 幻觉与鲁棒性 :vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 Lingjing 是一款面向开放城市异构多智能体具身任务的仿真测试平台,支持城市多智能体协同的可复现评估与故障诊断,通过评估视觉语言模型等揭示了环境感知等瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04246 2026-08-06 cs.RO cs.CV 新提交 70%

SAFECAST: Robust Failure Detection for VLA Policies with Contrast-Set Training and Calibration

SAFECAST:结合对比集训练与校准的VLA策略鲁棒故障检测

Harshitha Rajaprakash, Aditeya Prajapati, Rong Xue, Abrar Anwar, Jesse Thomason

机构 * University of Southern California(南加州大学)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 SAFECAST 借助对比集扰动优化隐状态探测器训练与校准,在真实和模拟实验中显著提升 VLA 策略故障检测 ROC-AUC,且视觉与语言对比集扰动结合时效果最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03791 2026-08-05 cs.AI 新提交 70%

Does Forgetting Transfer Across Modalities? A Real-World Benchmark for Cross-Modal Knowledge Unlearning Evaluation

遗忘能否跨模态迁移?面向跨模态知识遗忘评估的真实世界基准

Chunlin Liu, Junnian Chen, Haitong Jiang, Jianyu Zhao, Yingsen Pang, Jingchen Li, Jiabiao He, Youming Lu, Jinhe Bi, Yuntao Du

专题命中 幻觉与鲁棒性 :vision-language model(abstract,abstract_cn);分类 cs.AI

AI总结 本文针对跨模态知识遗忘迁移研究缺口,推出UNLINK-VL基准,实验发现跨模态遗忘存在不对称性,纯文本遗忘迁移效果差,凸显跨模态遗忘与评估的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00610 2026-08-04 cs.AI 新提交 70%

Slides2MindMap: Reconstructing Cognitively Efficient Knowledge Hierarchies from Lecture Slides

Slides2MindMap:从课程幻灯片重建认知高效的知识层次结构

Yuzhi Wang, Rongjun Ye, Shengyuan Chen, Huachi Zhou, Jiaqi Bai, Chuang Zhou, Zhicong Hong, Xiao Huang

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究提出Slides2MindMap任务,引入含12774张幻灯片的S2M-Bench基准,提出AutoMindMap智能体框架,实验证明其在基准上优于基线且鲁棒性强,具备教学应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28285 2026-07-31 cs.CV 新提交 70%

Beyond Visual Ambiguity: Guiding Robust Monocular Depth Estimation in Challenging Scenarios via Detailed Long Captions

超越视觉歧义:通过详细长文本引导具有挑战性场景下的鲁棒单目深度估计

Junrui Zhang, Jiaqi Li, Yiran Wang, Liao Shen, Zhiguo Cao

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract,abstract_cn);分类 cs.CV

AI总结 该研究针对单目深度估计的视觉歧义问题,提出CapDepth框架,通过详细长文本引导,在非朗伯表面和恶劣天气下的深度误差较现有最优方法分别降低25.0%和22.0%。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17769 2026-07-21 cs.RO cs.CV cs.HC 新提交 70%

From Sign Language Generation to Humanoid Execution: Vision-Language Guided Retargeting with Collision Mitigation

从手语生成到仿人执行:具有碰撞缓解功能的视觉语言引导重定向

Nabeela Khan, Bowen Wu, Runwu Shi, Benjamin Yen, Takeshi Ashizawa, Carlos Toshinori Ishi, Takashi Minato, Kazuhiro Nakadai

机构 * Department of Systems and Control Engineering, Institute of Science Tokyo(东京科学大学系统与控制工程系) RIKEN Guardian Robot Project(理化学研究所守护机器人项目) ATR Hiroshi Ishiguro Laboratories(ATR石黑浩实验室) RIKEN Center for Biosystems Dynamics Research(理化学研究所生物系统动力学研究中心)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 研究针对手语生成动作在人形执行时的自相交问题,提出系统级框架,包含体积SMPL-X碰撞缓解模块和视觉语言引导重定向算法,能将SLG输出连接到人形关节空间执行,突出碰撞处理等是可靠人形手语关键缺失组件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17482 2026-07-10 cs.CV 新提交 70%

SPHINX: First Explain, Then Explore

SPHINX: 先解释,再探索

Nguyen Do, Tue M. Cao, Tien Van Do, András Hajdu, Tamás Bérczes, My T. Thai

机构 * University of Florida(佛罗里达大学) University of Debrecen(德布勒恩大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);vision language model(abstract);分类 cs.CV

AI总结 提出SPHINX闭环框架,通过可解释AI分析驾驶策略的失败模式,并利用视觉语言模型生成针对性对抗场景,提升自动驾驶策略鲁棒性。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05783 2026-07-08 cs.CV 新提交 70%

Benchmarking the Robustness of Autonomous Driving to Environmental Illusions: A Lane Perception Perspective

从车道感知角度评估自动驾驶对环境错觉的鲁棒性:基准测试

Tianyuan Zhang, Xianglong Liu, Aishan Liu, Lu Wang, Yitong Zhang, Peng Yue, Mingchuan Zhang, Siyuan Liang, Dacheng Tao

机构 * SKLCCSE, the School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院软件安全技术与工程北京市重点实验室) the School of Cyber Science and Technology, Sun Yat-sen University(中山大学网络空间科学与技术学院) Henan University of Science and Technology(河南科技大学) the School of Computing, National University of Singapore(新加坡国立大学计算学院) College of Computing & Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 研究自动驾驶对环境错觉的鲁棒性,聚焦传统车道检测和视觉语言模型系统。引入基准LanEvil++并评估,发现错觉严重影响性能,阴影干扰最大。提出多模态错觉防御方法MIDA,有效提升了模型在挑战性条件下的鲁棒性。

Comments Accepted by IEEE TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19073 2026-07-07 cs.CV 新提交 70%

Taming I2V models for Image HOI Editing: A Cognitive Benchmark and Agentic Self-Correcting Framework

驯服I2V模型用于图像HOI编辑:认知基准与智能体自校正框架

Jiayi Gao, Qingchao Chen, Yuxin Peng, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University, Beijing, China(王轩计算机技术研究所,北京大学,北京,中国) National Institute of Health Data Science, Peking University, Beijing, China(国家健康数据科学研究院,北京大学,北京,中国)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出HOI-Edit基准和SCPE框架,利用I2V模型的时间生成能力进行动态人-物交互编辑,通过自校正提示迭代优化,实现与SOTA竞争的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02494 2026-07-03 cs.CV cs.CL 新提交 70%

Towards Robustness against Typographic Attack with Training-free Concept Localization

基于训练无关的概念定位实现对抗印刷体攻击的鲁棒性

Bohan Liu, Wenqian Ye, Guangzhi Xiong, Zhenghao He, Sanchit Sinha, Aidong Zhang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 幻觉与鲁棒性 :vision language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 提出一种无需训练的可解释性方法,通过分析注意力头对词汇和语义的编码差异,定位并干预ViT中的词汇偏置电路,从而在不额外训练的情况下显著提升对印刷体攻击的鲁棒性。

Comments 15 pages main text, provisionally accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02284 2026-07-03 cs.CV 新提交 70%

FlowCIR: Semantic Transport via Flow Matching for Zero-Shot Composed Image Retrieval

FlowCIR: 通过流匹配实现零样本组合图像检索的语义传输

Zhenqi He, Ziqi Jiang, Yuanpei Liu, Yanghao Wang, Teng Wang, Long Chen

机构 * The Hong Kong University of Science and Technology, Hong Kong SAR(香港科技大学) The University of Hong Kong, Hong Kong SAR(香港大学)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出FlowCIR,利用条件流匹配将参考图像与指令组合成目标对齐查询嵌入,避免文本反转的信息损失,训练效率高,并引入多负向引导策略提升对否定指令的鲁棒性。

Comments Accept to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04034 2026-08-06 cs.CR 新提交 67%

A Multimodal Automatic Redteaming Evaluation based on Atomic Jailbreak Strategy Decoupling and Combination

基于原子越狱策略解耦与组合的多模态自动红队评估

Shiji Zhao, Yuxuan Zhou, Chen Xiong, Dongxian Wu, Yang Bai, Xun Chen

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract,abstract_cn)

AI总结 针对现有多模态越狱攻击的两大挑战,本文提出HACA方法,构建多模态原子越狱策略空间,对5种主流MLLMs平均攻击成功率达95.48%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06196 2026-07-08 cs.CL cs.CY 新提交 67%

Pluralis v0.1: Towards a Multicultural, Multimodal, Multilingual Benchmark for AI Risk and Reliability

Pluralis v0.1:迈向用于人工智能风险与可靠性的多元文化、多模态、多语言基准测试

Alicia Parrish, Rajat Shinde, Sanket Badhe, Xinyi Bai, Sree Bhargavi Balija, Hua-Rong Chu, Emilio Ferrara, Armstrong Foundjem, Rajat Ghosh, Aakash Gupta, Xuanli He, Ong Chen Hui, Minji Jung, Madhangi Karimanal, Faiza Khan Khattak, Boryoung Kim, Eugenia Kim, Liliya Lavitas, Seok Min Lim, Victor Lu, Jim Moirangthem, Dhivya Nagasubramanian, Deepak Pandita, Sita Rajagopal, Geetha Raju, Evgeniia Razumovskaia, Aravind Reddy, Federico Ricciuti, Nobin Sarwar, Sungpil Shin, Sunayana Sitaram, Snehal Thorat, Tharindu Cyril Weerasooriya, Jasmijn Bastings, Joachim Baumann, Kongtao Chen, Murali Emani, Mariya Hendriksen, Jiho Jin, Jun Seong Kim, Younghoon Ko, Alicja Kwasniewska, Minjae Lee, Tom Wei-cyuan Lin Kashyap Ramanandula Manjusha, Junho Myung, Junyeong Park, Roma Patel, Shyam Ratan, Sudarsun Santhiappan, Priyanka Suresh, Tuesday, Ksheeraj Sai Vepuri Laura Amortegui-Ordonez, Claire Dennis, Minsuk Kahng, Chris Knotz, Alice Oh, Balaraman Ravindran, Soojung Ryu William Bartholomew, Hiwot Tesfaye, Lora Aroyo

机构 * Google DeepMind(谷歌DeepMind) University of Alabama in Huntsville(阿拉巴马大学亨茨维尔分校) Google(谷歌) University of Missouri Columbia(密苏里大学哥伦比亚分校) Chunghwa Telecom Laboratories(春木电信实验室) University of Southern California(南加州大学) Polytechnique Montreal(蒙特利尔理工学院) Nutanix ThinkEvolve Labs(ThinkEvolve实验室) UCL(伦敦大学学院) Infocomm Media Development Authority(信息通信媒体发展局) Monark Health(Monark健康) Seoul National University(首尔国立大学) Microsoft(微软) Centre for Responsible AI (CeRAI), Wadhwani School of Data Science and AI (WSAI), Indian Institute of Technology Madras(负责任人工智能中心(CeRAI)、瓦达威人工智能学校(WSAI)、印度理工学院马德拉斯分校) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Microsoft Research India(微软印度研究院) Stanford University(斯坦福大学) Argonne National Laboratory(阿贡国家实验室) University of Oxford(牛津大学) KAIST(韩国科学技术院) Yonsei University(延世大学) Amazon(亚马逊) UIUC(伊利诺伊大学香槟分校) Rochester Institute of Technology(罗切斯特理工学院) Xenoscube Inc.(Xenoscube公司) Korea AI Safety Institute (K-AISI)(韩国人工智能安全研究所(K-AISI)) MLCommons CommonGround Artifex Labs(Artifex实验室)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract)

AI总结 研究针对现有AI安全评估框架忽视文化差异问题,构建多语言多模态数据集Pluralis v0.1,从文化优先视角引入新评估范式,提出Judge - Pluralis集成,揭示特定地区失败模式,为多语言多元文化评估提供基础和创新起点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05396 2026-07-07 cs.CV cs.AI cs.LG cs.RO 新提交 67%

From Fixed to Free Cameras: Calibration-Free View-Robust Vision-Language-Action Model

从固定相机到自由相机:无需标定的视图鲁棒视觉-语言-动作模型

Wenhao Li, Xueying Jiang, Quanhao Qian, Deli Zhao, Shijian Lu, Gongjie Zhang, Ran Xu

机构 * Nanyang Technological University(南洋理工大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) HuPan Lab(湖畔实验室) Alibaba Group(阿里巴巴集团)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 针对真实机器人部署中相机位姿变动问题,提出CamVLA模型,解耦操控控制与相机几何,实现无标定视图鲁棒的机器人任务执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30875 2026-07-01 cs.CV cs.AI cs.LG 新提交 67%

The Label Imitation Game: Turing Test Network for Zero-Shot Pseudo-Label Pruning

标签模仿游戏:用于零样本伪标签剪枝的图灵测试网络

Brent A. Griffin, Jason J. Corso

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出图灵测试网络(TTN)作为任务无关的“裁判”,通过对抗性交互在数据集上下文中评估伪标签,无需监督或重训练即可提升标签准确性,并实现零样本任务迁移。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27527 2026-06-29 cs.CV cs.AI cs.LG 新提交 67%

Large Language Model Teaches Visual Students: Cross-Modality Transfer of Fine-Grained Conceptual Knowledge

大型语言模型教授视觉学生:细粒度概念知识的跨模态迁移

Thomas Shih-Chao Liang, Zhuoran Yu, Yong Jae Lee

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出LaViD框架,利用语言模型生成多选题来蒸馏细粒度视觉概念,无需多模态数据,在多个基准上超越现有方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19598 2026-06-19 cs.RO 新提交 67%

Fail-RAG : A Retrieval Augmented Generation Informed Framework for Robot Failure Identification

Fail-RAG:一种基于检索增强生成的机器人故障识别框架

Ameya Salvi, Jie Hu

机构 * Hitachi America, Ltd.(日立美国有限公司)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract_cn)

AI总结 提出Fail-RAG框架,利用检索增强生成和视觉语言模型,通过嵌入故障图像和上下文信息并查询数据库,实现机器人操作故障的高效检测,在仓库自动化任务中平均检测准确率提升25个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09595 2026-06-09 cs.IR 新提交 67%

Popcorn: A Configurable Benchmark for Visual Evidence in Multimodal Movie Recommendation

Popcorn: 多模态电影推荐中视觉证据的可配置基准

Ali Tourani, Fatemeh Nazary, Yashar Deldjoo, Tommaso Di Noia

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract_cn)

AI总结 提出Popcorn基准,通过配置合同标准化多模态电影推荐中的视觉证据(全片、预告片、缩略图)的嵌入、融合与评估,实验表明视觉源不可互换且影响推荐性能。

Comments 8 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10513 2026-08-12 cs.CV cs.AI 新提交 66%

SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning

SafeCap:通过图像字幕强化学习提升大型视觉语言模型(LVLM)的安全性

Caoyuan Ma, Wenpu Liu, Weichu Xie, Tian Gu, Shilei Zhao, Lingxi Min, Shuai Dong, Yuqi Xu, Ji Zhao, Ziyue Wang, Wenzheng Chang, Taiqiang Wu, Yongfu Zhu, Wenqi Shao, Yinqiang Zheng

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI;VLM(comments)

AI总结 SafeCap是一种通过图像字幕强化学习提升LVLM安全性的框架,在多模态安全基准上安全得分提升3.7-19.0个百分点,且视觉效用相当或更优,性能优于安全SFT等方法。

Comments 16pages, 4 figures. Preprint. Project page: https://safe-vlm.github.io/SafeCap/ ; code: https://github.com/Safe-VLM/SafeCap

详情

展开后加载摘要…

URL PDF HTML 收藏