arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-10 至 2026-02-10 共收录 91 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 23 篇

2505.22441 2026-02-10 cs.CV cs.AI 62%

Can NeRFs See without Cameras?

NeRF能否在没有摄像头的情况下看到?

Chaitanya Amballa, Sattwik Basu, Yu-Lin Wei, Zhijian Yang, Mehmet Ergezer, Romit Roy Choudhury

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出通过重新设计NeRF来利用多路径信号推断环境,应用于从稀疏Wi-Fi测量中推断室内平面图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08828 2026-02-10 cs.CV 57%

VideoVeritas: AI-Generated Video Detection via Perception Pretext Reinforcement Learning

VideoVeritas:通过感知预设强化学习实现AI生成视频检测

Hao Tan, Jun Lan, Senyuan Shi, Zichang Tan, Zijian Yu, Huijia Zhu, Weiqiang Wang, Jun Wan, Zhen Lei

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Shenzhen Institute of Advanced Technology (SIAT), Chinese Academy of Sciences(中国科学院深圳先进技术研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 VideoVeritas通过感知预设强化学习提升AI生成视频检测性能,整合细粒度感知与事实推理,采用时空定位和自监督计数提升检测效果。

Comments Project: https://github.com/EricTan7/VideoVeritas

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08593 2026-02-10 cs.HC cs.AI 57%

Kissan-Dost: Bridging the Last Mile in Smallholder Precision Agriculture with Conversational IoT

Kissan-Dost:通过对话物联网弥合小农户精准农业的最后一公里

Muhammad Saad Ali, Daanish U. Khan, Laiba Intizar Ahmad, Umer Irfan, Maryam Mustafa, Naveed Anwar Bhatti, Muhammad Hamad Alizai

机构 * Lahore University of Management Sciences (LUMS), Pakistan(拉合尔管理科学大学(LUMS),巴基斯坦)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 Kissan-Dost通过对话物联网系统,利用传感器数据和多语言翻译,为小农户提供精准农业的实时指导和高效决策支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08565 2026-02-10 cs.HC cs.AI 57%

Agent-Supported Foresight for AI Systemic Risks: AI Agents for Breadth, Experts for Judgment

支持智能体的前瞻性分析以应对AI系统性风险:智能体用于广度,专家用于判断

Leon Fröhling, Alessandro Giaconia, Edyta Paulina Bogucka, Daniele Quercia

机构 * GESIS - Leibniz Institute for the Social Sciences(GESIS-莱布尼茨社会科学研究所) ETH Zurich(苏黎世联邦理工学院) Nokia Bell Labs(诺基亚贝尔实验室) University of Cambridge(剑桥大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出了一种结合智能体和专家的前瞻性分析方法,用于评估AI系统的长期系统性风险,通过模拟智能体和专家讨论,扩大风险覆盖范围并提供上下文基础。

Comments 48 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15305 2026-02-10 cs.AI 57%

Coarse-to-Fine Grounded Memory for LLM Agent Planning

粗到细的 grounded memory 用于 LLM agent 计划

Wei Yang, Jinwei Xiao, Hongming Zhang, Qingyang Zhang, Yanna Wang, Bo Xu

机构 * National Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institution of Automation, Chinese Academy of Sciences(认知与决策智能复杂系统国家重点实验室,自动化研究所,中国科学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出 Coarse-to-Fine Grounded Memory,通过 LLM 实现粗到细的记忆 grounding,以提升代理在复杂规划任务中的灵活性和适应性。

Comments Accepted to EMNLP 2025 Main Conference;27 pages,15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19184 2026-02-10 cs.CV 57%

A Survey on Class-Agnostic Counting: Advancements from Reference-Based to Open-World Text-Guided Approaches

对类无关计数的综述:从基于参考到开放世界文本引导方法的进展

Luca Ciampi, Ali Azmoudeh, Elif Ecem Akbaba, Erdi Sarıtaş, Ziya Ata Yazıcı, Hazım Kemal Ekenel, Giuseppe Amato, Fabrizio Falchi

机构 * CNR-ISTI Istanbul Technical University(伊斯坦布尔技术大学) Division of Engineering, NYU Abu Dhabi(NYU阿布扎比分校工程系)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文综述了类无关计数方法,提出三种范式并评估了30种架构,探讨了其性能、挑战及未来方向。

Comments Preprint version of an article accepted ad Elsevier's CVIU

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07960 2026-02-10 cs.CV 57%

D-ORCA: Dialogue-Centric Optimization for Robust Audio-Visual Captioning

D-ORCA:面向鲁棒音频视觉描述的对话中心优化

Changli Tang, Tianyi Wang, Fengyun Rao, Jing Lyu, Chao Zhang

机构 * Tsinghua University(清华大学) WeChat Vision, Tencent Inc.(腾讯微信视觉实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 D-ORCA通过对话中心优化,提升音频视觉描述的鲁棒性和准确性,填补开源生态关键空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07378 2026-02-10 cs.LG physics.data-an stat.ML 57%

Dichotomy of Feature Learning and Unlearning: Fast-Slow Analysis on Neural Networks with Stochastic Gradient Descent

特征学习与遗忘的二元性:基于随机梯度下降的神经网络快慢分析

Shota Imai, Sota Nishiyama, Masaaki Imaizumi

机构 * The University of Tokyo(东京大学) RIKEN Center for Advanced Intelligence Project(RIKEN先进人工智能项目中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文研究了神经网络中特征学习与遗忘的二元性,通过快慢动态分析揭示特征遗忘的机制与条件,提出特征遗忘由数据主非线性项强度和第二层权重初始尺度决定。

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00030 2026-02-10 cs.LG 57%

RAPTOR-AI for Disaster OODA Loop: Hierarchical Multimodal RAG with Experience-Driven Agentic Decision-Making

RAPTOR-AI用于灾难OODA循环:基于经验驱动的多模态RAG框架

Takato Yasuno

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 RAPTOR-AI通过分层多模态RAG框架,结合经验驱动的代理控制和LoRA适应,提升灾害响应中的检索精度、情境基础性和任务分解准确性。

Comments 8 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06984 2026-02-10 cs.CY cs.AI 57%

Empowering Affected Individuals to Shape AI Fairness Assessments: Processes, Criteria, and Tools

赋能受影响个体塑造AI公平性评估:过程、标准与工具

Lin Luo, Satwik Ghanta, Yuri Nakao, Mathieu Chollet, Simone Stumpf

机构 * School of Computing Science, University of Glasgow(格拉斯哥大学计算科学学院) FUJITSU LIMITED(Fujitsu 有限公司) Graduate School of Arts and Sciences, The University of Tokyo(东京大学艺术与科学研究生院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文通过定性研究探讨了如何让受影响个体参与AI公平性评估,揭示了个体如何通过模型特征生成公平性标准,并提出了支持包容性AI公平性评估的设计建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08545 2026-02-10 cs.IR 50%

DA-RAG: Dynamic Attributed Community Search for Retrieval-Augmented Generation

DA-RAG:动态属性社区搜索用于检索增强生成

Xingyuan Zeng, Zuohan Wu, Yue Wang, Chen Zhang, Quanming Yao, Libin Zheng, Jian Yin

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 DA-RAG通过动态属性社区搜索提升检索增强生成的效果,有效处理动态复杂查询,减少计算与经济成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08529 2026-02-10 cs.MA 50%

EvoCorps: An Evolutionary Multi-Agent Framework for Depolarizing Online Discourse

EvoCorps:一种用于去极化的进化多智能体框架

Ning Lin, Haolun Li, Mingshu Liu, Chengyun Ruan, Kaibo Huang, Yukun Wei, Zhongliang Yang, Linna Zhou

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 EvoCorps通过进化多智能体框架主动应对在线讨论中的极化问题,提升讨论质量并实现闭环干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22246 2026-02-10 quant-ph cond-mat.dis-nn cond-mat.str-el 50%

Complexity in multi-qubit and many-body systems

多量子比特和许多体系统的复杂性

Imre Varga

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出了一种基于熵的复杂性度量,用于识别多量子比特和许多体系统中的非平凡量子相变和临界行为。

Comments 13 pages, 9 figures

Journal ref Phys. Rev. A 113, 022606, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07978 2026-02-10 cs.CL 50%

Cross-Linguistic Persona-Driven Data Synthesis for Robust Multimodal Cognitive Decline Detection

跨语言人格驱动的数据合成用于鲁棒多模态认知衰退检测

Rui Feng, Zhiyao Luo, Liuyu Wu, Wei Wang, Yuting Song, Yong Liu, Kok Pin Ng, Jianqing Li, Xingyao Wang

机构 * Engineering Research Center of Intelligent Theranostics Technology and Instruments, Ministry of Education, School of Biomedical Engineering and Informatics, Nanjing Medical University(智能诊疗技术与仪器工程研究中心、教育部、生物医学工程与信息学院、南京医科大学) Institute of Biomedical Engineering, University of Oxford(生物医学工程研究所、牛津大学) Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(高性能计算研究所、科技研究局(A*STAR)) Department of Neurology, National Neuroscience Institute, Singapore, 308433, Singapore(神经病学部、新加坡国家神经科学研究所) Duke-NUS Medical School, Singapore, 169857, Singapore(新加坡国立大学医学院)

专题命中 视觉定位与Grounding :multimodal large language model(abstract)

AI总结 SynCog通过跨语言人格驱动数据合成与推理链微调,提升多模态模型在认知衰退检测中的诊断性能和跨语言泛化能力。

Comments 18 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07371 2026-02-10 cs.DB 50%

DeepPrep: An LLM-Powered Agentic System for Autonomous Data Preparation

DeepPrep: 一种基于大语言模型的自主数据准备代理系统

Meihao Fan, Ju Fan, Yuxin Zhang, Shaolei Zhang, Xiaoyong Du, Jie Song, Peng Li, Fuxin Jiang, Tieying Zhang, Jianjun Chen

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 DeepPrep通过基于树状代理推理和渐进式训练框架,实现高效且准确的数据准备,相比闭源模型具有更低的成本和更广的适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23189 2026-02-10 eess.SY cs.SY 50%

The Dawn of Agentic EDA: A Survey of Autonomous Digital Chip Design

代理EDA的黎明:自主数字芯片设计的综述

Zelin Zang, Yuhang Song, Aili Wang, Bingo Wing-Kuen Ling, Qi Sun, Zhen Lei, Fuji Yang, Cheng Zhuo, Jiebo Luo

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出代理EDA的系统框架,通过认知堆栈分析前端和后端设计流程,强调神经符号优化和可信度提升的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22978 2026-02-10 cs.CL 50%

ShoppingComp: Are LLMs Really Ready for Your Shopping Cart?

ShoppingComp: LLMs 是否真的准备好为您的购物车服务?

Huaixiao Tou, Ying Zeng, Yuemeng Li, Cong Ma, Muzhi Li, Minghao Li, Weijie Yuan, He Zhang, Kai Jia

机构 * ByteDance(字节跳动)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 ShoppingComp通过现实世界基准揭示LLM在购物代理任务中的局限性,强调其在信息定位、多约束验证和风险决策方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 2 篇

2602.07642 2026-02-10 cs.AI cs.LG 81%

Efficient Table Retrieval and Understanding with Multimodal Large Language Models

基于多模态大语言模型的高效表格检索与理解

Zhuoyan Xu, Haoyang Fang, Boran Han, Bonan Min, Bernie Wang, Cuixiong Hu, Shuai Zhang

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) AWS(亚马逊网络服务)

专题命中 文档图表理解 :multimodal large language model(title,abstract);分类 cs.AI、cs.LG

AI总结 TabRAG通过多模态大语言模型实现高效表格检索与理解,显著提升检索召回率和答案准确率。

Comments Published at EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07645 2026-02-10 cs.CV cs.AI 73%

From Dead Pixels to Editable Slides: Infographic Reconstruction into Native Google Slides via Vision-Language Region Understanding

从死像素到可编辑幻灯片:通过视觉-语言区域理解将信息图转换为原生Google幻灯片

Leonardo Gonzalez

机构 * Trilogy AI Center of Excellence(Trilogy AI卓越中心)

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 通过视觉-语言区域理解,将信息图转换为可编辑的Google幻灯片,实现元素恢复和布局保真度的高精度转换。

Comments Accepted for publication in the Companion Proceedings of the ACM Web Conference 2026 (WWW Companion '26), April 13-17, 2026, Dubai, United Arab Emirates

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 4 篇

2602.09002 2026-02-10 cs.RO cs.AI 83%

From Obstacles to Etiquette: Robot Social Navigation with VLM-Informed Path Selection

从障碍到礼仪:基于VLM引导路径选择的机器人社交导航

Zilin Fang, Anxing Xiao, David Hsu, Gim Hee Lee

机构 * School of Computing(计算机学院) Smart Systems Institute(智能系统研究所)

专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI

AI总结 本文提出了一种结合几何规划与上下文社交推理的机器人社交导航框架,通过VLM模型优化路径选择,以减少对人类活动的干扰并遵守社会规范。

Comments Accepted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26098 2026-02-10 cs.AI 57%

GUI Knowledge Bench: Revealing the Knowledge Gap of VLMs in GUI Tasks

GUI知识基准:揭示VLMs在GUI任务中的知识差距

Chenrui Shi, Zedong Yu, Zhi Gao, Ruining Feng, Enqi Liu, Yuwei Wu, Yunde Jia, Liuyu Xiang, Zhaofeng He, Qing Li

机构 * Beijing Institute of Technology, Beijing, China(北京理工大学) State Key Laboratory of General Artificial Intelligence, BIGAI, Beijing, China(国家一般人工智能重点实验室) Beijing University of Posts(北京邮电大学) Tsinghua University, Beijing, China(清华大学) Shenzhen MSU-BIT University, Shenzhen, China(深圳MSU-BIT大学)

专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.AI

AI总结 GUI知识基准揭示VLMs在GUI任务中的知识差距,通过提炼三个维度的GUI知识,评估现有模型的不足并指导更高效的任务完成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22009 2026-02-10 cs.AI 57%

OpenPhone: Mobile Agentic Foundation Models

OpenPhone: 移动代理基础模型

Yangqin Jiang, Chao Huang

机构 * The University of Hong Kong(香港大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

AI总结 OpenPhone通过设备-云协作提升移动GUI代理性能,结合设备端高效模型与云端强大能力,实现成本降低与性能提升的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08537 2026-02-10 cs.RO 50%

UniPlan: Vision-Language Task Planning for Mobile Manipulation with Unified PDDL Formulation

UniPlan: 为移动操作统一PDDL形式的视觉-语言任务规划

Haoming Ye, Yunxiao Xiao, Cewu Lu, Panpan Cai

专题命中 GUI与屏幕智能体 :VLM(abstract)

AI总结 UniPlan通过统一PDDL形式实现视觉-语言任务规划,提升大规模室内移动操作的规划效率和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与鲁棒性 8 篇

2602.08136 2026-02-10 cs.CV cs.AI 84%

Robustness of Vision Language Models Against Split-Image Harmful Input Attacks

视觉语言模型对分裂图像有害输入攻击的鲁棒性

Md Rafi Ur Rashid, MD Sadik Hossain Shanto, Vishnu Asutosh Dasu, Shagufta Mehnaz

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出分裂图像视觉陷阱攻击(SIVA),揭示视觉语言模型在面对分裂图像攻击时的安全漏洞,并通过对抗性知识蒸馏算法提升跨模型攻击效果。

Comments 22 Pages, long conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10602 2026-02-10 cs.CV cs.AI cs.CL 81%

TruthPrInt: Mitigating Large Vision-Language Models Object Hallucination Via Latent Truthful-Guided Pre-Intervention

TruthPrInt: 通过潜在真实引导预干预缓解大视觉-语言模型对象幻觉

Jinhao Duan, Fei Kong, Hao Cheng, James Diffenderfer, Bhavya Kailkhura, Lichao Sun, Xiaofeng Zhu, Xiaoshuang Shi, Kaidi Xu

机构 * Drexel University(德雷塞尔大学) University of Electronic Science and Technology of China(电子科技大学) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) LLNL(劳伦斯利弗莫尔国家实验室) Lehigh University(莱斯大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 TruthPrInt通过学习真相方向并引导解码过程,有效缓解大视觉-语言模型中的对象幻觉问题。

Comments 15 pages, 9 figures, the first two authors contributed equally, Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07027 2026-02-10 cs.CV cs.LG 81%

Fair Context Learning for Evidence-Balanced Test-Time Adaptation in Vision-Language Models

公平上下文学习用于证据平衡的测试时间适应在视觉-语言模型中

Sanggeon Yun, Ryozo Masukawa, SungHeon Jeong, Wenjun Huang, Hanning Chen, Mohsen Imani

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文提出公平上下文学习方法,通过解决共享证据偏差来提升视觉-语言模型在测试时间适应中的鲁棒性,有效校准文本嵌入并提高适应性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08311 2026-02-10 cs.AI 79%

Moral Sycophancy in Vision Language Models

视觉语言模型中的道德趋炎奉承

Shadman Rabby, Md. Hefzul Hossain Papon, Sabbir Ahmed, Nokimul Hasan Arif, A. B. M. Ashikur Rahman, Irfan Ahmad

机构 * University of Dhaka(达卡大学) Daffodil International University(达福迪国际大学) Islamic University of Technology(伊斯兰技术大学) University of Central Florida(佛罗里达中央大学) King Fahad University of Petroleum and Minerals(国王法赫德石油与矿物大学) SDAIA - KFUPM Joint research Center for Artificial Intelligence(SDAIA-KFUPM人工智能联合研究中心)

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);分类 cs.AI

AI总结 本文研究了视觉语言模型在道德决策中的趋炎奉承现象,发现模型在用户偏见下易产生道德错误回应,揭示了模型在伦理一致性与稳健性上的权衡问题。

Comments 13 pages, 6 figures, 8 tables, Submitted for review in ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07899 2026-02-10 cs.CV 79%

Rethinking Practical and Efficient Quantization Calibration for Vision-Language Models

重新思考视觉-语言模型的实用且高效的量化校准

Zhenhao Shang, Haizhao Jing, Guoting Wei, Haokui Zhang, Rong Xiao, Jianqing Gao, Peng Wang

机构 * Northwestern Polytechnical University, Xi'an, China(西北工业大学,西安,中国) Nanjing University of Science and Technology, Nanjing, China(南京理工大学,南京,中国)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 TLQ通过标记级重要性整合和多GPU层级校准,提升视觉-语言模型的量化稳定性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08145 2026-02-10 cs.LG cs.AI cs.CL cs.CV cs.CY 67%

Reliable and Responsible Foundation Models: A Comprehensive Survey

可靠且负责任的基础模型:全面综述

Xinyu Yang, Junlin Han, Rishi Bommasani, Jinqi Luo, Wenjie Qu, Wangchunshu Zhou, Adel Bibi, Xiyao Wang, Jaehong Yoon, Elias Stengel-Eskin, Shengbang Tong, Lingfeng Shen, Rafael Rafailov, Runjia Li, Zhaoyang Wang, Yiyang Zhou, Chenhang Cui, Yu Wang, Wenhao Zheng, Huichi Zhou, Jindong Gu, Zhaorun Chen, Peng Xia, Tony Lee, Thomas Zollo, Vikash Sehwag, Jixuan Leng, Jiuhai Chen, Yuxin Wen, Huan Zhang, Zhun Deng, Linjun Zhang, Pavel Izmailov, Pang Wei Koh, Yulia Tsvetkov, Andrew Wilson, Jiaheng Zhang, James Zou, Cihang Xie, Hao Wang, Philip Torr, Julian McAuley, David Alvarez-Melis, Florian Tramèr, Kaidi Xu, Suman Jana, Chris Callison-Burch, Rene Vidal, Filippos Kokkinos, Mohit Bansal, Beidi Chen, Huaxiu Yao

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文综述了基础模型的可靠和负责任发展,探讨了偏见、安全、不确定性等关键问题,并提出了未来研究方向。

Comments TMLR camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11472 2026-02-10 cs.CV cs.LG 62%

Toward Inherently Robust VLMs Against Visual Perception Attacks

朝向对抗视觉感知攻击的固有鲁棒性VLMs

Pedram MohajerAnsari, Amir Salarpour, Michael Kühr, Siyu Huang, Mohammad Hamad, Sebastian Steinhorst, Habeeb Olufowobi, Bing Li, Mert D. Pesé

机构 * Clemson University(克莱姆森大学) Technical Universität München(慕尼黑技术大学) University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出V2LMs,通过固有鲁棒性提升自动驾驶车辆感知对视觉攻击的抗性,实验显示其在对抗攻击下表现优于传统DNNs。

Comments Accepted to the 2026 IEEE Intelligent Vehicles Symposium (IV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏