arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2277 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 2277 篇

2603.08260 2026-03-10 cs.RO 50%

Seed2Scale: A Self-Evolving Data Engine for Embodied AI via Small to Large Model Synergy and Multimodal Evaluation

Seed2Scale: 一种通过小到大模型协同和多模态评估的自我进化数据引擎用于具身AI

Cong Tai, Zhaoyu Zheng, Haixu Long, Hansheng Wu, Zhengbin Long, Haodong Xiang, Rong Shi, Zhuo Cui, Shizhuang Zhang, Gang Qiu, He Wang, Ruifeng Li, Biao Liu, Zhenzhe Sun, Tao Shen

机构 * ZTE Corporation(中兴通讯公司)

专题命中 幻觉与鲁棒性 :vision-language model(abstract)

AI总结 Seed2Scale通过小到大模型协同和多模态评估,实现具身AI的自我进化数据引擎,显著提升性能并提供可扩展的开发路径

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07484 2026-03-10 cs.RO 50%

HSC-VLA: Hierarchical Scene-Clearing for Robust Bimanual Manipulation in Dense Clutter

HSC-VLA:分层场景清除用于密集杂乱环境中的鲁棒双臂操作

Zhen Liu, Xinyu Ning, Zhe Hu, XinXin Xie, Yitong Liu, Zhongzhu Pu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学)

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 HSC-VLA 通过分层场景清除方法提升密集杂乱环境中的双臂操作鲁棒性,实现 86.7% 的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08650 2026-03-10 cs.CY 50%

Who is Responsible? The Data, Models, Users or Regulations? A Comprehensive Survey on Responsible Generative AI for a Sustainable Future

谁该负责?数据、模型、用户还是法规?为可持续未来全面调查负责任的生成式人工智能

Shaina Raza, Rizwan Qureshi, Anam Zahid, Amgad Muneer, Anas Zafar, Safiullah Kamawal, Ferhat Sadak, Joseph Fioresi, Muhammaed Saeed, Ranjan Sapkota, Aditya Jain, Muneeb Ul Hassan, Aizan Zafar, Hasan Maqbool, Ashmal Vayani, Jia Wu, Maged Shoman

专题命中 幻觉与鲁棒性 :vision language model(abstract)

AI总结 本文全面调查了生成式人工智能的负责任发展,提出评估标准、生命周期指标及领域分析,旨在推动安全和可持续的AI部署。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07286 2026-03-10 cs.CL 50%

Taiwan Safety Benchmark and Breeze Guard: Toward Trustworthy AI for Taiwanese Mandarin

台湾安全基准与Breeze Guard:迈向可信的台湾台语AI

Po-Chun Hsu, Meng-Hsi Chen, Tsu Ling Chao, Chia Tien Han, Da-shan Shiu

机构 * MediaTek Research(联发科研究实验室) National Taiwan University(国立台湾大学)

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 本文提出TS-Bench基准和Breeze Guard模型,通过文化基础预训练提升台湾台语安全检测性能,显著优于现有模型。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17277 2026-03-10 cs.CR 50%

PolyJailbreak: Cross-Modal Jailbreaking Attacks on Black-Box Multimodal LLMs

PolyJailbreak: 对黑盒多模态大语言模型的跨模态劫持攻击

Xinkai Wang, Beibei Li, Zerui Shao, Ao Liu, Guangquan Xu, Shouling Ji

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract)

AI总结 PolyJailbreak通过多模态安全性不对称现象,提出结构化原子策略原语库,实现对黑盒多模态大语言模型的高效劫持攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00913 2026-03-03 cs.RO 50%

Minimalist Compliance Control

极简合规控制

Haochen Shi, Songbo Hu, Yifan Hou, Weizhuo Wang, Karen Liu, Shuran Song

专题命中 幻觉与鲁棒性 :vision-language model(abstract)

AI总结 极简合规控制通过仅使用电机电流或电压信号实现无需力传感器的合规控制,适用于多种机器人和规划方法。

Comments Project website: https://minimalist-compliance-control.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21230 2026-02-26 cs.CL 50%

TRACE: Trajectory-Aware Comprehensive Evaluation for Deep Research Agents

TRACE: 基于轨迹的深度研究代理综合评估

Yanyu Chen, Jiyue Jiang, Jiahong Liu, Yifei Zhang, Xiao Guo, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 TRACE提出基于轨迹的深度研究代理综合评估框架,通过分层效用函数和阶梯式能力评估协议,解决单一指标评估的不足,揭示代理在准确性、效率和鲁棒性之间的关键权衡。

Comments Accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15859 2026-02-19 cs.CL 50%

From Transcripts to AI Agents: Knowledge Extraction, RAG Integration, and Robust Evaluation of Conversational AI Assistants

从语音记录到AI代理:知识提取、RAG整合及对话式AI助手的鲁棒评估

Krittin Pachtrachai, Petmongkon Pornpichitsuwan, Wachiravit Modecrua, Touchapon Kraisingkorn

机构 * Amity Research and Application Center (ARAC)(阿米蒂研究与应用中心)

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 本文提出了一种端到端框架,通过历史通话记录构建和评估对话式AI助手,利用知识提取和RAG整合提升事实准确性和鲁棒性。

Comments 9 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19054 2026-02-13 cs.CR 50%

Poly-Guard: Massive Multi-Domain Safety Policy-Grounded Guardrail Dataset

Poly-Guard: 大规模多领域安全政策导向的防护数据集

Mintong Kang, Zhaorun Chen, Chejian Xu, Jiawei Zhang, Chengquan Guo, Minzhou Pan, Ivan Revilla, Yu Sun, Bo Li

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 Poly-Guard是一个大规模多领域安全政策导向的防护数据集,旨在提升防护系统的安全性和领域适应性。

Comments NeurIPS 2025 Dataset & Benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19507 2026-01-28 cs.CL 50%

Automated Safety Benchmarking: A Multi-agent Pipeline for LVLMs

自动化安全基准测试:一种用于大型视觉语言模型的多代理流程

Xiangyang Zhu, Yuan Tian, Zicheng Zhang, Qi Jia, Chunyi Li, Renrui Zhang, Heng Li, Zongrui Wang, Wei Sun

机构 * Shanghai AI Lab(上海人工智能实验室) PolyU HK(PolyU香港分校) East China Normal University(东华大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract)

AI总结 VLSafetyBencher通过多代理流程自动化构建高质量安全基准,有效区分不同模型的安全性,提升LVLMs的安全评估效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18901 2026-01-28 cs.CL 50%

Self-Aware Knowledge Probing: Evaluating Language Models' Relational Knowledge through Confidence Calibration

具有自意识的知识探测:通过置信度校准评估语言模型的关系知识

Christopher Kissling, Elena Merdjanovska, Alan Akbik

机构 * Humboldt-Universität zu Berlin(柏林洪堡大学)

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 本文提出了一种新的校准探测框架,用于评估语言模型在关系知识上的置信度,揭示了大多数模型在置信度校准上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17728 2026-01-27 cs.CL 50%

Unsupervised Elicitation of Moral Values from Language Models

无监督从语言模型中提取道德价值观

Meysam Alizadeh, Fabrizio Gilardi, Zeynab Samei

机构 * University of Zurich(苏黎世大学) IPM(伊朗高等教育科学院)

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 通过无监督方法ICM,研究发现预训练语言模型具备潜在的道德推理能力,能有效减少社会偏见,为AI对齐提供新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15745 2026-01-23 cs.CL 50%

Hallucination Mitigating for Medical Report Generation

缓解医疗报告生成中的幻觉

Ruoqing Zhao, Runze Xia, Piji Li

机构 * College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(南京航空航天大学人工智能学院) MIIT Key Laboratory of Pattern Analysis and Machine Intelligence(信息产业部模式分析与机器智能重点实验室) The Key Laboratory of Brain-Machine Intelligence Technology, Ministry of Education(教育部脑机智能技术重点实验室)

专题命中 幻觉与鲁棒性 :vision language model(abstract)

AI总结 KERM框架通过知识检索、净化模块和细粒度奖励,有效缓解医疗报告生成中的幻觉问题,提升报告质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07558 2026-01-13 cs.RO 50%

FlyCo: Foundation Model-Empowered Drones for Autonomous 3D Structure Scanning in Open-World Environments

FlyCo:基于基础模型的无人机自主3D结构扫描系统

Chen Feng, Guiyong Zheng, Tengkai Zhuang, Yongqian Wu, Fangzhan He, Haojia Li, Juepeng Zheng, Shaojie Shen, Boyu Zhou

机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(香港科技大学电子与计算机工程系) School of Artificial Intelligence, Sun Yat-sen University(中山大学人工智能学院) Department of Mechanical and Energy Engineering, Southern University of Science and Technology(南方科技大学机械与能源工程系) Differential Robotics, Hangzhou, China(杭州差分机器人)

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 FlyCo通过整合基础模型实现无人机自主3D扫描,提升开放世界环境下的目标定位与预测效率。

Comments 34 pages, 24 figures, 9 tables. Video: https://www.youtube.com/playlist?list=PLqjZjnqsCyl40rw3y15Yzc7Mdo-z1y2j8

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04813 2026-01-09 cs.DC 50%

Proof of Commitment: A Human-Centric Resource for Permissionless Consensus

证明承诺:一种以人为中心的资源用于无许可共识

Homayoun Maleki, Nekane Sainz, Jon Legarda

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 证明承诺(PoCmt)通过实时人类参与的非并行化资源,提供了一种无许可共识机制,确保线性Sybil成本并实现公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00675 2026-01-09 cs.RO 50%

RoboReward: General-Purpose Vision-Language Reward Models for Robotics

RoboReward: 通用视觉-语言奖励模型用于机器人学

Tony Lee, Andrew Wagenmaker, Karl Pertsch, Percy Liang, Sergey Levine, Chelsea Finn

专题命中 幻觉与鲁棒性 :vision-language model(abstract)

AI总结 RoboReward通过构建机器人奖励数据集和基准,训练视觉-语言奖励模型,验证了其在机器人学习中的有效性,并展示了改进策略学习和缩小与人工奖励差距的成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03594 2026-01-08 cs.CR 50%

Jailbreaking LLMs & VLMs: Mechanisms, Evaluation, and Unified Defense

突破大语言模型与视觉语言模型:机制、评估与统一防御

Zejian Chen, Chaozhuo Li, Chao Li, Xi Zhang, Litian Zhang, Yiming He

专题命中 幻觉与鲁棒性 :vision-language model(abstract)

AI总结 本文提出三维框架系统回顾大语言模型和视觉语言模型的突破攻击与防御机制,提出统一防御原则并讨论未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21008 2025-12-29 cs.CR 50%

GateBreaker: Gate-Guided Attacks on Mixture-of-Expert LLMs

GateBreaker: 对混合专家LLM的门控引导攻击

Lichao Wu, Sasha Behrouzi, Mohamadreza Rostami, Stjepan Picek, Ahmad-Reza Sadeghi

专题命中 幻觉与鲁棒性 :vision language model(abstract)

AI总结 GateBreaker通过门控引导攻击破坏MoE LLM的安全对齐,发现安全机制集中在少量神经元上,禁用这些神经元显著提高攻击成功率。

Comments Accepted by USENIX Security'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01185 2025-12-19 cs.CR 50%

DefenSee: Dissecting Threat from Sight and Text -- A Multi-View Defensive Pipeline for Multi-modal Jailbreaks

DefenSee:从视觉和文本中解构威胁——一种多视图防御管道用于多模态对抗突破

Zihao Wang, Kar Wai Fok, Vrizlynn L. L. Thing

专题命中 幻觉与鲁棒性 :MLLM(abstract)

AI总结 DefenSee通过图像变体转录和跨模态一致性检查,提供一种多模态防御方法,有效降低多模态对抗攻击的成功率,提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13734 2025-12-18 cs.CL 50%

GAPS: A Clinically Grounded, Automated Benchmark for Evaluating AI Clinicians

GAPS: 一种基于临床的自动化评估基准,用于评估AI临床医生

Xiuyuan Chen, Tao Sun, Dexin Su, Ailing Yu, Junwei Liu, Zhe Chen, Gangzeng Jin, Xin Wang, Jingnan Liu, Hansong Xiao, Hualei Zhou, Dongjie Tao, Chunxiao Guo, Minghui Yang, Yuan Xia, Jing Zhao, Qianrui Fan, Yanyun Wang, Shuai Zhen, Kezhong Chen, Jun Wang, Zewen Sun, Heng Zhao, Tian Guan, Shaodong Wang, Geyun Chang, Jiaming Deng, Hongchengcheng Chen, Kexin Feng, Ruzhen Li, Jiayi Geng, Changtai Zhao, Jun Wang, Guihu Lin, Peihao Li, Liqi Liu, Peng Wei, Jian Wang, Jinjie Gu, Ping Wang, Fan Yang

机构 * Department of Thoracic Surgery(胸外科部门) Thoracic Oncology Institute(胸外科肿瘤研究所) Research Unit of Intelligence Diagnosis and Treatment in Early Non-small Cell Lung Cancer(早期非小细胞肺癌智能诊断与治疗研究单元) Institute of Advanced Clinical Medicine(先进临床医学研究所) Beijing Key Laboratory of Innovative Application of Big Data in Lung Cancer(肺癌大数据创新应用北京市重点实验室) Ant Group(蚂蚁集团) School of Software and Microelectronics(软件与微电子学院)

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 GAPS提出了一种基于临床的自动化评估基准,用于评估AI临床医生系统,通过多维评估框架解决现有基准的不足,揭示了AI在临床实践中的关键失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08653 2025-12-10 cs.RO 50%

A Sensor-Aware Phenomenological Framework for Lidar Degradation Simulation and SLAM Robustness Evaluation

一种面向传感器的现象学框架用于激光雷达退化仿真和SLAM鲁棒性评估

Doumegna Mawuto Koudjo Felix, Xianjia Yu, Zhuo Zou, Tomi Westerlund

机构 * Turku Intelligent Embedded and Robotic Systems (TIERS) Lab , University of Turku(图尔库智能嵌入与机器人系统实验室,图尔库大学) School of Information Science and Technology, Fudan University(信息科学与技术学院,复旦大学)

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 本文提出一种面向传感器的现象学框架,用于模拟激光雷达退化并评估SLAM系统的鲁棒性,通过保留点云结构并应用多种退化方法,实现可控的仿真测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06017 2025-12-09 cs.RO eess.IV 50%

Training-Free Robot Pose Estimation using Off-the-Shelf Foundational Models

无需训练的机器人姿态估计使用现成的基础模型

Laurence Liang

机构 * McGill University(麦吉尔大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract)

AI总结 本文提出利用现成的基础模型无需训练即可估计机器人关节角度,通过实验验证了模型性能基准及测试扩展对预测效果的影响。

Comments Accepted at CVIS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02263 2025-12-03 cs.HC cs.GR 50%

DepthScape: Authoring 2.5D Designs via Depth Estimation, Semantic Understanding, and Geometry Extraction

DepthScape: 通过深度估计、语义理解和几何提取进行2.5D设计创作

Xia Su, Cuong Nguyen, Matheus A. Gadelha, Jon E. Froehlich

专题命中 幻觉与鲁棒性 :vision-language model(abstract)

AI总结 DepthScape通过深度估计、语义理解和几何提取,实现2.5D设计创作,提升视觉真实感与动态效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00928 2025-12-02 cs.MM 50%

Augmenting Intra-Modal Understanding in MLLMs for Robust Multimodal Keyphrase Generation

增强多模态大语言模型的模态内理解以实现鲁棒的多模态关键词生成

Jiajun Cao, Qinggang Zhang, Yunbo Tang, Zhishang Xiang, Chang Yang, Jinsong Su

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract)

AI总结 AimKP通过增强模态内语义学习和跨模态对齐,提升多模态关键词生成的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19914 2025-11-26 cs.RO 50%

CoC-VLA: Delving into Adversarial Domain Transfer for Explainable Autonomous Driving via Chain-of-Causality Visual-Language-Action Model

CoC-VLA: 深入研究对抗域转移以实现可解释的自动驾驶 via 链式因果视觉语言动作模型

Dapeng Zhang, Fei Shen, Rui Zhao, Yinda Chen, Peng Zhi, Chenyang Li, Rui Zhou, Qingguo Zhou

机构 * Lanzhou University(兰州大学) National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 幻觉与鲁棒性 :VLM(abstract)

AI总结 CoC-VLA通过链式因果视觉语言动作模型实现对抗域转移,提升自动驾驶的可解释性和长尾场景处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15478 2025-11-25 cs.CL 50%

Red Teaming Multimodal Language Models: Evaluating Harm Across Prompt Modalities and Models

针对多模态语言模型的红队测试:评估不同提示模态和模型的有害性

Madison Van Doren, Casey Ford

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract)

AI总结 本研究通过红队测试评估多模态语言模型在不同提示模态下的安全性,发现Pixtral 12B的有害响应率最高,而Claude Sonnet 3.5最安全,凸显了建立多模态安全基准的必要性。

Journal ref AAAI 2026 AIGOV Workshop and EurIPS 2025 Workshop on Unifying Perspectives on Learning Biases

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16816 2025-11-24 stat.AP stat.CO 50%

Trust-Aware Multimodal Data Fusion for Yield Estimation: A Case Study of the 2020 Beirut Explosion

具有信任意识的多模态数据融合用于产量估计:贝鲁特2020爆炸的案例研究

Lekha Patel, Craig Ulmer, Stephen J. Verzi, Daniel J. Krofcheck, Indu Manickam, Asmeret Naugle, Jaideep Ray

专题命中 幻觉与鲁棒性 :vision-language model(abstract)

AI总结 本文提出一种基于贝叶斯分数后验框架的多模态数据融合方法,用于估计爆炸产量,通过信任权重校准不同观测数据,提升不确定性量化和抗偏差能力。

Comments 19 pages, 4 figures, supplementary material, journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10075 2025-11-14 cs.CL 50%

Format Matters: The Robustness of Multimodal LLMs in Reviewing Evidence from Tables and Charts

Xanh Ho, Yun-Ang Wu, Sunisth Kumar, Florian Boudin, Atsuhiro Takasu, Akiko Aizawa

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract)

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04835 2025-11-10 cs.RO 50%

Conformalized Non-uniform Sampling Strategies for Accelerated Sampling-based Motion Planning

Shubham Natraj, Bruno Sinopoli, Yiannis Kantaros

机构 * Department of Electrical and Systems Engineering, Washington University in St. Louis(电气与系统工程系,华盛顿大学圣路易斯分校)

专题命中 幻觉与鲁棒性 :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11350 2025-11-10 cs.RO 50%

Search-TTA: A Multimodal Test-Time Adaptation Framework for Visual Search in the Wild

Derek Ming Siang Tan, Shailesh, Boyang Liu, Alok Raj, Qi Xuan Ang, Weiheng Dai, Tanishq Duhan, Jimmy Chiun, Yuhong Cao, Florian Shkurti, Guillaume Sartoretti

专题命中 幻觉与鲁棒性 :vision language model(abstract)

Comments Accepted for presentation at CORL 2025. Code, models, and data are available at https://search-tta.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏