arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-10 至 2026-03-10 共收录 17 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 17 篇

2603.06600 2026-03-10 cs.LG cs.AI 84%

FuzzingRL: Reinforcement Fuzz-Testing for Revealing VLM Failures

FuzzingRL: 用于揭示视觉语言模型故障的强化模糊测试

Jiajun Xu, Jiageng Mao, Ang Qi, Weiduo Yuan, Alexander Romanus, Helen Xia, Vitor Campagnolo Guizilini, Yue Wang

机构 * University of Southern California(南加州大学) Toyota Research Institute(丰田研究机构)

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision language model(abstract);分类 cs.AI、cs.LG

AI总结 FuzzingRL通过强化模糊测试生成挑战性问题,揭示视觉语言模型的故障点并降低其准确性。

Comments 18 pages, 4 figures. † These authors jointly supervised this work: Jiageng Mao and Yue Wang

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07572 2026-03-10 cs.LG 83%

TS-MLLM: A Multi-Modal Large Language Model-based Framework for Industrial Time-Series Big Data Analysis

TS-MLLM:一种基于多模态大语言模型的工业时间序列大数据分析框架

Haiteng Wang, Yikang Li, Yunfei Zhu, Jingheng Yan, Lei Ren, Laurence T. Yang

机构 * School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院) School of Software, Beihang University(北京航空航天大学软件学院) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) State Key Laboratory of Intelligent Manufacturing System Technology(智能制造系统技术国家重点实验室) School of Computer and Artificial Intelligence, Zhengzhou University(郑州大学计算机与人工智能学院) Department of Computer Science, St. Francis Xavier University(圣弗朗西斯科大学计算机科学系)

专题命中 幻觉与鲁棒性 :MLLM(title,abstract);vision-language model(abstract);分类 cs.LG

AI总结 TS-MLLM通过多模态大语言模型联合建模时序信号、频域图像和文本知识,提升工业时间序列预测的鲁棒性、效率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07074 2026-03-10 cs.CV 83%

Physics-Guided VLM Priors for All-Cloud Removal

物理引导的VLM先验条件用于全云去除

Liying Xu, Huifang Li, Huanfeng Shen

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文提出PhyVLM-CR方法,结合VLM语义能力和物理模型,实现高保真全云去除,提升云去除与内容保留的平衡性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10110 2026-03-10 cs.RO cs.AI cs.LG 81%

IMPACT: Intelligent Motion Planning with Acceptable Contact Trajectories via Vision-Language Models

IMPACT: 通过视觉-语言模型实现可接受接触轨迹的智能运动规划

Yiyang Ling, Karan Owalekar, Oluwatobiloba Adesanya, Erdem Bıyık, Daniel Seita

机构 * Thomas Lord Department of Computer Science, Viterbi School of Engineering, University of Southern California(托马斯·劳德计算机科学系,维特里比工程学院,南加州大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.AI、cs.LG

AI总结 IMPACT通过视觉-语言模型实现高效的接触丰富运动规划,在杂乱环境中优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08708 2026-03-10 cs.CV 79%

FVG-PT: Adaptive Foreground View-Guided Prompt Tuning for Vision-Language Models

FVG-PT:适应性前景视图引导的提示微调用于视觉-语言模型

Haoyang Li, Liang Wang, Siyu Zhou, Jiacheng Sun, Jing Jiang, Chao Wang, Guodong Long, Yan Peng

机构 * University of Technology Sydney(悉尼技术大学) Shanghai University(上海大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 FVG-PT通过引入前景可靠性门、蒸馏补偿模块和先验校准模块,解决提示微调中前景注意力偏移问题,提升视觉-语言模型的适应性和泛化能力。

Comments 27 Pages, 9 Figures, 15 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04663 2026-03-10 cs.LG cs.AI cs.CE 62%

Neuro-Symbolic Financial Reasoning via Deterministic Fact Ledgers and Adversarial Low-Latency Hallucination Detector

通过确定性事实账本和对抗性低延迟幻觉检测器实现神经符号金融推理

Pedram Agand

机构 * FactAI Lab(FactAI实验室)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VeNRA,通过确定性事实账本和对抗性检测器实现零幻觉金融推理,结合确定性执行和高效检测机制,显著降低幻觉率并提升推理可靠性。

Comments 21 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07048 2026-03-10 cs.CV cs.AI 62%

Looking Back and Forth: Cross-Image Attention Calibration and Attentive Preference Learning for Multi-Image Hallucination Mitigation

回望与前行:用于多图像幻觉缓解的跨图像注意力校准与关注偏好学习

Xiaochen Yang, Hao Fang, Jiawei Kong, Yaoxin Mao, Bin Chen, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology(哈尔滨工业大学) Beijing Institute of Technology(北京理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳分校)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CAPL框架,通过跨图像注意力校准和偏好学习缓解多图像幻觉问题,提升模型对跨图像关联的建模能力,并在多个任务中取得稳定性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07911 2026-03-10 cs.CV 57%

Beyond Heuristic Prompting: A Concept-Guided Bayesian Framework for Zero-Shot Image Recognition

超越启发式提示:一种基于概念的贝叶斯框架用于零样本图像识别

Hui Liu, Kecheng Chen, Jialiang Wang, Xianming Liu, Wenya Wang, Haoliang Li

机构 * City University of Hong Kong(香港城市大学) Harbin Institute of Technology(哈尔滨工业大学) Nanyang Technological University(南洋理工大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出一种基于概念的贝叶斯框架,通过整合类特定概念提升零样本图像识别性能,采用多阶段概念合成和自适应软修剪似然,实现更鲁棒和高效的分类效果。

Comments 19 pages, Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07769 2026-03-10 cs.CV 57%

MedQ-Deg: A Multidimensional Benchmark for Evaluating MLLMs Across Medical Image Quality Degradations

MedQ-Deg:一个多维基准,用于评估医疗图像质量退化下的多模态大语言模型

Jiyao Liu, Junzhi Ning, Chenglong Ma, Wanying Qu, Jianghan Shen, Siqi Luo, Jinjie Wei, Jin Ye, Pengze Li, Tianbin Li, Jiashi Lin, Hongming Shan, Xinzhe Luo, Xiaohong Liu, Lihao Liu, Junjun He, Ningsheng Xu

机构 * Fudan University(复旦大学) Shanghai AI Lab(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) Imperial College London(伦敦帝国理工学院)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

AI总结 MedQ-Deg是一个多维基准,用于评估医疗图像质量退化下多模态大语言模型的性能,揭示模型在不同退化类型下的表现差异及置信度校准问题。

Comments 29 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07368 2026-03-10 cs.CL cs.AI 57%

Position: LLMs Must Use Functor-Based and RAG-Driven Bias Mitigation for Fairness

位置:LLMs必须使用基于函子和RAG驱动的偏见缓解以实现公平性

Ravi Ranjan, Utkarsh Grover, Agorista Polyzou

机构 * Knight Foundation School of Computing and Information Sciences(骑士基金会计算与信息科学学院) Florida International University(佛罗里达国际大学) College of Engineering(工程学院) University of South Florida(佛罗里达州立大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 本文提出通过范畴论转换和RAG结合的方法,解决LLMs中的偏见问题,以实现公平性。

Comments 24 pages, 3 figures

Journal ref Review available from NeurIPS 2025 reviwers

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06986 2026-03-10 cs.HC cs.CV 57%

ADAS-TO: A Large-Scale Multimodal Naturalistic Dataset and Empirical Characterization of Human Takeovers during ADAS Engagement

ADAS-TO:大规模多模态自然数据集及ADAS参与期间人类接管的实证分析

Yuhang Wang, Yiyao Xu, Jingran Sun, Hao Zhou

机构 * Department of Civil and Environmental Engineering, University of South Florida(土木与环境工程系,佛罗里达州立大学)

专题命中 幻觉与鲁棒性 :VLM(abstract);分类 cs.CV

AI总结 ADAS-TO数据集通过多模态分析揭示了ADAS参与期间人类接管的运动特征及视觉预警潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10285 2026-03-10 cs.AI 57%

Reallocating Attention Across Layers to Reduce Multimodal Hallucination

跨层分配注意力以减少多模态幻觉

Haolang Lu, Bolun Chu, WeiYe Fu, Guoshun Nan, Junning Liu, Minghui Pan, Qiankun Li, Yi Yu, Hua Wang, Kun Wang

机构 * Beijing University of Posts and Telecommunications, China(北京邮电大学) Nanyang Technological University, Singapore(南洋理工大学) Guangxi Transportation Science and Technology Group, China(广西交通科学和技术集团)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 通过跨层分配注意力减少多模态幻觉,提升推理一致性和视觉忠实性。

Comments Acceptted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08260 2026-03-10 cs.RO 50%

Seed2Scale: A Self-Evolving Data Engine for Embodied AI via Small to Large Model Synergy and Multimodal Evaluation

Seed2Scale: 一种通过小到大模型协同和多模态评估的自我进化数据引擎用于具身AI

Cong Tai, Zhaoyu Zheng, Haixu Long, Hansheng Wu, Zhengbin Long, Haodong Xiang, Rong Shi, Zhuo Cui, Shizhuang Zhang, Gang Qiu, He Wang, Ruifeng Li, Biao Liu, Zhenzhe Sun, Tao Shen

机构 * ZTE Corporation(中兴通讯公司)

专题命中 幻觉与鲁棒性 :vision-language model(abstract)

AI总结 Seed2Scale通过小到大模型协同和多模态评估,实现具身AI的自我进化数据引擎,显著提升性能并提供可扩展的开发路径

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07484 2026-03-10 cs.RO 50%

HSC-VLA: Hierarchical Scene-Clearing for Robust Bimanual Manipulation in Dense Clutter

HSC-VLA:分层场景清除用于密集杂乱环境中的鲁棒双臂操作

Zhen Liu, Xinyu Ning, Zhe Hu, XinXin Xie, Yitong Liu, Zhongzhu Pu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学)

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 HSC-VLA 通过分层场景清除方法提升密集杂乱环境中的双臂操作鲁棒性,实现 86.7% 的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08650 2026-03-10 cs.CY 50%

Who is Responsible? The Data, Models, Users or Regulations? A Comprehensive Survey on Responsible Generative AI for a Sustainable Future

谁该负责?数据、模型、用户还是法规?为可持续未来全面调查负责任的生成式人工智能

Shaina Raza, Rizwan Qureshi, Anam Zahid, Amgad Muneer, Anas Zafar, Safiullah Kamawal, Ferhat Sadak, Joseph Fioresi, Muhammaed Saeed, Ranjan Sapkota, Aditya Jain, Muneeb Ul Hassan, Aizan Zafar, Hasan Maqbool, Ashmal Vayani, Jia Wu, Maged Shoman

专题命中 幻觉与鲁棒性 :vision language model(abstract)

AI总结 本文全面调查了生成式人工智能的负责任发展,提出评估标准、生命周期指标及领域分析,旨在推动安全和可持续的AI部署。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07286 2026-03-10 cs.CL 50%

Taiwan Safety Benchmark and Breeze Guard: Toward Trustworthy AI for Taiwanese Mandarin

台湾安全基准与Breeze Guard:迈向可信的台湾台语AI

Po-Chun Hsu, Meng-Hsi Chen, Tsu Ling Chao, Chia Tien Han, Da-shan Shiu

机构 * MediaTek Research(联发科研究实验室) National Taiwan University(国立台湾大学)

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 本文提出TS-Bench基准和Breeze Guard模型,通过文化基础预训练提升台湾台语安全检测性能,显著优于现有模型。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17277 2026-03-10 cs.CR 50%

PolyJailbreak: Cross-Modal Jailbreaking Attacks on Black-Box Multimodal LLMs

PolyJailbreak: 对黑盒多模态大语言模型的跨模态劫持攻击

Xinkai Wang, Beibei Li, Zerui Shao, Ao Liu, Guangquan Xu, Shouling Ji

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract)

AI总结 PolyJailbreak通过多模态安全性不对称现象,提出结构化原子策略原语库,实现对黑盒多模态大语言模型的高效劫持攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏