arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-06 至 2026-01-06 共收录 6 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 6 篇

2508.06142 2026-01-06 cs.CV 83%

SDEval: Safety Dynamic Evaluation for Multimodal Large Language Models

SDEval: 多模态大语言模型的安全动态评估

Hanqing Wang, Yuan Tian, Mingyu Liu, Zhenhao Zhang, Xiangyang Zhu

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 SDEval通过动态调整安全基准分布和复杂度,提升多模态大语言模型的安全评估效果,缓解数据污染并揭示模型安全局限。

Comments AAAI 2026 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22535 2026-01-06 cs.AI cs.CL 79%

OFFSIDE: Benchmarking Unlearning Misinformation in Multimodal Large Language Models

OFFSIDE: 多模态大语言模型中误信信息消除的基准测试

Hao Zheng, Zirui Pang, Ling li, Zhijie Deng, Yuhan Pu, Zhaowei Zhu, Xiaobo Xia, Jiaheng Wei

机构 * Harbin Institute of Technology(哈尔滨工业大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) BIAI, ZJUT & D5Data.ai(BIAI、浙江工业大学及D5Data.ai) National University of Singapore(新加坡国立大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.AI

AI总结 OFFSIDE通过足球转会谣言数据集,评估多模态大语言模型中误信信息消除的挑战与方法,揭示现有技术的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02147 2026-01-06 cs.CV cs.AI cs.LG 78%

BiPrompt: Bilateral Prompt Optimization for Visual and Textual Debiasing in Vision-Language Models

BiPrompt:面向视觉与文本去偏的双重视觉语言模型双向提示优化

Sunny Gupta, Shounak Das, Amit Sethi

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV、cs.AI、cs.LG

AI总结 BiPrompt通过双重视觉语言模型双向提示优化,同时减轻视觉和文本中的非因果特征依赖,提升模型在分布偏移下的鲁棒性和因果推理能力。

Comments Accepted at the AAAI 2026 Workshop AIR-FM, Assessing and Improving Reliability of Foundation Models in the Real World

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18770 2026-01-06 cs.CV cs.AI cs.IR 76%

Multimodal Adversarial Defense for Vision-Language Models by Leveraging One-To-Many Relationships

通过利用一对一关系进行多模态对抗防御以提升视觉语言模型

Futa Waseda, Antonio Tejero-de-Pablos, Isao Echizen

机构 * The University of Tokyo(东京大学) CyberAgent National Institute of Informatics(信息处理研究所)

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV、cs.AI

AI总结 本文提出多模态对抗训练方法,通过利用图像与文本之间的一对多关系提升视觉语言模型的对抗鲁棒性。

Comments WACV 2026 Accepted. Code available at https://github.com/CyberAgentAILab/multimodal-adversarial-training

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00978 2026-01-06 cs.RO 67%

From Perception to Symbolic Task Planning: Vision-Language Guided Human-Robot Collaborative Structured Assembly

从感知到符号任务规划:基于视觉语言的引导人机协作结构装配

Yanyi Chen, Min Deng

机构 * Department of Civil, Environmental, and Construction Engineering, Texas Tech University(土木、环境与建设工程系,德克萨斯理工大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract)

AI总结 本文提出基于视觉语言模型的人机协作结构装配框架,通过感知到符号态和人感知规划模块提升动态环境下的态估计和任务规划鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14420 2026-01-06 cs.CV cs.AI 62%

DISCODE: Distribution-Aware Score Decoder for Robust Automatic Evaluation of Image Captioning

DISCODE:面向分布的评分解码器,用于鲁棒的图像描述评估

Nakamasa Inoue, Kanoko Goto, Masanari Oi, Martyna Gruszka, Mahiro Ukai, Takumi Hirose, Yusuke Sekikawa

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 DISCODE是一种无需微调的鲁棒图像描述评估方法,通过自适应测试时损失和多领域基准提升评估鲁棒性。

Comments Paper accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏