arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-01 至 2026-01-01 共收录 39 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 8 篇

2512.24591 2026-01-01 cs.CV 83%

Improving Few-Shot Change Detection Visual Question Answering via Decision-Ambiguity-guided Reinforcement Fine-Tuning

通过决策模糊性引导的强化微调提升少样本变化检测视觉问答

Fuyu Dong, Ke Li, Di Wang, Nan Luo, Yiming Zhang, Kaiyu Li, Jianfei Yang, Quan Wang

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Department of Mathematics, University of California, San Diego(加州大学圣地亚哥分校数学系) School of Software Engineering, Xi'an Jiaotong University(西安交通大学软件工程学院)

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 DARFT通过决策模糊性引导的强化微调提升CDVQA的判别性和鲁棒性,尤其在少样本场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24022 2026-01-01 cs.CV cs.AI 81%

FUSE-RSVLM: Feature Fusion Vision-Language Model for Remote Sensing

FUSE-RSVLM:用于遥感的特征融合视觉-语言模型

Yunkai Dang, Donghao Wang, Jiacheng Yang, Yifan Jiang, Meiyi Zhu, Yuekun Yang, Cong Wang, Qi Fan, Wenbin Li, Yang Gao

机构 * School of Artificial Intelligence Science and Technology, Nanjing University(人工智能科学与技术学院,南京大学)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 FUSE-RSVLM通过多特征融合技术提升遥感图像的视觉-语言处理能力,有效解决细粒度特征提取和视觉遗忘问题,在遥感分类、图像描述和VQA任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24271 2026-01-01 cs.CV cs.AI 73%

Taming Hallucinations: Boosting MLLMs' Video Understanding via Counterfactual Video Generation

驯服幻觉:通过反事实视频生成提升MLLMs的视频理解

Zhe Huang, Hao Wen, Aiming Hao, Bingze Song, Meiqi Wu, Jiahong Wu, Xiangxiang Chu, Sheng Lu, Haoqian Wang

机构 * Tsinghua University(清华大学) Beihang University(北航) AMAP, Alibaba Group(阿里妈妈实验室,阿里巴巴集团)

专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 通过反事实视频生成和对比训练,提升MLLMs对视频的理解能力并减少幻觉。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24340 2026-01-01 cs.CV cs.AI cs.CL 62%

DermaVQA-DAS: Dermatology Assessment Schema (DAS) & Datasets for Closed-Ended Question Answering & Segmentation in Patient-Generated Dermatology Images

DermaVQA-DAS:皮肤科评估方案(DAS)及用于患者生成皮肤科图像中封闭式问答与分割的数据库

Wen-wai Yim, Yujuan Fu, Asma Ben Abacha, Meliha Yetisgen, Noel Codella, Roberto Andres Novoa, Josep Malvehy

机构 * Microsoft Health AI(微软健康人工智能) University of Washington(华盛顿大学) Stanford University(斯坦福大学) Hospital Clinic of Barcelona(巴塞罗那医院诊所)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 DermaVQA-DAS引入了皮肤科评估方案DAS,支持封闭式问答与分割任务,通过专家标注数据集和多模态模型评估,提升患者为中心的皮肤科视觉语言模型研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00743 2026-01-01 cs.CL cs.AI cs.LG 62%

Multi-step retrieval and reasoning improves radiology question answering with large language models

多步检索与推理提升大型语言模型在放射学问答中的表现

Sebastian Wind, Jeta Sopa, Daniel Truhn, Mahshad Lotfinia, Tri-Thien Nguyen, Keno Bressem, Lisa Adams, Mirabela Rusu, Harald Köstler, Gerhard Wellein, Andreas Maier, Soroosh Tayebi Arasteh

专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 RaR通过多步检索与推理提升放射学问答中大型语言模型的诊断准确性和事实一致性。

Comments Published in npj Digital Medicine

Journal ref npj Digit. Med. 8, 790 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24947 2026-01-01 cs.CV cs.CL 57%

CPJ: Explainable Agricultural Pest Diagnosis via Caption-Prompt-Judge with LLM-Judged Refinement

CPJ: 通过基于提示-判断的图像描述实现可解释的农业害虫诊断

Wentao Zhang, Tao Fang, Lina Lu, Lifei Wang, Weihe Zhong

机构 * Business School, Shandong University of Technology, Shandong, China(山东科技大学商学院) Institute of International Language Services Studies, Macau Millennium College, Macau SAR, China(国际语言服务研究所,澳门 Millennium 学院)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

AI总结 CPJ通过基于提示-判断的图像描述实现可解释的农业害虫诊断,无需训练即可提升诊断性能。

Comments This paper is 6 pages in length and contains 2 figures. Tao Fang (Corresponding Author), Lina Lu (Co-corresponding Author)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24830 2026-01-01 cs.CL cs.AI 57%

Improving Reliability and Explainability of Medical Question Answering through Atomic Fact Checking in Retrieval-Augmented LLMs

通过检索增强的大语言模型中的原子事实核查来提高医疗问答的可靠性与可解释性

Juraj Vladika, Annika Domres, Mai Nguyen, Rebecca Moser, Jana Nano, Felix Busch, Lisa C. Adams, Keno K. Bressem, Denise Bernhardt, Stephanie E. Combs, Kai J. Borm, Florian Matthes, Jan C. Peeken

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 通过原子事实核查提升医疗问答的可靠性与可解释性,减少幻觉并提高事实准确性。

Comments 18 pages, 7 figures and tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18113 2026-01-01 cs.CV 57%

Chrono: A Simple Blueprint for Representing Time in MLLMs

Chrono: 一种用于多模态大语言模型中表示时间的简单蓝图

Hector Rodriguez, Boris Meinardus, Anil Batra, Anna Rohrbach, Marcus Rohrbach

专题命中 视觉问答 :MLLM(abstract);分类 cs.CV

AI总结 Chrono提出了一种简单通用的序列蓝图,用于提升多模态大语言模型在视频时间定位和 grounded 视频问答任务中的性能。

Comments Code: https://github.com/sudo-Boris/mr-Blip. Submitted to IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI). Under review

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 7 篇

2505.00742 2026-01-01 cs.CV cs.AI eess.IV 81%

Zoomer: Adaptive Image Focus Optimization for Black-box MLLM

Zoomer: 为黑盒大语言模型实现自适应图像聚焦优化

Jiaxu Qian, Chendong Wang, Yifan Yang, Chaoyun Zhang, Huiqiang Jiang, Xufang Luo, Yu Kang, Qingwei Lin, Anlan Zhang, Shiqi Jiang, Ting Cao, Tianjun Mao, Suman Banerjee, Guyue Liu, Saravan Rajmohan, Dongmei Zhang, Yuqing Yang, Qi Zhang, Lili Qiu

机构 * Microsoft(微软公司) Peking University(北京大学) University of Wisconsin Madison(威斯康星大学麦迪逊分校) University of Southern California(南加州大学)

专题命中 视觉推理 :MLLM(title);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 Zoomer通过自适应图像聚焦优化提升黑盒MLLM的多模态理解能力,显著提升准确性并减少token使用

Comments TMLR accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22998 2026-01-01 cs.AI 77%

TIM-PRM: Verifying multimodal reasoning with Tool-Integrated PRM

TIM-PRM:利用工具集成PRM验证多模态推理

Peng Kuang, Xiangxiang Wang, Wentao Liu, Jian Dong, Kaidi Xu

机构 * Zhejiang University(浙江大学) iFLYTEK AI Research Institute(iFLYTEK人工智能研究院) City University of Hong Kong(香港城市大学)

专题命中 视觉推理 :InternVL(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 TIM-PRM通过工具集成PRM验证多模态推理,有效解决视觉幻觉和逻辑不一致问题,实验表明其在性能和可解释性上优于现有模型。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15272 2026-01-01 cs.CL cs.AI cs.CV 73%

OmniBench: Towards The Future of Universal Omni-Language Models

OmniBench: 向通用多语言模型的未来迈进

Yizhi Li, Yinghao Ma, Ge Zhang, Ruibin Yuan, Kang Zhu, Hangyu Guo, Yiming Liang, Jiaheng Liu, Zekun Wang, Jian Yang, Siwei Wu, Xingwei Qu, Jinjie Shi, Xinyue Zhang, Zhenzhu Yang, Yidan Wen, Yanghai Wang, Shihao Li, Zhaoxiang Zhang, Zachary Liu, Emmanouil Benetos, Wenhao Huang, Chenghua Lin

机构 * University of Manchester(曼彻斯特大学) Queen Mary University of London(伦敦大学玛丽女王学院) Hongkong University of Science and Technology(香港科学与技术大学) Nanjing University(南京大学) Dartmouth College(达特茅斯学院)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 OmniBench提出了一种评估通用多语言模型三模态处理能力的基准,揭示了现有模型在多模态推理中的不足,并提出OmniInstruct数据集以改进训练方法。

Comments Accepted by The Thirty-Ninth Annual Conference on Neural Information Processing Systems (NeurIPS2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24404 2026-01-01 cs.LG cs.CV 62%

Lifting Vision: Ground to Aerial Localization with Reasoning Guided Planning

提升视觉:基于推理引导的地面到空中定位

Soham Pahari, M. Srinivas

机构 * School of Computer Science, UPES(UPES计算机科学学院) Department of CS&E, NIT Warangal(NIT Warangal计算机科学与工程系)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG

AI总结 本文提出ViReLoc框架,通过视觉推理实现地面到空中定位,无需依赖GPS数据,提升空间推理和跨视角检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24165 2026-01-01 cs.CV 57%

DiffThinker: Towards Generative Multimodal Reasoning with Diffusion Models

DiffThinker: 向基于扩散模型的生成多模态推理迈进

Zefeng He, Xiaoye Qu, Yafu Li, Tong Zhu, Siyuan Huang, Yu Cheng

机构 * Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 DiffThinker通过基于扩散模型的生成方法,在多模态推理任务中实现了更高效的视觉推理和更精确的空间处理,显著优于现有模型。

Comments Project page: https://diffthinker-project.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24119 2026-01-01 cs.CV 57%

GeoBench: Rethinking Multimodal Geometric Problem-Solving via Hierarchical Evaluation

GeoBench: 通过分层评估重新思考多模态几何问题解决

Yuan Feng, Yue Yang, Xiaohan He, Jiatong Zhao, Jianlong Chen, Zijun Chen, Daocheng Fu, Qi Liu, Renqiu Xia, Bo Zhang, Junchi Yan

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 GeoBench通过分层评估框架,系统评估几何问题解决能力,揭示任务复杂度对性能的影响及子目标分解的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24100 2026-01-01 cs.CV 57%

Think Before You Move: Latent Motion Reasoning for Text-to-Motion Generation

在行动前思考:用于文本到动作生成的潜在动作推理

Yijie Qian, Juncheng Wang, Yuxiang Feng, Chao Xu, Wang Lu, Yang Liu, Baigui Sun, Yiqiang Chen, Yong Liu, Shujun Wang

机构 * Zhejiang University(浙江大学) Hong Kong Polytechnic University(香港理工大学) IROOTECH TECHNOLOGY(IROOTECH技术) Wolf 1069 b Lab, Sany Group(Wolf 1069 b实验室,三一集团) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

AI总结 本文提出Latent Motion Reasoning框架,通过分阶段推理与执行提升文本到动作生成的语义与物理合理性。

Comments project page: https://chenhaoqcdyq.github.io/LMR/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 10 篇

2512.06205 2026-01-01 cs.AI cs.CL cs.LG 81%

On measuring grounding and generalizing grounding problems

关于测量 grounding 并推广 grounding 问题

Daniel Quigley, Eric Maynard

机构 * Center for Possible Minds(可能心智中心) Indiana University(印第安纳大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种框架,用于测量和推广 grounding 问题,通过定义不同需求和评估标准,分析了符号、参照、向量和关系四种模式的 grounding 现状,并探讨了其在不同任务中的表现。

Comments resubmission: 39 pages, 85 sources, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24605 2026-01-01 cs.CV 79%

MoniRefer: A Real-world Large-scale Multi-modal Dataset based on Roadside Infrastructure for 3D Visual Grounding

MoniRefer: 一种基于道路基础设施的现实世界大规模多模态数据集用于3D视觉定位

Panquan Yang, Junfei Huang, Zongzhangbao Yin, Yingsong Hu, Anni Xu, Xinyi Luo, Xueqi Sun, Hai Wu, Sheng Ao, Zhaoxing Zhu, Chenglu Wen, Cheng Wang

机构 * Xiamen University(厦门大学) Pengcheng Laboratory(鹏城实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出MoniRefer数据集和Moni3DVG方法,用于解决户外监控场景下的3D视觉定位问题。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24023 2026-01-01 cs.CV cs.AI 79%

RSAgent: Learning to Reason and Act for Text-Guided Segmentation via Multi-Turn Tool Invocations

RSAgent: 通过多轮工具调用学习推理与行动进行文本引导的分割

Xingqi He, Yujie Zhang, Shuyong Gao, Wenjie Li, Lingyi Hong, Mingxi Chen, Kaixun Jiang, Jiyuan Fu, Wenqiang Zhang

机构 * Shanghai Key Lab of Intelligent Information Processing, College of Computer Science and Artificial Intelligence, Fudan University(上海智能信息处理关键实验室,计算机科学与人工智能学院,复旦大学) Artificial Intelligence, Fudan University(人工智能,复旦大学)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 RSAgent通过多轮工具调用实现文本引导分割的推理与行动,采用两阶段框架提升分割性能,达到领域内和领域外基准的最先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24097 2026-01-01 cs.CV cs.AI cs.CL cs.MM 73%

Factorized Learning for Temporally Grounded Video-Language Models

分解学习用于时间感知的视频-语言模型

Wenzheng Zeng, Difei Gao, Mike Zheng Shou, Hwee Tou Ng

机构 * National University of Singapore(新加坡国立大学)

专题命中 视觉定位与Grounding :VLM(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出D$^2$VLM框架,通过分解学习方法提升视频-语言模型在时间定位和文本响应任务中的性能,引入证据标记和FPO算法以优化学习过程。

Comments ICCV 2025 paper. This arXiv version updates Figure 1 to include the concurrent work Qwen2.5-VL to ensure consistency with Table 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10969 2026-01-01 cs.CV 70%

Bringing The Consistency Gap: Explicit Structured Memory for Interleaved Image-Text Generation

弥合一致性差距:用于交错图像-文本生成的显式结构化记忆

Zeteng Lin, Xingxing Li, Wen You, Xiaoyang Li, Zehan Lu, Yujun Cai, Jing Tang

机构 * Hong Kong University of Science and Technology(Guangzhou)(香港科技大学(广州)) University of Queensland(昆士兰大学)

专题命中 视觉定位与Grounding :vision language model(abstract);grounding(abstract);分类 cs.CV

AI总结 IUT-Plug通过显式结构化记忆机制解决多模态生成中的上下文漂移问题,提升长序列一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23739 2026-01-01 cs.CL cs.AI cs.CV cs.RO 62%

Break Out the Silverware -- Semantic Understanding of Stored Household Items

拿出银器——对存储家居物品的语义理解

Michaela Levi-Richter, Reuth Mirsky, Oren Glickman

机构 * Bar Ilan University, Computer Science Department(巴伊兰大学计算机科学系) Tufts University, Department of Computer Science(塔夫茨大学计算机科学系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出NOAM模型,通过结合结构化场景理解和大语言模型推理,实现对家庭物品存储位置的语义理解,显著提升预测准确率并接近人类水平。

Comments Poster presented at the Israeli Seminar on Computational Linguistics 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24684 2026-01-01 cs.CL cs.AI 57%

R-Debater: Retrieval-Augmented Debate Generation through Argumentative Memory

R-Debater:通过论证记忆的检索增强辩论生成

Maoyuan Li, Zhongsheng Wang, Haoyuan Li, Jiamou Liu

机构 * Wuhan College of Communication(武汉通信学院) Wuhan College of Communication University of Auckland(武汉通信学院奥克兰大学) University of Auckland(奥克兰大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 R-Debater通过整合检索和结构化规划,实现了更忠实、一致且连贯的多轮辩论生成。

Comments Accepteed by AAMAS 2026 full paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22693 2026-01-01 cs.CV 57%

VADTree: Explainable Training-Free Video Anomaly Detection via Hierarchical Granularity-Aware Tree

VADTree: 通过分层粒度感知树实现可解释的无训练视频异常检测

Wenlong Li, Yifei Xu, Yuan Rao, Zhenhua Wang, Shuiguang Deng

机构 * School of Software, Xi’an Jiaotong University(西安交通大学软件学院) China Railway Xi’an Group(中国铁路西安集团) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 视觉定位与Grounding :visual language model(abstract);分类 cs.CV

AI总结 VADTree通过分层粒度感知树结构实现无训练视频异常检测,利用预训练模型知识和多维先验提升异常感知与推理能力。

Comments NeurIPS 2025 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24428 2026-01-01 cs.RO 50%

Subsecond 3D Mesh Generation for Robot Manipulation

亚秒级机器人操作用3D网格生成

Qian Wang, Omar Abdellall, Tony Gao, Xiatao Sun, Daniel Rakita

机构 * Office of Naval Research(海军研究办公室)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究提出了一种亚秒级3D网格生成系统,通过集成开放词汇分割、加速扩散生成和稳健点云注册,实现高保真网格的快速生成,用于机器人感知与规划。

Comments In submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04235 2026-01-01 cs.CL 50%

Addressing Hallucinations with RAG and NMISS in Italian Healthcare LLM Chatbots

通过RAG和NMISS解决意大利医疗LLM聊天机器人中的幻觉

Maria Paola Priola

机构 * Department of Economics and Business, University of Cagliari(经济与商业系,卡利亚里大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文通过RAG和NMISS方法有效缓解和检测LLM中的幻觉问题,验证了GPT-4和NMISS对提升医疗领域LLM性能的显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. GUI与屏幕智能体 1 篇

2512.24321 2026-01-01 cs.CV cs.RO 57%

UniAct: Unified Motion Generation and Action Streaming for Humanoid Robots

UniAct:面向人形机器人的统一动作生成与动作流

Nan Jiang, Zimo He, Wanhe Yu, Lexi Pang, Yunhao Li, Hongjie Li, Jieming Cui, Yuhan Li, Yizhou Wang, Yixin Zhu, Siyuan Huang

机构 * Institute for AI, Peking University(人工智能研究院,北京大学) Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院) School of Psychological and Cognitive Sciences, Peking University(心理学与认知科学学院,北京大学) School of Computer Science, Peking University(计算机科学学院,北京大学) Yuanpei College, Peking University(元培学院,北京大学) School of Foreign Languages, Peking University(外语学院,北京大学) School of EECS, Peking University(电子工程与科学学院,北京大学) Huazhong University of Science and Technology(华中科技大学) State Key Lab of General AI(通用人工智能国家重点实验室) Nat’l Eng. Research Center of Visual Technology(视觉技术国家工程研究中心) Beijing Key Laboratory of Behavior and Mental Health, Peking University(北京行为与心理健康重点实验室,北京大学) Embodied Intelligence Lab, PKU-Wuhan Institute for Artificial Intelligence(具身智能实验室,北京大学-武汉人工智能研究院)

专题命中 GUI与屏幕智能体 :MLLM(abstract);分类 cs.CV

AI总结 UniAct通过统一感知与控制框架,实现人形机器人在多模态指令下的高效动作生成与实时执行,提升零样本跟踪成功率19%。

Comments Project page: https://jnnan.github.io/uniact/

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与鲁棒性 1 篇

2406.17126 2026-01-01 cs.CV cs.LG 62%

MM-SpuBench: Towards Better Understanding of Spurious Biases in Multimodal LLMs

MM-SpuBench:迈向更好地理解多模态大语言模型中伪偏差的深入研究

Wenqian Ye, Bohan Liu, Guangtao Zheng, Di Wang, Yunsheng Ma, Xu Cao, Bolin Lai, James M. Rehg, Aidong Zhang

机构 * University of Virginia(弗吉尼亚大学) Purdue University(普渡大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 MM-SpuBench通过分析多模态大语言模型中的伪偏差,揭示其存在与缓解的挑战,提供公开基准以促进相关技术发展。

Comments Accepted at KDD 2026 (Dataset and Benchmark Track)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. VLM训练与架构 11 篇

2512.24013 2026-01-01 cs.CV 83%

Bridging the Perception-Cognition Gap:Re-engineering SAM2 with Hilbert-Mamba for Robust VLM-based Medical Diagnosis

弥合感知-认知鸿沟:通过希尔伯特-马amba重新工程SAM2以实现鲁棒的基于VLM的医学诊断

Hao Wu, Hui Li, Yiyun Su

机构 * Southern University of Science and Technology(南方科技大学) School of Informatics, Xiamen University(厦门大学信息学院) Rutgers University(罗格斯大学)

专题命中 VLM训练与架构 :VLM(title,abstract);visual language model(abstract);分类 cs.CV

AI总结 通过重新设计SAM2架构,引入希尔伯特空间填充曲线和希尔伯特-马amba交叉注意力机制,提升基于VLM的医学图像分割与诊断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06970 2026-01-01 cs.CV 83%

Guiding Cross-Modal Representations with MLLM Priors via Preference Alignment

通过偏好对齐引导跨模态表示

Pengfei Zhao, Rongbo Luan, Wei Zhang, Peng Wu, Sifeng He

机构 * Apple(苹果公司)

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 MAPLE通过利用多模态大语言模型的细粒度对齐先验,引导跨模态表示学习,提升细粒度检索性能。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17221 2026-01-01 cs.CV 79%

DAVE: A VLM Vision Encoder for Document Understanding and Web Agents

DAVE: 一种用于文档理解与网络代理的视觉编码器

Brandon Huang, Hang Hua, Zhuoran Yu, Trevor Darrell, Rogerio Feris, Roei Herzig

机构 * MIT-IBM Watson AI Lab(MIT-IBM Watson AI实验室) UC Berkeley(加州大学伯克利分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV

AI总结 DAVE是一种专为文档理解和网络代理设计的视觉编码器,通过自监督和监督预训练结合模型融合策略,提升对文档和网络任务的适应性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏