arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-09 至 2025-12-09 共收录 8 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 8 篇

2502.00843 2025-12-09 cs.CV 88%

VLM-Assisted Continual learning for Visual Question Answering in Self-Driving

基于视觉语言模型的持续学习用于自动驾驶中的视觉问答

Yuxin Lin, Mengshi Qi, Liang Liu, Huadong Ma

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视觉问答 :visual question answering(title,abstract);VLM(title);vision-language model(abstract);分类 cs.CV

AI总结 本文提出结合视觉语言模型与持续学习的方法,以提升自动驾驶中视觉问答系统的性能和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07302 2025-12-09 cs.CV cs.AI 88%

Towards Accurate UAV Image Perception: Guiding Vision-Language Models with Stronger Task Prompts

迈向准确的无人机图像感知:通过更强的任务提示引导视觉-语言模型

Mingning Guo, Mengwei Wu, Shaoxian Li, Haifeng Li, Chao Tao

机构 * School of Geosciences and InfoPhysics, Central South University(地质科学与信息物理学院,中南大学)

专题命中 视觉问答 :vision-language model(title);VLM(abstract);visual reasoning(abstract);visual question answering(abstract)

AI总结 AerialVP通过增强任务提示提升无人机图像感知性能,引入AerialSense基准评估模型在复杂场景下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01371 2025-12-09 cs.CV 83%

CLIP-UP: CLIP-Based Unanswerable Problem Detection for Visual Question Answering

CLIP-UP: 基于CLIP的视觉问答中不可回答问题检测

Ben Vardi, Oron Nir, Ariel Shamir

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 CLIP-UP通过基于CLIP的相似性度量,为视觉问答模型提供检测不可回答问题的能力,提升模型在不可回答问题上的识别性能。

Comments Revised version. Improvements include support for open-ended VQA and an alternative injection method

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25374 2025-12-09 cs.AI cs.CV 81%

Saliency Guided Longitudinal Medical Visual Question Answering

基于显著性的纵向医学视觉问答

Jialin Wu, Xiaofeng Liu

机构 * Dept. of Computer Science and Engineering University of California, San Diego(计算机科学与工程系,加州大学圣地亚哥分校) Dept. of Radiology and Biomedical Imaging Yale University(放射学与生物医学成像系,耶鲁大学)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于显著性的纵向医学视觉问答模型,通过显著性引导的编码器-解码器结构,在保持空间一致性的同时实现高效的临床变化识别。

Comments Published in NeurIPS Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04686 2025-12-09 cs.CV 79%

Towards Cross-View Point Correspondence in Vision-Language Models

面向视觉-语言模型的跨视图点对应研究

Yipu Wang, Yuheng Ji, Yuyang Liu, Enshen Zhou, Ziqiang Yang, Yuxuan Tian, Ziheng Qin, Yue Liu, Huajie Tan, Cheng Chi, Zhiyuan Ma, Daniel Dajun Zeng, Xiaolong Zheng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beihang University(北航大学) Jilin University(吉林大学) National University of Singapore(新加坡国立大学) Peking University(北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Huazhong University of Science And Technology(华中科技大学)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出跨视图点对应任务和 CrossPoint-Bench 基准,通过 CroPond 模型在 CrossPoint-Bench 上取得超越 Gemini-2.5-Pro 的准确率,推动跨视图对应研究发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06020 2025-12-09 cs.CV cs.AI 79%

PrefGen: Multimodal Preference Learning for Preference-Conditioned Image Generation

PrefGen: 多模态偏好学习用于偏好条件下的图像生成

Wenyi Mo, Tianyu Zhang, Yalong Bai, Ligong Han, Ying Ba, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) iN2X MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) Red Hat AI Innovation(红帽人工智能创新)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 PrefGen通过多模态大语言模型提取用户偏好并注入扩散模型,实现个性化图像生成,优于现有方法。

Comments Project Page: \href{https://prefgen.github.io/}{\texttt{https://prefgen.github.io}}

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14555 2025-12-09 cs.CV 57%

Descrip3D: Enhancing Large Language Model-based 3D Scene Understanding with Object-Level Text Descriptions

Descrip3D: 通过物体级文本描述增强基于大语言模型的3D场景理解

Jintang Xue, Ganning Zhao, Jie-En Yao, Hong-En Chen, Yue Hu, Meida Chen, Suya You, C. -C. Jay Kuo

机构 * University of Southern California(南加州大学) DEVCOM Army Research Laboratory(国防部陆军研究实验室)

专题命中 视觉问答 :grounding(abstract);分类 cs.CV

AI总结 Descrip3D通过引入物体级文本描述,提升大语言模型在3D场景理解中的关系推理能力,有效增强复杂室内场景的语义理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06096 2025-12-09 cs.CV 57%

BeLLA: End-to-End Birds Eye View Large Language Assistant for Autonomous Driving

BeLLA:端到端的鸟瞰图大语言助手用于自动驾驶

Karthik Mohan, Sonam Singh, Amit Arvind Kale

机构 * UC San Diego(加州大学圣地亚哥分校) Robert Bosch Corporate Research India(博世印度公司研究)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

AI总结 BeLLA通过端到端架构连接统一的360°鸟瞰图表示与大语言模型,提升自动驾驶中的空间推理和问答能力。

详情

展开后加载摘要…

URL PDF HTML 收藏