arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-10 至 2025-12-10 共收录 27 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 1 篇

2506.00238 2025-12-10 cs.CV cs.CL cs.IR cs.LG 86%

ZeShot-VQA: Zero-Shot Visual Question Answering Framework with Answer Mapping for Natural Disaster Damage Assessment

ZeShot-VQA:一种基于零样本学习的视觉问答框架,用于自然灾害损害评估

Ehsan Karimi, Maryam Rahnemoonfar

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出基于零样本学习的ZeShot-VQA框架,用于自然灾害损害评估,无需微调即可处理新数据集并生成未见过的答案。

Comments Accepted by the 2025 IEEE International Geoscience and Remote Sensing Symposium (IGARSS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 5 篇

2512.08860 2025-12-10 cs.CV 83%

Tri-Bench: Stress-Testing VLM Reliability on Spatial Reasoning under Camera Tilt and Object Interference

Tri-Bench:在相机倾斜和物体干扰下测试VLM在空间推理中的可靠性

Amit Bendkhale

机构 * Amit Bendkhale(独立研究者)

专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 Tri-Bench通过测试VLM在相机倾斜和物体干扰下的空间推理可靠性,揭示了模型在几何推理中的不足。

Comments 6 pages, 3 figures. Code and data: https://github.com/Amiton7/Tri-Bench. Accepted to the AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08889 2025-12-10 cs.CV cs.AI 79%

No Labels, No Problem: Training Visual Reasoners with Multimodal Verifiers

无标签,无问题:利用多模态验证器训练视觉推理器

Damiano Marsili, Georgia Gkioxari

机构 * California Institute of Technology(加州理工学院)

专题命中 视觉推理 :VLM(abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出无需标注的视觉推理训练框架,结合AI驱动的验证器提升推理与定位能力,超越现有开源和专有模型。

Comments Project webpage: https://glab-caltech.github.io/valor/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08228 2025-12-10 cs.CV cs.AI 79%

MM-CoT:A Benchmark for Probing Visual Chain-of-Thought Reasoning in Multimodal Models

MM-CoT:一种用于探测多模态模型中视觉链式推理的基准测试

Jusheng Zhang, Kaitong Cai, Xiaoyang Guo, Sidi Liu, Qinhan Lv, Ruiqi Chen, Jing Yang, Yijia Fan, Xiaofei Sun, Jian Wang, Ziliang Chen, Liang Lin, Keze Wang

机构 * Sun Yat-sen University(中山大学) Alibaba Group(阿里巴巴集团) Snap Inc(Snap公司)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 MM-CoT是一种用于评估多模态模型视觉链式推理能力的基准测试,通过验证推理链的视觉一致性和逻辑一致性,揭示生成模型在真实推理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08820 2025-12-10 cs.CV cs.AI 62%

Training-Free Dual Hyperbolic Adapters for Better Cross-Modal Reasoning

无需训练的双双曲适配器用于更高效的跨模态推理

Yi Zhang, Chun-Wun Cheng, Junyi He, Ke Yu, Yushun Tang, Carola-Bibiane Schönlieb, Zhihai He, Angelica I. Aviles-Rivero

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Department of Electrical and Electronic Engineering, Southern University of Science and Technology(南方科技大学电子与电气工程系) Department of Applied Mathematics and Theoretical Physics, University of Cambridge(剑桥大学应用数学与理论物理系) Yau Mathematical Sciences Center, Tsinghua University(清华大学应用数学中心)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出无需训练的双双曲适配器方法,通过双曲空间嵌入提升跨模态推理性能,实现更高效的领域泛化和少样本识别。

Comments Accepted in IEEE Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07007 2025-12-10 cs.CV 57%

MELLM: A Flow-Guided Large Language Model for Micro-Expression Understanding

MELLM:一种面向微表情理解的流引导大型语言模型

Sirui Zhao, Zhengye Zhang, Shifeng Liu, Xinglong Mao, Shukang Yin, Chaoyou Fu, Tong Xu, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) Nanjing University(南京大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 MELLM通过结合光学流敏感性与LLM推理能力,首次实现对微表情的全面理解,显著提升微表情识别的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 5 篇

2512.07215 2025-12-10 cs.CV cs.AI 88%

VFM-VLM: Vision Foundation Model and Vision Language Model based Visual Comparison for 3D Pose Estimation

基于视觉基础模型和视觉语言模型的3D姿态估计视觉比较:VFM-VLM

Md Selim Sarowar, Sungho Kim

机构 * Dept. of Electronic Engineering Yeungnam University Advanced Visual Intelligence Lab(电子工程系 韩国又南大学 高级视觉智能实验室)

专题命中 视觉定位与Grounding :vision language model(title,abstract);VLM(title);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文比较了基于CLIP和DINOv2的视觉模型在3D姿态估计中的性能,展示了两者在语义理解和几何精度上的互补优势,为机器人抓取应用提供了模型选择依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00518 2025-12-10 cs.CV cs.CL 79%

Fine-grained Spatiotemporal Grounding on Egocentric Videos

细粒度眼动视频时空定位

Shuo Liang, Yiwu Zhong, Zi-Yuan Hu, Yeyao Tao, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出EgoMask基准和EgoMask-Train数据集,针对眼动视频细粒度时空定位的挑战,通过微调提升模型性能。

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06335 2025-12-10 cs.CV 74%

Harnessing Object Grounding for Time-Sensitive Video Understanding

利用物体接地提升时间敏感视频理解

Tz-Ying Wu, Sharath Nittur Sridhar, Subarna Tripathi

机构 * Intel(英特尔公司)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.CV

AI总结 本文提出 GO-Tokenizer 以提升视频大型语言模型的时间敏感视频理解能力,通过实时编码紧凑的物体信息,提高模型性能并减少噪声影响。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08188 2025-12-10 cs.RO cs.AI cs.CV 62%

Embodied Tree of Thoughts: Deliberate Manipulation Planning with Embodied World Model

具身思维树:基于具身世界模型的 deliberative 操控规划

Wenjiang Xu, Cindy Wang, Rui Fang, Mingkang Zhang, Lusong Li, Jing Xu, Jiayuan Gu, Zecui Zeng, Rui Chen

机构 * University of Chinese Academy of Sciences (UCAS)(中国科学院大学) Tsinghua University(清华大学) JD Explore Academy(京东探索学院) ShanghaiTech University(上海科技大学) Nanjing University(南京大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 EToT通过基于物理的交互数字双胞胎实现具身世界模型,结合先验分支和反思分支机制,提升机器人操控规划的物理一致性和鲁棒性。

Comments Website at https://embodied-tree-of-thoughts.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07845 2025-12-10 cs.SD cs.AI eess.AS 57%

AudioScene: Integrating Object-Event Audio into 3D Scenes

AudioScene: 将对象事件音频整合到3D场景中

Shuaihang Yuan, Congcong Wen, Muhammad Shafique, Anthony Tzes, Yi Fang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出AudioScene数据集,通过整合音频事件与3D场景,探索音频条件任务,提升空间学习的准确性与多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 1 篇

2512.08922 2025-12-10 cs.CV 70%

Unified Diffusion Transformer for High-fidelity Text-Aware Image Restoration

统一扩散变压器用于高质量文本感知图像恢复

Jin Hyeon Kim, Paul Hyunbin Cho, Claire Kim, Jaewon Min, Jaeeun Lee, Jihye Park, Yeji Choi, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所) Samsung Electronics(三星电子)

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 UniT通过整合扩散变压器、视觉-语言模型和文本识别模块,实现高质量文本感知图像恢复,有效抑制文本幻觉并取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 3 篇

2512.08529 2025-12-10 cs.CV 79%

MVP: Multiple View Prediction Improves GUI Grounding

MVP: 多视角预测改进 GUI 定位

Yunzhu Zhang, Zeyu Pan, Zhengwen Zeng, Shuheng Shen, Changhua Meng, Linchao Zhu

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) College of Computer Science and Technology, Hangzhou Dianzi University(杭州电子科技大学计算机科学与技术学院) Venus Team, Ant Group(蚂蚁集团 Venus 团队)

专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.CV

AI总结 MVP 通过多视角预测方法提升 GUI 定位的稳定性与准确性,显著提高多个模型的性能指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08629 2025-12-10 cs.AI cs.CV cs.HC 73%

See-Control: A Multimodal Agent Framework for Smartphone Interaction with a Robotic Arm

See-Control: 一种多模态代理框架用于智能手机与机械臂的交互

Haoyu Zhao, Weizhong Ding, Yuhao Yang, Zheng Tian, Linyi Yang, Kun Shao, Jun Wang

机构 * University College London(伦敦大学学院) Imperial College London(伦敦帝国学院) Huawei Noah’s Ark Lab(华为诺亚实验室) ShanghaiTech University(上海科技大学) Southern University of Science(南方科技大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 See-Control通过直接与机械臂交互实现智能手机操作,无需ADB或系统后台访问,提供了一个平台无关的多模态代理框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08186 2025-12-10 cs.RO 67%

Ground Slow, Move Fast: A Dual-System Foundation Model for Generalizable Vision-and-Language Navigation

放慢脚步,快速移动:一种通用视觉-语言导航的双系统基础模型

Meng Wei, Chenyang Wan, Jiaqi Peng, Xiqian Yu, Yuqiang Yang, Delin Feng, Wenzhe Cai, Chenming Zhu, Tai Wang, Jiangmiao Pang, Xihui Liu

机构 * Shanghai AI Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) Tsinghua University(清华大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)

AI总结 DualVLN通过双系统架构,结合高层推理与低层动作执行,提升视觉-语言导航的泛化能力和动态环境适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与鲁棒性 4 篇

2512.08233 2025-12-10 cs.RO 82%

Semantic-Metric Bayesian Risk Fields: Learning Robot Safety from Human Videos with a VLM Prior

语义-度量贝叶斯风险场:从人类视频中学习机器人安全性的方法

Timothy Chen, Marcus Dominguez-Kuhne, Aiden Swann, Xu Liu, Mac Schwager

机构 * Stanford University(斯坦福大学) California Institute of Technology(加州理工学院)

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision-language model(abstract)

AI总结 本文提出基于贝叶斯框架的语义-度量风险场,通过人类视频学习机器人安全风险模型,实现类人风险评估与规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23856 2025-12-10 cs.CL cs.AI cs.HC cs.LG 62%

OMNIGUARD: An Efficient Approach for AI Safety Moderation Across Languages and Modalities

OMNIGUARD:一种跨语言和模态的高效AI安全审查方法

Sahil Verma, Keegan Hines, Jeff Bilmes, Charlotte Siska, Luke Zettlemoyer, Hila Gonen, Chandan Singh

机构 * University of Washington(华盛顿大学) Microsoft(微软公司)

专题命中 幻觉与鲁棒性 :MLLM(abstract);分类 cs.AI、cs.LG

AI总结 Omniguard提出了一种跨语言和模态的高效方法,通过构建语言或模态无关的分类器提升有害提示检测的准确率,并在多语言、图像和音频提示任务中取得显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07497 2025-12-10 cs.AI cs.SE 57%

How Do LLMs Fail In Agentic Scenarios? A Qualitative Analysis of Success and Failure Scenarios of Various LLMs in Agentic Simulations

大型语言模型在代理场景中为何失败?对各种LLM在代理模拟中成功与失败场景的定性分析

JV Roig

机构 * Kamiwaza AI

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 研究分析了LLM在代理任务中的失败原因,发现模型规模不决定鲁棒性,强调训练和设计对可靠性的重要性。

Comments 48 pages, 3 tables, 2 listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08653 2025-12-10 cs.RO 50%

A Sensor-Aware Phenomenological Framework for Lidar Degradation Simulation and SLAM Robustness Evaluation

一种面向传感器的现象学框架用于激光雷达退化仿真和SLAM鲁棒性评估

Doumegna Mawuto Koudjo Felix, Xianjia Yu, Zhuo Zou, Tomi Westerlund

机构 * Turku Intelligent Embedded and Robotic Systems (TIERS) Lab , University of Turku(图尔库智能嵌入与机器人系统实验室,图尔库大学) School of Information Science and Technology, Fudan University(信息科学与技术学院,复旦大学)

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 本文提出一种面向传感器的现象学框架,用于模拟激光雷达退化并评估SLAM系统的鲁棒性,通过保留点云结构并应用多种退化方法,实现可控的仿真测试。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. VLM训练与架构 7 篇

2503.23062 2025-12-10 cs.CV 83%

Shape and Texture Recognition in Large Vision-Language Models

大规模视觉-语言模型中的形状与纹理识别

Sagi Eppel, Mor Bismut, Alona Faktor-Strugatski

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 研究发现大规模视觉-语言模型在识别抽象形状和纹理时表现不足,而人类和简单网络表现更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08374 2025-12-10 cs.CV 70%

The Unseen Bias: How Norm Discrepancy in Pre-Norm MLLMs Leads to Visual Information Loss

看不见的偏见:预规范MLLM中规范差异如何导致视觉信息丢失

Bozhou Li, Xinda Xue, Sihan Yang, Yang Shi, Xinlong Chen, Yushuo Guan, Yuanxing Zhang, Wentao Zhang

机构 * Peking University(北京大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Xi’an Jiaotong University(西安交通大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 VLM训练与架构 :LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文揭示了预规范MLLM中规范差异导致的视觉信息丢失问题,并提出通过插入层规范层来解决这一问题,提升模型整体能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04713 2025-12-10 cs.CV 70%

Enabling Validation for Robust Few-Shot Recognition

使基于VLM微调的鲁棒少样本识别得以验证

Hanxin Wang, Tian Liu, Shu Kong

机构 * University of Macau(澳门大学) Texas A&M University(德克萨斯A&M大学) Institute of Collaborative Innovation(协同创新研究所)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出VEST框架,通过验证启用的分阶段微调策略,解决少样本识别中验证数据不足的问题,提升模型在ID和OOD数据上的泛化能力。

Comments Project website: https://hannawang09.github.io/projects/vest/

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02239 2025-12-10 cs.CV cs.AI 62%

MiniGPT-5: Interleaved Vision-and-Language Generation via Generative Vokens

MiniGPT-5:通过生成性vokens实现交错的视觉-语言生成

Kaizhi Zheng, Xuehai He, Xin Eric Wang

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) University of California, Santa Barbara(加州大学圣芭芭拉分校)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 MiniGPT-5通过生成性vokens实现交错的视觉-语言生成,显著提升多模态生成任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08627 2025-12-10 cs.CV 57%

Trajectory Densification and Depth from Perspective-based Blur

轨迹密集化与基于视角的模糊深度估计

Tianchen Qiu, Qirun Zhang, Jiajian He, Zhengyue Zhuge, Jiahui Xu, Yueting Chen

机构 * College of Optical Science and Engineering(光学科学与工程学院) Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出了一种基于视角模糊和密集轨迹的深度估计方法,利用视觉-语言模型和光学设计算法实现大范围深度的高精度重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08524 2025-12-10 cs.CV cs.CL 57%

Beyond Real Weights: Hypercomplex Representations for Stable Quantization

超越真实权重:用于稳定量化 的超复数表示

Jawad Ibn Ahad, Maisha Rahman, Amrijit Biswas, Muhammad Rafsan Kabir, Robin Krambroeckers, Sifat Momen, Nabeel Mohammed, Shafin Rahman

机构 * Artificial Intelligence Department, RobotBulls Labs(机器人bulls实验室人工智能部门) Machine Intelligence Lab (MILab), North South University(北南大学机器智能实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出了一种基于超复数乘法的渐进式重新参数化策略,用于压缩多模态语言模型,实现参数和计算量的显著减少,同时保持模型性能。

Comments Accepted in Winter Conference on Applications of Computer Vision (WACV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07871 2025-12-10 cs.CV 57%

CATP: Contextually Adaptive Token Pruning for Efficient and Enhanced Multimodal In-Context Learning

CATP:面向高效增强多模态上下文学习的上下文自适应令牌剪枝

Yanshu Li, Jianjiang Yang, Zhennan Shen, Ligong Han, Haoyan Xu, Ruixiang Tang

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 CATP通过上下文自适应令牌剪枝方法,提升多模态上下文学习的效率和性能,减少冗余令牌带来的影响。

Comments 14 pages, 12 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 其他VLM 1 篇

2510.14885 2025-12-10 cs.CV cs.CL 83%

You May Speak Freely: Improving the Fine-Grained Visual Recognition Capabilities of Multimodal Large Language Models with Answer Extraction

你可能可以自由发言:通过答案提取提升多模态大语言模型的细粒度视觉识别能力

Logan Lawrence, Oindrila Saha, Megan Wei, Chen Sun, Subhransu Maji, Grant Van Horn

机构 * University of Massachusetts, Amherst(马萨诸塞大学阿姆赫斯特分校) Brown University(布朗大学)

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出nlg2choice方法,通过两阶段策略提升多模态大语言模型在细粒度视觉识别任务中的表现,通过开放性问题和受限解码提高检索效率。

Comments Accepted to WACV26. 12 pages, 8 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏