arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-12 至 2026-02-12 共收录 11 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 11 篇

2602.07815 2026-02-12 cs.CV 83%

Out of the box age estimation through facial imagery: A Comprehensive Benchmark of Vision-Language Models vs. out-of-the-box Traditional Architectures

走出盒子进行年龄估计:一种视觉-语言模型与传统架构全面基准的比较

Simiao Ren, Xingyu Shen, Ankit Raj, Albert Dai, Caroline, Zhang, Yuan Xu, Zexi Chen, Siqi Wu, Chen Gong, Yuxin Zhang

机构 * Reality Inc Duke University(杜克大学) New York University(纽约大学) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文通过对比视觉-语言模型与传统架构,发现零样本VLM在面部年龄估计中表现优于专门模型,且在年龄验证中显著降低误判率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16944 2026-02-12 cs.CV 83%

Catching the Details: Self-Distilled RoI Predictors for Fine-Grained MLLM Perception

捕捉细节:用于细粒度MLLM感知的自蒸馏RoI预测器

Yuheng Shi, Xiaohuan Pei, Minjing Dong, Chang Xu

机构 * University of Sydney(悉尼大学) City University of Hong Kong(香港城市大学)

专题命中 视觉定位与Grounding :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出SD-RPN,通过自蒸馏方法提升MLLM细粒度感知的效率和准确性。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10399 2026-02-12 cs.RO 78%

LocoVLM: Grounding Vision and Language for Adapting Versatile Legged Locomotion Policies

LocoVLM:为适应多功能腿式运动策略而 grounding 视觉和语言

I Made Aswin Nahrendra, Seunghyun Lee, Dongkyu Lee, Hyun Myung

机构 * School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(电气工程学院,韩国科学技术院)

专题命中 视觉定位与Grounding :grounding(title);vision-language model(abstract)

AI总结 LocoVLM通过整合高层常识推理和视觉语言模型,实现了基于指令的实时腿式运动策略适应,准确率达87%。

Comments Project page: https://locovlm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21769 2026-02-12 cs.CV 74%

H2OFlow: Grounding Human-Object Affordances with 3D Generative Models and Dense Diffused Flows

H2OFlow: 通过3D生成模型和密集扩散流接地人类-物体 affordances

Harry Zhang, Luca Carlone

机构 * MIT(麻省理工学院)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.CV

AI总结 H2OFlow通过3D生成模型和密集扩散流学习人类-物体交互的3D affordances,无需人工标注,有效泛化至现实物体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02186 2026-02-12 cs.CV cs.LG 73%

GeoPurify: A Data-Efficient Geometric Distillation Framework for Open-Vocabulary 3D Segmentation

GeoPurify: 一种数据高效的几何蒸馏框架用于开放词汇3D分割

Weijia Dou, Xu Zhang, Yi Bin, Jian Liu, Bo Peng, Guoqing Wang, Yang Yang, Heng Tao Shen

机构 * Tongji University(同济大学) Tianjin University(天津大学) University of Electronic Science and Technology of China(电子科学与技术大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 GeoPurify通过几何蒸馏和亲和网络提升3D分割的数据效率,实现高效且准确的开放词汇3D分割

Comments Accepted at ICLR 2026. Code available at: https://github.com/tj12323/GeoPurify

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10881 2026-02-12 cs.CL cs.AI cs.LG 62%

Diagnosing Structural Failures in LLM-Based Evidence Extraction for Meta-Analysis

诊断基于大型语言模型的证据提取在元分析中的结构性故障

Zhiyin Tan, Jennifer D'Souza

机构 * L3S Research Center, Leibniz University Hannover(莱比锡大学汉诺威分校L3S研究中心) TIB Leibniz Information Centre for Science(莱比锡信息中心科学与技术研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 研究发现当前LLM在元分析中存在结构性缺陷,导致关联元组提取不可靠,需改进结构性和数值基础。

Comments Accepted at the 22nd Conference on Information and Research Science Connecting to Digital and Library Science (IRCDL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10863 2026-02-12 cs.LG cs.AI 62%

ICA: Information-Aware Credit Assignment for Visually Grounded Long-Horizon Information-Seeking Agents

ICA: 信息感知的信用分配用于基于视觉的长周期信息寻求智能体

Cong Pang, Xuyu Feng, Yujie Yi, Zixuan Chen, Jiawei Hong, Tiankuo Yao, Nang Yuan, Jiapeng Luo, Lewei Lu, Xin Lou

机构 * Shanghai Jiao Tong University(上海交通大学) ShanghaiTech University(上海科技大学) Wuhan University(武汉大学) SenseTime Research(商汤科技研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ICA方法,通过视觉快照和信息层面信用分配,提升开放网络环境中信息寻求智能体的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18936 2026-02-12 cs.LG cs.CV 62%

Revisit Visual Prompt Tuning: The Expressiveness of Prompt Experts

重新审视视觉提示调优:提示专家的表达性

Minh Le, Anh Nguyen, Huy Nguyen, Chau Nguyen, Anh Tran, Nhat Ho

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文提出VAPT,通过增强提示专家的表达性,在保持参数效率的同时,提升了视觉任务的性能表现。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10354 2026-02-12 cs.CL cs.LG 57%

Physically Interpretable AlphaEarth Foundation Model Embeddings Enable LLM-Based Land Surface Intelligence

可解释的AlphaEarth基础模型嵌入使基于大语言模型的地表智能成为可能

Mashrekur Rahman

机构 * Dartmouth College(达特茅斯学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 基于AlphaEarth基础模型的可解释嵌入,通过检索增强生成实现地表智能,验证了卫星嵌入在环境决策中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08892 2026-02-12 cs.CL cs.AI 57%

Toward Faithful Retrieval-Augmented Generation with Sparse Autoencoders

迈向基于稀疏自编码器的忠实检索增强生成

Guangzhi Xiong, Zhenghao He, Bohan Liu, Sanchit Sinha, Aidong Zhang

机构 * Department of Computer Science University of Virginia(计算机科学系弗吉尼亚大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本研究提出RAGLens,通过稀疏自编码器解构LLM内部激活,有效检测RAG生成中的不忠实输出,并提供可解释的决策理由。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11093 2026-02-12 cs.CV 57%

OmniDiff: A Comprehensive Benchmark for Fine-grained Image Difference Captioning

OmniDiff: 一个全面的细粒度图像差异描述基准

Yuan Liu, Saihui Hou, Saijie Hou, Jiabao Du, Shibei Meng, Yongzhen Huang

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 OmniDiff提出一个全面的细粒度图像差异描述基准,结合多模态大语言模型与插拔式多尺度差异感知模块,提升跨场景差异识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏