arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-09 至 2026-02-09 共收录 28 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3 篇

2602.06056 2026-02-09 cs.MM cs.AI cs.CL cs.CV 86%

Analyzing Diffusion and Autoregressive Vision Language Models in Multimodal Embedding Space

分析扩散模型和自回归视觉语言模型在多模态嵌入空间中的表现

Zihang Wang, Siyue Zhang, Yilun Zhao, Jingyi Yang, Tingyu Song, Anh Tuan Luu, Chen Zhao

机构 * Nanyang Technological University(南洋理工大学) Yale University(耶鲁大学) NYU Shanghai(纽约大学上海分校) Alibaba-NTU Singapore Joint Research Institute(阿里-国立新加坡大学联合研究机构) University of the Chinese Academy of Sciences(中国科学院大学) Center for Data Science(数据科学中心) New York University(纽约大学)

专题命中 视觉问答 :vision language model(title,abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了多模态扩散模型在多模态嵌入任务中的表现,发现其在分类、VQA和检索任务中均逊于自回归VLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06050 2026-02-09 cs.CL cs.CV 79%

Relevance-aware Multi-context Contrastive Decoding for Retrieval-augmented Visual Question Answering

具有相关性的多上下文对比解码用于检索增强的视觉问答

Jongha Kim, Byungoh Ko, Jeehye Na, Jinsung Yoon, Hyunwoo J. Kim

机构 * Korea University(韩国大学) KAIST(韩国科学技术院) Google Cloud AI(谷歌云人工智能)

专题命中 视觉问答 :visual question answering(title);vision language model(abstract);分类 cs.CV

AI总结 RMCD通过结合多个相关上下文并抑制无关上下文的负面影响,提升检索增强视觉问答的性能。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21355 2026-02-09 cs.LG 70%

SMMILE: An Expert-Driven Benchmark for Multimodal Medical In-Context Learning

SMMILE:一个多模态医学上下文学习的专家驱动基准

Melanie Rieff, Maya Varma, Ossian Rabow, Subathra Adithan, Julie Kim, Ken Chang, Hannah Lee, Nidhi Rohatgi, Christian Bluethgen, Mohamed S. Muneer, Jean-Benoit Delbrouck, Michael Moor

机构 * ETH Zurich(苏黎世联邦理工学院) Stanford University(斯坦福大学) Lund University(隆德大学) Jawaharlal Institute of Postgraduate Medical Education and Research(贾瓦哈拉尔·尼赫鲁医学教育与研究学院) UCSF(加州大学旧金山分校) University of Zurich(苏黎世大学) University Hospital Zurich(苏黎世大学医院) HOPPR

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.LG

AI总结 SMMILE是一个专家驱动的多模态医学上下文学习基准,评估了15个MLLMs在医学任务中的多模态ICL能力,发现其表现有限且易受无关示例和最近性偏见影响。

Comments NeurIPS 2025 (Datasets & Benchmarks Track)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 4 篇

2602.06166 2026-02-09 cs.CV 74%

M3: High-fidelity Text-to-Image Generation via Multi-Modal, Multi-Agent and Multi-Round Visual Reasoning

M3:通过多模态、多智能体和多轮视觉推理实现高保真的文本到图像生成

Bangji Yang, Ruihan Guo, Jiajun Fan, Chaoran Cheng, Ge Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视觉推理 :visual reasoning(title);分类 cs.CV

AI总结 M3通过多智能体和多轮视觉推理提升开源模型的文本到图像生成能力,超越商业系统并实现最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06041 2026-02-09 cs.CV 70%

Predicting Camera Pose from Perspective Descriptions for Spatial Reasoning

从透视描述预测相机姿态用于空间推理

Xuejun Zhang, Aditi Tiwari, Zhenhailong Wang, Heng Ji

专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 CAMCUE通过姿态感知的多图像框架,从自然语言描述中准确预测相机姿态,提升多视角空间推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02071 2026-02-09 cs.AI 70%

Human-AI Co-Embodied Intelligence for Scientific Experimentation and Manufacturing

人类-人工智能协同具身智能用于科学实验与制造

Xinyi Lin, Yuyang Zhang, Yuanhang Gan, Juntao Chen, Hao Shen, Yichun He, Lijun Li, Ze Yuan, Shuang Wang, Chaohao Wang, Rui Zhang, Na Li, Jia Liu

专题命中 视觉推理 :vision language model(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 本研究提出人类-人工智能协同具身智能,通过智能体-物理实验系统提升科学实验与制造的精度与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08585 2026-02-09 cs.AI cs.CV 62%

Simulating the Visual World with Artificial Intelligence: A Roadmap

用人工智能模拟视觉世界:一条路线图

Jingtong Yue, Ziqi Huang, Zhaoxi Chen, Xintao Wang, Pengfei Wan, Ziwei Liu

机构 * Robotics Institute Carnegie Mellon University(卡内基梅隆大学机器人研究所) S-Lab Nanyang Technological University(南洋理工大学S实验室) Kling Team Kuaishou Technology(快手科技 Kling 团队)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种基于隐式世界模型和视频渲染器的视频基础模型,用于模拟物理动态、智能体交互和任务规划,涵盖四代视频生成技术,应用于机器人、自动驾驶和互动游戏等领域。

Comments Project page: https://world-model-roadmap.github.io/ Github Repo: https://github.com/ziqihuangg/Awesome-From-Video-Generation-to-World-Model

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 5 篇

2602.06351 2026-02-09 cs.AI cs.CV 84%

Trifuse: Enhancing Attention-Based GUI Grounding via Multimodal Fusion

Trifuse: 通过多模态融合增强基于注意力的GUI定位

Longhui Ma, Di Zhao, Siwei Wang, Zhao Lv, Miao Wang

机构 * College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学) Intelligent Game and Decision Lab, Academy of Military Sciences(智能游戏与决策实验室,军事科学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 Trifuse通过多模态融合提升GUI定位性能,整合注意力、OCR文本和图标描述语义,无需任务微调即可实现高效定位。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19647 2026-02-09 cs.CV cs.AI 84%

Show or Tell? Effectively prompting Vision-Language Models for semantic segmentation

展示还是讲述?有效提示视觉-语言模型进行语义分割

Niccolo Avogaro, Thomas Frick, Mattia Rigotti, Andrea Bartezzaghi, Filip Janicki, Cristiano Malossi, Konrad Schindler, Roy Assaf

机构 * IBM Research(IBM研究院) ETH Zurich(苏黎世联邦理工学院)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PromptMatcher,通过结合文本和视觉提示提升VLMs在语义分割中的性能,实现优于现有方法的改进。

Journal ref Transactions on Machine Learning Research, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04692 2026-02-09 cs.CV cs.AI 73%

DRMOT: A Dataset and Framework for RGBD Referring Multi-Object Tracking

DRMOT:用于RGBD参照多目标跟踪的数据集和框架

Sijia Chen, Lijuan Ma, Yanqiu Yu, En Yu, Liman Liu, Wenbing Tao

专题命中 视觉定位与Grounding :grounding(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出DRMOT任务,通过融合RGB、深度和语言信息,构建DRSet数据集并提出DRTrack框架,提升多目标跟踪的3D感知能力。

Comments https://github.com/chen-si-jia/DRMOT

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06592 2026-02-09 cs.CV cs.AI 62%

ProtoQuant: Quantization of Prototypical Parts For General and Fine-Grained Image Classification

ProtoQuant:用于通用和细粒度图像分类的原型部分量化

Mikołaj Janusz, Adam Wróbel, Bartosz Zieliński, Dawid Rymarczyk

机构 * Jagiellonian University, Faculty of Mathematics and Computer Science(杰洛尼莫夫大学数学与计算机科学系) Jagiellonian University, Doctoral School of Exact and Natural Sciences(杰洛尼莫夫大学精确与自然科学研究博士学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 ProtoQuant通过潜在向量量化实现原型稳定性和可解释性,适用于通用和细粒度图像分类任务。

Comments Work under review. Code will be released upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06474 2026-02-09 cs.CV 57%

LAB-Det: Language as a Domain-Invariant Bridge for Training-Free One-Shot Domain Generalization in Object Detection

LAB-Det: 语言作为域不变桥梁用于无训练的一 shot 域泛化在目标检测

Xu Zhang, Zhe Chen, Jing Zhang, Dacheng Tao

机构 * The University of Sydney, Australia(悉尼大学) La Trobe University, Australia(拉特罗布大学) Wuhan University, China(武汉大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 LAB-Det通过语言条件替代梯度微调,实现无训练的一 shot 域泛化,在数据稀缺的检测任务中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 1 篇

2602.06402 2026-02-09 cs.CV 83%

MeDocVL: A Visual Language Model for Medical Document Understanding and Parsing

MeDocVL:一种用于医疗文档理解与解析的视觉语言模型

Wenjie Wang, Wei Wu, Ying Liu, Yuan Zhao, Xiaole Lv, Liang Diao, Zengjian Fan, Wenfeng Xie, Ziling Lin, De Shi, Lin Huang, Kaihe Xu, Hong Li

机构 * Visual Computing Group (VCG)(视觉计算组)

专题命中 文档图表理解 :visual language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 MeDocVL通过训练驱动的标签细化和噪声意识的混合后训练策略,实现了对医疗文档的高精度解析,优于现有OCR和VLM方法。

Comments 20 pages, 8 figures. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 3 篇

2602.06391 2026-02-09 cs.CV 83%

POINTS-GUI-G: GUI-Grounding Journey

POINTS-GUI-G:GUI接地之旅

Zhongyin Zhao, Yuan Liu, Yikun Liu, Haicheng Wang, Le Tian, Xiao Zhou, Yangxiu You, Zilin Yu, Yang Yu, Jie Zhou

机构 * Tencent(腾讯)

专题命中 GUI与屏幕智能体 :grounding(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 POINTS-GUI-G通过精细化数据工程、改进训练策略和强化学习提升GUI接地性能,实现多个基准测试的最优表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06556 2026-02-09 cs.CV cs.AI cs.RO 62%

LIBERO-X: Robustness Litmus for Vision-Language-Action Models

LIBERO-X:用于视觉-语言-动作模型的鲁棒性检测仪

Guodong Wang, Chenkai Zhang, Qingjie Liu, Jinjin Zhang, Jiancheng Cai, Junjie Liu, Xinmin Liu

机构 * Meituan(美团) Beihang University(北京航空航天大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 LIBERO-X通过分层评估协议和多样化训练数据集,系统性地提升视觉-语言-动作模型的鲁棒性评估能力。

Comments 19 pages, 14 figures and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14388 2026-02-09 cs.AI 57%

Hi-Agent: Hierarchical Vision-Language Agents for Mobile Device Control

Hi-Agent:用于移动设备控制的分层视觉语言代理

Zhe Wu, Hongjin Lu, Junliang Xing, Changhao Zhang, Yuxuan Li, Yin Zhu, Yuhao Yang, Yuheng Jing, Kai Li, Kun Shao, Jianye Hao, Jun Wang, Yuanchun Shi

机构 * Tsinghua University(清华大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University College London(伦敦大学学院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 Hi-Agent通过分层结构和前瞻性优势函数,实现移动设备控制的高效训练和高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与鲁棒性 3 篇

2602.06652 2026-02-09 cs.AI cs.CV 62%

Same Answer, Different Representations: Hidden instability in VLMs

相同答案,不同表示:VLMs中的隐藏不稳定性

Farooq Ahmad Wani, Alessandro Suglia, Rohit Saxena, Aryo Pradipta Gema, Wai-Chung Kwan, Fazl Barez, Maria Sofia Bucarelli, Fabrizio Silvestri, Pasquale Minervini

机构 * Sapienza University of Rome(罗马萨皮恩扎大学) CNRS(法国国家科学研究中心) University of Edinburgh(爱丁堡大学) University of Oxford(牛津大学) i3S(i3S研究所)

专题命中 幻觉与鲁棒性 :vision language model(abstract);分类 cs.CV、cs.AI

AI总结 本研究揭示了视觉语言模型中隐藏的不稳定性,通过引入新的评估框架发现模型在内部表示漂移、鲁棒性与决策边界等方面存在显著问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06822 2026-02-09 cs.AI 57%

POP: Online Structural Pruning Enables Efficient Inference of Large Foundation Models

POP:在线结构剪枝实现大基础模型的高效推理

Yi Chen, Wonjin Shin, Shuhong Liu, Tho Mai, Jeongmo Lee, Chuanbo Hua, Kun Wang, Jun Liu, Joo-Young Kim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) University of Tokyo, Tokyo, Japan(东京大学) Tokyo Institute of Technology, Tokyo, Japan(东京技术大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

AI总结 POP通过在线结构剪枝提升大基础模型推理效率,实现动态剪枝与低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06195 2026-02-09 cs.CV 57%

DeDPO: Debiased Direct Preference Optimization for Diffusion Models

DeDPO:用于扩散模型的去偏直接偏好优化

Khiem Pham, Quang Nguyen, Tung Nguyen, Jingsen Zhu, Michele Santacatterina, Dimitris Metaxas, Ramin Zabih

机构 * Cornell University(康奈尔大学) Rutgers University(罗格斯大学) NYU(纽约大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 DeDPO通过整合因果推理的去偏技术,提升扩散模型在低成本合成监督下的对齐性能,实现与人类标注数据相当的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. VLM训练与架构 5 篇

2502.10273 2026-02-09 cs.CV cs.AI 84%

Probing Perceptual Constancy in Large Vision-Language Models

探测大型视觉-语言模型中的知觉恒常性

Haoran Sun, Bingyang Wang, Suyang Yu, Yijiang Li, Qingying Gao, Haiyun Lyu, Lianyu Huang, Zelong Hong, Jiahui Ge, Qianli Ma, Hang He, Yifan Zhou, Lingzi Guo, Lantao Mei, Maijunxian Wang, Dezhi Luo, Hokin Deng

机构 * Johns Hopkins University(约翰霍普金斯大学) Emory University(埃默里大学) University of Washington(华盛顿大学) University of California San Diego(加州大学圣地亚哥分校) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Southern California(南加州大学) Washington University in St. Louis(圣路易斯华盛顿大学) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校) University of Michigan(密歇根大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了大型视觉-语言模型在颜色、大小和形状恒常性任务中的表现,发现模型在不同任务上的性能存在显著差异。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06507 2026-02-09 cs.CV 79%

FloorplanVLM: A Vision-Language Model for Floorplan Vectorization

FloorplanVLM:一种用于平面图向量化的视觉-语言模型

Yuanqing Liu, Ziming Yang, Yulong Li, Yue Yang

机构 * Beike(贝克)

专题命中 VLM训练与架构 :vision-language model(title);grounding(abstract);分类 cs.CV

AI总结 FloorplanVLM通过像素到序列的范式,实现复杂平面图向量化的高精度与高鲁棒性,其统一框架和渐进训练策略在工程级向量化任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05885 2026-02-09 cs.IR cs.AI 79%

An item is worth one token in Multimodal Large Language Models-based Sequential Recommendation

在基于多模态大语言模型的序列推荐中,一个项目相当于一个标记

Qiyong Zhong, Jiajie Su, Ming Yang, Yunshan Ma, Xiaolin Zheng, Chaochao Chen

机构 * Zhejiang University(浙江大学) Singapore Management University(新加坡国立管理学院)

专题命中 VLM训练与架构 :multimodal large language model(title);MLLM(abstract);分类 cs.AI

AI总结 Speeder通过多模态表示压缩、模态感知渐进优化和序列位置感知增强,提升多模态大语言模型在序列推荐中的效率与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21798 2026-02-09 cs.CV cs.HC cs.LG 62%

An Evaluation of Hybrid Annotation Workflows on High-Ambiguity Spatiotemporal Video Footage

对高歧义时空视频 footage 的混合标注流程的评估

Juan Gutiérrez, Victor Gutiérrez, Ángel Mora, Silvia Rodriguez, José Luis Blanco

机构 * IPTC(信息处理与电信中心) Telecommunications Center, Escuela Técnica Superior de Ingenieros de Telecomunicación, Av. Complutense 30, 28040 Madrid, Spain(电信中心,电信工程师高级学院,Complutense大道30号,28040马德里,西班牙)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文评估了混合标注流程在高歧义时空视频中的有效性,通过实验表明其能显著减少标注时间并提供更严谨的AI辅助工作流程评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06184 2026-02-09 cs.CV cs.CL 57%

PhenoLIP: Integrating Phenotype Ontology Knowledge into Medical Vision-Language Pretraining

PhenoLIP:将表型本体知识整合到医学视觉-语言预训练中

Cheng Liang, Chaoyi Wu, Weike Zhao, Ya Zhang, Yanfeng Wang, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 PhenoLIP通过整合表型本体知识提升医学视觉-语言模型的表型识别与跨模态检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 其他VLM 4 篇

2602.06619 2026-02-09 cs.CV 79%

CauCLIP: Bridging the Sim-to-Real Gap in Surgical Video Understanding via Causality-Inspired Vision-Language Modeling

CauCLIP:通过因果启发的视觉-语言模型弥合手术视频理解的仿真到现实差距

Yuxin He, An Li, Cheng Xue

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 CauCLIP通过因果启发的视觉-语言模型,在不访问目标领域数据的情况下,提升手术视频理解的领域泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00229 2026-02-09 cs.HC 78%

When and How to Integrate Multimodal Large Language Models in College Psychotherapy: Perspectives from Multi-stakeholders

何时以及如何将多模态大语言模型整合到大学生心理治疗中:来自多利益相关者的视角

Jiyao Wang, Youyu Sheng, Qihang He, Zian Zhang, Haolong Hu, Yumei Jing, Dengbo He

专题命中 其他VLM :multimodal large language model(title);MLLM(abstract)

AI总结 本研究探讨了多模态大语言模型在大学生心理治疗中的整合时机与方式,指出其作为辅助工具的作用,并揭示了用户接受度受社交身份和相对地位影响的关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10852 2026-02-09 cs.CV 57%

Enhancing Features in Long-tailed Data Using Large Vision Model

利用大视觉模型增强长尾数据特征

Pengxiao Han, Changkun Ye, Jinguang Tong, Cuicui Jiang, Jie Hong, Li Fang, Xuesong Li

机构 * Australian National University Canberra, Australia The University of Hong Kong Hong Kong SAR Chinese Academy of Sciences China Australian National University\&CSIRO Canberra, Australia

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本研究提出利用大视觉模型增强长尾数据特征,通过特征融合和原型损失函数提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06197 2026-02-09 cs.HC cs.AI 57%

Personagram: Bridging Personas and Product Design for Creative Ideation with Multimodal LLMs

Personagram: 通过多模态大语言模型连接人设与产品设计以促进创意构思

Taewook Kim, Matthew K. Hong, Yan-Ying Chen, Jonathan Q. Li, Monica P Van, Shabnam Hakimi, Matthew Kay, Matthew Klenk

机构 * Toyota Research Institute(丰田研究院) Northwestern University(西北大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

AI总结 Personagram利用多模态大语言模型帮助设计师探索基于人口普查的人设,提取并重新组合产品特征,提升创意构思的可行性和参与度。

Comments 22 pages, 10 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏