arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-26 至 2026-02-26 共收录 51 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 3 篇

2509.22548 2026-02-26 cs.CV cs.RO 70%

JanusVLN: Decoupling Semantics and Spatiality with Dual Implicit Memory for Vision-Language Navigation

JanusVLN: 通过双隐式记忆解耦语义与空间性用于视觉-语言导航

Shuang Zeng, Dekang Qi, Xinyuan Chang, Feng Xiong, Shichao Xie, Xiaolong Wu, Shiyi Liang, Mu Xu, Xing Wei, Ning Guo

机构 * Xi’an Jiaotong University(西安交通大学) Amap, Alibaba Group(阿里巴巴集团)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 JanusVLN通过双隐式记忆解耦语义与空间性,提升视觉-语言导航的性能和效率。

Comments Accepted to ICLR 2026. Project page: https://miv-xjtu.github.io/JanusVLN.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21633 2026-02-26 cs.RO cs.AI cs.CV 62%

Self-Correcting VLA: Online Action Refinement via Sparse World Imagination

自校正视觉-语言-动作模型:通过稀疏世界想象实现在线动作细化

Chenyv Liu, Wentao Tan, Lei Zhu, Fengling Li, Jingjing Li, Guoli Yang, Heng Tao Shen

机构 * Tongji University(同济大学) University of Technology Sydney(技术悉尼大学) University of Electronic Science(电子科学大学) Advanced Institute of Big Data(大数据高级研究所)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 SC-VLA通过稀疏世界想象实现自校正,提升机器人操作任务的效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 幻觉与鲁棒性 7 篇

2602.19983 2026-02-26 cs.RO cs.AI 85%

Contextual Safety Reasoning and Grounding for Open-World Robots

面向开放世界机器人的上下文安全推理与 grounding

Zachary Ravichandran, David Snyder, Alexander Robey, Hamed Hassani, Vijay Kumar, George J. Pappas

机构 * University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 幻觉与鲁棒性 :grounding(title,abstract);vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 CORE框架通过视觉语言模型实现在线上下文推理与空间grounding,提供概率安全保证,在开放世界中有效执行上下文适应的安全行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21441 2026-02-26 cs.LG cs.AI cs.CV 82%

Causal Decoding for Hallucination-Resistant Multimodal Large Language Models

因果解码用于抗幻觉的多模态大语言模型

Shiwei Tan, Hengyi Wang, Weiyi Qin, Qi Xu, Zhigang Hua, Hao Wang

机构 * Rutgers University(新泽西罗格斯大学) Meta Ranking AI(Meta 排名人工智能)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出因果解码框架,通过针对性干预减少多模态大语言模型中的物体幻觉,提升响应的准确性和忠实度。

Comments Published in Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07984 2026-02-26 cs.CL 82%

Cross-Cultural Expert-Level Art Critique Evaluation with Vision-Language Models

跨文化专家级艺术批评评估与视觉-语言模型

Haorui Yu, Xuehang Wen, Fengrui Zhang, Qiufeng Yi

机构 * DJCAD, University of Dundee, United Kingdom(邓迪大学DJCAD研究中心,英国) Hebei Academy of Fine Art, China(河北美术院,中国) Computer Science, Nanjing University, China(南京大学计算机科学系,中国) Department of Mechanical Engineering, School of Engineering, University of Birmingham(伯明翰大学工程学院机械工程系)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract)

AI总结 本文提出了一种跨文化评估框架,用于评估视觉-语言模型在艺术批评中的文化理解能力,揭示了自动化指标与专家评分的差异及文化敏感性问题。

Comments 16 pages, 7 figures, submitted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17115 2026-02-26 cs.CV cs.AI 81%

Measuring the Measurers: Quality Evaluation of Hallucination Benchmarks for Large Vision-Language Models

测量测量者:大型视觉-语言模型幻觉基准的品质评估

Bei Yan, Jie Zhang, Zheng Yuan, Shiguang Shan, Xilin Chen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, and also with University of Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院,以及中国科学院大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出HQM框架评估幻觉基准质量,发现现有基准存在可靠性与有效性不足问题,并提出HQQ基准以提升评估效果,揭示LVLMs在幻觉问题上的严重缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21704 2026-02-26 cs.CV cs.AI 81%

Dynamic Multimodal Activation Steering for Hallucination Mitigation in Large Vision-Language Models

动态多模态激活引导用于大型视觉-语言模型中的幻觉缓解

Jianghao Yin, Qin Chen, Kedi Chen, Jie Zhou, Xingjiao Wu, Liang He

机构 * East China Normal University(华东师范大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出动态多模态激活引导方法,通过构建语义真实性引导向量数据库,实现幻觉缓解,提升模型性能。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19610 2026-02-26 cs.CV 79%

JailBound: Jailbreaking Internal Safety Boundaries of Vision-Language Models

JailBound: 视觉语言模型内部安全边界的劫持

Jiaxin Song, Yixu Wang, Jie Li, Rui Yu, Yan Teng, Xingjun Ma, Yingchun Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Xuan Tong(宣通) NSFOCUS

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 JailBound通过在视觉语言模型的潜在空间中探索安全边界,提出了一种新的劫持框架,有效提升了白盒和黑盒攻击成功率,揭示了模型的安全风险。

Comments The Thirty-ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21230 2026-02-26 cs.CL 50%

TRACE: Trajectory-Aware Comprehensive Evaluation for Deep Research Agents

TRACE: 基于轨迹的深度研究代理综合评估

Yanyu Chen, Jiyue Jiang, Jiahong Liu, Yifei Zhang, Xiao Guo, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 TRACE提出基于轨迹的深度研究代理综合评估框架,通过分层效用函数和阶梯式能力评估协议,解决单一指标评估的不足,揭示代理在准确性、效率和鲁棒性之间的关键权衡。

Comments Accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. VLM训练与架构 11 篇

2602.22144 2026-02-26 cs.CV cs.AI cs.CL 84%

NoLan: Mitigating Object Hallucinations in Large Vision-Language Models via Dynamic Suppression of Language Priors

NoLan: 通过动态抑制语言先验来缓解大视觉-语言模型中的对象幻觉

Lingfeng Ren, Weihao Yu, Runpeng Yu, Xinchao Wang

机构 * National University of Singapore, Singapore(新加坡国立大学) Peking University Shenzhen Graduate School, China(北京大学深圳研究生院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 NoLan通过动态抑制语言先验缓解大视觉-语言模型中的对象幻觉问题,有效提升模型准确性。

Comments Code: https://github.com/lingfengren/NoLan

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01552 2026-02-26 cs.CV 79%

Variation-aware Vision Token Dropping for Faster Large Vision-Language Models

面向变化的视觉令牌丢弃以加速更大的视觉-语言模型

Junjie Chen, Xuyang Liu, Zichen Wen, Yiyu Wang, Siteng Huang, Honggang Chen

机构 * Sichuan University(四川大学) EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出V²Drop方法,通过动态令牌变化机制在LVLM推理中减少令牌数量,提升计算效率,同时保持任务性能。

Comments Accepted by CVPR 2026. Code is available at \url{https://github.com/xuyang-liu16/V2Drop}

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01350 2026-02-26 cs.AI 79%

Error Notebook-Guided, Training-Free Part Retrieval in 3D CAD Assemblies via Vision-Language Models

通过视觉-语言模型实现无训练的3DCAD装配体部件检索:基于错误笔记本的引导

Yunqing Liu, Nan Zhang, Zhiming Tan

机构 * Fujitsu Research & Development Center Shanghai, China(富士通研发中心上海)

专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract);分类 cs.AI

AI总结 本研究提出一种无训练的3D CAD部件检索方法,通过结合错误笔记本与RAG技术,显著提升基于VLM的推理性能,实验显示在专有模型和开源模型上均取得显著效果。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01617 2026-02-26 cs.CV 77%

LLaDA-MedV: Exploring Large Language Diffusion Models for Biomedical Image Understanding

LLaDA-MedV:探索大规模语言扩散模型用于生物医学图像理解

Xuanzhao Dong, Wenhui Zhu, Xiwen Chen, Zhipeng Wang, Peijie Qiu, Shao Tang, Xin Li, Yalin Wang

机构 * Arizona State University(亚利桑那州立大学) Clemson University(克莱姆森大学) LinkedIn Corporation(领英公司) Washington University in St. Louis(圣路易斯华盛顿大学) Morgan Stanley(摩根大通)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV

AI总结 LLaDA-MedV通过视觉指令微调,首次在生物医学图像理解中应用大规模语言扩散模型,实现了在生物医学视觉对话任务中的性能提升,并在多个VQA基准测试中取得新高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00062 2026-02-26 cs.CV cs.AI cs.LG cs.RO 75%

World Simulation with Video Foundation Models for Physical AI

基于视频基础模型的世界模拟用于物理AI

NVIDIA, :, Arslan Ali, Junjie Bai, Maciej Bala, Yogesh Balaji, Aaron Blakeman, Tiffany Cai, Jiaxin Cao, Tianshi Cao, Elizabeth Cha, Yu-Wei Chao, Prithvijit Chattopadhyay, Mike Chen, Yongxin Chen, Yu Chen, Shuai Cheng, Yin Cui, Jenna Diamond, Yifan Ding, Jiaojiao Fan, Linxi Fan, Liang Feng, Francesco Ferroni, Sanja Fidler, Xiao Fu, Ruiyuan Gao, Yunhao Ge, Jinwei Gu, Aryaman Gupta, Siddharth Gururani, Imad El Hanafi, Ali Hassani, Zekun Hao, Jacob Huffman, Joel Jang, Pooya Jannaty, Jan Kautz, Grace Lam, Xuan Li, Zhaoshuo Li, Maosheng Liao, Chen-Hsuan Lin, Tsung-Yi Lin, Yen-Chen Lin, Huan Ling, Ming-Yu Liu, Xian Liu, Yifan Lu, Alice Luo, Qianli Ma, Hanzi Mao, Kaichun Mo, Seungjun Nah, Yashraj Narang, Abhijeet Panaskar, Lindsey Pavao, Trung Pham, Morteza Ramezanali, Fitsum Reda, Scott Reed, Xuanchi Ren, Haonan Shao, Yue Shen, Stella Shi, Shuran Song, Bartosz Stefaniak, Shangkun Sun, Shitao Tang, Sameena Tasmeen, Lyne Tchapmi, Wei-Cheng Tseng, Jibin Varghese, Andrew Z. Wang, Hao Wang, Haoxiang Wang, Heng Wang, Ting-Chun Wang, Fangyin Wei, Jiashu Xu, Dinghao Yang, Xiaodong Yang, Haotian Ye, Seonghyeon Ye, Xiaohui Zeng, Jing Zhang, Qinsheng Zhang, Kaiwen Zheng, Andrew Zhu, Yuke Zhu

专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 Cosmos-Predict2.5和Cosmos-Transfer2.5通过统一生成和增强的模拟能力,推动物理AI领域的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22098 2026-02-26 cs.CV 70%

Brain3D: Brain Report Automation via Inflated Vision Transformers in 3D

Brain3D: 通过膨胀视觉变换器实现脑部报告自动化

Mariano Barone, Francesco Di Serio, Giuseppe Riccio, Antonio Romano, Marco Postiglione, Antonino Ferraro, Vincenzo Moscato

机构 * University of Naples Federico II, Department of Electrical Engineering and Information Technology(那不勒斯费德里科二世大学电子工程与信息技术系) Northwestern University, Dept. of Computer Science, McCormick School of Engineering and Applied Science(西北大学计算机科学系,工程与应用科学学院) Pegaso University, Department of Information Science and Technology(佩加索大学信息科学与技术系)

专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 Brain3D通过膨胀视觉变换器实现3D脑肿瘤MRI的自动化报告生成,通过分阶段对齐提升神经放射学解读的准确性和结构化输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21829 2026-02-26 cs.CV cs.AI 62%

StoryMovie: A Dataset for Semantic Alignment of Visual Stories with Movie Scripts and Subtitles

StoryMovie: 一个用于视觉故事语义对齐的语料库,结合电影剧本和字幕

Daniel Oliveira, David Martins de Matos

机构 * INESC-ID(INESC-ID研究所) Instituto Superior Técnico, Universidade de Lisboa(里斯本大学技术学院)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 StoryMovie通过结合电影剧本和字幕,提升视觉叙事模型的语义对齐能力,使对话归属更准确。

Comments 15 pages, submitted to Journal of Visual Communication and Image Representation

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01085 2026-02-26 cs.CV cs.AI 62%

Learning What Matters: Prioritized Concept Learning via Relative Error-driven Sample Selection

学习关键要素:通过相对误差驱动的样本选择进行优先概念学习

Shivam Chandhok, Qian Yang, Oscar Manas, Kanishk Jain, Leonid Sigal, Aishwarya Agrawal

机构 * Mila - Québec AI Institute(魁北克人工智能研究所) University of British Columbia(不列颠哥伦比亚大学) Université de Montréal(蒙特利尔大学) Vector Institute for AI(人工智能矢量研究所) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 PROGRESS通过相对误差驱动的样本选择,实现高效视觉-语言模型的指令微调,减少数据和计算需求,提升学习效率和泛化能力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19430 2026-02-26 cs.CV 57%

TherA: Thermal-Aware Visual-Language Prompting for Controllable RGB-to-Thermal Infrared Translation

TherA: 用于可控RGB到热红外转换的热感知视觉-语言提示

Dong-Guw Lee, Tai Hyoung Rhee, Hyunsoo Jang, Young-Sik Shin, Ukcheol Shin, Ayoung Kim

机构 * Seoul National University(首尔国立大学) Kyungpook National University(庆北国立大学) KENTECH

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 TherA通过热感知视觉-语言提示方法,实现了可控的RGB到热红外转换,提升了翻译性能和细粒度控制能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11910 2026-02-26 cs.CV 57%

Seeing the Forest and the Trees: Query-Aware Tokenizer for Long-Video Multimodal Language Models

看清森林与树木:面向长视频多模态语言模型的查询感知分词器

Siyou Li, Huanan Wu, Juexi Shao, Yinghao Ma, Yujian Gan, Yihao Luo, Yuwei Wang, Dong Nie, Lu Wang, Wenqing Wu, Le Zhang, Massimo Poesio, Juntao Yu

机构 * Queen Mary University of London(伦敦女王学院) University of Sheffield(谢菲尔德大学) Imperial College London(伦敦帝国学院) Pengcheng Laboratory(鹏城实验室) Meta Inc(Meta公司) Meituan Inc(美团公司) Nanjing University of Science(南京理工大学) University of Birmingham(伯明翰大学) Utrecht University(乌得勒支大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 QTSplus是一种轻量高效的视觉token选择模块,通过动态选择重要视觉证据提升长视频多模态语言模型的性能,显著降低计算成本并提高处理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01984 2026-02-26 cs.CV 57%

Enhancing Multi-Image Understanding through Delimiter Token Scaling

通过分隔符标记扩展提升多图像理解

Minyoung Lee, Yeji Park, Dongjun Hwang, Yejin Kim, Seong Joon Oh, Junsuk Choe

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 通过扩展分隔符标记的隐藏状态,提升多图像理解性能,有效减少跨图像信息泄露,提高模型区分和推理能力。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他VLM 1 篇

2602.22120 2026-02-26 cs.CV 57%

GeoDiv: Framework For Measuring Geographical Diversity In Text-To-Image Models

GeoDiv:文本到图像模型中地理多样性测量的框架

Abhipsa Basu, Mohana Singh, Shashank Agnihotri, Margret Keuper, R. Venkatesh Babu

机构 * Vision and AI Lab, Indian Institute of Science, Bangalore, India(印度科学院视觉与人工智能实验室) Chair for Machine Learning, University of Mannheim(曼海姆大学机器学习主任) Max Planck Institute for Informatics, Saarland Informatics Campus, Saarbrücken, Germany(马克斯·普朗克信息研究所,萨尔兰州信息学院,萨尔布吕肯,德国)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 GeoDiv通过评估文本到图像模型中的地理多样性,揭示模型在描绘地区时的偏见问题,提出可解释的度量框架以促进公平生成系统。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏