arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-04 至 2026-02-04 共收录 58 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 17 篇

2602.03054 2026-02-04 cs.HC cs.AI cs.RO 57%

Towards Considerate Embodied AI: Co-Designing Situated Multi-Site Healthcare Robots from Abstract Concepts to High-Fidelity Prototypes

迈向体贴的具身AI:从抽象概念到高保真原型的多站点医疗机器人协同设计

Yuanchen Bai, Ruixiang Han, Niti Parikh, Wendy Ju, Angelique Taylor

机构 * Cornell Tech / Cornell University(康奈尔科技/康奈尔大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出通过协同设计方法,从抽象概念到高保真原型,开发多站点医疗机器人,以减少医疗场景中的非增值任务负担。

Comments To appear in Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02991 2026-02-04 cs.AI 57%

Large Language Models Can Take False First Steps at Inference-time Planning

大语言模型在推理时间规划中可能采取错误的初始步骤

Haijiang Yan, Jian-Qiao Zhu, Adam Sanborn

机构 * Department of Psychology, The University of Warwick(沃里克大学心理学系) Department of Psychology, The University of Hong Kong(香港大学心理学系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究揭示了大语言模型在推理过程中因自我生成上下文积累导致的规划行为偏差,并通过实验验证了规划能力随上下文变化而变化的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02175 2026-02-04 cs.CV 57%

CIEC: Coupling Implicit and Explicit Cues for Multimodal Weakly Supervised Manipulation Localization

CIEC: 通过隐式和显式线索耦合实现多模态弱监督操作定位

Xinquan Yu, Wei Lu, Xiangyang Luo, Rui Yang

机构 * School of Computer Science and Engineering(计算机科学与工程学院) MoE Key Laboratory of Information Technology(信息技术关键实验室) Key Laboratory of Information Security Technology(信息安全技术重点实验室) Sun Yat-sen University(中山大学) State Key Laboratory of Mathematical Engineering and Advanced Computing(数学工程与先进计算国家重点实验室) Alibaba Group(阿里巴巴集团)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 CIEC通过耦合隐式和显式线索,实现多模态弱监督操作定位,利用粗粒度标注提升图像-文本对的定位效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02771 2026-02-04 stat.ME 50%

Markov Random Fields: Structural Properties, Phase Transition, and Response Function Analysis

马尔可夫随机场:结构特性、相变与响应函数分析

J. Brandon Carter, Catherine A. Calder

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文探讨了马尔可夫随机场的结构特性、相变现象及响应函数分析,旨在提供理论基础和实用工具以改进模型理解和扩展应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21875 2026-02-04 cs.CL 50%

LUMINA: Detecting Hallucinations in RAG System with Context-Knowledge Signals

LUMINA:通过上下文-知识信号检测RAG系统中的幻觉

Samuel Yeh, Sharon Li, Tanwi Mallick

机构 * Department of Computer Science, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系) Argonne National Laboratory(阿贡国家实验室)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 LUMINA通过上下文-知识信号检测RAG系统中的幻觉,利用分布距离和token演变测量,实现高准确率和实用性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. GUI与屏幕智能体 3 篇

2602.03750 2026-02-04 cs.CV cs.AI 81%

Zero-shot large vision-language model prompting for automated bone identification in paleoradiology x-ray archives

零样本大视觉语言模型提示法用于古放射学x光档案中骨骼自动识别

Owen Dong, Lily Gao, Manish Kota, Bennett A. Landmana, Jelena Bekvalac, Gaynor Western, Katherine D. Van Schaik

专题命中 GUI与屏幕智能体 :vision-language model(title);vision language model(abstract);分类 cs.CV、cs.AI

AI总结 利用大视觉语言模型实现古放射学x光图像中骨骼自动识别,提升内容导航效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02548 2026-02-04 cs.LG cs.AI cs.CV cs.MA 67%

ToolTok: Tool Tokenization for Efficient and Generalizable GUI Agents

ToolTok: 为高效且通用的GUI代理的工具标记化

Xiaoce Wang, Guibin Zhang, Junzhe Li, Jinzhe Tu, Chun Li, Ming Li

机构 * Department of Computer Science, Tsinghua University, Beijing, China(清华大学计算机科学系) Guangming Laboratory, Shenzhen, China(光明实验室) National University of Singapore, Singapore(新加坡国立大学) Peking University, Beijing, China(北京大学) MSU-BIT-SMBU Joint Research Center of Applied Mathematics, Shenzhen MSU–BIT University(MSU-BIT-SMBU应用数学联合研究中心)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 ToolTok通过多步路径寻找范式,利用语义锚定机制和易到难课程,实现高效且通用的GUI代理,以较少数据获得优异性能。

Comments 8 pages main paper, 18 pages total, 8 figures, 5 tables, code at https://github.com/ZephinueCode/ToolTok

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21602 2026-02-04 cs.RO 50%

AIR-VLA: Vision-Language-Action Systems for Aerial Manipulation

AIR-VLA:面向空中操作的视觉-语言-动作系统

Jianli Sun, Bin Tian, Qiyao Zhang, Chengxiang Li, Zihan Song, Zhiyong Cui, Yisheng Lv, Yonglin Tian

机构 * The Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Automation, Beijing Institute of Technology(北京理工大学自动化学院) School of Information and Intelligent Engineering, University of Sanya(三亚大学信息与智能工程学院) School of Mechanical and Vehicle Engineering, Hunan University(湖南大学机械与车辆工程学院) State Key Lab of Intelligent Transportation Systems, School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院)

专题命中 GUI与屏幕智能体 :VLM(abstract)

AI总结 AIR-VLA提出首个针对空中操作的视觉-语言-动作系统,通过构建仿真环境和多模态数据集,评估主流模型并揭示其在无人机移动、机械臂控制和高层规划中的能力和限制。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 幻觉与鲁棒性 7 篇

2501.18533 2026-02-04 cs.CV cs.CL cs.CR 83%

Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models

重新审视视觉语言模型安全微调中的瓶颈

Yi Ding, Lijun Li, Bing Cao, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Purdue University(普渡大学) Tianjin University(天津大学)

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 本文提出多图像安全数据集,通过增强视觉推理能力,提升模型在安全关键任务中的性能与通用能力。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02419 2026-02-04 cs.AI cs.SE 79%

SafeGround: Know When to Trust GUI Grounding Models via Uncertainty Calibration

SafeGround: 通过不确定性校准了解何时信任GUI接地模型

Qingni Wang, Yue Fan, Xin Eric Wang

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) University of California, Santa Cruz(加州大学圣克ruz分校)

专题命中 幻觉与鲁棒性 :grounding(title,abstract);分类 cs.AI

AI总结 SafeGround通过不确定性校准提升GUI接地模型的可靠性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21984 2026-02-04 cs.CV cs.CL 79%

Beyond the Vision Encoder: Identifying and Mitigating Spatial Bias in Large Vision-Language Models

超越视觉编码器:识别和缓解大视觉-语言模型中的空间偏差

Yingjie Zhu, Xuefeng Bai, Kehai Chen, Yang Xiang, Youcheng Pan, Yongshuai Hou, Weili Guan, Jun Yu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳学院) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出AGCI机制,通过动态注入全局视觉上下文缓解大视觉-语言模型中的空间偏差问题,提升模型的空间鲁棒性和下游任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01769 2026-02-04 cs.LG cs.AI 73%

IRIS: Implicit Reward-Guided Internal Sifting for Mitigating Multimodal Hallucination

IRIS: 隐式奖励引导的内部筛选以缓解多模态幻觉

Yuanshuai Li, Yuping Yan, Jirui Han, Fei Ming, Lingjuan Lv, Yaochu Jin

机构 * Department of Artificial Intelligence, Westlake University, Hangzhou, China(人工智能系,西湖大学,杭州,中国) Sony Research, Sony(索尼研究,索尼)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI、cs.LG

AI总结 IRIS通过隐式奖励引导内部筛选,有效缓解多模态大语言模型的幻觉问题,无需外部反馈且性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04136 2026-02-04 cs.CV cs.AI 73%

UniFGVC: Universal Training-Free Few-Shot Fine-Grained Vision Classification via Attribute-Aware Multimodal Retrieval

UniFGVC: 一种通用无训练少样本细粒度视觉分类方法通过属性感知多模态检索

Hongyu Guo, Xiangzhao Hao, Jiarui Guo, Haiyun Guo, Jinqiao Wang, Tat-Seng Chua

机构 * School of Traffic and Transportation, Beijing Jiaotong University(交通与运输学院,北京交通大学) Foundation Modal Research Center, Institute of Automation, Chinese Academy of Sciences(基础模态研究中心,自动化研究所) Queen Mary School Hainan, Beijing University of Posts and Telecommunications(海南女王学院,北京邮电大学) Department of Computer Science, NUS School of Computing(计算机科学系,国立大学计算机学院)

专题命中 幻觉与鲁棒性 :visual language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 UniFGVC通过属性感知多模态检索方法,实现无训练少样本细粒度视觉分类,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02589 2026-02-04 cs.AI cs.LG 62%

PeerRank: Autonomous LLM Evaluation Through Web-Grounded, Bias-Controlled Peer Review

PeerRank: 通过基于网络的、受偏见控制的同行评审实现自主LLM评估

Yanki Margalit, Erni Avram, Ran Taig, Oded Margalit, Nurit Cohen-Inger

机构 * Computer Science and Information, Ben-Gurion University of the Negev(本·加里翁大学(内盖夫)计算机科学与信息学院)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 PeerRank通过基于网络的、受偏见控制的同行评审实现自主LLM评估,产生稳定且具有区分性的排名,并揭示可测量的身份和呈现偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03263 2026-02-04 cs.AI 57%

CSR-Bench: A Benchmark for Evaluating the Cross-modal Safety and Reliability of MLLMs

CSR-Bench: 一种评估多模态大语言模型跨模态安全性和可靠性的基准

Yuxuan Liu, Yuntian Shi, Kun Wang, Haoting Shen, Kun Yang

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Nanyang Technological University(南洋理工大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI

AI总结 CSR-Bench通过四个压力测试模式评估多模态大语言模型的跨模态安全性和可靠性,发现模型在多模态输入下表现下降,且安全提升可能源于拒绝导向的启发式方法。

Comments 25 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. VLM训练与架构 11 篇

2602.02951 2026-02-04 cs.CV cs.AI cs.CL 88%

Nüwa: Mending the Spatial Integrity Torn by VLM Token Pruning

Nüwa: 通过VLM令牌剪枝修复空间完整性

Yihong Huang, Fei Ma, Yihua Shao, Jingcai Guo, Zitong Yu, Laizhong Cui, Qi Tian

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(人工智能与数字经济广东实验室) School of Artificial Intelligence, Xidian University(西安电子科技大学人工智能学院) The Hong Kong Polytechnic University(香港理工大学) Great Bay University(大鹏大学) Shenzhen University(深圳大学) Huawei(华为)

专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(abstract);visual question answering(abstract);grounding(abstract)

AI总结 Nüwa通过两阶段令牌剪枝框架在保持空间完整性的同时实现高效特征聚合,提升VQA和视觉定位任务性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03815 2026-02-04 cs.CV cs.LG 84%

Fast-Slow Efficient Training for Multimodal Large Language Models via Visual Token Pruning

通过视觉标记修剪实现多模态大语言模型的快慢高效训练

Dingkun Zhang, Shuhan Qi, Yulin Wu, Xinyu Xiao, Xuan Wang, Long Chen

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Hong Kong University of Science and Technology(香港科技大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.LG

AI总结 DualSpeed通过快慢双模式实现多模态大语言模型的高效训练,提升训练速度并保持性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02961 2026-02-04 cs.AI 83%

Generative Engine Optimization: A VLM and Agent Framework for Pinterest Acquisition Growth

生成引擎优化:一个面向Pinterest获取增长的VLM和代理框架

Faye Zhang, Qianyu Cheng, Jasmine Wan, Vishwakarma Singh, Jinfeng Rao, Kofi Boakye

机构 * Stanford University(斯坦福大学)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI

AI总结 Pinterest提出GEO框架,通过微调VLM和AI代理预测用户搜索需求,构建语义连贯的集合页面,提升生成搜索时代的视觉平台流量增长。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03134 2026-02-04 cs.CV cs.AI 81%

SwiftVLM: Efficient Vision-Language Model Inference via Cross-Layer Token Bypass

SwiftVLM: 通过跨层令牌绕过实现高效的视觉-语言模型推理

Chen Qian, Xinran Yu, Danyang Li, Guoxuan Chi, Zheng Yang, Qiang Ma, Xin Miao

机构 * Tsinghua University, Beijing, China(清华大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 SwiftVLM通过跨层令牌绕过方法,在视觉-语言模型中实现高效的推理,优于现有修剪策略,提升准确率与效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02033 2026-02-04 cs.CV cs.AI cs.MM 73%

One Size, Many Fits: Aligning Diverse Group-Wise Click Preferences in Large-Scale Advertising Image Generation

一个尺寸,多种适配:在大规模广告图像生成中对多样化群体点击偏好进行对齐

Shuo Lu, Haohan Wang, Wei Feng, Weizhen Wang, Shen Zhang, Yaoyu Li, Ao Ma, Zheng Zhang, Jingjing Lv, Junjie Shen, Ching Law, Bing Zhan, Yuan Xu, Huizai Yao, Yongcan Yu, Chenyang Si, Jian Liang

机构 * NLPR & MAIS, CASIA(中国科学院长春光学精密机械与物理研究所 & 中国科学院自动化所) School of AI, UCAS(中国科学院大学人工智能学院) HKUST(gz)(香港科技大学) PRLab, NJU(南京大学PRLab)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出OSMF框架,通过自适应分组和群组感知多模态模型,解决广告图像生成中用户群体点击偏好多样性的优化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03230 2026-02-04 cs.CV 70%

EventFlash: Towards Efficient MLLMs for Event-Based Vision

EventFlash: 向基于事件的视觉高效MLLMs迈进

Shaoyu Liu, Jianing Li, Guanghui Zhao, Yunjian Zhang, Wen Jiang, Ming Li, Xiangyang Ji

机构 * Xidian University(西安电子科技大学) Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy(SZ)(广东人工智能与数字经济实验室(深圳))

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 EventFlash通过时空令牌稀疏化技术,实现高效事件视觉处理,提升吞吐量并支持更长的事件流处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02684 2026-02-04 cs.HC 67%

ADx3: A Collaborative Workflow for High-Quality Accessible Audio Description

ADx3:高质量可及音频描述的协作流程

Lana Do, Shasta Ihorn, Charity Pitcher-Cooper, Juvenal Francisco Barajas, Gio Jung, Xuan Duy Anh Nguyen, Sanjay Mirani, Ilmi Yoon

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

AI总结 ADx3通过整合GenAD、RefineAD和AdaptAD模块,实现高质量可及音频描述的协作流程,提升描述质量和用户交互体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02539 2026-02-04 cs.LG cs.CV 62%

How Much Information Can a Vision Token Hold? A Scaling Law for Recognition Limits in VLMs

视觉标记能承载多少信息?VLMs中识别限制的缩放定律

Shuxin Zhuang, Zi Liang, Runsheng Yu, Hongzong Li, Rong Feng, Shiqin Tang, Youzhi Zhang

机构 * City University of Hong Kong(香港城市大学) The Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology(香港理工大学) Centre for Artificial Intelligence and Robotics, Chinese Academy of Sciences(中国科学院人工智能与机器人研究院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本研究通过压力测试揭示了视觉标记的信息上限,提出了一种统一的缩放定律,为优化视觉上下文压缩的效率-精度权衡提供了实证依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03615 2026-02-04 cs.CV 57%

KTV: Keyframes and Key Tokens Selection for Efficient Training-Free Video LLMs

KTV: 关键帧与关键令牌选择用于高效无训练视频大语言模型

Baiyang Song, Jun Peng, Yuxin Zhang, Guangyao Chen, Feidiao Yang, Jianyuan Guo

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV

AI总结 KTV通过两阶段框架高效选择关键帧和令牌,提升无训练视频理解的性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03060 2026-02-04 cs.CV 57%

IVC-Prune: Revealing the Implicit Visual Coordinates in LVLMs for Vision Token Pruning

IVC-Prune: 在大型视觉-语言模型中揭示隐式的视觉坐标以进行视觉标记剪枝

Zhichao Sun, Yidong Ma, Gang Liu, Yibo Chen, Xu Tang, Yao Hu, Yongchao Xu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Xiaohongshu Inc(小红书公司)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 IVC-Prune通过揭示LVLMs中隐式的视觉坐标,提出一种无训练、提示感知的视觉标记剪枝方法,有效减少标记数量并保持高性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00508 2026-02-04 cs.CV 57%

DuoGen: Towards General Purpose Interleaved Multimodal Generation

DuoGen:迈向通用的交错多模态生成

Min Shi, Xiaohui Zeng, Jiannan Huang, Yin Cui, Francesco Ferroni, Jialuo Li, Shubham Pachori, Zhaoshuo Li, Yogesh Balaji, Haoxiang Wang, Tsung-Yi Lin, Xiao Fu, Yue Zhao, Chieh-Yun Chen, Ming-Yu Liu, Humphrey Shi

机构 * Georgia Tech(佐治亚理工学院) NVIDIA research.nvidia.com/labs/dir/duogen(NVIDIA 研究所)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

AI总结 DuoGen通过系统性地解决数据整理、架构设计和评估问题,实现了通用的交错多模态生成,提升了文本质量、图像保真度和图像-上下文对齐性能。

Comments Technical Report. Project Page: https://research.nvidia.com/labs/dir/duogen/

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 其他VLM 2 篇

2602.02510 2026-02-04 cs.CY cs.AI cs.CL cs.CV 81%

Beyond Translation: Cross-Cultural Meme Transcreation with Vision-Language Models

超越翻译:基于视觉-语言模型的跨文化表情包再创作

Yuming Zhao, Peiyi Zhang, Oana Ignat

机构 * Santa Clara University(圣克拉拉大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种基于视觉-语言模型的跨文化表情包再创作框架,通过大规模数据集和多维度评估,揭示了跨文化再创作中的方向性差异及挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03416 2026-02-04 cs.IR 50%

AesRec: A Dataset for Aesthetics-Aligned Clothing Outfit Recommendation

AesRec:一个用于美学对齐的服装搭配推荐数据集

Wenxin Ye, Lin Li, Ming Li, Yang Shen, Kanghong Wang, Jimmy Xiangji Huang

专题命中 其他VLM :vision-language model(abstract)

AI总结 AesRec数据集通过系统化的定量美学注释,为开发与美学对齐的服装推荐系统提供了支持,实验表明整合量化美学信息能提升用户审美指导与个性化需求的满足。

详情

展开后加载摘要…

URL PDF HTML 收藏