arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-24 至 2026-02-24 共收录 86 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 5 篇

2502.10040 2026-02-24 cs.RO 50%

Diffusion Trajectory-guided Policy for Long-horizon Robot Manipulation

用于长时程机器人操作的扩散轨迹引导策略

Shichao Fan, Quantao Yang, Yajie Liu, Kun Wu, Zhengping Che, Qingjie Liu, Min Wan

机构 * School of Mechanical Engineering and Automation, BeiHang University(机械工程与自动化学院,北航) School of Computer Science and Engineering, BeiHang University(计算机科学与工程学院,北航) Beijing Innovation Center of Humanoid Robotics(人形机器人创新中心) Division of Robotics, Perception and Learning (RPL), KTH Royal Institute of Technology(机器人、感知与学习 division,皇家理工学院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 本文提出DTP框架,通过生成轨迹减少模仿学习中的误差累积,提升长时程机器人任务的性能。

Comments 8 pages, 5 figures, accepted to IEEE Robotics and Automation Letters (RAL)

Journal ref IEEE Robotics and Automation Letters (Volume: 10, Issue: 12, December 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 幻觉与鲁棒性 7 篇

2602.18439 2026-02-24 cs.CV cs.LG 81%

Replication Study: Federated Text-Driven Prompt Generation for Vision-Language Models

复制研究:用于视觉-语言模型的联邦文本驱动提示生成

Suraj Prasad, Anubha Pant

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本研究通过复制FedTPG方法,验证了文本驱动提示生成在联邦学习中提升泛化能力的效果,并展示了在不同视觉领域中的高性能表现。

Comments 6 pages, 2 figues

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19024 2026-02-24 cs.CV 79%

Towards Calibrating Prompt Tuning of Vision-Language Models

面向视觉-语言模型提示微调的校准

Ashshak Sharifdeen, Fahad Shamshad, Muhammad Akhtar Munir, Abhishek Basu, Mohamed Insaf Ismithdeen, Jeyapriyan Jeyamohan, Chathurika Sewwandi Silva, Karthik Nandakumar, Muhammad Haris Khan

机构 * Mohamed bin Zayed University of AI(Mohamed bin Zayed人工智能大学) University of Colombo(科伦坡大学) Michigan State University(密歇根州立大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出一种校准框架,通过引入均值-方差边际惩罚和文本矩匹配损失,提升视觉-语言模型提示微调的预测可靠性与置信度校准。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19539 2026-02-24 cs.CV cs.CR cs.LG 73%

Can a Teenager Fool an AI? Evaluating Low-Cost Cosmetic Attacks on Age Estimation Systems

青少年能否欺骗AI?评估低成本的外貌攻击对年龄估计系统的影响

Xingyu Shen, Tommy Duong, Xiaodong An, Zengqi Zhao, Zebang Hu, Haoyu Hu, Ziyou Wang, Finn Guo, Simiao Ren

机构 * Reality Inc UC Berkeley(伯克利大学) Duke University(杜克大学) Georgia Tech(佐治亚理工学院) UNC Chapel Hill(北卡罗来纳大学教堂山分校) UC San Diego(南加州大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 研究评估了低成本外貌攻击对年龄估计系统的影响,发现合成胡须等修改可使AI将未成年人误判为成年人,视觉-语言模型的鲁棒性略低于专门模型。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18729 2026-02-24 cs.CV cs.AI 73%

MiSCHiEF: A Benchmark in Minimal-Pairs of Safety and Culture for Holistic Evaluation of Fine-Grained Image-Caption Alignment

MiSCHiEF:安全与文化最小对基准用于细粒度图像-描述对齐的全面评估

Sagarika Banerjee, Tangatar Madi, Advait Swaminathan, Nguyen Dao Minh Anh, Shivank Garg, Kevin Zhu, Vasu Sharma

专题命中 幻觉与鲁棒性 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 MiSCHiEF通过安全与文化最小对基准,评估细粒度图像-描述对齐的挑战,揭示当前VLMs在模态对齐上的持续问题。

Comments EACL 2026, Main, Short Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18520 2026-02-24 cs.CV cs.AI 73%

Sketch2Feedback: Grammar-in-the-Loop Framework for Rubric-Aligned Feedback on Student STEM Diagrams

Sketch2Feedback: 用于学生STEM图表的基于语法规则的反馈框架

Aayam Bansal

机构 * IEEE

专题命中 幻觉与鲁棒性 :VLM(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 Sketch2Feedback通过结合语法规则和视觉语言模型,提高了学生STEM图表反馈的准确性与可靠性,展示了语法规则与端到端方法的互补性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19198 2026-02-24 cs.CV 57%

Prompt Tuning for CLIP on the Pretrained Manifold

在预训练流形上进行CLIP的提示调优

Xi Yang, Yuanrong Xu, Weigang Zhang, Guangming Lu, David Zhang, Jie Wen

机构 * Guizhou University, Guiyang, China(贵州大学) Harbin Institute of Technology, China(哈尔滨工业大学) The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳))

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 ManiPT通过在预训练流形上进行提示调优,引入余弦一致性约束和结构偏差,以提高模型在有限监督下的泛化能力和转移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18711 2026-02-24 cs.CV 57%

HIME: Mitigating Object Hallucinations in LVLMs via Hallucination Insensitivity Model Editing

HIME: 通过幻觉不敏感模型编辑缓解LVLMs中的物体幻觉

Ahmed Akl, Abdelwahed Khamis, Ali Cheraghian, Zhe Wang, Sara Khalifa, Kewen Wang

机构 * School of Information and Communication Technology, Griffith University, Australia(信息与通信技术学院,格里菲斯大学) Data61, CSIRO, Australia(Data61,澳大利亚联邦科学与工业研究组织) School of Engineering, Macquarie University, Sydney, Australia(工程学院,麦觉大学) School of Information Systems, Queensland University of Technology, Australia(信息系统学院,昆士兰技术大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 HIME通过分层加权编辑方法有效抑制LVLMs中的物体幻觉,减少61.8%的幻觉问题,无需额外参数或计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. VLM训练与架构 14 篇

2510.27623 2026-02-24 cs.AI cs.CL cs.CV 84%

BEAT: Visual Backdoor Attacks on VLM-based Embodied Agents via Contrastive Trigger Learning

BEAT:通过对比触发学习对基于VLM的具身代理进行视觉后门攻击

Qiusi Zhan, Hyeonjeong Ha, Rui Yang, Sirui Xu, Hanyang Chen, Liang-Yan Gui, Yu-Xiong Wang, Huan Zhang, Heng Ji, Daniel Kang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 BEAT通过对比触发学习在基于VLM的具身代理中实现视觉后门攻击,提升后门激活精度至39%。

Comments ICLR 2026. Project Page: https://zqs1943.github.io/BEAT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15690 2026-02-24 cs.CV cs.CL 83%

MoDES: Accelerating Mixture-of-Experts Multimodal Large Language Models via Dynamic Expert Skipping

通过动态专家跳过加速混合专家多模态大语言模型

Yushi Huang, Zining Wang, Zhihang Yuan, Yifu Ding, Ruihao Gong, Jinyang Guo, Xianglong Liu, Jun Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学) Beihang University(北航) Peking University(北京大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 MoDES通过动态专家跳过机制提升多模态大语言模型的推理效率和准确性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18766 2026-02-24 cs.CV 83%

Initialization matters in few-shot adaptation of vision-language models for histopathological image classification

初始化在视觉-语言模型少量样本适应中的重要性

Pablo Meseguer, Rocío del Amor, Valery Naranjo

机构 * Instituto Universitario de Investigación en Tecnología Centrada en el Ser Humano (HUMAN-Tech)(人类中心技术研究所) Universitat Politécnica de Valencia(巴塞罗那理工大学) Valencian Graduate School and Research Network for Artificial Intelligence (valgrAI)(瓦伦西亚人工智能研究生院和研究网络)

专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出ZS-MIL方法,通过利用视觉-语言模型的类级嵌入优化分类器初始化,提升少量样本场景下的病理图像分类性能。

Comments Accepted as oral presentation at CASEIB 2024 held in Sevilla, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18140 2026-02-24 cs.CV 83%

See-in-Pairs: Reference Image-Guided Comparative Vision-Language Models for Medical Diagnosis

See-in-Pairs: 用于医学诊断的参考图像引导的比较视觉-语言模型

Ruinan Jin, Gexin Huang, Xinwei Shen, Qiong Zhang, Yan Shuo Tan, Xiaoxiao Li

机构 * Electrical and Computer Engineering Department, The University of British Columbia(不列颠哥伦比亚大学电气与计算机工程系) Vector Institute(向量研究所) ETH Zurich(苏黎世联邦理工学院) Renmin University of China(中国人民大学) National University of Singapore(新加坡国立大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 See-in-Pairs通过引入参考图像引导的比较机制,提升医学视觉-语言模型的诊断性能,增强样本效率和视觉-文本对齐。

Comments 25 pages, four figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19409 2026-02-24 cs.SD 82%

AuditoryHuM: Auditory Scene Label Generation and Clustering using Human-MLLM Collaboration

AuditoryHuM: 利用人机协同生成和聚类听觉场景标签

Henry Zhong, Jörg M. Buchholz, Julian Maclaren, Simon Carlile, Richard F. Lyon

机构 * Australian Hearing Hub, Macquarie University, Sydney, Australia(澳大利亚听力中心、麦觉里大学、悉尼、澳大利亚) Google Research Australia, Sydney, Australia(谷歌澳大利亚研究、悉尼、澳大利亚)

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract)

AI总结 AuditoryHuM通过人机协同方法实现听觉场景标签的自动生成与聚类,提供了一种高效且低成本的标准化分类解决方案,适用于边缘设备部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19180 2026-02-24 cs.CV 74%

VLM-Guided Group Preference Alignment for Diffusion-based Human Mesh Recovery

基于扩散模型的人体网格恢复中的群体偏好对齐

Wenhao Shen, Hao Wang, Wanqi Yin, Fayao Liu, Xulei Yang, Chao Liang, Zhongang Cai, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) HKUST(GZ)(香港科技大学(广州)) SenseTime Research(商汤科技研究院) A*STAR(新加坡科技研究局)

专题命中 VLM训练与架构 :VLM(title);分类 cs.CV

AI总结 本文提出了一种基于群体偏好的扩散模型微调框架,通过双内存增强的批评代理生成质量评分,提升人体网格恢复的物理合理性和图像一致性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24943 2026-02-24 cs.IR cs.AI cs.CL cs.LG 73%

RAIR: A Rule-Aware Benchmark Uniting Challenging Long-Tail and Visual Salience Subset for E-commerce Relevance Assessment

RAIR:一种融合长尾和视觉显著子集的规则感知基准,用于电商相关性评估

Chenji Lu, Zhuo Chen, Hui Zhao, Zhenyi Wang, Pengjie Wang, Chuan Yu, Jian Xu

机构 * Taobao \& Tmall Group of Alibaba Beijing China Taobao \& Tmall Group of Alibaba

专题命中 VLM训练与架构 :VLM(abstract);visual language model(abstract);分类 cs.AI、cs.LG

AI总结 RAIR提出了一种融合长尾和视觉显著子集的规则感知基准,用于评估电商相关性,通过标准化框架和多子集数据提升模型评估的全面性与挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19870 2026-02-24 cs.CV 70%

ApET: Approximation-Error Guided Token Compression for Efficient VLMs

ApET:基于近似误差的令牌压缩用于高效的视觉语言模型

Qiankun Ma, Ziyao Zhang, Haofei Wang, Jie Chen, Zhen Song, Hairong Zheng

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) Peng Cheng Laboratory(鹏城实验室) University of Chinese Academy of Sciences(中国科学院大学) Harbin Institute of Technology(哈尔滨工业大学) Peking University(北京大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 ApET通过近似误差指导的令牌压缩,在不使用注意力机制的情况下高效压缩视觉语言模型的令牌预算,提升推理效率。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16449 2026-02-24 cs.CV cs.AI 62%

Emotion-LLaMAv2 and MMEVerse: A New Framework and Benchmark for Multimodal Emotion Understanding

Emotion-LLaMAv2 和 MMEVerse:多模态情感理解的新框架和基准

Xiaojiang Peng, Jingyi Chen, Zebang Cheng, Bao Peng, Fengyi Wu, Yifei Dong, Shuyuan Tu, Qiyu Hu, Huiting Huang, Yuxiang Lin, Jun-Yan He, Kai Wang, Zheng Lian, Zhi-Qi Cheng

机构 * Shenzhen Technology University(深圳技术大学) Shenzhen University of Information Technology(深圳信息科技学院) University of Washington(华盛顿大学) Foundation Model Team, Meituan(美团基础模型团队) National University of Singapore(新加坡国立大学) Tongji University(同济大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 Emotion-LLaMAv2和MMEVerse通过端到端多视图编码器、Conv Attention预融合模块和课程指令调制方案,提升了多模态情绪理解和推理能力,并构建了统一的多模态情绪基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19542 2026-02-24 cs.CV 57%

Vinedresser3D: Agentic Text-guided 3D Editing

Vinedresser3D: 基于代理的文本引导3D编辑

Yankuan Chi, Xiang Li, Zixuan Huang, James M. Rehg

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 Vinedresser3D通过多模态大语言模型和潜在空间编辑技术实现高质量文本引导的3D编辑,提升编辑精度与一致性。

Comments CVPR 2026, Project website:https://vinedresser3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19449 2026-02-24 cs.CV 57%

Decoupling Vision and Language: Codebook Anchored Visual Adaptation

解耦视觉与语言:基于代码本的视觉适应

Jason Wu, Tianchen Zhao, Chang Liu, Jiarui Cai, Zheng Zhang, Zhuowei Li, Aaditya Singh, Xiang Xu, Mani Srivastava, Jonathan Wu

机构 * AWS University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 CRAFT通过离散代码本解耦视觉与语言,实现无需修改其他部分的领域适应,提升LVLMs性能。

Comments 17 pages, accepted to CVPR2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19418 2026-02-24 cs.CV 57%

PA-Attack: Guiding Gray-Box Attacks on LVLM Vision Encoders with Prototypes and Attention

PA-Attack: 通过原型和注意力引导LVLM视觉编码器的灰盒攻击

Hefei Mei, Zirui Wang, Chang Xu, Jianyuan Guo, Minjing Dong

机构 * City University of Hong Kong(香港城市大学) The University of Sydney(悉尼大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 PA-Attack通过原型和注意力机制提升灰盒攻击效果,实现对LVLM视觉编码器的高效攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19058 2026-02-24 cs.CL 50%

Do LLMs and VLMs Share Neurons for Inference? Evidence and Mechanisms of Cross-Modal Transfer

大型语言模型和视觉语言模型是否共享神经元进行推理?证据和跨模态转移的机制

Chenhang Cui, An Zhang, Yuxin Chen, Gelei Deng, Jingnan Zheng, Zhenkai Liang, Xiang Wang, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学)

专题命中 VLM训练与架构 :vision-language model(abstract)

AI总结 本文研究了大型语言模型和视觉语言模型在推理过程中共享神经元的现象,提出SNRF框架实现低秩融合,提升多模态推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23575 2026-02-24 cs.RO 50%

Generalizable Coarse-to-Fine Robot Manipulation via Language-Aligned 3D Keypoints

可泛化的粗到细机器人操作 via 语言对齐的3D关键点

Jianshu Hu, Lidi Wang, Shujia Li, Yunpeng Jiang, Xiao Li, Paul Weng, Yutong Ban

专题命中 VLM训练与架构 :VLM(abstract)

AI总结 CLAP通过任务分解、VLM微调和3D感知表示,提升机器人操作在新指令和环境下的泛化能力,实现更高的样本效率和操作精度。

Comments Published in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他VLM 4 篇

2602.20066 2026-02-24 cs.CV cs.AI 81%

HeatPrompt: Zero-Shot Vision-Language Modeling of Urban Heat Demand from Satellite Images

HeatPrompt: 从卫星图像进行零样本的城市热需求视觉-语言建模

Kundan Thota, Xuanhao Mu, Thorsten Schlachter, Veit Hagenmeyer

机构 * Institute for Automation and Applied Informatics (IAI), Karlsruhe Institute of Technology (KIT), Germany(自动化与应用信息研究所(IAI)、卡尔斯鲁厄理工学院(KIT))

专题命中 其他VLM :vision-language model(title);vision language model(abstract);分类 cs.CV、cs.AI

AI总结 HeatPrompt通过卫星图像和地理信息数据,利用零样本视觉语言模型估算城市热需求,提升预测精度并支持数据稀缺地区的热规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20174 2026-02-24 cs.CV cs.AI 81%

LRR-Bench: Left, Right or Rotate? Vision-Language models Still Struggle With Spatial Understanding Tasks

LRR-Bench:左、右还是旋转?视觉-语言模型在空间理解任务上仍面临挑战

Fei Kong, Jinhao Duan, Kaidi Xu, Zhenhua Guo, Xiaofeng Zhu, Xiaoshuang Shi

机构 * University of Electronic Science and Technology of China(电子科技大学) Drexel University(德雷塞尔大学) Tianyijiaotong Technology Ltd.(天奕交通技术有限公司)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 LRR-Bench通过合成数据评估视觉-语言模型在空间理解任务上的性能,发现其在复杂任务上的表现远低于人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19357 2026-02-24 cs.CV cs.LG 62%

MentalBlackboard: Evaluating Spatial Visualization via Mathematical Transformations

MentalBlackboard: 通过数学变换评估空间可视化能力

Nilay Yilmaz, Maitreya Patel, Naga Sai Abhiram Kusumba, Yixuan He, Yezhou Yang

机构 * Arizona State University(亚利桑那州立大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 MentalBlackboard通过数学变换评估模型的空间可视化能力,揭示其在预测和规划任务中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09609 2026-02-24 cs.CV 57%

Tele-Omni: a Unified Multimodal Framework for Video Generation and Editing

Tele-Omni: 一种用于视频生成与编辑的统一多模态框架

Jialun Liu, Tian Li, Xiao Cao, Yukuo Ma, Gonghu Shang, Haibin Huang, Chi Zhang, Xiangzhen Chang, Zhiyong Huang, Jiakui Hu, Zuoxin Li, Yuanzhi Liang, Cong Liu, Junqi Liu, Robby T. Tan, Haitong Tang, Qizhen Weng, Yifan Xu, Liying Yang, Xiaoyan Yang, Peng Yu, Shiwen Zhang, Xuelong Li

机构 * TeleAI

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

AI总结 Tele-Omni是一种统一多模态框架,通过解析文本、图像和参考视频指令,实现视频生成与编辑的灵活控制,提升时间一致性和视觉一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏