arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-19 至 2025-12-19 共收录 46 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 4 篇

2512.16755 2025-12-19 cs.AI 57%

CitySeeker: How Do VLMS Explore Embodied Urban Navigation With Implicit Human Needs?

CitySeeker: VLMS如何通过隐含人类需求探索具身城市导航

Siqi Wang, Chao Liang, Yunfan Gao, Erxin Yu, Sen Li, Yushi Li, Jing Li, Haofen Wang

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Tongji University(同济大学) Nanjing Institute of Geography and Limnology, Chinese Academy of Sciences(中国科学院南京地理与湖泊研究所) Research Centre for Data Science & Artificial Intelligence(数据科学与人工智能研究中心)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 CitySeeker通过评估VLMs在动态城市环境中探索具身导航的能力,揭示了隐含需求理解中的关键瓶颈,并提出改进策略以提升空间推理和决策能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16295 2025-12-19 cs.AI 57%

OS-Oracle: A Comprehensive Framework for Cross-Platform GUI Critic Models

OS-Oracle: 一个跨平台GUI批评模型的综合框架

Zhenyu Wu, Jingjing Xie, Zehao Li, Bowen Yang, Qiushi Sun, Zhaoyang Liu, Zhoumianze Liu, Yu Qiao, Xiangyu Yue, Zun Wang, Zichen Ding

机构 * Shanghai Jiaotong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) CUHK MMLab(香港大学MMLab) The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.AI

AI总结 OS-Oracle提出了一种跨平台GUI批评模型框架,通过合成数据和两阶段训练方法,实现了在移动、网页和桌面平台上的高效批评评估。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 幻觉与鲁棒性 5 篇

2505.17509 2025-12-19 cs.CV 79%

MoAPT: Mixture of Adversarial Prompt Tuning for Vision-Language Models

MoAPT: 基于对抗提示微调的视觉-语言模型混合

Shiji Zhao, Qihui Zhu, Shukun Xiong, Shouwei Ruan, Maoxun Yuan, Jialing Tao, Jiexi Liu, Ranjie Duan, Jie Zhang, Jie Zhang, Xingxing Wei

机构 * Institute of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能研究院) Center for Frontier AI Research, A*STAR, Singapore(A*STAR前沿人工智能研究中心) Institute of Computing Technology, Chinese Academy of Sciences, China(中国科学院计算技术研究所)

专题命中 幻觉与鲁棒性 :vision-language model(title);vision language model(abstract);分类 cs.CV

AI总结 MoAPT通过混合对抗提示微调提升视觉-语言模型对多种对抗攻击的鲁棒性,通过学习多个提示的混合权重以增强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16921 2025-12-19 cs.CV cs.AI 62%

Differences That Matter: Auditing Models for Capability Gap Discovery and Rectification

关键差异:用于能力缺口发现与纠正的模型审计

Qihao Liu, Chengzhi Mao, Yaojie Liu, Alan Yuille, Wen-Sheng Chu

机构 * Google(谷歌) Johns Hopkins University(约翰霍普金斯大学)

专题命中 幻觉与鲁棒性 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 AuditDM通过主动发现和纠正多模态大语言模型的失败模式,提升模型性能和诊断能力。

Comments project page: https://auditdm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16723 2025-12-19 cs.LG 57%

KOSS: Kalman-Optimal Selective State Spaces for Long-Term Sequence Modeling

KOSS:基于卡尔曼最优选择状态空间的长期序列建模

Lei Wang, Xin Tan, Mingwei Wang, Ying Zhang

机构 * School of Electronic Information(电子信息学院) Artificial Intelligence, Shaanxi University of Science(人工智能,陕西科技大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.LG

AI总结 KOSS通过卡尔曼最优选择机制,在长期序列建模中实现高效且鲁棒的上下文感知选择,显著提升预测准确性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15776 2025-12-19 cs.AI cs.MA cs.RO 57%

Emergence: Overcoming Privileged Information Bias in Asymmetric Embodied Agents via Active Querying

涌现:通过主动查询克服不对称具身智能体中的特权信息偏差

Shaun Baek, Sam Liu, Joseph Ukpong

机构 * Emory University(埃默里大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 本文通过主动查询机制解决不对称具身智能体中的特权信息偏差问题,揭示了沟通接地错误对协作成功率的影响。

Comments 12 pages, 9 pages of content, 6 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01185 2025-12-19 cs.CR 50%

DefenSee: Dissecting Threat from Sight and Text -- A Multi-View Defensive Pipeline for Multi-modal Jailbreaks

DefenSee:从视觉和文本中解构威胁——一种多视图防御管道用于多模态对抗突破

Zihao Wang, Kar Wai Fok, Vrizlynn L. L. Thing

专题命中 幻觉与鲁棒性 :MLLM(abstract)

AI总结 DefenSee通过图像变体转录和跨模态一致性检查,提供一种多模态防御方法,有效降低多模态对抗攻击的成功率,提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. VLM训练与架构 8 篇

2512.15957 2025-12-19 cs.CV cs.AI 84%

Seeing is Believing (and Predicting): Context-Aware Multi-Human Behavior Prediction with Vision Language Models

看见即信仰(并预测):基于视觉语言模型的上下文感知多人类行为预测

Utsav Panchal, Yuchen Liu, Luigi Palmieri, Ilche Georgievski, Marco Aiello

机构 * Institute of Architecture of Application Systems, University of Stuttgart, Germany(应用系统建筑研究所,斯图加特大学,德国) Bosch Research, Germany(博世研究,德国)

专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 CAMP-VLM通过结合视觉语言模型与上下文特征,提升了多人类行为预测的准确性,其在预测精度上比基线模型高66.9%。

Comments Accepted at IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16906 2025-12-19 cs.CV 79%

VIVA: VLM-Guided Instruction-Based Video Editing with Reward Optimization

VIVA: 基于VLM的指令式视频编辑与奖励优化

Xiaoyan Cong, Haotian Yang, Angtian Wang, Yizhi Wang, Yiding Yang, Canyu Zhang, Chongyang Ma

机构 * Brown University(布朗大学) Intelligent Creation, ByteDance(字节跳动智能创作)

专题命中 VLM训练与架构 :VLM(title,abstract);分类 cs.CV

AI总结 VIVA通过VLM引导编码和奖励优化,实现更高效、高质量的指令式视频编辑,提升对复杂指令的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12998 2025-12-19 cs.CV 79%

PerTouch: VLM-Driven Agent for Personalized and Semantic Image Retouching

PerTouch:基于VLM的个性化和语义图像润色代理

Zewei Chang, Zheng-Peng Duan, Jianxing Zhang, Chun-Le Guo, Siyu Liu, Hyungju Chun, Hyunhee Park, Zikun Liu, Chongyi Li

专题命中 VLM训练与架构 :VLM(title,abstract);分类 cs.CV

AI总结 PerTouch通过VLM驱动代理实现个性化和语义图像润色,结合语义替换与参数扰动机制,提升用户意图匹配与长期偏好捕捉能力。

Comments To appear at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16446 2025-12-19 cs.RO cs.AI 70%

E-SDS: Environment-aware See it, Do it, Sorted - Automated Environment-Aware Reinforcement Learning for Humanoid Locomotion

E-SDS: 环境感知的见它、做它、排序——面向人类oid运动的自动化环境感知强化学习

Enis Yalcin, Joshua O'Hara, Maria Stamatopoulou, Chengxu Zhou, Dimitrios Kanoulas

机构 * University College London(伦敦大学学院)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 E-SDS通过整合视觉-语言模型与实时地形传感器分析,实现了自动化环境感知强化学习,显著提升了人形机器人在复杂地形中的运动鲁棒性和效率。

Comments 12 pages, 3 figures, 4 tables. Accepted at RiTA 2025 (Springer LNNS)

Journal ref RiTA 2025 (Springer LNNS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16250 2025-12-19 cs.AI cs.MA 70%

AMUSE: Audio-Visual Benchmark and Alignment Framework for Agentic Multi-Speaker Understanding

AMUSE:面向代理多说话者理解的音频-视觉基准与对齐框架

Sanjoy Chowdhury, Karren D. Yang, Xudong Liu, Fartash Faghri, Pavan Kumar Anasosalu Vasu, Oncel Tuzel, Dinesh Manocha, Chun-Liang Li, Raviteja Vemulapalli

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Apple(苹果公司)

专题命中 VLM训练与架构 :grounding(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 AMUSE提出一个面向多说话人理解的音频-视觉基准与对齐框架RAFT,通过代理推理提升多模态模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16164 2025-12-19 cs.CV cs.AI 62%

C-DGPA: Class-Centric Dual-Alignment Generative Prompt Adaptation

面向类别的双对齐生成提示适应:C-DGPA

Chao Li, Dasha Hu, Chengyang Li, Yuming Jiang, Yuncheng Shen

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 C-DGPA通过双分支架构协同优化边缘分布和条件分布对齐,提升无监督领域适应中提示学习的领域不变性和语义判别性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20322 2025-12-19 cs.CV 57%

HyperET: Efficient Training in Hyperbolic Space for Multi-modal Large Language Models

HyperET: 在超几何空间中为多模态大语言模型实现高效训练

Zelin Peng, Zhengqin Xu, Qingyang Liu, Xiaokang Yang, Wei Shen

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, SJTU(摩埃人工智能重点实验室、人工智能学院、计算机科学学院、上海交通大学)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

AI总结 HyperET通过在双曲空间中动态调整半径,实现多模态大语言模型的高效训练,提升跨模态对齐性能。

Comments Accepted by NeurIPS2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01146 2025-12-19 q-bio.OT 50%

Retrieval-Augmented Generation in Biomedicine: A Survey of Technologies, Datasets, and Clinical Applications

生物医学中的检索增强生成:技术、数据集和临床应用的综述

Jiawei He, Boya Zhang, Hossein Rouhizadeh, Yingjian Chen, Rui Yang, Jin Lu, Xudong Chen, Nan Liu, Douglas Teodoro

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 本文综述了生物医学中检索增强生成技术的发展,探讨了其在临床应用中的挑战与未来发展方向。

Comments 49 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他VLM 1 篇

2511.20056 2025-12-19 cs.CL 50%

Online-PVLM: Advancing Personalized VLMs with Online Concept Learning

在线-PVLM:通过在线概念学习推进个性化VLMs

Huiyu Bai, Runze Wang, Zhuoyun Du, Yiyang Zhao, Fengji Zhang, Haoyu Chen, Xiaoyong Zhu, Bo Zheng, Xuejiao Zhao

机构 * Nanyang Technological University(南洋理工大学) Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) City University of Hong Kong(香港城市大学) University of Oulu(奥卢大学)

专题命中 其他VLM :visual language model(abstract)

AI总结 Online-PVLM通过在线概念学习框架,实现个性化VLMs的高效实时适应,并提出OP-Eval基准评估其在现实场景中的性能。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏