arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-12 至 2026-02-12 共收录 42 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 4 篇

2512.15933 2026-02-12 cs.CV 70%

City Navigation in the Wild: Exploring Emergent Navigation from Web-Scale Knowledge in MLLMs

城市真实环境中的导航:探索从大规模知识中涌现的导航

Dwip Dalal, Utkarsh Mishra, Narendra Ahuja, Nebojsa Jojic

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出稀疏关联视觉导航任务,通过CityNav基准评估MLLMs在真实城市环境中的导航能力,并提出VoP方法提升导航性能。

Comments Accepted at EACL 2026 (ORAL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10598 2026-02-12 cs.AI cs.LG 62%

Neuro-symbolic Action Masking for Deep Reinforcement Learning

神经符号动作遮蔽用于深度强化学习

Shuai Han, Mehdi Dastani, Shihan Wang

机构 * Utrecht University(乌得勒支大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 NSAM通过自动学习符号模型与深度策略优化结合,提升深度强化学习的样本效率并减少约束违规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10717 2026-02-12 cs.RO 50%

Say, Dream, and Act: Learning Video World Models for Instruction-Driven Robot Manipulation

说、梦、做:学习视频世界模型以驱动指令式机器人操作

Songen Gu, Yunuo Cai, Tianyu Wang, Simo Wu, Yanwei Fu

机构 * Fudan University(复旦大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 本文提出一种视频条件动作框架,通过生成稳健的视频模型和对抗性蒸馏,提升机器人操作中的预测能力和空间准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 幻觉与鲁棒性 4 篇

2505.23798 2026-02-12 cs.CL cs.AI cs.CV 81%

Unveiling the "Fairness Seesaw": Discovering and Mitigating Gender and Race Bias in Vision-Language Models

揭示'公平性之锯':在视觉-语言模型中发现并缓解性别和种族偏见

Jian Lan, Udo Schlegel, Tanveer Hannan, Gengyuan Zhang, Haokun Chen, Thomas Seidl

机构 * LMU Munich(慕尼黑莱布尼茨大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出RES-FAIR框架,通过调整隐藏状态缓解视觉-语言模型中的性别和种族偏见,提升响应公平性和置信度校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10771 2026-02-12 cs.CV cs.RO 57%

From Steering to Pedalling: Do Autonomous Driving VLMs Generalize to Cyclist-Assistive Spatial Perception and Planning?

从转向到踩踏:自动驾驶VLMs是否能泛化到骑行辅助的空间感知与规划?

Krishna Kanth Nakka, Vedasri Nakka

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出CyclingVQA基准,评估自动驾驶VLMs在骑行辅助场景中的感知与推理能力,发现现有模型在骑行特定交通提示理解上存在不足,需进一步改进。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10425 2026-02-12 cs.CV 57%

HII-DPO: Eliminate Hallucination via Accurate Hallucination-Inducing Counterfactual Images

HII-DPO: 通过准确的 hallucination-Inducing Counterfactual Images 消除幻觉

Yilin Yang, Zhenghui Guo, Yuke Wang, Omprakash Gnawali, Sheng Di, Chengming Zhang

机构 * University of Houston(休斯顿大学) Rice University(里士满大学) Argonne National Laboratory(阿贡国家实验室)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 HII-DPO通过生成准确的幻觉诱导图像,有效缓解了VLMs在语言偏见下的幻觉问题,提升了模型的对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19844 2026-02-12 cs.CV 57%

ProAPO: Progressively Automatic Prompt Optimization for Visual Classification

ProAPO:逐步自动提示优化用于视觉分类

Xiangyan Qu, Gaopeng Gou, Jiamin Zhuang, Jing Yu, Kun Song, Qihao Wang, Yili Li, Gang Xiong

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) School of Information Engineering, Minzu University of China(民族大学信息工程学院) University of Science and Technology Beijing(北京科技大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 ProAPO通过逐步自动优化提示,提升视觉分类性能,优于现有方法并在多个数据集上取得显著改进。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. VLM训练与架构 4 篇

2602.10815 2026-02-12 cs.CV cs.LG 81%

Why Does RL Generalize Better Than SFT? A Data-Centric Perspective on VLM Post-Training

为什么强化学习比监督微调在泛化能力上更优?一种以数据为中心的视觉语言模型后训练视角

Aojun Lu, Tao Feng, Hangjie Yuan, Wei Li, Yanan Sun

机构 * College of Computer Science, Sichuan University(四川大学计算机科学学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文通过数据视角揭示了RL在VLM后训练中泛化能力优于SFT的原因,提出DC-SFT方法提升OOD性能并提高稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10458 2026-02-12 cs.AI cs.LG 73%

Found-RL: foundation model-enhanced reinforcement learning for autonomous driving

Found-RL: 基于基础模型的强化学习用于自动驾驶

Yansong Qu, Zihao Sheng, Zilin Huang, Jiancong Chen, Yuhao Luo, Tianyi Wang, Yiheng Feng, Samuel Labi, Sikai Chen

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.AI、cs.LG

AI总结 Found-RL通过异步批量推理和多样化监督机制,提升自动驾驶中强化学习的效率与实时性。

Comments 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00653 2026-02-12 cs.CV cs.AI 62%

Non-Contrastive Vision-Language Learning with Predictive Embedding Alignment

非对比视觉语言学习与预测嵌入对齐

Lukas Kuhn, Giuseppe Serra, Florian Buettner

机构 * Goethe University Frankfurt(法兰克福歌德大学) German Cancer Research Center (DKFZ)(德国癌症研究中心(DKFZ)) German Cancer Consortium (DKTK)(德国癌症联合会(DKTK))

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 NOVA通过联合嵌入预测与分布正则化,实现非对比视觉语言学习,简化训练目标并提升稳定性与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10740 2026-02-12 cs.CL 50%

Reinforced Curriculum Pre-Alignment for Domain-Adaptive VLMs

强化课程预对齐用于领域自适应视觉-语言模型

Yuming Yan, Shuo Yang, Kai Tang, Sihong Chen, Yang Zhang, Ke Xu, Dan Hu, Qun Yu, Pengfei Hu, Edith C. H. Ngai

机构 * Tencent(腾讯)

专题命中 VLM训练与架构 :vision-language model(abstract)

AI总结 本文提出RCPA方法,通过课程意识的渐进调节机制,在领域自适应中平衡领域知识获取与通用能力保持。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他VLM 1 篇

2511.03220 2026-02-12 eess.SP 50%

Multimodal-Wireless: A Large-Scale Dataset for Sensing and Communication

多模态无线:一种大规模数据集用于传感与通信

Tianhao Mao, Le Liang, Jie Yang, Hao Ye, Shi Jin, Geoffrey Ye Li

专题命中 其他VLM :multimodal large language model(abstract)

AI总结 本文提出多模态无线数据集,用于多模态传感与通信研究,包含高分辨率CSI与多种传感器数据,支持通信与协同感知应用。

详情

展开后加载摘要…

URL PDF HTML 收藏