arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-11 至 2026-02-11 共收录 40 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 8 篇

2602.09214 2026-02-11 cs.CV 88%

VLM-UQBench: A Benchmark for Modality-Specific and Cross-Modality Uncertainties in Vision Language Models

VLM-UQBench:一种用于视觉语言模型中模态特定和跨模态不确定性的基准

Chenyu Wang, Tianle Chen, H. M. Sabbir Ahmad, Kayhan Batmanghelich, Wenchao Li

机构 * Boston University(波士顿大学)

专题命中 视觉推理 :VLM(title,abstract);vision language model(title);vision-language model(abstract);分类 cs.CV

AI总结 VLM-UQBench通过评估不同UQ方法在模态特定和跨模态不确定性上的表现,揭示了现有方法在细粒度不确定性检测上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09934 2026-02-11 cs.CV 79%

VersaViT: Enhancing MLLM Vision Backbones via Task-Guided Optimization

VersaViT: 通过任务引导优化增强MLLM视觉骨干

Yikun Liu, Yuan Liu, Shangzhe Di, Haicheng Wang, Zhongyin Zhao, Le Tian, Xiao Zhou, Jie Zhou, Jiangchao Yao, Yanfeng Wang, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, China(上海交通大学人工智能学院) CMIC, Shanghai Jiao Tong University, China(上海交通大学计算机学院) WeChat AI, Tencent Inc., China(腾讯公司)

专题命中 视觉推理 :MLLM(title);multimodal large language model(abstract);分类 cs.CV

AI总结 VersaViT通过任务引导优化增强MLLM视觉骨干,解决其在密集预测任务中的性能问题,提升视觉任务的适应性与表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08688 2026-02-11 cs.AI cs.CV 73%

STELAR-VISION: Self-Topology-Aware Efficient Learning for Aligned Reasoning in Vision

STELAR-VISION:基于拓扑意识的高效学习以实现对齐推理

Chen Li, Han Zhang, Zhantao Yang, Fangyi Chen, Zihan Wang, Anudeepsekhar Bolimera, Marios Savvides

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 STELAR-VISION通过拓扑意识训练框架提升视觉-语言模型的推理准确性和效率,实现更高效的多模态任务处理。

Comments This paper has been accepted at AAAI 2026. This is the author's extended version. The final version will appear in the official proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09443 2026-02-11 cs.AI 70%

P1-VL: Bridging Visual Perception and Scientific Reasoning in Physics Olympiads

P1-VL: 联结视觉感知与物理竞赛中的科学推理

Yun Luo, Futing Wang, Qianjia Cheng, Fangchen Yu, Haodi Lei, Jianhao Yan, Chenxi Li, Jiacheng Chen, Yufeng Zhao, Haiyuan Wan, Yuchen Zhang, Shenghe Zheng, Junchi Yao, Qingyang Zhang, Haonan He, Wenxuan Zeng, Li Sheng, Chengxing Xie, Yuxin Zuo, Yizhuo Li, Yulun Wu, Rui Huang, Dongzhan Zhou, Kai Chen, Yu Qiao, Lei Bai, Yu Cheng, Ning Ding, Bowen Zhou, Peng Ye, Ganqu Cui

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 P1-VL通过融合课程强化学习和代理增强技术,成为首个在物理竞赛中获得12枚金牌的开源视觉-语言模型,展示了卓越的科学推理能力和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13666 2026-02-11 cs.RO cs.AI 70%

DREAM: Domain-aware Reasoning for Efficient Autonomous Underwater Monitoring

DREAM:面向高效自主水下监测的领域感知方法

Zhenqi Wu, Abhinav Modi, Angelos Mavrogiannis, Kaustubh Joshi, Nikhil Chopra, Yiannis Aloimonos, Nare Karapetyan, Ioannis Rekleitis, Xiaomin Lin

机构 * Electrical Engineering, University of South Florida(佛罗里达州立大学电气工程系) Maryland Robotics Center (MRC), University of Maryland(马里兰大学机器人中心) Woods Hole Oceanographic Institution (WHOI)(伍兹霍尔海洋研究所) Mechanical Engineering, University of Delaware(德雷克塞尔大学机械工程系)

专题命中 视觉推理 :vision language model(abstract);VLM(abstract);分类 cs.AI

AI总结 DREAM通过视觉语言模型引导的自主框架,实现了高效、低耗的水下长期监测,显著提升了目标物体探测效率与覆盖范围。

Comments In Proceeding of ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09972 2026-02-11 cs.RO 67%

Hydra-Nav: Object Navigation via Adaptive Dual-Process Reasoning

Hydra-Nav: 通过自适应双过程推理实现物体导航

Zixuan Wang, Huang Fang, Shaoan Wang, Yuanfei Luo, Heng Dong, Wei Li, Yiming Gan

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Peking University(北京大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract)

AI总结 Hydra-Nav通过自适应双过程推理提升物体导航效率,实现高效探索与决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09442 2026-02-11 cs.CL cs.AI 57%

Evaluating Social Bias in RAG Systems: When External Context Helps and Reasoning Hurts

评估RAG系统中的社会偏见:当外部上下文有助于而推理有害

Shweta Parihar, Lu Cheng

机构 * University of Illinois at Chicago(伊利诺伊大学芝加哥分校)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 本研究评估RAG系统中的社会偏见,发现外部上下文可减少偏见,但链式思维提示反而增加偏见,凸显了需要偏见意识推理框架的重要性。

Comments Accepted as a full paper with an oral presentation at the 30th Pacific-Asia Conference on Knowledge Discovery and Data Mining (PAKDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10357 2026-02-11 cs.AI 57%

Optimus-3: Dual-Router Aligned Mixture-of-Experts Agent with Dual-Granularity Reasoning-Aware Policy Optimization

Optimus-3: 具有双粒度推理感知策略优化的双路由对齐专家混合代理

Zaijing Li, Yuquan Xie, Rui Shao, Gongwei Chen, Weili Guan, Dongmei Jiang, Yaowei Wang, Liqiang Nie

机构 * School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen Campus)(计算机科学与技术学院,哈尔滨工业大学(深圳校区)) Pengcheng Laboratory(鹏城实验室) School of Information Science and Technology, Harbin Institute of Technology (Shenzhen Campus)(信息科学与技术学院,哈尔滨工业大学(深圳校区)) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 Optimus-3通过双路由对齐专家混合架构和双粒度推理感知策略优化,实现了系统1与系统2的协同,提升了开放性任务的解决能力。

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉定位与Grounding 9 篇

2602.09638 2026-02-11 cs.CV 88%

VideoAfford: Grounding 3D Affordance from Human-Object-Interaction Videos via Multimodal Large Language Model

VideoAfford: 通过多模态大语言模型实现人类-物体交互视频中的3D affordance grounding

Hanqing Wang, Mingyu Liu, Xiaoyu Chen, Chengwei MA, Yiming Zhong, Wenti Yin, Yuhao Liu, Zhiqing Cui, Jiahao Yuan, Lu Dai, Zhiyuan Ma, Hui Xiong

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(title,abstract);分类 cs.CV

AI总结 VideoAfford通过多模态大语言模型实现人类-物体交互视频中的3D affordance grounding,结合动态交互先验和空间感知损失函数,提升机器人操作的可操作区域识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09701 2026-02-11 cs.CV cs.AI 84%

GenSeg-R1: RL-Driven Vision-Language Grounding for Fine-Grained Referring Segmentation

GenSeg-R1: 通过强化学习驱动的视觉-语言接地进行细粒度指称分割

Sandesh Hegde, Jaison Saji Chacko, Debarshi Banerjee, Uma Mahesh

机构 * Camcom Technologies Pvt. Ltd.(Camcom技术有限公司)

专题命中 视觉定位与Grounding :grounding(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 GenSeg-R1 通过强化学习驱动的视觉-语言接地方法,在细粒度指称分割任务中实现了优于基线的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09252 2026-02-11 cs.CV cs.AI cs.MA 81%

VLM-Guided Iterative Refinement for Surgical Image Segmentation with Foundation Models

基于基础模型的手术图像分割迭代细化方法

Ange Lou, Yamin Li, Qi Chang, Nan Xi, Luyuan Xie, Zichao Li, Tianyu Luan

机构 * School of Automation Science and Engineering, South China University of Technology, Guangzhou, China(自动化科学与工程学院,华南理工大学,广州,中国) Vanderbilt University, Nashville, TN, USA(范德比尔特大学,纳什维尔,田纳西州,美国) The Pennsylvania State University, University Park, PA , USA(宾夕法尼亚州立大学,大学园,宾夕法尼亚州,美国) Peking University, Beijing , China(北京大学,北京,中国) Virginia Commonwealth University, Richmond, VA, USA(弗吉尼亚共同wealth大学,里士满,弗吉尼亚州,美国) University of California San Diego, San Diego, CA, USA(加州大学圣地亚哥分校,圣地亚哥,加利福尼亚州,美国)

专题命中 视觉定位与Grounding :VLM(title);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出IR-SIS,一种基于自然语言描述的手术图像分割迭代细化系统,结合视觉-语言模型和自适应工作流,实现高精度分割与临床交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00185 2026-02-11 cs.AI cs.LG 62%

Chunking Strategies for Multimodal AI Systems

多模态AI系统中的分块策略

Shashanka B R, Mohith Charan R, Seema Banu F

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了多模态系统中分块策略的分类和技术分析,探讨了不同模态的数据处理方法及挑战。

Comments 50 pages, 5 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09040 2026-02-11 eess.AS cs.AI cs.LG cs.SD 62%

Soft Clustering Anchors for Self-Supervised Speech Representation Learning in Joint Embedding Prediction Architectures

用于联合嵌入预测架构中自监督语音表示学习的软聚类锚点

Georgios Ioannides, Adrian Kieback, Judah Goldfeder, Linsey Pang, Aman Chadha, Aaron Elkins, Yann LeCun, Ravid Shwartz-Ziv

机构 * Carnegie Mellon University(卡内基梅隆大学) New York University(纽约大学) James Silberrad Brown Center for AI(詹姆斯·西伯拉德·布朗人工智能中心) Columbia University(哥伦比亚大学) Northeastern University(东北大学) Stanford University(斯坦福大学) Amazon GenAI(亚马逊生成人工智能)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 GMM-Anchored JEPA通过软聚类锚点提升语音表示学习,实现ASR、情感识别和槽填充的性能提升。

Comments 15 pages, 5 figures. Code: github.com/gioannides/clustering-anchored-jepa

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09979 2026-02-11 cs.CV 57%

Learning to Detect Baked Goods with Limited Supervision

在有限监督下学习检测烘焙食品

Thomas H. Schmitt, Maximilian Bundscherer, Tobias Bocklet

机构 * Technische Hochschule Nürnberg(纽伦堡技术大学) Georg Simon Ohm Nuremberg Germany(乔治·西蒙·奥姆纽尔堡德国)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 在有限监督下,通过结合OWLv2和Grounding DINO定位与图像级监督,以及使用Segment Anything 2伪标签微调,训练出YOLOv11模型,实现烘焙食品检测的高精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09146 2026-02-11 cs.CV 57%

SemanticMoments: Training-Free Motion Similarity via Third Moment Features

语义时刻:通过第三时刻特征实现免训练的运动相似性

Saar Huberman, Kfir Goldberg, Or Patashnik, Sagie Benaim, Ron Mokady

机构 * BRIA AI(BRIA人工智能研究中心) Tel Aviv University(特拉维夫大学) Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 SemanticMoments通过计算语义特征的高阶矩,无需训练即可提升基于运动的视频理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07342 2026-02-11 q-bio.NC cs.LG eess.IV 57%

Beyond Grid-Locked Voxels: Neural Response Functions for Continuous Brain Encoding

超越网格锁定体素:神经响应函数用于连续脑编码

Haomiao Chen, Keith W Jamison, Mert R. Sabuncu, Amy Kuceyeski

机构 * Cornell University(康奈尔大学) Cornell Tech(康奈尔科技) Weill Cornell Medicine(韦尔医学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 NRF通过连续函数建模大脑响应,超越传统扁平体素方法,提升跨受试者适应性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09901 2026-02-11 cs.IR cs.CL 50%

QP-OneModel: A Unified Generative LLM for Multi-Task Query Understanding in Xiaohongshu Search

QP-OneModel: 一个用于小红书搜索多任务查询理解的统一生成式大语言模型

Jianzhao Huang, Xiaorui Huang, Fei Zhao, Yunpeng Liu, Hui Zhang, Fangcheng Shi, Congfeng Li, Zechen Sun, Yi Wu, Yao Hu, Yunhan Bai, Shaosheng Cao

机构 * Xiaohongshu Inc.(小红书公司)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 QP-OneModel通过统一生成式大语言模型提升小红书搜索多任务查询理解的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 8 篇

2602.10109 2026-02-11 cs.RO 75%

ST4VLA: Spatially Guided Training for Vision-Language-Action Models

ST4VLA:基于空间引导的视觉-语言-动作模型训练

Jinhui Ye, Fangjing Wang, Ning Gao, Junqiu Yu, Yangkun Zhu, Bin Wang, Jinyu Zhang, Weiyang Jin, Yanwei Fu, Feng Zheng, Yilun Chen, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Hong Kong University of Science and Technology(香港科技大学) Southern University of Science and Technology(南方科技大学) Fudan University(复旦大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);grounding(abstract)

AI总结 ST4VLA通过空间引导训练提升视觉-语言-动作模型的性能,实现对机器人任务的更稳健和可泛化的学习。

Comments Spatially Training for VLA, Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09765 2026-02-11 cs.RO 67%

NavDreamer: Video Models as Zero-Shot 3D Navigators

NavDreamer: 视频模型作为零样本三维导航器

Xijie Huang, Weiqi Gai, Tianyue Wu, Congyu Wang, Zhiyang Liu, Xin Zhou, Yuze Wu, Fei Gao

专题命中 GUI与屏幕智能体 :VLM(abstract);grounding(abstract)

AI总结 NavDreamer利用视频模型实现零样本三维导航,通过生成视频模型作为语言指令与导航轨迹的接口,结合时空信息和物理动态,实现强大泛化能力。

Comments Work in the progress. 22 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09007 2026-02-11 cs.AI cs.CV 62%

GEBench: Benchmarking Image Generation Models as GUI Environments

GEBench: 图形用户界面生成模型的基准测试

Haodong Li, Jingwei Wu, Quan Sun, Guopeng Li, Juanxi Tian, Huanyu Zhang, Yanlin Lai, Ruichuan An, Hongbo Peng, Yuhong Dai, Chenxi Li, Chunmei Qing, Jia Wang, Ziyang Meng, Zheng Ge, Xiangyu Zhang, Daxin Jiang

机构 * StepFun South China University of Technology(南方科技大学) Peking University(北京大学) Tsinghua University(清华大学) Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所) The University of Chicago(芝加哥大学) Nanyang Technological University(南洋理工大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 GEBench提出一个评估GUI生成模型动态交互和时间一致性的基准测试,通过五维指标揭示模型在多步交互中的瓶颈问题。

Comments 23 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09940 2026-02-11 cs.RO cs.AI 57%

Instruct2Act: From Human Instruction to Actions Sequencing and Execution via Robot Action Network for Robotic Manipulation

Instruct2Act: 从人类指令到动作序列和执行的机器人操作网络

Archit Sharma, Dharmendra Sharma, John Rebeiro, Peeyush Thakur, Narendra Dhar, Laxmidhar Behera

机构 * Indian Institute of Technology Mandi(印度理工学院曼迪分校)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 Instruct2Act通过机器人操作网络实现从人类指令到动作序列的解析与执行,达到91.5%的子动作预测准确率和90%的任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09662 2026-02-11 cs.CV 57%

TreeCUA: Efficiently Scaling GUI Automation with Tree-Structured Verifiable Evolution

TreeCUA: 通过树结构可验证进化高效扩展GUI自动化

Deyang Jiang, Jing Huang, Xuanle Zhao, Lei Chen, Liming Zheng, Fanfan Liu, Haibo Qiu, Peng Shi, Zhixiong Zeng

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 TreeCUA通过树结构可验证进化高效扩展GUI自动化,提升GUI规划能力。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05787 2026-02-11 cs.AI 57%

From Off-Policy to On-Policy: Enhancing GUI Agents via Bi-level Expert-to-Policy Assimilation

从离线到在线:通过双层专家到策略融合提升GUI代理

Zezhou Wang, Ziyun Zhang, Xiaoyi Zhang, Zhuzhong Qian, Yan Lu

机构 * Nanjing University(南京大学) Peking University(北京大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 BEPA通过双层专家到策略融合方法,提升GUI代理在OSWorld-Verified等基准测试中的性能。

Comments Work In Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09973 2026-02-11 cs.RO 50%

RoboInter: A Holistic Intermediate Representation Suite Towards Robotic Manipulation

RoboInter: 一种面向机器人操控的综合中间表示套件

Hao Li, Ziqin Wang, Zi-han Ding, Shuai Yang, Yilun Chen, Yang Tian, Xiaolin Hu, Tai Wang, Dahua Lin, Feng Zhao, Si Liu, Jiangmiao Pang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Beihang University(北航) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 RoboInter通过统一的中间表示套件,提升机器人操控中视觉-语言-动作系统的泛化能力和推理能力。

Comments Published to ICLR 2026, 69 pages, 40 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07629 2026-02-11 cs.RO 50%

LCLA: Language-Conditioned Latent Alignment for Vision-Language Navigation

LCLA:语言引导的潜在对齐用于视觉-语言导航

Nitesh Subedi, Adam Haroon, Samuel Tetteh, Prajwal Koirala, Cody Fleming, Soumik Sarkar

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 LCLA通过将视觉-语言观测对齐到专家策略的潜在空间,实现轻量级的视觉-运动学习,提升在不同环境下的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与鲁棒性 4 篇

2602.09825 2026-02-11 cs.CV 79%

SAKED: Mitigating Hallucination in Large Vision-Language Models via Stability-Aware Knowledge Enhanced Decoding

SAKED: 通过稳定性感知知识增强解码缓解大视觉-语言模型中的幻觉

Zhaoxu Li, Chenqi Kong, Peijun Bao, Song Xia, Yi Tu, Yi Yu, Xinghao Jiang, Xudong Jiang

机构 * ROSE Lab, School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(ROSE实验室,电子工程学院,南洋理工大学,新加坡) ROSE Lab, Interdisciplinary Graduate Programme, Nanyang Technological University, Singapore(ROSE实验室,跨学科研究生项目,南洋理工大学,新加坡) School of Physical and Mathematical Sciences, Nanyang Technological University, Singapore(物理与数学科学学院,南洋理工大学,新加坡) Shanghai Jiao Tong University, China(上海交通大学,中国)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 SAKED通过引入稳定性感知知识增强解码方法,有效缓解大视觉-语言模型中的幻觉问题,无需训练即可集成至不同架构中,实现最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06218 2026-02-11 cs.CV cs.LG 62%

Cross-Modal Redundancy and the Geometry of Vision-Language Embeddings

跨模态冗余与视觉-语言嵌入的几何学

Grégoire Dhimoïla, Thomas Fel, Victor Boutin, Agustin Picard

机构 * Brown University(布朗大学) ENS Paris Saclay(巴黎萨克雷大学) IRT Saint Exupéry(IRT圣埃克苏佩里) Kempner Institute, Harvard University(哈佛大学凯姆纳研究所)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文通过等能假设和对齐稀疏自编码器,揭示了视觉-语言模型中跨模态对齐的几何结构,发现稀疏双模态原子承载了跨模态对齐信号,单模态原子解释了模态差距,去除单模态原子可消除差距而不影响性能。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16596 2026-02-11 cs.CV cs.AI 62%

SHIELD: Suppressing Hallucinations In LVLM Encoders via Bias and Vulnerability Defense

SHIELD:通过偏差和脆弱性防御抑制LVLM编码器中的幻觉

Yiyang Huang, Liang Shi, Yitian Zhang, Yi Xu, Yun Fu

机构 * Department of Electrical and Computer Engineering, Northeastern University(电气与计算机工程系,东北大学) Khoury College of Computer Science, Northeastern University(计算机科学学院,东北大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 SHIELD通过减少统计偏差、对抗固有偏差和解决脆弱性,有效抑制LVLM编码器中的对象幻觉。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09541 2026-02-11 cs.CV 57%

Scalpel: Fine-Grained Alignment of Attention Activation Manifolds via Mixture Gaussian Bridges to Mitigate Multimodal Hallucination

Scalpel: 通过混合高斯桥梁实现细粒度注意力激活流形对齐以缓解多模态幻觉

Ziqiang Shi, Rujie Liu, Shanshan Yu, Satoshi Munakata, Koichi Shirahata

机构 * Fujitsu Research & Development Center Co.,LTD.(Fujitsu 研究与开发中心有限公司) Fujitsu Limited(Fujitsu 有限公司)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 Scalpel通过高斯混合模型和熵最优传输减少多模态幻觉,实现注意力激活流形的细粒度对齐,提升视觉-语言模型的输出一致性。

Comments WACV 2026 (It was accepted in the first round, with an acceptance rate of 6%.)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. VLM训练与架构 9 篇

2602.09483 2026-02-11 cs.CV 85%

Beyond Next-Token Alignment: Distilling Multimodal Large Language Models via Token Interactions

超越单个词对齐:通过令牌交互蒸馏多模态大语言模型

Lin Chen, Xiaoke Zhao, Kun Ding, Weiwei Feng, Changtao Miao, Zili Wang, Wenxuan Guo, Ying Wang, Kaiyuan Zheng, Bo Zhang, Zhe Li, Shiming Xiang

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所信息与智能系统研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);MLLM(abstract);分类 cs.CV

AI总结 Align-TI通过令牌交互改进知识蒸馏,实现多模态大语言模型的高效压缩与性能提升

详情

展开后加载摘要…

URL PDF HTML 收藏