arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-11 至 2026-02-11 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 6 篇

2602.09080 2026-02-11 cs.LG cs.AI 79%

Looping Back to Move Forward: Recursive Transformers for Efficient and Flexible Large Multimodal Models

循环回溯以前进:递归变换器用于高效灵活的大型多模态模型

Ruihan Xu, Yuting Gao, Lan Wang, Jianing Li, Weihao Chen, Qingpei Guo, Ming Yang, Shiliang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) AntGroup(蚂蚁集团)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 RecursiveVLM通过递归细化机制提升多模态模型效率,实现参数复用和性能提升。

Comments This is a primary contribution in the Recursive Vision-Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06218 2026-02-11 cs.CV cs.LG 79%

Cross-Modal Redundancy and the Geometry of Vision-Language Embeddings

跨模态冗余与视觉-语言嵌入的几何学

Grégoire Dhimoïla, Thomas Fel, Victor Boutin, Agustin Picard

机构 * Brown University(布朗大学) ENS Paris Saclay(巴黎萨克雷大学) IRT Saint Exupéry(IRT圣埃克苏佩里) Kempner Institute, Harvard University(哈佛大学凯姆纳研究所)

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文通过等能假设和对齐稀疏自编码器,揭示了视觉-语言模型中跨模态对齐的几何结构,发现稀疏双模态原子承载了跨模态对齐信号,单模态原子解释了模态差距,去除单模态原子可消除差距而不影响性能。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16596 2026-02-11 cs.CV cs.AI 62%

SHIELD: Suppressing Hallucinations In LVLM Encoders via Bias and Vulnerability Defense

SHIELD:通过偏差和脆弱性防御抑制LVLM编码器中的幻觉

Yiyang Huang, Liang Shi, Yitian Zhang, Yi Xu, Yun Fu

机构 * Department of Electrical and Computer Engineering, Northeastern University(电气与计算机工程系,东北大学) Khoury College of Computer Science, Northeastern University(计算机科学学院,东北大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 SHIELD通过减少统计偏差、对抗固有偏差和解决脆弱性,有效抑制LVLM编码器中的对象幻觉。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08688 2026-02-11 cs.AI cs.CV 62%

STELAR-VISION: Self-Topology-Aware Efficient Learning for Aligned Reasoning in Vision

STELAR-VISION:基于拓扑意识的高效学习以实现对齐推理

Chen Li, Han Zhang, Zhantao Yang, Fangyi Chen, Zihan Wang, Anudeepsekhar Bolimera, Marios Savvides

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 STELAR-VISION通过拓扑意识训练框架提升视觉-语言模型的推理准确性和效率,实现更高效的多模态任务处理。

Comments This paper has been accepted at AAAI 2026. This is the author's extended version. The final version will appear in the official proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10913 2026-02-11 cs.CV cs.CL 62%

Know "No" Better: A Data-Driven Approach for Enhancing Negation Awareness in CLIP

了解“不”:一种数据驱动的方法用于增强CLIP中的否定意识

Junsung Park, Jungbeom Lee, Jongyoon Song, Sangwon Yu, Dahuin Jung, Sungroh Yoon

机构 * Department of Electrical and Computer Engineering, Seoul National University(首尔国立大学电子与计算机工程系) Amazon(亚马逊) Samsung Research(三星研究院) School of Computer Science and Engineering, Soongsil University(顺天大学计算机科学与工程学院) IPAI, AIIS, ASRI, INMC, and ISRC, Seoul National University(首尔国立大学IPAI、AIIS、ASRI、INMC和ISRC)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出NegationCLIP,通过生成包含否定的数据增强CLIP的否定意识,同时提出NegRefCOCOg基准用于评估多模态模型的否定理解能力。

Comments Accepted to ICCV 2025

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), 2025, pp. 2825-2835

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09443 2026-02-11 cs.AI 57%

P1-VL: Bridging Visual Perception and Scientific Reasoning in Physics Olympiads

P1-VL: 联结视觉感知与物理竞赛中的科学推理

Yun Luo, Futing Wang, Qianjia Cheng, Fangchen Yu, Haodi Lei, Jianhao Yan, Chenxi Li, Jiacheng Chen, Yufeng Zhao, Haiyuan Wan, Yuchen Zhang, Shenghe Zheng, Junchi Yao, Qingyang Zhang, Haonan He, Wenxuan Zeng, Li Sheng, Chengxing Xie, Yuxin Zuo, Yizhuo Li, Yulun Wu, Rui Huang, Dongzhan Zhou, Kai Chen, Yu Qiao, Lei Bai, Yu Cheng, Ning Ding, Bowen Zhou, Peng Ye, Ganqu Cui

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 P1-VL通过融合课程强化学习和代理增强技术,成为首个在物理竞赛中获得12枚金牌的开源视觉-语言模型,展示了卓越的科学推理能力和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏