arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-17 至 2026-02-17 共收录 71 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 13 篇

2602.13315 2026-02-17 cs.CV cs.AI 73%

IDPruner: Harmonizing Importance and Diversity in Visual Token Pruning for MLLMs

IDPruner: 在视觉令牌修剪中协调重要性与多样性

Yifan Tan, Yifu Sun, Shirui Huang, Hong Liu, Guanghua Yu, Jianchen Zhu, Yangdong Deng

机构 * School of Software, Tsinghua University(清华大学软件学院) Tencent(腾讯)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 IDPruner通过协调重要性与多样性,提出了一种高效的视觉令牌修剪方法,实现最优平衡并提升多模态大语言模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00527 2026-02-17 cs.RO 67%

DeCo: Task Decomposition and Skill Composition for Zero-Shot Generalization in Long-Horizon 3D Manipulation

DeCo:用于长周期3D操作零样本泛化任务分解与技能组合

Zixuan Chen, Junhui Yin, Yangtao Chen, Jing Huo, Pinzhuo Tian, Jieqi Shi, Yiwen Hou, Yinchuan Li, Yang Gao

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院) Huawei Noah’s Ark Lab (AI Lab), China(华为诺亚实验室(AI实验室))

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

AI总结 DeCo通过任务分解与技能组合提升长周期3D操作任务的零样本泛化能力,显著提高多个模型在新任务上的成功率。

Comments RAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14445 2026-02-17 cs.LG cs.AI cs.CL cs.NE 62%

Selective Synchronization Attention

选择性同步注意

Hasi Hays

机构 * Department of Chemical Engineering, University of Arkansas, Fayetteville, AR 72701, USA(化学工程系,阿肯色大学,法雷维尔,AR 72701,USA)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 提出选择性同步注意机制,通过振荡模型实现高效自注意,具备自然稀疏性、统一编码和单次计算优势,替代Transformer提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14432 2026-02-17 cs.LG cs.AI stat.ML 62%

S2D: Selective Spectral Decay for Quantization-Friendly Conditioning of Neural Activations

S2D:选择性谱衰减用于神经激活的量化友好条件化

Arnav Chavan, Nahush Lele, Udbhav Bamba, Sankalp Dayal, Aditi Raghunathan, Deepak Gupta

机构 * Amazon(亚马逊公司) Carnegie Mellon University(卡内基梅隆大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 S2D通过选择性谱衰减减少神经激活异常值,提升模型在量化过程中的准确性和部署效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14237 2026-02-17 cs.CV cs.AI 62%

AbracADDbra: Touch-Guided Object Addition by Decoupling Placement and Editing Subtasks

AbracADDbra: 通过解耦放置和编辑子任务实现触控引导的对象添加

Kunal Swami, Raghu Chittersu, Yuvraj Rathore, Rajeev Irny, Shashavali Doodekula, Alok Shukla

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 AbracADDbra通过解耦放置和编辑子任务,利用触控先验实现高效精准的对象添加,提升了交互式编辑的用户体验和编辑质量。

Comments Accepted in IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14024 2026-02-17 cs.LG cs.AI 62%

EIDOS: Latent-Space Predictive Learning for Time Series Foundation Models

EIDOS:用于时间序列基础模型的潜在空间预测学习

Xinxing Zhou, Qingren Yao, Yiji Zhao, Chenghao Liu, Flora Salim, Xiaojie Yuan, Yanlong Wen, Ming Jin

机构 * Nankai University(南开大学) Eindhoven University of Technology(埃因霍温理工大学) Yunnan University(云南大学) University of New South Wales(新南威尔士大学) Griffith University(格里菲斯大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 EIDOS通过潜在空间预测学习提升时间序列基础模型的鲁棒性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14438 2026-02-17 cs.RO cs.MA 50%

RoboSolver: A Multi-Agent Large Language Model Framework for Solving Robotic Arm Problems

RoboSolver: 一种基于多智能体大语言模型的机器人臂问题求解框架

Hamid Khabazi, Ali F. Meghdari, Alireza Taheri

专题命中 VLM训练与架构 :VLM(abstract)

AI总结 RoboSolver通过多智能体框架结合LLM和VLM,实现机器人臂问题的自动求解,准确率达0.97。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13591 2026-02-17 cs.RO 50%

AgentRob: From Virtual Forum Agents to Hijacked Physical Robots

AgentRob: 从虚拟论坛代理到被劫持的物理机器人

Wenrui Liu, Yaxuan Wang, Xun Zhang, Yanshu Wang, Jiashen Wei, Yifan Xiang, Yuhang Wang, Mingshen Ye, Elsie Dai, Zhiqi Liu, Yingjie Xu, Xinyang Chen, Hengzhe Sun, Jiyu Shen, Jingjing He, Tong Yang

机构 * Peking University(北京大学)

专题命中 VLM训练与架构 :VLM(abstract)

AI总结 AgentRob通过模型上下文协议连接虚拟论坛与物理机器人,实现多代理协作控制,展示了论坛驱动的多机器人协调可行性。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他VLM 3 篇

2602.13715 2026-02-17 cs.IR 82%

DMESR: Dual-view MLLM-based Enhancing Framework for Multimodal Sequential Recommendation

DMESR: 基于双视角的多模态序列推荐增强框架

Mingyao Huang, Qidong Liu, Wenxuan Yang, Moranxin Wang, Yuqi Sun, Haiping Zhu, Feng Tian, Yan Chen

专题命中 其他VLM :MLLM(title,abstract);multimodal large language model(abstract)

AI总结 DMESR通过双视角机制解决多模态序列推荐中的语义对齐和细粒度语义丢失问题,提升推荐效果。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00686 2026-02-17 cs.CV cs.AI 81%

LVLM-COUNT: Enhancing the Counting Ability of Large Vision-Language Models

LVLM-COUNT: 提升大视觉-语言模型的计数能力

Muhammad Fetrat Qharabagh, Mohammadreza Ghofrani, Kimon Fountoulakis

机构 * University of Waterloo(滑铁卢大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 LVLM-COUNT通过分而治之的方法提升大视觉-语言模型对大量对象的计数能力,有效解决计数任务中的重复计数问题。

Comments 38 pages, 24 Figures, 19 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14902 2026-02-17 cs.IR cs.CV 57%

U-MARVEL: Unveiling Key Factors for Universal Multimodal Retrieval via Embedding Learning with MLLMs

通过嵌入学习与大语言模型揭示通用多模态检索的关键因素:U-MARVEL

Xiaojie Li, Chu Li, Shi-Zhe Chen, Xi Chen

机构 * Tencent PCG(腾讯PCG) Nanjing University(南京大学) ByteDance(字节跳动)

专题命中 其他VLM :MLLM(abstract);分类 cs.CV

AI总结 U-MARVEL通过嵌入学习与大语言模型揭示通用多模态检索的关键因素,实现超越现有方法的性能。

Comments Accepted to ICLR 2026

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏