arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-17 至 2026-02-17 共收录 13 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 13 篇

2602.14236 2026-02-17 cs.CV cs.AI cs.LG cs.PF 85%

Dual-Signal Adaptive KV-Cache Optimization for Long-Form Video Understanding in Vision-Language Models

双信号自适应KV缓存优化用于视觉-语言模型中长形式视频理解

Vishnu Sai, Dheeraj Sai, Srinath B, Girish Varma, Priyesh Shukla

机构 * International Institute of Information Technology(国际信息研究所)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 Sali-Cache通过双信号自适应缓存优化,提升视觉-语言模型处理长形式视频的内存效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13306 2026-02-17 cs.CV cs.AI cs.LG 82%

Fine-Tuning a Large Vision-Language Model for Artwork's Scoring and Critique

对大型视觉-语言模型进行微调以用于艺术品的评分与批评

Zhehan Zhang, Meihua Qian, Li Luo, Siyu Huang, Chaoyi Zhou, Ripon Saha, Xinxin Song

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出通过微调Qwen2-VL-7B模型,结合多任务学习实现对人类绘画的自动化创造力评估,通过生成与评分标准一致的反馈,提高评分准确性和反馈质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03574 2026-02-17 cs.LG cs.CV 81%

Efficient Test-Time Scaling for Small Vision-Language Models

小视觉语言模型的高效测试时缩放

Mehmet Onurcan Kaya, Desmond Elliott, Dim P. Papadopoulos

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文提出两种高效测试时缩放策略,通过模型内部特征提升小视觉语言模型的性能,同时保持计算效率。

Comments Accepted at ICLR 2026. Project Page: https://monurcan.github.io/efficient_test_time_scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15704 2026-02-17 cs.CV 79%

Pyramid Token Pruning for High-Resolution Large Vision-Language Models via Region, Token, and Instruction-Guided Importance

通过区域、令牌和指令引导的重要性进行高分辨率大视觉-语言模型的金字塔令牌修剪

Yuxuan Liang, Xu Li, Xiaolei Chen, Yi Zheng, Haotian Chen, Bin Li, Xiangyang Xue

机构 * Shanghai Key Laboratory of Intelligent Information Processing(上海智能信息处理重点实验室) College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 通过区域、令牌和指令引导的重要性进行高分辨率大视觉-语言模型的金字塔令牌修剪,有效降低计算和内存开销,同时保持性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22391 2026-02-17 cs.CV cs.AI 79%

Top-Down Semantic Refinement for Image Captioning

自上而下语义细化用于图像描述生成

Jusheng Zhang, Kaitong Cai, Jing Yang, Jian Wang, Chengpei Tang, Keze Wang

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 自上而下语义细化通过高效MCTS算法提升图像描述生成的性能与质量

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13315 2026-02-17 cs.CV cs.AI 73%

IDPruner: Harmonizing Importance and Diversity in Visual Token Pruning for MLLMs

IDPruner: 在视觉令牌修剪中协调重要性与多样性

Yifan Tan, Yifu Sun, Shirui Huang, Hong Liu, Guanghua Yu, Jianchen Zhu, Yangdong Deng

机构 * School of Software, Tsinghua University(清华大学软件学院) Tencent(腾讯)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 IDPruner通过协调重要性与多样性,提出了一种高效的视觉令牌修剪方法,实现最优平衡并提升多模态大语言模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00527 2026-02-17 cs.RO 67%

DeCo: Task Decomposition and Skill Composition for Zero-Shot Generalization in Long-Horizon 3D Manipulation

DeCo:用于长周期3D操作零样本泛化任务分解与技能组合

Zixuan Chen, Junhui Yin, Yangtao Chen, Jing Huo, Pinzhuo Tian, Jieqi Shi, Yiwen Hou, Yinchuan Li, Yang Gao

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院) Huawei Noah’s Ark Lab (AI Lab), China(华为诺亚实验室(AI实验室))

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

AI总结 DeCo通过任务分解与技能组合提升长周期3D操作任务的零样本泛化能力,显著提高多个模型在新任务上的成功率。

Comments RAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14445 2026-02-17 cs.LG cs.AI cs.CL cs.NE 62%

Selective Synchronization Attention

选择性同步注意

Hasi Hays

机构 * Department of Chemical Engineering, University of Arkansas, Fayetteville, AR 72701, USA(化学工程系,阿肯色大学,法雷维尔,AR 72701,USA)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 提出选择性同步注意机制,通过振荡模型实现高效自注意,具备自然稀疏性、统一编码和单次计算优势,替代Transformer提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14432 2026-02-17 cs.LG cs.AI stat.ML 62%

S2D: Selective Spectral Decay for Quantization-Friendly Conditioning of Neural Activations

S2D:选择性谱衰减用于神经激活的量化友好条件化

Arnav Chavan, Nahush Lele, Udbhav Bamba, Sankalp Dayal, Aditi Raghunathan, Deepak Gupta

机构 * Amazon(亚马逊公司) Carnegie Mellon University(卡内基梅隆大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 S2D通过选择性谱衰减减少神经激活异常值,提升模型在量化过程中的准确性和部署效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14237 2026-02-17 cs.CV cs.AI 62%

AbracADDbra: Touch-Guided Object Addition by Decoupling Placement and Editing Subtasks

AbracADDbra: 通过解耦放置和编辑子任务实现触控引导的对象添加

Kunal Swami, Raghu Chittersu, Yuvraj Rathore, Rajeev Irny, Shashavali Doodekula, Alok Shukla

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 AbracADDbra通过解耦放置和编辑子任务,利用触控先验实现高效精准的对象添加,提升了交互式编辑的用户体验和编辑质量。

Comments Accepted in IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14024 2026-02-17 cs.LG cs.AI 62%

EIDOS: Latent-Space Predictive Learning for Time Series Foundation Models

EIDOS:用于时间序列基础模型的潜在空间预测学习

Xinxing Zhou, Qingren Yao, Yiji Zhao, Chenghao Liu, Flora Salim, Xiaojie Yuan, Yanlong Wen, Ming Jin

机构 * Nankai University(南开大学) Eindhoven University of Technology(埃因霍温理工大学) Yunnan University(云南大学) University of New South Wales(新南威尔士大学) Griffith University(格里菲斯大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 EIDOS通过潜在空间预测学习提升时间序列基础模型的鲁棒性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14438 2026-02-17 cs.RO cs.MA 50%

RoboSolver: A Multi-Agent Large Language Model Framework for Solving Robotic Arm Problems

RoboSolver: 一种基于多智能体大语言模型的机器人臂问题求解框架

Hamid Khabazi, Ali F. Meghdari, Alireza Taheri

专题命中 VLM训练与架构 :VLM(abstract)

AI总结 RoboSolver通过多智能体框架结合LLM和VLM,实现机器人臂问题的自动求解,准确率达0.97。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13591 2026-02-17 cs.RO 50%

AgentRob: From Virtual Forum Agents to Hijacked Physical Robots

AgentRob: 从虚拟论坛代理到被劫持的物理机器人

Wenrui Liu, Yaxuan Wang, Xun Zhang, Yanshu Wang, Jiashen Wei, Yifan Xiang, Yuhang Wang, Mingshen Ye, Elsie Dai, Zhiqi Liu, Yingjie Xu, Xinyang Chen, Hengzhe Sun, Jiyu Shen, Jingjing He, Tong Yang

机构 * Peking University(北京大学)

专题命中 VLM训练与架构 :VLM(abstract)

AI总结 AgentRob通过模型上下文协议连接虚拟论坛与物理机器人,实现多代理协作控制,展示了论坛驱动的多机器人协调可行性。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏