arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-17 至 2026-02-17 共收录 71 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 20 篇

2602.14890 2026-02-17 cs.AI 57%

Lifted Relational Probabilistic Inference via Implicit Learning

通过隐式学习实现提升的关系概率推断

Luise Ge, Brendan Juba, Kris Nilsson, Alison Shao

机构 * Washington University in St. Louis(华盛顿大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出了一种基于隐式学习的方法,实现第一-order概率逻辑的隐式学习和提升推断,解决了传统方法在模型构建上的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14833 2026-02-17 eess.SP cs.LG 57%

RF-GPT: Teaching AI to See the Wireless World

RF-GPT:教AI看见无线世界

Hang Zou, Yu Tian, Bohao Wang, Lina Bariah, Samson Lasaulce, Chongwen Huang, Mérouane Debbah

机构 * Research Institute for Digital Future, Khalifa University(数字未来研究院,哈利法大学) College of Information Science and Electronic Engineering, Zhejiang University(信息科学与电子工程学院,浙江大学) Université de Lorraine, CNRS, CRAN(洛林大学,CNRS,CRAN)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 RF-GPT通过多模态LLM的视觉编码器处理RF频谱图,实现射频信号的高级推理与生成,无需人工标注即可在多个无线任务中取得优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06185 2026-02-17 cs.AI 57%

Dataforge: Agentic Platform for Autonomous Data Engineering

Dataforge:自主数据工程的代理平台

Xinyuan Wang, Hongyu Cao, Kunpeng Liu, Yanjie Fu

机构 * Arizona State University(亚利桑那州立大学) Clemson University(克莱姆森大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 Dataforge是一个基于大语言模型的自动数据工程平台,通过自动数据清理和迭代优化特征操作,提升表格数据的AI准备质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09027 2026-02-17 cs.CV 57%

Measure Twice, Cut Once: A Semantic-Oriented Approach to Video Temporal Localization with Video LLMs

两次测量,一次切割:一种面向语义的视频时间定位方法与视频LLMs

Zongshang Pang, Mayu Otani, Yuta Nakashima

机构 * The University of Osaka(大阪大学) CyberAgent, Inc.(CyberAgent公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 MeCo提出一种面向语义的视频时间定位方法,通过生成和判别学习任务提升视频LLMs对事件结构的识别能力,实现更精确的时间分割。

Comments ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13320 2026-02-17 cs.AI 57%

Information Fidelity in Tool-Using LLM Agents: A Martingale Analysis of the Model Context Protocol

工具使用LLM代理中的信息保真度:模型上下文协议的鞅分析

Flint Xiaofeng Fan, Cheston Tan, Roger Wattenhofer, Yew-Soon Ong

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出了一种分析模型上下文协议中误差累积的理论框架,通过鞅分析证明误差呈现线性增长并受$O(\sqrt{T})$约束,实验验证了语义加权和周期性再定位对误差控制的有效性。

Comments Full working version of an extended abstract accepted at the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03474 2026-02-17 cs.CV 57%

Procedural Mistake Detection via Action Effect Modeling

通过动作效果建模实现过程性错误检测

Wenliang Guo, Yujiang Pu, Yu Kong

机构 * Michigan State University(密歇根州立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出通过动作效果建模实现过程性错误检测,结合语义和视觉信息,在单类分类任务中取得最佳性能。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14653 2026-02-17 cs.CL 50%

Is Information Density Uniform when Utterances are Grounded on Perception and Discourse?

当话语基于感知和话语进行 grounding 时,信息密度是否均匀?

Matteo Gay, Coleman Haley, Mario Giulianelli, Edoardo Ponti

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究首次探讨了基于感知和话语的视觉环境对信息密度均匀性的影响,发现 grounding 能提高信息分布的均匀性,并在话语单元开始处产生最大的惊奇度降低。

Comments Accepted as main paper at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11848 2026-02-17 physics.geo-ph 50%

Groundwater dynamics beneath a marine ice sheet

冰架下方的地下水动态

Gabriel Cairns, Graham Benham, Ian Hewitt

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究通过建立数学模型,揭示了冰架下方沉积盆地中地下水动态受海水入侵和盆地几何形状的影响,发现海水可能被困于盆地中,并影响冰流流动。

Comments 33 pages, 11 figures

Journal ref The Cryosphere, 19, 3725-3747, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13833 2026-02-17 cs.RO 50%

Semantic-Contact Fields for Category-Level Generalizable Tactile Tool Manipulation

语义接触场用于类别级可泛化的触觉工具操作

Kevin Yuchen Ma, Heng Zhang, Weisi Lin, Mike Zheng Shou, Yan Wu

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 SCFields通过融合视觉语义与密集接触估计,实现类别级可泛化的触觉工具操作,显著优于视觉和原始触觉基线。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 3 篇

2602.14524 2026-02-17 cs.CV 79%

Error Patterns in Historical OCR: A Comparative Analysis of TrOCR and a Vision-Language Model

历史OCR中的错误模式:TrOCR与视觉语言模型的比较分析

Ari Vesalainen, Eetu Mäkelä, Laura Ruotsalainen, Mikko Tolonen

机构 * University of Helsinki, Department of Computer Science, Finland(赫尔辛基大学计算机科学系) University of Helsinki, Department of Digital Humanities, Finland(赫尔辛基大学数字人文系)

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文比较了TrOCR与视觉语言模型在历史文本OCR中的表现,发现两者在错误模式和学术可靠性上存在显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13345 2026-02-17 cs.LG cs.IR cs.MA 57%

BLUEPRINT Rebuilding a Legacy: Multimodal Retrieval for Complex Engineering Drawings and Documents

BLUEPRINT 重筑遗产:面向复杂工程图纸和文档的多模态检索

Ethan Seefried, Ran Eldegaway, Sanjay Das, Nathaniel Blanchard, Tirthankar Ghosal

机构 * Oak Ridge National Laboratory(橡树岭国家实验室) Colorado State University(科罗拉多州立大学)

专题命中 文档图表理解 :VLM(abstract);分类 cs.LG

AI总结 Blueprint通过布局感知的多模态检索系统,提升对复杂工程图纸和文档的自动化检索能力,实现结构化元数据生成与跨设施搜索效率提升。

Comments 20 pages 8 main + 12 appendix + references

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17315 2026-02-17 cs.CL 50%

HIPPO: Enhancing the Table Understanding Capability of LLMs through Hybrid-Modal Preference Optimization

HIPPO:通过混合模态偏好优化增强大语言模型的表格理解能力

Haolan Wang, Zhenghao Liu, Xinze Li, Xiaocui Yang, Yu Gu, Yukun Yan, Qi Shi, Fangfang Li, Chong Chen, Ge Yu

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 文档图表理解 :MLLM(abstract)

AI总结 HIPPO 通过混合模态偏好优化提升大语言模型的表格理解能力,实现 4% 的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 10 篇

2602.13653 2026-02-17 cs.AI cs.CL cs.CV cs.HC 79%

Building Autonomous GUI Navigation via Agentic-Q Estimation and Step-Wise Policy Optimization

通过代理-Q估计和分步策略优化构建自主GUI导航

Yibo Wang, Guangda Huzhang, Yuwei Hu, Yu Xia, Shiyin Lu, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, Lijun Zhang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Ovis Team, Alibaba Group(阿里团队,阿里巴巴集团)

专题命中 GUI与屏幕智能体 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于代理-Q估计和分步策略优化的GUI自主导航框架,通过强化学习提升GUI交互能力,实验证明其在导航和基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14974 2026-02-17 cs.RO 75%

DM0: An Embodied-Native Vision-Language-Action Model towards Physical AI

DM0:一种面向物理AI的具身原生视觉-语言-动作模型

En Yu, Haoran Lv, Jianjian Sun, Kangheng Lin, Ruitao Zhang, Yukang Shi, Yuyang Chen, Ze Chen, Ziheng Zhang, Fan Jia, Kaixin Liu, Meng Zhang, Ruitao Hao, Saike Huang, Songhan Xie, Yu Liu, Zhao Wu, Bin Xie, Pengwei Zhang, Qi Yang, Xianchi Deng, Yunfei Wei, Enwen Zhang, Hongyang Peng, Jie Zhao, Kai Liu, Wei Sun, Yajun Wei, Yi Yang, Yunqiao Zhang, Ziwei Yan, Haitao Yang, Hao Liu, Haoqiang Fan, Haowei Zhang, Junwen Huang, Yang Chen, Yunchao Ma, Yunhuan Yang, Zhengyuan Du, Ziming Liu, Jiahui Niu, Yucheng Zhao, Daxin Jiang, Wenbin Tang, Xiangyu Zhang, Zheng Ge, Erjin Zhou, Tiancai Wang

机构 * DM0 Team(DM0团队) Dexmal StepFun

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);grounding(abstract)

AI总结 DM0提出了一种面向物理AI的具身原生视觉-语言-动作模型,通过统一具身操作和导航,结合预训练、中训练和后训练流程,实现对复杂物理任务的高效处理。

Comments Authors are listed in alphabetical order. Code is available at https://github.com/Dexmal/dexbotic

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11526 2026-02-17 cs.RO cs.AI 70%

Foundation Models in Autonomous Driving: A Survey on Scenario Generation and Scenario Analysis

自动驾驶中的基础模型:场景生成与场景分析的综述

Yuan Gao, Mattia Piccinini, Yuchen Zhang, Dingrui Wang, Korbinian Moller, Roberto Brusnicki, Baha Zarrouki, Alessio Gambi, Jan Frederik Totz, Kai Storms, Steven Peters, Andrea Stocco, Bassam Alrifaee, Marco Pavone, Johannes Betz

专题命中 GUI与屏幕智能体 :vision-language model(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 本文综述了基础模型在自动驾驶场景生成与分析中的应用,探讨了相关模型、方法及挑战。

Comments IEEE Open Journal of Intelligent Transportation Systems

Journal ref IEEE Open Journal of Intelligent Transportation Systems, 03 February 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16713 2026-02-17 cs.RO cs.AI cs.CL 70%

A Pragmatist Robot: Learning to Plan Tasks by Experiencing the Real World

务实型机器人:通过体验现实世界学习任务规划

Kaixian Qu, Guowei Lan, René Zurbrügg, Changan Chen, Christopher E. Mower, Haitham Bou-Ammar, Marco Hutter

机构 * Robotic Systems Lab, ETH Zürich(瑞士联邦理工学院机器人系统实验室) ETH AI Center, ETH Zürich(瑞士联邦理工学院人工智能中心) Huawei Noah’s Ark Lab, London, UK(华为诺亚实验室,伦敦,英国) UCL Centre for AI, London, UK(伦敦大学学院人工智能中心)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 PragmaBot 通过现实世界经验学习任务规划,利用 STM 自我反思和 RAG 提高任务成功率

Comments Accepted to RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20037 2026-02-17 cs.RO 67%

Visio-Verbal Teleimpedance Interface: Enabling Semi-Autonomous Control of Physical Interaction via Eye Tracking and Speech

视觉-语言远阻抗接口:通过眼动追踪和语音实现物理交互的半自主控制

Henk H. A. Jekel, Alejandro Díaz Rosales, Luka Peternel

机构 * Department of Cognitive Robotics, Delft University of Technology(认知机器人系,代尔夫特理工大学) European Organization for Nuclear Research (CERN)(欧洲核子研究中心)

专题命中 GUI与屏幕智能体 :VLM(abstract);visual language model(abstract)

AI总结 本文提出一种结合眼动追踪和语音交互的视觉-语言远阻抗接口,用于通过生成刚度矩阵实现远程机械臂的半自主物理交互控制。

Journal ref Frontiers in Robotics and AI, Volume 13, 1749105, February 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02456 2026-02-17 cs.RO 67%

InternVLA-A1: Unifying Understanding, Generation and Action for Robotic Manipulation

InternVLA-A1:统一理解、生成和行动以实现机器人操作

Junhao Cai, Zetao Cai, Jiafei Cao, Yilun Chen, Zeyu He, Lei Jiang, Hang Li, Hengjie Li, Yang Li, Yufei Liu, Yanan Lu, Qi Lv, Haoxiang Ma, Jiangmiao Pang, Yu Qiao, Zherui Qiu, Yanqing Shen, Xu Shi, Yang Tian, Bolun Wang, Hanqing Wang, Jiaheng Wang, Tai Wang, Xueyuan Wei, Chao Wu, Yiman Xie, Boyang Xing, Yuqiang Yang, Yuyin Yang, Qiaojun Yu, Feng Yuan, Jia Zeng, Jingjing Zhang, Shenghan Zhang, Shi Zhang, Zhuoma Zhaxi, Bowen Zhou, Yuanzhen Zhou, Yunsong Zhou, Hongrui Zhu, Yangkun Zhu, Yuchen Zhu

机构 * InternVLA-A1 Team(InternVLA-A1团队)

专题命中 GUI与屏幕智能体 :grounding(abstract);multimodal large language model(abstract)

AI总结 InternVLA-A1通过统一的Transformer架构,结合语义理解和动态预测能力,提升了机器人操作任务的性能。

Comments Homepage: https://internrobotics.github.io/internvla-a1.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13329 2026-02-17 cs.CV cs.AI cs.RO 62%

HiST-VLA: A Hierarchical Spatio-Temporal Vision-Language-Action Model for End-to-End Autonomous Driving

HiST-VLA:一种用于端到端自动驾驶的分层时空视觉-语言-动作模型

Yiru Wang, Zichong Gu, Yu Gao, Anqing Jiang, Zhigang Sun, Shuo Wang, Yuwen Heng, Hao Sun

机构 * Bosch Corporate Research(博世企业研究) School of Communication and Information Engineering(信息工程学院)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 HiST-VLA通过分层时空视觉-语言-动作模型提升自动驾驶轨迹生成的精度与效率,实现端到端的自动驾驶系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14083 2026-02-17 cs.AI 57%

Plan-MCTS: Plan Exploration for Action Exploitation in Web Navigation

Plan-MCTS:网页导航中的计划探索用于动作利用

Weiming Zhang, Jihong Wang, Jiamu Zhou, Qingyao Li, Xinbei Ma, Congmin Zheng, Xingyu Lou, Weiwen Liu, Zhuosheng Zhang, Jun Wang, Yong Yu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) OPPO Research Institute(OPPO研究院)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 Plan-MCTS通过将网页导航探索转移到语义计划空间,提升动作利用效率,实现更高效的导航任务执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10556 2026-02-17 cs.RO cs.AI 57%

LAP: Language-Action Pre-Training Enables Zero-shot Cross-Embodiment Transfer

LAP:语言-动作预训练实现零样本跨躯体迁移

Lihan Zha, Asher J. Hancock, Mingtong Zhang, Tenny Yin, Yixuan Huang, Dhruv Shah, Allen Z. Ren, Anirudha Majumdar

机构 * Princeton University(普林斯顿大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 LAP通过语言-动作预训练实现零样本跨躯体迁移,首次在无需特定躯体微调的情况下达到显著的迁移效果,提升性能达两倍。

Comments Project website: https://lap-vla.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14326 2026-02-17 cs.NI 50%

Diffusion-based Dynamic Contract for Federated AI Agent Construction in Mobile Metaverses

基于扩散的动态合同用于移动元宇宙中联邦AI代理的构建

Jinbo Wen, Jiawen Kang, Yang Zhang, Yue Zhong, Dusit Niyato, Jie Xu, Jianhang Tang, Chau Yuen

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 本文提出基于扩散模型的EDMSAC算法,通过动态合同机制优化边缘-云协作下的AI代理构建,提升移动元宇宙中服务的低延迟与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与鲁棒性 3 篇

2412.06082 2026-02-17 cs.CV 57%

Are foundation models for computer vision good conformal predictors?

计算机视觉基础模型是否是良好的符合预测器?

Leo Fillioux, Julio Silva-Rodríguez, Ismail Ben Ayed, Paul-Henry Cournède, Maria Vakalopoulou, Stergios Christodoulidis, Jose Dolz

机构 * MICS, CentraleSupélec, Université Paris-Saclay(MICS、中央理工巴黎高等学院、巴黎-萨克雷大学) LIVIA, ILLS, ETS Montréal(LIVIA、ILLs、蒙特利尔工程师学院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文研究了计算机视觉基础模型在符合预测中的表现,发现其适合符合化过程,但校准置信度预测会降低效率,且视觉-语言模型在少样本适应中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14430 2026-02-17 cs.LG 57%

A unified framework for evaluating the robustness of machine-learning interpretability for prospect risking

评估机器学习可解释性在勘探风险中的鲁棒性统一框架

Prithwijit Chowdhury, Ahmad Mustafa, Mohit Prabhushankar, Ghassan AlRegib

机构 * Center for Energy and Geo Processing (CeGP)(能源与地球处理中心) Omni Lab for Intelligent Visual Engineering and Science (OLIVES)(智能视觉工程与科学实验室) School of Electrical and Computer Engineering(电气与计算机工程学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.LG

AI总结 本文提出统一框架,通过量化必要性和充分性来评估LIME和SHAP在高维结构化勘探风险数据中的鲁棒性。

Journal ref Geophysics 90, no. 3 (2025): IM103-IM118

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23519 2026-02-17 cs.CR cs.AI 57%

ReliabilityRAG: Effective and Provably Robust Defense for RAG-based Web-Search

ReliabilityRAG: 有效且可证明的防御方法用于基于检索的Web搜索

Zeyu Shen, Basileal Imana, Tong Wu, Chong Xiang, Prateek Mittal, Aleksandra Korolova

机构 * Department of Computer Science(计算机科学系) Princeton University(普林斯顿大学) Center for Information Technology Policy(信息政策中心) Department of Electrical and Computer Engineering(电气与计算机工程系) NVIDIA(英伟达)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 ReliabilityRAG通过利用文档可靠性信息,提供更有效且可证明鲁棒的防御方法,以增强基于检索的Web搜索系统对对抗攻击的抵御能力。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

5. VLM训练与架构 13 篇

2602.14236 2026-02-17 cs.CV cs.AI cs.LG cs.PF 85%

Dual-Signal Adaptive KV-Cache Optimization for Long-Form Video Understanding in Vision-Language Models

双信号自适应KV缓存优化用于视觉-语言模型中长形式视频理解

Vishnu Sai, Dheeraj Sai, Srinath B, Girish Varma, Priyesh Shukla

机构 * International Institute of Information Technology(国际信息研究所)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 Sali-Cache通过双信号自适应缓存优化,提升视觉-语言模型处理长形式视频的内存效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13306 2026-02-17 cs.CV cs.AI cs.LG 82%

Fine-Tuning a Large Vision-Language Model for Artwork's Scoring and Critique

对大型视觉-语言模型进行微调以用于艺术品的评分与批评

Zhehan Zhang, Meihua Qian, Li Luo, Siyu Huang, Chaoyi Zhou, Ripon Saha, Xinxin Song

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出通过微调Qwen2-VL-7B模型,结合多任务学习实现对人类绘画的自动化创造力评估,通过生成与评分标准一致的反馈,提高评分准确性和反馈质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03574 2026-02-17 cs.LG cs.CV 81%

Efficient Test-Time Scaling for Small Vision-Language Models

小视觉语言模型的高效测试时缩放

Mehmet Onurcan Kaya, Desmond Elliott, Dim P. Papadopoulos

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文提出两种高效测试时缩放策略,通过模型内部特征提升小视觉语言模型的性能,同时保持计算效率。

Comments Accepted at ICLR 2026. Project Page: https://monurcan.github.io/efficient_test_time_scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15704 2026-02-17 cs.CV 79%

Pyramid Token Pruning for High-Resolution Large Vision-Language Models via Region, Token, and Instruction-Guided Importance

通过区域、令牌和指令引导的重要性进行高分辨率大视觉-语言模型的金字塔令牌修剪

Yuxuan Liang, Xu Li, Xiaolei Chen, Yi Zheng, Haotian Chen, Bin Li, Xiangyang Xue

机构 * Shanghai Key Laboratory of Intelligent Information Processing(上海智能信息处理重点实验室) College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 通过区域、令牌和指令引导的重要性进行高分辨率大视觉-语言模型的金字塔令牌修剪,有效降低计算和内存开销,同时保持性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22391 2026-02-17 cs.CV cs.AI 79%

Top-Down Semantic Refinement for Image Captioning

自上而下语义细化用于图像描述生成

Jusheng Zhang, Kaitong Cai, Jing Yang, Jian Wang, Chengpei Tang, Keze Wang

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 自上而下语义细化通过高效MCTS算法提升图像描述生成的性能与质量

详情

展开后加载摘要…

URL PDF HTML 收藏