arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-11-26 至 2025-11-26 共收录 59 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 4 篇

2511.19878 2025-11-26 cs.CV cs.AI cs.CL cs.LG cs.RO 75%

MAPS: Preserving Vision-Language Representations via Module-Wise Proximity Scheduling for Better Vision-Language-Action Generalization

MAPS: 通过模块级接近调度保留视觉-语言表示以实现更好的视觉-语言-动作泛化

Chengyue Huang, Mellon M. Zhang, Robert Azarcon, Glen Chou, Zsolt Kira

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 MAPS通过模块级接近调度优化VLA微调,提升视觉-语言-动作任务的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14337 2025-11-26 cs.HC 75%

MobileViews: A Million-scale and Diverse Mobile GUI Dataset

MobileViews: 一个百万级且多样化的移动GUI数据集

Longxi Gao, Li Zhang, Shihe Wang, Pengzhi Gao, Wei Liu, Jian Luan, Shangguang Wang, Yuanchun Li, Mengwei Xu

专题命中 GUI与屏幕智能体 :VLM(abstract);visual language model(abstract);grounding(abstract)

AI总结 MobileViews是一个百万级移动GUI数据集,通过大规模高保真数据提升GUI定位精度,公开可用。

Comments Dataset: https://huggingface.co/datasets/mllmTeam/MobileViews

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20067 2025-11-26 cs.AI cs.HC 57%

"Are We Done Yet?": A Vision-Based Judge for Autonomous Task Completion of Computer Use Agents

我们完成了吗?

Marta Sumyk, Oleksandr Kosovan

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于视觉的评估机制,通过视觉-语言模型评估计算机使用代理的任务完成情况,提升了任务完成的准确性和可靠性。

Comments This work has been accepted to appear at the AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 幻觉与鲁棒性 7 篇

2506.04704 2025-11-26 cs.CV cs.AI 84%

HoliSafe: Holistic Safety Benchmarking and Modeling for Vision-Language Model

HoliSafe: 视觉-语言模型的综合安全性评估与建模

Youngwan Lee, Kangsan Kim, Kwanyong Park, Ilcahe Jung, Soojin Jang, Seanie Lee, Yong-Ju Lee, Sung Ju Hwang

机构 * ETRI KAIST AI(韩国科学技术院人工智能研究所) University of Seoul(首尔大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 HoliSafe提出了一种模块化框架和视觉守护模块,通过综合安全性数据集提升视觉-语言模型的安全性,展现其在多个基准中的优越表现。

Comments Project page: https://youngwanlee.github.io/holisafe

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12897 2025-11-26 cs.CV cs.AI 81%

Cross-Layer Vision Smoothing: Enhancing Visual Understanding via Sustained Focus on Key Objects in Large Vision-Language Models

跨层视觉平滑:通过持续聚焦关键对象增强大视觉-语言模型的视觉理解

Jianfei Zhao, Feng Zhang, Xin Sun, Chong Feng, Zhixing Tan

机构 * Beijing Institute of Technology(北京理工大学) Zhongguancun Academy(中关村学院) Tsinghua University(清华大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出CLVS方法,通过跨层视觉记忆平滑注意力分布,提升大视觉-语言模型对关键对象的持续聚焦能力,从而增强视觉理解性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19834 2025-11-26 cs.CV 70%

Large Language Model Aided Birt-Hogg-Dube Syndrome Diagnosis with Multimodal Retrieval-Augmented Generation

基于多模态检索增强生成的大型语言模型辅助Birt-Hogg-Dube综合征诊断

Haoqing Li, Jun Shi, Xianmeng Chen, Qiwei Jia, Rui Wang, Wei Wei, Hong An, Xiaowen Hu

机构 * School of Computer Science and Technology(计算机科学与技术学院) Department of Pulmonary and Critical Care Medicine(呼吸与危重症医学科) Center for Diagnosis and Management of Rare Diseases(罕见病诊断与管理中心) the First Affiliated Hospital of USTC(USTC第一附属医院) Division of Life Sciences and Medicine(生命科学与医学系) USTC WanNan Medical College(皖南医学院)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本研究提出BHD-RAG框架,通过整合多模态检索增强生成与领域专业知识,提升Birt-Hogg-Dube综合征的CT影像诊断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08701 2025-11-26 cs.CV cs.AI cs.LG 67%

SafeFix: Targeted Model Repair via Controlled Image Generation

SafeFix: 通过受控图像生成实现目标模型修复

Ouyang Xu, Baoming Zhang, Ruiyu Mao, Yunhui Guo

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 SafeFix通过生成语义忠实的图像来修复模型,提升模型对罕见案例的鲁棒性,减少系统性错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20570 2025-11-26 cs.RO cs.AI cs.HC cs.LG 62%

Gated Uncertainty-Aware Runtime Dual Invariants for Neural Signal-Controlled Robotics

门控不确定性感知的实时双不变量框架用于神经信号控制的机器人

Tasha Kim, Oiwi Parker Jones

机构 * Oxford Robotics Institute (ORI)(牛津机器人研究所) Department of Engineering Science(工程科学系) University of Oxford(牛津大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 GUARDIAN通过结合校准置信度的脑信号解码与符号目标接地和双层运行时监控,实现神经信号控制机器人系统的高安全性和可靠性。

Comments Embodied and Safe-Assured Robotic Systems workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20627 2025-11-26 cs.AI 57%

Fighting AI with AI: Leveraging Foundation Models for Assuring AI-Enabled Safety-Critical Systems

用AI对抗AI:利用基础模型确保AI赋能的安全关键系统

Anastasia Mavridou, Divya Gopinath, Corina S. Păsăreanu

机构 * KBR Inc.(KBR公司) NASA Ames(美国国家航空航天局阿姆斯研究中心)

专题命中 幻觉与鲁棒性 :vision language model(abstract);分类 cs.AI

AI总结 本文提出利用AI技术解决安全关键系统中AI保证问题,通过REACT和SemaLens两个组件实现需求工程与感知系统验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19914 2025-11-26 cs.RO 50%

CoC-VLA: Delving into Adversarial Domain Transfer for Explainable Autonomous Driving via Chain-of-Causality Visual-Language-Action Model

CoC-VLA: 深入研究对抗域转移以实现可解释的自动驾驶 via 链式因果视觉语言动作模型

Dapeng Zhang, Fei Shen, Rui Zhao, Yinda Chen, Peng Zhi, Chenyang Li, Rui Zhou, Qingguo Zhou

机构 * Lanzhou University(兰州大学) National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 幻觉与鲁棒性 :VLM(abstract)

AI总结 CoC-VLA通过链式因果视觉语言动作模型实现对抗域转移,提升自动驾驶的可解释性和长尾场景处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. VLM训练与架构 14 篇

2506.17967 2025-11-26 cs.LG cs.AI cs.CV 85%

Adapting Vision-Language Models for Evaluating World Models

为世界模型评估适应视觉-语言模型

Mariya Hendriksen, Tabish Rashid, David Bignell, Raluca Georgescu, Abdelhak Lemkhenter, Katja Hofmann, Sam Devlin, Sarah Parisot

机构 * University of Oxford(牛津大学) Microsoft Research(微软研究院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出UNIVERSE,一种基于视觉-语言模型的视频世界模型评估器,通过适应不同任务格式和数据约束,实现了细粒度、时间敏感的评估,与任务特定检查点性能相当,并在多种环境中验证了其与人类判断的一致性。

Comments NeurIPS LAW 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02966 2025-11-26 cs.CV cs.AI 84%

KEPT: Knowledge-Enhanced Prediction of Trajectories from Consecutive Driving Frames with Vision-Language Models

KEPT: 基于视觉-语言模型的连续驾驶帧轨迹预测增强方法

Yujin Wang, Tianyi Wang, Quanfeng Liu, Wenxian Fan, Junfeng Jiao, Christian Claudel, Yunbing Yan, Bingzhao Gao, Jianqiang Wang, Hong Chen

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 KEPT 通过知识增强的视觉-语言模型,利用时间频率-空间融合编码器和检索增强生成流水线,提升自动驾驶中轨迹预测的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19546 2025-11-26 cs.AI cs.CL cs.HC 83%

CNS-Obsidian: A Neurosurgical Vision-Language Model Built From Scientific Publications

CNS-Obsidian:基于科学出版物构建的神经外科视觉-语言模型

Anton Alyakin, Jaden Stryker, Daniel Alexander Alber, Jin Vivian Lee, Karl L. Sangwon, Brandon Duderstadt, Akshay Save, David Kurland, Spencer Frome, Shrutika Singh, Jeff Zhang, Eunice Yang, Ki Yun Park, Cordelia Orillac, Aly A. Valliani, Sean Neifert, Albert Liu, Aneek Patel, Christopher Livia, Darryl Lau, Ilya Laufer, Peter A. Rozman, Eveline Teresa Hidalgo, Howard Riina, Rui Feng, Todd Hollon, Yindalon Aphinyanaphongs, John G. Golfinos, Laura Snyder, Eric Leuthardt, Douglas Kondziolka, Eric Karl Oermann

专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract);LLaVA(abstract);分类 cs.AI

AI总结 CNS-Obsidian是一款基于科学文献训练的神经外科视觉-语言模型,通过对比实验展示了其在诊断准确性与用户评分上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20641 2025-11-26 cs.CV cs.LG 81%

Unleashing the Power of Vision-Language Models for Long-Tailed Multi-Label Visual Recognition

释放视觉-语言模型在长尾多标签视觉识别中的潜力

Wei Tang, Zuo-Zheng Wang, Kun Zhang, Tong Wei, Min-Ling Zhang

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of Computer Network and Information Integration (Southeast University)(计算机网络与信息集成重点实验室) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(Mohamed bin Zayed人工智能大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文提出CAPNET框架,通过显式建模标签相关性,结合图卷积网络和可学习软提示,解决长尾多标签视觉识别中的类别不平衡问题,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20280 2025-11-26 cs.CV 79%

Bootstrapping Physics-Grounded Video Generation through VLM-Guided Iterative Self-Refinement

通过VLM引导的迭代自优化提升物理导向的视频生成

Yang Liu, Xilin Zhao, Peisong Wen, Siran Dai, Qingming Huang

机构 * School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV

AI总结 本文提出一种通过VLM引导的迭代自优化方法,提升视频生成的物理一致性,实验显示在PhyIQ基准上得分提升明显。

Comments ICCV 2025 Physics-IQ Challenge Third Place Solution

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18617 2025-11-26 cs.RO cs.CV 79%

AutoFocus-IL: VLM-based Saliency Maps for Data-Efficient Visual Imitation Learning without Extra Human Annotations

AutoFocus-IL:基于视觉语言模型的数据高效视觉模仿学习中的显著性图

Litian Gong, Fatemeh Bahrani, Yutai Zhou, Amin Banayeeanzade, Jiachen Li, Erdem Bıyık

机构 * Department of Electrical and Computer Engineering, University of California, Riverside, USA(电气与计算机工程系,加州大学河滨分校) Thomas Lord Department of Computer Science, University of Southern California, USA(汤姆斯·劳德计算机科学系,南加州大学)

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV

AI总结 AutoFocus-IL通过视觉语言模型自动生成显著性图,提升视觉模仿学习的数据效率和泛化能力,无需额外人类标注。

Comments 8 pages, 6 figures. Code and datasets available at http://autofocus-il.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20218 2025-11-26 cs.CV 70%

Text-guided Controllable Diffusion for Realistic Camouflage Images Generation

基于文本引导的可控扩散生成逼真伪装图像

Yuhang Qian, Haiyan Chen, Wentong Li, Ningzhong Liu, Jie Qin

专题命中 VLM训练与架构 :VLM(abstract);visual language model(abstract);分类 cs.CV

AI总结 本文提出CT-CIG方法,通过文本引导和可控扩散生成逼真且逻辑合理的伪装图像,利用VLM和FIRM模块提升伪装图像质量。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19647 2025-11-26 cs.RO cs.AI 70%

Robot-Powered Data Flywheels: Deploying Robots in the Wild for Continual Data Collection and Foundation Model Adaptation

机器人驱动的数据飞轮:在真实世界中部署机器人以实现持续的数据收集和基础模型适应

Jennifer Grannen, Michelle Pan, Kenneth Llontop, Cherie Ho, Mark Zolotas, Jeannette Bohg, Dorsa Sadigh

机构 * Stanford University(斯坦福大学) Toyota Research Institute(丰田研究机构)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 机器人驱动的数据飞轮通过部署机器人收集真实世界数据,提升基础模型在复杂环境中的适应能力,减少人工干预并提高多语言OCR性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20643 2025-11-26 cs.CV cs.LG 62%

Concept-Aware Batch Sampling Improves Language-Image Pretraining

概念感知的批量采样提升语言-图像预训练

Adhiraj Ghosh, Vishaal Udandarao, Thao Nguyen, Matteo Farina, Mehdi Cherti, Jenia Jitsev, Sewoong Oh, Elisa Ricci, Ludwig Schmidt, Matthias Bethge

机构 * Tübingen AI Center, University of Tübingen(图宾根人工智能中心,图宾根大学) University of Cambridge(剑桥大学) University of Washington(华盛顿大学) University of Trento(特伦托大学) LAION Stanford University(斯坦福大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本研究提出CABS方法,通过概念感知的批量采样提升语言-图像预训练效果,提供灵活的任务适应性数据整理方案。

Comments Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20614 2025-11-26 cs.CV 57%

The Consistency Critic: Correcting Inconsistencies in Generated Images via Reference-Guided Attentive Alignment

一致性批评者:通过参考引导的注意对齐纠正生成图像中的不一致

Ziheng Ouyang, Yiren Song, Yaoli Liu, Shihao Zhu, Qibin Hou, Ming-Ming Cheng, Mike Zheng Shou

机构 * VCIP, Nankai University Show Lab, National University of Singapore State Key Laboratory of CAD\&CG, Zhejiang University

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 本文提出ImageCritic,通过参考引导的注意力对齐方法纠正生成图像中的不一致问题,提升细粒度细节的一致性。

Comments Project page: https://ouyangziheng.github.io/ImageCritic-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20478 2025-11-26 cs.LG 57%

NVIDIA Nemotron Parse 1.1

NVIDIA推出Nemotron Parse 1.1:轻量级OCR模型提升文档解析与OCR性能

Kateryna Chumachenko, Amala Sanjay Deshmukh, Jarno Seppanen, Ilia Karmanov, Chia-Chih Chen, Lukas Voegtle, Philipp Fischer, Marek Wawrzos, Saeid Motiian, Roman Ageev, Kedi Wu, Alexandre Milesi, Maryam Moosaei, Krzysztof Pawelec, Padmavathy Subramanian, Mehrzad Samadi, Xin Yu, Celina Dear, Sarah Stoddard, Jenna Diamond, Jesse Oliver, Leanna Chraghchian, Patrick Skelly, Tom Balough, Yao Xu, Jane Polak Scowcroft, Daniel Korzekwa, Darragh Hanley, Sandip Bhaskar, Timo Roman, Karan Sapra, Andrew Tao, Bryan Catanzaro

机构 * NVIDIA

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.LG

AI总结 NVIDIA推出Nemotron Parse 1.1,一种轻量级OCR模型,提升文档解析和OCR性能,支持更长输出序列,实现高准确率和高效处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19836 2025-11-26 cs.CV 57%

4DWorldBench: A Comprehensive Evaluation Framework for 3D/4D World Generation Models

4DWorldBench: 一种用于3D/4D世界生成模型的综合评估框架

Yiting Lu, Wei Luo, Peiyan Tu, Haoran Li, Hanxin Zhu, Zihao Yu, Xingrui Wang, Xinyi Chen, Xinge Peng, Xin Li, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) Beijing Zhongguancun Academy(北京中关村学院)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

AI总结 4DWorldBench提出了一种用于评估3D/4D世界生成模型的综合框架,通过四个维度评估模型的感知质量、条件对齐、物理真实性和一致性,支持多模态输入并整合多种评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17964 2025-11-26 cs.CV 57%

X-ReID: Multi-granularity Information Interaction for Video-Based Visible-Infrared Person Re-Identification

X-ReID:基于视频的可见-红外人重识别中的多粒度信息交互

Chenyang Yu, Xuehu Liu, Pingping Zhang, Huchuan Lu

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 X-ReID通过多粒度信息交互和跨模态特征学习,提升视频中可见-红外人重识别的性能。

Comments Accepted by AAAI2026. More modifications may be performed

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16181 2025-11-26 cs.CV 57%

CLIP-IT: CLIP-based Pairing for Histology Images Classification

CLIP-IT: 基于CLIP的病理图像分类配对

Banafsheh Karimian, Giulia Avanzato, Soufian Belharbi, Alexis Guichemerre, Luke McCaffrey, Mohammadhadi Shateri, Eric Granger

机构 * LIVIA, ILLS, Dept. of Systems Engineering, ETS Montreal, Canada(LIVIA、ILLs、系统工程系、蒙特利尔大学ETSMontreal加拿大) Dept. of Computer Engineering, University of Cagliari, Italy(计算机工程系、卡利亚里大学意大利) Goodman Cancer Research, Centre, Dept. of Oncology, McGill University, Canada(Goodman癌症研究中心、肿瘤学系、麦吉尔大学加拿大)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 CLIP-IT通过利用未配对的病理报告提升病理图像分类性能,无需配对数据或复杂推理。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他VLM 5 篇

2511.19676 2025-11-26 cs.CV 74%

INTERLACE: Interleaved Layer Pruning and Efficient Adaptation in Large Vision-Language Models

INTERLACE:大规模视觉-语言模型中的交错层剪枝与高效适应

Parsa Madinei, Ryan Solgi, Ziqi Wen, Jonathan Skaza, Miguel Eckstein, Ramtin Pedarsani

机构 * UC Santa Barbara(加州大学圣巴巴拉分校)

专题命中 其他VLM :vision-language model(title);分类 cs.CV

AI总结 INTERLACE通过交错微调冻结设计,在剪枝25%网络后实现88.9%的性能保留,达到SOTA水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26536 2025-11-26 cs.CL cs.AI cs.CV cs.LG cs.RO 67%

OceanGym: A Benchmark Environment for Underwater Embodied Agents

OceanGym: 一个用于水下具身智能体的基准环境

Yida Xue, Mingjun Mao, Xiangyuan Ru, Yuqi Zhu, Baochang Ren, Shuofei Qiao, Mengru Wang, Shumin Deng, Xinyu An, Ningyu Zhang, Ying Chen, Huajun Chen

专题命中 其他VLM :MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 OceanGym通过多模态大语言模型构建首个水下具身智能体基准,揭示水下环境感知与规划的挑战,推动水下自主系统发展。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19518 2025-11-26 cs.CV cs.AI cs.IT cs.LG math.IT 67%

Towards Efficient VLMs: Information-Theoretic Driven Compression via Adaptive Structural Pruning

迈向高效的VLMs:通过自适应结构压缩的信息论驱动压缩

Zhaoqi Xu, Yingying Zhang, Jian Li, Jianwei Guo, Qiannan Zhu, Hua Huang

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Zhongtai Securities Institute for Financial Studies, Shandong University(山东大学中泰证券金融研究学院)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出InfoPrune框架,通过信息论驱动的自适应结构压缩方法,在保持性能的同时显著提升视觉语言模型的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10979 2025-11-26 cs.CV cs.AI 62%

VidComposition: Can MLLMs Analyze Compositions in Compiled Videos?

VidComposition: MLLMs能否分析编译视频中的构成?

Yolo Y. Tang, Junjia Guo, Hang Hua, Susan Liang, Mingqian Feng, Xinyang Li, Rui Mao, Chao Huang, Jing Bi, Zeliang Zhang, Pooyan Fazli, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) Arizona State University(亚利桑那州立大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 VidComposition通过编排视频和电影级注释评估MLLMs对视频构成的理解能力,揭示了当前模型在复杂编译视频分析中的局限性。

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19200 2025-11-26 cs.CV 57%

Can Modern Vision Models Understand the Difference Between an Object and a Look-alike?

现代视觉模型能否理解物体与相似物之间的差异?

Itay Cohen, Ethan Fetaya, Amir Rosenfeld

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本文研究了现代视觉模型能否区分真实物体与相似物,通过构建RoLA数据集并改进CLIP模型的嵌入空间方向,提升跨模态检索和描述生成的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏