arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1388 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1388 篇

2604.02093 2026-04-03 cs.CV 57%

GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Grounding

GroundVTS:多模态大语言模型中的视频时间定位视觉标记采样

Rong Fan, Kaiyan Xiao, Minghao Zhu, Liuyi Wang, Kai Dai, Zhao Yang

机构 * Newcapec AI Research(新开普人工智能研究院) Fudan University(复旦大学) Tongji University(同济大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出GroundVTS,通过细粒度查询引导机制筛选视觉标记,提升视频时间定位的时空信息保留与时间连贯性,实验表明其在三个标准基准上优于现有方法。

Comments Published as a conference paper at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29966 2026-04-03 cs.CV 57%

Scaling Video Pretraining for Surgical Foundation Models

为手术基础模型扩展视频预训练

Sicheng Lu, Zikai Xiao, Jianhui Wei, Danyu Sun, Qi Lu, Keli Hu, Yang Feng, Jian Wu, Zongxin Yang, Zuozhu Liu

机构 * The Johns Hopkins University(约翰霍普金斯大学) Zhejiang University(浙江大学) Zhejiang University-University of Illinois Urbana-Champaign Institute(浙江大学伊利诺伊大学厄巴纳-香槟分校联合学院) Zhejiang Lab(之江实验室) Shaoxing University(绍兴大学) Angelalign(时代天使) Harvard Medical School(哈佛医学院)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出SurgRec,通过大规模数据和统一预训练流程提升手术视频理解能力,对比SSL基线和视觉语言模型,展示SurgRec在多个下游任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01881 2026-04-03 cs.CV cs.CL 57%

HieraVid: Hierarchical Token Pruning for Fast Video Large Language Models

HieraVid:用于快速视频大语言模型的分层令牌修剪

Yansong Guo, Chaoyang Zhu, Jiayi Ji, Jianghang Lin, Liujuan Cao

机构 * Xiamen University(厦门大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 HieraVid通过分层修剪框架减少视频令牌冗余,提升视频大语言模型的效率,在保留性能的同时实现30%的令牌保留率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29494 2026-04-01 cs.CV 57%

VecAttention: Vector-wise Sparse Attention for Accelerating Long Context Inference

VecAttention: 向量级稀疏注意力用于加速长上下文推理

Anmin Liu, Ruixuan Yang, Huiqiang Jiang, Bin Lin, Minmin Sun, Yong Li, Chen Zhang, Tao Xie

机构 * SCS, Peking University(北京大学计算机科学技术学院) Key Lab of HCST (PKU), MOE(高可信软件技术教育部重点实验室(北京大学)) Fudan University(复旦大学) Alibaba Group(阿里巴巴集团) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出VecAttention,一种向量级稀疏注意力框架,通过动态选择信息向量提升视频模型的精度与效率,实测在视频理解和生成任务中比全注意力快2.65倍,比现有稀疏注意力方法快1.83倍且精度相当。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27650 2026-03-31 cs.CV 57%

V-CAST: Video Curvature-Aware Spatio-Temporal Pruning for Efficient Video Large Language Models

V-CAST:面向高效视频大语言模型的曲率感知时空剪枝

Xinying Lin, Xuyang Liu, Yiyu Wang, Teng Ma, Wenqi Ren

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Shenzhen Loop Area Institute(深圳河套学院) Sichuan University(四川大学) EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出V-CAST,一种无需训练的视频长上下文推理剪枝策略,通过曲率引导的时空分配模块和双锚点空间选择机制,提升视频大语言模型的效率与性能。

Comments Code: \url{https://github.com/xinyouu/V-CAST}

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26639 2026-03-30 cs.CV cs.AI 57%

Make Geometry Matter for Spatial Reasoning

让几何在空间推理中发挥作用

Shihua Zhang, Qiuhong Shen, Shizun Wang, Tianbo Pan, Xinchao Wang

机构 * National University of Singapore, Singapore(新加坡国立大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出GeoSR框架,通过几何解封掩码和几何引导融合,提升视觉语言模型的空间推理能力,实验证明其在静态和动态场景中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26336 2026-03-30 cs.CV 57%

From Pixels to Privacy: Temporally Consistent Video Anonymization via Token Pruning for Privacy Preserving Action Recognition

从像素到隐私:通过令牌修剪实现时间一致的视频匿名化以保护隐私的行动识别

Nazia Aslam, Abhisek Ray, Joakim Bruslund Haurum, Lukas Esterle, Kamal Nasrollahi

机构 * Aalborg University(奥尔堡大学) Aarhus University(奥胡斯大学) Poineer Centre for AI(先锋人工智能中心) University of Southern Denmark(南丹麦大学) Milestone System(Milestone系统公司)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出一种基于注意力机制的时空视频匿名化框架,通过分离效用和隐私特征,实现对隐私保护的行动识别。

Comments 10 pages, CVPR paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20525 2026-03-27 cs.CV 57%

Mistake Attribution: Fine-Grained Mistake Understanding in Egocentric Videos

错误归因:第一性错误理解在第一人称视频中

Yayuan Li, Aadit Jain, Filippos Bellos, Jason J. Corso

机构 * University of Michigan(密歇根大学) Voxel51

专题命中 视频理解 :video-language(abstract);分类 cs.CV

AI总结 本文提出MATT任务,通过细粒度分析第一人称视频中的人类错误,开发MisEngine数据引擎生成带有归因注释的错误样本,并提出MisFormer模型在语义、时间和空间维度上实现统一的错误归因,实验表明其在视频语言理解等任务上优于现有方法。

Comments 12 pages, 5 figures, 7 tables. Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11336 2026-03-25 cs.CV 57%

UFVideo: Towards Unified Fine-Grained Video Cooperative Understanding with Large Language Models

UFVideo:迈向统一的细粒度视频协作理解的大型语言模型

Hewen Pan, Cong Wei, Dashuang Liang, Zepeng Huang, Pengfei Gao, Ziqi Zhou, Lulu Xue, Pengfei Yan, Xiaoming Wei, Minghui Li, Shengshan Hu

机构 * Huazhong University of Science and Technology(华中科技大学) Meituan(美团)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 UFVideo通过统一多粒度协作理解能力,实现视频理解的全面覆盖,展示了其在多粒度视频任务中的灵活性和优势。

Comments CVPR 2026 Camera Ready, Github Code: https://github.com/Heven-Pan/UFVideo

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03405 2026-03-25 cs.CV 57%

ViDiC: Video Difference Captioning

ViDiC:视频差异描述

Jiangtao Wu, Shihao Li, Zhaozhou Bian, Jialu Chen, Runzhe Wen, An Ping, Yiwen He, Jiakai Wang, Yuanxing Zhang, Jiaheng Liu

机构 * NJU-LINK Team, Nanjing University(南京大学NJU-LINK团队) Kling Team, Kuaishou Technology(快手科技Kling团队)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出ViDiC任务及ViDiC-1K数据集,旨在评估多模态大语言模型对视频对相似性与差异性的细粒度描述能力,揭示现有模型在比较描述和差异感知上的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21957 2026-03-24 cs.CV 57%

Unified Spatiotemporal Token Compression for Video-LLMs at Ultra-Low Retention

面向超低保留率的视频大语言模型统一时空令牌压缩

Junhao Du, Jialong Xue, Anqi Li, Jincheng Dai, Guo Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出统一的时空令牌压缩方法,通过全局令牌保留池整合注意力权重和语义相似性,实现高效令牌选择与合并,保留90.1%性能并降低计算量至2.6%。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19610 2026-03-24 cs.CV 57%

ParallelVLM: Lossless Video-LLM Acceleration with Visual Alignment Aware Parallel Speculative Decoding

ParallelVLM: 无损视频-大语言模型加速与视觉对齐感知并行推测解码

Quan Kong, Yuhao Shen, Yicheng Ji, Huan Li, Cong Wang

机构 * Zhejiang University(浙江大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 ParallelVLM通过并行化阶段和无偏验证器引导剪枝策略,有效提升视频理解任务的解码效率,实现3.36倍的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13406 2026-03-24 cs.CV cs.AI 57%

Nuanced Emotion Recognition Based on a Segment-based MLLM Framework Leveraging Qwen3-Omni for AH Detection

基于段落式MLLM框架的细致情绪识别:利用Qwen3-Omni进行AH检测

Liang Tang, Hongda Li, Jiayu Zhang, Long Chen, Shuxian Li, Siqi Pei, Tiaonan Duan, Yuhao Cheng

机构 * Qwen3-Omni

专题命中 视频理解 :long video(abstract);分类 cs.CV

AI总结 本文提出基于段落式MLLM框架的细致情绪识别方法,利用Qwen3-Omni模型在AH检测中实现85.1%的准确率,验证了多模态大语言模型在捕捉复杂情绪冲突中的优势。

Comments 5 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02845 2026-03-24 cs.CV 57%

Go Beyond Earth: Understanding Human Actions and Scenes in Microgravity Environments

超越地球:理解微重力环境中的人类行为与场景

Di Wen, Lei Qi, Kunyu Peng, Kailun Yang, Fei Teng, Ao Luo, Jia Fu, Yufan Chen, Ruiping Liu, Yitian Shi, M. Saquib Sarfraz, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology, Germany(卡尔斯鲁厄大学,德国) Hunan University, China(湖南大学,中国) INSAIT, Sofia University, Bulgaria(INSAIT,索菲亚大学,保加利亚) Waseda University, Japan(早稻田大学,日本) KTH Royal Institute of Technology, Sweden(瑞典皇家理工学院,瑞典) RISE Research Institutes of Sweden, Sweden(瑞典RISE研究机构,瑞典)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出MicroG-4M数据集,用于微重力环境下的人类行为和场景理解,包含50种动作、1238个丰富描述和7000多个问答对,支持动作识别、视频captioning和视觉问答任务。

Comments 16 pages, 4 figures, code are available at https://github.com/LEI-QI-233/HAR-in-Space

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05175 2026-03-24 cs.CV 57%

VideoAuto-R1: Video Auto Reasoning via Thinking Once, Answering Twice

VideoAuto-R1:通过一次推理、两次回答实现视频自动推理

Shuming Liu, Mingchen Zhuge, Changsheng Zhao, Jun Chen, Lemeng Wu, Zechun Liu, Chenchen Zhu, Zhipeng Cai, Chong Zhou, Haozhe Liu, Ernie Chang, Saksham Suri, Hongyu Xu, Qi Qian, Wei Wen, Balakrishnan Varadarajan, Zhuang Liu, Hu Xu, Florian Bordes, Raghuraman Krishnamoorthi, Bernard Ghanem, Vikas Chandra, Yunyang Xiong

机构 * Meta AI King Abdullah University of Science and Technology (KAUST)(卡布斯大学) Princeton University(普林斯顿大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出VideoAuto-R1框架,通过一次推理两次回答策略提升视频理解效率,实现准确率和效率的双重提升。

Comments Accepted to CVPR 2026. Project page: https://ivul-kaust.github.io/projects/videoauto-r1/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21778 2026-03-24 cs.CV 57%

Scene-VLM: Multimodal Video Scene Segmentation via Vision-Language Models

Scene-VLM:通过视觉-语言模型进行多模态视频场景分割

Nimrod Berman, Adam Botach, Emanuel Ben-Baruch, Shunit Haviv Hakimi, Asaf Gendler, Ilan Naiman, Erez Yosef, Igor Kviatkovsky

机构 * Ben-Gurion University(本·古里安大学) Amazon Prime Video(亚马逊Prime视频) Tel-Aviv University(特拉维夫大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出Scene-VLM,首个基于视觉-语言模型的视频场景分割框架,通过融合视觉与文本信息实现多模态推理,提升场景分割的准确性和可解释性。

Comments Accepted for publication at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16975 2026-03-24 cs.CV cs.AI 57%

InfoTok: Adaptive Discrete Video Tokenizer via Information-Theoretic Compression

InfoTok: 通过信息论压缩实现自适应离散视频分块器

Haotian Ye, Qiyuan He, Jiaqi Han, Puheng Li, Jiaojiao Fan, Zekun Hao, Fitsum Reda, Yogesh Balaji, Huayu Chen, Sheng Liu, Angela Yao, James Zou, Stefano Ermon, Haoxiang Wang, Ming-Yu Liu

机构 * NVIDIA Stanford University(斯坦福大学) National University of Singapore(新加坡国立大学)

专题命中 视频理解 :long video(abstract);分类 cs.CV

AI总结 本文提出InfoTok框架,通过信息论压缩实现视频分块的自适应优化,实验证明在不损失性能的情况下,压缩率提升2.3倍,节省20%的token。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17024 2026-03-20 cs.CV cs.AI cs.CL 57%

HopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language Reasoning

HopChain: 多跳数据合成用于通用视觉语言推理

Shenzhi Wang, Shixuan Liu, Jing Zhou, Chang Gao, Xiong-Hui Chen, Binghai Wang, An Yang, Shiji Song, Bowen Yu, Gao Huang, Junyang Lin

机构 * Qwen Team, Alibaba Inc.(通义实验室,阿里巴巴公司) LeapLab, Tsinghua University(清华大学跃迁实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出HopChain框架,通过多跳视觉语言推理数据合成提升VLMs的通用推理能力,实验表明其在多个基准测试中显著提升性能。

Comments 28 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17948 2026-03-19 cs.CV cs.AI 57%

VideoAtlas: Navigating Long-Form Video in Logarithmic Compute

VideoAtlas: 在对数计算中导航长视频

Mohamed Eltahir, Ali Habibullah, Yazan Alshoibi, Lama Ayash, Tanveer Hussain, Naeemullah Khan

机构 * King Abdullah University of Science and Technology (KAUST)(卡斯特大学) Department of Computer Science, King Khalid University (KKU)(国王 Khalid 大学计算机科学系) Department of Computer Science, Edge Hill University(Edge Hill 大学计算机科学系)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 VideoAtlas通过层次化网格结构实现长视频的无损表示,解决视频表示和长上下文问题,提出Video-RLM架构,展示对数计算增长、环境预算和自适应计算分配等贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17813 2026-03-19 cs.CV 57%

M2P: Improving Visual Foundation Models with Mask-to-Point Weakly-Supervised Learning for Dense Point Tracking

M2P:通过Mask-to-Point弱监督学习改进视觉基础模型以实现密集点跟踪

Qiangqiang Wu, Tianyu Yang, Bo Fang, Jia Wan, Matias Di Martino, Guillermo Sapiro, Antoni B. Chan

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Department of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系) Meituan, Shenzhen, China(美团(深圳,中国)) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) Department of Electrical and Computer Engineering, Duke University(杜克大学电气与计算机工程系)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出M2P学习方法,利用视频对象分割掩码注解改进视觉基础模型,通过局部结构一致性损失、掩码标签一致性损失和掩码边界约束,提升密集点跟踪性能,实验表明其在TAP-Vid-DAVIS基准上优于DINOv2和DINOv3。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16154 2026-03-18 cs.CV cs.AI 57%

GATS: Gaussian Aware Temporal Scaling Transformer for Invariant 4D Spatio-Temporal Point Cloud Representation

GATS: 基于高斯意识的时间缩放变换器的不变四维时空点云表示

Jiayi Tian, Jiaze Wang

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家重点实验室) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) Xi’an Jiaotong University(西安交通大学) Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出GATS框架,通过不确定性引导的高斯卷积和时间缩放注意力模块,解决四维点云视频中时间尺度偏差和分布不确定性问题,提升鲁棒性和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15386 2026-03-17 cs.CV cs.AI 57%

RieMind: Geometry-Grounded Spatial Agent for Scene Understanding

RieMind:基于几何的场景理解空间智能体

Fernando Ropero, Erkin Turkoz, Daniel Matos, Junqing Du, Antonio Ruiz, Yanfeng Zhang, Lu Liu, Mingwei Sun, Yongliang Wang

机构 * Riemann Lab, Huawei Technologies(华为技术有限公司里斯曼实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出RieMind,通过显式3D场景图实现空间推理,证明解耦感知与推理能显著提升空间推理能力,实验结果显示比现有方法提升16%-50%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15003 2026-03-17 cs.CV 57%

Edit2Interp: Adapting Image Foundation Models from Spatial Editing to Video Frame Interpolation with Few-Shot Learning

Edit2Interp:从空间编辑到视频帧插值的图像基础模型适应

Nasrin Rahimi, Mısra Yavuz, Burak Can Biner, Yunus Bilge Kurt, Ahmet Rasim Emirdağı, Süleyman Aslan, Görkay Aydemir, M. Akın Yılmaz, A. Murat Tekalp

机构 * Codeway AI Research Dept. of Electrical \& Electronics Engineering, Ko c University, \. I stanbul, T\" u rkiye

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文通过少量样本学习,将图像编辑模型适应于视频帧插值,揭示了静态场景中物体变换的理解可激活潜在的时间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10979 2026-03-17 cs.CV cs.AI 57%

PAS: A Training-Free Stabilizer for Temporal Encoding in Video LLMs

PAS:一种无训练的时序编码稳定器

Bowen Sun, Yujun Cai, Ming-Hsuan Yang, Hang Wu, Yiwei Wang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 针对视频大语言模型中时序不一致问题,提出PAS机制,通过相位聚合平滑技术减少帧间扰动,提升注意力稳定性,实验表明在不增加计算开销的情况下提升了视频理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04467 2026-03-17 cs.CV cs.AI cs.CL cs.LG 57%

VisionZip: Longer is Better but Not Necessary in Vision Language Models

VisionZip: 更长并非必要,但在视觉语言模型中更优

Senqiao Yang, Yukang Chen, Zhuotao Tian, Chengyao Wang, Jingyao Li, Bei Yu, Jiaya Jia

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出VisionZip方法,通过选择信息性视觉token提升效率并保持性能,实验显示在多种设置下性能提升至少5%,同时显著加快推理速度。

Comments Code: https://github.com/dvlab-research/VisionZip

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06569 2026-03-17 cs.CV 57%

Penguin-VL: Exploring the Efficiency Limits of VLM with LLM-based Vision Encoders

Penguin-VL:探索基于大语言模型的视觉编码器的效率极限

Boqiang Zhang, Lei Ke, Ruihan Yang, Qi Gao, Tianyuan Qu, Rossell Chen, Dong Yu, Leoweiliang

机构 * Tencent AI Lab(腾讯AI实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出Penguin-VL,通过基于大语言模型的视觉编码器替代传统对比预训练,实现更高效的多模态理解,在文档理解、视觉知识和多视角视频理解等任务中超越现有领先VLM。

Comments Penguin-VL demonstrates that text-only initialized vision encoders can achieve superior performance in multimodal understanding tasks; Code: https://github.com/tencent-ailab/Penguin-VL

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12382 2026-03-16 cs.CV cs.AI 57%

SPARROW: Learning Spatial Precision and Temporal Referential Consistency in Pixel-Grounded Video MLLMs

SPARROW:在像素级视频MLLM中学习空间精度和时间参照一致性

Mohamad Alansari, Naufal Suryanto, Divya Velayudhan, Sajid Javed, Naoufel Werghi, Muzammal Naseer

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 SPARROW通过引入目标特定跟踪特征和双提示设计,提升视频像素级理解的空间精度和时间一致性,基于30646个视频和45231对问答对的数据集,实现六个基准测试的显著改进。

Comments Accepted at CVPR 2026; Project page: https://risys-lab.github.io/SPARROW; Repository: https://github.com/RISys-Lab/SPARROW

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11549 2026-03-10 cs.CV 57%

ODI-Bench: Can MLLMs Understand Immersive Omnidirectional Environments?

ODI-Bench: MLLMs能否理解沉浸式全向环境?

Liu Yang, Huiyu Duan, Ran Tao, Juntao Cheng, Sijing Wu, Yunhao Li, Jing Liu, Xiongkuo Min, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Xinjiang University(新疆大学) Tianjin University(天津大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 ODI-Bench旨在评估多模态大语言模型对全向图像沉浸环境的理解能力,通过定制基准和Omni-CoT方法提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06263 2026-03-10 cs.CV 57%

iLLaVA: An Image is Worth Fewer Than 1/3 Input Tokens in Large Multimodal Models

iLLaVA: 图像的价值少于三分之一的输入标记在大型多模态模型中

Lianyu Hu, Liqing Gao, Fanhua Shang, Liang Wan, Wei Feng

机构 * School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院) School of Computer Science and Technology, Tiangong University(天津工大学计算机科学与技术学院) Key Research Center for Surface Monitoring and Analysis of Relics, State Administration of Cultural Heritage(文物表面监测与分析关键研究中心,国家文物局)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 iLLaVA通过联合优化图像编码器和LLM,减少冗余标记并提升吞吐量,实现更高效的多模态模型性能。

Comments Accepted by ICLR2026,code is released at https://github.com/hulianyuyy/iLLaVA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05697 2026-03-09 cs.CV 57%

MultiHaystack: Benchmarking Multimodal Retrieval and Reasoning over 40K Images, Videos, and Documents

MultiHaystack:用于40,000张图像、视频和文档的多模态检索和推理的基准测试

Dannong Xu, Zhongyu Yang, Jun Chen, Yingfang Yuan, Ming Hu, Lei Sun, Luc Van Gool, Danda Pani Paudel, Chun-Mei Feng

机构 * INSAIT Lanzhou University(兰州大学) King Abdullah University of Science and Technology(国王阿卜杜勒-阿齐兹科学与技术大学) Heriot-Watt University(赫瑞-沃德大学) Monash University(莫纳什大学) University College Dublin(都柏林大学学院)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 MultiHaystack是首个评估大规模异构多模态检索与推理的基准测试,揭示了MLLMs在异构语料库中检索证据时的性能瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏