arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4735 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4735 篇

2510.02561 2026-06-23 cs.CV cs.AI 版本更新 81%

Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback

Oracle-RLAIF:一种利用排名反馈强化学习改进多模态视频模型微调框架的方法

Derek Shi, Ruben Glatt, Christine Klymko, Shubham Mohole, Hongjun Choi, Shashank Kushwaha, Sam Sakla, Felipe Leno da Silva

机构 * Stanford University(斯坦福大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) Microsoft(微软公司)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出Oracle-RLAIF框架,用通用排序器替代奖励模型,结合基于GRPO的排名损失函数GRPO_rank,实现更高效的多模态视频模型微调,在多个基准上优于现有方法。

Comments Proceedings of the 39th Annual Conference on Neural Information Processing Systems, ARLET Workshop (Aligning Reinforcement Learning Experimentalists and Theorists)

Journal ref Transactions on Machine Learning Research, Vol. 2026, June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19965 2026-06-19 cs.CV cs.AI 新提交 81%

ROSE: Benchmarking the Perception-to-Action Gap in Multimodal Models

ROSE:多模态模型中感知到行动差距的基准测试

Yihao Wang, Zijian He, Jie Ren, Keze Wang

机构 * Sun Yat-sen University(中山大学) Shaanxi Normal University(陕西师范大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出ROSE基准,通过固定视觉场景并变化区域约束与符号输出,测试多模态大模型在不同上下文中将相同视觉证据转化为所需行动的能力,发现模型性能下降高达44.5个百分点,揭示感知到行动的瓶颈。

Comments 29 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13289 2026-06-12 cs.CV cs.AI 新提交 81%

HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers

HYDRA-X: 具有整体视觉分词器的原生统一多模态模型

Guozhen Zhang, Xuerui Qiu, Yutao Cui, Tianhui Song, Changlin Li, Junzhe Li, Tao Huang, Xiao Zhang, Yang Li, Jianbing Wu, Miles Yang, Zhao Zhong, Liefeng Bo, Limin Wang

机构 * Nanjing University(南京大学) CASIA(中国科学院自动化研究所) Tencent Hunyuan(腾讯混元) Zhongguancun Academy(中关村学院) Shanghai AI Lab(上海人工智能实验室)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出HYDRA-X,首个在单一ViT中统一图像和视频分词的原生统一多模态模型,通过因果时间注意力和分层时间压缩实现高效重建,并利用轻量化解压缩器注入语义,显著提升编辑一致性和收敛速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11209 2026-06-11 cs.CL cs.AI cs.LG 新提交 81%

ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward

ProcessThinker: 通过基于展开的过程奖励增强多模态大语言模型推理

Jingpei Wu, Xiao Han, Weixiang Shen, Boer Zhang, Zifeng Ding, Volker Tresp

机构 * LMU Munich(慕尼黑大学) Harvard University(哈佛大学) University of Cambridge(剑桥大学) Mina AI Konrad Zuse School of Excellence in Reliable AI (relAI)(康拉德·楚泽可靠人工智能卓越学校(relAI))

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出ProcessThinker,一种无需显式过程奖励模型的后训练方法,通过步骤标记格式和基于展开的过程奖励,为多步推理提供密集的步骤级奖励,提升多模态推理一致性。

Comments Accepted at ICLR 2026 Workshop on Logical Reasoning of Large Language Models. 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06872 2026-06-08 cs.CV cs.AI 新提交 81%

EgoPressDiff: Multimodal Video Diffusion for Egocentric UV-Domain Hand-Pressure Estimation

EgoPressDiff: 用于自我中心UV域手部压力估计的多模态视频扩散模型

Yuan Zeng, Zilue Gao, Yujia Shi, Zongqing Lu, Wenming Yang, QingMin Liao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频多模态 :multimodal(title);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出EgoPressDiff,一种条件视频扩散框架,通过多模态条件策略(手部姿态、3D网格顶点和深度信息)从视觉输入生成UV压力图,解决了现有方法中的量化误差和时间不一致问题,在EgoPressure数据集上实现SOTA,Volumetric IoU相对提升34%以上。

Comments Accepted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22574 2026-06-08 cs.CV cs.AI 版本更新 81%

Enhancing Video Representations with Spatiotemporal-Semantic Residual to Mitigate Hallucinations in Video Large Multimodal Models

增强视频表示中的时空语义残差以缓解视频大型多模态模型中的幻觉

Yuansheng Gao, Jinman Zhao, Tong Zhang, Xingguo Xu, Wenbin Xing, Han Bao, Zonghui Wang, Wenzhi Chen

机构 * Zhejiang University(浙江大学) University of Toronto(多伦多大学) Dalian University of Technology(大连理工大学) Sun Yat-sen University(中山大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出ViSSRes方法,通过轻量级MLP网络学习视频表示的残差,从时空和语义一致性优化,在推理时仅需单次前向传播,有效降低幻觉率并提升视频理解性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01615 2026-06-02 cs.CV cs.MM 81%

Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval

图灵模式用于多媒体:反应-扩散多模态融合用于语言引导的视频时刻检索

Xiang Fang, Wanlong Fang, Wei Ji, Tat-Seng Chua

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学)

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.MM

AI总结 提出基于反应-扩散过程的多模态融合框架RDMF,通过模拟生物模式形成机制实现视频与文本的动态对齐,用于视频时刻检索与高亮检测。

Comments Published in ACM MM 2025. Address some typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26680 2026-05-27 cs.CV cs.AI 81%

DynFrame: Adaptive Reasoning-Driven Multimodal Framework with Dynamic Frame Augmentation for Complex Video Understanding

DynFrame: 自适应推理驱动的多模态框架与动态帧增强用于复杂视频理解

Peng Zhang, Guanghao Zhang, Wanggui He, Longxiang Zhang, Mushui Liu, Yan Xia, Zhenhao Peng, Weilong Dai, Jinlong Liu, Haobing Tang, Le Zhang, Hao Jiang, Pipei Huang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出DynFrame框架,通过将时间窗口和采样密度作为原生token进行单步检索,并引入分段解耦GRPO优化,解决了视频多模态大模型中采样密度不可学习及检索与回答优化耦合的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07570 2026-05-20 q-bio.NC cs.AI cs.CV cs.LG 81%

How does longer temporal context enhance multimodal narrative video processing in the brain?

更长的时间上下文如何增强大脑对多模态叙事视频的处理?

Prachi Jindal, Anant Khandelwal, Manish Gupta, Bapi S. Raju, Subba Reddy Oota, Tanmoy Chakraborty

机构 * Technische Universität Berlin(柏林技术大学) Microsoft Research(微软研究院) IIT Delhi(德里理工学院) Microsoft(微软) IIIT-Hyderabad(海得拉巴理工学院)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究探讨了视频片段时长和叙事任务提示如何影响自然电影观看过程中大脑模型对多模态大语言模型(MLLMs)的对齐情况,发现增加片段持续时间显著提高了大脑对齐程度,而单模态视频模型则无明显提升。

Comments 22 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04727 2026-05-19 cs.CV cs.AI 81%

Are Multimodal LLMs Ready for Surveillance? A Reality Check on Zero-Shot Anomaly Detection in the Wild

多模态大语言模型是否准备好用于监控?对零样本异常检测在现实中的检验

Shanle Yao, Armin Danesh Pazho, Narges Rashvand, Hamed Tabkhi

机构 * Electrical and Computer Engineering Department(电气与计算机工程系)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文研究了多模态大语言模型在现实中的零样本异常检测性能,发现其存在保守偏差,通过特定指令可以提升F1分数,但召回率仍是关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09395 2026-05-19 cs.AI cs.LG cs.MA cs.MM 81%

Empowering VLMs for Few-Shot Multimodal Time Series Classification via Tailored Agentic Reasoning

通过定制代理推理增强VLMs在少样本多模态时间序列分类中的能力

Lin Li, Jiawei Huang, Qihao Quan, Dan Li, Boxin Li, Xiao Zhang, Erli Meng, Wenjie Feng, Jian Lou, See-Kiong Ng

机构 * Sun Yat-sen University(中山大学) Xiaomi Corporation(小米公司) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI、cs.MM

AI总结 本文提出MarsTSC框架,通过自演化知识库和代理推理提升少样本多模态时间序列分类性能,实验表明其在六个VLM基础上均优于传统和基础模型基线。

Comments 18 pages, 12 figures, 6 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10732 2026-05-12 cs.CV cs.AI 81%

iPay: Integrated Payment Action Recognition via Multimodal Networks and Adaptive Spatial Prior Learning

iPay: 通过多模态网络和自适应空间先验学习实现集成支付动作识别

Kaicong Huang, Weiheng Oh, Thomas Guggisberg, Ruimin Ke

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) Capital District Transportation Authority(卡特里奇交通局)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出iPay框架,结合多模态混合专家架构和自适应空间先验学习,提升公共交通车内支付动作识别的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10106 2026-05-12 cs.CV cs.AI 81%

ViSRA: A Video-based Spatial Reasoning Agent for Multi-modal Large Language Models

ViSRA:一种基于视频的空间推理代理用于多模态大语言模型

Tingshu Mou, Jiabo He, Renying Wang, Ce Liu, Hao Yang, Tiehua Zhang, Jingjing Chen, Xingjun Ma

机构 * Fudan University(复旦大学) Bosch Center for Artificial Intelligence (BCAI)(博世人工智能中心(BCAI)) Tongji University(同济大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 ViSRA从无训练视角出发,提出一种人类对齐的视频空间推理代理框架,通过显式空间信息探索多模态大语言模型的空间推理机制,实现模块化和可扩展的空间推理,提升3D理解能力并减少训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09693 2026-05-12 cs.CV cs.AI cs.LG 81%

Do multimodal models imagine electric sheep?

多模态模型是否想象出电羊?

Santhosh Kumar Ramakrishnan, Carl Vondrick, Raja Giryes, Philipp Krähenbühl, Vladlen Koltun

机构 * Apple(苹果公司)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究发现多模态模型在解决空间谜题时会形成心理图像,通过微调Qwen3.5 VLM解决多种视觉推理任务,发现动作序列预测能提升解谜准确率,尤其在需要空间推理的任务中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07151 2026-05-11 cs.CV cs.AI 81%

DPG-CD: Depth-Prior-Guided Cross-Modal Joint 2D-3D Change Detection

DPG-CD: 基于深度先验的跨模态联合2D-3D变化检测

Luqi Zhang, Zhen Dong, Bisheng Yang

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出DPG-CD框架,通过引入深度先验和多阶段跨时序跨模态融合,有效解决影像与DSM间模态差异导致的3D变化检测难题,提升2D语义和3D高度变化检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00630 2026-05-04 cs.CV cs.MM eess.IV 81%

CMTA: Leveraging Cross-Modal Temporal Artifacts for Generalizable AI-Generated Video Detection

CMTA:利用跨模态时间特征进行通用的AI生成视频检测

Hang Wang, Chao Shen, Chenhao Lin, Minghui Yang, Lei Zhang, Cong Wang

机构 * Xi’an Jiaotong University(西安交通大学) The Hong Kong Polytechnic University(香港理工大学) Guangdong OPPO Mobile Communications Co., Ltd.(广东OPPO移动通信有限公司) City University of Hong Kong(香港城市大学)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出CMTA框架,通过联合跨模态嵌入和多粒度时间建模,识别AI生成视频中的跨模态时间特征,验证了其在四个大规模数据集上的新状态和跨生成器泛化能力。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07584 2026-04-29 cs.CV cs.AI 81%

Multimodal Contextualized Support for Enhancing Video Retrieval System

多模态上下文支持用于增强视频检索系统

Quoc-Bao Nguyen-Le, Thanh-Huy Le-Nguyen

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种多模态视频检索系统,通过整合多帧信息提取更高层次的抽象信息,提升视频检索的准确性与深度。

Comments This paper has been withdrawn by the author. After further review, the author believes that the current version does not meet the desired standards and plans to revise the work before any potential resubmission

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18570 2026-04-23 cs.LG cs.AI cs.CL 81%

A multimodal and temporal foundation model for virtual patient representations at healthcare system scale

面向医疗系统规模的多模态与时间基础模型:虚拟患者表示

Andrew Zhang, Tong Ding, Sophia J. Wagner, Caiwei Tian, Ming Y. Lu, Rowland Pettit, Joshua E. Lewis, Alexandre Misrahi, Dandan Mo, Long Phi Le, Faisal Mahmood

机构 * Department of Pathology, Mass General Brigham, Harvard Medical School(病理学系,马萨诸塞州总医院与哈佛医学院) Cancer Program, Broad Institute of Harvard and MIT(癌症计划,哈佛-麻省理工Broad研究所) Data Science Program, Dana-Farber Cancer Institute(数据科学计划,达纳-法伯癌症研究所) Health Sciences and Technology, Harvard-MIT(健康科学与技术,哈佛-麻省理工) Harvard John A. Paulson School of Engineering and Applied Sciences, Harvard University(哈佛约翰·A·保罗森工程与应用科学学院,哈佛大学) Department of Biomedical Informatics, Harvard Medical School(生物医学信息学系,哈佛医学院) Electrical Engineering and Computer Science, Massachusetts Institute of Technology (MIT)(电气工程与计算机科学,麻省理工学院(MIT)) School of Computer and Communication Sciences, EPFL, Lausanne, Switzerland(计算机与通信科学学院,EPFL,瑞士洛桑)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Apollo模型,整合多模态和时间信息,构建虚拟患者表示,用于预测疾病风险、治疗反应等,展示其在医疗计算中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10417 2026-04-23 cs.CV cs.AI cs.LG 81%

Combo-Gait: Unified Transformer Framework for Multi-Modal Gait Recognition and Attribute Analysis

Combo-Gait:多模态和多任务框架用于多模态步态识别与属性分析

Zhao-Yang Wang, Zhimin Shao, Anirudh Nanduri, Basudha Pal, Laura McDaniel, Jieneng Chen, Rama Chellappa

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Maryland(马里兰大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出结合2D时间轮廓与3D SMPL特征的多模态框架,实现步态识别与年龄、BMI、性别等属性估计,通过统一Transformer融合多模态特征,提升鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19217 2026-04-22 cs.CV cs.AI 81%

Attention-based Multi-modal Deep Learning Model of Spatio-temporal Crop Yield Prediction with Satellite, Soil and Climate Data

基于注意力机制的多模态深度学习模型:融合卫星、土壤和气候数据的时空作物产量预测

Gopal Krishna Shyam, Ila Chandrakar

机构 * Presidency University, Bengaluru, India(班加罗尔大学) University of Europe for Applied Sciences, Berlin(欧洲应用科学大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出ABMMDLF模型,结合多年的卫星影像、高分辨率气象时间序列和初始土壤属性,通过卷积神经网络提取空间特征和时间注意力机制适应性加权关键物候期,实现高精度时空作物产量预测,R²达0.89。

Comments 6 pages, 2 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16748 2026-04-21 cs.CV cs.AI 81%

TriTS: Time Series Forecasting from a Multimodal Perspective

TriTS:从多模态视角进行时间序列预测

Xiang Ao

机构 * School of Software Engineering, Beijing Jiaotong University(北京交通大学软件学院)

专题命中 视频多模态 :multimodal(title);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 TriTS从多模态视角提出新的跨模态解耦框架,通过时间、频率和2D视觉空间投影,结合周期感知重塑策略和视觉Mamba,实现高效的时间序列预测,实验表明其在多个基准数据集上达到SOTA性能。

Comments 9 pages, 3 figures. Accepted by the A2A-MML Workshop in conjunction with CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16734 2026-04-21 cs.CV cs.AI 81%

Reducing Peak Memory Usage for Modern Multimodal Large Language Model Pipelines

降低现代多模态大语言模型流水线的峰值内存使用

Junwan Kim, Hyunkyung Bae

机构 * New York University(纽约大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种顺序输入压缩机制,在预填充阶段通过结构感知的键值缓存压缩,降低多模态大语言模型的峰值内存使用,同时保持生成性能。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15377 2026-04-20 cs.LG cs.CV cs.MM 81%

M3R: Localized Rainfall Nowcasting with Meteorology-Informed MultiModal Attention

M3R:基于气象信息的多模态注意力的局部降雨现在预测

Sanjeev Panta, Rhett M Morvant, Xu Yuan, Li Chen, Nian-Feng Tzeng

机构 * University of Louisiana at Lafayette, Lafayette, LA, USA(路易斯安那州立大学拉斐特分校) University of Delaware, Newark, DE, USA(德克萨斯大学达勒姆分校)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 M3R结合NEXRAD雷达图像与气象站数据,通过多模态注意力机制提升降雨预测精度与效率,实现更准确的降雨现在预测。

Comments Accepted at IEEE International Conference on Multimedia and Expo (ICME) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08719 2026-04-13 cs.CV cs.AI cs.RO 81%

LMGenDrive: Bridging Multimodal Understanding and Generative World Modeling for End-to-End Driving

LMGenDrive: 联合多模态理解与生成世界建模以实现端到端驾驶

Hao Shao, Letian Wang, Yang Zhou, Yuxuan Hu, Zhuofan Zong, Steven L. Waslander, Wei Zhan, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多媒体实验室) University of Toronto(多伦多大学) UC Berkeley(加州大学伯克利分校)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出LMGenDrive框架,结合LLM多模态理解与生成世界模型,提升自动驾驶的闭环性能,通过视频预测和控制信号生成,增强时空场景建模和指令遵循能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03302 2026-04-07 cs.CV cs.AI 81%

Beyond Static Vision: Scene Dynamic Field Unlocks Intuitive Physics Understanding in Multi-modal Large Language Models

超越静态视觉:场景动态场解锁多模态大语言模型中的直观物理理解

Nanxi Li, Xiang Wang, Yuanjie Chen, Haode Zhang, Hong Li, Yong-Lu Li

机构 * Shanghai Jiao Tong University(上海交通大学) Tianjin University(天津大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究探讨多模态大语言模型在物理理解上的不足,提出Scene Dynamic Field方法提升对连续物体动态的理解能力,实现20.7%的改进并展现良好的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06763 2026-04-03 cs.CV cs.AI 81%

SafePLUG: Empowering Multimodal LLMs with Pixel-Level Insight and Temporal Grounding for Traffic Accident Understanding

SafePLUG: 通过像素级洞察和时间锚定赋能多模态大语言模型以理解交通事故

Zihao Sheng, Zilin Huang, Yansong Qu, Jiancong Chen, Yuhao Luo, Yen-Jung Chen, Yue Leng, Sikai Chen

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Purdue University(普渡大学) Google(谷歌)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出SafePLUG框架,通过像素级理解和时间锚定提升多模态大语言模型在交通事故分析中的能力,引入新数据集并实现区域问答、像素分割、时间事件定位等任务的高性能表现。

Comments The code, dataset, and model checkpoints will be made publicly available at: https://zihaosheng.github.io/SafePLUG

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01002 2026-04-02 cs.CV cs.AI cs.LG 81%

Query-Conditioned Evidential Keyframe Sampling for MLLM-Based Long-Form Video Understanding

基于证据的关键帧采样用于基于MLLM的长视频理解

Yiheng Wang, Lichen Zhu, Yueqian Lin, Yudong Liu, Jingyang Zhang, Hai "Helen" Li, Yiran Chen

机构 * Duke University(杜克大学) Independent Researcher(独立研究员)

专题命中 视频多模态 :MLLM(title);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于信息瓶颈理论的证据驱动关键帧采样框架,通过最大化选帧与查询的条件互信息,提升长视频理解性能,实验表明在严格token预算下优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00994 2026-04-02 cs.CL cs.AI cs.SI 81%

Multimodal Analysis of State-Funded News Coverage of the Israel-Hamas War on YouTube Shorts

对以色列-哈马斯战争中YouTube Shorts上国家资助新闻报道的多模态分析

Daniel Miehling, Sandra Kuebler

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个多模态管道,结合自动转录、基于方面的情感分析和语义场景分类,分析国家资助机构对以色列-哈马斯战争的短视频报道,发现不同来源和时间的情感表达差异及视觉线索的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29252 2026-04-01 cs.CV cs.AI 81%

Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism

通过视觉记忆机制扩展多模态大语言模型的长视频理解

Tao Chen, Kun Zhang, Qiong Wu, Xiao Chen, Chao Chang, Xiaoshuai Sun, Yiyi Zhou, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室) National University of Defense Technology(国防科技大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出FlexMem方法,通过视觉记忆机制实现长视频理解,有效提升多模态大语言模型处理无限长视频的能力,实验显示其在单块3090 GPU上能处理超1000帧视频并优于现有方法。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08415 2026-03-25 cs.CV cs.AI 81%

Cross-Modal Transferable Image-to-Video Attack on Video Quality Metrics

跨模态可迁移的图像到视频攻击视频质量度量

Georgii Gotin, Ekaterina Shumitskaya, Anastasia Antsiferova, Dmitriy Vatolin

机构 * Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学) ISP RAS Research Center for Trusted Artificial Intelligence(俄罗斯科学院信息与系统研究所在可信人工智能研究中心) MSU Institute for Artificial Intelligence(莫斯科大学人工智能研究所) Laboratory of Innovative Technologies for Processing Video Content(视频内容处理创新技术实验室)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出IC2VQA方法,通过跨模态攻击探索现代视频质量度量模型的漏洞,利用CLIP模块提升对抗扰动的可迁移性,实验显示在三种黑盒视频质量度量模型上攻击成功率高。

Comments Accepted for VISAPP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏