arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4749 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4749 篇

2608.02629 2026-08-05 cs.LG cs.AI 新提交 79%

Multimodal Auto-regressive Transformer Surrogate for Modeling Variable Operations and Quantifying Uncertainty in Geological Carbon Storage

用于建模地质碳封存中可变操作与量化不确定性的多模态自回归Transformer代理模型

Yifu Han, Louis J. Durlofsky

机构 * Stanford University(斯坦福大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究提出多模态自回归Transformer代理模型,用于地质碳封存中可变操作建模与不确定性量化,经4000次GEOS流模拟训练后,可精准预测相关参数并降低关键元参数的不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08592 2026-08-05 cs.MM 版本更新 79%

Fact-Checking at Scale: Multimodal AI for Authenticity and Context Verification in Online Media

大规模事实核查:用于在线媒体真实性与上下文验证的多模态AI

Van-Hoang Phan, Tung-Duong Le-Duc, Long-Khanh Pham, Anh-Thu Le, Quynh-Huong Dinh-Nguyen, Dang-Quan Vo, Hoang-Quoc Nguyen-Son, Anh-Duy Tran, Dang Vu, Minh-Son Dao

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.MM

AI总结 本文为2025年ACM多媒体大会多媒体验证挑战赛开发了多模态验证系统,整合视觉取证等技术,可检测脱离上下文的媒体,提升了多媒体验证水平,为相关从业者提供实用工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04227 2026-08-04 cs.AI cs.HC 版本更新 79%

Pro$^2$Assist: Continuous Step-aware Proactive Assistance with Multi-modal Egocentric Perception for Long-horizon Procedural Tasks

Pro²Assist:面向长程流程任务的、基于多模态自我中心感知的步骤感知主动式辅助系统

Lilin Xu, Bufang Yang, Siyang Jiang, Kaiwei Liu, Kaiyuan Hou, Yuang Fan, Hongkai Chen, Zhenyu Yan, Xiaofan Jiang

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);分类 cs.AI

AI总结 本研究提出Pro²Assist,一种基于多模态自我中心感知的步骤感知主动式辅助系统,通过AR眼镜感知与持续推理提升长程流程任务辅助效果,在动作理解与主动时机准确率上优于基线,获多数用户认可。

Comments To appear in IMWUT'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00847 2026-08-04 cs.CV 新提交 79%

Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking

模型作为工具:用于统一多模态视觉跟踪的智能体协调框架

Wenrui Cai, Yuzhe Li, Qingjie Liu, Yunhong Wang

机构 * Beihang University(北京航空航天大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 针对现有视觉跟踪方法的瓶颈,提出ACTrack智能体协调框架,整合异构模型工具的互补优势,仅用30%可训练参数便在多类基准上实现性能超越。

Comments 21 pages, 15 Tables, 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00309 2026-08-04 cs.SE cs.AI 新提交 79%

OrEdge: Efficient Multi-Modal Anomaly Detection in Distributed Software Systems via Orthogonal-Domain Learning

OrEdge:基于正交域学习的分布式软件系统高效多模态异常检测

Amr M. Zaki, Farhoud Jafari Kaleibar, Honggeun Ji, Komal Sarda, Marin Litoiu

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.AI

AI总结 OrEdge是基于正交域学习的轻量级多模态异常检测框架,通过OrEdgeCore重构模块,在微服务数据集上实现了高精度,且模型参数仅9.6K,推理延迟较现有方法降低一个数量级以上,可高效部署于边缘设备。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21337 2026-08-04 cs.LG cs.AI 版本更新 79%

DataClaw0: Agentic Tailoring Multimodal Data from Raw Streams

DataClaw0: 从原始流中智能定制多模态数据

Cong Wan, Zeyu Guo, Zijian Cai, Jiangyang Li, SongLin Dong, Lin Peng, Xiangyang Luo, Zhiheng Ma, Yihong Gong

机构 * University of Chinese Academy of Sciences(中国科学院大学) Shenzhen University of Advanced Technology(深圳理工大学) Tsinghua University(清华大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 提出DataClaw0模型,通过两阶段流水线将生成语义合成锚定于确定性事实锚点,结合SFT与GRPO实现复杂数据精炼意图的对齐,首个数据精炼基准验证其高效性。

Comments add base model: Qwen3.5-27B

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29310 2026-08-03 cs.CV 新提交 79%

CALM-AH: An ABAW11-Calibrated Multimodal Ensemble with Reliability-Gated Multi-Expert Consensus for Video-Level Ambivalence and Hesitancy Recognition

CALM-AH:面向视频层面矛盾与犹豫识别的ABAW11校准多模态集成模型,采用可靠性门控多专家共识机制

Wenzhuo Sun, Mingjian Liang, Richard Attfield, Zongyuan Ge, Xuelian Cheng, Pamela Carreno-Medrano

机构 * Monash University(莫纳什大学) Monash Suzhou Research Institute(莫纳什苏州研究院)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 针对ABAW11视频层面矛盾与犹豫识别任务,提出CALM-AH多模态集成模型及RG-MEC门控多专家共识机制,在ABAW11数据集上分别取得0.7525与0.7771的Macro-F1性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23855 2026-08-03 cs.SD cs.CV 版本更新 79%

OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation

OmniVAE:用于联合生成的具有跨模态对齐的音频-视频变分自编码器

Jun Zhan, Chen Yang, Yitian Gong, Donghua Yu, Kuangwei Chen, Wenbo Zhang, Kexin Huang, Qi Luo, Zhe Xu, Ying Zhu, Jin Wang, Tengyue Zhang, Qi Chen, Cheng Chang, Songlin Wang, Junqi Dai, Jiasheng Ye, Xiaogui Yang, Tianyi Liang, Xiangyu Peng, Zhaoye Fei, Shimin Li, Qinyuan Cheng, Xie Chen, Xinchi Chen, Xipeng Qiu

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 研究针对音频和视频联合生成中跨模态对齐难的问题,提出OmniVAE,通过联合训练学习音频和视频潜在表示间的细粒度语义对齐,使用对比目标捕捉对应关系并对齐潜在空间,还提炼特征提升可学习性,实验证明其有效提升生成质量和同步准确性。

Comments 15 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19063 2026-08-03 cs.AI 版本更新 79%

Quality Action Assurance: Multimodal Verification of Examiner Claims in VR OSCEs

质量行动保证:虚拟现实客观结构化临床考试中考官声明的多模态验证

Harry Rogers, Sally Shiels, Ashley Tomlinson, James Thomas, James Aylward, Nathan Gauge, Helen Higham, Alison Noble

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 研究针对VR儿科OSCEs中考官评分受主观因素影响问题,提出多模态框架QAA,结合约束时间动作对齐模型与大语言模型,通过对比动作与真实事件序列验证考官声明,提升了评估的公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10680 2026-08-03 cs.HC cs.AI 79%

A Platform-Agnostic Multimodal Digital Human Modelling Framework: Neurophysiological Sensing in Game-Based Interaction

一种平台无关的多模态数字人类建模框架:基于游戏交互的神经生理传感

Daniel J. Buxton, Mufti Mahmud, Jordan J. Bird, Thomas Hughes-Roberts, David J. Brown

机构 * Nottingham Trent University(诺丁汉特伦大学) King Fahd University of Petroleum and Minerals(国王法赫德石油和矿物大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出了一种平台无关的多模态数字人类建模框架,通过统一的神经生理传感和游戏交互环境,支持AI驱动的可重复、可扩展的交互研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26393 2026-07-30 cs.AI 新提交 79%

CaM-Wolf: Causal-Aware Multimodal Agents for Social Deduction Games

CaM-Wolf:面向社交推理游戏的因果感知多模态智能体

Zheng Zhang, Nanjie Yao, Jiarui He, Deheng Ye, Peilin Zhao, Hao Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 该研究针对现有SDG智能体多模态特性缺失的问题,提出首个整合多模态感知生成的CaM-Wolf,经实验验证其游戏性能与交互质量均有提升。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08716 2026-07-22 cs.CV 版本更新 79%

Great X: A Unified Multi-Modal Simulator Bridging the Sim2Real Gap for 6G

Great X:一种统一的多模态模拟器,弥合6G的模拟与现实差距

Yuan Gao, Kongwu Huang, Jun Jiang, Shiyi Mu, Shugong Xu

机构 * Shanghai University(上海大学) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 针对6G无线研究中多模态数据集收集难题及现有模拟器不足,提出在虚幻引擎实现统一单引擎模拟器Great-X,集成光线追踪等技术,构建含大量同步样本的Great-MCD,实验显示其性能优于现有模拟器及测量数据基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17669 2026-07-21 cs.CV 新提交 79%

Attention from Above: A Multimodal Model for Drone-Based Object Localization

自上而下的注意力:一种基于无人机的目标定位多模态模型

Hyun-Ki Jung

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 针对无人机目标检测,本文基于YOLO-World框架,用A2C2f层替换C2f层,引入注意力机制和并行处理结构,提升小目标检测性能,在VisDrone数据集实验中各项指标显著优于原模型,提供了高精度检测方案。

Comments Preprint. Accepted for publication in the International Journal of Interactive Mobile Technologies

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17423 2026-07-21 cs.CV 新提交 79%

TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs

TimeLens2:使用多模态大语言模型进行通用视频时间定位

Yuhan Zhu, Changlian Ma, Xiangyu Zeng, Xinhao Li, Zhiqiu Zhang, Songze Li, Jun Zhang, Tianxiang Jiang, Yuandong Yang, Ziang Yan, Zikang Wang, Xinyu Chen, Haoran Chen, Shaowei Zhang, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 研究通用视频时间定位问题,TimeLens2将时间证据视为区间集,通过多种策略构建多跨度监督,其时间瓦瑟斯坦奖励等方法提供反馈,在多个基准测试中表现出色,不同变体均有性能提升。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17386 2026-07-21 cs.CV 新提交 79%

SkyVLaM: Multimodal Large Language Model for UAV Video Understanding in Remote Sensing

SkyVLaM:用于遥感中无人机视频理解的多模态大语言模型

Kaiwen Jing, Ruixu Jia, Bingyao Li, Ruizhe Ou, Ming Wu, Chuang Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Beijing Wuzi University(北京物资学院)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 针对无人机视频理解任务,提出多模态大语言模型SkyVLaM,通过时间基感知器构建稀疏令牌,正则化稀疏基,自适应选择密集段,联合大语言模型处理,还构建SkyVid,实验证明其能有效分配视觉令牌预算,提升语言条件视频分割效果。

Comments Accepted by WAICA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11939 2026-07-15 cs.CV 新提交 79%

TSCA-Net: Temporal-Spatial Clique Attention for Interpretable Multimodal Pedestrian Trajectory Prediction

TSCA-Net:用于可解释多模态行人轨迹预测的时空团块注意力

Md Mustafizur Rahman, Guangchao Yang, A F M Abdun Noor, Md Imam Ahasan, Md Mahfuzur Rahman, Md Ariful Islam

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 针对拥挤环境中行人轨迹预测难题,提出TSCA-Net框架,含时空团块注意力、跨行人团块势、自适应KAN网格细化三个模块,经实验验证其性能最优,消融研究证实模块互补作用。

Comments 10 pages, 4 figures, 4 tables. Submitted to the IEEE International Conference on Data Mining (ICDM) 2026, Applied Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10206 2026-07-14 cs.RO cs.AI 新提交 79%

Source-Lifted Flow Matching for Intervenable Multimodal Imitation

用于可干预多模态模仿的源提升流匹配

He Zhang, Ying Sun, Pengteng Li, Ziyang Chen, Yiren Zhao, Ziyang Rao, Weiyu Guo, Yandong Guo, Hui Xiong

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 研究提出源提升流匹配(SL - FM)解决多模态模仿学习中流匹配策略随机性被动问题,核心机制为正交源提升,实验表明其能将被动源随机性转化为可操作变量,提升多模态控制性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09955 2026-07-14 cs.LG cs.AI 新提交 79%

A Foundation Model for Multimodal Event Sequences in Financial Applications

金融应用中多模态事件序列的基础模型

Nikita Rusakov, Vladislav Meshkov, Konstantin Zorin, Gleb Zaripov, Alexander Uglov, Alexey Vasilev, Anton Klenitskiy

机构 * Sber(俄罗斯储蓄银行) Sber AI Lab(俄罗斯储蓄银行人工智能实验室)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 研究金融应用中多模态事件序列预测建模,提出预训练基础变压器模型统一多源事件成序列,经下一个事件预测学习通用表示,结合现有特征训练轻量级神经模型用于多下游任务,优于传统模型并减少开发开销且已应用取得业务改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29943 2026-07-13 cs.CV 版本更新 79%

Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting

EC-Bench:超长视频的枚举与计数基准

Fumihiko Tsuchiya, Taiki Miyanishi, Shunsuke Yasuki, Mahiro Ukai, Nakamasa Inoue, Shuhei Kurita, Yusuke Iwasawa, Yutaka Matsuo

机构 * The University of Tokyo, Japan(东京大学) Institute of Science Tokyo, Japan(东京科学大学) National Institute of Informatics, Japan(国立信息学研究所)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 EC-Bench针对超长视频的枚举与计数问题,通过152部超过30分钟的视频和1699个查询,评估多模态大语言模型的性能,揭示模型在时间推理和计数任务中的局限性。

Comments The first two authors are equally contributed. The data and code are publicly available at: https://github.com/matsuolab/EC-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09385 2026-07-09 cs.CV 版本更新 79%

EventVGGT: Exploring Cross-Modal Distillation for Consistent Event-based Depth Estimation

EventVGGT:探索跨模态蒸馏以实现一致的基于事件的深度估计

Yinrui Ren, Jinjing Zhu, Kanghao Chen, Zhuoxiao Li, Jing Ou, Zidong Cao, Tongyan Hua, Peilun Shi, Yingchun Fu, Wufan Zhao, Hui Xiong

机构 * HKUST(GZ)(香港科技大学(珠海)) CUHK(香港中文大学) SCNU(华南师范大学)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 EventVGGT通过跨模态蒸馏实现一致的基于事件的深度估计,有效提升深度预测精度和泛化能力。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04117 2026-07-07 cs.LG cs.CV 新提交 79%

GlacierCastAI: Predicting Glacier Retreat from Multi-Modal Satellite Imagery and Climate Signals

GlacierCastAI:从多模态卫星图像和气候信号预测冰川退缩

Arunkumar Ramachandran

机构 * Independent Researcher(独立研究者)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 研究将冰川边界预测重构为多模态时空预测问题,融合多源数据,用特定架构预测冰川边界,对比传统基线及实验条件,发现气候信号有预测信息,深度学习模型优于传统基线。

Comments 6 pages, 5 figures. Code available at GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22872 2026-07-03 cs.CV 版本更新 79%

ForeSea: AI Forensic Search with Multi-modal Queries for Video Surveillance

ForeSea:面向视频监控的多模态查询AI取证搜索

Hyojin Park, Yi Li, Janghoon Cho, Sungha Choi, Jungsoo Lee, Taotao Jing, Shuai Zhang, Munawar Hayat, Dashan Gao, Ning Bi, Fatih Porikli

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 针对监控视频中多模态查询与时间定位难题,提出ForeSea系统,采用三阶段即插即用流程,结合跟踪、多模态嵌入和视频LLM,在ForeSeaQA基准上准确率提升3.1%,时间IoU提升10.1%。

Comments ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22032 2026-07-03 cs.CV 版本更新 79%

Drive-JEPA: Video JEPA Meets Multimodal Trajectory Distillation for End-to-End Driving

Drive-JEPA:视频JEPA结合多模态轨迹蒸馏实现端到端驾驶

Linhan Wang, Zichong Yang, Chen Bai, Guoxiang Zhang, Xiaotong Liu, Xiaoyin Zheng, Xiao-Xiao Long, Chang-Tien Lu, Cheng Lu

机构 * Virginia Tech(弗吉尼亚理工学院) Purdue University(普渡大学) XPENG Motors(小鹏汽车) Nanjing University(南京大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 提出Drive-JEPA框架,结合视频联合嵌入预测架构(V-JEPA)与多模态轨迹蒸馏,通过自监督视频预训练和动量感知选择机制提升端到端驾驶的规划性能,在NAVSIM上达到新最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28369 2026-07-02 cs.IR cs.AI 版本更新 79%

Multimodal and Multiscale Spatial-Temporal Semantic Search and Recommendation with AI Foundation Models

基于AI基础模型的多模态与多尺度时空语义搜索与推荐

Yuanyuan Tian, Wenwen Li, Xiao Chen, Michael Brook, Michael Brubaker, Anna Liljedahl, Chitta Baral

机构 * School of Geographical Sciences and Urban Planning, Arizona State University(地理科学与城市规划学院,亚利桑那州立大学) Alaska Native Tribal Health Consortium(阿拉斯加原住民部落健康联盟) Woodwell Climate Research Center(伍德沃德气候研究中心) School of Computing and Augmented Intelligence, Arizona State University(计算与增强智能学院,亚利桑那州立大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 提出融合大语言模型和视觉-语言模型的框架,通过CAMERA算法融合文本与视觉信息生成更丰富嵌入,以及ASTRA算法结合尺度依赖的时空相关性与语义相似性进行重排序,在环境事件文档检索中优于单模态方法。

Comments 17 pages, accepted for publication in the ACM Transactions on Spatial Algorithms and Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31187 2026-07-01 cs.CV 新提交 79%

Learning to Deny: Action Denial in Multimodal Large Language Models

学习拒绝:多模态大语言模型中的动作否定

Raiyaan Abdullah, Shehreen Azad, Yogesh Singh Rawat

机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 提出UCF101-AD基准测试,评估多模态大语言模型在强上下文线索下识别动作缺失的能力,发现模型倾向于肯定动作而非验证其真实性,并通过因果图CausalAct减少误报。

Comments Accepted to ECCV 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29504 2026-06-30 cs.CV cs.CR 79%

Empirical Evaluation of Multi-Modal Touch Detection in Over-the-Shoulder Video Surveillance

肩后视频监控中多模态触摸检测的实证评估

Mohammadreza Rashidi

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文评估了一种多模态触摸检测框架,用于从肩后视频中重建移动键盘按键事件,但实验表明在非受控场景下无法可靠重建击键。

Comments 9 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28089 2026-06-29 cs.CV 新提交 79%

RPM-Distill: Physiology-guided Adaptive Cross-modal Distillation for Robust Remote Physiological Measurement

RPM-Distill:生理引导的自适应跨模态蒸馏用于鲁棒的远程生理测量

Jiyao Wang, Qingyong Hu, Duoxun Tang, Xiao Yang, Kaishun Wu, Jiangbo Yu

机构 * McGill University(麦吉尔大学) Hong Kong University of Science and Technology(香港科技大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 提出RPM-Distill框架,利用训练时的雷达信号通过频域蒸馏指导视频模型,提升光照、肤色和运动变化下的远程心率估计鲁棒性,在挑战性条件下MAE降低81%,相关性提升21%。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27576 2026-06-29 cs.CV 新提交 79%

DeLux: Cross-Modal Local Artifact Restoration in Video Using Neuromorphic Data

DeLux: 利用神经形态数据进行视频中的跨模态局部伪影修复

Bartosz Stachowiak, Dariusz Brzezinski

机构 * Institute of Computing Science, Poznan University of Technology(波兹南技术大学计算机科学学院)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 提出DeLux,一种利用神经形态事件流作为结构先验,引导RGB视频中光照伪影检测与修复的跨模态修复方法,在合成和真实数据上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19193 2026-06-26 cs.CV 79%

How Far Are Video Models from True Multimodal Reasoning?

视频模型距离真正的多模态推理还有多远?

Xiaotian Zhang, Jianhui Wei, Yuan Wang, Jie Tan, Yichen Li, Yan Zhang, Ziyi Chen, Daoan Zhang, Dezhi YU, Wei Xu, Songtao Jiang, Zuozhu Liu

机构 * Zhejiang University(浙江大学) ByteDance(字节跳动)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出CLVG-Bench评估框架,通过上下文学习测试视频模型的零样本推理能力,揭示当前SOTA模型在逻辑推理和交互生成任务中表现不足,指出多模态推理和物理基础是关键瓶颈。

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24187 2026-06-25 cs.CV 新提交 79%

Towards Fast and Effective Long Video Understanding of Multimodal Large Language Models via Adaptive Quasi-Gaussian Sampling

面向多模态大语言模型的长视频快速有效理解:自适应准高斯采样

Kun Zhang, Chenxin Fang, Tao Chen, Baiyang Song, Yunhang Shen, Yiyi Zhou, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 提出自适应无训练帧采样方法AdaQ,基于高斯分布3-σ规则动态调整采样区间,在仅用64帧下使Qwen3-VL-8B平均超越GPT4o 15.8%,显著提升长视频理解的鲁棒性和效率。

Comments NeurIPS 2026 submission. 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏