arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 178 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 178 篇

2605.09625 2026-06-16 cs.HC 版本更新 78%

AwareLLM: A Proactive Multimodal Ecosystem for Personalized Human-AI Collaboration to Enhance Productivity

AwareLLM: 一种主动多模态生态系统,用于个性化人机协作以提升生产力

Amog Rao, Utkarsh Agarwal, Amol Harsh, Siddharth Siddharth

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 AwareLLM通过整合多模态数据与大语言模型,实现主动适应用户心理生理状态,提升任务表现并降低认知疲劳,推动人机协作新范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20919 2026-07-31 cs.CV 版本更新 74%

GIM-ENDO: A Multimodal Endoscopic Image and Video Dataset for Gastric Intestinal Metaplasia Morphology and Pathology

GIM-ENDO:用于胃肠化生形态与病理的多模态内镜图像和视频数据集

Mojgan Forootan, Mahziar Setayeshfar, Ali Darvishi, Mohammad Tashakoripour, Hamidreza Bolhasani

机构 * Gastroenterology and Liver Disease Research Center, Research Institute for Gastroenterology and Liver Diseases, Shahid Beheshti University of Medical Sciences(沙希德·贝赫什提医科大学胃肠病与肝病研究中心,胃肠病与肝病研究所) Iran University of Medical Sciences(伊朗医科大学) Shiraz University of Medical Sciences(设拉子医科大学) Gastroenterology Department, Amiralam Hospital, Tehran University of Medical Sciences(德黑兰医科大学阿米拉拉姆医院胃肠病科) Department of Computer Engineering, Science and Research Branch, Islamic Azad University(伊斯兰阿扎德大学科学与研究分校计算机工程系)

专题命中 视频多模态 :multimodal(title);分类 cs.CV

AI总结 针对胃黏膜肠化生(GIM)公开数据集缺失的问题,构建了包含多模态内镜图像、视频及病理标注的数据集GIM-ENDO,涵盖六种主要内镜征象和亚型分级,以促进AI辅助诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16084 2026-07-07 cs.LG cs.AI 版本更新 74%

Unveiling Stochasticity: Universal Multi-modal Probabilistic Modeling for Traffic Forecasting

揭示随机性:面向交通预测的通用多模态概率建模

Weijiang Xiong, Robert Fonod, Nikolas Geroliminis

机构 * Urban Transport Systems Laboratory (LUTS), EPFL(智能交通系统实验室(LUTS),EPFL)

专题命中 视频多模态 :multi-modal(title);分类 cs.AI

AI总结 本文提出一种通用多模态概率建模方法,通过替换输出层为GMM层,提升交通预测的不确定性建模能力,实验表明其在多种数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10180 2026-07-02 cs.CV 版本更新 74%

TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval

TCMA:面向无人机跨模态文本-视频检索的文本条件多粒度对齐

Zixu Zhao, Yang Zhan, Yunhao Li, Yan Li

机构 * Carnegie Mellon University(卡内基梅隆大学) The Hong Kong Polytechnic University(香港理工大学) Wuhan University(武汉大学)

专题命中 视频多模态 :cross-modal(title);分类 cs.CV

AI总结 针对无人机视频检索中数据集粗粒度、冗余标注问题,构建细粒度多样化标注数据集DVTMD,并提出文本条件多粒度对齐框架TCMA,实现全局-局部多层级对齐,在无人机文本-视频检索任务上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13679 2026-06-09 cs.HC cs.CV 版本更新 74%

Toward Scalable Co-located Practical Learning: Assisting with Computer Vision and Multimodal Analytics

迈向可扩展的协同实践学习:协助计算机视觉和多模态分析

Xinyu Li, Linxuan Zhao, Yueqiao Jin, Yuchen Liu, Jin Zhou, Roberto Martinez-Maldonado, Dragan Gasevic, Lixiang Yan

机构 * Centre for Learning Analytics at Monash(墨尔本大学学习分析中心) Monash University(墨尔本大学) Department of Civil and Environmental Engineering(土木与环境工程系) School of Education(教育学院) The University of Hong Kong(香港大学)

专题命中 视频多模态 :multimodal(title);分类 cs.CV

AI总结 本研究评估了固定摄像头管道在重复护理模拟中的效果,通过多阶段源到目标适应提升行为检测精度,并利用行为轨迹分析提升模拟 debriefing 的可检索性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12826 2026-08-12 cs.CV cs.AI 版本更新 73%

DIMOS: Disentangling Instance-level Moving Object Segmentation

DIMOS: 解耦实例级运动目标分割

Hongxiang Huang, Hongwei Ren, Xiaopeng Lin, Yulong Huang, Zeke Xie, Bojun Cheng

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出双解耦特征提取框架分离图像与事件模态的外观和运动信息,并通过多粒度跨模态对齐实现有效融合,在运动实例分割任务中尤其对快速运动和低光下的小目标取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11719 2026-07-30 cs.CV cs.AI 版本更新 73%

Ouroboros-Spatial: Closing the Data-Model Loop for Spatial Reasoning

Ouroboros-Spatial:闭环数据-模型循环的空间推理

Enhan Zhao, Wei Wu, Yuanrui Zhang, Xueliang Zhao, Di He

机构 * Peking University(北京大学) Ant International(蚂蚁国际) The University of Hong Kong(香港大学)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出Ouroboros-Spatial自演化框架,通过提议器与求解器闭环交互,动态生成与模型能力匹配的训练样本,在六个空间推理基准上以十分之一数据量显著提升Qwen3-VL性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17901 2026-06-23 cs.CV cs.MM cs.SD 版本更新 73%

Do Modern Video-LLMs Need to Listen? A Benchmark Audit and Scalable Remedy

现代视频大语言模型需要听觉吗?基准审计与可扩展补救措施

Geewook Kim, Minjoon Seo

机构 * NAVER Cloud AI(NAVER云AI) KAIST AI(韩国国立庆北大学AI)

专题命中 视频多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM

AI总结 通过审计10个视频基准发现多数任务仅凭视觉即可解决,音频未被充分利用;提出在LLaVA-OneVision上附加语音/音频编码器,采用25倍令牌压缩,实验证明音频在需要语音理解或跨模态对齐的任务上带来显著提升。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05103 2026-08-07 cs.LG math-ph math.MP physics.ao-ph physics.flu-dyn 版本更新 71%

Multimodal Spatiotemporal Atmospheric Data Assimilation with Latent Video Flow-matching

基于潜在流匹配的多模态时空大气数据同化

Dibyajyoti Chakraborty, Romit Maulik

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Purdue University(普渡大学)

专题命中 视频多模态 :multimodal(title)

AI总结 该研究提出基于潜在流匹配的多模态时空大气数据同化方法,利用ERA5再分析数据训练先验,结合后验采样同化真实观测,可完成多种DA任务,从稀疏观测生成的集合预报性能达先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30045 2026-08-14 cs.CV 版本更新 70%

DualEraser: Joint Video Object and Effect Removal via Balanced Text-Mask Guidance and Decoupled Locator-Preserver

GenEraser:通过平衡文本-掩码引导和解耦定位器-保持器实现可泛化的视频对象移除

Yuqing Chen, Lin Liu, Haisu Wu, Xiaopeng Zhang, Yaowei Wang, Yujiu Yang, Qi Tian

机构 * Tsinghua University(清华大学) Pengcheng National Laboratory(鹏城实验室) Huawei(华为) Southeast University(东南大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出GenEraser框架,通过多条件混合专家、可学习深度CFG融合机制和解耦专家架构,解决视频对象移除中目标与物理效应同时消除的泛化难题,在ROSE和VOR-Eval上分别提升2.16 dB和1.44 dB。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25266 2026-08-03 cs.CV cs.LG 版本更新 70%

FORGE: Frame Orthogonality in Relevance Geometry for Long-Form Video Understanding

FORGE:用于长视频理解的相关几何中的帧正交性

Ghazal Kaviani, Ghassan AlRegib

机构 * Georgia Institute of Technology(佐治亚理工学院) Center for Signal and Information Processing (CSIP)(信号与信息处理中心 (CSIP)) School of Electrical and Computer Engineering(电气与计算机工程学院)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 研究长视频理解中推理时最大化查询相关信息问题,提出FORGE模型无关方法,通过在预训练嵌入空间引入查询条件几何统一相关性和多样性,实验证明该方法在关键帧选择和问答上有显著提升。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11140 2026-07-30 cs.CV 版本更新 70%

Hyper-FEOD: Sparse Hypergraph-Enhanced Frame-Event Object Detection with Fine-Grained MoE

稀疏超图增强的帧事件目标检测与细粒度MoE

Wei Bao, Yuehan Wang, Tianhang Zhou, Siqi Li

机构 * BNRist, THUIBCS, BLBCI, School of Software, Tsinghua University(清华大学软件学院,北京信息科学与技术国家研究中心,清华-英特尔先进移动计算中心,北京国家信息科学与技术实验室) State Key Laboratory of Heavy Oil Processing, China University of Petroleum (Beijing)(中国石油大学(北京)重质油国家重点实验室)

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出Hyper-FEOD框架,通过稀疏超图增强交叉模态融合和细粒度MoE增强模块,实现高效的多模态交互优化,提升动态环境下目标检测的准确率与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15038 2026-07-20 cs.CV 版本更新 70%

Video = World + Event Stream

视频 = 世界 + 事件流

Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Cheng Yu, Chen Liang, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Yuxiang Bao, Yuzheng Wang, Zhiwei Lin, Zoubin Bi

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视频多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 研究提出Wan-Streamer v0.3,将视频视为世界加事件流,据此有通用预训练任务,应用于实时全双工视听交互,保留v0.2运行点,为实时下游任务提供能力。

Comments website: https://wan-streamer.com/v0.3/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22226 2026-07-14 cs.CV 版本更新 70%

Towards Temporal Compositional Reasoning in Long-Form Sports Videos

长期体育视频中的时间组成推理方法

Siyu Cao, Lu Zhang, Ruizhe Zeng, Zhi-yong Liu

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出SportsTime基准和CoTR方法,通过时间接地证据组成提升体育视频长期推理能力,优于现有多模态大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01884 2026-07-08 cs.AI 版本更新 70%

EVA-Net: Subject-Independent EEG Motor Decoding with Video-Derived Motor Priors

EVA-Net: 基于视频衍生运动先验的跨被试脑电运动解码

Ziyuan Li, Yueru Sun, Yimeng Zhang

机构 * South China University of Technology(华南理工大学)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 提出EVA-Net两阶段框架,利用动作视频作为语义先验,通过跨模态对比学习和对齐减少个体差异,实现跨被试脑电运动解码,在EEGMMI上取得8.66%的LOSO准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01958 2026-06-26 cs.CV 版本更新 70%

MAVFusion: Efficient Infrared and Visible Video Fusion via Motion-Aware Sparse Interaction

MAVFusion: 基于运动感知稀疏交互的高效红外与可见光视频融合

Xilai Li, Weijun Jiang, Xiaosong Li, Yang Liu, Hongbin Wang, Tao Ye, Huafeng Li, Haishu Tan

机构 * Foshan University(佛山大学) Kunming University of Science and Technology(昆明理工大学) China University of Mining and Technology(中国矿业大学)

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出MAVFusion端到端视频融合框架,通过运动感知稀疏交互机制,利用光流识别动态区域并分配跨模态注意力,对静态区域使用轻量弱交互模块,在保持时间一致性和细节的同时加速推理,达到14.16 FPS。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15347 2026-06-26 eess.IV cs.MM 版本更新 70%

Symmetric Entropy-Constrained Video Coding for Machines

面向机器的对称熵约束视频编码

Yuxiao Sun, Meiqin Liu, Chao Yao, Qi Tang, Jian Jin, Weisi Lin, Frederic Dufaux, Yao Zhao

专题命中 视频多模态 :MLLM(abstract,abstract_cn);分类 cs.MM

AI总结 提出SEC-VCM框架,通过双向熵约束机制对称对齐视频编解码器与视觉骨干网络,保留语义并丢弃无关信息,结合语义-像素双路径融合提升机器视觉任务性能,在多项任务上显著优于H.266/VVC。

Comments Accepted by IEEE Transactions on Image Processing. This is the author's accepted manuscript (AAM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01602 2026-06-23 cs.LG cs.AI cs.IT math.IT 版本更新 70%

Estimating Mutual Information between Time Series and Temporal Event Sequences Across Diverse Analysis Tasks

估计时间序列与时间事件序列在不同分析任务中的互信息

Haoji Hu, Huaqing Mao, Yijun Lin, Xiaowei Jia, Jinwei Zhou, Minoh Jeong, Yao-Yi Chiang

机构 * University of Minnesota - Twin Cities(明尼苏达大学-双城分校) University of Pittsburgh(匹兹堡大学) Inha University(Inha大学)

专题命中 视频多模态 :multimodal(abstract,abstract_cn);分类 cs.AI

AI总结 提出一种非参数互信息估计器,直接度量连续时间序列与离散事件序列之间的依赖关系,无需数据转换或离散化,通过处理量化伪影和事件冗余实现鲁棒统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19161 2026-08-21 cs.RO 版本更新 67%

HT-Bench: Benchmarking and Learning Dexterous Full-Hand Tactile Representations with Egocentric Vision

HT-Bench:基于自我中心视觉的灵巧全手触觉表示基准与学习

Yuzhe Huang, Jiaping Wu, Jiaming Jiang, Hezhe Lin, Aikebaier Aierken, Yunlong Wang, Kun Cheng, Wanlin Li, Chenxi Xiao, Ziyuan Jiao, Yuanxin Zhong

机构 * Beihang University(北航) Rimbot BUPT(北邮) ShanghaiTech University(上海科技大学) Tsinghua University(清华大学) CAS(中国科学院)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract)

AI总结 提出HT-Bench多任务基准和HandTouch编码器,通过大规模自我中心视觉与全手触觉数据,在触觉相似性检索、掩码修复、视觉到触觉合成等任务上验证了触觉表示的有效性。

Comments 9pages, 4figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09874 2026-08-20 cs.CV cs.AI cs.CL 版本更新 67%

EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding

EgoMemReason:一种基于记忆的推理基准,用于长时间的以自身为中心的视频理解

Ziyang Wang, Yue Zhang, Shoubin Yu, Ce Zhang, Zengqi Zhao, Jaehong Yoon, Hyunji Lee, Gedas Bertasius, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) NTU Singapore(新加坡国立大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 EgoMemReason通过记忆驱动推理评估一周的自身中心视频理解,包含500个问题和六个核心挑战,揭示长时间记忆仍面临挑战。

Comments Accepted by COLM2026. The first two authors contributed equally. Project website: https://egomemreason.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13606 2026-08-18 cs.AI cs.CL cs.LG cs.MA cs.MM 版本更新 67%

MobileMem: Learning from a Year of Mobile Experiences

MobileMem:从一年的移动体验中学习

Xinle Deng, Yida Xue, Xiangyuan Ru, Yijun Chen, Buqiang Xu, Mingjun Mao, Xinjie Liu, Haoming Xu, Shuofei Qiao, Mengru Wang, Chen Jiang, Yuchen Eleanor Jiang, Lizhong Wang, Jason Wang, Li Zeng, Haofen Wang, Guilin Qi, Huajun Chen, Ningyu Zhang

机构 * OPPO OpenKG

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 该研究推出MobileMem基准与框架,基于一年移动体验构建,用于设备端长期记忆研究,支持多类推理,推动智能体从信息检索向体验智能发展。

Comments Technical Report; Project Page: http://mobilemem.openkg.cn/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03753 2026-07-28 cs.HC 版本更新 67%

VisTR: Visualizations as Representations for Time-series Table Reasoning

VisTR:将可视化作为时间序列表推理的表示

Jianing Hao, Zhuowen Liang, Chunting Li, Yuyu Luo, Jie Li, Wei Zeng

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract)

AI总结 针对时间序列表推理难题,VisTR框架以可视化核心,利用其连接数据与认知,通过多模态大语言模型对齐输入,集成机制处理大数据,实现交互式可视化,经评估和案例验证了其在时间序列推理任务中的有效性和适用性。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23620 2026-07-16 cs.RO 版本更新 67%

Move-Then-Operate: Behavioral Phasing for Human-Like Robotic Manipulation

移动-然后-操作:用于类人机器人操作的行为相位

Haoming Xu, Lei Lei, Jie Gu, Chu Tang, Jingmin Chen, Ruiqi Wang

机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences, Hangzhou, China.(杭州高等研究院,中国科学院大学,中国杭州) University of Science and Technology of China, Hefei, China.(中国科学技术大学,中国合肥) School of Aritificial intelligence, Institute of Artificial Intelligence, University of Science and Technology Beijing, Beijing, China(人工智能学院,人工智能研究院,北京科技大学,中国北京)

专题命中 视频多模态 :MLLM(abstract,abstract_cn)

AI总结 本文提出Move-Then-Operate框架,将机器人操作分为粗略移动和接触关键交互两个阶段,通过双专家策略提升操作精度与效率。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23024 2026-07-14 cs.RO 版本更新 67%

InCoM: Intent-Driven Perception and Structured Coordination for Mobile Manipulation

InCoM:基于意图的感知与结构化协调用于移动操作

Jiahao Liu, Cui Wenbo, Zhongpu Xia, Yongliang Wang, Haoran Li, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) AnyverseDynamics

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract)

AI总结 InCoM通过意图驱动的感知和结构化协调框架,解决移动操作中基座与机械臂动作耦合及感知注意力分配问题,提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03834 2026-07-09 cs.RO 版本更新 67%

Let the Dynamics Flow: Stable Flow Matching Dynamical Systems

让动力学流动:稳定的流匹配动力系统

Rodrigo Pérez-Dattari, Francisco Leiva, Andrea Testa, Leonel Rozo, Javier Ruiz del Solar, Noémie Jaquier

机构 * Department of Robotics, Perception, and Learning, KTH Royal Institute of Technology(机器人、感知与学习系,皇家理工学院) Advanced Mining Technology Center (AMTC) and Department of Electrical Engineering, Universidad de Chile(先进采矿技术中心(AMTC)和电气工程系,智利大学) Bosch Center for Artificial Intelligence, Renningen, Germany(博世人工智能中心,德国Renningen) Italian Institute of Artificial Intelligence (AI4I), Turin, Italy(意大利人工智能研究所(AI4I),意大利都灵)

专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract)

AI总结 提出稳定流匹配动力系统(SFMDS)框架,通过流匹配参数化动力系统并施加李雅普诺夫稳定性约束,实现稳定、可扩展、多模态的机器人运动生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16863 2026-06-25 cs.CV cs.AI cs.CL 版本更新 67%

Position: Reasoning After Perception Means Reasoning Without Vision

立场:感知之后推理意味着无视觉推理

Hongcheng Gao, Zihao Huang, Jingyi Tang, Lin Xu, Xinhao Li, Haoyang Li, Yue Liu, Minhua Lin, Xinlong Yang, Taihang Hu, Ge Wu, Balong Bi, Hongyu Chen, Olive Huang, Wentao Zhang

机构 * Tsinghua University(清华大学) Peking University(北京大学) National University of Singapore(新加坡国立大学) Zhongguancun Academy(中关村学院) Nanjing University(南京大学) Nankai University(南开大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文质疑多模态研究中语言推理能弥补视觉缺陷的假设,提出“感知-推理”范式导致视觉推理退化为文本空间推理,并通过图灵眼测试验证文本推理无法修复感知失败,主张转向感知内的推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12313 2026-08-19 cs.CV cs.CL 版本更新 62%

AVA-Encoder: Towards Agent-Native Video Representation Learning

AVA-Encoder:面向智能体原生的视频表示学习

Chuyue Li, Jinpeng Yu, Haozhe Wang, Tian Xueyun, Zhijing Zhang, Bingnan Li, Shuqi Gu, Kan Ren, Jiaming Liu, Ruihua Huang

机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问业务部) ShanghaiTech University(上海科技大学) The Hong Kong University of Science and Technology(香港科技大学) Institute of Computing Technology(中国科学院计算技术研究所) Southeast University(东南大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 针对创意智能体缺乏从高质量电影学习的有效方式的问题,提出AVA-Encoder框架,其视频表示经重构优化后,在相关基准上性能优于现有方法,还发布了配套框架、基准及数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08974 2026-08-18 cs.CV cs.AI 版本更新 62%

Tracking the Truth: Object-Centric Spatio-Temporal Monitoring for Video Large Language Models

追踪真相:面向视频大语言模型的物体感知时空监控

Tri Cao, Khoi Le, Thong Nguyen, Cong-Duy Nguyen, Quynh Vo, Anh Tuan Luu, Chunyan Miao, See-Kiong Ng, Shuicheng Yan, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学) VinUniversity(文大学) Nanyang Technological University(南洋理工大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出STEMO-Bench基准测试,通过分解查询验证时空监控能力,改进视频大语言模型的时空推理一致性。

Comments The authors are withdrawing this manuscript due to errors identified in the experimental evaluation and result aggregation, which affect several reported quantitative results and some conclusions. These issues require substantial re-evaluation of the experiments and analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11399 2026-08-18 cs.CV cs.CL 版本更新 62%

Lost in Adaptation: Layer-Selective Recovery of Temporal Reasoning in Video-Language Models

层次间推理:通过层选择性融合恢复视频-语言模型中的时间推理

Zihang Fu, Haonan Wang, Jian Kang, Kenji Kawaguchi, Jiaying Wu

机构 * National University of Singapore(新加坡国立大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出MERIT框架,通过层选择性融合提升视频-语言模型的时间推理能力,同时保持时间感知能力,优于全模型融合和随机层选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01353 2026-08-11 cs.AI cs.CV cs.LG 版本更新 62%

EgoBrain: Synergizing Minds and Eyes For Human Action Understanding

EgoBrain:协同心智与视觉以实现人类行为理解

Nie Lin, Yansen Wang, Dongqi Han, Weibang Jiang, Jingyuan Li, Ryosuke Furuta, Yoichi Sato, Dongsheng Li

机构 * The University of Tokyo(东京大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究人员构建了全球首个同步脑电与第一人称视觉的大规模多模态数据集EgoBrain,开发多模态学习框架实现行为理解,跨参与者与环境验证达66.70%准确率,为脑机接口研究提供新范式。

Comments Accepted to ICLR 2026. Camera-ready version. Project page: https://lin-nie.github.io/EgoBrain/

详情

展开后加载摘要…

URL PDF HTML 收藏