arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4735 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4735 篇

1511.02492 2015-11-10 cs.CV cs.MM 62%

VideoStory Embeddings Recognize Events when Examples are Scarce

Amirhossein Habibian, Thomas Mensink, Cees G. M. Snoek

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
1308.3225 2013-12-30 cs.MM cs.CV cs.IR 62%

An interactive engine for multilingual video browsing using semantic content

M. Ben Halima, M. Hamroun, S. Ben Moussa, A. M. Alimi

专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV、cs.MM

Comments 4 pages, IGS 2013 Conference; IGS 2013

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04670 2025-11-07 cs.CV 61%

Cambrian-S: Towards Spatial Supersensing in Video

Shusheng Yang, Jihan Yang, Pinzhi Huang, Ellis Brown, Zihao Yang, Yue Yu, Shengbang Tong, Zihan Zheng, Yifan Xu, Muhan Wang, Daohan Lu, Rob Fergus, Yann LeCun, Li Fei-Fei, Saining Xie

机构 * New York University(纽约大学) Stanford University(斯坦福大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV;MLLM(comments)

Comments Website: https://cambrian-mllm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19773 2023-10-31 cs.CV 61%

MM-VID: Advancing Video Understanding with GPT-4V(ision)

Kevin Lin, Faisal Ahmed, Linjie Li, Chung-Ching Lin, Ehsan Azarnasab, Zhengyuan Yang, Jianfeng Wang, Lin Liang, Zicheng Liu, Yumao Lu, Ce Liu, Lijuan Wang

专题命中 视频多模态 :multimodal(abstract,comments);分类 cs.CV

Comments Project page at https://multimodal-vid.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.02082 2023-04-12 cs.CV 61%

Towards Fast Adaptation of Pretrained Contrastive Models for Multi-channel Video-Language Retrieval

Xudong Lin, Simran Tiwari, Shiyuan Huang, Manling Li, Mike Zheng Shou, Heng Ji, Shih-Fu Chang

专题命中 视频多模态 :multimodal(abstract,comments);分类 cs.CV

Comments To appear in CVPR 2023; The code will be released at https://github.com/XudongLinthu/upgradable-multimodal-intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20814 2026-08-24 cs.CV 新提交 57%

Enhancing Localized Reasoning for Long Video Understanding via Efficient Segment-to-Video Supervision

通过高效的段级到视频级监督增强长视频理解的局部推理能力

Beibei Zhang, Chao Xu, Jun Lan, Zongyi Li, Lai Wei, Huijia Zhu, Tongwei Ren

机构 * Ant Group(蚂蚁集团)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对长视频理解中MLLMs易受干扰噪声影响的问题,提出S2V方法,通过段级VQA训练模型,提升了LVU性能与训练推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20802 2026-08-24 cs.AI 新提交 57%

SPARC: Single-Pass Scaling for Motion Forecasting with Conformal Bayesian Last Layers

SPARC:采用保形贝叶斯最后层的运动预测单通缩放方法

Sakif Hossain, Julian Teusch, Jörg P. Müller

机构 * Clausthal University of Technology (TU Clausthal)(克劳斯塔尔工业大学(克劳斯塔尔工业大学))

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出SPARC,一种贝叶斯-保形不确定性层,在9个数据集-协议模块上的NLL及MPJPE+NLL综合指标优于基线,可作为轻量风险监控工具。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20376 2026-08-24 cs.CL cs.LG 新提交 57%

TH-GNN: Heterogeneous Temporal Graph Neural Networks for LLM-Agent Shilling Attack Detection

TH-GNN:用于检测大语言模型智能体刷单攻击的异质性时序图神经网络

Shivam Swarup, Divya Prakash Shrivastava, Rakesh Thakur

机构 * JAIN (Deemed to be University)(JAIN(被认定大学)) Zayed University(扎耶德大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CL

AI总结 本文提出TH-GNN,一种异质性时序图神经网络,联合建模时序、结构与语义信号,在5类攻击族和4个基准数据集上检测LLM智能体刷单攻击,总体平均F1值达0.870,性能优于纯文本基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11354 2026-08-24 cs.AI 版本更新 57%

Inverse Theory of Mind Modeling for Content Recommendation: From Web Browsing to Dynamic Intelligent Interfaces

用于内容推荐的反向心智理论建模:从网页浏览到动态智能界面

Mengyu Chen, Feiyu Lu, Chun-Fu Chen, Lucas Vinh Tran, Jay Katukuri

机构 * JPMorganChase(摩根大通)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.AI

AI总结 本研究提出反向心智理论(IToM)流程,从用户交互反向推理推断信念与偏好,在OPeRA数据集上验证其画像推断效果,并通过VisionOS应用展示跨模态迁移能力,提升内容推荐的用户理解精度。

Comments Preprint for conference full paper at 20th ACM Conference on Recommender Systems (RecSys '26), Minneapolis, MN, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20127 2026-08-21 cs.CV 新提交 57%

ID-VTG: Image-Disambiguated Video Temporal Grounding

ID-VTG:基于图像消歧的视频时间定位

Minghang Zheng, Jingli Wei, Hongyi Yang, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对视频时间定位中视觉相似实体的消歧难题,本文提出ID-VTG任务与VGD-Agg框架,构建两个基准数据集,实现了该任务的当前最优性能。

Comments ACM-MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11322 2026-08-21 cs.HC cs.AI 版本更新 57%

Socioduality: A Relational Process Framework for Human-AI Interaction

社会对偶性:用于人机交互的关系过程框架

Mehmed Zahid Çögenli

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出社会对偶性这一关系过程框架,通过嵌套单元定义人机交互过程,经实验验证其可用于分析人机交互中贡献的形成及路径信息。

Comments 50 pages, 4 figures, 12 tables. Revised version adds a Supplementary Exploratory Analysis comparing Sociodual pathways with blind developmental/task-process segmentation, with granularity and record-format checks and an unseen-case extension. Main construct specification unchanged; minor editorial and terminology refinements

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07932 2026-08-21 cs.CV 版本更新 57%

SportsGrounder: Proposal-Aided Interleaved Grounding for Dense Sports Video Reasoning

SportsGrounder:用于密集体育视频推理的提案辅助交错定位框架

Yizhi Li, Jiawei Jiang, Guanhong Wang, Yingcai Wu, Gaoang Wang

机构 * Zhejiang University(浙江大学) Beijing Jiaotong University(北京交通大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对LMMs难以处理密集体育视频细粒度推理的问题,提出SportsGrounder框架,结合IGF机制与AAS模块,在SoccerNet等数据集上实现最优准确率。

Comments ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09261 2026-08-21 cs.CV 版本更新 57%

Self-supervised Learning Matters: A Simple Ensemble Solution for Micro-Gesture Recognition

自监督学习至关重要:一种用于微手势识别的简单集成方案

Tingyi Liu, Kun Li, Fei Wang, Junjie Chen, Zhiliang Wu, Jihao Gu, Haixu Liu, Dan Guo

机构 * Hefei University of Technology(合肥工业大学) United Arab Emirates University(阿拉伯联合酋长国大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) Anhui Evolution Technology Co., Ltd.(安徽进化科技有限公司) Nanyang Technological University(南洋理工大学) University College London(伦敦大学学院) The University of Sydney(悉尼大学) Beijing QBoson Quantum Technology Co., Ltd.(北京量子芯科技有限公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出一种集成自监督RGB模型与监督多流模型的框架,在MiGA挑战赛微手势分类赛道取得第一名,通过自监督预训练提升性能,在iMiGUE测试集上达到74.419%的top-1准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24856 2026-08-21 cs.LG cs.AI 版本更新 57%

The Concept Allocation Zone: Tracking How Concepts Form Across Transformer Depth

概念分配区:追踪概念如何跨越Transformer深度形成

James Henry

机构 * Independent Researcher(独立研究者)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出概念分配区(CAZ)框架,通过层间度量(分离度、概念一致性、概念速度)检测概念在残差流中逐渐形成的深度区间,并在34个模型上验证了分离曲线的多模态性及温和CAZ的因果活性。

Comments v2: substantial revision. Cross-architecture ordering statistic and MHA/GQA cohort-split claim retracted per recomputation; corpus and companion-paper citations refreshed. See paper's "Changes from Version 1" section for the full list of superseded values

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17013 2026-08-19 cs.CV 版本更新 57%

Toward Universal Skeleton-Based Action Recognition across Heterogeneous Skeletons and Open Vocabularies

迈向通用的基于骨骼的动作识别

Jidong Kuang, Hongsong Wang, Jie Gui, Yuan Yan Tang, James Tin-Yau Kwok

机构 * School of Cyber Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院,南京,中国) School of Computer Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院,南京,中国)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出了一种基于Transformer的模型,通过统一骨骼表示、动作编码器和多粒度动作-文本对齐,解决异构骨骼动作识别的挑战,实验验证了方法的有效性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01460 2026-08-19 cs.CV 版本更新 57%

Reinforcing Consistency in Video MLLMs with Structured Rewards

通过结构化奖励强化视频MLLMs的一致性

Yihao Quan, Zeru Shi, Jinman Zhao, Ruixiang Tang

机构 * Rutgers University(罗格斯大学) University of Toronto(多伦多大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究通过结构化奖励提升视频MLLMs的一致性,发现传统监督不足,提出结合事实和时间单元的奖励机制,提升视频理解准确性。

Comments Accepted by COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16332 2026-08-18 cs.CV 新提交 57%

Unlocking Motion in Expressions: Temporal Calibration for Referring Video Object Segmentation

解锁表达中的运动:用于指称视频目标分割的时间校准

Yiwen Jiang, Zhengtong Zhu, Ruixin Zhang, Jiaqing Fan

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 针对指称视频目标分割中运动语义依赖未显式建模的问题,提出EMC框架,通过MSP、MIC、STSC模块校准运动线索,在6个基准上验证了方法的优越性。

Comments Accept by ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15708 2026-08-18 cs.CV 新提交 57%

What You Ask is What You Ground: Bridging Question Intent to Temporal Evidence for Grounded VideoQA

你所问即你所定位:连接问题意图与时序证据以实现定位视频问答

Jinhwan Seo, Kyubeom Han, Jumin Lee, Junhyug Noh, Sung-eui Yoon

机构 * KAIST(韩国科学技术院) Ewha Womans University(梨花女子大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 针对定位视频问答中问题不变定位的失效模式,提出GroundFormer模型,通过可学习通信令牌、因子化MIL交叉注意力等技术,在NExT-GQA和STAR数据集上实现最优性能,提升时序定位的问题区分性。

Comments Accepted at ECCV2026. Code: https://github.com/jinhseo/GroundFormer. Project page: https://jinhseo.github.io/groundformer/groundformer.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15437 2026-08-18 cs.RO cs.CV cs.DC cs.SY eess.SY 新提交 57%

MM-BEV: Enhancing Timeliness by Computing Where and When it Matters

MM-BEV:通过计算关键的位置与时刻提升时效性

Liangkai Liu, Kang G. Shin

机构 * Texas Tech University(德克萨斯理工大学) University of Michigan(密歇根大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 MM-BEV是一种遵循「计算关键位置与时刻」的实时多模态BEV系统,通过四种机制优化,在nuScenes数据集和Clearpath Husky A300平台上显著降低延迟,且性能损失极小。

Comments 12 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15261 2026-08-18 cs.CV 新提交 57%

Boundary-Aligned Contribution Routing for Robust Optical--SAR Object Detection

用于稳健光学-SAR目标检测的边界对齐贡献路由

Haifa Zhang, Yijing Wang, Haoyu Wang, Zheng Li, Zhiqiang Zuo

机构 * Tianjin University(天津大学) School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 该研究针对光学-SAR融合目标检测中的负跨模态迁移问题,提出边界对齐贡献路由方法,在M4-SAR和SpaceNet6-OTD实验中提升了检测性能并降低了负迁移率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15230 2026-08-18 cs.CV 新提交 57%

PersonaDrive: Controllable Trajectory Prediction with Multi-Dimensional Driving Personas

PersonaDrive:基于多维驾驶 personas 的可控轨迹预测

Chan Lee, Kimin Yun, Yuseok Bae, Seong Tae Kim, Jung Uk Kim

机构 * Kyung Hee University(庆熙大学) ETRI(韩国电子通信研究院)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 针对现有轨迹预测方法可控性不足的问题,提出 PCT 数据集与 PersonaDrive 框架,通过多轴设计实现可控轨迹生成,性能优于基线。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15085 2026-08-18 cs.CL 新提交 57%

Why Vision Fails as a Universal Bridge: Rectifying Modality Asynchrony in Multilingual MLLMs

为何视觉无法作为通用桥梁:修正多语言多模态大语言模型(MLLMs)中的模态异步性

Yihang Du, Juhao Liang, Zhengzhao Lai, Siyu Li, Yan Hu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) National Health Data Institute (Shenzhen)(国家健康数据研究院(深圳))

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 针对多语言MLLMs在非英语视觉推理中的性能下降问题,该研究发现其源于“幽灵锚点”模态异步性,提出ANCHOR训练框架,经实验验证可提升跨语言视觉推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15058 2026-08-18 cs.CV 新提交 57%

MEDR: Query-Independent Frame Selection via Multi-Signal Event Modeling and Dynamic Rescoring

MEDR:基于多信号事件建模与动态重评分的查询无关帧选择

Xinlei Pu, Weijie Shi, Wen Yang, Yi Cao, Hao Chen, Yuanjun Liu, Wenwei Ding, Jia Zhu, Jiajie Xu

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 该研究提出无需训练的MEDR帧选择方法,通过多信号事件建模与动态重评分实现查询无关,在Video-MME等基准上提升了多模态大语言模型的长视频处理准确率,且帧集可跨问题复用。

Comments 9 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14740 2026-08-18 cs.CV 新提交 57%

From Dense Prediction to Visual Editing: Structured Supervision for Unified Image and Video Creation

从密集预测到视觉编辑:用于统一图像与视频创作的结构化监督

Zhefan Rao, Bin Zou, Haoxuan Che, Xuanhua He, Chong Hou Choi, Yanheng Li, Rui Liu, Qifeng Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) Celia Research HK City University of Hong Kong(香港城市大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 该研究提出基于深度与表面法向量预测的结构化视觉监督框架,共享MMDiT主干实现统一图像视频创作,提升了相关基准任务分数,证明密集监督对下游创作的结构知识迁移价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08705 2026-08-17 cs.CV 版本更新 57%

HumanForge: A Human-Centric Deepfake Video Benchmark with Multi-Agent Forgery Rationales

HumanForge:一个具有多智能体伪造原理的以人类为中心的深度伪造视频基准

Wenbo Xu, Zhimin Chen, Xiaojie Liang, Hengrui Liu, Ziqi Sheng, Wei Lu

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对视频伪造给数字内容取证带来的挑战,引入HumanForge数据集,提出基于LangGraph的Gen2Anno多智能体管道构建并注释数据集,经测试展现了零样本泛化和细粒度推理的重大挑战,代码和数据集将公开。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06201 2026-08-17 cs.CV 版本更新 57%

Point-Supervised Skeleton-Based Human Action Segmentation

基于点监督的骨架人类动作分割

Hongsong Wang, Yiqin Shen, Pengbo Yan, Jie Gui, Yang Zhang

机构 * Southeast University(东南大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种点监督框架,通过多模态骨架数据和新型原型相似性方法,实现了高效的基于骨架的人类动作分割,减少了注释工作量并提升了性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13102 2026-08-14 cs.CV 新提交 57%

RbFT-Net: Rectify-Before-Fuse Temporal Radar Anchors for 4D Radar-Camera Depth Completion

RbFT-Net:用于4D雷达-相机深度补全的融合前校正时间雷达锚点

Wentao Zhao, Shouxuan Wu, Yongtao Cen, Tianchen Deng, Yuyang Zhang, Jingchuan Wang

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出RbFT-Net框架,通过图像条件校正模块校正雷达锚点并选择性传播,解决雷达测量的稀疏与干扰问题,在相关数据集上的深度补全性能优于对比方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10915 2026-08-13 cs.AI 版本更新 57%

ComBodied Agents: a New Paradigm of Human-Centric Agentic AI

具身融合智能体:以人为中心的智能体人工智能新范式

Qianggang Ding, Xingyao Wang, Rui Feng, Zhibin Wang, Feixiang Yao, Kelong Mao, Hao Sun, Zhiyao Luo, Jiankai Tang, Lei Li, Jiadong Guo, Minheng Ni, Weicong Lin, Chenxi Yang, Hongxiang Gao, Zhenghua Chen, Yang Bai, Min Wu, Jun Cheng, Huazhu Fu, Dacheng Tao, Bang Liu

机构 * Université de Montréal(蒙特利尔大学) Mila – Quebec Artificial Intelligence Institute(米拉-魁北克人工智能研究所) Institute of Advanced Intelligence and Computing (IAIC), A*STAR(新加坡科技研究局高级智能与计算研究所) Nanjing Medical University(南京医科大学) Nanjing University(南京大学) Renmin University of China(中国人民大学) University of Cambridge(剑桥大学) University of Oxford(牛津大学) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong Polytechnic University(香港理工大学) Southern University of Science and Technology(南方科技大学) Southeast University(东南大学) University of Glasgow(格拉斯哥大学) Nanyang Technological University(南洋理工大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 该研究提出以人为中心的 Combodied Agents 新范式,整合多类智能体能力形成闭环,聚焦人类状态轨迹建模,推动智能体 AI 从任务完成转向人类持续福祉。

Comments 38 pages, 6 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07037 2026-08-13 hep-ex cs.CV 版本更新 57%

Towards foundation-style models for energy-frontier heterogeneous neutrino detectors via self-supervised pre-training

迈向能量前沿异质中微子探测器的风格化模型:通过自监督预训练

Saúl Alonso-Monsalve, Fabio Cufino, Umut Kose, Anna Mascellani, André Rubbia

机构 * IPA, ETH Zürich(瑞士苏黎世联邦理工学院IPA研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种稀疏ViT框架,通过自监督预训练学习异质探测器数据的可重用表示,提升中微子风味和charm夸克识别、动量回归和顶点重建性能。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11142 2026-08-12 cs.CV 新提交 57%

SAR2Agri: Learning SAR Intensity Representations for Agricultural Monitoring

SAR2Agri:学习SAR强度表征用于农业监测

Moti Rattan Gupta, Anupam Sobti

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本研究提出首个仅用SAR强度影像的自监督学习流水线,通过改进时间预文本任务提升物候特征捕捉能力,在SICKLE基准上的作物类型制图任务中,其IoU较光学基线和现有SAR基线均有显著提升,验证了SAR强度编码器预训练的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏