arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-03 至 2026-02-03 共收录 18 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 18 篇

2602.00209 2026-02-03 cs.MM 88%

Divide and Conquer: Multimodal Video Deepfake Detection via Cross-Modal Fusion and Localization

分而治之:通过跨模态融合与定位实现多模态视频深度伪造检测

Qingcao Li, Miao He, Liang Yi, Qing Wen, Yitao Zhang, Hongshuo Jin, Peng Cheng, Zhongjie Ba, Li Lu, Kui Ren

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(title);audio-visual(abstract);分类 cs.MM

AI总结 本文提出一种通过跨模态融合与定位实现多模态视频深度伪造检测的系统,通过音频和视觉模块的融合提升检测鲁棒性。

Comments The 3rd Place, IJCAI 2025 Workshop on Deepfake Detection, Localization, and Interpretability

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02002 2026-02-03 cs.CV 83%

UniDriveDreamer: A Single-Stage Multimodal World Model for Autonomous Driving

UniDriveDreamer: 一种用于自动驾驶的单阶段多模态世界模型

Guosheng Zhao, Yaozeng Wang, Xiaofeng Wang, Zheng Zhu, Tingdong Yu, Guan Huang, Yongchen Zai, Ji Jiao, Changliang Xue, Xiaole Wang, Zhen Yang, Futang Zhu, Xingang Wang

机构 * GigaAI CASIA BYD

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 UniDriveDreamer是一种用于自动驾驶的单阶段多模态世界模型,通过统一的多模态生成方法提升视频和激光雷达数据合成的性能。

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00504 2026-02-03 cs.CV 83%

RGBX-R1: Visual Modality Chain-of-Thought Guided Reinforcement Learning for Multimodal Grounding

RGBX-R1: 多视觉模态链式推理引导的多模态接地强化学习

Jiahe Wu, Bing Cao, Qilong Wang, Qinghua Hu, Dongdong Li, Pengfei Zhu

机构 * School of Artificial Intelligence, Tianjin University(天津大学人工智能学院) Low-Altitude Intelligence Lab, Xiong’an National Innovation Center(雄安国家创新中心低空智能实验室) Xiong’an Guochuang Lantian Technology Co., Ltd.(雄安国创莲田科技有限公司) College of Electronic Science and Technology, National University of Defense Technology(国防科技大学电子科学学院)

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 RGBX-R1通过视觉模态链式推理引导的强化学习提升多模态接地能力,首次构建RGBX-接地基准并在多个任务中取得显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00559 2026-02-03 cs.CV cs.AI 81%

Learning to Decode Against Compositional Hallucination in Video Multimodal Large Language Models

在视频多模态大语言模型中学习对抗组合性幻觉

Wenbin Xing, Quanxing Zha, Lizheng Zu, Mengran Li, Ming Li, Junchi Yan

机构 * Sun Yat-sen University(中山大学) Huaqiao University(华侨大学) Shenzhen University(深圳大学) Guangming Laboratory(光明实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对视频多模态大语言模型中的组合性幻觉问题,提出TriCD框架,通过对比解码和三路径校准机制提升模型在对抗幻觉时的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01125 2026-02-03 cs.CL cs.LG 79%

Long-range Modeling and Processing of Multimodal Event Sequences

多模态事件序列的长程建模与处理

Jichu Li, Yilun Zhong, Zhiting Li, Feng Zhou, Quyu Kong

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出了一种基于LLM的多模态时间点过程框架,通过自适应序列压缩解决长上下文问题,提升多模态事件序列的建模与生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21915 2026-02-03 cs.CV 79%

VideoAesBench: Benchmarking the Video Aesthetics Perception Capabilities of Large Multimodal Models

VideoAesBench: 大规模多模态模型视频审美感知能力评估基准

Yunhao Li, Sijing Wu, Zhilin Gao, Zicheng Zhang, Qi Jia, Huiyu Duan, Xiongkuo Min, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 VideoAesBench通过多样化视频内容和多类型问题评估大规模多模态模型的视频审美感知能力,揭示当前模型在该领域的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00132 2026-02-03 cs.CV 74%

Shedding the Facades, Connecting the Domains: Detecting Shifting Multimodal Hate Video with Test-Time Adaptation

去除伪装,连接领域:通过测试时适应检测转移多模态仇恨视频

Jiao Li, Jian Lang, Xikai Tang, Wenzheng Shu, Ting Zhong, Qiang Gao, Yong Wang, Leiting Chen, Fan Zhou

专题命中 视频多模态 :multimodal(title);分类 cs.CV

AI总结 SCANNER通过测试时适应框架,利用仇恨内容中稳定的内核连接源与目标领域,有效应对多模态仇恨视频检测中的语义漂移问题。

Comments Accepted by AAAI2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18561 2026-02-03 cs.CV 70%

CoT-RVS: Zero-Shot Chain-of-Thought Reasoning Segmentation for Videos

CoT-RVS:零样本链式推理视频对象分割

Shiu-hong Kao, Yu-Wing Tai, Chi-Keung Tang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) Dartmouth College(达特茅斯学院)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 CoT-RVS通过零样本链式推理能力,实现了对视频对象的高效分割,无需训练即可处理复杂查询和在线视频流。

Comments Accepted to ICLR 2026. Project page: https://danielshkao.github.io/cot-rvs.html. Code: https://github.com/DanielSHKao/CoT-RVS

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01257 2026-02-03 cs.CV 70%

Boosting Point-supervised Temporal Action Localization via Text Refinement and Alignment

通过文本细化与对齐提升点监督时间动作定位

Yunchuan Ma, Laiyun Qing, Guorong Li, Yuqing Liu, Yuankai Qi, Qingming Huang

机构 * University of Chinese Academy of Science, Beijing,100190, China(中国科学院大学,北京) Macquarie University(麦考瑞大学)

专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

AI总结 本文提出TRA框架,通过文本细化与对齐提升点监督时间动作定位的精度和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01004 2026-02-03 cs.CV 70%

SRVAU-R1: Enhancing Video Anomaly Understanding via Reflection-Aware Learning

SRVAU-R1: 通过反射感知学习增强视频异常理解

Zihao Zhao, Shengting Cao, Muchao Ye

机构 * The University of Iowa(艾奥瓦大学) Knox College(克诺克斯学院)

专题命中 视频多模态 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

AI总结 SRVAU-R1通过引入反射感知学习框架,提升视频异常理解的推理能力和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01683 2026-02-03 cs.CV cs.AI 62%

FreshMem: Brain-Inspired Frequency-Space Hybrid Memory for Streaming Video Understanding

FreshMem: 基于大脑的频率-空间混合内存用于流视频理解

Kangcong Li, Peng Ye, Lin Zhang, Chao Wang, Huafeng Qin, Tao Chen

机构 * College of Future Information Technology, Fudan University, Shanghai, China(复旦大学未来信息科技学院) Shanghai Innovation Institute, Shanghai, China(上海创新研究院) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) The Chinese University of Hong Kong, Hong Kong, China(香港中文大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 FreshMem通过频率-空间混合内存网络,提升流视频理解的连续感知能力,实现短期保真与长期一致性的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04282 2026-02-03 cs.CV cs.LG 57%

Inference-time Stochastic Refinement of GRU-Normalizing Flow for Real-time Video Motion Transfer

推理时GRU归一化流的随机细化用于实时视频运动转移

Tasmiah Haque, Srinjoy Das

机构 * Department of Industrial and Management Systems Engineering(工业与管理系统工程系) School of Mathematical and Data Sciences(数学与数据科学学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种在推理时结合随机采样和GRU-NF的改进方法,以提升实时视频运动转移中未来预测的多样性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06051 2026-02-03 cs.CV 57%

VQAThinker: Exploring Generalizable and Explainable Video Quality Assessment via Reinforcement Learning

VQAThinker: 通过强化学习探索通用且可解释的视频质量评估

Linhan Cao, Wei Sun, Weixia Zhang, Xiangyang Zhu, Jun Jia, Kaiwei Zhang, Dandan Zhu, Guangtao Zhai, Xiongkuo Min

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 VQAThinker通过强化学习方法,结合大模型和规则引导算法,提升视频质量评估的泛化能力和可解释性。

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00536 2026-02-03 cs.CV 57%

SADER: Structure-Aware Diffusion Framework with DEterministic Resampling for Multi-Temporal Remote Sensing Cloud Removal

SADER:一种结构感知扩散框架,用于多时相遥感云去除

Yifan Zhang, Qian Chen, Yi Liu, Wengen Li, Jihong Guan

机构 * College of Literature, Science, and the Arts, University of Michigan(文学、科学与艺术学院,密歇根大学) School of Computer Science and Technology, Tongji University(计算机科学与技术学院,同济大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 SADER通过结构感知扩散框架,结合时间融合和混合注意力机制,有效解决多时相遥感云去除问题,提升云去除效果和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00440 2026-02-03 cs.CV cs.LG cs.RO 57%

DISK: Dynamic Inference SKipping for World Models

DISK:用于世界模型的动态推理跳过

Anugunj Naman, Gaibo Zhang, Ayushman Singh, Yaguang Zhang

机构 * Purdue University, West Lafayette, United States(普渡大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 DISK通过动态推理跳过技术,在无需训练的情况下提升自回归世界模型的视频和轨迹预测效率,同时保持预测精度和视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02396 2026-02-03 cs.RO cs.LG 50%

PRISM: Performer RS-IMLE for Single-pass Multisensory Imitation Learning

PRISM:基于单次传递的RS-IMLE单次传递多感官模仿学习

Amisha Bhaskar, Pratap Tokekar, Stefano Di Cairano, Alexander Schperberg

专题命中 视频多模态 :multimodal(abstract)

AI总结 PRISM通过单次传递的RS-IMLE方法,实现高效的多感官模仿学习,优于扩散策略,提升成功率并减少轨迹 jerk。

Comments 10 pages main text and 4 figures, and 11 pages appendix and 10 figures, total 21 pages and 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02086 2026-02-03 eess.SP cs.HC 50%

Neurophysiological effects of museum modalities on emotional engagement with real artworks

博物馆模态对真实艺术品情感参与的神经生理效应

Chen Feng, Sébastien Lugan, Karine Lasaracina, Midori Sugaya, Benoît Macq

专题命中 视频多模态 :multimodal(abstract)

AI总结 本研究通过EEG分析发现,不同数字解释性内容模态对艺术欣赏的情感参与产生不同影响,为博物馆优化解释媒体提供了新方向。

Comments 7 pages, 4 figures - \c{opyright}IEEE EmotionSense 2026/PerCom 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01156 2026-02-03 cs.LG cs.RO 50%

PolicyFlow: Policy Optimization with Continuous Normalizing Flow in Reinforcement Learning

PolicyFlow: 在强化学习中使用连续归一化流进行策略优化

Shunpeng Yang, Ben Liu, Hua Chen

机构 * Hong Kong University of Science and Technology(香港科技大学) Southern University of Science and Technology(南方科技大学) Zhejiang University-University of Illinois Urbana-Champaign Institute(浙江大学-伊利诺伊大学厄巴纳-香槟分校联合研究所) LimX Dynamics

专题命中 视频多模态 :multimodal(abstract)

AI总结 PolicyFlow是一种基于连续归一化流的在线强化学习算法,通过减少似然计算开销实现稳定训练,并通过布朗正则化器促进多样化行为。

Comments Submitted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏