arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-25 至 2025-11-25 共收录 134 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 13 篇

2511.18437 2025-11-25 cs.CV 79%

Perceptual-Evidence Anchored Reinforced Learning for Multimodal Reasoning

基于感知证据的强化学习用于多模态推理

Chi Zhang, Haibo Qiu, Qiming Zhang, Yufei Xu, Zhixiong Zeng, Siqi Yang, Peng Shi, Lin Ma, Jing Zhang

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Meituan Inc(美团公司) The University of Sydney(悉尼大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 PEARL通过将推理锚定在验证的视觉证据上,提升多模态推理能力,有效解决视觉幻觉和奖励黑客问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18314 2025-11-25 cs.LG cs.AI 79%

AnyExperts: On-Demand Expert Allocation for Multimodal Language Models with Mixture of Expert

AnyExperts: 多模态语言模型中基于需求的专家分配方法

Yuting Gao, Wang Lan, Hengyuan Zhao, Linjiang Huang, Si Liu, Qingpei Guo

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 AnyExperts通过按需分配专家资源,提高多模态MoE模型的效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18921 2025-11-25 cs.CV 70%

BackdoorVLM: A Benchmark for Backdoor Attacks on Vision-Language Models

BackdoorVLM:面向视觉-语言模型的后门攻击基准

Juncheng Li, Yige Li, Hanxun Huang, Yunhao Chen, Xin Wang, Yixu Wang, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Singapore Management University(新加坡管理学院) The University of Melbourne(墨尔本大学)

专题命中 图文多模态 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 BackdoorVLM提出首个评估视觉-语言模型后门攻击的基准,揭示VLMs对文本指令的高敏感性及多模后门的有效性

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17793 2025-11-25 cs.CV cs.LG 70%

Attention Guided Alignment in Efficient Vision-Language Models

注意力引导的高效视觉-语言模型

Shweta Mahajan, Hoang Le, Hyojin Park, Farzad Farhadzadeh, Munawar Hayat, Fatih Porikli

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出AGE-VLM,通过交错交叉注意力层和空间知识提取,减少高效视觉-语言模型中的幻觉问题。

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop on Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19536 2025-11-25 cs.CV cs.AI cs.CL 67%

FlowCut: Rethinking Redundancy via Information Flow for Efficient Vision-Language Models

FlowCut: 通过信息流重新思考冗余性以提高视觉-语言模型的效率

Jintao Tong, Wenwei Jin, Pengda Qin, Anqi Li, Yixiong Zou, Yuhong Li, Yuhua Li, Ruixuan Li

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) Xiaohongshu Inc.(小红书公司) Shanghai Jiao Tong University(上海交通大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 FlowCut通过信息流视角改进视觉-语言模型的冗余识别,实现更高效的剪枝效果。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17405 2025-11-25 cs.CL cs.AI 62%

Beyond Multiple Choice: Verifiable OpenQA for Robust Vision-Language RFT

超越多项选择:可验证的开放问答用于鲁棒的视觉-语言 RFT

Yesheng Liu, Hao Li, Haiyu Xu, Baoqi Pei, Jiahao Wang, Mingxuan Zhao, Jingshu Zheng, Zheqi He, JG Yao, Bowen Qin, Xi Yang, Jiajun Zhang

机构 * Institute of Automation, CAS(中国科学院自动化研究所) School of Artificial Intelligence, UCAS(中国科学技术大学人工智能学院) BAAI FlagEval Team(百度AI旗评团队) BUAA(北京航空航天大学) PKU(北京大学) ZJU(浙江大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 ReVeL通过重写和验证多项选择问题为开放式问题,提升视觉-语言模型在鲁棒性与数据效率上的表现。

Comments Project url: https://flageval-baai.github.io/ReVeL/

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16671 2025-11-25 cs.CV cs.CL 62%

Demystifying CLIP Data

解开CLIP数据之谜

Hu Xu, Saining Xie, Xiaoqing Ellen Tan, Po-Yao Huang, Russell Howes, Vasu Sharma, Shang-Wen Li, Gargi Ghosh, Luke Zettlemoyer, Christoph Feichtenhofer

机构 * FAIR, Meta AI(FAIR,Meta AI) New York University(纽约大学) University of Washington(华盛顿大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL

AI总结 MetaCLIP通过优化数据整理方法,提升CLIP在图像分类任务中的性能。

Comments 17 pages. arXiv admin note: text overlap with arXiv:2103.00020 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18978 2025-11-25 cs.CV 57%

Zero-shot segmentation of skin tumors in whole-slide images with vision-language foundation models

基于视觉语言基础模型的全切片图像皮肤肿瘤零样本分割

Santiago Moreno, Pablo Meseguer, Rocío del Amor, Valery Naranjo

机构 * Instituto Universitario de Investigación en Tecnología Centrada en el Ser Humano (HUMAN-Tech), Universitat Politécnica de Valencia(人类中心技术大学研究机构(HUMAN-Tech)、西班牙巴塞罗那理工大学) Artikode Intelligence S.L.(Artikode Intelligence公司)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本研究提出ZEUS框架,利用视觉语言基础模型实现全切片图像中皮肤肿瘤的零样本分割,减少标注负担并提高分割精度。

Comments Conference manuscript accepted for oral presentation at CASEIB 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18964 2025-11-25 cs.AI 57%

Synthesizing Visual Concepts as Vision-Language Programs

合成视觉概念作为视觉-语言程序

Antonia Wüst, Wolfgang Stammer, Hikaru Shindo, Lukas Helff, Devendra Singh Dhami, Kristian Kersting

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 本研究提出视觉-语言程序(VLP),结合视觉模型的感知灵活性与程序合成的系统推理能力,通过生成结构化视觉描述并编译成神经符号程序,提升复杂逻辑推理任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00416 2025-11-25 cs.RO cs.CV 57%

Evo-0: Vision-Language-Action Model with Implicit Spatial Understanding

Evo-0:具有隐式空间理解的视觉-语言-动作模型

Tao Lin, Gen Li, Yilei Zhong, Yanwen Zou, Yuxin Du, Jiting Liu, Encheng Gu, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) EvoMind Tech(EvoMind科技) IAAR-Shanghai(IAAR-上海) University of Cambridge(剑桥大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 Evo-0通过隐式整合3D几何特征,提升视觉-语言-动作模型在现实世界中的空间理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23518 2025-11-25 cs.AI 57%

TRAP: Targeted Redirecting of Agentic Preferences

TRAP:面向目标的代理偏好重定向

Hangoo Kang, Jehyeok Yeon, Gagandeep Singh

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.AI

AI总结 TRAP通过语义引导的跨模态操纵,诱导代理AI系统产生一致的选择偏见,揭示了语义层面的安全漏洞。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18396 2025-11-25 cs.CV 57%

Exploring Weak-to-Strong Generalization for CLIP-based Classification

探索基于CLIP的分类中的弱到强泛化

Jinhao Li, Sarah M. Erfani, Lei Feng, James Bailey, Feng Liu

机构 * School of Computing and Information Systems University of Melbourne, Australia(墨尔本大学计算机与信息系统学院) School of Computing and Information Systems University of Melbournem, Australia(墨尔本大学计算机与信息系统学院) School of Computer Science and Engineering Southeast University, China(东南大学计算机科学与工程学院)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出类别原型学习方法,通过弱监督提升CLIP模型分类性能,实验显示在预训练受限情况下取得显著改进。

Comments TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02162 2025-11-25 cs.RO cs.AI cs.HC 57%

Text to Robotic Assembly of Multi Component Objects using 3D Generative AI and Vision Language Models

通过3D生成AI和视觉语言模型实现多组件物体的文本到机器人组装

Alexander Htet Kyaw, Richa Gupta, Dhruv Shah, Anoop Sinha, Kory Mathewson, Stefanie Pender, Sachin Chitta, Yotto Koga, Faez Ahmed, Lawrence Sass, Randall Davis

机构 * Massachusetts Institute of Technology (MIT)(麻省理工学院) MIT(麻省理工学院) Google DeepMind(谷歌DeepMind) Google, Paradigms of Intelligence(谷歌、范式智能) Autodesk Research(Autodesk研究) MIT Mechanical Engineering(麻省理工学院机械工程系) MIT Architecture(麻省理工学院建筑系) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出利用3D生成AI和视觉语言模型实现多组件物体的文本到机器人组装,通过多模态推理分解生成网格并优化组件分配。

Comments Accepted to NeurIPS 2025, Conference on Neural Information Processing Systems, Creative AI Track

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 14 篇

2511.19080 2025-11-25 cs.MM cs.CV 86%

Towards Generalizable Deepfake Detection via Forgery-aware Audio-Visual Adaptation: A Variational Bayesian Approach

面向可泛化的深度伪造检测的伪造感知音频视觉适应:一种变分贝叶斯方法

Fan Nie, Jiangqun Ni, Jian Zhang, Bin Zhang, Weizhe Zhang, Bin Li

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Department of New Networks, Pengcheng Laboratory(鹏城实验室网络部) School of Cyber Science and Technology, Sun Yat-sen University(中山大学网络安全科学与技术学院) School of Computer Science and Cyber Engineering, Guangzhou University(广州大学计算机科学与网络工程学院) School of Cyberspace Science, Harbin Institute of Technology(哈尔滨工业大学网络空间科学学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出基于变分贝叶斯的伪造感知音频视觉适应方法,通过估计音频视觉相关性来提升深度伪造检测的泛化能力。

Comments TIFS AQE

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18698 2025-11-25 cs.SD cs.AI cs.CV cs.LG cs.MM 85%

Multimodal Real-Time Anomaly Detection and Industrial Applications

多模态实时异常检测与工业应用

Aman Verma, Keshav Samdani, Mohd. Samiuddin Shafi

机构 * Department of Electrical Engineering IIT Bombay Mumbai, India(电气工程系 印度理工学院Bombay 墨尔本)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出了一种多模态实时异常检测系统,结合视频和音频处理,通过多模型音频集合、混合物体检测和双向跨模态注意力机制,提升了准确性与工业适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10016 2025-11-25 cs.MM cs.AI cs.CL 85%

A Survey of Generative Categories and Techniques in Multimodal Generative Models

多模态生成模型中生成类别的综述

Longzhen Han, Awes Mubarak, Almas Baimagambetov, Nikolaos Polatidis, Thar Baker

机构 * School of Architecture, Technology and Engineering, University of Brighton, Lewes Road, BN2 4GJ(建筑、科技与工程学院,布里顿大学,勒斯路,BN2 4GJ) University of Khorfakkan, Sharjah(柯法克坎大学,沙迦)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 本文综述多模态生成模型中生成类别的发展,分析了跨模态能力的基础技术,并探讨了评估框架与治理机制以提升系统通用性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17890 2025-11-25 cs.CV cs.AI cs.MM 85%

Decoupled Audio-Visual Dataset Distillation

解耦音频-视觉数据集蒸馏

Wenyuan Li, Guang Li, Keisuke Maeda, Takahiro Ogawa, Miki Haseyama

机构 * Hokkaido University(北海道大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 DAVDD通过解耦音频-视觉表示提升数据集蒸馏效果,利用预训练库和轻量解耦器实现稳定特征提取与模态隔离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18993 2025-11-25 cs.CV 83%

AuViRe: Audio-visual Speech Representation Reconstruction for Deepfake Temporal Localization

AuViRe:用于深度伪造时间定位的音频视觉语音表示重建

Christos Koutlis, Symeon Papadopoulos

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 AuViRe 通过音频视觉语音表示重建技术,提升深度伪造时间定位的准确性,实验结果显示在多个数据集上均优于现有方法。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18718 2025-11-25 cs.RO cs.AI 79%

AIRHILT: A Human-in-the-Loop Testbed for Multimodal Conflict Detection in Aviation

AIRHILT:航空多模态冲突检测的人机交互测试平台

Omar Garib, Jayaprakash D. Kambhampaty, Olivia J. Pinon Fischer, Dimitri N. Mavris

机构 * Daniel Guggenheim School of Aerospace Engineering, Georgia Institute of Technology(丹尼尔·古根海姆航空航天工程学院,佐治亚理工学院)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 AIRHILT是一款用于航空多模态冲突检测的人机交互测试平台,通过集成ASR、视觉检测和决策模型,实现冲突检测的高效评估与研究。

Comments 9 pages, 4 figures, 1 table, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18405 2025-11-25 cs.AI cs.HC cs.IR 79%

A Multimodal Conversational Agent for Tabular Data Analysis

面向表格数据分析的多模态对话代理

Mohammad Nour Al Awad, Sergey Ivanov, Olga Tikhonova, Ivan Khodnenko

机构 * ITMO University(ITMO大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 Talk2Data是一种多模态对话代理,通过语音和文本交互实现表格数据分析,结合LLM、ASR、代码生成和TTS技术,提供多轮对话和可验证计算。

Comments \c{opyright} 2025 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17955 2025-11-25 cs.CL 79%

MTikGuard System: A Transformer-Based Multimodal System for Child-Safe Content Moderation on TikTok

MTikGuard系统:一种基于Transformer的多模态系统,用于TikTok上的儿童安全内容审核

Dat Thanh Nguyen, Nguyen Hung Lam, Anh Hoang-Thi Nguyen, Trong-Hop Do

机构 * Faculty of Information Science and Engineering, University of Information Technology(信息科学与工程学院,信息科技大学) Faculty of Software Engineering, University of Information Technology(软件工程学院,信息科技大学) Faculty of Computer Science, University of Information Technology(计算机科学学院,信息科技大学) University of Information Technology, Ho Chi Minh City(信息科技大学,胡志明市) Vietnam National University, Ho Chi Minh City(越南国家大学,胡志明市)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 MTikGuard系统通过多模态分类框架和扩展数据集,实现TikTok儿童安全内容审核的高准确率和实时部署。

Comments Accepted at PACLIC39

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17776 2025-11-25 cs.LG cs.MM 79%

PrismSSL: One Interface, Many Modalities; A Single-Interface Library for Multimodal Self-Supervised Learning

PrismSSL: 一个接口,多种模态;一个多模态自监督学习的单一接口库

Melika Shirian, Kianoosh Vadaei, Kian Majlessi, Audrina Ebrahimi, Arshia Hemmat, Peyman Adibi, Hossein Karshenas

机构 * dept. Computer Engineering University of Isfahan(计算机工程系 哈尔拉克大学) dept. Computer Engineering University of Texas at Dallas(计算机工程系 德克萨斯大学达拉斯分校) dept. Computer Science University of Oxford(计算机科学系 奥克兰大学) dept. Artificial Intelligence University of Isfahan(人工智能系 哈尔拉克大学)

专题命中 音频语音多模态 :multimodal(title);cross-modal(abstract);分类 cs.MM

AI总结 PrismSSL是一个统一多模态自监督学习的单一接口库,提供模块化代码、分布式训练和图形化仪表盘,支持多种模态和方法的扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08213 2025-11-25 cs.HC 71%

GazePointAR: A Context-Aware Multimodal Voice Assistant for Pronoun Disambiguation in Wearable Augmented Reality

GazePointAR: 一种基于情境的多模态语音助手,用于可穿戴增强现实中的代词消歧

Jaewook Lee, Jun Wang, Elizabeth Brown, Liam Chu, Sebastian S. Rodriguez, Jon E. Froehlich

专题命中 音频语音多模态 :multimodal(title)

AI总结 GazePointAR是一种基于情境的多模态语音助手,通过结合眼动、指向手势和对话历史来提升可穿戴增强现实中的代词消歧能力。

Journal ref Proceedings of the CHI Conference on Human Factors in Computing Systems (CHI 2024), Article 408, ACM

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18487 2025-11-25 eess.AS cs.AI cs.CL cs.SD 67%

InstructAudio: Unified speech and music generation with natural language instruction

InstructAudio: 通过自然语言指令统一语音和音乐生成

Chunyu Qiang, Kang Yin, Xiaopeng Wang, Yuzhe Liang, Jiahui Zhao, Ruibo Fu, Tianrui Wang, Cheng Gong, Chen Zhang, Longbiao Wang, Jianwu Dang

机构 * Tianjin University(天津大学) Kuaishou Technology(快手科技) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 InstructAudio通过自然语言指令统一语音和音乐生成,实现多任务学习和跨模态对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13219 2025-11-25 cs.SD cs.AI eess.AS 62%

FoleyBench: A Benchmark For Video-to-Audio Models

FoleyBench:视频到音频模型的基准测试

Satvik Dixit, Koichi Saito, Zhi Zhong, Yuki Mitsufuji, Chris Donahue

机构 * Carnegie Mellon University(卡内基梅隆大学) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.AI、eess.AS

AI总结 FoleyBench 是首个针对 Foley 风格视频到音频生成的基准测试,包含5000个三元组,用于评估模型在音频质量、对齐和同步方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17553 2025-11-25 cs.LG cs.AI cs.CL 62%

Practical Machine Learning for Aphasic Discourse Analysis

实用语言学在失语症话语分析中的应用

Jason M. Pittman, Anton Phillips, Yesenia Medina-Santos, Brielle C. Stark

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本研究评估了五个机器学习模型在失语症患者描述图片任务中识别正确信息单位(CIUs)的性能,发现虽然模型能有效区分词与非词,但识别CIUs仍面临挑战。

Comments 14 pages, 4 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02792 2025-11-25 cs.HC 50%

Where Do Passengers Gaze? Impact of Passengers' Personality Traits on Their Gaze Pattern Toward Pedestrians During APMV-Pedestrian Interactions with Diverse eHMIs

乘客注视方向在哪里?乘客个性特征对其在APMV-行人互动中对行人注视模式的影响

Hailong Liu, Zhe Zeng, Takahiro Wada

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 研究探讨了乘客个性特征如何影响其在APMV与行人互动中的注视模式,发现不同eHMI设计对乘客注视行为有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 18 篇

2508.06859 2025-11-25 cs.AI cs.CV 81%

MeteorPred: A Meteorological Multimodal Large Model and Dataset for Severe Weather Event Prediction

MeteorPred:一种用于恶劣天气事件预测的气象多模态大模型和数据集

Shuo Tang, Jian Xu, Jiadong Zhang, Yi Chen, Qizhao Jin, Lingdong Shen, Chenglin Liu, Shiming Xiang

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Zhongguancun Academy, Beijing(中关村学院) China Meteorological Administration(中国气象局)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 MeteorPred提出一种多模态大模型和数据集,用于提升恶劣天气事件预测的准确性和自动化水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18823 2025-11-25 cs.CV 79%

VideoPerceiver: Enhancing Fine-Grained Temporal Perception in Video Multimodal Large Language Models

VideoPerceiver: 提升视频多模态大语言模型的细粒度时序感知能力

Fufangchen Zhao, Liao Zhang, Daiqi Shi, Yuanjun Gao, Chen Ye, Yang Cai, Jian Gao, Danfeng Yan

机构 * State Key Laboratory of Networking and Switching Technology, BUPT(网络与交换技术国家重点实验室)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 VideoPerceiver通过两阶段训练框架提升视频多模态大语言模型对细粒度动作和短暂事件的感知能力,显著优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18104 2025-11-25 cs.CV 79%

Consolidating Diffusion-Generated Video Detection with Unified Multimodal Forgery Learning

通过统一多模态伪造学习巩固扩散生成视频检测

Xiaohong Liu, Xiufeng Song, Huayu Zheng, Lei Bai, Xiaoming Liu, Guangtao Zhai

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学信息科学与电子工程学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Department of Computer Science and Engineering, Michigan State University(密歇根州立大学计算机科学与工程系)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MM-Det++算法,通过统一多模态学习检测扩散生成视频,结合时空分支和多模态分支,提升视频伪造检测的准确性和泛化能力。

Comments Code and dataset are available at https://github.com/SparkleXFantasy/MM-Det-Plus

详情

展开后加载摘要…

URL PDF HTML 收藏