Event Specific Multimodal Pattern Mining with Image-Caption Pairs
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV
专题命中 视频多模态 :multimodal(title,abstract)
Comments ICML 2024. Previously published as a workshop paper for the AAAI 2023 Workshop MLmDS as "Multimodal Teacher Forcing for Reconstructing Nonlinear Dynamical Systems"
D3VL:利用语言模型从3D时间序列数据和视频中理解驾驶场景
机构 * Bradley Department of Electrical and Computer Engineering, Virginia Tech(弗吉尼亚理工大学布拉德利电气与计算机工程系) ; Virginia Tech Transportation Institute(弗吉尼亚理工大学交通研究所) ; Sanghani Center for Artificial Intelligence and Data Analytics(桑哈尼人工智能与数据分析中心)
专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文针对自动驾驶中多模态大语言模型,提出D3VL框架,整合2D和3D时间序列数据,回答交通场景相关问题,在KITTI问答数据集上性能提升11%,并引入Waymo QA数据集扩展以评估模型在多样驾驶条件下处理3D和时间序列数据的能力。
Comments Accepted to IEEE IV 2026
CMTFormer:融合Transformer与层次化信息交互的RGB-事件目标检测
专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 提出CMTFormer,通过浅层对齐、中层增强和深层可学习融合的层次化交互机制,有效融合RGB帧与事件流,在DSEC-Detection和PKU-DAVIS-SOD基准上超越现有方法。
Comments 15 pages
VideoLatent: 通过潜在自强制进行视频-语言学习
机构 * The Chinese University of Hong Kong(香港中文大学) ; Weitu AI(微图AI)
专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 提出VideoLatent,一种通过潜在自强制训练范式(包括潜在对齐和潜在多样性目标)进行视觉潜在推理的多模态大语言模型,仅依赖标准视频-问答三元组,在14个基准上优于现有模型,并大幅降低训练/推理开销。
DPC-VQA: 解耦质量感知与残差校准用于视频质量评估
机构 * Shanghai Jiao Tong University(上海交通大学) ; Baidu Inc.(百度公司) ; Xinjiang University(新疆大学)
专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.MM
AI总结 提出DPC-VQA框架,通过冻结多模态大模型提供感知先验,轻量校准分支预测残差修正,实现低训练成本下视频质量评估,在UGC和AIGC基准上取得竞争性能。
通过设计理解视频:数据集如何塑造视频模型
机构 * School of Engineering and Built Environment, Electrical and Electronic Engineering, Griffith University(工程与建筑环境学院,电气与电子工程学院,格里菲斯大学) ; School of Computer Science and Engineering, University of New South Wales(计算机科学与工程学院,新南威尔士大学)
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI
AI总结 本文从数据集视角出发,提出统一框架连接数据集结构、归纳偏差与架构设计,分析数据集特性如何驱动视频理解架构创新,并讨论不同数据体制下的表征偏差。
Comments Research report
CoCoVideo: 基于商业模型的高质量对比基准用于AI生成视频检测
机构 * School of Informatics, Xiamen University(厦门大学信息学院) ; China Academy of Information and Communications Technology(中国信息通信技术研究院) ; AI Transcend Pte. Ltd.(AI Transcend有限公司)
专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 针对现有数据集依赖低质量开源模型且商业样本带水印的问题,提出包含13个商业生成器的CoCoVideo-26K对比数据集,并设计结合对比学习与置信门控多模态大语言模型的CoCoDetect检测框架,实现高保真AI生成视频的鲁棒检测。
Comments Accepected by CVPR 2026
人类如何处理AI生成的幻觉内容:一项神经影像学研究
机构 * Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) ; Institute of Trustworthy Embodied AI, Fudan University, Shanghai, China(复旦大学可信具身人工智能研究院)
专题命中 视频多模态 :MLLM(abstract,abstract_cn);multi-modal(abstract);分类 cs.CL、cs.AI
AI总结 通过EEG实验,研究人类在处理多模态大语言模型生成的幻觉与非幻觉内容时的神经动力学差异,揭示误判的幻觉内容未能触发标准神经认知事实验证通路。
X2SAM:图像和视频中的任意分割
机构 * Sun Yat-Sen University(中山大学) ; Peng Cheng Laboratory(鹏城实验室)
专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 X2SAM是一种统一的分割多模态大语言模型,能够将图像分割能力扩展到视频,结合LLM和Mask Memory模块,支持通用、开放词汇、指称、推理、基于视觉的对话生成及交互式分割。
Comments Technical Report
VideoStir:通过时空结构化和意图感知的RAG理解长视频
机构 * University of Queensland(昆士兰大学) ; University of California, Merced(加州大学默塞德分校) ; Institute of Automation, CAS(中国科学院自动化研究所) ; Lancaster University(兰卡斯特大学)
专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 VideoStir通过构建时空图和意图相关性评分器,改进长视频RAG框架,实现基于意图的结构化推理,无需辅助信息即可竞争现有最佳基线。
Comments Accepted by ACL 2026
FunCineForge: 一个统一的数据集工具包和模型,用于多样的影视场景零样本配音
机构 * Alibaba Group(阿里巴巴集团) ; Tongyi Lab(通义实验室)
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);audio-visual(abstract);分类 cs.CV、cs.AI
AI总结 FunCineForge提出了一种统一的数据集工具包和模型,用于多样的影视场景零样本配音,通过构建大规模数据集和基于大规模语言模型的模型,提升了音频质量、唇形同步和情绪表达性能。
MMDuet2:通过多轮强化学习增强视频MLLMs的主动交互
机构 * Wangxuan Institute of Computer Technology, Peking University(王宣计算机技术研究所,北京大学) ; State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)
专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.CL
AI总结 MMDuet2通过多轮强化学习方法,实现了视频MLLMs在多轮对话中的主动交互,提升了回复时机和质量,达到ProactiveVideoQA基准的最优性能。
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.CL
Comments 10 pages, 10 figures
专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM
Comments 2025 icic
机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) ; Beijing Institute of Technology(北京理工大学) ; Zhejiang Normal University(浙江师范大学) ; Peng Cheng Laboratory(鹏城实验室) ; National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学多媒体信息处理国家重点实验室) ; School of Electronic and Computer Engineering, Shenzhen, Graduate School, Peking University(北京大学深圳研究生院电子与计算机工程学院)
专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.CL
Comments Demo page: https://om-cat.github.io
专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM
Cambrian-P: 基于姿态的视频理解
机构 * New York University(纽约大学) ; UC Berkeley(加州大学伯克利分校) ; Meta FAIR
专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 该研究提出Cambrian-P,一种增强的视频多模态大语言模型,通过引入可学习的相机令牌和姿态回归头,利用姿态作为轻量级监督信号,显著提升了空间推理能力,并在多个视频问答基准上实现了SOTA表现。
Comments Project Page: https://cambrian-mllm.github.io/
能量比例型多模态上下文感知视觉物联网节点
专题命中 视频多模态 :multimodal(title,abstract)
AI总结 该研究提出一种异构多模态双摄像头架构的视觉物联网节点,采用 TinyissimoYOLOv12 模型,实现节能的始终开启视觉监测,在低功耗下完成目标检测与遥测,可支持三个月运行寿命。
从多模态观察到可解释建议:手术团队的反事实时间扩展关系建模
机构 * University of Trento(特伦托大学) ; UiT the Arctic University of Norway(挪威北极大学)
专题命中 视频多模态 :multimodal(title,abstract)
AI总结 针对现有外科AI忽略团队互动建模的问题,提出tempo-relational框架结合Time-Expanded图,通过反事实程序生成可解释建议,在模拟手术实验中提升了多目标预测性能。
Comments Accepted at ACM Multimedia 2026
MultiSigBERT:肿瘤学中超越生存分析的多模态与序列建模
机构 * Université Lumière Lyon 2(里昂第二大学) ; Léon Bérard Center(莱昂·贝拉尔中心) ; EPITA(EPITA(法国高等计算机与技术学院))
专题命中 视频多模态 :multimodal(title,abstract)
AI总结 本研究提出基于路径特征表示的多模态序列生存建模框架MultiSigBERT,结合电子健康记录的多模态数据与时间特性,在含2500余名患者的肿瘤队列上取得0.743的一致性指数,提升了生存预测性能。
Comments Accepted at ECML PKDD 2026, Applied Data Science Track
PolyPresentation:一种面向幻灯片感知迭代演示练习的多模态AI平台
专题命中 视频多模态 :multimodal(title,abstract)
AI总结 该研究针对现有AI演示排练工具缺乏幻灯片关联与迭代练习规划支持的问题,推出PolyPresentation多模态AI平台,经20次学术演示对比验证其能提供更优的演示改进支持。
FEWT:用于多模态轮式双臂操作的频率增强型小波Transformer
专题命中 视频多模态 :multimodal(title,abstract)
AI总结 本研究针对轮式双臂操作的空间视觉与物理动力学表示不匹配问题,提出FEWT框架,整合FE-EMA与TS-DWT模块并结合STF传感器,在模拟及真实操作任务中较基准取得显著性能提升。
EsaacSim:适用于NVIDIA Isaac Sim的多模态事件相机附加组件
机构 * Leibniz Universität Hannover(莱布尼茨汉诺威大学) ; L3S Research Center(L3S研究中心) ; University of Southern Denmark(南丹麦大学) ; University of Chile(智利大学)
专题命中 视频多模态 :multimodal(title,abstract)
AI总结 本文提出适用于NVIDIA Isaac Sim的多模态事件相机附加组件EsaacSim,可实现多模态事件相机在线仿真,在多种分辨率下具备高效性能,支持机器人研究的多模态仿真与合成数据生成。
Journal ref The 19th European Conference on Computer Vision Workshops (ECCVW 2026); Workshop on Neuromorphic Vision (NeVi)
FedSceneX:面向同场景多模态联邦边缘学习的目标时间编排
专题命中 视频多模态 :multimodal(title,abstract)
AI总结 FedSceneX针对同场景多模态联邦边缘学习的轮次耗时不固定问题,提出VHP优化方法,在nuScenes基准测试中缩短每轮次活跃时间,20小时预算内准确率最高且保持全部四种模态。
AquaJEPA:面向水下机器人动力学的动作条件多模态预测表示
机构 * ITMO University(ITMO大学)
专题命中 视频多模态 :multimodal(title,abstract)
AI总结 该研究提出动作条件多模态预测模型AquaJEPA,在Stonefish环境中对比多种基线,经120个带计划DVL损失的配对环境实验,其闭环性能最优,配对最终误差显著优于多数基线。
Comments Submitted to IEEE ICRA 2027
多模态不确定性下基于优先级排序STL规范的自动驾驶
机构 * Eindhoven University of Technology(埃因霍温理工大学)
专题命中 视频多模态 :multimodal(title,abstract)
AI总结 提出一种不确定性感知的轨迹规划框架,通过信号时序逻辑的词典序优先级处理冲突目标,并结合模型预测路径积分控制实现,在仿真中验证了有效性。