arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-09-01 至 2026-09-01 共收录 22 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 22 篇

2509.06422 2026-09-01 cs.CV 版本更新 83%

Phantom-Insight: Adaptive Multi-cue Fusion for Video Camouflaged Object Detection with Multimodal LLM

Phantom-Insight:基于多模态大语言模型的视频伪装目标自适应多线索融合检测方法

Hua Zhang, Changjiang Luo

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 视频多模态 :multimodal(title);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 该研究针对视频伪装目标检测的两大问题,提出Phantom-Insight方法,通过多线索融合与解耦学习优化SAM,在MoCA-Mask数据集上达最优性能,且泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29711 2026-09-01 cs.CL 新提交 81%

DVBench: Benchmarking MLLMs for Understanding Dynamic Charts and Narratives in Data Videos

DVBench:用于评估多模态大语言模型(MLLMs)理解数据视频中动态图表与叙事的基准

Bomiao Wang, Zekai Shao, Jiexiang Lan, Xiaoliang Fu, Xingchen Zeng, Siming Chen

机构 * Fudan University(复旦大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视频多模态 :MLLM(summary_cn,abstract);分类 cs.CL

AI总结 本研究推出DVBench基准,评估MLLMs在结合动态图表与叙事的数据视频理解上的表现,发现开源模型性能不严格随参数规模扩展等现象,为MLLM发展提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30457 2026-09-01 cs.LG cs.CL 新提交 79%

Learning Where Outcomes Change:Credit-Addressable Reasoning for Multimodal Geometry

学习结果变化的位置:面向多模态几何的信用可寻址推理

Jiani Guo, Junjie Wang, Jie Wu, Pengxiang Zhao, Dongdong Zhang, Shaohan Huang, Yujiu Yang, Furu Wei

机构 * Tsinghua University(清华大学) Microsoft Research(微软研究院)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 该研究针对多模态几何推理中现有方法的缺陷,提出信用可寻址推理,通过Code-CoT和CE-GRPO实现,在9个几何基准上平均准确率达76.04,优于对比模型,凸显协同设计的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28844 2026-09-01 cs.HC cs.AI cs.LG 新提交 79%

Toward Postural State Classification in Immersive VR with Multimodal Data and Explainability Analysis

基于多模态数据与可解释性分析的沉浸式VR姿态状态分类研究

Nipa Anjum, Md Irfan Pavel, Robert Gonzalez, Kevin Desai, Alberto Cordova, M. Rasel Mahmud, John Quarles

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究提出用MI-CNN模型结合多模态数据与SHAP可解释性分析,实现VR中平衡与不平衡姿态的二分类,准确率达96.76%,降维后仍保持良好性能,为安全VR系统提供支撑。

Comments Accepted in The 25th IEEE International Symposium on Mixed and Augmented Reality (ISMAR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12335 2026-09-01 cs.CV cs.LG 版本更新 79%

SynMulti: Synthetic-to-Real Learning for Multimodal Video Understanding

一站式:一个多模态视频理解统一合成数据管道

Tanzila Rahman, Renjie Liao, Leonid Sigal

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute for AI(向量人工智能研究所)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出统一合成数据管道,用于生成多模态视频数据,支持多种任务格式,提升模型推理能力,并在视频物体计数、视觉问答和分割任务中验证了其有效性。

Comments 14 Pages, 4 Tables, 4 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15599 2026-09-01 cs.CV cs.LG 79%

Multi-Modal Fusion of In-Situ Video Data and Process Parameters for Online Forecasting of Cookie Drying Readiness

Shichen Li, Chenhui Shao

机构 * Department of Mechanical Science and Engineering, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校机械科学与工程系) Department of Mechanical Engineering, University of Michigan(密歇根大学机械工程系)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

Comments 17 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30804 2026-09-01 cs.LG 新提交 78%

Geometric Attractor Monitoring: A Robust and Frugal Framework for Multi-modal Industrial Robotic Cycles

几何吸引子监测:一种针对多模态工业机器人周期的鲁棒且经济的框架

Martin Bonsergent-Brachet, Jesse Read, Dany Abboud

机构 * LIX, École Polytechnique, Institut Polytechnique de Paris(巴黎综合理工学院LIX实验室,巴黎理工学院) Renault(雷诺公司)

专题命中 视频多模态 :multi-modal(title,abstract)

AI总结 针对多模态工业机器人周期及故障数据稀缺的挑战,提出基于相空间重构的几何吸引子监测框架,用离散支持估计构建健康指标,在真实与合成数据集上性能优于深度学习基线。

Comments 17 pages, 6 figures. Accepted at ECML PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09625 2026-09-01 cs.HC 版本更新 78%

AwareLLM: A Proactive Multimodal Ecosystem for Personalized Human-AI Collaboration to Enhance Productivity

AwareLLM: 一种主动多模态生态系统,用于个性化人机协作以提升生产力

Amog Rao, Utkarsh Agarwal, Amol Harsh, Siddharth Siddharth

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 AwareLLM通过整合多模态数据与大语言模型,实现主动适应用户心理生理状态,提升任务表现并降低认知疲劳,推动人机协作新范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01600 2026-09-01 cs.CV cs.CL cs.RO 版本更新 73%

RoboTrustBench: Benchmarking the Trustworthiness of Video World Models for Robotic Manipulation

RoboTrustBench:机器人操作视频世界模型的可信度基准测试

Huiqiong Li, Jiayu Wang, Zhiting Mei, Anirudha Majumdar, Jingjing Chen, Bin Zhu

机构 * Singapore Management University(新加坡国立管理学院) Fudan University(复旦大学) Princeton University(普林斯顿大学)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL

AI总结 针对视频世界模型在机器人操作中的可信度问题,提出RoboTrustBench基准,包含正常、约束敏感、反事实和对抗四种场景,通过专家验证的指令-图像对和六维评估协议,发现当前模型在约束推理、反事实基础、物理交互和不安全指令抑制方面存在不足。

Comments EMNLP 2026 Findings, Project: https://huiqiongli.github.io/RoboTrustBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00514 2026-09-01 cs.RO 版本更新 71%

Cross-Modal Visuo-Tactile Representation Learning with Action Chunking Transformers for Contact-Rich Manipulation

一种低成本的基于视觉的触觉夹具,用于接触丰富的操作

Yaohua Liu, Rong Fu, Amir H. Gandomi, Simon Fong, Hengjun Zhang

机构 * Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) Innovation and Research and Development Department, BoardWare Information System Company Ltd.(创新与研发部,BoardWare信息系统有限公司) School of Artificial Intelligence, Nanjing Agricultural University(人工智能学院,南京农业大学) School of Computing, National University of Singapore(计算机学院,新加坡国立大学) School of Electronic Engineering and Automation, Guilin University of Electronic Technology(电子工程与自动化学院,桂林电子科技大学)

专题命中 视频多模态 :cross-modal(title)

AI总结 本研究提出了一种低成本的视觉-触觉夹具,通过融合视觉和触觉反馈,提升接触丰富环境中的操作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28699 2026-09-01 cs.CV 新提交 70%

Beyond Visual Boundaries: Rethinking Scene Segmentation for Movie RAG

超越视觉边界:为电影检索增强生成(RAG)重新思考场景分割

Dong-Hee Kim, Seonwoo Choi, Changbeen Kim, Jungmyung Wi, Juyeon Ko, Youngju Choi, Il Hyeon Mun, Hyunwoo J. Kim, Donghyun Kim

机构 * Korea University(高丽大学) KAIST(韩国科学技术院)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 本文针对电影RAG场景,发现现有场景分割方法不如均匀时间分块,提出以叙事为核心的NarraScene数据集,其生成的片段作为检索单元可提升下游电影理解任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30716 2026-09-01 cs.CL cs.CV 新提交 62%

SocialReasonBench: A Video-QA Benchmark for Social Reasoning with Counterfactual Narrative Videos

SocialReasonBench:基于反事实叙事视频的社会推理视频问答基准

Zheyu Huang, Zijing Shi, Haozhe Luo, Huadong Tang, Mingyu Liu, Meng Fang, Ling Chen

机构 * AAII, University of Technology Sydney(悉尼科技大学AAII(先进人工智能研究所)) Northeastern University(东北大学) Fudan University(复旦大学) University of Liverpool(利物浦大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 研究人员推出SocialReasonBench基准,评估LMMs的社会推理能力,发现其在反事实和因果推理上表现不佳,凸显了模型在潜在社会状态推理上的不足。

Comments Accepted to Findings of EMNLP 2026. 24 pages, 11 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17790 2026-09-01 cs.CV cs.AI 版本更新 62%

ReViV: Reconstructing the Viewer and the View in 4D from Monocular Egocentric Video

ReViV:从单目自我中心视频中重建4D中的观看者和视图

Xiaozhong Lyu, Gen Li, Zhiyin Qian, Xucong Zhang, Marc Pollefeys, Siyu Tang

机构 * ETH Zurich(苏黎世联邦理工学院) Delft University of Technology(代尔夫特理工大学) Microsoft(微软)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究旨在从单目自我中心视频重建4D中的观看者和视图,提出ReViV框架,将任务建模为学习多模态信号联合概率分布,由掩码生成自我中心变压器驱动,在多基准测试中展现出高精度和效率,还保持了竞争力强的自我中心深度估计,且代码模型开源。

Comments Accepted to ECCV 2026. The first two authors contributed equally, and their author order is interchangeable

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31005 2026-09-01 cs.CV 新提交 57%

From Intent to Evidence: Policy-Steered Multi-Strategy Retrieval for Long-Video Agents

从意图到证据:面向长视频智能体的策略引导多策略检索

Can Zhang, Baofeng Zhang, Xiaotian Han, Junyuan Shang, Yuchen Ding, Shuohuan Wang, Dianhai Yu, Ruirui Li

机构 * Beijing University of Chemical Technology(北京化工大学) Baidu, Inc.(百度公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对长视频智能体现有统一证据获取方式的缺陷,提出无需训练的VESTA智能体,通过策略引导多策略检索等机制,在多个长视频基准上取得了显著性能提升。

Comments 15 pages, 5 figures, 6 tables (main paper with appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30521 2026-09-01 cs.CV 新提交 57%

MEOM: Multi-View Expected-OKS Maximization for Human Pose Triangulation

MEOM:用于人体姿态三角测量的多视图期望OKS最大化

Ziliang Xiong, Henglin Shi, Per-Erik Forssen

机构 * Linköping University(林雪平大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 该研究针对传统人体姿态三角测量法的缺陷,提出MEOM框架,融合多视图热图并评估其可靠性,在两种设置下均实现最优性能,推理成本仅为现有最优方法的一半。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29937 2026-09-01 cs.AI 新提交 57%

AcrossWAM1.0:A Modular Latent World-Action Stack for Compact Robot Policies

AcrossWAM1.0:用于紧凑机器人策略的模块化潜在世界-动作栈

Yafei Zhang, Nan Wu

机构 * Across Physical AI(跨物理人工智能机构) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 该研究针对LaWAM的耦合问题推出AcrossWAM1.0模块化潜在世界-动作栈,在LIBERO实验中实现高成功率,参数规模显著缩小,提供可审计的部署边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28784 2026-09-01 cs.CV 新提交 57%

ClearText-Video: A Large-Scale Text-Centric Video Dataset Bridging Video Restoration and Scene-Text Enhancement

ClearText-Video:连接视频修复与场景文本增强的大规模以文本为中心的视频数据集

Jinlong Li, Jiaming Ding, Dingfu Lu, Malcolm Hsiu, Chuang Ke, Kangning Yang, Bochen Guan, Lan Fu, Jie Cai, Huiming Sun, Zibo Meng

机构 * OPPO US AI Center(OPPO美国人工智能中心) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of California San Diego(加利福尼亚大学圣迭戈分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究团队推出ClearText-Video数据集,评估发现视觉增强未必提升文本推理,仅OCR管道远逊于多模态推理,为相关系统提供基础。

Comments This paper is accepted by 2026 Proceedings of the European Conference on Computer Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26495 2026-09-01 cs.CV 版本更新 57%

Video-FLAIR: Not Whether to Reason, But How

Video-FLAIR:不是是否推理,而是如何推理

Yogesh Kulkarni, Pooyan Fazli

机构 * Arizona State University(亚利桑那州立大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 该研究提出 Video-FLAIR 训练框架,通过强化学习让模型为多模态查询选择适配的推理模式,在多个视频多模态基准上提升准确率并降低 token 用量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20186 2026-09-01 cs.CV 版本更新 57%

Improving Image-to-Image Translation via a Rectified Flow Reformulation

通过修正流重新公式化改进图像到图像转换

Satoshi Iizuka, Shun Okamoto, Kazuhiro Fukui

机构 * University of Tsukuba(茨口大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出I2I-RFR方法,通过将标准图像到图像回归网络重新解释为连续时间传输模型,提升图像转换性能,保留传统监督训练流程,增强感知质量和细节保留。

Comments Accepted to ECCV 2026. Project page: https://iizuka.cs.tsukuba.ac.jp/projects/i2irfr/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29304 2026-09-01 cs.LG 新提交 50%

MEL: Coordinate-Preserving EEG Tokenization for fMRI Translation

MEL:用于fMRI转换的坐标保留型EEG分词

Xiangyu Liu, Zeting Yan, Zhitong Yin, Boyang Li, Xi Zhang

机构 * Beijing Normal-Hong Kong Baptist University(北京师范大学-香港浸会大学联合国际学院) The University of Hong Kong(香港大学) Peking University(北京大学)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本研究提出坐标保留型EEG表示框架MEL,通过结构化EEG表示解决EEG到fMRI转换中的表示接口不匹配问题,在基准数据集上相比NeuroBOLT基线提升了预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03540 2026-09-01 cs.RO 版本更新 50%

Drift-Based Policy Optimization: Native One-Step Policy Learning for Online Robot Control

基于漂移的策略优化:面向在线机器人控制的原生一步生成策略

Yuxuan Gao, Yedong Shen, Shiqi Zhang, Wenhao Yu, Yifan Duan, Jia pan, Jiajia Wu, Jiajun Deng, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出一种原生一步生成策略框架,通过将迭代细化移至训练阶段,提升在线机器人控制的效率与稳定性,实验显示其在推理速度和性能上优于多步扩散策略。

Comments Accepted at the 34th ACM International Conference on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09608 2026-09-01 cs.RO 版本更新 50%

Super4DR: 4D Radar-centric Self-supervised Odometry and Gaussian-based Map Optimization

Super4DR: 基于4D雷达的自监督里程计与高斯基于地图优化

Zhiheng Li, Weihua Wang, Qiang Shen, Yichen Zhao, Zheng Fang

专题命中 视频多模态 :multi-modal(abstract)

AI总结 Super4DR通过基于4D雷达的自监督里程计和高斯地图优化,在恶劣天气中实现更准确的定位与地图重建。

Comments 19 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏