arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4729 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4729 篇

cmp-lg/9407018 2009-11-30 cmp-lg cs.CL 57%

Generating Multilingual Documents from a Knowledge Base: The TECHDOC Project

Dietmar Rösner, Manfred Stede

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

Comments 5 pages, TEX + PS figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11017 2026-08-12 cs.CV cs.AI cs.HC cs.MM 新提交 56%

R4DSG: Relative 4D Scene Graph Memory for Object-Centric Question Answering in Long Egocentric Video

R4DSG:面向长时序自我中心视频中以对象为中心的问答的相对4D场景图记忆

Ke Ma, Yamin Mao, Weiming Li, Shuai Tan, Yijie Zhong, Hao Chen, Haofen Wang, Meng Wang

机构 * Samsung R&D Institute China - Beijing(三星中国研发研究院(北京)) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频多模态 :分类 cs.CV、cs.AI、cs.MM;multimodal(comments)

AI总结 该研究提出R4DSG,一种面向长时序自我中心视频的相对4D场景图记忆,在EgoLifeQA数据集的对象相关问答任务中,较EgoRAG-Text取得显著性能提升,可作为可穿戴助手等的实用记忆载体。

Comments 10 pages, 3 figures, ACM Multimedia 2026, egocentric video; 3D scene graph; temporal memory; graph retrieval; object-state reasoning; multimodal question answering

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24310 2026-03-17 cs.RO 56%

World In Your Hands: A Large-Scale and Open-Source Ecosystem for Learning Human-Centric Manipulation in the Wild

世界在你手中:一个大规模且开源的生态系统,用于在真实世界中学习以人类为中心的操纵

Yupeng Zheng, Jichao Peng, Weize Li, Yuhang Zheng, Xiang Li, Yujie Jin, Julong Wei, Guanhua Zhang, Ruiling Zheng, Ming Cao, Songen Gu, Zhenhong Zou, Kaige Li, Ke Wu, Mingmin Yang, Jiahao Liu, Pengfei Li, Hengjie Si, Feiyu Zhu, Wang Fu, Likun Wang, Ruiwen Yao, Jieru Zhao, Yilun Chen, Wenchao Ding

专题命中 视频多模态 :multimodal(abstract,comments)

AI总结 本文提出World In Your Hands,一个包含1000小时真实人类操纵数据的开源生态系统,通过高精度运动捕捉和多模态数据提升机器人在杂乱环境中的操作成功率。

Comments This dataset represents the first large-scale collection of real-world, human-centric multimodal data integrating vision, language, tactile sensing, and action (VLTA) Github: https://github.com/tars-robotics/World-In-Your-Hands

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.04688 2023-09-21 cs.CV cs.AI 54%

Interaction-Aware Prompting for Zero-Shot Spatio-Temporal Action Detection

Wei-Jhe Huang, Jheng-Hsien Yeh, Min-Hung Chen, Gueter Josmy Faure, Shang-Hong Lai

专题命中 视频多模态 :分类 cs.CV、cs.AI;multimodal(comments);multimodal foundation model(comments)

Comments Accepted by ICCV Workshop 2023 (What is Next in Multimodal Foundation Models?)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23078 2026-08-21 eess.IV 版本更新 50%

A Systematic Survey on Event Camera Representation Learning

事件相机表示学习系统综述

Hongwei Ren, Youxin Jiang, Tuopusen Huang, Lei Yu, Xiao Wang, Min Liu, Lin Wang, Xiangqian Wu

专题命中 视频多模态 :multimodal(abstract)

AI总结 综述从原始事件流转换为可学习表示的角度,分类梳理了基于密集和稀疏表示的方法,分析其在结构规则性、时间保真度、稀疏保持和架构兼容性上的权衡,并总结基准与未来方向。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17651 2026-08-19 astro-ph.HE 新提交 50%

Revisiting neutrino event epochs for the blazar PKS 0735+178 with TESS

利用TESS重新研究耀变体PKS 0735+178的中微子事件时期

Shubham Kishore, Alok C. Gupta, Debanjan Bose

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文利用TESS观测耀变体PKS 0735+178的周级耀发,分析其光学光变特性,探讨该源光学变异性与同期中微子事件的可能关联,为其光学流量行为提出物理场景。

Comments Accepted for publication in ApJ, 13 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23037 2026-08-19 cs.LG physics.flu-dyn 版本更新 50%

Open datasets and machine learning for two-phase heat transfer: a review following a spatial-temporal taxonomy

用于多相输运和热系统数据驱动建模的开放多模态数据集与开源软件

Christy Dunlap, Ridwan Olabiyi, Firas Al-Hindawi, Hari Pandey, Stephen Pierson, Daniel Curl, Braden Stevens, Mohammad Ishraq Hossain, Annapurna Parjuli, Chinmaya Joshi, Ashif Iquebal, Han Hu

机构 * Department of Mechanical Engineering, University of Arkansas(阿肯色大学机械工程系)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文介绍了一个由NED3实验室开发的开放多模态数据集和开源软件生态系统,提出了空间加时间维度(S+TD)分类框架,并重点描述了SeqReg序列回归库,以推动可复现的AI赋能热流体研究。

Comments Accepted manuscript replacing arXiv:2605.23037 (v1). Substantially expanded from the original preprint and published in Transport Phenomena 2026, 1(3), 20260081. https://doi.org/10.1515/tp-2026-0081

Journal ref Transport Phenomena 2026, 1(3), 20260081

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13015 2026-08-18 cs.RO 版本更新 50%

Learning Versatile Humanoid Manipulation with Touch Dreaming

通过触觉梦想学习多功能人形操作

Yaru Niu, Zhenlong Fang, Binghong Chen, Shuai Zhou, Revanth Krishna Senthilkumaran, Hao Zhang, Bingqing Chen, Chen Qiu, H. Eric Tseng, Jonathan Francis, Ding Zhao

机构 * Carnegie Mellon University(卡内基梅隆大学) UT Arlington(UT阿灵顿) Bosch Center for AI(博世人工智能中心)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出HTD模型,结合触觉、视觉和本体感觉,通过触觉梦想增强学习实现高灵活性的人形操作,实验证明在五个真实任务中成功率提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19264 2026-08-18 physics.med-ph 版本更新 50%

A novel method for analysis of transient morphological changes in quasiperiodic physiological signals and their neurogenic correlates

一种用于分析准周期生理信号瞬态形态变化及其神经源性关联的新方法

Tomasz Gradowski, Damian Waląg, Tomir Domański, Teodor Buchner

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出了一种新的可视化方法,用于分析准周期生理信号的瞬态形态变化及其神经源性关联,通过二维地毯图同时评估心跳节律和信号特征。

Comments 31 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14349 2026-08-17 cs.LG 新提交 50%

Non-Parametric Spatiotemporal Trajectory Prediction via State-Conditioned Transition Sampling

基于状态条件转移采样的非参数时空轨迹预测

Michael Fore, Akshay Jain, Justin Downes, Rohan Pradhan, Duncan Botti

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 该研究提出一种无训练的非参数时空轨迹预测方法,无需GPU和学习参数,在数据充足时精度与57M参数Transformer相当,数据稀缺时性能显著更优,可从少量历史数据部署到新区域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10780 2026-08-17 cs.RO 版本更新 50%

StageWAM: Joint-Embedding Stage Prediction for World-Action Models in Robot Manipulation

JEPA-WAM:机器人操作中世界-动作模型的阶段级联合嵌入预测

Xiao Liu, Yuguang Yang, Xi Wang, Kai Jiang, Cheng Chi, Yong Xu, Wenchao Ding, Yilun Chen, Yan Wang

专题命中 视频多模态 :multimodal(abstract)

AI总结 该研究针对通用机器人策略未明确建模任务阶段级未来的问题,提出JEPA-WAM模型,在50个RoboTwin 2.0任务上实现90.25%的整体成功率,成功减少了平均执行步骤数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12993 2026-08-14 cs.IT math.IT 新提交 50%

A Theory of Probabilistic Power Provisioning for Data Centers with Distributed Energy Storage

面向配备分布式储能的数据中心的概率功率供应理论

Can Emre Koksal, Richard A. Barry, Artun Sel

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文针对配备分布式储能的数据中心的电力供应问题,提出概率框架,划分两种运行模式并引入等效功率概念,经三类生产数据中心工作负载验证,为下一代AI数据中心提供规模设计原则。

Comments 26 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12908 2026-08-13 cs.RO 版本更新 50%

Robotic Manipulation is Vision-to-Geometry Mapping: Vision-Geometry Backbones over Language and Video Models

机器人操作是视觉到几何映射(f(v)→G):超越语言和视频模型的视觉-几何骨干

Zijian Song, Qichang Li, Jiawei Zhou, Zhenlong Yuan, Tianshui Chen, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis(大数据分析与处理广东省重点实验室) X-Era AI Lab(X-Era人工智能实验室) AMAP, Alibaba(阿里妈妈实验室) Guangdong University of Technology(广东工业大学)

专题命中 视频多模态 :image-text(abstract)

AI总结 本文提出基于视觉-几何骨干的机器人操作方法,通过直接利用预训练的3D表示生成动作,优于传统语言或视频模型,在精确操作和零样本泛化中表现更优。

Comments Accepted at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08729 2026-08-11 cs.HC 新提交 50%

From Scaffolding to Internalization: Enhancing CPR Training with In-Situ Visualization and Kinesthetic Feedback

从支架到内化:利用原位可视化与运动反馈强化心肺复苏(CPR)训练

Jiahe Dong, Shuhao Zhang, Yutao Ming, Jinkai Zhang, Yurui Zhang, Quan Li

专题命中 视频多模态 :multimodal(abstract)

AI总结 本研究针对现有CPR训练系统依赖外部反馈导致技能保持差的问题,设计了阶段自适应多模态混合现实训练系统Kinesthetic-CPR,经60人参与的受控研究验证,为CPR训练系统提供了设计启示。

Comments In The 39th Annual ACM Symposium on User Interface Software and Technology (UIST '26), November 02-05, 2026, Detroit, MI, USA. ACM, New York, NY, USA, 15 pages. https://doi.org/10.1145/3830398.3830498

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06833 2026-08-11 cs.RO 版本更新 50%

Unordered Landmark Visual Navigation

无序地标视觉导航

Hao Ren, Junzhe Zhu, Yihan Li, Zetong Bi, Le Zheng, Zhi Li, Yiqing Yuan, Zhaoliang Wan, Dizhe Zhang, Lu Qi, Hui Cheng

专题命中 视频多模态 :multimodal(abstract)

AI总结 针对无序图像导航的挑战,本文提出无需时间与里程计先验的ULVN框架,通过整合建图、定位与规划,在仿真和真实场景中性能优于现有最优方法。

Comments ECCV2026 Oral & Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22505 2026-08-11 q-bio.QM cs.HC 版本更新 50%

Loom: Multi-Region Analysis of Spatial Transcriptomics with Local Neighborhoods and Global Trajectories

Loom:利用局部邻域和全局轨迹对空间转录组学进行多区域分析

Siyuan Zhao, Nafiul Nipu, Hossein Fathollahian, Olga Karginova, Hao Chen, Ameen Salahudeen, G. Elisabeta Marai

专题命中 视频多模态 :multi-modal(abstract)

AI总结 Loom是用于空间转录组学分析的视觉计算系统,利用新颖图形符号和计算框架,应对多模态整合挑战,经案例研究和可用性研究评估,有效支持细胞转变及时空表达动态发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06783 2026-08-10 eess.SP 新提交 50%

Design and Validation of a Portable EEG-tES Platform Supporting High-Rate EEG Recording and Temporal Interference Stimulation

支持高速脑电图记录和时间干扰刺激的便携式脑电图-经颅电刺激平台的设计与验证

Le Xing, Maoxing Liang, Disi A, Yifei Jia, Gaoxiang Xie, Linfeng Xu, Xiang'ao Chen, Jiebin Shi, Gang Pan, Bicheng Han

专题命中 视频多模态 :multimodal(abstract)

AI总结 本研究设计并验证了一款以MCU为核心的便携式EEG-tES平台,集成8通道EEG采集与2通道tES功能,具备高信号保真度与低刺激误差,为便携式闭环神经调控系统提供了实用基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08199 2026-08-07 cs.NI 版本更新 50%

Beyond Static Forecasting: Unleashing the Power of World Models for Mobile Traffic Extrapolation

超越静态预测:利用世界模型进行移动交通外推

Xiaoqian Qi, Haoye Chai, Yue Wang, Yong Li

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出MobiWM世界模型,用于移动网络中的移动交通外推,通过融合多模态环境上下文和编码动作,提升空间理解,实验表明其在所有评估场景中均取得最佳分布保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24804 2026-08-05 cs.IR cs.LG 版本更新 50%

Bumblebee: Interleaved Mixed-Layer Building Blocks for Large-Scale Recommendation Systems

大黄蜂:用于大规模推荐系统的交错混合层构建块

David Bauer, Cancan Zhang, Wenshun Liu, Xiaoyi Zhang, Weijia Liu, Wanli Ma, Yue Weng, Wei Li, Rui Li, Jing Qian, Huayu Li, Xiaoyi Liu, Linhong Zhu, Jerry Fu

专题命中 视频多模态 :cross-modal(abstract)

AI总结 研究针对推荐系统发展的两条轨道缺乏交互的问题,提出大黄蜂架构,通过交错可堆叠块设计,结合多种技术,实现模态混合与信息丰富,经实验验证该方法优于基线模型,证明交错异构单元是有前途的推荐架构范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01773 2026-08-04 q-bio.NC 新提交 50%

NeuroWorld: A Latent Brain World Model for Stimulus-Conditioned Human Brain Dynamics

NeuroWorld:用于刺激条件下人脑动力学的潜在脑世界模型

Zijian Dong, Jianxiong Zhou, Kwun Kei Ng, Jan Paolo Macapinlac Balagtas, Zhizhou Li, Zijiao Chen, Juan Helen Zhou

专题命中 视频多模态 :multimodal(abstract)

AI总结 研究针对现有脑编码模型的时间约束缺陷,提出首个脑世界模型NeuroWorld,通过两阶段方法在三个fMRI基准上实现了更优的脑活动多步预测性能,为脑活动因果预测提供了新框架。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13489 2026-08-04 eess.SP 版本更新 50%

Feasibility of simultaneous EEG-fMRI at 0.55 T: Recording, Denoising, and Functional Mapping

0.55T下同时进行EEG-fMRI可行性的研究:记录、去噪与功能映射

Parsa Razmara, Takfarinas Medani, Majid Abbasi Sisara, Anand A. Joshi, Rui Chen, Woojae Jeong, Ye Tian, Krishna S. Nayak, Richard M. Leahy

专题命中 视频多模态 :multimodal(abstract)

AI总结 本研究证明在0.55T下同时进行EEG-fMRI的可行性,通过去噪和功能映射展示了多模态神经成像的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29482 2026-08-03 cs.RO 新提交 50%

Temporal Policy: History-Initialized Action Generation for Robotic Learning from Demonstration

时间策略:用于机器人演示学习的历史初始化动作生成

Dylan Miller, Martin Jagersand

机构 * University of Alberta(阿尔伯塔大学)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出Temporal Policy生成框架,将动作生成为时间耦合传输问题,在降低近一个数量级传输成本的同时匹配基线成功率,实现高频闭环控制。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29413 2026-08-03 cs.HC 新提交 50%

SAVVY: Student Attention Visualization for Video-based Learning Analysis

SAVVY:面向视频学习分析的学生注意力可视化

Shixian Zhou, Minghuan Shen, Xiaolin Wen, Zijun Qiu, Yongliang Jiang, Xiangyang Wu, Fei Wu, Yong Wang, Zhiguang Zhou

专题命中 视频多模态 :multimodal(abstract)

AI总结 针对现有视频学习注意力分析算法易受噪声干扰、教师修订成本高的问题,提出基于多模态脑信号的注意力建模框架,开发整合视听注意力的SAVVY可视化系统,经验证可有效辅助教学视频优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06834 2026-08-03 cs.HC cs.GR 50%

COIVis: Eye-tracking-based Visual Exploration of Concept Learning in MOOC Videos

COIVis:基于眼动的MOOC视频概念学习视觉探索

Zhiguang Zhou, Ruiqi Yu, Yuming Ma, Hao Ni, Guojun Li, Li Ye, Xiaoying Wang, Yize Li, Yigang Wang, Yong Wang

专题命中 视频多模态 :multimodal(abstract)

AI总结 COIVis通过眼动追踪技术分析MOOC视频中学习过程,提取课程概念并定义感兴趣概念,提供多视角可视化,帮助教师理解学习者认知状态,支持个性化干预和教学优化。

Comments 17pages, 8 figures

Journal ref IEEE Transactions on Visualization and Computer Graphics, vol. 32, no. 7, pp. 7074-7091, July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23749 2026-07-31 cs.HC 版本更新 50%

StateScribe: Towards Accessible Change Awareness Across Real-World Revisits

StateScribe: 向现实世界重访中的可访问性变化意识迈进

Ruei-Che Chang, Xirui Jiang, Rosiana Natalie, Hao Chen, Vlad Roznyatovskiy, Jianzhong Zhang, Kang G. Shin, Ke Sun, Anhong Guo

专题命中 视频多模态 :multimodal(abstract)

AI总结 StateScribe通过双层记忆架构实现跨重访的现实变化感知,提高盲人和低视力用户对环境变化的认知能力,准确率达83.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23457 2026-07-28 physics.soc-ph 新提交 50%

From Pen to Palette: Mathematical Analysis of van Gogh's Psychological Trajectory

从笔到调色板:梵高心理轨迹的数学分析

Anna Singley, Eli Goldwyn, Mark Pitzer, Jessica Logue

专题命中 视频多模态 :multi-modal(abstract)

AI总结 该研究通过对梵高信件片段情感分析和画作分形维数分析,运用临界慢化理论,发现视觉复杂性与死亡情绪相关,重大危机前有CSD模式,如1888年割耳事件,揭示数学方法可检测历史人物心理转变特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08757 2026-07-28 cs.RO 版本更新 50%

A Visuo-Tactile Data Collection System with Haptic Feedback for Coarse-to-Fine Imitation Learning

一种带有触觉反馈的视觉-触觉数据采集系统用于粗到细模仿学习

Yeseung Kim, Nayoung Oh, Jun Park, Teetat Thamronglak, Daehyung Park

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出一种视觉-触觉数据采集系统,生成时间结构丰富的接触密集演示,用于模仿学习。通过直接驱动夹具和触觉阵列,保留自然触觉反馈,结合实时注释,生成多模态数据集以支持粗到细学习算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21309 2026-07-24 cs.RO 新提交 50%

Factorized Spatio-Temporal Convolutions for Human Pose Estimation from Planar Lidar

用于基于平面激光雷达的人体姿态估计的分解时空卷积

Simone Arreghini, Mirko Nava, Nicholas Carlotti, Antonio Paolillo, Alessandro Giusti

机构 * Dalle Molle Institute for Artificial Intelligence (IDSIA), USI-SUPSI(瑞士意大利语区大学提契诺大学人工智能达勒莫利研究所)

专题命中 视频多模态 :cross-modal(abstract)

AI总结 针对服务机器人仅配备平面激光雷达和普通处理器的情况,提出基于时空块的轻量级网络,用于全向人体检测和相对2D姿态估计,通过跨模态自监督训练,优于基线模型,适用于计算受限的服务机器人空间感知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06700 2026-07-24 cs.CR 版本更新 50%

Facade: High-Precision Insider Threat Detection Using Deep Contextual Anomaly Detection

Facade:使用深度上下文异常检测的高精度内部威胁检测

Alex Kantchelian, Casper Neo, Ryan Stevens, Hyungwon Kim, Zhaohao Fu, Sadegh Momeni, Birkett Huber, Cem Topcuoglu, Senaka Buthpitiya, Elie Bursztein, Yanis Pavlidis, Martin Cochran, Massimiliano Poletto

专题命中 视频多模态 :multi-modal(abstract)

AI总结 研究内部人员特权访问带来的威胁,提出Facade系统,通过考虑事件上下文、基于多模态模型及对比学习策略检测可疑事件,能高精度检测内部威胁且误报率极低,可用于大型企业环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19827 2026-07-23 cs.RO cs.CY 新提交 50%

Clinical Pathways as Safety Specifications for Physical AI in Hospital Wards

临床路径作为医院病房物理人工智能的安全规范

Gabriele Franchini, Giulio Mallardi, Michele De Carolis, Filippo Lanubile

专题命中 视频多模态 :multimodal(abstract)

AI总结 研究针对医院病房物理人工智能系统的安全挑战,提出将临床路径作为安全规范,构建集成多种组件的概念性机器人架构,用运行时安全监视器结合多种方法识别安全违规,助力护理人员并为安全物理人工智能做贡献。

Comments 4 pages, 3 figures. Accepted at the 1st IJCAI Workshop on Safe Physical AI (SPAI 2026), held in conjunction with IJCAI-ECAI 2026, Bremen, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏