arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4729 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4729 篇

2602.06866 2026-05-19 cs.LG 50%

T-STAR: A Context-Aware Transformer Framework for Short-Term Probabilistic Demand Forecasting in Dock-Based Shared Micro-Mobility

T-STAR: 一种基于上下文的Transformer框架用于基于码头的共享微出行短期概率需求预测

Jingyi Cheng, Gonçalo Homem de Almeida Correia, Oded Cats, Shadi Sharif Azadeh

机构 * Transport and Planning, Delft University of Technology(代尔夫特理工大学交通与规划)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出T-STAR框架,通过两级结构分离一致需求模式和短期波动,提升短期概率需求预测的准确性,实验表明其在确定性和概率性准确性上均优于现有方法,且具备良好的时空鲁棒性。

Comments This work has been submitted to Transportation Research Part C

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17701 2026-05-19 eess.SY cs.SY 50%

Architecture Dependent Temporal Observability Under Deployment Interference in Edge Inference Systems

边缘推理系统中部署干扰影响下的时间可观性依赖于架构

Akul Swami, Nikhil Chougule

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文研究了在边缘推理系统中部署干扰对时间可观性的影响,通过对比不同架构下的延迟分布和内存压力,发现单一时间源的统计信息可能掩盖了独立外部观察者可见的故障模式。

Comments 13 pages, 7 figures, 1 table. Workshop preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17123 2026-05-19 cs.HC cs.RO 50%

ATRACT: A Trustworthy Robotic Autonomous system to support Casualty Triage

ATRACT: 一种可靠的机器人自主系统以支持伤员分诊

Tasweer Ahmad, Rafael Pina, Sandip Pradhan, Arindam Sikdar, Mindula Illeperuma, Khizer Saeed, Peter Lee, Varuna De Silva, Ardhendu Behera

机构 * Department of Computer Science, Edge Hill University(埃德希尔大学计算机科学系) Institute for Digital Technologies, Loughborough University London(洛斯伯勒大学伦敦数字技术研究所) School of Architecture, Technology and Engineering, University of Brighton(布莱顿大学建筑、技术与工程学院) School of Criminology and Criminal Justice, University of Portsmouth(普茅斯大学犯罪学与刑事司法学院)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文提出ATRACT,一种人机协同的决策支持系统,通过多模态学习整合无人机视频与可穿戴传感器数据,以提高战场伤员分诊的准确性,同时减少前线医疗人员的风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.03147 2026-05-19 eess.SP 50%

Real-Time Non-Invasive Imaging and Detection of Spreading Depolarizations through EEG: An Ultra-Light Explainable Deep Learning Approach

实时非侵入式成像与检测扩散性去极化通过EEG:一种超轻量可解释深度学习方法

Yinzhe Wu, Sharon Jewell, Xiaodan Xing, Yang Nan, Anthony J. Strong, Guang Yang, Martyn G. Boutelle

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文提出一种超轻量多模态深度学习网络,通过融合EEG频谱图像和时间功率向量,提升单电极上的扩散性去极化检测精度,实现低密度EEG下的高效检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16285 2026-05-19 cs.HC cs.CY 50%

Making Sense of the Weather, Together: Collaborative Sensemaking in Severe Weather Livestreams

共同解读天气:在恶劣天气直播中协作意义建构

Julie A. Vera, Mark Zachry, David W. McDonald

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文研究恶劣天气事件中通过'天气主播'直播解读气象现象的协作意义建构,分析其如何利用多源信息、时间衔接技术和平台适应性,挑战传统危机沟通模式。

Comments Accepted to CSCW 2026; 29 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15952 2026-05-18 cs.HC cs.RO 50%

Driving Through the Network: Performance and Workload Under Latency and Video Impairment

通过网络驾驶:延迟和视频失真下的性能与负载

Ines Trautmannsheimer, Ahmed Azab, Frank Diermeyer

机构 * Technical University of Munich, School of Engineering and Design, Institute of Automotive Technology and Munich Institute of Robotics and Machine Intelligence (MIRMI)(慕尼黑工业大学,工程学院,汽车技术研究所,慕尼黑机器人与机器智能研究所(MIRMI))

专题命中 视频多模态 :multimodal(abstract)

AI总结 研究通过驾驶模拟器探讨网络延迟和视频质量对驾驶员性能和负载的影响,发现延迟和带宽增加会提升操作负荷,但生理指标显示亚加性交互作用,而性能和眼动指标交互作用较小。

Comments Preprint of VEHITS 2026 : 12th International Conference on Vehicle Technology and Intelligent Transport Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15356 2026-05-18 math.NA cs.NA stat.ML 50%

Proposal-Guided Greedy Surrogate Refinement for PDE-Driven High-Dimensional Rare-Event Estimation

基于提案的贪心替代模型细化用于PDE驱动的高维稀有事件估计

Zhiwei Gao, George Karniadakis

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出一种替代模型辅助的自适应重要采样框架,通过局部细化替代模型提升高维稀有事件模拟的准确性,减少高保真评估次数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10892 2026-05-15 cs.RO cs.MA 50%

HECTOR: Human-centric Hierarchical Coordination and Supervision of Robotic Fleets under Continual Temporal Tasks

HECTOR:面向人本的机器人舰队层级协调与监督方案

Shen Wang, Yinhang Luo, Jie Li, Meng Guo

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) National University of Defense Technology(国防科技大学)

专题命中 视频多模态 :multimodal(abstract)

AI总结 HECTOR提出一种面向人本的机器人舰队协调与监督方案,通过三级层级结构实现动态任务分配与协调,提升计算效率并减少人工干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14070 2026-05-15 cs.NI 50%

WirelessSenseLLM: Zero-Shot Human Activity Understanding by Bridging Wireless Signals and Human Language

WirelessSenseLLM: 通过连接无线信号与人类语言实现零样本人体活动理解

Mahmuda Keya, Sneh Pillai, Jiawei Yuan, Kai Zeng, Long Jiao

专题命中 视频多模态 :cross-modal(abstract)

AI总结 WirelessSenseLLM通过引入CSI到语言适配器和跨模态投影机制,利用大语言模型实现从未分割的Wi-Fi CSI信号中零样本人体活动理解,提升了动作识别和语言推理性能。

Comments Accepted at IEEE SECON 2026. 9 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12735 2026-05-14 cs.RO 50%

The Unified Autonomy Stack: Toward a Blueprint for Generalizable Robot Autonomy

统一自主栈:迈向通用机器人自主性的蓝图

Mihir Dharmadhikari, Nikhil Khedekar, Mihir Kulkarni, Morten Nissov, Martin Jacquet, Angelos Zacharia, Marvin Harms, Albert Gassol Puigjaner, Philipp Weiss, Kostas Alexis

机构 * Autonomous Robots Lab(自主机器人实验室)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文提出统一自主栈,通过多模态感知、多行为规划和多层安全导航模块实现通用机器人自主性,经实地测试验证其在复杂环境中的鲁棒性。

Comments 35 pages, 22 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11120 2026-05-13 cs.IT cs.SY eess.SP eess.SY math.IT stat.ML 50%

Sensor Design for Accuracy-Bounded Estimation via Maximum-Entropy Likelihood Synthesis

通过最大熵似然合成实现精度受限的估计器设计

Raktim Bhattacharya

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出通过最大熵后验进行似然合成,以在给定误差预算下实现高精度估计,适用于时空系统的大规模传感架构设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01427 2026-05-05 cs.RO 50%

SixthSense: Task-Agnostic Proprioception-Only Whole-Body Wrench Estimation for Humanoids

SixthSense:面向人类oid的无任务依赖的本体感知-only全身 wrench 估计

Xingzhou Chen, Xiayan Xu, Yan Ning, Jiyu Yu, Yizheng Zhang, Siyi Qian, Lingzhu Xiang, Jiahao Chen, Yuquan Wang, Haodong Zhang, Ling Shi

机构 * The Hong Kong University of Science and Technology(香港理工大学) Zhejiang University(浙江大学) Tencent Robotics X(腾讯机器人实验室)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文提出SixthSense,一种基于本体感知和IMU数据的无任务依赖方法,用于估计人类oid的全身接触时间和位置及外部wrench,解决浮动物理动力学和不确定接触位置的难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07645 2026-05-01 cs.RO 50%

From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback

从动作标签到集合:重新思考基于纠正反馈的模仿学习中的动作监督

Zhaoting Li, Rodrigo Pérez-Dattari, Robert Babuska, Cosimo Della Santina, Jens Kober

机构 * Delft University of Technology, The Netherlands(代尔夫特理工大学,荷兰) KTH, Sweden(瑞典皇家理工学院) University of Stuttgart, Germany(斯图加特大学)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文提出CLIC方法,通过将点状监督替换为集合值动作目标,提升在不准确反馈下的模仿学习效果,实验表明其在不同场景下具有更高的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27508 2026-05-01 cs.RO 50%

SASI: Leveraging Sub-Action Semantics for Robust Early Action Recognition in Human-Robot Interaction

SASI:利用子动作语义实现人机交互中鲁棒的早期动作识别

Yongpeng Cao, Masahiro Hirano, Hyuno Kim, Yuji Yamakawa

机构 * Institute of Industrial Science, The University of Tokyo(东京大学工业科学研究所) Interfaculty Initiative in Information Studies, Graduate School of Interdisciplinary Information Studies, The University of Tokyo(东京大学跨学际信息研究学院信息研究联合计划)

专题命中 视频多模态 :cross-modal(abstract)

AI总结 本文提出SASI框架,通过融合时空特征与子动作语义提升人机交互中早期动作识别的鲁棒性,实验表明其在识别精度和部分动作序列理解方面优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27497 2026-05-01 cs.CR cs.CY 50%

SST-Guard: Detecting and Characterizing Server-Side Google Analytics in the Wild

SST-Guard:检测和表征野外的服务器端Google Analytics

Muhammad Jazlan, Alexander Gamero-Garrido, Zubair Shafiq, Yash Vekaria

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文提出SST-Guard系统,通过多模态方法检测和阻止服务器端Google Analytics,通过匹配语义值模式提高检测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27131 2026-05-01 cs.IR 50%

LLM-Enhanced Topical Trend Detection at Snapchat

基于大语言模型的Snapchat话题趋势检测

Hangqi Zhao, Jay Li, Abhiruchi Bhattacharya, Cong Ni, Jason Yeung, Jinchao Ye, Kai Yang, Akshat Malu, Manish Malik

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出一个大规模系统,利用多模态主题提取、时间序列爆发检测和大语言模型进行整合与丰富,实现Snapchat上新兴话题趋势的准确及时发现,首次在短视频平台实现生产级话题趋势检测系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19554 2026-04-28 cs.LG 50%

MobText-SISA: Efficient Machine Unlearning for Mobility Logs with Spatio-Temporal and Natural-Language Data

MobText-SISA:基于时空和自然语言数据的高效机器反学习

Haruki Yonekura, Ren Ozeki, Tatsuya Amano, Hamada Rizk, Hirozumi Yamaguchi

机构 * The University of Osaka(大阪大学) RIKEN Center for Computational Science(理化学研究所计算科学中心) Tanta University(塔塔大学)

专题命中 视频多模态 :multimodal(abstract)

AI总结 MobText-SISA通过扩展SISA训练方法,实现对异构时空数据的高效机器反学习,保持预测精度并优于随机分片方法,为城市规模的多模态移动数据隐私合规分析提供基础。

Comments Accepted to The 33rd ACM International Conference on Advances in Geographic Information Systems(SIGSPATIAL '25) as a short paper in the Short Paper Track

Journal ref In Proceedings of the 33rd ACM International Conference on Advances in Geographic Information Systems (SIGSPATIAL '25), 2025, pp. 1186-1189

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22575 2026-04-27 cs.LG 50%

SpikingBrain2.0: Brain-Inspired Foundation Models for Efficient Long-Context and Cross-Platform Inference

SpikingBrain2.0:面向高效长上下文和跨平台推理的脑启发基础模型

Yuqi Pan, Jinghao Zhuang, Yupeng Feng, Fangzhi Zhong, Siyu Ding, Xuerui Qiu, Shaowei Gu, Bohan Sun, Zhiyong Qin, Yibo Zhong, Lingtao Ouyang, Kun Yang, Zehao Liu, Yuhong Chou, Shurong Wang, Anjie Hu, Han Xu, Bo Xu, Guoqi Li

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Key Laboratory of Brain-Inspired General Intelligence Large Model(北京脑启发通用智能大模型重点实验室) Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology(脑认知与脑启发智能技术重点实验室) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视频多模态 :multimodal(abstract)

AI总结 SpikingBrain2.0通过双空间稀疏注意力机制和优化训练策略,在保持性能的同时提升长上下文处理效率,实现跨平台高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22043 2026-04-27 physics.soc-ph cs.LG 50%

Audio Video Verbal Analysis (AVVA) for Capturing Classroom Dialogues

音频视频言语分析(AVVA)用于捕捉课堂对话

Vivek Upadhyay, Amaresh Chakrabarti

机构 * Department of Design and Manufacturing, Indian Institute of Science(设计与制造系,印度科学研究院)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出AVVA框架,通过整合定性解释与定量建模,提升课堂对话分析的可扩展性与严谨性,验证了其在23小时课堂录音中的实用性。

Comments 42 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07818 2026-04-27 cs.MA 50%

Open-Ended Video Game Glitch Detection with Agentic Reasoning and Temporal Grounding

基于代理推理和时间定位的开放式视频游戏漏洞检测

Muyang Zheng, Tong Zhou, Geyang Wu, Zihao Lin, Haibo Wang, Lifu Huang

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出VideoGlitchBench基准和GliDe框架,通过代理推理和时间定位检测视频游戏中的漏洞,提升语义理解和时间定位能力。

Comments 16 pages, 10 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03540 2026-04-22 cs.RO 50%

Drift-Based Policy Optimization: Native One-Step Policy Learning for Online Robot Control

基于漂移的策略优化:面向在线机器人控制的原生一步生成策略

Yuxuan Gao, Yedong Shen, Shiqi Zhang, Wenhao Yu, Yifan Duan, Jia pan, Jiajia Wu, Jiajun Deng, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出一种原生一步生成策略框架,通过将迭代细化移至训练阶段,提升在线机器人控制的效率与稳定性,实验显示其在推理速度和性能上优于多步扩散策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08491 2026-04-21 cs.HC 50%

Figures as Interfaces: Toward LLM-Native Artifacts for Scientific Discovery

图表作为接口:迈向面向大语言模型的科学发现原生图件

Yifang Wang, Rui Sheng, Erzhuo Shao, Yifan Qian, Haotian Li, Nan Cao, Dashun Wang

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出LLM原生图件概念,通过融合语言-视觉接口,实现数据驱动的可解释图件,提升科学发现的可重复性和透明性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17493 2026-04-17 physics.plasm-ph 50%

DustNET: enabling machine learning and AI models of dusty plasmas

DustNET: 使尘埃等离子体的机器学习和人工智能模型成为可能

Zhehui Wang, Justin C. Burton, Niklas Dormagen, Cheng-Ran Du, Yan Feng, John E. Foster, Susan S. Glenn, Max Klein, Christina A. Knapek, Lorin Matthews, André Melzer, Edward Thomas, Chuji Wang, Jalaan Avritte, Shan Chang, Neeraj Chaubey, Pubuduni Ekanayaka, John A. Goree, Truell Hyde, Chen Liang, Zhuang Liu, Zhuang Ma, Ilya Nemenman, Elon Price, A. S. Schmitz, Mike Schwarz, Saikat C. Thakur, M. H. Thoma, Hubertus M. Thomas, L. Wimmer, Wei Yang, Zimu Yang, Xiaoman Zhang

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文探讨了DustNET框架,通过整合实验、模拟和合成数据,利用机器学习和人工智能方法,实现尘埃等离子体的多尺度预测和不确定性量化。

Comments 61 pages, 35 figures, 490+ references

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01728 2026-04-17 cs.RO cs.LG cs.LO 50%

Constrained Decoding for Safe Robot Navigation Foundation Models

安全机器人导航基础模型的约束解码

Parv Kapoor, Akila Ganlath, Michael Clifford, Changliu Liu, Sebastian Scherer, Eunsuk Kang

机构 * Carnegie Mellon University(卡内基梅隆大学) Toyota InfoTech Labs(丰田信息科技实验室)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出SafeDec框架,通过约束解码确保机器人导航基础模型满足信号时间逻辑规范,提升安全性和行动生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13241 2026-04-16 cs.CE 50%

Early-Warning Learner Satisfaction Forecasting in MOOCs via Temporal Event Transformers and LLM Text Embeddings

通过时间事件Transformer和LLM文本嵌入在MOOCs中进行学习者满意度预警预测

Anna Kowalczyk, Jakub Kowalski

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文提出TET-LLM框架,结合时间事件Transformer、LLM嵌入和短文本主题分布,通过早期信号预测学习者满意度,实验表明其在7天预警范围内RMSE为0.82,AUC为0.77。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11128 2026-04-14 cs.AR 50%

Technology solutions targeting the performance of gen-AI inference in resource constrained platforms

面向资源受限平台的生成式AI推理性能的技术解决方案

Joyjit Kundu, Joshua Klein, Aakash Patel, Dwaipayan Biswas

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文针对生成式AI推理在资源受限平台上的内存压力问题,提出两种技术方案,通过分层屋顶线分析模型评估其在容量和带宽上的性能影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20380 2026-04-14 cs.LG 50%

TESSERA: Temporal Embeddings of Surface Spectra for Earth Representation and Analysis

TESSERA:表面光谱的时间嵌入用于地球表示与分析

Zhengpeng Feng, Clement Atzberger, Sadiq Jaffer, Jovana Knezevic, Silja Sormunen, Robin Young, Madeline C. Lisaius, Markus Immitzer, Toby Jackson, James Ball, David A. Coomes, Anil Madhavapeddy, Andrew Blake, Srinivasan Keshav

机构 * University of Cambridge(剑桥大学) dClimate Labs(dClimate实验室) Aalto University(阿尔托大学) University of Bristol(布里斯托大学)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 TESSERA通过多模态遥感时间序列学习鲁棒嵌入,提升植被物候分析的准确性与效率,提供轻量级工具支持大规模地球观测任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09159 2026-04-13 cs.LG 50%

Truncated Rectified Flow Policy for Reinforcement Learning with One-Step Sampling

截断修正流策略用于具有一步采样的强化学习

Xubin Zhou, Yipeng Yang, Zhan Li

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出TRFP框架,通过混合确定性-随机性架构解决MaxEnt RL中连续时间生成策略的可微性问题,实现稳定训练和有效一步采样,实验表明其在多目标环境和MuJoCo基准中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08443 2026-04-10 cs.RO cs.HC 50%

A Soft Robotic Interface for Chick-Robot Affective Interactions

一种柔软的机器人接口用于鸡-机器人情感互动

Jue Chen, Alexander Mielke, Kaspar Althoefer, Elisabetta Versace

机构 * Queen Mary University of London(伦敦玛丽女王大学) School of Biological and Behavioural Sciences, Queen Mary University of London(伦敦玛丽女王大学生物与行为科学学院)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出了一种以动物为中心的柔软机器人情感接口,用于新生鸡的机器人情感互动研究,通过温度、呼吸样变形和面孔状视觉刺激等安全可控的提示,评估鸡对接口的接受度及与机器人互动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05507 2026-04-08 cs.CY 50%

From Pixels to Personas: Tracking the Evolution of Anime Characters

从像素到人物:动漫角色演变的追踪

Rongze Liu, Jiaxin Pei, Jian Zhu

专题命中 视频多模态 :multimodal(abstract)

AI总结 研究通过大规模多模态数据集分析动漫角色演变,结合LLM提取的性格特征与视觉特征,揭示观众群体从儿童向青少年过渡,角色设计呈现萌系化趋势,视觉信号比性格特征更主导观众偏好。

Comments Accepted at the 20th International AAAI Conference on Web and Social Media (ICWSM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏