arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-27 至 2026-01-27 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 10 篇

2503.18712 2026-01-27 cs.CV 83%

LLaVAction: evaluating and training multi-modal large language models for action understanding

LLaVAction:评估和训练多模态大语言模型进行动作理解

Haozhe Qi, Shaokai Ye, Alexander Mathis, Mackenzie W. Mathis

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 LLaVAction通过引入动作标记和两阶段流程提升多模态大语言模型的动作理解能力,显著提升基准测试性能。

Comments https://github.com/AdaptiveMotorControlLab/LLaVAction

Journal ref International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17466 2026-01-27 cs.HC cs.AI cs.CL 81%

Autiverse: Eliciting Autistic Adolescents' Daily Narratives through AI-guided Multimodal Journaling

Autiverse: 通过AI引导的多模态日记记录 eliciting 自闭症青少年的日常叙述

Migyeong Yang, Kyungah Lee, Jinyoung Han, SoHyun Park, Young-Ho Kim

机构 * NAVER AI Lab(NAVER AI实验室) Dodakim Child Development Center(Dodakim儿童发展中心) Sungkyunkwan University(松均大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 Autiverse通过AI引导的多模态日记记录帮助自闭症青少年组织日常经历,提升叙述能力并增强自主感。

Comments 19 pages excluding reference. Conditionally accepted to ACM CHI 2026

Journal ref In Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26), April 13-17, 2026, Barcelona, Spain. ACM, New York, NY, USA, 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17041 2026-01-27 cs.CV cs.AI 81%

Arabic Sign Language Recognition using Multimodal Approach

阿拉伯手语识别的多模态方法

Ghadeer Alanazi, Abir Benabid

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出结合Leap Motion和RGB摄像头的多模态方法,用于提高阿拉伯手语识别的准确率,实验结果显示78%的识别准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17123 2026-01-27 cs.HC cs.CV cs.RO 79%

Acoustic Field Video for Multimodal Scene Understanding

用于多模态场景理解的声学场视频

Daehwa Kim, Chris Harrison

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出声学场视频作为多模态场景理解的新输入方式,通过整合空间声学数据显著提升视觉-语言模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17611 2026-01-27 eess.AS cs.LG cs.SD eess.IV eess.SP 70%

ToS: A Team of Specialists ensemble framework for Stereo Sound Event Localization and Detection with distance estimation in Video

ToS: 一种针对视频中立体声音事件定位与检测的专家团队集成框架,包含距离估计

Davide Berghi, Philip J. B. Jackson

机构 * Centre for Vision, Speech Signal Processing (CVSSP) University of Surrey, Guildford, U.K.

专题命中 视频多模态 :multimodal(abstract);audio-visual(abstract);分类 eess.AS

AI总结 ToS框架通过整合三个互补子网络,有效解决视频中立体声音事件定位与检测的多维度推理问题,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08487 2026-01-27 cs.CV cs.AI cs.MA 62%

MAViS: A Multi-Agent Framework for Long-Sequence Video Storytelling

MAViS:一个用于长序列视频叙事的多智能体框架

Qian Wang, Ziqi Huang, Ruoxi Jia, Paul Debevec, Ning Yu

机构 * Virginia Tech(弗吉尼亚理工大学) Nanyang Technological University(南洋理工大学) Eyeline Studios(Eyeline工作室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 MAViS通过多智能体协作框架提升长序列视频生成的辅助能力、视觉质量和表达性,支持多模态输出。

Comments Video Generation Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06835 2026-01-27 cs.CV 57%

X-LeBench: A Benchmark for Extremely Long Egocentric Video Understanding

X-LeBench:一个用于极长第一人称视频理解的基准数据集

Wenqi Zhou, Kai Cao, Hao Zheng, Yunze Liu, Xinyi Zheng, Miao Liu, Per Ola Kristensson, Walterio Mayol-Cuevas, Fan Zhang, Weizhe Lin, Junxiao Shen

机构 * University of Bristol(布里斯托大学) University of Manchester(曼彻斯特大学) University of Cambridge(剑桥大学) College of AI, Tsinghua University(清华大学人工智能学院) Meta Memories.ai Research(Memories.ai研究)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 X-LeBench通过模拟真实日常生活场景,构建了首个极长第一人称视频理解基准数据集,揭示了长视频理解中的关键挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02621 2026-01-27 physics.soc-ph cond-mat.stat-mech 50%

From motifs to Lévy flights: Modeling urban mobility in Bogotá's public transport system

从模式到莱维飞行:对波哥大公共交通系统的机动性建模

Juan F. Alayón-Martínez, Alejandro P. Riascos

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文通过分析波哥大公共交通系统的通行记录,发现其移动模式符合莱维飞行动力学,提出了一种基于用户记录的复杂交通系统分析新方法。

Comments 20 pages, 7 figures

Journal ref J. Stat. Mech. (2026) 013403

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03400 2026-01-27 cs.RO 50%

Close-Fitting Dressing Assistance Based on State Estimation of Feet and Garments with Semantic-based Visual Attention

基于足部与衣物状态估计的近身穿衣辅助

Takuma Tsukakoshi, Tamon Miyake, Tetsuya Ogata, Yushi Wang, Takumi Akaishi, Shigeki Sugano

机构 * Creative Science and Engineering Faculty, Waseda Univ.(早稻田大学创意科学与工程学部) Future Robotics Organization, Waseda Univ.(早稻田大学未来机器人组织) Faculty of Science and Engineering, Waseda Univ.(早稻田大学科学与工程学部) The National Institute of Advanced Science and Technology(日本国家先进科学与技术研究院)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本研究提出基于语义信息的穿衣辅助方法,通过多模态数据融合实现对足部和衣物状态的精准估计,成功帮助10名受试者穿袜子,优于其他方法。

Comments Accepted at RA-L, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08684 2026-01-27 cs.RO 50%

A Computationally Efficient Maximum A Posteriori Sequence Estimation via Stein Variational Inference

通过Stein变分推断实现计算高效的最大后验序列估计

Min-Won Seo, Solmaz S. Kia

机构 * Department of Mechanical and Aerospace Engineering, University of California, Irvine(加州大学尔湾分校机械与航空航天工程系)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出Stein-MAP-Seq方法,通过整合Stein变分梯度下降与动态规划算法,实现高效多模态状态估计。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏