arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-15 至 2026-01-15 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 5 篇

2601.09430 2026-01-15 cs.CV 57%

Video-MSR: Benchmarking Multi-hop Spatial Reasoning Capabilities of MLLMs

Video-MSR: 多跳空间推理能力的MLLMs基准测试

Rui Zhu, Xin Shen, Shuchen Wu, Chenxi Miao, Xin Yu, Yang Li, Weikang Li, Deguo Xia, Jizhou Huang

机构 * Baidu Inc.(百度公司) Nanjing University(南京大学) The University of Queensland(昆士兰大学) Peking University(北京大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 Video-MSR通过四个任务评估MLLMs的多跳空间推理能力,发现模型在复杂推理中存在显著不足,并通过微调提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09350 2026-01-15 cs.CV 57%

See More, Store Less: Memory-Efficient Resolution for Video Moment Retrieval

看清更多,存储更少:视频时刻检索的内存高效解决方案

Mingyu Jeon, Sungjin Han, Jinkwon Hwang, Minchol Kwon, Jonghee Kim, Junyeong Kim

机构 * Department of Artificial Intelligence, Chung-Ang University(人工智能系, Chung-Ang 大学) Electronics and Telecommunications Research Institute (ETRI)(电子与电信研究院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 SMORE通过查询引导的描述和自适应压缩技术,在视频时刻检索中实现高信息分辨率与内存效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09031 2026-01-15 cs.RO cs.AI 57%

Generalizable Geometric Prior and Recurrent Spiking Feature Learning for Humanoid Robot Manipulation

可推广的几何先验与递归脉冲特征学习用于双足机器人操作

Xuetao Li, Wenke Huang, Mang Ye, Jifeng Xuan, Bo Du, Sheng Liu, Miao Li

机构 * School of Computer Science, School of Robotics, Institute of Technological Sciences, Wuhan University(计算机学院、机器人学院、技术科学研究院、武汉大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出RGMP-S方法,通过几何先验和递归脉冲网络提升双足机器人操作的泛化能力与数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08587 2026-01-15 cs.CV 57%

MoCha:End-to-End Video Character Replacement without Structural Guidance

MoCha:端到端视频人物替换无需结构引导

Zhengbo Xu, Jie Ma, Ziheng Wang, Zhan Peng, Jun Liang, Jing Li

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 MoCha提出了一种无需结构引导的端到端视频人物替换方法,通过单帧掩码实现高效替换,并设计了三种数据集以克服数据稀缺问题。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07235 2026-01-15 cs.IT math.IT 50%

Sentiment Analysis on Movie Reviews: A Deep Dive into Modern Techniques and Open Challenges

对电影评论的情感分析:深入探讨现代技术和开放挑战

Agnivo Gosai, Shuvodeep De, Karun Thankachan, Ramadan A. ZeinEldin, Ali W. Mohamed, Seyed J. Mousavirad

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文综述了电影评论情感分析的现代技术和挑战,涵盖从传统方法到深度学习模型的发展,并探讨了多模态分析、可解释性及未来研究方向。

Comments 31 Pages; 1 figure; 108 references; paper under review in APIN

详情

展开后加载摘要…

URL PDF HTML 收藏