arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-23 至 2026-02-23 共收录 3 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 3 篇

2602.17869 2026-02-23 cs.CV 83%

Learning Compact Video Representations for Efficient Long-form Video Understanding in Large Multimodal Models

学习紧凑的视频表示以在大规模多模态模型中实现高效的长视频理解

Yuxiao Chen, Jue Wang, Zhikang Zhang, Jingru Yi, Xu Zhang, Yang Zou, Zhaowei Cai, Jianbo Yuan, Xinyu Li, Hao Yang, Davide Modolo

机构 * Amazon AGI(亚马逊人工智能研究院)

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出了一种端到端的长视频理解框架,结合自适应视频采样器和空间时间视频压缩器,以高效处理长视频的冗余问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17785 2026-02-23 cs.CV 74%

Multi-Modal Monocular Endoscopic Depth and Pose Estimation with Edge-Guided Self-Supervision

多模态单目内窥镜深度与姿态估计与边缘引导自监督学习

Xinwei Ju, Rema Daher, Danail Stoyanov, Sophia Bano, Francisco Vasconcelos

机构 * UCL Hawkes Institute, Department of Computer Science(伦敦大学学院UCL霍克斯研究所、计算机科学系)

专题命中 视频多模态 :multi-modal(title);分类 cs.CV

AI总结 PRISM通过边缘引导自监督学习,结合解剖学和照明先验知识,提升内窥镜单目深度与姿态估计性能。

Comments 14 pages, 6 figures; early accepted by IPCAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18258 2026-02-23 cs.RO cs.CV 57%

RoEL: Robust Event-based 3D Line Reconstruction

RoEL: 基于事件的稳健3D线条重建

Gwangtak Bae, Jaeho Shin, Seunggu Kang, Junho Kim, Ayoung Kim, Young Min Kim

机构 * Dept. of Electrical and Computer Engineering, Seoul National University(电子与计算机工程系,首尔国立大学) Dept. of Future Automotive Mobility, Seoul National University(未来汽车移动系,首尔国立大学) Dept. of Mechanical Engineering, Seoul National University(机械工程系,首尔国立大学) University of Michigan(密歇根大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 RoEL通过稳健的3D线条重建方法,提升事件相机在复杂环境中的映射与姿态估计性能。

Comments IEEE Transactions on Robotics (T-RO)

详情

展开后加载摘要…

URL PDF HTML 收藏