arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-09-17 至 2025-09-17 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 5 篇

2509.12893 2025-09-17 cs.CV 83%

MEJO: MLLM-Engaged Surgical Triplet Recognition via Inter- and Intra-Task Joint Optimization

Yiyi Zhang, Yuchen Yuan, Ying Zheng, Jialun Pei, Jinpeng Li, Zheng Li, Pheng-Ann Heng

专题命中 视频多模态 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12269 2025-09-17 cs.LG cs.IR 71%

Research on Short-Video Platform User Decision-Making via Multimodal Temporal Modeling and Reinforcement Learning

Jinmeiyang Wang, Jing Dong, Li Zhou

专题命中 视频多模态 :multimodal(title)

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12231 2025-09-17 cs.DC 67%

Research on fault diagnosis and root cause analysis based on full stack observability

Jian Hou

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12876 2025-09-17 cs.CL cs.MM 62%

Benchmarking and Improving LVLMs on Event Extraction from Multimedia Documents

Fuyu Xing, Zimu Wang, Wei Wang, Haiyang Zhang

机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(先进技术学院,西安交通大学利物浦大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CL、cs.MM

Comments Accepted at INLG 2025. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12741 2025-09-17 cs.RO cs.AI cs.LG 57%

Force-Modulated Visual Policy for Robot-Assisted Dressing with Arm Motions

Alexis Yihong Hao, Yufei Wang, Navin Sriram Ravie, Bharath Hegde, David Held, Zackory Erickson

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Department of Engineering Design, Indian Institute of Technology, Madras(印度理工学院Madras分校工程设计系)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

Comments CoRL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏