arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-08-29 至 2025-08-29 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4 篇

2507.04651 2025-08-29 cs.IR 85%

FindRec: Stein-Guided Entropic Flow for Multi-Modal Sequential Recommendation

Maolin Wang, Yutian Xiao, Binhao Wang, Sheng Zhang, Shanshan Ye, Wanyu Wang, Hongzhi Yin, Ruocheng Guo, Zenglin Xu

专题命中 视频多模态 :multi-modal(title,abstract);multimodal(abstract);cross-modal(abstract)

Comments Accepted by KDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20121 2025-08-29 cs.NE cs.SY eess.IV eess.SY 71%

Task-Aware Tuning of Time Constants in Spiking Neural Networks for Multimodal Classification

Chiu-Chang Cheng, Kapil Bhardwaj, Ya-Ning Chang, Sayani Majumdar, Chao-Hung Wang

专题命中 视频多模态 :multimodal(title)

Comments 25 Pages and 5 Figures and a supplementary discussion as well

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21070 2025-08-29 cs.CV cs.LG 57%

Dress&Dance: Dress up and Dance as You Like It - Technical Preview

Jun-Kun Chen, Aayush Bansal, Minh Phuoc Vo, Yu-Xiong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) SpreeAI

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments Project Page: https://immortalco.github.io/DressAndDance/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19958 2025-08-29 cs.RO 50%

Long-VLA: Unleashing Long-Horizon Capability of Vision Language Action Model for Robot Manipulation

Yiguo Fan, Pengxiang Ding, Shuanghao Bai, Xinyang Tong, Yuyang Zhu, Hongchao Lu, Fengqi Dai, Wei Zhao, Yang Liu, Siteng Huang, Zhaoxin Fan, Badong Chen, Donglin Wang

专题命中 视频多模态 :multimodal(abstract)

Comments Accepted to CoRL 2025; Github Page: https://long-vla.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏