arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-06 至 2026-02-06 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 5 篇

2602.04104 2026-02-06 cs.HC 82%

Making Videos Accessible for Blind and Low Vision Users Using a Multimodal Agent Video Player

通过多模态代理视频播放器使视频对视障和低视力用户更加可访问

Adriana Olmos, Anoop K. Sinha, Renelito Delos Santos, Ruben Rodriguez Rodriguez, James A. Landay, Sam S. Sepah, Philip Nelson, Shaun K. Kane

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract)

AI总结 本文提出一种多模态代理视频播放器,通过多层提示编排为视障和低视力用户带来交互式、可访问的视频体验,增强用户自主性和信任感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05986 2026-02-06 cs.CV cs.AI 62%

RISE-Video: Can Video Generators Decode Implicit World Rules?

RISE-Video: 视频生成器能否解码隐含的世界规则?

Mingxin Liu, Shuran Ma, Shibei Meng, Xiangyu Zhao, Zicheng Zhang, Shaofeng Zhang, Zhihang Zhong, Peixian Chen, Haoyu Cao, Xing Sun, Haodong Duan, Xue Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Youtu Lab(腾讯优图实验室) Xidian University(西安电子科技大学) Beijing Normal University(北京师范大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 RISE-Video通过多维评估框架评估视频生成模型在隐含世界规则推理能力,揭示其在复杂场景模拟中的不足,推动未来生成模型的发展。

Comments 38 pages, 16 figures, 3 tables; Code: https://github.com/VisionXLab/RISE-Video; HuggingFace: https://huggingface.co/datasets/VisionXLab/RISE-Video

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05853 2026-02-06 cs.CL 57%

RRAttention: Dynamic Block Sparse Attention via Per-Head Round-Robin Shifts for Long-Context Inference

RRAttention: 通过每头轮换位移实现动态块稀疏注意力以支持长上下文推理

Siran Liu, Guoxia Wang, Sa Wang, Jinle Zeng, HaoYang Xie, Siyu Lou, JiaBin Yang, DianHai Yu, Haifeng Wang, Chao Yang

机构 * Baidu Inc.(百度公司) Peking University(北京大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 RRAttention通过轮换位移策略实现动态块稀疏注意力,提升长上下文推理效率,实现99%的完整注意力性能和2.4倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05829 2026-02-06 cs.CV 57%

Weaver: End-to-End Agentic System Training for Video Interleaved Reasoning

Weaver:用于视频交织推理的端到端代理系统训练

Yudi Shi, Shangzhe Di, Qirui Chen, Qinian Wang, Jiayin Cai, Xiaolong Jiang, Yao Hu, Weidi Xie

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 Weaver通过端到端训练多模态推理代理系统,提升视频推理任务在长视频处理上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05514 2026-02-06 cs.CE 50%

Detecting Information Channels in Congressional Trading via Temporal Graph Learning

通过时序图学习检测国会交易中的信息通道

Benjamin Pham Roodman, Eugene Sy, J. Xavier Atero Vázquez, Yu-Shiang Huang, Che Lin, Chaun-Ju Wang

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出利用时序图学习方法,通过分析国会与企业之间的动态关系,识别出在股票交易中可能具备信息优势的通道。

详情

展开后加载摘要…

URL PDF HTML 收藏