Making Videos Accessible for Blind and Low Vision Users Using a Multimodal Agent Video Player
通过多模态代理视频播放器使视频对视障和低视力用户更加可访问
专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract)
AI总结 本文提出一种多模态代理视频播放器,通过多层提示编排为视障和低视力用户带来交互式、可访问的视频体验,增强用户自主性和信任感。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
通过多模态代理视频播放器使视频对视障和低视力用户更加可访问
专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract)
AI总结 本文提出一种多模态代理视频播放器,通过多层提示编排为视障和低视力用户带来交互式、可访问的视频体验,增强用户自主性和信任感。
RISE-Video: 视频生成器能否解码隐含的世界规则?
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tencent Youtu Lab(腾讯优图实验室) ; Xidian University(西安电子科技大学) ; Beijing Normal University(北京师范大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 RISE-Video通过多维评估框架评估视频生成模型在隐含世界规则推理能力,揭示其在复杂场景模拟中的不足,推动未来生成模型的发展。
Comments 38 pages, 16 figures, 3 tables; Code: https://github.com/VisionXLab/RISE-Video; HuggingFace: https://huggingface.co/datasets/VisionXLab/RISE-Video
RRAttention: 通过每头轮换位移实现动态块稀疏注意力以支持长上下文推理
机构 * Baidu Inc.(百度公司) ; Peking University(北京大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CL
AI总结 RRAttention通过轮换位移策略实现动态块稀疏注意力,提升长上下文推理效率,实现99%的完整注意力性能和2.4倍加速。
Weaver:用于视频交织推理的端到端代理系统训练
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 Weaver通过端到端训练多模态推理代理系统,提升视频推理任务在长视频处理上的性能。
通过时序图学习检测国会交易中的信息通道
专题命中 视频多模态 :multimodal(abstract)
AI总结 本文提出利用时序图学习方法,通过分析国会与企业之间的动态关系,识别出在股票交易中可能具备信息优势的通道。