arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-27 至 2025-11-27 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 8 篇

2506.12336 2025-11-27 cs.CV 83%

Benchmarking the Trustworthiness in Multimodal LLMs for Video Understanding

对多模态大语言模型在视频理解中的可信度进行基准测试

Youze Wang, Zijun Chen, Ruoyu Chen, Shishen Gu, Wenbo Hu, Jiayang Liu, Yinpeng Dong, Hang Su, Jun Zhu, Meng Wang, Richang Hong

机构 * Hefei University of Technology(合肥工业大学) Tsinghua University(清华大学) Institute of Science Tokyo(东京科学研究所)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本研究提出Trust-videoLLMs基准,评估23种视频LLMs在真实性、鲁棒性、安全性和隐私等方面的表现,揭示其在动态场景理解及现实风险缓解中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21375 2025-11-27 cs.CV 70%

Thinking With Bounding Boxes: Enhancing Spatio-Temporal Video Grounding via Reinforcement Fine-Tuning

通过边界框思考:通过强化微调提升空间时间视频定位

Xin Gu, Haoji Zhang, Qihang Fan, Jingxuan Niu, Zhipeng Zhang, Libo Zhang, Guang Chen, Fan Chen, Longyin Wen, Sijie Zhu

机构 * ByteDance Intelligent Creation(字节跳动智能创作) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai Jiao Tong University(上海交通大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 STVG-o1通过强化微调提升空间时间视频定位性能,实现无需架构修改的先进结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16595 2025-11-27 cs.CV cs.AI cs.CL 67%

TimeViper: A Hybrid Mamba-Transformer Vision-Language Model for Efficient Long Video Understanding

TimeViper: 一种用于高效长视频理解的混合Mamba-Transformer视觉语言模型

Boshen Xu, Zihan Xiao, Jiaze Li, Jianzhong Ju, Zhenbo Luo, Jian Luan, Qin Jin

机构 * AIM3 Lab, Renmin University of China(中国人民大学人工智能实验室) MiLM Plus, Xiaomi Inc.(小米公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 TimeViper是一种混合Mamba-Transformer模型,通过TransV模块实现高效长视频理解,提升多模态处理能力。

Comments Project page: https://xuboshen.github.io/TimeViper; Code: https://github.com/xiaomi-research/timeviper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21439 2025-11-27 cs.CV cs.AI 62%

EvRainDrop: HyperGraph-guided Completion for Effective Frame and Event Stream Aggregation

EvRainDrop:基于超图的高效帧和事件流聚合

Futian Wang, Fan Zhang, Xiao Wang, Mengqi Wang, Dexing Huang, Jin Tang

机构 * School of Computer Science and Technology, Anhui University(计算机科学与技术学院,安徽大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 EvRainDrop通过超图引导的方法完成事件流,实现多模态特征的有效融合与学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17490 2025-11-27 cs.CV 57%

Video-R4: Reinforcing Text-Rich Video Reasoning with Visual Rumination

Video-R4:通过视觉沉思强化文本丰富的视频推理

Yolo Y. Tang, Daiki Shimada, Hang Hua, Chao Huang, Jing Bi, Rogerio Feris, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) Sony Group Corporation(索尼集团) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 Video-R4通过视觉沉思机制提升文本丰富视频的推理能力,采用多阶段学习框架实现像素基础的多模态推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01533 2025-11-27 cs.CV 57%

ReasonAct: Progressive Training for Fine-Grained Video Reasoning in Small Models

ReasonAct: 为小模型在细粒度视频推理中的渐进训练

Jiaxin Liu, Zhaolu Kang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 ReasonAct通过三阶段训练提升小模型细粒度视频推理性能,实现比基线更高的准确率和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21500 2025-11-27 cs.LG 50%

Lost in Time? A Meta-Learning Framework for Time-Shift-Tolerant Physiological Signal Transformation

时光流逝?一种用于时间偏移容忍生理信号转换的元学习框架

Qian Hong, Cheng Bian, Xiao Zhou, Xiaoyu Li, Yelei Li, Zijing Zeng

专题命中 视频多模态 :multimodal(abstract)

AI总结 ShiftSyncNet通过元学习框架自动缓解时间偏移对生理信号转换的影响,提升转换精度和标签质量。

Comments The 40th Annual AAAI Conference on Artificial Intelligence (AAAI 26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.04749 2025-11-27 astro-ph.HE 50%

Bayesian Black Hole Photogrammetry

贝叶斯黑洞摄影测量

Dominic O. Chang, Michael D. Johnson, Paul Tiede, Daniel C. M. Palumbo

专题命中 视频多模态 :multi-modal(abstract)

AI总结 该研究提出了一种双锥吸积模型,用于分析EHT观测的黑洞图像,并通过贝叶斯推断确定质量-距离比和倾角的范围。

详情

展开后加载摘要…

URL PDF HTML 收藏