arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-05 至 2025-12-05 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4 篇

2512.04356 2025-12-05 cs.CV cs.AI cs.CL cs.LG 85%

Mitigating Object and Action Hallucinations in Multimodal LLMs via Self-Augmented Contrastive Alignment

通过自增强对比对齐缓解多模态大语言模型中的对象和动作幻觉

Kai-Po Chang, Wei-Yuan Cheng, Chi-Pin Huang, Fu-En Yang, Yu-Chiang Frank Wang

机构 * Graduate Institute of Communication Engineering, National Taiwan University(国家交通大学通信工程研究所) NVIDIA

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 SANTA框架通过自增强对比对齐方法,有效缓解多模态大语言模型中的对象和动作幻觉问题。

Comments IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026. Project page: https://kpc0810.github.io/santa/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21908 2025-12-05 cs.LG 82%

Multi-Modal Machine Learning for Early Trust Prediction in Human-AI Interaction Using Face Image and GSR Bio Signals

多模态机器学习在人机交互中早期信任预测中的应用:利用面部图像和GSR生物信号

Hamid Shamszare, Avishek Choudhury

专题命中 视频多模态 :multi-modal(title,abstract);multimodal(abstract)

AI总结 本研究提出多模态机器学习框架,结合面部图像和GSR生物信号,用于预测人机交互中AI或人类推荐的早期信任,通过多模态堆叠集成提升预测性能。

Comments This version contains errors in content presentation and arrangement, so it is being withdrawn until a corrected version is generated

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23400 2025-12-05 astro-ph.IM astro-ph.SR 67%

Solar flare forecasting with foundational transformer models across image, video, and time-series modalities

基于基础Transformer模型的太阳耀斑预测:跨图像、视频和时间序列模态

S. Riggi, P. Romano, A. Pilzer, U. Becciani

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract)

AI总结 本文通过比较三种基础Transformer模型在太阳耀斑预测中的表现,发现Moirai2在时间序列预测中表现最佳,展示了预训练模型在多模态空间天气预测中的潜力。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04532 2025-12-05 cs.CV cs.AI 62%

PhyVLLM: Physics-Guided Video Language Model with Motion-Appearance Disentanglement

PhyVLLM:具有运动-外观解耦的物理引导视频语言模型

Yu-Wei Zhan, Xin Wang, Hong Chen, Tongtong Feng, Wei Feng, Ren Wang, Guangyao Li, Qing Li, Wenwu Zhu

机构 * Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) Department of Electronic Engineering, Tsinghua University(电子工程系,清华大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 PhyVLLM通过引入物理运动建模和运动-外观解耦,提升视频语言模型在物理推理和视频理解任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏