arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-08-18 至 2025-08-18 共收录 42 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9 篇

2508.11058 2025-08-18 cs.CV cs.MM 62%

Advancing 3D Scene Understanding with MV-ScanQA Multi-View Reasoning Evaluation and TripAlign Pre-training Dataset

Wentao Mo, Qingchao Chen, Yuxin Peng, Siyuan Huang, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(计算机技术王先院,北京大学) National Institute of Health Data Science, Peking University(健康数据科学国家研究院,北京大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.MM

Comments Accepeted to ACM MM 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11536 2025-08-18 cs.CL 57%

Language models align with brain regions that represent concepts across modalities

Maria Ryskina, Greta Tuckute, Alexander Fung, Ashley Malkin, Evelina Fedorenko

机构 * Vector Institute for AI(向量人工智能研究所) MIT(麻省理工学院)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CL

Comments Accepted to COLM 2025. Code and data can be found at https://github.com/ryskina/concepts-brain-llms

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10947 2025-08-18 cs.CV 57%

MedAtlas: Evaluating LLMs for Multi-Round, Multi-Task Medical Reasoning Across Diverse Imaging Modalities and Clinical Text

Ronghao Xu, Zhen Huang, Yangbo Wei, Xiaoqian Zhou, Zikang Xu, Ting Liu, Zihang Jiang, S. Kevin Zhou

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06570 2025-08-18 cs.CV cs.LG 57%

ImpliHateVid: A Benchmark Dataset and Two-stage Contrastive Learning Framework for Implicit Hate Speech Detection in Videos

Mohammad Zia Ur Rehman, Anukriti Bhatnagar, Omkar Kabde, Shubhi Bansal, Nagendra Kumar

机构 * Indian Institute of Technology Indore(印度理工学院印地尔分校) Chaitanya Bharathi Institute of Technology(恰伊坦亚·巴哈蒂技术学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

Comments Published in ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 2 篇

2508.10833 2025-08-18 cs.CV 57%

UI-Venus Technical Report: Building High-performance UI Agents with RFT

Zhangxuan Gu, Zhengwen Zeng, Zhenyu Xu, Xingran Zhou, Shuheng Shen, Yunfei Liu, Beitong Zhou, Changhua Meng, Tianyu Xia, Weizhi Chen, Yue Wen, Jingya Dou, Fei Tang, Jinzhen Lin, Yulin Liu, Zhenlin Guo, Yichen Gong, Heng Jia, Changlong Gao, Yuan Guo, Yong Deng, Zhenyu Guo, Liang Chen, Weiqiang Wang

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17593 2025-08-18 cs.HC cs.AI 57%

JELAI: Integrating AI and Learning Analytics in Jupyter Notebooks

Manuel Valle Torre, Thom van der Velden, Marcus Specht, Catharine Oertel

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

Comments Accepted for AIED 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 5 篇

2505.22483 2025-08-18 cs.LG cs.AI cs.CV 84%

A Closer Look at Multimodal Representation Collapse

Abhra Chaudhuri, Anjan Dutta, Tu Bui, Serban Georgescu

机构 * Fujitsu Research of Europe(富士通欧洲研究)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

Comments International Conference on Machine Learning (ICML) 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07264 2025-08-18 cs.SI cs.AI 83%

FLUID: Flow-Latent Unified Integration via Token Distillation for Expert Specialization in Multimodal Learning

Van Duc Cuong, Ta Dinh Tam, Tran Duc Chinh, Nguyen Thi Hanh

机构 * Hanoi University of Science and Technology(河内科学技术大学) Faculty of Interdisciplinary Digital Technology(跨学科数字技术学院) PHENIKAA University(PHENIKAA大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04058 2025-08-18 cs.CV 83%

LSVG: Language-Guided Scene Graphs with 2D-Assisted Multi-Modal Encoding for 3D Visual Grounding

Feng Xiao, Hongbin Xu, Guocan Zhao, Wenxiong Kang

机构 * School of Automation Science and Engineering, South China University of Technology(自动化科学与工程学院,华南理工大学) School of Future Technology, South China University of Technology(未来技术学院,华南理工大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11350 2025-08-18 cs.CV 79%

HOID-R1: Reinforcement Learning for Open-World Human-Object Interaction Detection Reasoning with Multimodal Large Language Model

Zhenhao Zhang, Hanqing Wang, Xiangyu Zeng, Ziyu Cheng, Jiaxin Liu, Haoyu Yan, Zhirui Liu, Kaiyang Ji, Tianxiang Gui, Ke Hu, Kangyi Chen, Yahao Fan, Mokai Pan

专题命中 多模态训练与对齐 :multimodal(title);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11419 2025-08-18 cs.CV 57%

Training-free Dimensionality Reduction via Feature Truncation: Enhancing Efficiency in Privacy-preserving Multi-Biometric Systems

Florian Bayer, Maximilian Russo, Christian Rathgeb

机构 * Hochschule Darmstadt(达姆斯塔特应用技术大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他多模态 1 篇

2508.09630 2025-08-18 cs.LG cs.AI 57%

TimeMKG: Knowledge-Infused Causal Reasoning for Multivariate Time Series Modeling

Yifei Sun, Junming Liu, Yirong Chen, Xuefeng Yan, Ding Wang

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏