arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-27 至 2025-11-27 共收录 54 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9 篇

2511.20701 2025-11-27 cs.AI cs.LG 79%

Cross Domain Evaluation of Multimodal Chain-of-Thought Reasoning of different datasets into the Amazon CoT Framework

跨领域评估不同数据集的多模态链式推理在Amazon CoT框架中的表现

Nitya Tiwari, Parv Maheshwari, Vidisha Agarwal

机构 * Indian Institute of Technology Bombay(印度理工学院孟买学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文评估了多模态链式推理在不同数据集上的表现,发现视觉整合减少幻觉但不同问题类型对推理有效性影响显著,为多模态推理系统改进提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15277 2025-11-27 cs.CL 70%

Web-Shepherd: Advancing PRMs for Reinforcing Web Agents

Web-Shepherd: 促进强化网络代理的PRMs

Hyungjoo Chae, Sunghwan Kim, Junhee Cho, Seungone Kim, Seungjun Moon, Gyeom Hwangbo, Dongha Lim, Minjin Kim, Yeonjun Hwang, Minju Gwak, Dongwook Choi, Minseok Kang, Gwanhoon Im, ByeongUng Cho, Hyojun Kim, Jun Hee Han, Taeyoon Kwon, Minju Kim, Beong-woo Kwak, Dongjin Kang, Jinyoung Yeo

机构 * Georgia Institute of Technology(佐治亚理工学院) Department of Artificial Intelligence, Yonsei University(延世大学人工智能系) Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CL

AI总结 Web-Shepherd是首个用于强化网络代理的PRM,通过构建大规模数据集和元评估基准,提升了网络导航任务的准确性和效率。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14914 2025-11-27 cs.CV cs.CL cs.LG 62%

CAPability: A Comprehensive Visual Caption Benchmark for Evaluating Both Correctness and Thoroughness

CAPability: 一个全面的视觉描述基准,用于评估正确性和全面性

Zhihang Liu, Chen-Wei Xie, Bin Wen, Feiwu Yu, Jixuan Chen, Pandeng Li, Boqiang Zhang, Nianzu Yang, Yinglu Li, Zuan Gao, Yun Zheng, Hongtao Xie

机构 * University of Science and Technology of China(中国科学技术大学) Tongyi Lab, Alibaba Group(阿里云实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 CAPability是一个全面的视觉描述基准,通过12个维度评估描述的正确性和全面性,利用人类标注数据和启发式指标提升多模态模型的描述能力分析。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21444 2025-11-27 cs.AI physics.ao-ph 57%

EWE: An Agentic Framework for Extreme Weather Analysis

EWE:极端天气分析的代理框架

Zhe Jiang, Jiong Wang, Xiaoyu Yue, Zijie Guo, Wenlong Zhang, Fenghua Ling, Wanli Ouyang, Lei Bai

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The University of Sydney(悉尼大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 EWE是首个用于极端天气分析的智能代理框架,通过知识引导的规划和闭环推理实现自动化诊断,提供首个该领域基准测试,推动科学发现民主化进程。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 7 篇

2511.20904 2025-11-27 cs.IR 71%

Generating Querying Code from Text for Multi-Modal Electronic Health Record

从文本生成多模态电子健康记录的查询代码

Mengliang ZHang

专题命中 多模态Agent :multi-modal(title)

AI总结 本文提出TQGen-EHRQuery框架,通过整合表格和文本数据,提升多模态电子健康记录查询的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19900 2025-11-27 cs.CV cs.AI 62%

Agent0-VL: Exploring Self-Evolving Agent for Tool-Integrated Vision-Language Reasoning

Agent0-VL: 探索自我进化代理用于工具集成的视觉-语言推理

Jiaqi Liu, Kaiwen Xiong, Peng Xia, Yiyang Zhou, Haonian Ji, Lu Feng, Siwei Han, Mingyu Ding, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Agent0-VL通过工具集成推理实现自我进化,无需人类标注或外部奖励,提升视觉-语言推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21042 2025-11-27 cs.CV 57%

LungNoduleAgent: A Collaborative Multi-Agent System for Precision Diagnosis of Lung Nodules

LungNoduleAgent: 一种用于肺结节精准诊断的协作多智能体系统

Cheng Yang, Hui Jin, Xinlei Yu, Zhipeng Wang, Yaoqun Liu, Fenglei Fan, Dajiang Lei, Gangyong Jia, Changmiao Wang, Ruiquan Ge

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 LungNoduleAgent通过协作多智能体系统提升肺结节诊断的精度与效率

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20766 2025-11-27 cs.AI 57%

OpenApps: Simulating Environment Variations to Measure UI-Agent Reliability

OpenApps: 通过模拟环境变化来衡量UI代理的可靠性

Karen Ullrich, Jingtong Su, Claudia Shi, Arjun Subramonian, Amir Bar, Ivan Evtimov, Nikolaos Tsilivis, Randall Balestriero, Julia Kempe, Mark Ibrahim

机构 * FAIR at Meta(Meta 的 FAIR 研究组) New York University(纽约大学) Brown University(布朗大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 OpenApps通过模拟不同应用程序变化来衡量UI代理的可靠性,发现任务成功率在不同环境中有显著波动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20351 2025-11-27 cs.CV 57%

Thinking in 360°: Humanoid Visual Search in the Wild

全方位思考:野外人形视觉搜索

Heyang Yu, Yinan Han, Xiangyu Zhang, Baiqiao Yin, Bowen Chang, Xiangyu Han, Xinhao Liu, Jing Zhang, Marco Pavone, Chen Feng, Saining Xie, Yiming Li

机构 * NYU(纽约大学) NVIDIA(英伟达) TU Darmstadt(图鲁姆大学) UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 多模态Agent :MLLM(abstract);分类 cs.CV

AI总结 本文提出人形视觉搜索方法,通过人形代理在360°全景图像中搜索物体和路径,实验表明现有模型在复杂场景中表现不佳,但通过后训练技术显著提升了性能。

Comments Website: https://humanoid-vstar.github.io/ ; Code: https://github.com/humanoid-vstar/hstar

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07858 2025-11-27 cs.AI cs.LG 57%

Augur: Modeling Covariate Causal Associations in Time Series via Large Language Models

Augur:通过大型语言模型建模时间序列中的协变量因果关联

Zhiqing Cui, Binwu Wang, Qingxiang Liu, Yeqiang Wang, Zhengyang Zhou, Yuxuan Liang, Yang Wang

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 Augur通过大型语言模型建模时间序列中的协变量因果关联,提升预测准确性并实现透明的因果推理。

Comments 24 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21000 2025-11-27 cs.HC 50%

PileUp: A Tufting Approach to Soft, Tactile, and Volumetric E-Textile Interfaces

PileUp:一种基于毛毡的柔软、触觉和体积电子织物接口方法

Seoyoung Choi, Rashmi Balegar Mohan, Heather Jin Hee Kim, Jisoo Ha, Jeyeon Jo

专题命中 多模态Agent :multimodal(abstract)

AI总结 PileUp通过毛毡技术实现柔软、触觉和体积电子织物接口,能够检测压力、弯曲、应变及湿度等,为集成传感织物提供新的制造方法。

Comments Twentieth International Conference on Tangible, Embedded, and Embodied Interaction (TEI '26)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 9 篇

2306.15711 2025-11-27 cs.AI q-bio.NC 83%

Semi-supervised Multimodal Representation Learning through a Global Workspace

通过全局工作空间实现半监督多模态表示学习

Benjamin Devillers, Léopold Maytié, Rufin VanRullen

机构 * CerCo, CNRS UMR 5549, Université de Toulouse and ANITI, Artificial and Natural Intelligence Toulouse Institute(CerCo、CNRS UMR 5549、图卢兹大学和ANITI人工智能与自然智能图卢兹研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出了一种受全局工作空间概念启发的神经网络架构,通过自监督学习实现多模态表示对齐与转换,显著减少对匹配数据的需求。

Comments Under review

Journal ref IEEE Transactions on Neural Networks and Learning Systems 36 (5), 7843-7857 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21106 2025-11-27 cs.CV 79%

EM-KD: Distilling Efficient Multimodal Large Language Model with Unbalanced Vision Tokens

EM-KD: 通过不平衡视觉标记的知识蒸馏提升高效多模态大语言模型

Ze Feng, Sen Yang, Boqiang Duan, Wankou Yang, Jingdong Wang

机构 * Baidu VIS(百度视觉)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 EM-KD通过改进的知识蒸馏方法,有效提升高效多模态大语言模型的视觉理解和效率。

Comments accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20997 2025-11-27 cs.LG cs.AI 79%

FANoise: Singular Value-Adaptive Noise Modulation for Robust Multimodal Representation Learning

FANoise:奇异值自适应噪声调制用于鲁棒多模态表示学习

Jiaoyang Li, Jun Fang, Tianhao Gao, Xiaohui Zhang, Zhiyuan Liu, Chao Liu, Pengzhang Liu, Qixia Jiang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 FANoise通过自适应噪声注入策略提升多模态表示学习的鲁棒性和性能

Comments 13 pages, 5 figures, accept to AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10133 2025-11-27 cs.CV 79%

MANGO: Multimodal Attention-based Normalizing Flow Approach to Fusion Learning

MANGO: 多模态基于注意力的归一化流方法用于融合学习

Thanh-Dat Truong, Christophe Bobda, Nitin Agarwal, Khoa Luu

机构 * CVIU Lab, University of Arkansas, USA(大学实验室,亚利桑那大学,美国) University of Florida, USA(佛罗里达大学,美国) COSMOS Research Center, University of Arkansas, Little Rock, USA(研究机构,亚利桑那大学,小石城,美国) ICSI, University of California, Berkeley, USA(研究机构,加州大学伯克利分校,美国)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 MANGO提出了一种基于归一化流和可逆交叉注意力机制的多模态融合学习方法,通过三种新型交叉注意力机制提升多模态数据的建模能力。

Comments Accepted to NeurIPS'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20871 2025-11-27 cs.CY cs.LG 78%

A review on data fusion in multimodal learning analytics and educational data mining

多模态学习分析与教育数据挖掘中数据融合的综述

Wilson Chango, Juan A. Lara, Rebeca Cerezo, Cristóbal Romero

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文综述了多模态学习分析与教育数据挖掘中数据融合的应用、方法及挑战。

Journal ref WIREs Data Mining and Knowledge Discovery, 12(4), e1458 (2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21452 2025-11-27 eess.IV 71%

Semantic-Enhanced Feature Matching with Learnable Geometric Verification for Cross-Modal Neuron Registration

语义增强的特征匹配与可学习几何验证用于跨模态神经元配准

Wenwei Li, Lingyi Cai, Hui Gong, Qingming Luo, Anan Li

专题命中 多模态训练与对齐 :cross-modal(title)

AI总结 本文提出一种结合语义增强和可学习几何验证的深度学习框架,用于解决跨模态神经元配准中的模态差距、数据稀缺和组织形变问题,提升生物医学影像配准精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21389 2025-11-27 cs.IR cs.AI 57%

FITRep: Attention-Guided Item Representation via MLLMs

FITRep: 通过大语言模型实现的注意力引导的项目表示

Guoxiao Zhang, Ao Li, Tan Qu, Qianlong Xie, Xingxing Wang

机构 * Meituan(美团)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 FITRep通过引入注意力引导的白盒表示框架,利用多模态大语言模型实现细粒度项目去重,提升了广告点击率和每千次展示成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14264 2025-11-27 cs.CV 57%

Directed-Tokens: A Robust Multi-Modality Alignment Approach to Large Language-Vision Models

Directed-Tokens: 一种稳健的多模态对齐方法用于大语言-视觉模型

Thanh-Dat Truong, Huu-Thien Tran, Tran Thai Son, Bhiksha Raj, Khoa Luu

机构 * CVIU Lab, University of Arkansas, USA(美国亚拉巴马大学CVIU实验室) Vietnam National University, Ho Chi Minh City University of Science, Vietnam(越南国家大学胡志明市科技大学) Carnegie Mellon University, USA(美国卡内基梅隆大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Directed-Tokens方法,通过引入图像和文本顺序重建任务及新的损失函数,提升大语言-视觉模型的鲁棒性和跨模态对齐能力,在多个基准上取得最佳性能。

Comments Accepted to NeurIPS'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20704 2025-11-27 cs.LG stat.ML 50%

Pretraining Transformer-Based Models on Diffusion-Generated Synthetic Graphs for Alzheimer's Disease Prediction

基于扩散生成合成图的Transformer模型预训练用于阿尔茨海默病预测

Abolfazl Moslemi, Hossein Peyvandi

机构 * Sharif University of Technology(谢里夫理工学院) Pasargad Institute for Advanced Innovative Solutions(帕萨尔加德先进创新解决方案研究所)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本研究提出基于扩散生成合成图的Transformer模型,通过预训练提升阿尔茨海默病预测的准确性和泛化能力。

Comments 14 pages. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他多模态 4 篇

2511.02607 2025-11-27 cs.CV cs.CL 84%

UniChange: Unifying Change Detection with Multimodal Large Language Model

UniChange: 通过多模态大语言模型统一变化检测

Xu Zhang, Danyang Li, Xiaohang Dong, Tianhao Wu, Hualong Yu, Jianye Wang, Qicheng Li, Xiang Li

机构 * TMCC, Computer Science, Nankai University(天津大学计算机学院,南开大学) VCIP, Computer Science, Nankai University(南开大学计算机科学系) NKIARI, Futian, Shenzhen(深圳福田国家工程研究中心) CMEE, Sichuan Agricultural University(四川农业大学)

专题命中 其他多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL

AI总结 UniChange通过多模态大语言模型统一变化检测任务,引入特殊标记和文本提示,实现BCD和SCD的统一,并在多个基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21120 2025-11-27 cs.LG cs.AI 83%

Learning Cell-Aware Hierarchical Multi-Modal Representations for Robust Molecular Modeling

学习细胞感知的层次多模态表示以实现稳健的分子建模

Mengran Li, Zelin Zang, Wenbin Xing, Junzhou Chen, Ronghui Zhang, Jiebo Luo, Stan Z. Li

专题命中 其他多模态 :multi-modal(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 CHMR通过联合建模分子与细胞反应的层次依赖关系,提升分子建模的稳健性和生物学基础。

Comments Accepted to AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21574 2025-11-27 cs.CV cs.AI 81%

Multimodal Robust Prompt Distillation for 3D Point Cloud Models

多模态鲁棒提示蒸馏用于3D点云模型

Xiang Gu, Liming Lu, Xu Zheng, Anan Du, Yongbin Zhou, Shuchao Pang

机构 * Xiang Gu 1 , Liming Lu 1 1 1 footnotemark: 1 , Xu Zheng 2,3 , Anan Du 4 , Yongbin Zhou 1 , Shuchao Pang 1 2 2 footnotemark: 2(某大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 多模态鲁棒提示蒸馏通过多模态知识蒸馏提升3D点云模型的鲁棒性,有效防御多种对抗攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15953 2025-11-27 cs.CV 57%

Activator: GLU Activation Function as the Core Component of a Vision Transformer

Activator: GLU激活函数作为视觉变换器的核心组件

Abdullah Nazhat Abdullah, Tarkan Aydin

机构 * Bahcesehir University(巴切塞希尔大学)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出使用GLU激活函数替代传统MLP和注意力机制,以提高视觉变换器的计算效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏