arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-26 至 2025-11-26 共收录 87 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 10 篇

2511.19865 2025-11-26 cs.AI 70%

Agentic AI-Empowered Conversational Embodied Intelligence Networks in 6G

基于代理AI的6G时代对话具身智能网络

Mingkai Chen, Zijie Feng, Lei Wang, Yaser Khamayseh

机构 * Key Laboratory of Broadband Wireless Communication and Sensor Network Technology(宽带无线通信与传感网络技术重点实验室) Nanjing University of Posts and Telecommunications(南京邮电大学) College of Technological Innovation(技术创新学院)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出一种基于代理AI的6G时代对话具身智能网络,通过多模态融合、自适应通信和可解释性模块,提升复杂任务执行效率与语义一致性。

Comments 7 pages, 8 figures. Preprint submitted to IEEE Vehicle Technology Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19773 2025-11-26 cs.AI cs.CL cs.CV 67%

Scaling Agentic Reinforcement Learning for Tool-Integrated Reasoning in VLMs

在视觉语言模型中实现工具集成推理的规模化代理强化学习

Meng Lu, Ran Xu, Yi Fang, Wenxuan Zhang, Yue Yu, Gaurav Srivastava, Yuchen Zhuang, Mohamed Elhoseiny, Charles Fleming, Carl Yang, Zhengzhong Tu, Yang Xie, Guanghua Xiao, Hanrui Wang, Di Jin, Wenqi Shi, Xuan Wang

机构 * Virginia Tech(弗吉尼亚理工大学) Emory University(埃默里大学) KAUST(阿联酋卡塔尔大学) Georgia Tech(佐治亚理工学院) Cisco(思科系统) TAMU(德克萨斯大学奥斯汀分校) UT Southwestern Medical Center(德克萨斯西南医学中心) Eigen AI

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出VISTA-Gym,通过多轮轨迹采样和端到端强化学习,提升视觉语言模型的工具集成推理能力,在多个基准测试中取得显著优势。

Comments 17 pages, 9 figures, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19654 2025-11-26 cs.CV cs.AI cs.CL cs.RO 67%

From Forecasting to Planning: Policy World Model for Collaborative State-Action Prediction

从预测到规划:用于协作状态-动作预测的策略世界模型

Zhida Zhao, Talas Fu, Yifan Wang, Lijun Wang, Huchuan Lu

机构 * Dalian University of Technology(大连理工大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出策略世界模型(PWM),通过整合世界建模与轨迹规划,并利用无动作未来状态预测提升规划性能,实现更可靠的自主驾驶决策。

Comments Accepted by NuerIPS 2025 (Poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12937 2025-11-26 cs.AI cs.CV 62%

Yanyun-3: Enabling Cross-Platform Strategy Game Operation with Vision-Language Models

Yanyun-3: 通过视觉-语言模型实现跨平台战略游戏操作

Guoyan Wang, Yanyan Huang, Chunlin Chen, Lifeng Wang, Yuxiang Sun

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Yanyun-3通过整合视觉-语言模型和结构化多模态数据组织,实现了跨平台战略游戏操作的自动化,提升了任务执行效率和泛化能力。

Comments 32 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20156 2025-11-26 cs.CV cs.RO 57%

Map-World: Masked Action planning and Path-Integral World Model for Autonomous Driving

Map-World: 遮蔽动作规划与路径积分世界模型用于自动驾驶

Bin Hu, Zijian Lu, Haicheng Liao, Chengran Yuan, Bin Rao, Yongkang Li, Guofa Li, Zhiyong Cui, Cheng-zhong Xu, Zhenning Li

机构 * University of Macau(澳门大学) National University of Singapore(新加坡国立大学) Purdue University(普渡大学) Chongqing University(重庆大学) Beihang University(北航大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV

AI总结 MAP-World通过结合遮蔽动作规划和路径加权世界模型,实现了高效的多模式自动驾驶规划,无需强化学习即可达到最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04042 2025-11-26 cs.RO cs.AI 57%

An LLM-based Framework for Human-Swarm Teaming Cognition in Disaster Search and Rescue

基于大语言模型的灾难搜索救援中人-群智能协同认知框架

Kailun Ji, Xiaoyu Hu, Xinyu Zhang, Jun Chen

机构 * School of Electronics and Information, Northwestern Polytechnical University(电子工程学院,西北工业大学) Chongqing Institute for Brain and Intelligence, Guangyang Bay Laboratory(脑科学与智能研究院,广阳湾实验室)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的LLM-CRF系统,通过自然交互捕捉意图并实现任务规划,显著提升灾难救援任务效率与成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08367 2025-11-26 cs.CV 57%

Embodied Crowd Counting

具身人群计数

Runling Long, Yunlong Wang, Jia Wan, Xiang Deng, Xinting Zhu, Weili Guan, Antoni B. Chan, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) City University of Hong Kong(香港城市大学)

专题命中 多模态Agent :MLLM(abstract);分类 cs.CV

AI总结 本文提出具身人群计数任务,通过构建大规模交互式模拟器和零样本导航方法,在复杂场景中实现高效人群计数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20429 2025-11-26 astro-ph.CO astro-ph.GA 50%

Estimating the triaxiality of massive clusters from 2D observables in MillenniumTNG with machine learning

从MillenniumTNG模拟中的2D观测数据利用机器学习估计巨团的三轴性

Ana Maria Delgado, Michelle Ntampaka, Sownak Bose, Fulvio Ferlito, Boryana Hadzhiyska, Lars Hernquist, John Soltis, John F. Wu, Mikaeel Yunus, John ZuHone

专题命中 多模态Agent :multi-modal(abstract)

AI总结 利用机器学习从MillenniumTNG模拟中的2D观测数据估计巨团的三轴性和取向,提升团几何估计精度30%

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.12963 2025-11-26 q-bio.NC q-bio.QM 50%

Modeling the subjective perspective of consciousness and its role in the control of behaviours

意识的主观视角建模及其在行为控制中的作用

D. Rudrauf, G. Sergeant-Perthuis, O. Belli, Y. Tisserand, G. Di Marzo Serugendo

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出基于投影意识模型的主观视角建模,揭示其在行为控制中的作用,通过智能体模拟展示适应与非适应性行为的生成。

Journal ref Journal of Theoretical Biology Volume 534, 7 February 2022, 110957

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态训练与对齐 9 篇

2511.17585 2025-11-26 cs.LG cs.AI cs.CV 84%

PaSE: Prototype-aligned Calibration and Shapley-based Equilibrium for Multimodal Sentiment Analysis

PaSE:原型对齐校准与基于Shapley的均衡用于多模态情感分析

Kang He, Boyu Chen, Yuzhe Ding, Fei Li, Chong Teng, Donghong Ji

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 PaSE通过原型对齐校准和基于Shapley的均衡框架,有效缓解多模态情感分析中的模态竞争问题,提升模型性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20167 2025-11-26 cs.MM 83%

FINE: Factorized multimodal sentiment analysis via mutual INformation Estimation

FINE: 通过互信息估计进行因子化多模态情感分析

Yadong Liu, Shangfei Wang

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 本文提出了一种基于互信息估计的因子化多模态情感分析框架,通过分解模态为共享和独特表示,抑制噪声并提升情感表示质量,从而在多个数据集上优于现有方法。

Comments 15 pages, 9 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11895 2025-11-26 cs.CV 83%

Adversarial Robustness for Unified Multi-Modal Encoders via Efficient Calibration

通过高效校准实现统一多模态编码器的对抗鲁棒性

Chih-Ting Liao, Zhangquan Chen, Chunlei Meng, Tzu-Yu Huang, Xin Cao, Xu Zheng

机构 * UNSW Sydney(新南威尔士大学悉尼分校) Tsinghua University(清华大学) Fudan University(复旦大学) UTS(澳大利亚UTS大学) HKUST(GZ)(香港理工大学(广州))

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本研究提出高效对抗校准框架,提升统一多模态编码器的对抗鲁棒性,同时保持清洁性能,提升47.3%的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19887 2025-11-26 cs.CV cs.AI 81%

Distilling Cross-Modal Knowledge via Feature Disentanglement

通过特征解耦进行跨模态知识蒸馏

Junhong Liu, Yuan Zhang, Tao Huang, Wenchao Xu, Renyu Yang

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出频率解耦的跨模态知识蒸馏方法,通过利用频域特征解耦和平衡跨模态知识转移,提升蒸馏效果。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12121 2025-11-26 cs.LG cs.MM 79%

To Align or Not to Align: Strategic Multimodal Representation Alignment for Optimal Performance

对齐还是不对齐:为最佳性能的战略多模态表示对齐

Wanlong Fang, Tianle Zhang, Alvin Chan

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.MM

AI总结 本文研究了显式对齐对模型性能的影响,提出可控对比学习模块,发现最佳对齐强度取决于数据冗余量,为优化单模态编码器提供指导。

Comments Accepted by AAAI 2026. This arXiv version includes additional details and extended appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20000 2025-11-26 eess.SP 78%

Cross-Modal Semantic Communication for Heterogeneous Collaborative Perception

跨模态语义通信用于异构协同感知

Mingyi Lu, Guowei Liu, Le Liang, Chongtao Guo, Hao Ye, Shi Jin

专题命中 多模态训练与对齐 :cross-modal(title,abstract)

AI总结 本文提出跨模态语义通信框架,通过统一语义空间实现异构传感器车辆间的高效协同感知,提升低信噪比环境下的感知性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19856 2025-11-26 cs.CV 70%

Temporal-Visual Semantic Alignment: A Unified Architecture for Transferring Spatial Priors from Vision Models to Zero-Shot Temporal Tasks

时间-视觉语义对齐:一种统一架构,用于从视觉模型中转移空间先验到零样本时间任务

Xiangkai Ma, Han Zhang, Wenzhong Li, Sanglu Lu

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 TimeArtist通过时间-视觉语义对齐框架,实现从时间序列到高质量图像生成的跨模态转换,并在零样本时间任务中取得优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10109 2025-11-26 cs.CV 70%

Dream-IF: Dynamic Relative EnhAnceMent for Image Fusion

Dream-IF: 动态相对增强用于图像融合

Xingxin Xu, Bing Cao, Dongdong Li, Qinghua Hu, Pengfei Zhu

专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 Dream-IF通过动态相对增强框架提升图像融合质量,结合主导区域信息实现多模态图像的协同增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15691 2025-11-26 q-fin.CP cs.AI cs.CL cs.LG 62%

Exploring the Synergy of Quantitative Factors and Newsflow Representations from Large Language Models for Stock Return Prediction

探索来自大语言模型的定量因素和新闻流表示的协同效应以预测股票收益率

Tian Guo, Emmanuel Hauptmann

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出融合学习框架和混合模型,利用大语言模型生成的定量因素和新闻流表示,提升股票收益率预测和选择的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他多模态 9 篇

2510.20519 2025-11-26 cs.CV cs.AI 81%

Metis-HOME: Hybrid Optimized Mixture-of-Experts for Multimodal Reasoning

Metis-HOME: 面向多模态推理的混合优化专家混合模型

Xiaohan Lan, Fanfan Liu, Haibo Qiu, Siqi Yang, Delian Ruan, Peng Shi, Lin Ma

机构 * Meituan(美团)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 Metis-HOME通过混合优化专家混合模型,提升多模态推理的复杂推理能力和通用能力,解决推理与泛化之间的矛盾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19752 2025-11-26 cs.CV 79%

What You See is (Usually) What You Get: Multimodal Prototype Networks that Abstain from Expensive Modalities

你所见的通常就是你所得到的:一种多模态原型网络,能够避免昂贵的模态

Muchang Bahng, Charlie Berens, Jon Donnelly, Eric Chen, Chaofan Chen, Cynthia Rudin

机构 * Duke University(杜克大学) University of Maine(缅因大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出了一种多模态原型网络,通过避免昂贵的遗传数据来提高物种检测的效率和可解释性。

Comments 19 pages. 16 figures. 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03151 2025-11-26 cs.CL cs.LG 79%

Why Reasoning Matters? A Survey of Advancements in Multimodal Reasoning (v1)

为何推理重要?多模态推理的进展综述(v1)

Jing Bi, Susan Liang, Xiaofei Zhou, Pinxin Liu, Junjia Guo, Yunlong Tang, Luchuan Song, Chao Huang, Ali Vosoughi, Guangyu Sun, Jinxi He, Jiarui Wu, Shu Yang, Daoan Zhang, Chen Chen, Lianggong Bruce Wen, Zhang Liu, Jiebo Luo, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) University of Central Florida(中央佛罗里达大学) Corning Inc.(康宁公司)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本文综述了多模态推理的进展,探讨了推理在多模态任务中的挑战与优化方法,为未来研究提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09738 2025-11-26 cs.LG 78%

Towards Multimodal Graph Large Language Model

迈向多模态图大规模语言模型

Xin Wang, Zeyang Zhang, Linxin Xiao, Haibo Chen, Chendi Ge, Wenwu Zhu

机构 * Department of Computer Science and Technology(计算机科学与技术系) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

专题命中 其他多模态 :multimodal(title);multi-modal(abstract)

AI总结 本文提出多模态图大规模语言模型(MG-LLM),旨在统一和泛化多模态图数据和任务,通过统一空间、多任务处理、上下文学习等五个核心特性,推动多模态图学习的发展。

Comments 4 figures, 2 tables

Journal ref Science China Information Sciences (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20627 2025-11-26 cs.AI 57%

Fighting AI with AI: Leveraging Foundation Models for Assuring AI-Enabled Safety-Critical Systems

用AI对抗AI:利用基础模型确保AI赋能的安全关键系统

Anastasia Mavridou, Divya Gopinath, Corina S. Păsăreanu

机构 * KBR Inc.(KBR公司) NASA Ames(美国国家航空航天局阿姆斯研究中心)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出利用AI技术解决安全关键系统中AI保证问题,通过REACT和SemaLens两个组件实现需求工程与感知系统验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20194 2025-11-26 cs.LG 50%

In-Context Compositional Learning via Sparse Coding Transformer

基于稀疏编码的上下文组合学习变换器

Wei Chen, Jingxi Yu, Zichen Miao, Qiang Qiu

机构 * Purdue University(普渡大学)

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出基于稀疏编码的变换器,通过稀疏注意力机制提升组合学习任务的性能。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18376 2025-11-26 eess.SP 50%

BeamCKM: A Framework of Channel Knowledge Map Construction for Multi-Antenna Systems

BeamCKM:多天线系统中通道知识图谱构建的框架

Haohan Wang, Xu Shi, Hengyu Zhang, Yashuai Cao, Sufang Yang, Jintao Wang, Kaibin Huang

专题命中 其他多模态 :multi-modal(abstract)

AI总结 本文提出BeamCKM框架,结合UNet和ViT模块,通过多模态学习和交叉注意力机制提升多天线系统中通道知识图谱的构建精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23338 2025-11-26 eess.SP 50%

An Active Dry-Contact Continuous EEG Monitoring System for Seizure Detection Applications in Clinical Neurophysiology

一种用于临床神经生理学中癫痫检测的主动干接触连续EEG监测系统

Nima L. Wickramasinghe, Dinuka Sandun Udayantha, Akila Abeyratne, Kavindu Weerasinghe, Kithmin Wickremasinghe, Jithangi Wanigasinghe, Anjula De Silva, Chamira U. S. Edussooriya

专题命中 其他多模态 :multimodal(abstract)

AI总结 本研究提出了一种低成本的主动干接触EEG头戴设备,结合深度学习模型和多模态伪影去除算法,用于实时检测婴儿癫痫发作。

Comments 10 pages, 9 figures, Work is accepted for publication in IEEE TBME

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22247 2025-11-26 cs.HC 50%

Pneumatic Multi-mode Silicone Actuator with Pressure, Vibration, and Cold Thermal Feedback

气动多模式硅胶执行器带压力、振动和冷热反馈

Mohammad Shadman Hashem, Ahsan Raza, Sama E Shan, Seokhee Jeon

专题命中 其他多模态 :multi-modal(abstract)

AI总结 本文提出了一种气动多模式硅胶执行器,通过同时提供压力、振动和冷热反馈,实现更丰富的触觉体验。

详情

展开后加载摘要…

URL PDF HTML 收藏