arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-07 至 2026-01-07 共收录 47 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 14 篇

2512.03025 2026-01-07 cs.IR cs.AI cs.CL cs.LG 62%

LORE: A Large Generative Model for Search Relevance

LORE:一种大规模生成模型用于搜索相关性

Chenji Lu, Zhuo Chen, Hui Zhao, Zhiyuan Zeng, Gang Zhao, Junjie Ren, Ruicong Xu, Haoran Li, Songyan Liu, Pengjie Wang, Jian Xu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 LORE提出了一种基于大规模生成模型的搜索相关性框架,通过两阶段训练和分层部署策略提升搜索效果,为垂直领域提供方法参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22334 2026-01-07 cs.AI cs.CL 62%

SciEvalKit: An Open-source Evaluation Toolkit for Scientific General Intelligence

SciEvalKit: 一个用于科学通用智能的开源评估工具包

Yiheng Wang, Yixin Chen, Shuo Li, Yifan Zhou, Bo Liu, Hengjian Gao, Jiakang Yuan, Jia Bu, Wanghan Xu, Yuhao Zhou, Xiangyu Zhao, Zhiwang Zhou, Fengxiang Wang, Haodong Duan, Songyang Zhang, Jun Yao, Han Deng, Yizhou Wang, Jiabei Xiao, Jiaqi Liu, Encheng Su, Yujie Liu, Weida Wang, Junchi Yao, Shenghe Zheng, Haoran Sun, Runmin Ma, Xiangchao Yan, Bo Zhang, Dongzhan Zhou, Shufei Zhang, Peng Ye, Xiaosong Wang, Shixiang Tang, Wenlong Zhang, Lei Bai

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 SciEvalKit是一个开源工具包,用于评估科学通用智能,涵盖科学多模态感知、推理、理解等核心能力,并提供灵活的评估流程和可定制的基准测试环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02875 2026-01-07 cs.CL 57%

Revisiting Data Compression with Language Modeling

重新审视语言模型在数据压缩中的应用

Chen-Han Tsai

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL

AI总结 本文探讨了使用大型语言模型进行数据压缩的潜力,展示了在enwik9数据集上达到18%的调整压缩率,并探讨了LLM在压缩非英语数据、代码和字节流序列中的应用。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03198 2026-01-07 cs.LG 50%

Empowering Reliable Visual-Centric Instruction Following in MLLMs

赋能多模态大语言模型中的可靠指令跟随

Weilei He, Feng Ju, Zhiyuan Fan, Rui Min, Minhao Cheng, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Penn State(宾夕法尼亚州立大学)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出VC-IFEval基准,通过引入视觉依赖性约束,系统评估多模态大语言模型在指令跟随任务中的性能与改进。

Comments Submitted to ARR Jan

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 5 篇

2503.04833 2026-01-07 cs.CV cs.AI cs.CL 82%

E$^2$AT: Multimodal Jailbreak Defense via Dynamic Joint Optimization for Multimodal Large Language Models

E$^2$AT: 通过动态联合优化实现多模态对抗防御

Liming Lu, Xiang Gu, Shuchao Pang, Siyuan Liang, Haotian Zhu, Xiyu Zeng, Xu Zheng, Yongbin Zhou

机构 * School of Cyber Science and Engineering, Nanjing University of Science and Technology, China(南京理工大学信息科学与工程学院) HKUST(GZ) and INSAIT, Sofia University St. Kliment Ohridski(香港科技大学(广州)及INSAIT,索菲亚大学圣克莱门特·奥赫里迪斯学院) College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 E$^2$AT通过动态联合优化提升多模态大语言模型对对抗攻击的鲁棒性,实验显示其在文本和图像模态上性能优于现有方法34%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24851 2026-01-07 cs.CV cs.RO 70%

VLN-MME: Diagnosing MLLMs as Language-guided Visual Navigation agents

VLN-MME: 诊断MLLMs作为语言引导的视觉导航代理

Xunyi Zhao, Gengze Zhou, Qi Wu

机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所) Adelaide University(阿德莱德大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 VLN-MME通过统一评估框架揭示MLLMs在具身导航任务中的局限性,发现其3D空间推理能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03073 2026-01-07 cs.CV 57%

Understanding Multi-Agent Reasoning with Large Language Models for Cartoon VQA

通过大型语言模型理解多智能体推理用于漫画视觉问答

Tong Wu, Thanet Markchom

机构 * University of Reading(阅读大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出多智能体LLM框架,用于解决漫画图像中视觉抽象和叙事上下文的VQA问题,通过三个智能体协作提升推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02732 2026-01-07 cs.SE cs.AI 57%

Agentic Memory Enhanced Recursive Reasoning for Root Cause Localization in Microservices

基于代理记忆的递归推理用于微服务根因定位

Lingzhe Zhang, Tong Jia, Yunpeng Zhai, Leyi Pan, Chiming Duan, Minghua He, Mengxi Jia, Ying Li

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学) Institute of Artificial Intelligence(人工智能研究院)

专题命中 多模态Agent :cross-modal(abstract);分类 cs.AI

AI总结 本文提出AMER-RCL框架,通过递归推理和代理记忆提升微服务根因定位的准确性和效率。

Comments accepted by ICSE-SEIP'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02377 2026-01-07 cs.RO 50%

Trust in LLM-controlled Robotics: a Survey of Security Threats, Defenses and Challenges

对LLM控制的机器人信任:安全威胁、防御和挑战的综述

Xinyu Huang, Shyam Karthick V B, Taozhao Chen, Mitch Bryson, Thomas Chaffey, Huaming Chen, Kim-Kwang Raymond Choo, Ian R. Manchester

机构 * School of Electrical and Computer Engineering, The University of Sydney(悉尼大学电气与计算机工程学院) Australian Centre for Robotics and School of Aerospace, Mechanical and Mechatronic Engineering, The University of Sydney(悉尼大学机器人中心及航空航天、机械与机电工程学院) Department of Information Systems and Cybersecurity, University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校信息系统与网络安全系) School of Engineering and Natural Sciences, University of Iceland(冰岛大学工程与自然科学学院)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文综述了LLM控制机器人面临的安全威胁和防御策略,强调了具身系统中恶意输出的物理风险,并提出了安全规范和多LLM监督等防御方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 3 篇

2601.02415 2026-01-07 cs.CV cs.AI 84%

Multimodal Sentiment Analysis based on Multi-channel and Symmetric Mutual Promotion Feature Fusion

基于多通道和对称互促特征融合的多模态情感分析

Wangyuan Zhu, Jun Yu

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于多通道和对称互促特征融合的多模态情感分析方法,通过增强模态内特征表示和促进模态间信息交互,提升情感识别的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02924 2026-01-07 cs.CV cs.AI 81%

DCG ReID: Disentangling Collaboration and Guidance Fusion Representations for Multi-modal Vehicle Re-Identification

DCG ReID: 解构协作与指导融合表示以实现多模态车辆重识别

Aihua Zheng, Ya Gao, Shihao Li, Chenglong Li, Jin Tang

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 DCG-ReID通过解构协作与指导融合表示,解决多模态车辆重识别中模态质量分布不平衡的问题,提升多模态联合决策性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02414 2026-01-07 cs.CV cs.AI 81%

MIAR: Modality Interaction and Alignment Representation Fuison for Multimodal Emotion

MIAR: 多模态情感的模态交互与对齐表示融合

Jichao Zhu, Jun Yu

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 MIAR通过模态交互与对齐表示融合,提升多模态情感识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他多模态 5 篇

2601.03181 2026-01-07 cs.NI cs.AI cs.CL cs.CV 82%

Multi-Modal Data-Enhanced Foundation Models for Prediction and Control in Wireless Networks: A Survey

多模态数据增强的基础模型用于无线网络中的预测与控制:综述

Han Zhang, Mohammad Farzanullah, Mohammad Ghassemi, Akram Bin Sediq, Ali Afana, Melike Erol-Kantarci

机构 * School of Electrical Engineering and Computer Science, University of Ottawa(Ottawa 大学电子工程与计算机科学学院) Ericsson(埃里克森公司)

专题命中 其他多模态 :multi-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文综述了多模态数据增强的基础模型在无线网络预测与控制中的应用,探讨了其在无线网络管理中的关键任务和未来发展方向。

Comments 5 figures, 7 tables, IEEE COMST

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18376 2026-01-07 cs.LG cs.CV 79%

Empowering Source-Free Domain Adaptation via MLLM-Guided Reliability-Based Curriculum Learning

通过MLLM引导的可靠性基于课程学习增强源无关领域适应

Dongjie Chen, Kartik Patwari, Zhengfeng Lai, Xiaoguang Zhu, Sen-ching Cheung, Chen-Nee Chuah

机构 * University of California, Davis(加州大学戴维斯分校) University of Kentucky(肯塔基大学)

专题命中 其他多模态 :MLLM(title);multimodal(abstract);分类 cs.CV

AI总结 通过MLLM引导的可靠性基于课程学习增强源无关领域适应,提出一种新的框架,利用多个冻结的MLLMs的稳健监督蒸馏到目标模型,实现稳定且噪声感知的训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12020 2026-01-07 cond-mat.mes-hall cond-mat.dis-nn cs.ET cs.NE nlin.AO 71%

Multimodal oscillator networks learn to solve a classification problem

多模态振荡器网络学习解决分类问题

Daan de Bos, Marc Serra-Garcia

专题命中 其他多模态 :multimodal(title)

AI总结 多模态振荡器网络通过结合长期记忆、短期记忆和演化法则,实现从示例中学习解决分类任务。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02611 2026-01-07 physics.bio-ph 71%

Holotomography in 2025: From Morphometric Imaging to AI-Driven Multimodal Phenotyping

2025年的全息成像:从形态学成像到AI驱动的多模态表型分析

YongKeun Park

专题命中 其他多模态 :multimodal(title)

AI总结 2025年,全息成像从 niche 技术发展为多功能生物医学成像平台,结合深度学习和多模态技术,推动数字病理学和高通量筛选的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02831 2026-01-07 cs.CV 57%

DGA-Net: Enhancing SAM with Depth Prompting and Graph-Anchor Guidance for Camouflaged Object Detection

DGA-Net:通过深度提示和图锚引导增强SAM用于伪装物检测

Yuetong Li, Qing Zhang, Yilin Zhao, Gongyang Li, Zeming Liu

专题命中 其他多模态 :cross-modal(abstract);分类 cs.CV

AI总结 DGA-Net通过深度提示和图锚引导增强SAM,提升伪装物检测的精度和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏