arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-03 至 2026-02-03 共收录 25 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 25 篇

2602.02204 2026-02-03 cs.DC 88%

vLLM-Omni: Fully Disaggregated Serving for Any-to-Any Multimodal Models

vLLM-Omni: 任何到任何多模态模型的完全解耦服务

Peiqi Yin, Jiangyun Zhu, Han Gao, Chenguang Zheng, Yongxiang Huang, Taichang Zhou, Ruirui Yang, Weizhi Liu, Weiqing Chen, Canlin Guo, Didan Deng, Zifeng Mo, Cong Wang, James Cheng, Roger Wang, Hongsheng Liu

专题命中 多模态生成 :multimodal(title,abstract);any-to-any(title,abstract)

AI总结 vLLM-Omni通过解耦服务系统优化多模态模型的高效服务,显著提升作业完成时间效率。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02140 2026-02-03 cs.CL 83%

Quantifying the Gap between Understanding and Generation within Unified Multimodal Models

量化统一多模态模型中理解与生成之间的差距

Chenlong Wang, Yuhang Chen, Zhihan Hu, Dongping Chen, Wenhu Chen, Sarah Wiegreffe, Tianyi Zhou

机构 * University of Maryland(马里兰大学) University of Waterloo(滑铁卢大学) MBZUAI

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 本研究通过GapEval基准量化统一多模态模型中理解与生成能力的差距,揭示当前模型仅实现表面层次的统一,而非深度认知融合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25178 2026-02-03 cs.CV cs.AI cs.LG 81%

GHOST: Hallucination-Inducing Image Generation for Multimodal LLMs

GHOST:诱导幻觉的多模态大语言模型图像生成

Aryan Yazdan Parast, Parsa Hosseini, Hesam Asadollahzadeh, Arshia Soltani Moakhar, Basim Azam, Soheil Feizi, Naveed Akhtar

机构 * The University of Melbourne(墨尔本大学) University of Maryland(马里兰大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 GHOST通过优化隐蔽令牌生成诱导幻觉的图像,评估多模态大语言模型的可靠性,并发现高幻觉成功率及可转移漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01901 2026-02-03 cs.CV 79%

Q Cache: Visual Attention is Valuable in Less than Half of Decode Layers for Multimodal Large Language Model

Q Cache:视觉注意力在少于一半的解码层中具有价值用于多模态大语言模型

Jiedong Zhuang, Lu Lu, Ming Dai, Rui Hu, Jian Chen, Qiang Liu, Haoji Hu

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 Q Cache通过跨层共享相似注意力模式,减少多模态大语言模型中的KV缓存使用量,提升吞吐量并保持性能

Comments Accepted by AAAI26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00960 2026-02-03 cs.LG cs.AI cs.CE stat.CO stat.ML 79%

Multimodal Scientific Learning Beyond Diffusions and Flows

多模态科学学习超越扩散与流

Leonardo Ferreira Guilhoto, Akshat Kaushal, Paris Perdikaris

机构 * Graduate Group in Applied Mathematics and Computational Science(应用数学与计算科学联合研究生组) Department of Computer and Information Science(计算机与信息科学系) Department of Mechanical Engineering and Applied Mechanics(机械工程与应用力学系)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出混合密度网络作为多模态科学学习中更高效、更稳定的替代方法,实现对科学问题中多模态不确定性的有效建模与解决。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00849 2026-02-03 cs.LG cs.AI cs.NA math.NA 79%

RMFlow: Refined Mean Flow by a Noise-Injection Step for Multimodal Generation

RMFlow:通过噪声注入步骤细化均流以实现多模态生成

Yuhao Huang, Shih-Hsin Wang, Andrea L. Bertozzi, Bao Wang

机构 * Department of Mathematics and Scientific Computing and Imaging (SCI) Institute University of Utah(数学与科学计算及成像学院(SCI)院,犹他大学) Department of Mathematics, UCLA(数学系,加州大学洛杉矶分校)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 RMFlow通过引入噪声注入步骤,改进均流模型,实现高效多模态生成,仅需单次功能评估即可达到接近最先进的性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00762 2026-02-03 cs.CL cs.HC 79%

WordCraft: Scaffolding the Keyword Method for L2 Vocabulary Learning with Multimodal LLMs

WordCraft: 通过多模态大语言模型 scaffolding 关键词方法用于L2词汇学习

Yuheng Shao, Junjie Xiong, Chaoran Wu, Xiyuan Wang, Ziyu Zhou, Yang Ouyang, Qinyi Tao, Quan Li

机构 * School of Information Science and Technology, ShanghaiTech University(信息科学与技术学院,上海科技大学) School of Creativity and Art, ShanghaiTech University(创意与艺术学院,上海科技大学) Shanghai Fengxian Dai Wen Middle School(上海奉贤戴文中学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL

AI总结 WordCraft通过多模态大语言模型辅助L2词汇学习,提升关键词方法的使用效果和学习者参与度。

Comments Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI' 26), April 13--17, 2026, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00107 2026-02-03 cs.CV cs.RO eess.IV 79%

Efficient UAV trajectory prediction: A multi-modal deep diffusion framework

高效无人机轨迹预测:一种多模态深度扩散框架

Yuan Gao, Xinyu Guo, Wenjing Xie, Zifan Wang, Hongwen Yu, Gongyang Li, Shugong Xu

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出一种多模态深度融合框架,通过融合激光雷达和毫米波雷达数据提升无人机轨迹预测精度,实验显示其比基线模型提升40%。

Comments in Chinese language

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00641 2026-02-03 stat.ML cs.LG stat.CO 78%

Sampling from multi-modal distributions on Riemannian manifolds with training-free stochastic interpolants

在黎曼流形上采样多模分布的无训练随机插值法

Alain Durmus, Maxence Noble, Thibaut Pellerin

机构 * CMAP, CNRS, Ecole polytechnique(CMAP、法国国家科学研究中心、巴黎高等师范学院)

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 本文提出了一种无训练的随机插值方法,用于在黎曼流形上高效采样多模分布,通过非平衡动力学和随机插值实现无需训练的高效采样。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23208 2026-02-03 cs.CL 74%

A Structured Framework for Evaluating and Enhancing Interpretive Capabilities of Multimodal LLMs in Culturally Situated Tasks

一种评估和增强多模态大语言模型在文化情境任务中解释能力的结构框架

Haorui Yu, Ramon Ruiz-Dolz, Qiufeng Yi

机构 * DJCAD, University of Dundee, United Kingdom(邓迪大学DJCAD部门) ARG-tech, SSEN, University of Dundee, United Kingdom(邓迪大学) School of Computer Science, University of Birmingham, United Kingdom(伯明翰大学计算机科学学院)

专题命中 多模态生成 :multimodal(title);分类 cs.CL

AI总结 本研究提出了一种结构框架,用于评估和增强多模态大语言模型在文化情境任务中生成中国绘画批评的能力,通过量化评价特征和人设引导提示,揭示了VLMs在艺术批评领域的表现与局限。

Comments EMNLP 2025 submission, 10 pages, 6 figures, 5 tables

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, pages 1945-1971, Suzhou, China

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00583 2026-02-03 cs.CV cs.AI 73%

MAUGen: A Unified Diffusion Approach for Multi-Identity Facial Expression and AU Label Generation

MAUGen: 一种用于多身份面部表情和AU标签生成的统一扩散方法

Xiangdong Li, Ye Lou, Ao Gao, Wei Zhang, Siyang Song

专题命中 多模态生成 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 MAUGen通过统一的扩散方法生成多身份面部表情和AU标签,提升面部动作单元识别系统的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01623 2026-02-03 cs.CV 70%

Omni-Judge: Can Omni-LLMs Serve as Human-Aligned Judges for Text-Conditioned Audio-Video Generation?

Omni-Judge: 能否将 Omni-LLMs 用作文本条件音频视频生成的人类对齐裁判?

Susan Liang, Chao Huang, Filippos Bellos, Yolo Yunlong Tang, Qianxiang Shen, Jing Bi, Luchuan Song, Zeliang Zhang, Jason Corso, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 多模态生成 :multi-modal(abstract);omni-modal(abstract);分类 cs.CV

AI总结 Omni-Judge 评估 Omni-LLMs 是否能作为文本条件音频视频生成的人类对齐裁判,展现其在多模态评估中的潜力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01193 2026-02-03 cs.CL cs.CV 62%

Bridging Lexical Ambiguity and Vision: A Mini Review on Visual Word Sense Disambiguation

弥合词汇歧义与视觉:关于视觉词义消歧的简要综述

Shashini Nilukshi, Deshan Sumanathilaka

机构 * School of Computing Informatics(计算与信息学学院) Institute of Technology(技术研究所)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文综述了视觉词义消歧的发展,探讨了对比模型和LLM在解决词汇歧义中的作用,并指出未来发展方向。

Comments 2 figures, 2 Tables, Accepted at IEEE TIC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01756 2026-02-03 cs.CV 57%

Mind-Brush: Integrating Agentic Cognitive Search and Reasoning into Image Generation

Mind-Brush: 将代理认知搜索与推理整合到图像生成中

Jun He, Junyan Ye, Zilong Huang, Dongzhi Jiang, Chenjue Zhang, Leqi Zhu, Renrui Zhang, Xiang Zhang, Weijia Li

机构 * Sun Yat-sen University(中山大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 Mind-Brush通过整合代理认知搜索与推理,提升图像生成模型对复杂知识推理和动态适应能力,实现性能显著跃升。

Comments 36 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18623 2026-02-03 cs.CV 57%

Adaptive Domain Shift in Diffusion Models for Cross-Modality Image Translation

扩散模型中自适应域偏移用于跨模态图像翻译

Zihao Wang, Yuzhou Chen, Shaogang Ren

机构 * Laplace Lab at University of Tennessee(田纳西大学Laplace实验室) University of California Riverside(加州大学河滨分校) University of Tennessee at Chattanooga(田纳西大学查塔努加分校)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种自适应域偏移方法,通过在扩散模型生成过程中嵌入域偏移动态,提升跨模态图像翻译的结构保真度和语义一致性。

Comments Paper accepted as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01352 2026-02-03 cs.CV 57%

T2M Mamba: Motion Periodicity-Saliency Coupling Approach for Stable Text-Driven Motion Generation

T2M Mamba:基于运动周期性与显著性耦合的稳定文本驱动运动生成方法

Xingzu Zhan, Chen Xie, Honghang Chen, Yixun Lin, Xiaochun Mai

机构 * Shenzhen University(深圳大学) Jinan University(济南大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 T2M Mamba通过周期性-显著性耦合方法,解决文本驱动运动生成中的周期性漂移和语义脆弱性问题,实现更稳定的运动生成。

Comments 8 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01305 2026-02-03 cs.CV 57%

StoryState: Agent-Based State Control for Consistent and Editable Storybooks

StoryState: 基于代理的状态控制用于一致且可编辑的故事书

Ayushman Sarkar, Zhenyu Yu, Wei Tang, Chu Chen, Kangning Cui, Mohd Yamani Idna Idris

机构 * Birbhum Institute of Engineering and Technology(比尔布尔工程科技学院) Universiti Malaya(马来亚大学) City University of Hong Kong(香港城市大学) Wake Forest University(威克森林大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 StoryState通过基于代理的状态控制实现多页故事书的一致性与编辑优化

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01046 2026-02-03 cs.CV 57%

ReLayout: Versatile and Structure-Preserving Design Layout Editing via Relation-Aware Design Reconstruction

ReLayout: 通过关系感知的设计重建实现多功能且结构保持的设计布局编辑

Jiawei Lin, Shizhao Sun, Danqing Huang, Ting Liu, Ji Li, Jiang Bian

机构 * Xi'an Jiaotong University, Xi'an, China(西安交通大学) Microsoft Research(微软研究院)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 ReLayout通过关系感知设计重建实现多功能且结构保持的设计布局编辑,无需三元组数据,提升编辑质量和结构保持性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00516 2026-02-03 cs.CV 57%

SPARK: Stochastic Propagation via Affinity-guided Random walK for training-free unsupervised segmentation

SPARK: 基于亲和力引导的随机游走进行无监督分割的随机传播

Kunal Mahatha, Jose Dolz, Christian Desrosiers

机构 * International Laboratory on Learning Systems (ILLS)(学习系统国际实验室)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 SPARK通过随机传播和亲和力引导的随机游走,实现无监督分割的高效且稳定的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03199 2026-02-03 cs.CL 57%

Beyond Content: How Grammatical Gender Shapes Visual Representation in Text-to-Image Models

超越内容:语法性别如何塑造文本到图像模型中的视觉表示

Muhammed Saeed, Shaina Raza, Ashmal Vayani, Muhammad Abdul-Mageed, Ali Emami, Shady Shehata

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 研究揭示语法性别对文本到图像模型中视觉表示的显著影响,通过跨语言实验展示不同语法性别对性别表示的系统性影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00463 2026-02-03 cs.CV 57%

PSGS: Text-driven Panorama Sliding Scene Generation via Gaussian Splatting

PSGS:通过高斯点划法实现文本驱动的全景滑动场景生成

Xin Zhang, Shen Chen, Jiale Zhou, Lei Li

机构 * East China University of Science and Technology(东华大学) Zhejiang University(浙江大学) Beijing Institute of Technology(北京理工大学)

专题命中 多模态生成 :MLLM(abstract);分类 cs.CV

AI总结 PSGS通过高斯点划法和双阶段框架实现高质量文本驱动全景场景生成,提升3D场景的真实感和细节保真度。

Comments Accepted to ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00042 2026-02-03 eess.SP cs.AI 57%

JSR-GFNet: Jamming-to-Signal Ratio-Aware Dynamic Gating for Interference Classification in future Cognitive Global Navigation Satellite Systems

JSR-GFNet: 针对未来认知全球导航卫星系统干扰分类的干扰-信号比感知动态门控

Zhihan Zeng, Hongyuan Shu, Kaihe Wang, Lu Chen, Amir Hussian, Yanjun Huang, Junchu Zhao, Yue Xiu, Zhongpei Zhang

机构 * National Key Laboratory of Wireless Communications, University of Electronic Science and Technology of China(中国电子科技大学无线通信国家重点实验室) University of Electronic Science and Technology of China(中国电子科技大学) Shanghai Aerospace Electronic Technology Institute(上海航天电子技术研究所) Shanghai Key Laboratory of Collaborative Computing in Spacial Heterogeneous Networks (CCSN)(上海空间异构网络协同计算重点实验室) Anhui Science and Technology University(安徽科技大学) University of Oxford(牛津大学) Shanghai Xiaoyuan Innovation center(上海小元创新中心)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

AI总结 JSR-GFNet通过结合相位敏感的IQ样本与STFT频谱图,利用动态门控机制提升GNSS干扰分类的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00941 2026-02-03 cs.NI 50%

LMTE: Putting the "Reasoning" into WAN Traffic Engineering with Language Models

LMTE:利用语言模型进行WAN流量工程中的推理

Xinyu Yuan, Yan Qiao, Zonghui Wang, Meng Li, Wenzhi Chen

专题命中 多模态生成 :multimodal(abstract)

AI总结 LMTE利用语言模型进行WAN流量工程,通过高效多模态对齐和轻量级配置生成,实现更高效的流量规划和优化。

Comments Accepted as a conference paper at IEEE INFOCOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00808 2026-02-03 cs.RO 50%

Physics-informed Diffusion Mamba Transformer for Real-world Driving

物理引导的扩散Mamba变换器用于现实驾驶

Hang Zhou, Qiang Zhang, Peiran Liu, Yihao Qin, Zhaoxu Yan, Yiding Ji

机构 * Robotics and Autonomous Systems Thrust, The Hong Kong University of Science and Technology(Guangzhou)(香港科学与技术大学(广州)机器人与自主系统方向) MoSense Technologies

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出了一种结合Mamba和注意力机制的扩散模型,通过整合物理约束提升自动驾驶轨迹预测的准确性和可解释性。

Journal ref International Conference on Robotics & Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11818 2026-02-03 cs.LG 50%

SynCoGen: Synthesizable 3D Molecule Generation via Joint Reaction and Coordinate Modeling

SynCoGen: 通过联合反应和坐标建模实现可合成的3D分子生成

Andrei Rekesh, Miruna Cretu, Dmytro Shevchuk, Vignesh Ram Somnath, Pietro Liò, Robert A. Batey, Mike Tyers, Michał Koziarski, Cheng-Hao Liu

机构 * University of Toronto(多伦多大学) The Hospital for Sick Children(多伦多儿童医院) University of Cambridge(剑桥大学) ETH Zürich(苏黎世联邦理工学院) Vector Institute(向量研究所) Mila – Quebec AI Institute(魁北克AI研究所) McGill University(麦吉尔大学) Caltech(加州理工学院)

专题命中 多模态生成 :multimodal(abstract)

AI总结 SynCoGen通过联合反应和坐标建模实现可合成的3D分子生成,实现了分子构建块、化学反应和原子坐标的联合分布采样,在无条件小分子生成和药物发现中表现出色。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏