arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-06 至 2026-02-06 共收录 62 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 7 篇

2602.05251 2026-02-06 cs.LG 82%

TADS: Task-Aware Data Selection for Multi-Task Multimodal Pre-Training

TADS: 任务感知的数据选择用于多任务多模态预训练

Guanjie Cheng, Boyi Li, Lingyu Sun, Mengying Zhu, Yangyang Wu, Xinkui Zhao, Shuiguang Deng

机构 * School of Software Technology, Zhejiang University(浙江大学软件技术学院) School of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract)

AI总结 TADS通过整合内在质量、任务相关性和分布多样性,提升多任务多模态预训练的数据效率,实现更高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07209 2026-02-06 cs.CV cs.AI cs.GR 81%

SIRR-LMM: Single-image Reflection Removal via Large Multimodal Model

SIRR-LMM:通过大多模态模型实现单图像反射去除

Yu Guo, Zhiqiang Lao, Xiyun Song, Yubin Zhou, Heather Yu

机构 * Futurewei Technologies(未来科技公司)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出SIRR-LMM方法,通过大模型和合成数据集生成技术,提升单图像反射去除的性能。

Comments 12 pages, 14 figures, accepted in WACVW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22120 2026-02-06 cs.CV 74%

See Less, See Right: Bi-directional Perceptual Shaping For Multimodal Reasoning

看得少,看得对:双向感知塑造用于多模态推理

Shuoshuo Zhang, Yizhen Zhang, Jingjing Fu, Lei Song, Jiang Bian, Yujiu Yang, Rui Wang

机构 * Microsoft Research Asia(微软亚洲研究院) Tsinghua University(清华大学)

专题命中 图文多模态 :multimodal(title);分类 cs.CV

AI总结 本文提出BiPS,通过双向感知塑造提升多模态推理性能,有效增强细粒度视觉依赖并提升跨领域泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05785 2026-02-06 cs.CV cs.AI cs.LG 73%

ReText: Text Boosts Generalization in Image-Based Person Re-identification

ReText:文本提升基于图像的人员重识别泛化能力

Timur Mamedov, Karina Kvanchiani, Anton Konushin, Vadim Konushin

机构 * Tevian, Moscow, Russia(莫斯科 Tévian) Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 ReText通过结合多摄像头和单摄像头数据,利用文本描述增强语义线索,实现更强大的跨领域人员重识别泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05909 2026-02-06 cs.CV 57%

CLIP-Map: Structured Matrix Mapping for Parameter-Efficient CLIP Compression

CLIP-Map: 结构化矩阵映射用于参数高效的CLIP压缩

Kangjie Zhang, Wenxuan Huang, Xin Zhou, Boxiang Zhou, Dejia Song, Yuan Xie, Baochang Zhang, Lizhuang Ma, Nemo Chen, Xu Tang, Yao Hu, Shaohui Lin

机构 * East China Normal University(东华师范大学) Xiaohongshu Inc.(小红书公司) Beihang University(北航大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 CLIP-Map通过结构化矩阵映射和克罗内克因子分解实现参数高效的CLIP压缩,有效保留原始权重信息并在高压缩比下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05261 2026-02-06 cs.CL 57%

Length-Unbiased Sequence Policy Optimization: Revealing and Controlling Response Length Variation in RLVR

长度无偏序列策略优化:揭示和控制RLVR中的响应长度变化

Fanfan Liu, Youyang Yin, Peng Shi, Siqi Yang, Zhixiong Zeng, Haibo Qiu

机构 * Meituan(美团)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出LUSPO算法,通过消除长度偏差解决RLVR中响应长度崩溃问题,并在多个任务中展示出优于现有方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15281 2026-02-06 cs.CV 57%

StyleMe3D: Stylization with Disentangled Priors by Multiple Encoders on 3D Gaussians

StyleMe3D: 通过多编码器在3D高斯上实现解耦先验的风格化

Cailin Zhuang, Yaoqi Hu, Xuanyang Zhang, Wei Cheng, Jiacheng Bao, Shengqi Liu, Yiying Yang, Xianfang Zeng, Gang Yu, Ming Li

机构 * ShanghaiTech University(上海科技大学) StepFun AIGC Research(AIGC研究院) Guangming Laboratory(光明实验室)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 StyleMe3D通过多编码器在3D高斯上实现解耦先验的风格化,利用动态风格分数蒸馏和多模态对齐策略提升风格迁移效果。

Comments 18 pages; Project page: https://styleme3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 6 篇

2602.03891 2026-02-06 eess.AS cs.AI cs.CV cs.MM cs.SD 83%

Sounding Highlights: Dual-Pathway Audio Encoders for Audio-Visual Video Highlight Detection

音频亮点:用于音频-视觉视频亮点检测的双路径音频编码器

Seohyun Joo, Yoori Oh

机构 * School of Electrical Engineering(电气工程学院) Music and Audio Research Group(音乐与音频研究组) Seoul National University(首尔国立大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出双路径音频编码器,通过结合语义和动态路径,提升音频-视觉视频亮点检测的性能。

Comments 5 pages, 2 figures, to appear in ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04924 2026-02-06 cs.LG cs.SD 82%

Knowing When to Answer: Adaptive Confidence Refinement for Reliable Audio-Visual Question Answering

何时回答:可靠音频-视觉问答的自适应置信度细化

Dinh Phu Tran, Jihoon Jeong, Saad Wazir, Seongah Kim, Thao Do, Cem Subakan, Daeyoung Kim

机构 * School of Computing, KAIST, Republic of Korea(韩国釜山科学技术院计算机科学学院) Laval University(拉瓦尔大学) Mila-Quebec AI Institute(魁北克人工智能研究所)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract)

AI总结 本文提出自适应置信度细化方法,用于提升音频-视觉问答任务中可靠性的性能。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05093 2026-02-06 cs.HC 67%

VR Calm Plus: Coupling a Squeezable Tangible Interaction with Immersive VR for Stress Regulation

VR Calm Plus:将可压缩的实体交互与沉浸式VR结合用于压力调节

He Zhang, Xinyang Li, Xingyu Zhou, Xinyi Fu

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract)

AI总结 VR Calm Plus通过结合可压缩实体交互与沉浸式VR,提升压力调节效果,增强积极情绪与放松体验。

Comments This work has been conditionally accepted by the ACM CHI 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08176 2026-02-06 cs.SD cs.AI cs.LG eess.AS 62%

Leveraging Whisper Embeddings for Audio-based Lyrics Matching

利用Whisper嵌入进行基于音频的歌词匹配

Eleonora Mancini, Joan Serrà, Paolo Torroni, Yuki Mitsufuji

机构 * DISI, University of Bologna(博洛尼亚大学DISI) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 本文提出WEALY,利用Whisper嵌入实现基于音频的歌词匹配,通过可重复的流程和多模态扩展,展示了与最先进方法相当的性能,并为音乐信息检索提供了可靠基准。

Comments Accepted at ICASSP 2026 (IEEE International Conference on Acoustics, Speech and Signal Processing)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05107 2026-02-06 cs.CL 57%

Multilingual Extraction and Recognition of Implicit Discourse Relations in Speech and Text

多语言语音与文本中隐含语篇关系的提取与识别

Ahmed Ruby, Christian Hardmeier, Sara Stymne

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出了一种多模态方法,通过整合文本和音频信息,实现多语言隐含语篇关系的跨语言迁移和识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04913 2026-02-06 cs.LG cs.AI cs.SD 57%

A$^2$-LLM: An End-to-end Conversational Audio Avatar Large Language Model

A$^2$-LLM:一种端到端的对话音频虚拟形象大语言模型

Xiaolin Hu, Hang Yuan, Xinzhu Sang, Binbin Yan, Zhou Yu, Cong Huang, Kai Chen

机构 * State Key Laboratory of Information Photonics(信息光子学国家重点实验室) Optical Communications, Beijing University of Posts(邮电大学光学通信学院) Zhongguancun Institute of Artificial Intelligence, Beijing, China(中关村人工智能研究院) School of Finance and Statistics, East China Normal University, Shanghai, China(东华大学金融与统计学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 A$^2$-LLM通过统一框架联合推理语言、音频语调和3D面部运动,实现端到端的情感表达对话虚拟形象,提升实时效率与情感表现力。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 5 篇

2602.04104 2026-02-06 cs.HC 82%

Making Videos Accessible for Blind and Low Vision Users Using a Multimodal Agent Video Player

通过多模态代理视频播放器使视频对视障和低视力用户更加可访问

Adriana Olmos, Anoop K. Sinha, Renelito Delos Santos, Ruben Rodriguez Rodriguez, James A. Landay, Sam S. Sepah, Philip Nelson, Shaun K. Kane

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract)

AI总结 本文提出一种多模态代理视频播放器,通过多层提示编排为视障和低视力用户带来交互式、可访问的视频体验,增强用户自主性和信任感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05986 2026-02-06 cs.CV cs.AI 62%

RISE-Video: Can Video Generators Decode Implicit World Rules?

RISE-Video: 视频生成器能否解码隐含的世界规则?

Mingxin Liu, Shuran Ma, Shibei Meng, Xiangyu Zhao, Zicheng Zhang, Shaofeng Zhang, Zhihang Zhong, Peixian Chen, Haoyu Cao, Xing Sun, Haodong Duan, Xue Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Youtu Lab(腾讯优图实验室) Xidian University(西安电子科技大学) Beijing Normal University(北京师范大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 RISE-Video通过多维评估框架评估视频生成模型在隐含世界规则推理能力,揭示其在复杂场景模拟中的不足,推动未来生成模型的发展。

Comments 38 pages, 16 figures, 3 tables; Code: https://github.com/VisionXLab/RISE-Video; HuggingFace: https://huggingface.co/datasets/VisionXLab/RISE-Video

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05853 2026-02-06 cs.CL 57%

RRAttention: Dynamic Block Sparse Attention via Per-Head Round-Robin Shifts for Long-Context Inference

RRAttention: 通过每头轮换位移实现动态块稀疏注意力以支持长上下文推理

Siran Liu, Guoxia Wang, Sa Wang, Jinle Zeng, HaoYang Xie, Siyu Lou, JiaBin Yang, DianHai Yu, Haifeng Wang, Chao Yang

机构 * Baidu Inc.(百度公司) Peking University(北京大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 RRAttention通过轮换位移策略实现动态块稀疏注意力,提升长上下文推理效率,实现99%的完整注意力性能和2.4倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05829 2026-02-06 cs.CV 57%

Weaver: End-to-End Agentic System Training for Video Interleaved Reasoning

Weaver:用于视频交织推理的端到端代理系统训练

Yudi Shi, Shangzhe Di, Qirui Chen, Qinian Wang, Jiayin Cai, Xiaolong Jiang, Yao Hu, Weidi Xie

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 Weaver通过端到端训练多模态推理代理系统,提升视频推理任务在长视频处理上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05514 2026-02-06 cs.CE 50%

Detecting Information Channels in Congressional Trading via Temporal Graph Learning

通过时序图学习检测国会交易中的信息通道

Benjamin Pham Roodman, Eugene Sy, J. Xavier Atero Vázquez, Yu-Shiang Huang, Che Lin, Chaun-Ju Wang

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出利用时序图学习方法,通过分析国会与企业之间的动态关系,识别出在股票交易中可能具备信息优势的通道。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 2 篇

2602.04451 2026-02-06 cs.IR 67%

SDR-CIR: Semantic Debias Retrieval Framework for Training-Free Zero-Shot Composed Image Retrieval

SDR-CIR:一种基于链式推理的语义去偏检索框架用于无训练零样本复合图像检索

Yi Sun, Jinyu Xu, Qing Xie, Jiachen Li, Yanchun Ma, Yongjian Liu

专题命中 跨模态检索 :multimodal(abstract);MLLM(abstract)

AI总结 SDR-CIR通过语义去偏排名方法提升无训练零样本复合图像检索性能。

Comments Accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05484 2026-02-06 cs.CR 50%

Clouding the Mirror: Stealthy Prompt Injection Attacks Targeting LLM-based Phishing Detection

镜面迷雾:针对基于大语言模型的钓鱼检测的隐秘提示注入攻击

Takashi Koide, Hiroki Nakano, Daiki Chiba

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文首次全面评估了针对基于大语言模型的钓鱼检测的提示注入攻击,提出InjectDefuser防御框架以降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 8 篇

2509.13646 2026-02-06 cs.HC 78%

Vistoria: A Multimodal System to Support Fictional Story Writing through Instrumental Text-Image Co-Editing

Vistoria:一种多模态系统,通过仪器文本-图像协同编辑支持虚构故事写作

Kexue Fu, Jingfei Huang, Long Ling, Sumin Hong, Yihang Zuo, Ray LC, Toby Jia-jun Li

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 Vistoria通过多模态协同编辑提升虚构故事创作的表达力和创造力,使作家能更自由地探索故事发展方向。

Comments Change the format of the first page

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02276 2026-02-06 cs.LG cs.AI cs.CL q-bio.QM 62%

CellForge: Agentic Design of Virtual Cell Models

CellForge: 虚拟细胞模型的代理设计

Xiangru Tang, Zhuoyun Yu, Jiapeng Chen, Yan Cui, Daniel Shao, Weixu Wang, Fang Wu, Yuchen Zhuang, Wenqi Shi, Zhi Huang, Arman Cohan, Xihong Lin, Fabian Theis, Smita Krishnaswamy, Mark Gerstein

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 CellForge通过多代理协作自主设计虚拟细胞模型,生成高竞争力的计算方法,推动计算生物学的自主科学方法开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05998 2026-02-06 cs.CV 57%

VisRefiner: Learning from Visual Differences for Screenshot-to-Code Generation

VisRefiner: 从视觉差异中学习以实现截图到代码生成

Jie Deng, Kaichun Yao, Libo Zhang

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 VisRefiner通过学习视觉差异提升截图到代码生成的准确性和自我完善能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05339 2026-02-06 cs.CV cs.LG 57%

Consistency-Preserving Concept Erasure via Unsafe-Safe Pairing and Directional Fisher-weighted Adaptation

通过不安全-安全配对和方向性Fisher加权适应进行一致性保持的概念擦除

Yongwoo Kim, Sungmin Cha, Hyunsoo Kim, Jaewon Lee, Donghyun Kim

机构 * Korea University(韩国大学) New York University(纽约大学) Korea Institute of Science(韩国科学技术院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出PAIR框架,通过不安全-安全配对和方向性Fisher加权适应,实现对有害概念的精细化擦除,保持生成内容的结构和语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05013 2026-02-06 cs.GR cs.CV 57%

Untwisting RoPE: Frequency Control for Shared Attention in DiTs

解开RoPE:多模态和共享注意力中的频率控制

Aryan Mikaeili, Or Patashnik, Andrea Tagliasacchi, Daniel Cohen-Or, Ali Mahdavi-Amiri

机构 * Simon Fraser University(西蒙弗雷泽大学) Tel Aviv University(特拉维夫大学) University of Toronto(多伦多大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文通过分析RoPE的频率结构,提出方法调节RoPE频率带以实现更符合语义的共享注意力,从而有效控制风格迁移与内容复制的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04886 2026-02-06 cs.LG cs.AI cs.CE stat.ML 57%

Denoising diffusion networks for normative modeling in neuroimaging

去噪扩散网络在神经影像规范建模中的应用

Luke Whitbread, Lyle J. Palmer, Mark Jenkinson

机构 * Australian Institute for Machine Learning (AIML), Adelaide University(澳大利亚机器学习研究所(AIML),阿德莱德大学) South Australian Health and Medical Research Institute (SAHMRI)(南澳大利亚健康与医学研究机构(SAHMRI)) School of Computer Science and Information Technology, Adelaide University(计算机科学与信息技术学院,阿德莱德大学) School of Public Health, Adelaide University(公共卫生学院,阿德莱德大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出基于去噪扩散概率模型(DDPMs)的神经影像规范建模方法,通过统一条件密度估计器实现多变量依赖关系建模,提升高维数据下的校准性能和可扩展性。

Comments 55 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05855 2026-02-06 cs.RO cs.LG 50%

A Hybrid Autoencoder for Robust Heightmap Generation from Fused Lidar and Depth Data for Humanoid Robot Locomotion

一种用于人形机器人运动的融合激光雷达和深度数据的鲁棒高度图生成的混合自编码器

Dennis Bank, Joost Cordes, Thomas Seel, Simon F. G. Ehlers

机构 * Institute of Mechatronic Systems, Leibniz University Hannover(机械系统研究所,莱比锡洪堡大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出了一种混合自编码器,通过融合激光雷达和深度数据生成鲁棒的高度图,以提升人形机器人在非结构化环境中的运动性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03405 2026-02-06 quant-ph cs.LG 50%

Enhancing Quantum Diffusion Models for Complex Image Generation

增强量子扩散模型用于复杂图像生成

Jeongbin Jo, Santanam Wishal, Shah Md Khalil Ullah, Shan Zeng, Dikshant Dulal

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出混合量子-经典U-Net架构,结合自适应非局部可观测量,以提升复杂图像生成的性能和可扩展性。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 10 篇

2602.05576 2026-02-06 cs.LG 82%

OpenMAG: A Comprehensive Benchmark for Multimodal-Attributed Graph

OpenMAG: 多模态属性图的综合基准

Chenxi Wan, Xunkai Li, Yilong Zuo, Haokun Deng, Sihan Li, Bowen Fan, Hongchao Qin, Ronghua Li, Guoren Wang

机构 * Department of Computer Science, Beijing Institute of Technology, Beijing, China(计算机科学系,北京理工大学,北京,中国)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract)

AI总结 OpenMAG是一个综合基准,通过整合多领域数据集和多种编码器,提供统一框架以评估多模态属性图学习的公平比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05496 2026-02-06 cs.MM cs.AI cs.CV 82%

XEmoGPT: An Explainable Multimodal Emotion Recognition Framework with Cue-Level Perception and Reasoning

XEmoGPT:一种具有线索级感知与推理的可解释多模态情感识别框架

Hanwen Zhang, Yao Liu, Peiyuan Jiang, Lang Junjie, Xie Jun, Yihui He, Yajiao Deng, Siyu Du, Qiao Liu

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) th Research Institute, China Electronics Technology Group Corporation(中国电子科技集团第五十四研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 XEmoGPT通过专门模块和大规模数据集提升多模态情感识别的可解释性和线索级推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏