arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-05 至 2026-02-05 共收录 64 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 9 篇

2503.20322 2026-02-05 cs.CV 83%

Dynamic Pyramid Network for Efficient Multimodal Large Language Model

动态金字塔网络用于高效多模态大语言模型

Hao Ai, Kunyi Wang, Zezhou Wang, Hao Lu, Jin Tian, Yaxin Luo, Peng Xing, Jen-Yuan Huang, Huaxia Li, Gen luo

机构 * Beihang University(北航大学) Shanghai AI Laboratory(上海人工智能实验室) KAUST(卡塔尔大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Technical University Of Denmark(丹麦技术大学) Nanjing University of Science and Technology(南京理工大学) Peking University(北京大学) Xiaohongshu Inc(小红书公司)

专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 动态金字塔网络通过分层结构和动态池化专家提升多模态大语言模型的效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22208 2026-02-05 cs.CL cs.CV cs.LG 76%

Open-Source Multimodal Moxin Models with Moxin-VLM and Moxin-VLA

开源多模态Moxin模型:Moxin-VLM和Moxin-VLA

Pu Zhao, Arash Akbari, Xuan Shen, Zhenglun Kong, Yixin Shen, Sung-En Chang, Timothy Rupprecht, Lei Lu, Enfu Nan, Changdi Yang, Yumei He, Weiyan Shi, Xingchen Xu, Yu Huang, Wei Jiang, Wei Wang, Yue Chen, Yong He, Yanzhi Wang

机构 * Northeastern University(东北大学) Harvard University(哈佛大学) Cornell University(康奈尔大学) Tulane University(路易斯安那州立大学) University of Washington(华盛顿大学) Futurewei(未来通信) AIBAO LLC

专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.CL

AI总结 本文提出开源多模态Moxin模型,通过Moxin-VLM、Moxin-VLA和Moxin-Chinese三种变体,提升视觉-语言、视觉-语言-动作及中文任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20504 2026-02-05 cs.CV 70%

UniVRSE: Unified Vision-conditioned Response Semantic Entropy for Hallucination Detection in Medical Vision-Language Models

UniVRSE: 统一的视觉条件响应语义熵用于医学视觉语言模型中的幻觉检测

Zehui Liao, Shishuai Hu, Ke Zou, Mengyuan Jin, Yanning Zhang, Huazhu Fu, Liangli Zhen, Yong Xia

机构 * National Engineering Laboratory for Integrated Aero-Space-Ground-Ocean Big Data Application Technology, School of Computer Science and Engineering, Northwestern Polytechnical University(集成航空航天地面海洋大数据应用技术国家工程实验室,计算机科学与工程学院,西北工业大学)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 UniVRSE通过统一的视觉条件响应语义熵框架,有效检测医学视觉语言模型中的幻觉,提升临床应用的可靠性。

Comments Under Review. 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04337 2026-02-05 cs.CV cs.AI 62%

Fine-tuning Pre-trained Vision-Language Models in a Human-Annotation-Free Manner

无需人工标注的预训练视觉-语言模型微调

Qian-Wei Wang, Guanghao Meng, Ren Cai, Yaguang Song, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Institute of Perceptual Intelligence, Peng Cheng Laboratory(感知智能研究院,鹏城实验室) Peking University Shenzhen Graduate School, Peking University(北京大学深圳研究生院,北京大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 CoFT通过双模型跨模态协作机制和双提示学习策略,在无需人工标注的情况下提升预训练视觉-语言模型的下游任务适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04355 2026-02-05 cs.CL 57%

Can Vision Replace Text in Working Memory? Evidence from Spatial n-Back in Vision-Language Models

视觉能否取代文本在工作记忆中的作用?来自视觉-语言模型中空间n-Back任务的证据

Sichu Liang, Hongyu Zhu, Wenwen Wang, Deyu Zhou

机构 * Southeast University(东南大学) Shanghai Jiao Tong University(上海交通大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

AI总结 研究通过空间n-Back任务评估视觉-语言模型中视觉与文本对工作记忆的影响,发现文本条件下的表现优于视觉条件,揭示了视觉信息处理中的计算差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21639 2026-02-05 cs.CV 57%

OCRVerse: Towards Holistic OCR in End-to-End Vision-Language Models

OCRVerse: 向端到端视觉语言模型中的整体OCR迈进

Yufeng Zhong, Lei Chen, Xuanle Zhao, Wenkang Han, Liming Zheng, Jing Huang, Deyang Jiang, Yilin Cao, Lin Ma, Zhixiong Zeng

机构 * Meituan(美团)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 OCRVerse是一种端到端的全面OCR方法,通过多领域训练实现文本和视觉导向OCR的统一,提升跨领域数据处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12340 2026-02-05 cs.CV cs.CR 57%

Image Corruption-Inspired Membership Inference Attacks against Large Vision-Language Models

基于图像退化启发的对抗大视觉-语言模型的成员推断攻击

Zongyu Wu, Minhua Lin, Zhiwei Zhang, Fali Wang, Xianren Zhang, Xiang Zhang, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出基于图像退化启发的成员推断攻击方法,用于检测目标图像是否被用于训练大视觉-语言模型,通过图像退化和文本嵌入相似性进行攻击。

Comments Accepted by EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17440 2026-02-05 cs.CV 57%

VEAttack: Downstream-agnostic Vision Encoder Attack against Large Vision Language Models

VEAttack: 面向大视觉语言模型的下游任务无关视觉编码器攻击

Hefei Mei, Zirui Wang, Shen You, Minjing Dong, Chang Xu

机构 * City University of Hong Kong(香港城市大学) University of Sydney(悉尼大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 VEAttack是一种针对大视觉语言模型视觉编码器的简单有效攻击方法,通过优化图像令牌降低计算开销,实现对多种下游任务的泛化攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03910 2026-02-05 eess.IV 50%

CONRep: Uncertainty-Aware Vision-Language Report Drafting Using Conformal Prediction

CONRep:基于置信预测的不确定性感知视觉-语言报告起草

Danial Elyassirad, Benyamin Gheiji, Mahsa Vatanparast, Amir Mahmoud Ahmadzadeh, Seyed Amir Asef Agah, Mana Moassefi, Meysam Tavakoli, Shahriar Faghani

专题命中 图文多模态 :image-text(abstract)

AI总结 CONRep通过置信预测为视觉语言模型生成的放射学报告提供不确定性量化,提升自动化报告系统的透明性和临床实用性。

Comments 17 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 6 篇

2601.18321 2026-02-05 cs.MM cs.CL cs.CV 89%

Integrating Fine-Grained Audio-Visual Evidence for Robust Multimodal Emotion Reasoning

融合细粒度音频视觉证据以实现鲁棒的多模态情绪推理

Zhixian Zhao, Wenjie Tian, Lei Xie

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title);cross-modal(abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 SABER-LLM通过构建大规模情绪推理数据集和结构化证据分解范式,实现鲁棒的多模态情绪推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03892 2026-02-05 cs.CV cs.AI cs.LG cs.MM cs.SD eess.AS 87%

Audit After Segmentation: Reference-Free Mask Quality Assessment for Language-Referred Audio-Visual Segmentation

分段后审计:用于语言指代音频视频分段的无参考掩码质量评估

Jinxing Zhou, Yanghao Zhou, Yaoting Wang, Zongyan Han, Jiaqi Ma, Henghui Ding, Rao Muhammad Anwer, Hisham Cholakkal

机构 * MBZUAI National University of Singapore(国立新加坡大学) Fudan University(复旦大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本研究提出 MQA-RefAVS 任务,通过多模态大语言模型评估语言指代音频视频分段中掩码质量,提升分割准确性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03365 2026-02-05 cs.SD cs.AI cs.CR eess.AS 62%

When Good Sounds Go Adversarial: Jailbreaking Audio-Language Models with Benign Inputs

当良好声音变得对抗性:利用无害输入对音频-语言模型进行劫持

Hiskias Dingeto, Taeyoun Kwon, Dasol Choi, Bodam Kim, DongGeon Lee, Haon Park, JaeHoon Lee, Jongho Shin

机构 * Yonsei University, Seoul, South Korea(延世大学) Seoul National University, Seoul, South Korea(首尔国立大学) Pohang University of Science(坡桑科学大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 WhisperInject通过在无害音频中嵌入细微扰动,利用两阶段对抗性攻击框架劫持音频-语言模型,生成有害内容,展示了音频原生威胁的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04705 2026-02-05 cs.CL 57%

ERNIE 5.0 Technical Report

ERNIE 5.0技术报告

Haifeng Wang, Hua Wu, Tian Wu, Yu Sun, Jing Liu, Dianhai Yu, Yanjun Ma, Jingzhou He, Zhongjun He, Dou Hong, Qiwen Liu, Shuohuan Wang, Junyuan Shang, Zhenyu Zhang, Yuchen Ding, Jinle Zeng, Jiabin Yang, Liang Shen, Ruibiao Chen, Weichong Yin, Siyu Ding, Dai Dai, Shikun Feng, Siqi Bao, Bolei He, Yan Chen, Zhenyu Jiao, Ruiqing Zhang, Zeyu Chen, Qingqing Dang, Kaipeng Deng, Jiajun Jiang, Enlei Gong, Guoxia Wang, Yanlin Sha, Yi Liu, Yehan Zheng, Weijian Xu, Jiaxiang Liu, Zengfeng Zeng, Yingqi Qu, Zhongli Li, Zhengkun Zhang, Xiyang Wang, Zixiang Xu, Xinchao Xu, Zhengjie Huang, Dong Wang, Bingjin Chen, Yue Chang, Xing Yuan, Shiwei Huang, Qiao Zhao, Xinzhe Ding, Shuangshuang Qiao, Baoshan Yang, Bihong Tang, Bin Li, Bingquan Wang, Binhan Tang, Binxiong Zheng, Bo Cui, Bo Ke, Bo Zhang, Bowen Zhang, Boyan Zhang, Boyang Liu, Caiji Zhang, Can Li, Chang Xu, Chao Pang, Chao Zhang, Chaoyi Yuan, Chen Chen, Cheng Cui, Chenlin Yin, Chun Gan, Chunguang Chai, Chuyu Fang, Cuiyun Han, Dan Zhang, Danlei Feng, Danxiang Zhu, Dong Sun, Dongbo Li, Dongdong Li, Dongdong Liu, Dongxue Liu, Fan Ding, Fan Hu, Fan Li, Fan Mo, Feisheng Wu, Fengwei Liu, Gangqiang Hu, Gaofeng Lu, Gaopeng Yong, Gexiao Tian, Guan Wang, Guangchen Ni, Guangshuo Wu, Guanzhong Wang, Guihua Liu, Guishun Li, Haibin Li, Haijian Liang, Haipeng Ming, Haisu Wang, Haiyang Lu, Haiye Lin, Han Zhou, Hangting Lou, Hanwen Du, Hanzhi Zhang, Hao Chen, Hao Du, Hao Liu, Hao Zhou, Haochen Jiang, Haodong Tian, Haoshuang Wang, Haozhe Geng, Heju Yin, Hong Chen, Hongchen Xue, Hongen Liu, Honggeng Zhang, Hongji Xu, Hongwei Chen, Hongyang Zhang, Hongyuan Zhang, Hua Lu, Huan Chen, Huan Wang, Huang He, Hui Liu, Hui Zhong, Huibin Ruan, Jiafeng Lu, Jiage Liang, Jiahao Hu, Jiahao Hu, Jiajie Yang, Jialin Li, Jian Chen, Jian Wu, Jianfeng Yang, Jianguang Jiang, Jianhua Wang, Jianye Chen, Jiaodi Liu, Jiarui Zhou, Jiawei Lv, Jiaxin Zhou, Jiaxuan Liu, Jie Han, Jie Sun, Jiefan Fang, Jihan Liu, Jihua Liu, Jing Hu, Jing Qian, Jing Yan, Jingdong Du, Jingdong Wang, Jingjing Wu, Jingyong Li, Jinheng Wang, Jinjin Li, Jinliang Lu, Jinlin Yu, Jinnan Liu, Jixiang Feng, Jiyi Huang, Jiyuan Zhang, Jun Liang, Jun Xia, Jun Yu, Junda Chen, Junhao Feng, Junhong Xiang, Junliang Li, Kai Liu, Kailun Chen, Kairan Su, Kang Hu, Kangkang Zhou, Ke Chen, Ke Wei, Kui Huang, Kun Wu, Kunbin Chen, Lei Han, Lei Sun, Lei Wen, Linghui Meng, Linhao Yu, Liping Ouyang, Liwen Zhang, Longbin Ji, Longzhi Wang, Meng Sun, Meng Tian, Mengfei Li, Mengqi Zeng, Mengyu Zhang, Ming Hong, Mingcheng Zhou, Mingming Huang, Mingxin Chen, Mingzhu Cai, Naibin Gu, Nemin Qiu, Nian Wang, Peng Qiu, Peng Zhao, Pengyu Zou, Qi Wang, Qi Xin, Qian Wang, Qiang Zhu, Qianhui Luo, Qianwei Yang, Qianyue He, Qifei Wu, Qinrui Li, Qiwen Bao, Quan Zhang, Quanxiang Liu, Qunyi Xie, Rongrui Zhan, Rufeng Dai, Rui Peng, Ruian Liu, Ruihao Xu, Ruijie Wang, Ruixi Zhang, Ruixuan Liu, Runsheng Shi, Ruting Wang, Senbo Kang, Shan Lu, Shaofei Yu, Shaotian Gong, Shenwei Hu, Shifeng Zheng, Shihao Guo, Shilong Fan, Shiqin Liu, Shiwei Gu, Shixi Zhang, Shuai Yao, Shuang Zhang, Shuangqiao Liu, Shuhao Liang, Shuwei He, Shuwen Yang, Sijun He, Siming Dai, Siming Wu, Siyi Long, Songhe Deng, Suhui Dong, Suyin Liang, Teng Hu, Tianchan Xu, Tianliang Lv, Tianmeng Yang, Tianyi Wei, Tiezhu Gao, Ting Sun, Ting Zhang, Tingdan Luo, Wei He, Wei Luan, Wei Yin, Wei Zhang, Wei Zhou, Weibao Gong, Weibin Li, Weicheng Huang, Weichong Dang, Weiguo Zhu, Weilong Zhang, Weiqi Tan, Wen Huang, Wenbin Chang, Wenjing Du, Wenlong Miao, Wenpei Luo, Wenquan Wu, Xi Shi, Xi Zhao, Xiang Gao, Xiangguo Zhang, Xiangrui Yu, Xiangsen Wang, Xiangzhe Wang, Xianlong Luo, Xianying Ma, Xiao Tan, Xiaocong Lin, Xiaofei Wang, Xiaofeng Peng, Xiaofeng Wu, Xiaojian Xu, Xiaolan Yuan, Xiaopeng Cui, Xiaotian Han, Xiaoxiong Liu, Xiaoxu Fei, Xiaoxuan Wu, Xiaoyu Wang, Xiaoyu Zhang, Xin Sun, Xin Wang, Xinhui Huang, Xinming Zhu, Xintong Yu, Xinyi Xu, Xinyu Wang, Xiuxian Li, XuanShi Zhu, Xue Xu, Xueying Lv, Xuhong Li, Xulong Wei, Xuyi Chen, Yabing Shi, Yafeng Wang, Yamei Li, Yan Liu, Yanfu Cheng, Yang Gao, Yang Liang, Yang Wang, Yang Wang, Yang Yang, Yanlong Liu, Yannian Fu, Yanpeng Wang, Yanzheng Lin, Yao Chen, Yaozong Shen, Yaqian Han, Yehua Yang, Yekun Chai, Yesong Wang, Yi Song, Yichen Zhang, Yifei Wang, Yifeng Guo, Yifeng Kou, Yilong Chen, Yilong Guo, Yiming Wang, Ying Chen, Ying Wang, Yingsheng Wu, Yingzhan Lin, Yinqi Yang, Yiran Xing, Yishu Lei, Yixiang Tu, Yiyan Chen, Yong Zhang, Yonghua Li, Yongqiang Ma, Yongxing Dai, Yongyue Zhang, Yu Ran, Yu Sun, Yu-Wen Michael Zhang, Yuang Liu, Yuanle Liu, Yuanyuan Zhou, Yubo Zhang, Yuchen Han, Yucheng Wang, Yude Gao, Yuedong Luo, Yuehu Dong, Yufeng Hu, Yuhui Cao, Yuhui Yun, Yukun Chen, Yukun Gao, Yukun Li, Yumeng Zhang, Yun Fan, Yun Ma, Yunfei Zhang, Yunshen Xie, Yuping Xu, Yuqin Zhang, Yuqing Liu, Yurui Li, Yuwen Wang, Yuxiang Lu, Zefeng Cai, Zelin Zhao, Zelun Zhang, Zenan Lin, Zezhao Dong, Zhaowu Pan, Zhaoyu Liu, Zhe Dong, Zhe Zhang, Zhen Zhang, Zhengfan Wu, Zhengrui Wei, Zhengsheng Ning, Zhenxing Li, Zhenyu Li, Zhenyu Qian, Zhenyun Li, Zhi Li, Zhichao Chen, Zhicheng Dong, Zhida Feng, Zhifan Feng, Zhihao Deng, Zhijin Yu, Zhiyang Chen, Zhonghui Zheng, Zhuangzhuang Guo, Zhujun Zhang, Zhuo Sun, Zichang Liu, Zihan Lin, Zihao Huang, Zihe Zhu, Ziheng Zhao, Ziping Chen, Zixuan Zhu, Ziyang Xu, Ziyi Liang, Ziyuan Gao

机构 * ERNIE Team(ERNIE团队)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 ERNIE 5.0是首个实现万亿参数统一自回归模型的生产规模实现,支持多模态理解和生成,并采用弹性训练范式实现灵活的性能与资源权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04085 2026-02-05 cs.SD cs.CL 57%

BASS: Benchmarking Audio LMs for Musical Structure and Semantic Reasoning

BASS:用于音乐结构和语义推理的音频语言模型基准测试

Min Jang, Orevaoghene Ahia, Nazif Tamer, Sachin Kumar, Yulia Tsvetkov, Noah A. Smith

机构 * University of Washington(华盛顿大学) The Ohio State University(俄亥俄州立大学) Allen Institute for AI(人工智能研究所)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 BASS通过评估音频语言模型在音乐结构和语义推理方面的性能,揭示了现有模型在高层次推理任务上的局限性,并为音乐推荐和搜索提供评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25458 2026-02-05 cs.AI 57%

Plug-and-Play Emotion Graphs for Compositional Prompting in Zero-Shot Speech Emotion Recognition

即插即用的情感图谱用于零样本语音情感识别的组合提示

Jiacheng Shi, Hongfei Du, Y. Alicia Hong, Ye Gao

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI

AI总结 本文提出CCoT-Emo框架,通过引入结构化情感图谱提升零样本语音情感识别的性能。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 2 篇

2505.13928 2026-02-05 cs.CV cs.IR 79%

LoVR: A Benchmark for Long Video Retrieval in Multimodal Contexts

LoVR:一种多模态背景下长视频检索的基准

Qifeng Cai, Hao Liang, Zhaoyang Han, Hejun Dong, Meiyi Qiang, Ruichuan An, Quanqing Xu, Bin Cui, Wentao Zhang

机构 * East China Normal University Shanghai China Peking University \& Zhongguancun Academy Beijing China Huazhong University of Science Beihang University Beijing China Peking University Beijing China East China Normal University Peking University \& Zhongguancun Academy Beihang University Peking University

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 LoVR是一个针对长视频检索的多模态基准,通过高质量标注和细粒度数据提升视频理解挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04257 2026-02-05 cs.CV 57%

Depth-Guided Metric-Aware Temporal Consistency for Monocular Video Human Mesh Recovery

基于深度的度量感知时序一致性用于单目视频人体网格恢复

Jiaxin Cen, Xudong Mao, Guanghui Yue, Wei Zhou, Ruomei Wang, Fan Zhou, Baoquan Zhao

机构 * Sun Yat-sen University, China(中山大学) Shenzhen University, China(深圳大学) Cardiff University, UK(卡迪夫大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出深度引导的度量感知时序一致性框架,通过多尺度融合、D-MAPS估计器和MoDAR模块提升单目视频人体网格恢复的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 5 篇

2602.04116 2026-02-05 cs.LG cs.AI cs.SI 83%

Toward Effective Multimodal Graph Foundation Model: A Divide-and-Conquer Based Approach

迈向有效的多模态图基础模型:基于分而治之的方法

Sicheng Liu, Xunkai Li, Daohan Su, Ru Zhang, Hongchao Qin, Ronghua Li, Guoren Wang

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 PLANET提出了一种基于分而治之的方法,通过解耦模态交互和对齐,提升多模态图基础模型的性能。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20347 2026-02-05 cs.CV 83%

MMSF: Multitask and Multimodal Supervised Framework for WSI Classification and Survival Analysis

MMSF:多任务和多模态监督框架用于WSI分类和生存分析

Chengying She, Chengwei Chen, Xinran Zhang, Ben Wang, Lizhuang Liu, Chengwei Shao, Yun Bian

机构 * University of Chinese Academy of Sciences(中国科学院大学) Shanghai Advanced Research Institute, Chinese Academy of Sciences(中国科学院上海先进研究院) Department of Radiology, Changhai Hospital(昌海医院放射科)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 MMSF通过多任务和多模态监督框架,结合组织拓扑和临床数据,提升全滑片图像分类和生存分析的准确性和预后预测能力。

Comments Submitted to "Biomedical Signal Processing and Control"

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04021 2026-02-05 cs.LG q-bio.QM stat.ML 82%

Group Contrastive Learning for Weakly Paired Multimodal Data

用于弱配对多模态数据的组对比学习

Aditya Gorla, Hugues Van Assel, Jan-Christian Huetter, Heming Yao, Kyunghyun Cho, Aviv Regev, Russell Littman

机构 * Research and Early Development (gRED), Genentech(Genentech 研究与早期发展部门) UCLA(加州大学洛杉矶分校) Biology Research | AI Development (BRAID), Genentech(Genentech 生物研究 | 人工智能开发部门) Genentech Computational Sciences NYU(Genentech 计算科学与纽约大学)

专题命中 跨模态检索 :multimodal(title);multi-modal(abstract);cross-modal(abstract)

AI总结 GROOVE通过组级对比学习方法,有效处理弱配对多模态数据,提升跨模态匹配与填补任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04263 2026-02-05 cs.IR 78%

LILaC: Late Interacting in Layered Component Graph for Open-domain Multimodal Multihop Retrieval

LILaC:基于分层组件图的开放域多模态多跳检索中的后期交互

Joohyung Yun, Doyup Lee, Wook-Shin Han

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 LILaC通过分层组件图和后期交互子图检索方法,提升开放域多模态多跳检索的精度与效率。

Comments Project page: https://lilac-emnlp2025.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21904 2026-02-05 cs.CV 57%

Beyond Global Alignment: Fine-Grained Motion-Language Retrieval via Pyramidal Shapley-Taylor Learning

超越全局对齐:通过金字塔Shapley-Taylor学习实现细粒度动语言检索

Hanmo Chen, Guangtao Lyu, Chenghao Xu, Jiexi Yan, Xu Yang, Cheng Deng

机构 * Hangzhou Institute of Technology, Xidian University, Hangzhou, China(杭州理工大学、西安电子科技大学、杭州,中国) Xidian University, Xi'an, China(西安电子科技大学、西安,中国) Hohai University, Nanjing, China(河海大学、南京,中国)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出基于金字塔Shapley-Taylor学习的细粒度动语言检索方法,通过分层对齐捕捉局部细节与层次结构,提升检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 4 篇

2601.21006 2026-02-05 physics.plasm-ph 78%

A joint diffusion approach to multi-modal inference in inertial confinement fusion

一种联合扩散方法用于惯性约束聚变中的多模态推断

Michael S. Jones, Justin Kunimune, Daniel Casey, Bogdan Kustowski, Eugene Kur, Kelli Humbird

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 本文提出JointDiff方法,通过联合扩散统一正向建模、逆向推断和输出填补,提升惯性约束聚变实验的多模态推断精度与可转移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00508 2026-02-05 eess.SP 78%

Quadrature Over-the-Air-Computing for Multimodal Dual-Stream Signal Processing

正交空天地计算用于多模双流信号处理

Hyeon Seok Rou, Kengo Ando, Giuseppe Thadeu Freitas de Abreu, David González G

专题命中 多模态生成 :multimodal(title);multi-modal(abstract)

AI总结 Q-OTAC通过利用复信号的同相和正交分量,实现双流同时计算,提升计算效率,适用于多模B5G应用。

Comments Accepted at the IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13462 2026-02-05 cs.SD cs.MM eess.AS 73%

SAVGBench: Benchmarking Spatially Aligned Audio-Video Generation

SAVGBench: 多模态空间对齐音频视频生成基准测试

Kazuki Shimada, Christian Simon, Takashi Shibuya, Shusuke Takahashi, Yuki Mitsufuji

机构 * Sony AI(索尼人工智能) Sony Group Corporation(索尼集团)

专题命中 多模态生成 :multimodal(abstract);audio-visual(abstract);分类 cs.MM、eess.AS

AI总结 SAVGBench提出了一种新的基准测试方法,用于评估空间对齐音频视频生成任务的性能,通过引入专门的数据集和对齐度量标准,评估不同生成模型的对齐效果。

Comments 5 pages, 2 figures, accepted for publication in IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03112 2026-02-05 cs.RO 50%

A Unified Candidate Set with Scene-Adaptive Refinement via Diffusion for End-to-End Autonomous Driving

通过扩散生成场景自适应候选集的统一候选集用于端到端自动驾驶

Zhengfei Wu, Shuaixi Pan, Shuohan Chen, Shuo Yang, Yanjun Huang

机构 * School of Automotive Studies, Tongji University, Shanghai, China(同济大学汽车学院)

专题命中 多模态生成 :multimodal(abstract)

AI总结 CdDrive通过扩散生成场景自适应候选集,提升端到端自动驾驶的候选集设计与轨迹平滑性

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 14 篇

2602.04739 2026-02-05 cs.CL cs.AI cs.HC 84%

Alignment Drift in Multimodal LLMs: A Two-Phase, Longitudinal Evaluation of Harm Across Eight Model Releases

多模态大语言模型中的对齐漂移:对八个模型版本的双阶段纵向评估

Casey Ford, Madison Van Doren, Emily Dix

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL、cs.AI

AI总结 研究通过双阶段评估揭示多模态大语言模型在不同模型版本中的安全性和对齐漂移问题,强调了持续多模态基准测试的重要性。

Comments under peer-review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04260 2026-02-05 cs.CV 83%

Decoupled Hierarchical Distillation for Multimodal Emotion Recognition

解耦层次蒸馏用于多模态情感识别

Yong Li, Yuanzhi Wang, Yi Ding, Shiqing Zhang, Ke Lu, Cuntai Guan

机构 * School of Computer Science and Engineering, and the Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Southeast University(计算机科学与工程学院,新一代人工智能技术及跨学科应用重点实验室,东南大学) School of Computer Science and Engineering, Nanjing University of Science and Technology(计算机科学与工程学院,南京理工大学) Institute of Intelligent Information Processing, Taizhou University(智能信息处理研究院,台州大学) School of Engineering Science, University of Chinese Academy of Sciences(工程科学学院,中国科学院大学) Peng Cheng Laboratory(鹏城实验室) School of Computer Science and Engineering, Nanyang Technological University(计算机科学与工程学院,南洋理工大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出解耦层次多模态蒸馏框架,通过两阶段知识蒸馏提升跨模态特征对齐,有效提高多模态情感识别性能。

Comments arXiv admin note: text overlap with arXiv:2303.13802

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04416 2026-02-05 cs.CV cs.AI 81%

Med-MMFL: A Multimodal Federated Learning Benchmark in Healthcare

Med-MMFL:医疗领域的多模态联邦学习基准

Aavash Chhetri, Bibek Niroula, Pratik Shrestha, Yash Raj Shrestha, Lesley A Anderson, Prashnna K Gyawali, Loris Bazzani, Binod Bhattarai

机构 * University of Aberdeen(阿伯丁大学) NepAl Applied Mathematics and Informatics Institute for research, Nepal(尼泊尔应用数学与信息学研究所) University of Lausanne(洛桑大学) West Virginia University(西弗吉尼亚大学) University of Verona(威尼斯大学) University College London(伦敦大学学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 Med-MMFL是首个医疗领域多模态联邦学习基准,涵盖多种模态和任务,评估六种先进算法以推动医疗多模态联邦学习的研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04413 2026-02-05 cs.CL cs.AI cs.MM 80%

History-Guided Iterative Visual Reasoning with Self-Correction

基于历史的迭代视觉推理与自我校正

Xinglong Yang, Zhilin Peng, Zhanzhan Liu, Haochen Shi, Sheng-Jun Huang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 H-GIVR框架通过迭代视觉推理与自我校正,显著提升多模态推理准确性并保持低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏