arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-23 至 2026-02-23 共收录 33 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 5 篇

2602.04587 2026-02-23 cs.CL cs.AI cs.CY 86%

VILLAIN at AVerImaTeC: Verifying Image-Text Claims via Multi-Agent Collaboration

VILLAIN 在 AVerImaTeC 上:通过多智能体协作验证图像-文本声明

Jaeyoon Jung, Yejun Yoon, Kunwoo Park

机构 * School of AI Convergence, Soongsil University(人工智能融合学院,顺世大学) MAUM AI Inc.(MAUM人工智能公司) Department of Intelligent Semiconductors, Soongsil University(智能半导体系,顺世大学)

专题命中 图文多模态 :image-text(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 VILLAIN 通过多智能体协作验证图像-文本声明,实现事实核查系统的高效准确验证。

Comments A system description paper for the AVerImaTeC shared task at the Ninth FEVER Workshop (co-located with EACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17689 2026-02-23 cs.LG cs.AI cs.CL cs.CV 85%

Robust Pre-Training of Medical Vision-and-Language Models with Domain-Invariant Multi-Modal Masked Reconstruction

具有领域不变多模态掩码重建的医学视觉-语言模型鲁棒预训练

Melika Filvantorkaman, Mohsen Piri

专题命中 图文多模态 :multi-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出Robust-MMR框架,通过显式建模鲁棒性提升医学视觉-语言模型在跨领域和扰动下的表现,实现更可靠的医疗应用。

Comments 28 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18252 2026-02-23 cs.CV cs.AI 73%

On the Adversarial Robustness of Discrete Image Tokenizers

对离散图像标记器的对抗鲁棒性的研究

Rishika Bhagwatkar, Irina Rish, Nicolas Flammarion, Francesco Croce

机构 * Mila - Quebec AI Institute(魁北克AI研究所) EPFL(苏黎世联邦理工学院) ELLIS Institute Finland - Aalto University(芬兰ELLIS研究所-阿莱大学)

专题命中 图文多模态 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了离散图像标记器的对抗鲁棒性,提出了一种无监督对抗训练方法以提升其鲁棒性,适用于多种多模态任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14498 2026-02-23 cs.CV cs.LG 70%

Uncertainty-Aware Vision-Language Segmentation for Medical Imaging

面向医学影像的不确定性感知视觉-语言分割

Aryan Das, Tanishq Rachamalla, Koushik Biswas, Swalpa Kumar Roy, Vinay Kumar Verma

机构 * VIT Bhopal(维特大学博帕尔分校) SAHE, Andhra Pradesh(安得拉邦SAHE) IIIT Delhi(德里印度理工学院) Tezpur University Assam(阿萨姆特兹普尔大学) IIT Kanpur(坎普尔印度理工学院)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种不确定性感知的多模态分割框架,通过引入SEU损失和MoDAB模块,提升医学影像分割的精度与效率。

Comments Accepted in WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17871 2026-02-23 cs.CV cs.AI cs.LG cs.MM 67%

Understanding the Fine-Grained Knowledge Capabilities of Vision-Language Models

理解视觉语言模型的细粒度知识能力

Dhruba Ghosh, Yuhui Zhang, Ludwig Schmidt

机构 * Stanford University(斯坦福大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文研究了视觉语言模型在细粒度知识任务中的表现,发现更好的语言模型和视觉编码器对细粒度分类性能有显著影响,预训练阶段也至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 2 篇

2508.11936 2026-02-23 cs.LG 82%

M3OOD: Automatic Selection of Multimodal OOD Detectors

M3OOD:多模态OOD检测器的自动选择

Yuehan Qin, Li Li, Defu Cao, Tiankai Yang, Jiate Li, Yue Zhao

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract)

AI总结 M3OOD通过元学习框架自动选择多模态OOD检测器,有效提升不同分布偏移下的检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17769 2026-02-23 cs.MM cs.SD eess.AS 73%

MusicSem: A Semantically Rich Language--Audio Dataset of Natural Music Descriptions

MusicSem: 一种语义丰富的语言-音频数据集,用于自然音乐描述

Rebecca Salganik, Teng Tu, Fei-Yueh Chen, Xiaohao Liu, Keifeng Lu, Ethan Luvisia, Zhiyao Duan, Guillaume Salha-Galvan, Anson Kahng, Yunshan Ma, Jian Kang

机构 * University of Rochester(罗切斯特大学) National University of Singapore(新加坡国立大学) SJTU Paris Elite Institute of Technology(上海科技技术巴黎精英学院) Singapore Management University(新加坡管理学院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.MM、eess.AS

AI总结 MusicSem是一个基于Reddit讨论的语义丰富的音乐描述数据集,旨在提升多模态音乐表示学习中对细粒度语义的建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 3 篇

2602.17869 2026-02-23 cs.CV 83%

Learning Compact Video Representations for Efficient Long-form Video Understanding in Large Multimodal Models

学习紧凑的视频表示以在大规模多模态模型中实现高效的长视频理解

Yuxiao Chen, Jue Wang, Zhikang Zhang, Jingru Yi, Xu Zhang, Yang Zou, Zhaowei Cai, Jianbo Yuan, Xinyu Li, Hao Yang, Davide Modolo

机构 * Amazon AGI(亚马逊人工智能研究院)

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出了一种端到端的长视频理解框架,结合自适应视频采样器和空间时间视频压缩器,以高效处理长视频的冗余问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17785 2026-02-23 cs.CV 74%

Multi-Modal Monocular Endoscopic Depth and Pose Estimation with Edge-Guided Self-Supervision

多模态单目内窥镜深度与姿态估计与边缘引导自监督学习

Xinwei Ju, Rema Daher, Danail Stoyanov, Sophia Bano, Francisco Vasconcelos

机构 * UCL Hawkes Institute, Department of Computer Science(伦敦大学学院UCL霍克斯研究所、计算机科学系)

专题命中 视频多模态 :multi-modal(title);分类 cs.CV

AI总结 PRISM通过边缘引导自监督学习,结合解剖学和照明先验知识,提升内窥镜单目深度与姿态估计性能。

Comments 14 pages, 6 figures; early accepted by IPCAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18258 2026-02-23 cs.RO cs.CV 57%

RoEL: Robust Event-based 3D Line Reconstruction

RoEL: 基于事件的稳健3D线条重建

Gwangtak Bae, Jaeho Shin, Seunggu Kang, Junho Kim, Ayoung Kim, Young Min Kim

机构 * Dept. of Electrical and Computer Engineering, Seoul National University(电子与计算机工程系,首尔国立大学) Dept. of Future Automotive Mobility, Seoul National University(未来汽车移动系,首尔国立大学) Dept. of Mechanical Engineering, Seoul National University(机械工程系,首尔国立大学) University of Michigan(密歇根大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 RoEL通过稳健的3D线条重建方法,提升事件相机在复杂环境中的映射与姿态估计性能。

Comments IEEE Transactions on Robotics (T-RO)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 2 篇

2602.18010 2026-02-23 cs.SD 85%

Scaling Audio-Text Retrieval with Multimodal Large Language Models

通过多模态大语言模型扩展音频-文本检索

Jilan Xu, Carl Thomé, Danijela Horak, Weidi Xie, Andrew Zisserman

机构 * Visual Geometry Group, University of Oxford(牛津大学视觉几何组) Epidemic Sound School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);cross-modal(abstract)

AI总结 AuroLA通过多模态大语言模型实现音频-文本检索的扩展,利用可扩展的数据管道和混合NCE损失提升检索性能。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17687 2026-02-23 cs.IR cs.AI cs.CL cs.LG 73%

IRPAPERS: A Visual Document Benchmark for Scientific Retrieval and Question Answering

IRPAPERS: 一个用于科学检索和问答的视觉文档基准

Connor Shorten, Augustas Skaburskas, Daniel M. Jones, Charles Pierse, Roberto Esposito, John Trengrove, Etienne Dilocker, Bob van Luijt

机构 * Weaviate

专题命中 跨模态检索 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CL、cs.AI

AI总结 IRPAPERS基准通过比较图像和文本检索系统,揭示了多模态混合搜索在科学文档检索和问答中的优势。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 5 篇

2602.18055 2026-02-23 cs.LG 67%

Continual-NExT: A Unified Comprehension And Generation Continual Learning Framework

Continual-NExT: 一种统一的理解和生成持续学习框架

Jingyang Qiao, Zhizhong Zhang, Xin Tan, Jingyu Gong, Yanyun Qu, Yuan Xie

机构 * East China Normal University(华东师范大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Xiamen University(厦门大学)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract)

AI总结 本文提出Continual-NExT框架,通过MAGE方法提升双到双多模态大语言模型的持续学习能力,实现跨模态知识转移和减少遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02437 2026-02-23 cs.CV cs.AI 62%

UniReason 1.0: A Unified Reasoning Framework for World Knowledge Aligned Image Generation and Editing

UniReason 1.0: 一个统一的推理框架,用于世界知识对齐的图像生成与编辑

Dianyi Wang, Chaofan Ma, Feng Han, Size Wu, Wei Song, Yibin Wang, Zhixiong Zhang, Tianhang Wang, Siyuan Wang, Zhongyu Wei, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学) University of Southern California(美国南加州大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 UniReason 1.0通过统一推理框架整合图像生成与编辑,利用世界知识增强文本推理和视觉优化,提升复杂合成任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14514 2026-02-23 cs.CV 57%

Efficient Text-Guided Convolutional Adapter for the Diffusion Model

高效的文本引导卷积适配器用于扩散模型

Aryan Das, Koushik Biswas, Swalpa Kumar Roy, Badri Narayana Patro, Vinay Kumar Verma

机构 * VIT Bhopal(维特大学博帕尔分校) IIIT Delhi(德里印度理工学院) Tezpur University Assam(泰朱普大学阿萨姆分校) IIT Kanpur(坎普尔印度理工学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Nexus Prime和Slim适配器,通过文本引导提升扩散模型的结构保持条件生成性能,显著减少参数量并保持高效果。

Comments Accepted in WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18016 2026-02-23 cs.CV 57%

Towards LLM-centric Affective Visual Customization via Efficient and Precise Emotion Manipulating

面向高效精准情感操控的基于大语言模型的有情感视觉定制

Jiamin Luo, Xuqian Gu, Jingjing Wang, Jiahong Lu

机构 * School of Computer Science and Technology, Soochow University(计算机科学与技术学院,苏州大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于大语言模型的有情感视觉定制任务,通过高效精准的情感操控方法实现图像主观情感的生成与修改。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13567 2026-02-23 cs.AI 57%

On the Value of Labeled Data and Symbolic Methods for Hidden Neuron Activation Analysis

关于标记数据和符号方法在隐藏神经元激活分析中的价值

Abhilekha Dalal, Rushrukh Rayan, Adrita Barua, Eugene Y. Vasserman, Md Kamruzzaman Sarker, Pascal Hitzler

机构 * Kansas State University(堪萨斯州立大学) Bowie State University(比弗州立大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出了一种基于符号方法和背景知识的可解释人工智能方法,能够为卷积神经网络中的神经元提供有意义的解释,并在定量和定性方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 9 篇

2602.18006 2026-02-23 cs.CV 79%

MUOT_3M: A 3 Million Frame Multimodal Underwater Benchmark and the MUTrack Tracking Method

MUOT_3M: 300万帧多模态水下基准及MUTrack跟踪方法

Ahsan Baidar Bakht, Mohamad Alansari, Muhayy Ud Din, Muzammal Naseer, Sajid Javed, Irfan Hussain, Jiri Matas, Arif Mahmood

机构 * Khalifa University(卡利法大学) Czech Technical University(捷克技术大学) Information Technology University(信息科技大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 MUOT_3M是首个包含300万帧的多模态水下目标跟踪基准,结合MUTrack方法提升水下跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.05826 2026-02-23 cs.HC cs.CV 79%

HaDR: Applying Domain Randomization for Generating Synthetic Multimodal Dataset for Hand Instance Segmentation in Cluttered Industrial Environments

HaDR:利用领域随机化生成合成多模态数据集用于 cluttered 工业环境中的手实例分割

Stefan Grushko, Aleš Vysocký, Jakub Chlebek, Petr Prokop

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 HaDR通过领域随机化生成合成多模态数据集,提升工业环境中手部实例分割的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18083 2026-02-23 cs.CV cs.LG 74%

Comparative Assessment of Multimodal Earth Observation Data for Soil Moisture Estimation

多模态地球观测数据在土壤含水量估计中的比较评估

Ioannis Kontogiorgakis, Athanasios Askitopoulos, Iason Tsardanidis, Dimitrios Bormpoudakis, Ilias Tsoumas, Fotios Balampanis, Charalampos Kontoes

机构 * BEYOND EO Centre, IAASARS, National Observatory of Athens(BEYOND EO中心、IAASARS、雅典国家天文台) Artificial Intelligence, Wageningen University & Research(人工智能,瓦赫宁根大学与研究所)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 本研究通过多模态地球观测数据结合机器学习,提出高分辨率土壤含水量估计框架,验证了传统特征工程在稀疏数据回归任务中的有效性。

Comments This paper has been submitted to IEEE IGARSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14201 2026-02-23 cs.CV cs.AI 62%

GeoEyes: On-Demand Visual Focusing for Evidence-Grounded Understanding of Ultra-High-Resolution Remote Sensing Imagery

GeoEyes: 面向超高清遥感影像证据驱动理解的按需视觉聚焦

Fengxiang Wang, Mingshuo Chen, Yueying Li, Yajie Yang, Yifan Zhang, Long Lan, Xue Yang, Hongda Sun, Yulin Wang, Di Wang, Jun Song, Jing Zhang, Bo Du

机构 * National University of Defense Technology, China(国防科技大学) Beijing University of Posts and Telecommunications, China(北京邮电大学) University of the Chinese Academy of Sciences, China(中国科学院大学) Shanghai Jiao Tong University, China(上海交通大学) Wuhan University, China(武汉大学) Chinese Academy of Science, China(中国科学院) Tsinghua University, China(清华大学) Renmin University of China, China(中国人民大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 GeoEyes通过分阶段训练框架,结合冷启动数据集和代理强化学习方法,解决超高清遥感影像中证据获取不足的问题,提升视觉问答任务的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13662 2026-02-23 cs.CV cs.AI 62%

LeafNet: A Large-Scale Dataset and Comprehensive Benchmark for Foundational Vision-Language Understanding of Plant Diseases

LeafNet:一个大规模数据集和全面基准,用于植物病害的基础视觉-语言理解

Khang Nguyen Quoc, Phuong D. Dao, Luyl-Da Quach

机构 * School of Electrical Engineering, Korea University(韩国大学电气工程学院) Department of Integrative Biology, The University of Texas at Austin(德克萨斯大学奥斯汀分校整合生物学系) Department of Software Engineering, FPT University(FPT大学软件工程系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 LeafNet通过大规模多模态数据集和基准测试,揭示了VLMs在植物疾病理解中的性能差异,强调了多模态架构在提升诊断精度中的关键作用。

Comments 26 pages, 13 figures and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18015 2026-02-23 cs.LG cs.AI 57%

Flow Actor-Critic for Offline Reinforcement Learning

流Actor-Critic用于离线强化学习

Jongseong Chae, Jongeui Park, Yongjae Shin, Gyeongmin Kim, Seungyul Han, Youngchul Sung

机构 * KAIST(韩国科学技术院) UNIST(全南大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出流Actor-Critic方法,通过结合流模型提升离线强化学习中策略的表达能力,以应对复杂多模式数据分布,实现新的性能突破。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17793 2026-02-23 cs.CV eess.IV 57%

LGD-Net: Latent-Guided Dual-Stream Network for HER2 Scoring with Task-Specific Domain Knowledge

LGD-Net:基于任务特定领域知识的HER2评分潜变量引导双流网络

Peide Zhu, Linbin Lu, Zhiqin Chen, Xiong Chen

机构 * School of Mathematics and Statistics, Fujian Normal University(福建师范大学数学与统计学学院) Department of Oncology, Mengchao Hepatobiliary Hospital of Fujian Medical University(福建医科大学 Mengchao 肝胆医院肿瘤科)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 LGD-Net通过跨模态特征幻觉替代显式像素生成,利用任务特定领域知识提升HER2评分的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05208 2026-02-23 eess.IV cs.CV 57%

Context-Aware Asymmetric Ensembling for Interpretable Retinopathy of Prematurity Screening via Active Query and Vascular Attention

具备上下文感知的非对称集成用于通过主动查询和血管注意力的可解释早产视网膜病变筛查

Md. Mehedi Hassan, Taufiq Hasan

机构 * m-Health Lab, Department of Biomedical Engineering, Bangladesh University of Engineering(m-Health实验室,生物医学工程系,孟加拉国工程大学) Center for Bioengineering Innovation(生物工程创新中心) Design, Department of Biomedical Engineering, Johns Hopkins University, Baltimore, MD, USA(设计,生物医学工程系,约翰霍普金斯大学,巴尔的摩,MD,美国)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出具备上下文感知的非对称集成模型,通过主动查询和血管注意力技术,实现早产视网膜病变筛查的高准确率和可解释性。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17926 2026-02-23 cs.RO 50%

Homotopic information gain for sparse active target tracking

同伦信息增益用于稀疏主动目标跟踪

Jennifer Wakulicz, Ki Myung Brian Lee, Teresa Vidal-Calleja, Robert Fitch

机构 * Australian Centre for Robotics, School of Aerospace, Mechanical and Mechatronic Engineering, University of Sydney(澳大利亚机器人中心,航空航天、机械与机电工程学院,悉尼大学) Department of Electrical and Computer Engineering, UC San Diego(电气与计算机工程系,UC圣地亚哥大学) School of Mechanical and Mechatronics Engineering, University of Technology Sydney(机械与机电工程学院,技术大学悉尼)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文提出同伦信息增益方法,通过最大化目标高层运动信息实现更高效的稀疏主动目标跟踪。

Comments 12 pages, 12 figures, accepted to Transactions on Robotics

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 多模态Agent 2 篇

2505.11409 2026-02-23 cs.LG cs.AI cs.CL cs.CV 67%

Visual Planning: Let's Think Only with Images

视觉规划:只用图像来思考

Yi Xu, Chengzu Li, Han Zhou, Xingchen Wan, Caiqi Zhang, Anna Korhonen, Ivan Vulić

机构 * Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室) Google(谷歌公司)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出视觉规划范式,通过图像进行推理,优于纯文本推理,在视觉导航任务中表现更优。

Comments ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03175 2026-02-23 cs.LG 50%

Probe-then-Commit Multi-Objective Bandits: Theoretical Benefits of Limited Multi-Arm Feedback

探查-然后承诺多目标老虎机:有限多臂反馈的理论优势

Ming Shi

机构 * Department of Electrical Engineering, University at Buffalo(电气工程系,布法罗大学)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出PtC-P-UCB算法,通过有限探查提升多目标老虎机的性能,实现$1/\sqrt{q}$的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 多模态训练与对齐 2 篇

2602.18005 2026-02-23 eess.SP 78%

Multi-Modal Sensing Residual-Corrected GNN for mmWave Path Loss Prediction via Synesthesia of Machines

多模态感知残差校正图神经网络用于毫米波路径损耗预测的机器合成感知

Mengyuan Lu, Lu Bai, Xiang Cheng

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 本文提出一种多模态感知残差校正图神经网络,用于毫米波路径损耗预测,结合拓扑感知图表示和细粒度视觉语义,实现高精度路径损耗估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17680 2026-02-23 cs.LG 50%

BioBridge: Bridging Proteins and Language for Enhanced Biological Reasoning with LLMs

BioBridge: 蛋白质与语言的桥梁:利用大语言模型增强生物推理

Yujia Wang, Jihong Guan, Wengen Li, Shuigeng Zhou, Xuhong Wang

机构 * School of Computer Science and Technology(计算机科学与技术学院) College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 BioBridge结合蛋白质领域知识与通用语言能力,通过领域自适应持续预训练框架提升生物推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏