arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-07 至 2026-04-07 共收录 110 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 15 篇

2601.01891 2026-04-07 cs.CV 57%

Agentic AI in Remote Sensing: Foundations, Taxonomy, and Emerging Systems

遥感中的代理AI:基础、分类与新兴系统

Niloufar Alipour Talemi, Julia Boone, Fatemeh Afghah

机构 * Clemson University(克莱姆森大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文探讨遥感中代理AI的基础、分类及新兴系统,提出统一的分类框架,分析规划机制、检索增强生成和记忆结构,并评估轨迹感知推理的准确性。

Comments Accepted to the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026, GeoCV Workshop

Journal ref Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) Workshops, 2026, pp. 786-799

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.03327 2026-04-07 math.OC 50%

Approximation Algorithms for Line Planning with Heterogeneous Fleets and Multiple Resource Constraints

具有异质车队和多重资源约束的线路规划近似算法

Hongyi Jiang, Igor Averbakh, Samitha Samaranayake

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文研究了面临预算、劳动力和排放限制的公共交通巴士网络线路规划问题,提出了一种具有理论保证的近似算法,解决了异质车队和多重资源约束下的线路规划问题,实验表明其在大规模应用中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03509 2026-04-07 physics.med-ph 50%

Applications of Large Language Models in Radiation Oncology: From Workflow Automation to Clinical Intelligence

大型语言模型在放射肿瘤学中的应用:从工作流自动化到临床智能

Yuzhen Ding, Jason Holmes, Yuexing Hao, Zhengliang Liu, Peilong Wang, Junjie Cui, Meiyun Cao, Caiwen Jiang, Shuoyang Wei, Lin Zhao, Chenbin Liu, Lian Zhang, Yunze Yang, Tianming Liu, Wei Liu

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文探讨了大型语言模型在放射肿瘤学中的应用,包括工作流自动化、临床智能及决策支持,展示了其在标准化命名、注册管理及放疗计划评估中的核心贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03406 2026-04-07 cs.GR 50%

SASAV: Self-Directed Agent for Scientific Analysis and Visualization

SASAV:面向科学分析和可视化的自主代理

Jianxin Sun, David Lenz, Tom Peterka, Hongfeng Yu

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出SASAV,首个无需外部提示或人类在环反馈的自主AI代理,可自动执行科学数据分析并生成有洞察力的可视化,推动AI for Science加速大规模科学发现。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态训练与对齐 10 篇

2604.04297 2026-04-07 cs.AI 83%

PanLUNA: An Efficient and Robust Query-Unified Multimodal Model for Edge Biosignal Intelligence

PanLUNA: 一种高效且稳健的多模态模型,用于边缘生物信号智能

Marija Zelic, Anna Tegon, Yawei Li, Thorir Mar Ingolfsson, Luca Benini

机构 * DEI, University of Bologna(博洛尼亚大学DEI)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 PanLUNA是一种紧凑的多模态基础模型,能够高效处理EEG、ECG和PPG信号,实现跨模态早期融合,同时在推理时对缺失模态具有鲁棒性。其在生物信号检测和睡眠分期任务中表现出色。

Comments 5 pages, 5 tables, 1 figure, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04797 2026-04-07 cs.CV cs.LG 79%

Multi-Modal Sensor Fusion using Hybrid Attention for Autonomous Driving

多模态传感器融合使用混合注意力用于自动驾驶

Mayank Mayank, Bharanidhar Duraisamy, Florian Geiß, Abhinav Valada

机构 * Mercedes-Benz AG(梅赛德斯-奔驰集团) University of Freiburg(弗莱堡大学)

专题命中 多模态训练与对齐 :multi-modal(title);cross-modal(abstract);分类 cs.CV

AI总结 本文提出MMF-BEV框架,通过变形注意力实现雷达与摄像头BEV融合,通过传感器贡献分析验证传感器互补性,并在VoD数据集上优于单模态基线。

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04496 2026-04-07 cs.CV 79%

The Indra Representation Hypothesis for Multimodal Alignment

多模态对齐的Indra表示假说

Jianglin Lu, Hailing Wang, Kuo Yang, Yitian Zhang, Simon Jenni, Yun Fu

机构 * Northeastern University(东北大学) Adobe Research(Adobe研究院)

专题命中 多模态训练与对齐 :multimodal(title);cross-modal(abstract);分类 cs.CV

AI总结 本文提出Indra表示假说,通过范畴论中的V富化Yoneda嵌入,定义样本间关系轮廓,提升多模态对齐的鲁棒性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04488 2026-04-07 cs.CV cs.LG 79%

A Patch-based Cross-view Regularized Framework for Backdoor Defense in Multimodal Large Language Models

基于补丁的跨视图正则化框架用于多模态大语言模型中的后门防御

Tianmeng Fang, Yong Wang, Zetai Kong, Zengzhen Su, Jun Wang, Chengjin Yu, Wei Wang

机构 * Singapore Management University(新加坡管理大学) China University of Mining and Technology(中国矿业大学) The University of Melbourne(墨尔本大学) Anhui University(安徽大学) Xi’an Jiaotong University(西安交通大学) Sun Yat-sen University(中山大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种基于补丁增强和跨视图正则化的统一后门防御框架,通过约束特征表示和输出分布层面的异常行为,有效降低后门攻击成功率并保持正常生成能力。

Comments 26 pages, 3 figures. Subjects: Machine Learning (cs.LG)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17514 2026-04-07 cs.CV 79%

EI: Early Intervention for Multimodal Imaging based Disease Recognition

EI:基于多模态影像的疾病识别早期干预

Qijie Wei, Hailan Lin, Xirong Li

机构 * Renmin University of China(中国人民大学) Beijing Key Laboratory for Intelligent Diagnosis of Fundus Diseases and Drug-Device R&D and Translation(眼底疾病智能诊断与药械研发转化北京市重点实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出EI框架,通过早期干预提升多模态影像疾病识别性能,引入MoR方法优化Vision Foundation Models适应,验证了在三个公开数据集上的有效性。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04407 2026-04-07 eess.IV cs.CV cs.LG cs.MM 62%

NAIMA: Semantics Aware RGB Guided Depth Super-Resolution

NAIMA:基于语义的RGB引导深度超分辨率

Tayyab Nasir, Daochang Liu, Ajmal Mian

机构 * The University of Western Australia(西澳大利亚大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出NAIMA框架,通过引导token注意力模块和DINOv2整合,提升RGB引导深度超分辨率的语义感知能力,在多尺度和数据集上实现显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03296 2026-04-07 cs.CV cs.AI 62%

3D-IDE: 3D Implicit Depth Emergent

3D-IDE: 3D隐式深度涌现

Chushan Zhang, Ruihan Lu, Jinguang Tong, Yikai Wang, Hongdong Li

机构 * School of Computing, Australian National University(澳大利亚国立大学计算学院) School of EECS, The University of Queensland(昆士兰大学电气工程与计算机科学学院) FreiNexus School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出3D-IDE方法,通过几何自监督学习实现3D感知的隐式涌现,消除了深度和姿态依赖,提升推理效率和多任务性能。

Comments CVPR 2026 accepted. Project page: https://chushanzhang.github.io/3D-IDE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27584 2026-04-07 cs.CV cs.IR cs.LG 57%

Image Hashing via Cross-View Code Alignment in the Age of Foundation Models

基于基础模型的跨视图代码对齐图像哈希

Ilyass Moummad, Kawtar Zaher, Hervé Goëau, Alexis Joly

机构 * INRIA(法国国家信息与自动化研究所) LIRMM(蒙彼利埃计算机科学、机器人及微电子实验室) INA(法国国家视听研究所) CIRAD(法国农业研究发展国际合作中心) AMAP(植物建模与生态学联合实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出CroVCA方法,通过统一的二进制交叉熵损失和编码率最大化正则化,在少量训练轮次内实现高效图像哈希,适用于多种视觉检索任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04243 2026-04-07 cs.NI 50%

RELIEF: Turning Missing Modalities into Training Acceleration for Federated Learning on Heterogeneous IoT Edge

RELIEF: 将缺失的模态转化为联邦学习在异构物联网边缘设备上的训练加速

Beining Wu, Zihao Ding, Jun Huang

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 针对异构物联网边缘设备中系统-模态-数据异质性问题,提出RELIEF框架,通过将低秩适应(LoRA)投影矩阵划分模态对齐的列块,实现聚合、弹性训练和通信的统一接口,提升训练效率和资源利用率。

Comments 14 pages, submitted to IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04016 2026-04-07 cs.RO 50%

Odometry Calibration and Pose Estimation of a 4WIS4WID Mobile Wall Climbing Robot

四轮独立转向四轮独立驱动壁爬机器人姿态估计与里程计校准

Branimir Ćaran, Vladimir Milić, Marko Švaco, Bojan Jerbić

机构 * Croatian Academy of Sciences and Arts(克罗地亚科学与艺术学院)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文基于多模态测量融合设计了四轮独立转向四轮独立驱动壁爬机器人姿态估计器,采用扩展卡尔曼滤波和无迹卡尔曼滤波方法,解决传统定位传感器在复杂建筑立面环境中的不可行性问题。

Comments ACCEPTED FOR IEEE EUROPEAN CONFERENCE ON MOBILE ROBOTS 2025. PREPRINT VERSION. ACCEPTED JUNE, 2025 AND PRESENTED SEPTEMBER, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他多模态 6 篇

2604.03630 2026-04-07 cs.AI q-bio.QM 84%

A Multimodal Foundation Model of Spatial Transcriptomics and Histology for Biological Discovery and Clinical Prediction

一种结合空间转录组学和组织学的多模态基础模型用于生物发现和临床预测

Jinxi Xiang, Siyu Hou, Yuchen Li, Ryan Quinton, Xiaoming Zhang, Feyisope Eweje, Xiangde Luo, Yijiang Chen, Zhe Li, Colin Bergstrom, Ted Kim, Sierra Willens, Francesca Maria Olguin, Matthew Abikenari, Andrew Heider, Sanjeeth Rajaram, Joel Neal, Maximilian Diehn, Xiang Zhou, Ruijiang Li

机构 * Department of Radiation Oncology, Stanford University School of Medicine(斯坦福大学医学院放射肿瘤学系) Department of Statistics and Data Science, Yale University(耶鲁大学统计与数据科学系) Department of Medicine (Oncology), Stanford University School of Medicine(斯坦福大学医学院医学系(肿瘤学)) Department of Pathology, Stanford University School of Medicine(斯坦福大学医学院病理学系) Department of Neurosurgery, Stanford University School of Medicine(斯坦福大学医学院神经外科学系) Stanford Institute for Human-Centered Artificial Intelligence(斯坦福大学以人为本人工智能研究所) Perelman School of Medicine at the University of Pennsylvania(宾夕法尼亚大学佩雷尔曼医学院)

专题命中 其他多模态 :multimodal(title);multimodal foundation model(title);分类 cs.AI

AI总结 本文提出STORM模型,整合形态学特征、基因表达和空间上下文,提升空间领域发现并预测肿瘤类型基因表达,提高免疫治疗响应预测和预后诊断。

Comments 29 pages, 5 figures. This manuscript is a work in progress; further updates and revisions will be posted as they become available

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04823 2026-04-07 math.PR math.ST stat.TH 78%

Rapid convergence of tempering chains to multimodal Gibbs measures

温控链快速收敛于多模Gibbs测度

Seungjae Son

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 研究平行与模拟退火链的谱间隙,证明其在低目标温度下具有多项式下界,适用于广泛势能函数类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27492 2026-04-07 cs.RO cs.AI cs.HC cs.LG 57%

Copilot-Assisted Second-Thought Framework for Brain-to-Robot Hand Motion Decoding

辅助第二思考框架用于脑机臂运动解码

Yizhe Li, Shixiao Wang, Jian K. Liu

机构 * University of Birmingham(伯明翰大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出混合CNN-注意力模型解码EEG手部运动轨迹,在单受试者实验中取得高PCC值,进一步扩展至EEG-EMG多模态解码,并引入copilot框架提升轨迹精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03334 2026-04-07 cs.CV 57%

Bridging the Dimensionality Gap: A Taxonomy and Survey of 2D Vision Model Adaptation for 3D Analysis

弥合维度差距:2D视觉模型适应3D分析的分类与综述

Akshat Pandya, Bhavuk Jain

机构 * Independent Researcher(独立研究员)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文综述了将2D视觉模型适应3D分析的策略,分类为数据导向、架构导向和混合方法,探讨了计算复杂度、预训练依赖性和几何归纳偏置的权衡。

Comments VISAPP 2026

Journal ref Proceedings of the 21st International Conference on Computer Vision Theory and Applications - Volume 3: VISAPP 2026; ISBN 978-989-758-804-4; ISSN 2184-4321, SciTePress, pages 353-364

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14351 2026-04-07 cs.LG cs.AI 57%

WIMLE: Uncertainty-Aware World Models with IMLE for Sample-Efficient Continuous Control

WIMLE:具有IMLE的不确定性感知世界模型用于高效连续控制

Mehran Aghabozorgi, Alireza Moazeni, Yanshu Zhang, Ke Li

专题命中 其他多模态 :multi-modal(abstract);分类 cs.AI

AI总结 WIMLE通过扩展IMLE至模型基于强化学习框架,学习随机多模世界模型并估计预测不确定性,提升了连续控制任务的样本效率和稳定性。

Comments Accepted at ICLR 2026. Website: https://mehranagh20.github.io/wimle/ Code: https://github.com/mehranagh20/wimle

Journal ref In Proceedings of the Fourteenth International Conference on Learning Representations (ICLR 2026), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14336 2026-04-07 cs.CV 57%

ArchMap: Arch-Flattening and Knowledge-Guided Vision Language Model for Tooth Counting and Structured Dental Understanding

ArchMap:用于牙齿计数和结构牙科理解的拱形扁平化和知识引导的视觉语言模型

Bohan Zhang, Yiyi Miao, Taoyu Wu, Tong Chen, Ji Jiang, Zhuoxiao Li, Zhe Tang, Limin Yu, Jionglong Su

机构 * Xi'an Jiaotong-Liverpool University(西交利物浦大学) University of Liverpool(利物浦大学) Zhejiang University of Technology(浙江工业大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出ArchMap,一种无需训练的知识引导框架,通过几何归一化和本体引导的多模态推理,提升3D口腔扫描的结构化分析能力,实现牙齿计数、解剖分区、牙列阶段分类及临床状况识别。

Journal ref In Proceedings of the 2025 IEEE International Conference on Big Data (BigData), pp. 7529-7538, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏