arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-27 至 2026-01-27 共收录 116 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 21 篇

2601.18464 2026-01-27 cs.CV cs.AI 81%

Fair-Eye Net: A Fair, Trustworthy, Multimodal Integrated Glaucoma Full Chain AI System

Fair-Eye Net:一种公平、可信的多模态集成青光眼全流程人工智能系统

Wenbin Wei, Suyuan Yao, Cheng Huang, Xiangyu Gao

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 Fair-Eye Net通过多模态融合和公平性优化,实现青光眼全流程AI系统,提升诊断准确性与公平性,助力全球眼科健康公平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18250 2026-01-27 cs.CV cs.AI 81%

A multimodal vision foundation model for generalizable knee pathology

一种用于通用膝部病理的多模态视觉基础模型

Kang Yu, Dingyu Wang, Zimu Yuan, Nan Zhou, Jiajun Liu, Jiaxin Liu, Shanggui Liu, Yaoyan Zheng, Huishu Yuan, Di Huang, Dong Jiang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 OrthoFoundation是一种多模态视觉基础模型,通过自监督学习在膝关节影像上实现高泛化能力,提升骨科影像诊断的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08235 2026-01-27 cs.AI cs.CL 81%

MPCI-Bench: A Benchmark for Multimodal Pairwise Contextual Integrity Evaluation of Language Model Agents

MPCI-Bench: 一种用于语言模型代理多模态成对情境完整性评估的基准

Shouju Wang, Haopeng Zhang

机构 * University of Hawaii at Manoa(夏威夷大学曼瑙分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 MPCI-Bench是首个用于评估语言模型代理多模态情境完整性隐私行为的基准,揭示了现有模型在隐私与效用平衡及模态泄漏方面的系统性失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18493 2026-01-27 cs.CV 79%

DisasterInsight: A Multimodal Benchmark for Function-Aware and Grounded Disaster Assessment

DisasterInsight: 一种多模态基准,用于功能感知和基于事实的灾害评估

Sara Tehrani, Yonghao Xu, Leif Haglund, Amanda Berg, Michael Felsberg

机构 * Computer Vision Laboratory, Linköping University, Sweden(林奈大学计算机视觉实验室) Vantor, Linköping, Sweden(林奈瑞典)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 DisasterInsight提出一种多模态基准,用于评估视觉-语言模型在灾害分析任务中的性能,通过DI-Chat模型在损害识别和报告生成方面取得显著提升。

Comments Under review at ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18346 2026-01-27 cs.CV 79%

Q-Bench-Portrait: Benchmarking Multimodal Large Language Models on Portrait Image Quality Perception

Q-Bench-Portrait:多模态大语言模型在肖像图像质量感知上的基准测试

Sijing Wu, Yunhao Li, Zicheng Zhang, Qi Jia, Xinyue Li, Huiyu Duan, Xiongkuo Min, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 Q-Bench-Portrait首次提出用于评估多模态大语言模型在肖像图像质量感知上的能力,包含2765个三元组,涵盖多种图像来源和质量维度,评估20个模型后发现其表现有限,与人类判断存在差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17571 2026-01-27 eess.SP cs.CV cs.LG 79%

ME-WARD: A multimodal ergonomic analysis tool for musculoskeletal risk assessment from inertial and video data in working plac

ME-WARD:一种多模态人体工学分析工具,用于从惯性与视频数据中评估肌肉骨骼风险

Javier González-Alonso, Paula Martín-Tapia, David González-Ortega, Míriam Antón-Rodríguez, Francisco Javier Díaz-Pernas, Mario Martínez-Zarzuela

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 ME-WARD是一种多模态工具,利用惯性和视频数据评估人体工学风险,通过整合多种运动捕捉技术提供可靠且经济的解决方案。

Comments 19 pages

Journal ref Expert Systems With Applications 278 (2025) 127212

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17916 2026-01-27 cs.LG 78%

UniPACT: A Multimodal Framework for Prognostic Question Answering on Raw ECG and Structured EHR

UniPACT:一种多模态框架,用于基于原始ECG和结构化EHR的预后问题回答

Jialu Tang, Tong Xia, Yuan Lu, Aaqib Saeed

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 UniPACT通过多模态融合和结构化提示机制,实现对ECG和EHR的预后问题回答,取得优异的AUROC性能。

Comments Accepted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17102 2026-01-27 q-bio.QM 78%

Domain-Aware Geometric Multimodal Learning for Multi-Domain Protein-Ligand Affinity Prediction

领域感知的几何多模态学习用于多领域蛋白质-配体亲和力预测

Shuo Zhang, Jian K. Liu

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 DAGML通过领域感知的几何多模态学习框架,有效提升多领域蛋白质-配体亲和力预测的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17191 2026-01-27 cs.CV cs.CL 76%

VaseVQA: Multimodal Agent and Benchmark for Ancient Greek Pottery

VaseVQA: 古代希腊陶器的多模态代理与基准

Jinchao Ge, Tengfei Cheng, Biao Wu, Zeyu Zhang, Shiya Huang, Judith Bishop, Gillian Shepherd, Meng Fang, Ling Chen, Yang Zhao

机构 * University of Adelaide(阿德莱德大学) University of Liverpool(利物浦大学) University of Technology Sydney(悉尼技术大学) The Australian National University(澳大利亚国立大学) La Trobe University(拉特罗布大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.CL

AI总结 VaseVQA通过引入VaseVL强化学习方法,提升对古代希腊陶器的多模态推理能力,尤其在复杂推理任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04192 2026-01-27 cs.CV 70%

PixFoundation: Are We Heading in the Right Direction with Pixel-level Vision Foundation Models?

PixFoundation: 我们在像素级视觉基础模型的方向正确吗?

Mennatullah Siam

专题命中 多模态评测 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

AI总结 PixFoundation提出新的基准测试,揭示像素级基础模型在视觉问答中的不足,并提出可解释性工具分析接地机制。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17489 2026-01-27 cs.LG cs.CL cs.CV 62%

SpatialMath: Spatial Comprehension-Infused Symbolic Reasoning for Mathematical Problem-Solving

SpatialMath: 基于空间认知的符号推理框架用于数学问题解决

Ashutosh Bajpai, Akshat Bhandari, Akshay Nambi, Tanmoy Chakraborty

机构 * Indian Institute of Technology Delhi(印度理工学院德里) Indian Institute of Technology Abu Dhabi(印度理工学院阿布扎克) Microsoft Research(微软研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 SpatialMath通过整合空间表示到结构化符号推理链中,提升多模态模型在视觉密集型数学问题中的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17722 2026-01-27 cs.AI 57%

EntWorld: A Holistic Environment and Benchmark for Verifiable Enterprise GUI Agents

EntWorld: 一个综合环境和基准,用于可验证的企业GUI代理

Ying Mo, Yu Bai, Dapeng Sun, Yuqian Shi, Yukai Miao, Li Chen, Dan Li

机构 * Zhongguancun Laboratory(中关村实验室) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 EntWorld是一个综合的企业GUI代理基准,通过基于模式的任务生成和SQL验证机制,评估代理在企业环境中的表现,揭示当前代理能力的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17697 2026-01-27 cs.CV 57%

StyleDecoupler: Generalizable Artistic Style Disentanglement

StyleDecoupler: 可泛化艺术风格解耦

Zexi Jia, Jinchao Zhang, Jie Zhou

机构 * Wechat AI, Tencent, China(腾讯微信AI,腾讯,中国)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 StyleDecoupler通过信息论方法分离多模态视觉模型中的纯风格特征,实现艺术风格的可泛化解耦,并在大规模艺术数据集上展示出强大的风格检索和生成模型评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10098 2026-01-27 cs.RO cs.LG 50%

Estimating the Joint Probability of Scenario Parameters with Gaussian Mixture Copula Models

基于高斯混合Copula模型的场景参数联合概率估计

Christian Reichenbächer, Philipp Rank, Jochen Hipp, Oliver Bringmann

机构 * Mercedes-Benz AG(梅赛德斯-奔驰集团) Department of Computer Science, University of Tübingen(图宾根大学计算机科学系)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出利用高斯混合Copula模型对自动驾驶场景参数进行联合概率估计,通过实验证明其在安全验证中的有效性。

Comments 9 pages, 4 figures; This work has been submitted to the IEEE for possible publication; Code available at: https://codeocean.com/capsule/1003615/tree

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 7 篇

2506.00555 2026-01-27 cs.LG cs.AI cs.CL cs.CV 82%

MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning

MMedAgent-RL: 优化多智能体协作以实现多模态医疗推理

Peng Xia, Jinglu Wang, Yibo Peng, Kaide Zeng, Zihan Dong, Xian Wu, Xiangru Tang, Hongtu Zhu, Yun Li, Linjun Zhang, Shujie Liu, Yan Lu, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) Microsoft Research(微软研究院) CMU(卡内基梅隆大学) Rutgers University(罗格斯大学) Yale University(耶鲁大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 MMedAgent-RL通过强化学习优化多智能体协作,提升多模态医疗推理性能,实现23.6%的性能提升。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18320 2026-01-27 cs.CL cs.AI cs.DB 81%

MultiVis-Agent: A Multi-Agent Framework with Logic Rules for Reliable and Comprehensive Cross-Modal Data Visualization

MultiVis-Agent:一种带有逻辑规则的多智能体框架,用于可靠且全面的跨模态数据可视化

Jinwei Lu, Yuanfeng Song, Chen Zhang, Raymond Chi-Wing Wong

机构 * The Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The Hong Kong University of Science(香港科学大学)

专题命中 多模态Agent :cross-modal(title);multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 MultiVis-Agent通过引入逻辑规则的多智能体框架,提升多模态数据可视化的可靠性与全面性,实现高评分和高完成率。

Comments Accepted to SIGMOD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10046 2026-01-27 cs.AI 79%

SimWorld-Robotics: Synthesizing Photorealistic and Dynamic Urban Environments for Multimodal Robot Navigation and Collaboration

SimWorld-Robotics: 为多模态机器人导航与协作合成逼真动态城市环境

Yan Zhuang, Jiawei Ren, Xiaokang Ye, Jianzhi Shen, Ruixuan Zhang, Tianai Yue, Muhammad Faayez, Xuhong He, Ziqiao Ma, Lianhui Qin, Zhiting Hu, Tianmin Shu

机构 * University of Virginia(弗吉尼亚大学) UC San Diego(加州大学圣地亚哥分校) Johns Hopkins University(约翰霍普金斯大学) Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 SimWorld-Robotics通过合成逼真动态城市环境,提出两个多模态机器人基准测试,评估机器人在复杂场景中的导航、协作与通信能力。

Comments Conference: NeurIPS 2025 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18735 2026-01-27 cs.AI cs.LG 57%

Why Keep Your Doubts to Yourself? Trading Visual Uncertainties in Multi-Agent Bandit Systems

为何保留你的怀疑?多智能体老虎机系统中的视觉不确定性交易

Jusheng Zhang, Yijia Fan, Kaitong Cai, Jing Yang, Jiawei Yao, Jian Wang, Guanlong Qu, Ziliang Chen, Keze Wang

机构 * Sun Yat-sen University(中山大学) University of Washington(华盛顿大学) Snap Inc.(Snap公司) Syracuse University(雪城大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 Agora通过去中心化市场交易机制提升多智能体系统在视觉任务中的协调效率与经济性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17920 2026-01-27 cs.AI 57%

Agentic AI for Self-Driving Laboratories in Soft Matter: Taxonomy, Benchmarks,and Open Challenges

代理AI在软物质中的自主实验室:分类、基准和开放挑战

Xuanzhou Chen, Audrey Wang, Stanley Yin, Hanyang Jiang, Dong Zhang

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 本文探讨了自主实验室在软物质中的应用,提出了基于智能体的环境交互框架,回顾了闭环实验的主要方法,并指出了多模态表示、校准不确定性、安全探索和共享基准基础设施等开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18492 2026-01-27 cs.RO 50%

DV-VLN: Dual Verification for Reliable LLM-Based Vision-and-Language Navigation

DV-VLN:基于可靠大语言模型的视觉-语言导航的双重验证

Zijun Li, Shijie Li, Zhenxi Zhang, Bin Li, Shoujun Zhou

机构 * Robotics Engineering Program, College of Engineering, Zhejiang Normal University(浙江师范大学工程学院机器人工程专业) Shenzhen Institutes of Advanced Technology (SIAT), Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Department of Health Technology and Informatics, The Hong Kong Polytechnic University(香港理工大学健康科技与信息技术系)

专题命中 多模态Agent :cross-modal(abstract)

AI总结 DV-VLN通过生成-验证范式提升大语言模型在视觉-语言导航中的可靠性,通过双重验证机制提高导航决策的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17548 2026-01-27 cs.CR 50%

Prompt Injection Attacks on Agentic Coding Assistants: A Systematic Analysis of Vulnerabilities in Skills, Tools, and Protocol Ecosystems

针对代理编码助手的提示注入攻击:对技能、工具和协议生态系统漏洞的系统分析

Narek Maloyan, Dmitry Namiot

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文系统分析了代理编码助手的提示注入攻击漏洞,提出三维分类法并揭示防御不足,强调需架构级防护而非碎片化措施。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 24 篇

2601.17986 2026-01-27 cs.LG 85%

Federated learning for unpaired multimodal data through a homogeneous transformer model

通过同质Transformer模型实现无配对多模态数据的联邦学习

Anders Eklund

机构 * Department of Biomedical Engineering, Linköping University, Sweden(_linköping大学生物医学工程系) Department of Computer and Information Science, Linköping University, Sweden(_linköping大学计算机与信息科学系) Center for Medical Image Science and Visualization (CMIV), Linköping University, Sweden(_linköping大学医学影像科学与可视化中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract);image-text(abstract);multimodal foundation model(abstract)

AI总结 本文提出通过同质Transformer模型实现联邦学习,解决无配对多模态数据的训练问题,通过公共锚点对齐和子空间稳定化微调方法,在不传输私有数据的情况下实现全局模型统一表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19327 2026-01-27 cs.CV cs.AI 84%

DeepInsert: Early Layer Bypass for Efficient and Performant Multimodal Understanding

DeepInsert: 早期层绕过以实现高效且高性能的多模态理解

Moulik Choraria, Xinbo Wu, Akhil Bhimaraju, Nitesh Sekhar, Yue Wu, Xu Zhang, Prateek Singhal, Lav R. Varshney

机构 * UIUC(伊利诺伊大学) Amazon(亚马逊) Capital One Apple(苹果) Stony Brook University(石溪大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 DeepInsert通过将多模态令牌插入模型中间层以绕过早期层,从而在降低训练和推理成本的同时保持或提升多模态语言模型的性能。

Comments To be presented at EACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15139 2026-01-27 cs.CV 83%

Unified Cross-Modal Attention-Mixer Based Structural-Functional Connectomics Fusion for Neuropsychiatric Disorder Diagnosis

统一的跨模态注意力-混合器基于结构-功能连接组融合的神经精神疾病诊断

Badhan Mazumder, Lei Wu, Vince D. Calhoun, Dong Hye Ye

机构 * Department of Computer Science, Georgia State University(计算机科学系,佐治亚州立大学) Tri-Institutional Center for Translational Research in Neuroimaging and Data Science (TReNDS), Georgia State University, Georgia Institute of Technology, and Emory University(跨机构神经影像与数据科学转化研究中心(TReNDS),佐治亚州立大学、佐治亚理工学院和埃默里大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出ConneX方法,通过统一的跨模态注意力和MLP-Mixer实现结构-功能连接组的多模态融合,提升神经精神疾病诊断性能。

Comments Published in the Proceedings of the 47th Annual International Conference of the IEEE Engineering in Medicine and Biology Society (EMBC 2025). IEEE Xplore. DOI: 10.1109/EMBC58623.2025.11254194

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17809 2026-01-27 cs.IT math.IT 82%

A Multi-Modal Fusion Platform for Joint Environment Sensing and Channel Sounding in Highly Dynamic Scenarios

一种多模态融合平台,用于高动态场景中的联合环境感知与信道探测

Xuejian Zhang, Ruisi He, Mi Yang, Zhengyu Zhang, Ziyi Qi

专题命中 多模态训练与对齐 :multi-modal(title,abstract);multimodal(abstract)

AI总结 本文提出一种多模态融合平台,用于高动态场景中联合环境感知与信道探测,支持多频段多天线测量和高精度环境感知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15304 2026-01-27 cs.IR 82%

MLLMRec: A Preference Reasoning Paradigm with Graph Refinement for Multimodal Recommendation

MLLMRec: 基于图细化的多模态推荐偏好推理范式

Yuzhuo Dang, Xin Zhang, Zhiqiang Pan, Yuxiao Duan, Wanyu Chen, Fei Cai, Honghui Chen

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract)

AI总结 MLLMRec通过图细化和多模态大语言模型提升多模态推荐的用户偏好推理与物品表示学习准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18589 2026-01-27 cs.CV cs.MM 81%

AGSP-DSA: An Adaptive Graph Signal Processing Framework for Robust Multimodal Fusion with Dynamic Semantic Alignment

AGSP-DSA: 一种用于鲁棒多模态融合的自适应图信号处理框架,具有动态语义对齐

KV Karthikeya, Ashok Kumar Das, Shantanu Pal, Vivekananda Bhat K, Arun Sekar Rajasekaran

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 AGSP-DSA通过自适应图信号处理和动态语义对齐,实现鲁棒的多模态融合,提升情感分析和多媒体分类的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21885 2026-01-27 cs.CV cs.MM cs.RO 81%

Integrating Multi-Modal Sensors: A Review of Fusion Techniques for Intelligent Vehicles

多模态传感器整合:智能车辆融合技术综述

Chuheng Wei, Ziye Qin, Ziyan Zhang, Guoyuan Wu, Matthew J. Barth

机构 * College of Engineering, Center for Environmental Research and Technology, University of California at Riverside(工程学院、环境研究与技术中心、加州大学河滨分校) School of Transportation and Logistics, Southwest Jiaotong University(交通运输与物流学院、西南交通大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.MM

AI总结 本文综述了多传感器融合技术在自动驾驶中的应用,分析了深度学习方法、多模态数据集及新兴趋势,强调了其提升系统适应性和鲁棒性的潜力。

Comments Accepted by IEEE IV 2025

Journal ref Proceedings of the 2025 IEEE Intelligent Vehicles Symposium (IV), pp. 1817-1824, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11740 2026-01-27 cs.LG cs.CV 79%

Mitigating Visual Knowledge Forgetting in MLLM Instruction-tuning via Modality-decoupled Gradient Descent

通过模态解耦梯度下降缓解MLLM指令微调中的视觉知识遗忘

Junda Wu, Yuxin Xiong, Xintong Li, Yu Xia, Ruoyu Wang, Yu Wang, Tong Yu, Sungchul Kim, Ryan A. Rossi, Lina Yao, Jingbo Shang, Julian McAuley

机构 * UC San Diego(加州大学圣迭戈分校) University of New South Wales(新南威尔士大学) Adobe Research(Adobe研究)

专题命中 多模态训练与对齐 :MLLM(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出模态解耦梯度下降方法,通过有效秩量化视觉退化并缓解过度压缩,保留预训练视觉知识并提升任务适应能力。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18683 2026-01-27 stat.ME astro-ph.IM cs.LG 78%

Learned harmonic mean estimation of the marginal likelihood for multimodal posteriors with flow matching

基于流匹配的连续归一化流用于多模后验的学得谐均估计

Alicja Polanska, Jason D. McEwen

机构 * Mullard Space Science Laboratory, University College London(穆尔空间科学实验室,伦敦大学学院) Alan Turing Institute(艾伦·图灵研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出基于流匹配的连续归一化流,用于高效估计多模后验的边际似然,解决了传统方法在处理复杂后验时的局限性。

Comments Submitted to 44th International Workshop on Bayesian Inference and Maximum Entropy Methods in Science and Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏