arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 633 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 633 篇

2608.17962 2026-08-19 cs.RO 新提交 78%

PRISM: Precision and contact-rich Real-world Industrial Skill dataset with Multimodal sensing

PRISM:具备多模态感知的高精度高接触真实工业技能数据集

Tengbo Yu, Jiahao Wu, Hanning Wang, Rui Chen, Chuanhou Liu, Chuang Sun, Hangxin Liu

机构 * State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) Delta Intelligence(三角洲智能公司) PKU-Wuhan Institute for Artificial Intelligence(北京大学武汉人工智能研究院) Hubei Humanoid Robot Innovation Center Co., Ltd.(湖北人形机器人创新中心有限公司) China Academy of Information and Communications Technology(中国信息通信研究院)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文介绍PRISM——一个面向高接触工业操作的大规模多模态数据集,涵盖25余项操作任务,包含5000余条共45小时的遥操作演示,为高精度工业场景的多模态感知与控制提供真实基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13342 2026-08-14 quant-ph cs.ET 新提交 78%

Quantum-Inspired Phase Bicoherence Spectroscopy: A Framework for Detecting Universal Textural Angular Order Across Multi-Modal Complex Datasets

量子启发的双相干相位光谱:一种用于检测多模态复杂数据集普适纹理角序的框架

Zheng Xing, Chan-Tong Lam, Xiaochen Yuan

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 本文提出量子双相干相位(QPBC)光谱框架,将图像角扇区嵌入9量子比特纠缠态,在三类多模态成像数据集上验证其可解析角相位序、区分生物表型,性能优于传统方法,提供经典无法实现的定量纹理观测值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10825 2026-08-12 eess.SY cs.SY 新提交 78%

Cross-modal topology decodes battery faults from sparse voltage snapshots

跨模态拓扑从稀疏电压快照解码电池故障

Jinwen Li, Yunhong Che, Simona Onori, Weihan Li, Xiaosong Hu

专题命中 多模态评测 :cross-modal(title,abstract)

AI总结 本研究针对EV电池安全瓶颈,提出跨模态诊断框架DeFault,通过将电压序列展开为相空间拓扑解码故障,在99辆EV的1640万条数据上对四种故障类型平均准确率达0.96,无需新增传感器即可实现高可解释性故障诊断。

Comments 33 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10127 2026-08-12 astro-ph.CO 新提交 78%

Evaporation of Primordial Black Holes with Multimodal Mass and Extended Spin Distributions: Cosmological Imprints on the Effective Number of Relativistic Species

多模态质量与扩展自旋分布的原初黑洞蒸发:对有效相对论粒子数的宇宙学印记

T. Toghrai, A. Daassou, Y. Ouchhaine, H. Laassiri, R. Benbrik

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 该研究构建FRISHBEE代码实现多模态质量函数与扩展自旋分布,计算原初黑洞蒸发对有效相对论粒子数$\Delta N_{\rm eff}$的影响,发现质量分布和自旋会改变$\Delta N_{\rm eff}$,其可作为原初黑洞形成通道的判别依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06013 2026-08-07 cs.HC 新提交 78%

OneEmo: A Unified Multimodal Reasoning Model for Emotion Perception, Understanding, and Interaction

OneEmo:用于情感感知、理解与交互的统一多模态推理模型

Jiahao Huang, Zheng Lian, Jingyi Zhang, Zhide Chen, Xiaojiang Peng, Shaonan Wang

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 针对现有情感智能多模态模型忽略任务协同的问题,研究人员提出统一多模态情感模型OneEmo,构建EmoWorld-130K数据集并采用Emo-Chord强化学习策略,其性能优于同规模基线模型,参数远少于商业模型且结果具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03187 2026-08-05 cs.NE 新提交 78%

NeuroMosaic: Anatomically Grounded Multimodal Large Language Modeling for Molecularly Aware Glioma Reasoning from 3D MRI and Clinical Narratives

NeuroMosaic:基于解剖学的多模态大语言模型,用于从3D MRI和临床叙事中进行分子感知的胶质瘤推理

Yantong Liu, Zheyu Zhang, Runpeng Liu, Mu Xitang, Seong-Yoon Shin, Hyun-Ae Lee

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 该研究针对多模态医疗大语言模型在神经肿瘤学中的结构缺陷,提出NeuroMosaic模型,通过多模块架构实现胶质瘤的准确推理,在多个数据集上取得优异性能,验证了解剖学索引路由机制的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23822 2026-07-28 cs.LG 新提交 78%

DriveDNA: A Large-Scale Multimodal Naturalistic Driving Dataset and Benchmark for Driving Style Identification

DriveDNA:用于驾驶风格识别的大规模多模态自然驾驶数据集及基准测试

Yuhang Wang, Lingyao Li, Hao Zhou

机构 * University of South Florida(南佛罗里达大学) University of Arizona(亚利桑那大学)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 该研究引入DriveDNA数据集及基准测试用于驾驶风格识别,定义驾驶风格为车辆在相似条件下的特定行为模式,通过三个核心任务评估,对比多种基线方法得出学习表示更优,视频模型有路线泄漏问题,强调可靠评估需考虑多方面因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22006 2026-07-27 cs.CY econ.GN q-fin.EC stat.AP 新提交 78%

Unfit for stranding assessment: a panel-scale multimodal-LLM audit of building-decarbonisation disclosure (BeDA)

不适用于搁浅评估:建筑脱碳披露(BeDA)的面板规模多模态大语言模型审计

Jingyi Xu, Minghui Cheng, Anchen Sun

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 研究建筑脱碳披露情况,引入多模态大语言模型工具BeDA审计全球公司面板。发现多数披露不适用,存在报告差距,BeDA分数可靠,可监测该差距,为可执行的建筑搁浅法规提供支持,是筛选工具非预测工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21986 2026-07-27 cs.RO 新提交 78%

Mag4D-SLAM Dataset: A Repeated-Traversal Multi-Modal 4D Geomagnetic Dataset for Localization and Mapping

Mag4D-SLAM数据集:用于定位和映射的重复遍历多模态4D地磁数据集

Bibhutibhusan Nayak, Hyoseok Ju, Giseop Kim

机构 * Department of Robotics and Mechatronics Engineering, DGIST(大邱庆北科学技术院机器人与机电工程系)

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 该研究提出Mag4D-SLAM这一首个大规模室外地磁SLAM数据集,含多传感器同步测量与地面真值姿态。通过重复遍历实验分析磁场重复性等特性,支持偏航漂移缓解等研究,还能开启地磁传感补充其他模态及应对特殊情况的新研究。

Comments Accepted to IROS 2026. 8 pages, 8 figures. *Bibhutibhusan Nayak and Hyoseok Ju contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21780 2026-07-27 cs.CL cs.AI cs.CV 新提交 78%

Khondo: A Multimodal Benchmark for Document Packet Splitting of Bangla Forms

Khondo:孟加拉语表格文档分组拆分的多模态基准测试

Abu Tyeb Azad, Fahim Ahmed, Ishita Sur Apan, Ezharuddin Jubaer, Sumaiya Karim Katha, Armun Alam, Amin Ahsan Ali, Aman Chadha, Md Mofijul Islam, AKM Mahbubur Rahman

机构 * Wichita State University(威奇托州立大学) CCDS, Independent University, Bangladesh(孟加拉国独立大学计算与通信科学系) Amazon GenAI(亚马逊生成式人工智能)

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.CL、cs.AI

AI总结 研究针对孟加拉语表格文档分组拆分难的问题,引入多模态基准测试Khondo,涵盖多种拼接方案和行政领域。通过对语言模型零样本评估及对照分析,发现页面排列是主要挑战,语言有影响,确立页面顺序重建问题并提供基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20323 2026-07-23 cs.LG physics.comp-ph q-bio.BM 新提交 78%

Multi-modal transformer for signal classification in nanopore blockade experiments

用于纳米孔阻断实验中信号分类的多模态变压器

Sandro Kuppel, Julian Hoßbach, Samuel Tovey, Christian Holm

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 针对纳米孔信号复杂难以分类的问题,引入多模态深度学习架构,联合处理多种信号表示,在42肽基准测试中大幅超越现有方法,转移到20氨基酸数据集也有高准确率,证明机器学习助力纳米孔传感器高精度分子识别的潜力。

Comments 22 pages (incl. references), 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19816 2026-07-23 physics.chem-ph cs.LG physics.comp-ph physics.data-an 新提交 78%

Hypothesis-and-Refinement Learning of Organic Structures from Multimodal Spectroscopic Data

基于多模态光谱数据的有机结构假设与细化学习

Chengchun Liu, Zhiyuan Yan, Li Yuan, Hao Li, Boxuan Zhao, Yonghong Tian, Bartosz A. Grzybowski, Fanyang Mo

机构 * State Key Laboratory of Advanced Waterproof Materials, School of Materials Science and Engineering, Peking University(先进防水材料国家重点实验室,材料科学与工程学院,北京大学) School of Electronic and Computer Engineering, Peking University Shenzhen Graduate School(电子与计算机工程学院,北京大学深圳研究生院) Peng Cheng Laboratory(鹏城实验室) IBS Center for Algorithmic and Robotized Synthesis (CARS), UNIST(算法与机器人化合成中心(CARS),UNIST) Department of Chemistry, UNIST(化学系,UNIST) School of Advanced Materials, Peking University Shenzhen Graduate School(先进材料学院,北京大学深圳研究生院)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 该研究针对从光谱数据确定分子结构的难题,提出假设细化范式,构建QM9SPIN数据集,引入SpectroMol和MS - Mol2Mol,集成系统在模拟基准上准确率达93.8%,能适应实验光谱并改进预测,为有机结构解析提供可扩展途径。

Comments 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16604 2026-07-21 eess.IV 新提交 78%

When Do Multimodal and Graph-Augmented RAG Help? A Controlled Evaluation for Document Question Answering

多模态和图增强的检索增强生成(RAG)何时有用?文档问答的对照评估

Sokipriala Jonah

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 研究文档问答中多模态和图增强RAG的作用,提出用多模态图-RAG架构,通过独立检索并融合文本、图和视觉证据源来评估效果。经实验发现其价值取决于多种因素,如检索设计等,还揭示了一些相关问题,如图像检索及生成器效率对结果的影响。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15436 2026-07-20 cs.CY 新提交 78%

Complete Trip: A Linked Multimodal Human Mobility Dataset

完整行程:一个链接的多模式人类移动数据集

Ruohan Li, Weiyu Luo, Xin Wu, Chenfeng Xiong

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 该研究提出完整行程数据集,通过四阶段工作流程从LBS数据重建多模式旅行行为,涵盖犹他州六个县。能保留行程关系、提供路线表示并支持人口级分析,推动交通、公共卫生等多领域可重复研究。

Comments 16 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09730 2026-07-14 eess.SP 新提交 78%

Multimodal EEG-IMU Fusion for Motor Assessment: Leveraging Task-Dependent Complementarity for Robustness

用于运动评估的多模态脑电-惯性测量单元融合:利用任务相关互补性提高鲁棒性

Zhenan Yin, Lalitha Pranathi Pulavarthy, Saptarshi Purkayastha

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 研究针对运动障碍评估中多传感模式整合不足问题,通过同步记录脑电-惯性测量单元数据,评估特定任务模态性能和多模态融合。结果表明脑电和惯性测量单元各有优势,后期融合可利用互补性提高评估可靠性,为大规模临床验证提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10530 2026-07-14 cs.CE 新提交 78%

Integrating Physics-Informed Neural Networks and 3D Vascular Geometry Learning for Cerebral Aneurysm Detection and Multimodal Rupture-Risk Prediction

将物理信息神经网络与3D血管几何学习相结合用于脑动脉瘤检测和多模态破裂风险预测

Eshan Vipuil, Xianqi Li

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 研究旨在结合物理信息神经网络与3D血管几何学习用于脑动脉瘤检测及多模态破裂风险预测。通过基于PointNeXt的检测器识别动脉瘤,利用物理信息神经网络生成血流动力学描述符,多模态模型整合多种变量预测风险,取得良好检测及预测效果,提供了定量多模态评估策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09948 2026-07-14 physics.med-ph cs.LG 新提交 78%

Artificial Intelligence Across the Cardiac Amyloidosis Diagnostic Pathway: From Single-Modality Detection to Multimodal Clinical Integration

人工智能在心脏淀粉样变性诊断途径中的应用:从单模态检测到多模态临床整合

Diana Shadibaeva, Rochak Dhakal, Kui Zhang, Xiaofeng Yang, Saurabh Malhotra, Weihua Zhou

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 研究心脏淀粉样变性诊断中人工智能的应用,按筛查、检测等临床任务综合相关研究,揭示其成熟度梯度,骨闪烁显像和SPECT/CT的二元检测及量化接近临床转化,亚型识别等任务尚处早期。

Comments Diana Shadibaeva and Rochak Dhakal contributed equally to this work. Total Pages = 35, No. of Figures = 4, No. of Tables on Manuscript = 1, Supplementary Tables = 6

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08790 2026-07-13 q-bio.QM 新提交 78%

DentiAsk: A VQA Benchmark for Multimodal Reasoning in Panoramic Dental Radiographs

DentiAsk:全景牙科X光片中多模态推理的视觉问答基准测试

Debesh Jha, Tapas Kumar Dutta, Roshan Paudel, Onkar Kishor Susladkar, Aashish Ghimire, Anupam Dhakal, Sabin Adhikari, Nand Kumar Yadav, Deepak Ranjan Nayak, Pravin Pawar, William C. W. Chen, Glenda Reynolds

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 研究旨在解决现有医学视觉问答基准测试无法充分体现全景牙科X光片解读复杂性的问题,引入DentiAsk基准测试,涵盖多种病变和推理层次,对10种模型测试发现其在空间定位等方面存在局限,为推进医学成像多模态推理提供挑战基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08215 2026-07-10 cs.DC 新提交 78%

On the Limitations of Non-GPU AI Accelerators for Large-Model Inference: A Field Study of MoE and Multimodal Serving on Huawei Ascend

论非 GPU 人工智能加速器在大模型推理中的局限性:基于华为昇腾的 MoE 和多模态服务的实地研究

Zheng Yu

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 研究非 GPU 人工智能加速器在大模型推理中的局限性,通过在华为昇腾系统上部署两个大型推理工作负载进行实地研究,总结平台八类限制及原因,量化相关指标,为评估或操作此类加速器的团队提供可重复参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06973 2026-07-09 cs.LG 新提交 78%

Rethinking Multimodal Time-Series Forecasting Evaluation

重新思考多模态时间序列预测评估

Haoxin Liu, Yichen Zhou, Rajat Sen, B. Aditya Prakash, Abhimanyu Das

机构 * Georgia Institute of Technology(佐治亚理工学院) Google Research(谷歌研究院)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 研究针对现有多模态时间序列预测基准的问题,引入TimesX基准,通过自动数据生成管道获取多样真实世界时间序列。经实证研究发现,一些在现有基准上好的方法在TimesX上可能失败,而利用文本上下文的简单集成方法表现出色。

Journal ref Published in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03907 2026-07-07 eess.SP 新提交 78%

Task-Oriented Multimodal Edge Intelligence via Integrated Sensing-Communication-Computation

通过集成传感-通信-计算实现面向任务的多模态边缘智能

Weiwei Chen, Yinghui He, Zhong Ye, Dingzhu Wen, Guanding Yu

专题命中 多模态评测 :multimodal(title);multi-modal(abstract)

AI总结 针对现有单模态集成传感通信计算(ISCC)设计易受多种问题影响、多模态ISCC设计不足的情况,提出面向任务的多模态ISCC框架,用最大编码率降低准则及算法提升性能,实验表明优于基线方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03826 2026-07-07 eess.SP 新提交 78%

LAMBDA: A Low-Altitude Multimodal Base Dataset for UAV Sensing and Communication

LAMBDA:用于无人机传感与通信的低空多模态基础数据集

Lin Zhou, Peichuan Rao, Chenshuo Zhang, Jianhua Mo, Shu Sun, Zhiyong Chen, Meixia Tao

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 研究低空综合传感与通信需对齐多模态数据,为此引入LAMBDA数据集,通过高保真数字孪生管道生成,具有多种特性,涵盖多场景多条件,支持多种参数设置,经评估有可靠性与可用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27886 2026-06-29 cs.LG 新提交 78%

A Comparison of Fusion Techniques for Multi-Modal Human Activity Recognition on the HARMES Dataset

HARMES数据集上多模态人类活动识别融合技术的比较

Ahmed Mohamady, Robin Burchard, Kristof Van Laerhoven

机构 * University of Siegen(锡根大学)

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 系统比较七种传感器融合方法在HARMES多模态数据集上的性能,发现门控多模态融合在留一参与者评估中宏F1分数达0.82,优于拼接式后期融合基线(0.76)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27666 2026-06-29 cs.AR 新提交 78%

MultModLM: A multi-modal benchmark for Large-Language Model based hardware schematic generation

MultModLM:基于大语言模型的硬件原理图生成的多模态基准

Dhruv Kulkarni, Sai Manoj Pudukotai Dinkarrao

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 提出MultModLM基准,评估LLM从RTL描述生成硬件原理图的能力,通过多阶段评估框架发现模型生成原理图功能正确性有限,且LLM评估者与人类评分一致性极低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26164 2026-06-26 cs.LG cs.NA math.NA physics.data-an stat.CO 新提交 78%

\chisao{}: A GPU-Native Parallel Optimizer for Multimodal Black-Box Functions via Convergence-Anticonvergence Oscillation

Chisao: 一种基于收敛-反收敛振荡的多模态黑盒函数的GPU原生并行优化器

Ira Wolfson

机构 * Braude College of Engineering(布劳德工程学院)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 提出GPU原生群体优化器Chisao,通过收敛-反收敛振荡循环逃离局部陷阱并冻结确认模态,在42个基准函数上实现100%模态恢复,速度提升达39倍。

Comments 22 pages, 4 Appendixes

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18640 2026-06-26 cs.LG q-bio.QM 新提交 78%

MetaboNet-Bench: A Multi-modal Benchmark for Glucose Forecasting in Type 1 Diabetes

MetaboNet-Bench:1型糖尿病血糖预测的多模态基准

Nathaniel Jeffries, Miriam Wolff, Sam Royston, Elizabeth Healey, Caleb Mayer, David Klonoff, Michael Snyder, Tao Wang

机构 * Department of Genetics, Stanford University School of Medicine(斯坦福大学医学院遗传学系) Replica Health Boston Children’s Hospital, Harvard Medical School(哈佛医学院波士顿儿童医院) Diabetes Research Institute, Mills-Peninsula Medical Center(米尔斯半岛医学中心糖尿病研究所)

专题命中 多模态评测 :multi-modal(title);multimodal(abstract)

AI总结 针对1型糖尿病血糖预测算法缺乏标准化评估基准的问题,提出MetaboNet-Bench多模态基准,集成血糖、胰岛素和碳水化合物数据,通过多个模型对比验证多模态数据对模型性能的影响。

Comments main content in 10 pages with 5 figures; supplementary section with 11 more pages and 5 more figures. v2: fix figure 4 and 5's misordering

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10637 2026-06-26 hep-ex 新提交 78%

A Multimodal Domain-Adversarial Network for Fragmentation Background Suppression in AMS Heavy Nuclei Measurements

用于AMS重核测量中碎裂本底抑制的多模态域对抗网络

Zhen Liu, Valerio Formato, Muhammad Waqas

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 针对AMS重核测量中碎裂本底问题,提出多模态域对抗网络,融合硅径迹仪和飞行时间探测器数据,通过域对抗训练实现模拟到飞行数据的迁移,有效抑制本底。

Comments 16 pages, 13 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22889 2026-06-23 cs.LG 新提交 78%

Physiology-Aware CNN and Zero-Shot Multimodal LLMs for ECG Image Classification: A Comparative Study

生理感知CNN与零样本多模态大语言模型在心电图图像分类中的比较研究

Khalil Ahammad, Derek Abbott, Mohsen Dorraki

机构 * School of Computer Science and Information Technology, Adelaide University(阿德莱德大学计算机科学与信息学院) Australian Institute for Machine Learning (AIML)(澳大利亚机器学习研究所) Pi MedTech(Pi医疗科技) School of Electrical and Electronic Engineering, Adelaide University(阿德莱德大学电子与电气工程学院)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 研究比较了零样本多模态大语言模型和生理感知CNN在正常/异常心电图图像分类中的表现,发现CNN模型稳定且准确,而LLM分类接近随机。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22188 2026-06-23 cs.LG 新提交 78%

Bayesian Adaptation Gym: A Benchmark for the Bayesian Low-Rank Adaptation of Multi-Modal Language Models

贝叶斯适应健身房:多模态语言模型贝叶斯低秩适应的基准

Colin Samplawski, Ramneet Kaur, Manoj Acharya, Anirban Roy, Adam D. Cobb

机构 * Neuro-Symbolic Computing and Intelligence Research Group(神经符号计算与智能研究组) Computer Science Laboratory(计算机科学实验室) SRI International(SRI国际)

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 提出贝叶斯适应健身房(BAG)基准,用于评估多模态语言模型的贝叶斯低秩适应方法,涵盖校准、分布偏移鲁棒性和主动学习下的不确定性决策。

Comments Oral Paper at UAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19675 2026-06-19 cs.RO 新提交 78%

ForEnt: A Multi-Modal Dataset for Characterizing Quadruped Robot Entrapments in Forest Environments

ForEnt: 用于表征四足机器人在森林环境中被困的多模态数据集

Natapat Kirdwichai, Danesh Tarapore

机构 * University of Southampton(南安普顿大学)

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 针对四足机器人在森林中因植被缠绕而倾覆的问题,提出多模态数据集ForEnt,包含RGB-D、LiDAR、本体感知和第三人称视频,记录69次被困事件,支持可重复的基准测试。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏