arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-25 至 2026-08-25 共收录 33 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 33 篇

2608.15404 2026-08-25 cs.CV 版本更新 89%

CBX-Bench: A Human-Aligned MLLM Council for Benchmarking Concept Bottleneck Model Explanations

CBX-Bench:用于评估概念瓶颈模型解释的人类对齐多模态大语言模型委员会

Yusuf Meric Karadag, Gulay Oklan, Seref Baris Cagliyan, Umut Ozdemir, Emre Akbas

专题命中 多模态评测 :MLLM(title,summary_cn);multimodal(abstract);分类 cs.CV

AI总结 该研究开发了人类对齐的多模态大语言模型(MLLM)委员会,构建了CBX-Bench基准,实现了概念瓶颈模型(CBM)解释的可扩展定量评估,其在人类偏好排名上的恢复率达70%以上。

Comments Accepted to the Explainable Computer Vision (eXCV) Workshop at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21810 2026-08-25 cs.LG cs.CV 新提交 85%

MSM-Mem: A Universal Medical Structured Multimodal Memory Framework for Medical AI Agents

MSM-Mem:面向医疗AI智能体的通用医疗结构化多模态记忆框架

Md Asaduzzaman Jabin, Khoa Le, Lin Zhao, Tianming Liu

机构 * University of Georgia(佐治亚大学) New Jersey Institute of Technology(新泽西理工学院)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对现有医疗AI智能体无法内化临床经验的问题,提出MSM-Mem框架,整合多类型临床经验并逐步更新,经MoE-LLaVA评估可提升性能,助力医疗AI智能体随实践进化推理能力。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21543 2026-08-25 cs.CV cs.AI 新提交 85%

presto: Efficient, Training-free, and Open-world Object Placement via Imaginary Search

presto:基于想象搜索的高效无训练开放世界物体放置方法

Weixuan Ding, Shang Liu, Hanyu Pei, Zeyan Liu

机构 * Wuhan University(武汉大学) University of Louisville(路易斯维尔大学)

专题命中 多模态评测 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出零样本无训练框架presto,将开放世界物体放置转化为MLLM引导的启发式搜索任务,经多基准实验及人类研究验证,其在开放世界场景中性能最优,且MLLM作为评判者的变体更具感知一致性。

Comments Accepted to ICONIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22963 2026-08-25 cs.AI cs.CL 新提交 84%

Buried in Textual Debt: Context Pruning with Visual Evidence Preservation for MLLM Agents

被文本债务掩埋:面向多模态大语言模型智能体的保留视觉证据的上下文剪枝

Yuchen Huang, Sijia Li, Jun Zhang, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态评测 :MLLM(title,abstract_cn);multimodal(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型智能体长轨迹中文本主导上下文、抑制视觉证据的问题,提出基于KL引导的SPARE框架,结合OPSD与SFT实现高效剪枝,在多步视觉工具使用基准中达到最优准确率与剪枝比例的权衡。

Comments 14 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22321 2026-08-25 cs.CL 新提交 83%

Semantics or Structure? Auditing Text Sensitivity in Multimodal Time-Series Forecasting

语义还是结构?多模态时间序列预测中的文本敏感性审计

Karthik Sridhar, Atharva Gupta, Nishant Pradhan, Murari Mandal, Dhruv Kumar, Saurabh Deshpande

机构 * Birla AI Labs(贝拉人工智能实验室) BITS Pilani(皮拉尼比特斯学院) KIIT(基伊特学院)

专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.CL

AI总结 本研究审计多模态时间序列预测模型的文本敏感性,发现文本内容并非其在Time-MMD基准上性能提升的有效信号,并发布了相关诊断工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22232 2026-08-25 cs.AI cs.CL cs.CV cs.MM 新提交 83%

Beyond What Meets the Eye: Unveiling Situational Illusions for Multimodal Large Language Models

超越表象:揭示多模态大语言模型的情境错觉

Zhiming Yang, Zhuoxi Xiong, Donglin Zhou, Wenjun Wei, Shiyao Cui, Jinqiao Shi

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文针对多模态大语言模型(MLLMs)面临的情境错觉问题,构建分类体系并推出MSIBench基准,发现27种模型配置均易受6类错觉影响,通过提示工程和监督微调最多提升性能20%。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21941 2026-08-25 cs.AI 新提交 83%

Multimodal Prompt Learning with Irregular EHRs for Robust Monitoring of Critical Care Patients

面向重症监护患者稳健监测的不规则电子病历多模态提示学习

Yixin Yang, Yueyang Sun, Weichen Liu, Xianbing Zhao, Sicen Liu

机构 * Faculty of Engineering, Shenzhen MSU-BIT University(深圳北理莫斯科大学工程学院) International School, Beijing University of Posts and Telecommunications(北京邮电大学国际学院) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) School of Artificial Intelligence and Computer Science, Jiangnan University(江南大学人工智能与计算机学院)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 针对多模态电子病历存在模态缺失导致性能下降的问题,本文提出含四类互补提示的多模态提示学习框架,在两种缺失场景下的临床预测性能优于现有方法。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21853 2026-08-25 cs.CL 新提交 83%

PUMA: A Polish Benchmark for Culturally Grounded Multimodal Understanding

PUMA:面向文化扎根多模态理解的波兰基准测试

Sławomir Dadas, Michał Perełkiewicz, Rafał Poświata, Małgorzata Grębowiec, Bartłomiej Jaworski, Izabela Woźniakowska

机构 * National Information Processing Institute(国家信息处理研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 该研究针对英语外文化多模态评估不足的问题,提出波兰多模态基准PUMA,通过900项任务评估各类模型在波兰语境下的多模态能力,发现商用模型在视觉问答表现好但音频/文档理解弱,并开源评估框架推进本地化多模态AI研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21482 2026-08-25 eess.IV cs.AI cs.CV 新提交 81%

Reliability- and Anatomy-Consistency-Aware Multimodal Learning for Robust Fracture Classification from Bangladeshi Radiographs

面向孟加拉国X光片鲁棒骨折分类的可靠性与解剖一致性感知多模态学习

Musa Tur Farazi, K G Subarno Bithi

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 该研究针对孟加拉国X光片骨折分类,提出可靠性与解剖一致性感知的多模态融合方法,在提升分类性能的同时降低元数据不匹配带来的损失,存在干净性能与鲁棒性的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22346 2026-08-25 cs.CV cs.AI 新提交 81%

Multimodal examination answer data with expert-designed Outcome-Based Education rubrics for criterion-level assessment

采用专家设计的成果导向教育(OBE)评分规则用于准则级评估的多模态考试答案数据

Jahangir Alam SM, Md Khalid Syfullah, Saad Ahmed, Munira Akter Mou, A K Z Rasel Rahman, A.K.M. Masudur Rahman, Mohammed Sowket Ali

机构 * Bangladesh Army University of Science and Technology (BAUST)(孟加拉国陆军科技大学(BAUST))

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 该文发布了含OBE评分元数据的多模态考试答案数据集,可支持自动评估、多模态文档理解等研究,访问仅限科研用途。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11533 2026-08-25 cs.CL cs.CV 版本更新 81%

Checkup2Action: A Multimodal Clinical Check-up Report Dataset for Patient-Oriented Action Card Generation

Checkup2Action:面向患者行动的多模态临床检查报告数据集

Sike Xiang, Shuang Chen, Kevin Qinghong Lin, Jialin Yu, Yijia Sun, Philip Torr, Amir Atapour-Abarghouei

机构 * Durham University(杜伦大学) University of Oxford(牛津大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出Checkup2Action数据集,用于生成结构化的行动卡,通过多模态检查报告生成患者导向的行动建议,评估行动的准确性、优先级和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21497 2026-08-25 eess.IV cs.CV 新提交 79%

CHIMERA Challenge: Biochemical Recurrence Prediction in Prostate Cancer Patients using multimodal datasets

CHIMERA挑战赛:利用多模态数据集预测前列腺癌患者的生化复发

Robert N. Spaans, Catherine Chia, Tongjie Wang, Adam Kowalewski, Parandzem Khachatryan, Domingos Oliveira, Khrystyna Faryna, Jean-Paul A. van Basten, Geert Litjens, Nadieh Khalili

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究开发首个公开标准化前列腺癌预后多模态基准CHIMERA挑战赛,整合多类数据建立数据集,发现多模态模型在缺失临床变量时更稳健,单模态临床模型性能更高但对变量完整性敏感。

Comments 38 pages, 3 figures, 3 supplementary figures. Preprint submitted to Medical Image Analysis. Challenge results presented at the CHIMERA workshop, MICCAI 2025. Challenge website: this https URL (https://chimera.grand-challenge.org/chimera/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22713 2026-08-25 cs.CL 新提交 79%

A Source-Grounded Framework for Constructing and Evaluating Progressive Multimodal Diagnostic Dialogues from Clinical Case Reports

基于来源的从临床病例报告构建和评估渐进式多模态诊断对话的框架

Yufan Wang, Rui Yang, Yi Liu, Yi Lin, Yifan Peng

机构 * Weill Cornell Medicine(威尔康奈尔医学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 该研究提出基于来源的框架用于构建渐进式多模态诊断对话,并评估MLLMs的诊断推理能力,实验显示所提框架转换病例报告的参考对话表现优异,而前沿MLLMs的相关指标显著更低。

Comments Accepted to IEEE HealthCom 2026, Distinguished Invited Papers Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22323 2026-08-25 cs.CV 新提交 79%

MedReaMM: Evaluating Large Multimodal Models on Expert-Level Clinical Diagnostic Synthesis

MedReaMM:评估大型多模态模型在专家级临床诊断综合能力上的表现

Lai Wei, Yuchao Chen, Zhenbiao Cao, Xiaojin Zhang, Zhongyu Wei, Bangting Wang, Wei Chen, Xiang Bai

机构 * The First Affiliated Hospital with Nanjing Medical University(南京医科大学第一附属医院) Jiangsu Province Hospital(江苏省医院) Huazhong University of Science Technology(华中科技大学) Fudan University(复旦大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究构建了多模态临床诊断基准MedReaMM,评估23个大型多模态模型的诊断综合能力,发现多数模型准确率不足50%,揭示了该领域的能力差距及相关影响因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21883 2026-08-25 cs.CV 新提交 79%

VIG: Visual Information Gain as a Reward Signal for Multimodal Chain-of-Thought Compression

VIG:作为多模态思维链压缩奖励信号的视觉信息增益

Wen Luo, Xiaohan Yi, Xiaotao Huang, Liqun Huang

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究提出VIG奖励机制,通过提升视觉信息密度优化多模态CoT的准确率与效率权衡,无需额外资源,在多类基准及不同规模模型上均有效。

Comments Accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21530 2026-08-25 cs.LG 新提交 78%

Multimodal Injury Risk and Performance Prediction in Tennis Using Weighted Ensemble Learning

基于加权集成学习的网球多模态损伤风险与表现预测

Weihao Qu, Dongyang Wang, Ling Zheng, Francisco E. Alvarez, Shobharani Polasa, Jiacun Wang

机构 * Monmouth University(蒙茅斯大学)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本研究针对网球领域多模态损伤风险与表现预测方法不足的问题,提出PART多模态加权集成学习框架,整合多类数据提取专属特征,采用自适应权重策略,经9名大学网球运动员数据验证,可监测健康、估算损伤风险,对休闲球员也有应用潜力。

Comments 8 pages. Accepted author manuscript. Published as Early Access in IEEE Systems, Man, and Cybernetics Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15052 2026-08-25 cs.RO 版本更新 78%

CAVERS: Multimodal SLAM Data from a Natural Karstic Cave with Ground Truth Motion Capture

CAVERS:从自然喀斯特洞穴获取多模态SLAM数据并采用地面真实运动捕捉

Giacomo Franchini, David Rodríguez-Martínez, Alfonso Martínez-Petersen, C. J. Pérez-del-Pulgar, Marcello Chiaberge

机构 * Polytechnic of Turin Interdepartmental Centre for Service Robotics (PIC4SeR)(都灵理工大学服务机器人跨部门研究中心(PIC4SeR)) Systems Engineering and Automation Department, Universidad de Málaga(马德里大学系统工程与自动化系)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出CAVERS数据集,通过地面真实运动捕捉系统提供高精度姿态和速度数据,验证了多模态传感器在复杂洞穴环境中的SLAM算法性能。

Comments 8 pages, 4 figures, accepted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22465 2026-08-25 cs.CV 新提交 74%

M$^3$ISR: A Multi-Modal Multi-View Benchmark for 3D/4D Gaussian Splatting and Feedforward Compression

M$^3$ISR:面向3D/4D高斯溅射(Gaussian Splatting)与前馈压缩的多模态多视图基准测试

Xinhui Liu, Lei Liu, Zhenghao Chen, Lebin Zhou, Wei Wang, Wei Jiang

机构 * The University of Hong Kong(香港大学) University of Newcastle(纽卡斯尔大学) Santa Clara University(圣克拉拉大学) Futurewei Technologies, Inc.(华为主导未来技术公司)

专题命中 多模态评测 :multi-modal(title);分类 cs.CV

AI总结 该研究提出面向3D/4D高斯溅射的可控合成基准M$^3$ISR,含25个场景等,设5个赛道,评估发现静态重建质量差异小但存储成本差异大,为相关研究提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23531 2026-08-25 cs.CV cs.LG 新提交 70%

Predicting Multiple Clinical Outcomes Related to Functional Recovery and Social Isolation Among Older Adults After Lower-Limb Fracture or Hip Replacement

预测下肢骨折或髋关节置换术后老年人与功能恢复和社交孤立相关的多种临床结局

Santosh Ray, Pratik K. Mishra, Ali Abedi, Charlene H. Chu, Amir Ahmad, Shehroz S. Khan

机构 * Liwa University(利瓦大学) University of Toronto(多伦多大学) University Health Network(大学健康网络) United Arab Emirates University(阿联酋大学) American University of the Middle East(中东美国大学)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

AI总结 该研究基于MAISON-LLF数据集构建多输出回归模型,用NODE算法联合预测下肢骨折或髋关节置换术后老年人的5项临床结局,效果优于单输出模型,可辅助评估其功能恢复与社交参与。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23313 2026-08-25 cs.AI 新提交 70%

EviSafe: Evidence-Grounded Safety Evaluation for Vision-Language Models

EviSafe:基于证据的视觉语言模型安全性评估

Xuetong Li, Gaofeng Liu

机构 * Department of Automation, Shanghai Jiao Tong University(上海交通大学自动化系)

专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.AI

AI总结 本研究提出基于证据的VLM安全性评估框架EviSafe及对应基准EviSafeBench,通过三探针协议评估11个VLMs,发现其未因正确多模态原因可靠安全,需开展超越拒绝次数的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20510 2026-08-25 cs.AI cs.CL 版本更新 62%

Telco-GAIA: Bilingual Benchmark for Agents in Telecom Domain

电信-GAIA:电信领域智能体的双语基准测试

Dmitrii Khizbullin, Zaid Alyafeai, Abdelrahman Eldesokey, Nourah AlSultan, Raghad Alshalan, Bernard Ghanem, David R. Pugh

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) stc(沙特电信公司)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 介绍电信-GAIA双语多模态基准测试,含100个人工验证问答任务,需多跳推理,跨越多种异构源。以沙盒化Docker环境提供,通过规范化精确字符串匹配评分。评估发现其具有挑战性,为企业智能体提供测试平台和构建基准测试的模板。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18484 2026-08-25 cs.CV cs.CL 版本更新 62%

Benchmarking and Boosting Multilingual Capabilities of LVLMs via OCR-Centric Reinforcement Learning

PM4Bench: 通过平行多语言多模态多任务语料库对大型视觉-语言模型进行基准测试

Junyuan Gao, Jiahe Song, Jiang Wu, Runchuan Zhu, Guanlin Shen, Shasha Wang, Xingjian Wei, Haote Yang, Weijia Li, Bin Wang, Lijun Wu, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Sun Yat-Sen University(中山大学) Chinese University of Hong Kong(香港中文大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 PM4Bench通过平行多语言多模态多任务语料库评估大型视觉-语言模型,揭示跨语言性能差异与OCR能力的关系。

Comments Accepted by EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23330 2026-08-25 cs.CV 新提交 57%

IntentQA: Intent Question Answering in Videos by Cognitive Context Reasoning

IntentQA:基于认知上下文推理的视频意图问答

Jiapeng Li, Ping Wei, Wenjuan Han, Song-Chun Zhu, Lifeng Fan

机构 * Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院) Beijing Jiaotong University(北京交通大学)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出视频意图问答任务 IntentQA,构建相关大规模数据集,提出 X-CaVIR 框架并引入对比性能下降指标,实验验证其有效性、优越性与稳定性。

Comments 18 pages, 7 figures. Accepted manuscript of an article published in IEEE Transactions on Pattern Analysis and Machine Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22975 2026-08-25 cs.AI 新提交 57%

Budget-Constrained Embodied Perception: Four Resource Walls and a Pre-Registered Evaluation of Access-Structured Perception on Open Models at less than 31B

预算受限的具身感知:四道资源墙及对小于31B的开放模型的访问结构化感知的预注册评估

Defu Lin, Wenhui Chen, Ziyao Lin, Jianlin Chen, Peiji Long, Chi Man Vong

机构 * University of Macau(澳门大学) South China University of Technology(华南理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 该研究针对具身多模态智能体的固定决策token预算问题,提出四道资源墙及无训练包装器ASP,在SEW-Bench上评估发现查询条件访问比参数数量更关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22926 2026-08-25 cs.CV 新提交 57%

Motion-Based Tokenization for Cross-Dataset Egocentric Gaze Modeling

面向跨数据集自我中心凝视建模的基于运动的分词

Virmarie Maquiling, Zhuojiang Cai, Enkelejda Kasneci

机构 * Technical University of Munich (TUM)(慕尼黑工业大学(TUM)) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 该研究针对跨数据集自我中心凝视建模,提出基于运动的分词方法,通过多维度评估对比不同表示方式,发现其在部分迁移场景下的优势,明确事件构建对跨数据集迁移的影响。

Comments 8 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21596 2026-08-25 cs.CV 版本更新 57%

$ϕ$-Scene: Physically Grounded Image-to-3D Scene Reconstruction

$\phi$-Scene: 物理驱动的图像到3D场景重建

Haodong Li, Lulu Shao, Haolin Lu, Yu Fu, Yen-Ru Chen, Seemandhar Jain, Manmohan Chandraker

机构 * University of California San Diego(加州大学圣地亚哥分校)

专题命中 多模态评测 :MLLM(abstract);分类 cs.CV

AI总结 提出$\phi$-Scene方法,将单图像3D场景重建视为拓扑驱动的物理组装过程,通过SDF优化和刚体仿真解决穿透与不稳定接触问题,在3D-Front数据集上取得最优性能。

Comments Project page: this https URL (https://phi-scene.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21620 2026-08-25 cs.RO 新提交 56%

Why Personalization Matters: Cross-Subject Challenges in EMG-IMU-based HRI Activity Recognition

个性化为何重要:基于EMG-IMU的HRI活动识别中的跨主体挑战

Ruan Rithelle Chagas de Faria Carminati, Giovanni Braglia, Luigi Biagiotti, Ronnier Frates Rohrich, Andre Schneider de Oliveira, Mikael Nedel Hartmann, André Eugenio Lazzaretti

机构 * Universidade Tecnológica Federal do Paraná(巴拉那联邦理工大学) University of Modena and Reggio Emilia(摩德纳-雷焦艾米利亚大学) Istituto Italiano di Tecnologia(意大利技术研究院)

专题命中 多模态评测 :multimodal(abstract,comments)

AI总结 该研究针对基于EMG-IMU的HRI活动识别的跨主体挑战,构建了MAGIC-HRI数据集,发现存在较大泛化差距,证实注入少量新用户样本的个性化适配可显著提升识别性能,为HRI稳健部署提供支撑。

Comments Data collection was approved by the Federal University of Technology-Paraná Ethics Committee (CAAE 91430125.0.0000.0177). The MAGIC-HRI (Multimodal Activity, Gesture, and Intention Collection for HRI) dataset is available at [ this https URL (https://github.com/ruancarminati/MAGIC-HRI-V01.git) ]( this https URL (https://github.com/ruancarminati/MAGIC-HRI-V01.git) ). This paper will be presented at IEEE RO-MAN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23344 2026-08-25 cs.LG 新提交 50%

Towards Actionable Surgical Team Dynamics: from Teamwork to Counterfactual Annotations

面向可操作的手术团队动态:从团队协作到反事实标注

Vincenzo Marco De Luca, Antonio Longa, Andrea Passerini

机构 * University of Trento(特伦托大学) UiT the Arctic University of Norway(挪威北极大学)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本研究构建了基于真实手术室录制的扩展多模态手术团队互动数据集,含多级标注与反事实标注,支持团队协作建模及AI辅助协作系统设计,为高风险领域协作行为分析提供统一资源。

Comments Accepted at HCOMP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21626 2026-08-25 cs.LG 新提交 50%

Rethinking Communication Metrics: How Should We Measure Meaning?

重新思考通信指标:我们应如何衡量意义?

Niloofar Tavakolian, Hakimeh Purmehdi, Jungyeon Baek

机构 * Ericsson Canada(爱立信加拿大公司) Concordia University(康考迪亚大学)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文针对语义通信评估碎片化问题,从评估视角综述文本与图像语义通信的关键性能指标,分类梳理各类指标,分析现存挑战并展望未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21400 2026-08-25 cs.RO 新提交 50%

Active Interaction-Aware Model Predictive Path Integral via Ego-Conditioned Generative Predictions

基于自车条件生成预测的主动交互感知模型预测路径积分方法

Khaled A. Mustafa, Mohamed-Khalil Bouzidi, Christian Schlauch, Ahmad Gazar, Nadja Klein, Joerg Reichardt, Javier Alonso-Mora

机构 * TU Delft(代尔夫特理工大学) Aumovio SE(奥莫维奥股份公司) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文提出将自车条件生成自回归预测模型集成到MPPI控制的规划框架,通过嵌套采样评估代价与风险,使自车主动探测交互、降低歧义,仿真显示其安全效率优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏