arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-03 至 2026-02-03 共收录 153 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 25 篇

2602.00762 2026-02-03 cs.CL cs.HC 79%

WordCraft: Scaffolding the Keyword Method for L2 Vocabulary Learning with Multimodal LLMs

WordCraft: 通过多模态大语言模型 scaffolding 关键词方法用于L2词汇学习

Yuheng Shao, Junjie Xiong, Chaoran Wu, Xiyuan Wang, Ziyu Zhou, Yang Ouyang, Qinyi Tao, Quan Li

机构 * School of Information Science and Technology, ShanghaiTech University(信息科学与技术学院,上海科技大学) School of Creativity and Art, ShanghaiTech University(创意与艺术学院,上海科技大学) Shanghai Fengxian Dai Wen Middle School(上海奉贤戴文中学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL

AI总结 WordCraft通过多模态大语言模型辅助L2词汇学习,提升关键词方法的使用效果和学习者参与度。

Comments Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI' 26), April 13--17, 2026, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00107 2026-02-03 cs.CV cs.RO eess.IV 79%

Efficient UAV trajectory prediction: A multi-modal deep diffusion framework

高效无人机轨迹预测:一种多模态深度扩散框架

Yuan Gao, Xinyu Guo, Wenjing Xie, Zifan Wang, Hongwen Yu, Gongyang Li, Shugong Xu

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出一种多模态深度融合框架,通过融合激光雷达和毫米波雷达数据提升无人机轨迹预测精度,实验显示其比基线模型提升40%。

Comments in Chinese language

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00641 2026-02-03 stat.ML cs.LG stat.CO 78%

Sampling from multi-modal distributions on Riemannian manifolds with training-free stochastic interpolants

在黎曼流形上采样多模分布的无训练随机插值法

Alain Durmus, Maxence Noble, Thibaut Pellerin

机构 * CMAP, CNRS, Ecole polytechnique(CMAP、法国国家科学研究中心、巴黎高等师范学院)

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 本文提出了一种无训练的随机插值方法,用于在黎曼流形上高效采样多模分布,通过非平衡动力学和随机插值实现无需训练的高效采样。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23208 2026-02-03 cs.CL 74%

A Structured Framework for Evaluating and Enhancing Interpretive Capabilities of Multimodal LLMs in Culturally Situated Tasks

一种评估和增强多模态大语言模型在文化情境任务中解释能力的结构框架

Haorui Yu, Ramon Ruiz-Dolz, Qiufeng Yi

机构 * DJCAD, University of Dundee, United Kingdom(邓迪大学DJCAD部门) ARG-tech, SSEN, University of Dundee, United Kingdom(邓迪大学) School of Computer Science, University of Birmingham, United Kingdom(伯明翰大学计算机科学学院)

专题命中 多模态生成 :multimodal(title);分类 cs.CL

AI总结 本研究提出了一种结构框架,用于评估和增强多模态大语言模型在文化情境任务中生成中国绘画批评的能力,通过量化评价特征和人设引导提示,揭示了VLMs在艺术批评领域的表现与局限。

Comments EMNLP 2025 submission, 10 pages, 6 figures, 5 tables

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, pages 1945-1971, Suzhou, China

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00583 2026-02-03 cs.CV cs.AI 73%

MAUGen: A Unified Diffusion Approach for Multi-Identity Facial Expression and AU Label Generation

MAUGen: 一种用于多身份面部表情和AU标签生成的统一扩散方法

Xiangdong Li, Ye Lou, Ao Gao, Wei Zhang, Siyang Song

专题命中 多模态生成 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 MAUGen通过统一的扩散方法生成多身份面部表情和AU标签,提升面部动作单元识别系统的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01623 2026-02-03 cs.CV 70%

Omni-Judge: Can Omni-LLMs Serve as Human-Aligned Judges for Text-Conditioned Audio-Video Generation?

Omni-Judge: 能否将 Omni-LLMs 用作文本条件音频视频生成的人类对齐裁判?

Susan Liang, Chao Huang, Filippos Bellos, Yolo Yunlong Tang, Qianxiang Shen, Jing Bi, Luchuan Song, Zeliang Zhang, Jason Corso, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 多模态生成 :multi-modal(abstract);omni-modal(abstract);分类 cs.CV

AI总结 Omni-Judge 评估 Omni-LLMs 是否能作为文本条件音频视频生成的人类对齐裁判,展现其在多模态评估中的潜力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01193 2026-02-03 cs.CL cs.CV 62%

Bridging Lexical Ambiguity and Vision: A Mini Review on Visual Word Sense Disambiguation

弥合词汇歧义与视觉:关于视觉词义消歧的简要综述

Shashini Nilukshi, Deshan Sumanathilaka

机构 * School of Computing Informatics(计算与信息学学院) Institute of Technology(技术研究所)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文综述了视觉词义消歧的发展,探讨了对比模型和LLM在解决词汇歧义中的作用,并指出未来发展方向。

Comments 2 figures, 2 Tables, Accepted at IEEE TIC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01756 2026-02-03 cs.CV 57%

Mind-Brush: Integrating Agentic Cognitive Search and Reasoning into Image Generation

Mind-Brush: 将代理认知搜索与推理整合到图像生成中

Jun He, Junyan Ye, Zilong Huang, Dongzhi Jiang, Chenjue Zhang, Leqi Zhu, Renrui Zhang, Xiang Zhang, Weijia Li

机构 * Sun Yat-sen University(中山大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 Mind-Brush通过整合代理认知搜索与推理,提升图像生成模型对复杂知识推理和动态适应能力,实现性能显著跃升。

Comments 36 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18623 2026-02-03 cs.CV 57%

Adaptive Domain Shift in Diffusion Models for Cross-Modality Image Translation

扩散模型中自适应域偏移用于跨模态图像翻译

Zihao Wang, Yuzhou Chen, Shaogang Ren

机构 * Laplace Lab at University of Tennessee(田纳西大学Laplace实验室) University of California Riverside(加州大学河滨分校) University of Tennessee at Chattanooga(田纳西大学查塔努加分校)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种自适应域偏移方法,通过在扩散模型生成过程中嵌入域偏移动态,提升跨模态图像翻译的结构保真度和语义一致性。

Comments Paper accepted as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01352 2026-02-03 cs.CV 57%

T2M Mamba: Motion Periodicity-Saliency Coupling Approach for Stable Text-Driven Motion Generation

T2M Mamba:基于运动周期性与显著性耦合的稳定文本驱动运动生成方法

Xingzu Zhan, Chen Xie, Honghang Chen, Yixun Lin, Xiaochun Mai

机构 * Shenzhen University(深圳大学) Jinan University(济南大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 T2M Mamba通过周期性-显著性耦合方法,解决文本驱动运动生成中的周期性漂移和语义脆弱性问题,实现更稳定的运动生成。

Comments 8 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01305 2026-02-03 cs.CV 57%

StoryState: Agent-Based State Control for Consistent and Editable Storybooks

StoryState: 基于代理的状态控制用于一致且可编辑的故事书

Ayushman Sarkar, Zhenyu Yu, Wei Tang, Chu Chen, Kangning Cui, Mohd Yamani Idna Idris

机构 * Birbhum Institute of Engineering and Technology(比尔布尔工程科技学院) Universiti Malaya(马来亚大学) City University of Hong Kong(香港城市大学) Wake Forest University(威克森林大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 StoryState通过基于代理的状态控制实现多页故事书的一致性与编辑优化

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01046 2026-02-03 cs.CV 57%

ReLayout: Versatile and Structure-Preserving Design Layout Editing via Relation-Aware Design Reconstruction

ReLayout: 通过关系感知的设计重建实现多功能且结构保持的设计布局编辑

Jiawei Lin, Shizhao Sun, Danqing Huang, Ting Liu, Ji Li, Jiang Bian

机构 * Xi'an Jiaotong University, Xi'an, China(西安交通大学) Microsoft Research(微软研究院)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 ReLayout通过关系感知设计重建实现多功能且结构保持的设计布局编辑,无需三元组数据,提升编辑质量和结构保持性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00516 2026-02-03 cs.CV 57%

SPARK: Stochastic Propagation via Affinity-guided Random walK for training-free unsupervised segmentation

SPARK: 基于亲和力引导的随机游走进行无监督分割的随机传播

Kunal Mahatha, Jose Dolz, Christian Desrosiers

机构 * International Laboratory on Learning Systems (ILLS)(学习系统国际实验室)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 SPARK通过随机传播和亲和力引导的随机游走,实现无监督分割的高效且稳定的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03199 2026-02-03 cs.CL 57%

Beyond Content: How Grammatical Gender Shapes Visual Representation in Text-to-Image Models

超越内容:语法性别如何塑造文本到图像模型中的视觉表示

Muhammed Saeed, Shaina Raza, Ashmal Vayani, Muhammad Abdul-Mageed, Ali Emami, Shady Shehata

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 研究揭示语法性别对文本到图像模型中视觉表示的显著影响,通过跨语言实验展示不同语法性别对性别表示的系统性影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00463 2026-02-03 cs.CV 57%

PSGS: Text-driven Panorama Sliding Scene Generation via Gaussian Splatting

PSGS:通过高斯点划法实现文本驱动的全景滑动场景生成

Xin Zhang, Shen Chen, Jiale Zhou, Lei Li

机构 * East China University of Science and Technology(东华大学) Zhejiang University(浙江大学) Beijing Institute of Technology(北京理工大学)

专题命中 多模态生成 :MLLM(abstract);分类 cs.CV

AI总结 PSGS通过高斯点划法和双阶段框架实现高质量文本驱动全景场景生成,提升3D场景的真实感和细节保真度。

Comments Accepted to ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00042 2026-02-03 eess.SP cs.AI 57%

JSR-GFNet: Jamming-to-Signal Ratio-Aware Dynamic Gating for Interference Classification in future Cognitive Global Navigation Satellite Systems

JSR-GFNet: 针对未来认知全球导航卫星系统干扰分类的干扰-信号比感知动态门控

Zhihan Zeng, Hongyuan Shu, Kaihe Wang, Lu Chen, Amir Hussian, Yanjun Huang, Junchu Zhao, Yue Xiu, Zhongpei Zhang

机构 * National Key Laboratory of Wireless Communications, University of Electronic Science and Technology of China(中国电子科技大学无线通信国家重点实验室) University of Electronic Science and Technology of China(中国电子科技大学) Shanghai Aerospace Electronic Technology Institute(上海航天电子技术研究所) Shanghai Key Laboratory of Collaborative Computing in Spacial Heterogeneous Networks (CCSN)(上海空间异构网络协同计算重点实验室) Anhui Science and Technology University(安徽科技大学) University of Oxford(牛津大学) Shanghai Xiaoyuan Innovation center(上海小元创新中心)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

AI总结 JSR-GFNet通过结合相位敏感的IQ样本与STFT频谱图,利用动态门控机制提升GNSS干扰分类的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00941 2026-02-03 cs.NI 50%

LMTE: Putting the "Reasoning" into WAN Traffic Engineering with Language Models

LMTE:利用语言模型进行WAN流量工程中的推理

Xinyu Yuan, Yan Qiao, Zonghui Wang, Meng Li, Wenzhi Chen

专题命中 多模态生成 :multimodal(abstract)

AI总结 LMTE利用语言模型进行WAN流量工程,通过高效多模态对齐和轻量级配置生成,实现更高效的流量规划和优化。

Comments Accepted as a conference paper at IEEE INFOCOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00808 2026-02-03 cs.RO 50%

Physics-informed Diffusion Mamba Transformer for Real-world Driving

物理引导的扩散Mamba变换器用于现实驾驶

Hang Zhou, Qiang Zhang, Peiran Liu, Yihao Qin, Zhaoxu Yan, Yiding Ji

机构 * Robotics and Autonomous Systems Thrust, The Hong Kong University of Science and Technology(Guangzhou)(香港科学与技术大学(广州)机器人与自主系统方向) MoSense Technologies

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出了一种结合Mamba和注意力机制的扩散模型,通过整合物理约束提升自动驾驶轨迹预测的准确性和可解释性。

Journal ref International Conference on Robotics & Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11818 2026-02-03 cs.LG 50%

SynCoGen: Synthesizable 3D Molecule Generation via Joint Reaction and Coordinate Modeling

SynCoGen: 通过联合反应和坐标建模实现可合成的3D分子生成

Andrei Rekesh, Miruna Cretu, Dmytro Shevchuk, Vignesh Ram Somnath, Pietro Liò, Robert A. Batey, Mike Tyers, Michał Koziarski, Cheng-Hao Liu

机构 * University of Toronto(多伦多大学) The Hospital for Sick Children(多伦多儿童医院) University of Cambridge(剑桥大学) ETH Zürich(苏黎世联邦理工学院) Vector Institute(向量研究所) Mila – Quebec AI Institute(魁北克AI研究所) McGill University(麦吉尔大学) Caltech(加州理工学院)

专题命中 多模态生成 :multimodal(abstract)

AI总结 SynCoGen通过联合反应和坐标建模实现可合成的3D分子生成,实现了分子构建块、化学反应和原子坐标的联合分布采样,在无条件小分子生成和药物发现中表现出色。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 30 篇

2511.23402 2026-02-03 cs.LG stat.ML 88%

Quantized-Tinyllava: a new multimodal foundation model enables efficient split learning

量化-小TinyLLaVA:一种新的多模态基础模型实现了高效的分裂学习

Jiajun Guo, Xin Luo, Jiayin Zheng, Yiqun Wang, Kai-Wei Chang, Wei Wang, Jie Liu

机构 * Department of Statistics University of Michigan(统计学系密歇根大学) Department of Computational Medicine & Bioinformatics University of Michigan(计算医学与生物信息学系密歇根大学) Department of Biostatistics University of Michigan(生物统计学系密歇根大学) Department of Computer Science University of California, Los Angeles(计算机科学系加州大学洛杉矶分校)

专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(title,abstract)

AI总结 Quantized-TinyLLaVA通过量化压缩和高效分裂学习框架,在减少通信开销的同时保持模型性能,提升隐私保护能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21717 2026-02-03 cs.CL cs.CV 86%

CrossCheck-Bench: Diagnosing Compositional Failures in Multimodal Conflict Resolution

CrossCheck-Bench:多模态冲突解决中的组成性故障诊断

Baoliang Tian, Yuxuan Si, Jilong Wang, Lingyao Li, Zhongyuan Bao, Zineng Zhou, Tao Wang, Sixu Li, Ziyao Xu, Mingze Wang, Zhouzhuo Zhang, Zhihao Wang, Yike Yun, Ke Tian, Ning Yang, Minghui Qiu

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL

AI总结 CrossCheck-Bench通过多阶段注释流程构建的基准测试,揭示了多模态模型在处理跨模态冲突时的瓶颈,并表明融合符号推理与视觉处理的方法能提升模型的稳健性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00376 2026-02-03 cs.LG 85%

MATRIX: A Multimodal Benchmark and Post-Training Framework for Materials Science

MATRIX: 一种用于材料科学的多模态基准和后训练框架

Delia McGrath, Curtis Chong, Rohil Kulkarni, Gerbrand Ceder, Adeesh Kolluru

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract)

AI总结 MATRIX通过多模态后训练提升材料科学推理,展示视觉引导对实验解释和文本任务的显著改进。

Comments 17 pages, 9 Figures, submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01298 2026-02-03 cs.CV 83%

Interaction-Consistent Object Removal via MLLM-Based Reasoning

基于MLLM的交互一致物体移除

Ching-Kai Huang, Wen-Chieh Lin, Yan-Cen Lee

机构 * National Yang Ming Chiao Tung University(阳明交通大学)

专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出基于MLLM的REORM框架,通过多模态语言模型推断需共同删除的交互元素,解决交互一致物体移除问题,并在ICOREval基准上验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00811 2026-02-03 cs.AI 83%

MissMAC-Bench: Building Solid Benchmark for Missing Modality Issue in Robust Multimodal Affective Computing

MissMAC-Bench: 构建缺失模态问题的坚实基准以提升鲁棒多模态情感计算

Ronghao Lin, Honghao Lu, Ruixing Wu, Aolin Xiong, Qinggong Chu, Qiaolin He, Sijie Mai, Haifeng Hu

机构 * Sun Yat-Sen University(中山大学) South China Normal University(华南师范大学) Pazhou Laboratory(琶洲实验室)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 MissMAC-Bench通过构建统一评估标准和跨模态协同原则,系统量化缺失模态问题,提升多模态情感计算的鲁棒性和实际应用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01541 2026-02-03 cs.CV cs.AI 81%

Toward Cognitive Supersensing in Multimodal Large Language Model

迈向多模态大语言模型的认知超感知

Boyi Li, Yifan Shen, Yuanzhe Liu, Yifan Xu, Jiateng Liu, Xinzhuo Li, Zhengyuan Li, Jingyuan Zhu, Yunhan Zhong, Fangzhou Lan, Jianguo Cao, James M. Rehg, Heng Ji, Ismini Lourentzou, Xu Cao

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出认知超感知方法,通过整合视觉图像预测头和强化学习阶段,提升多模态大语言模型在复杂认知任务中的表现,展现其在视觉问答基准中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01163 2026-02-03 cs.CV cs.AI 81%

Semantically Aware UAV Landing Site Assessment from Remote Sensing Imagery via Multimodal Large Language Models

基于多模态大语言模型的语义感知无人机着陆地评估:从遥感图像

Chunliang Hua, Zeyuan Yang, Lei Zhang, Jiayang Sun, Fengwen Chen, Chunlan Zeng, Xiao Hu

机构 * School of Information Science and Engineering, Southeast University(信息科学与工程学院,东南大学) LASER, International Digital Economy Academy(LASER,国际数字经济学院) Department of Electronic Engineering, East China Normal University(电子工程系,华东师范大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于多模态大语言模型的无人机着陆地评估方法,通过语义感知与多模态融合提升风险识别精度与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01816 2026-02-03 cs.CV 79%

Seeing Is Believing? A Benchmark for Multimodal Large Language Models on Visual Illusions and Anomalies

看见即相信?多模态大语言模型在视觉错觉和异常上的基准测试

Wenjin Hou, Wei Liu, Han Hu, Xiaoxiao Sun, Serena Yeung-Levy, Hehe Fan

机构 * Zhejiang University(浙江大学) Tencent Hunyuan Team(腾讯文言团队) Stanford University(斯坦福大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出VIA-Bench基准测试,评估多模态大语言模型在视觉错觉和异常上的性能,揭示其在复杂视觉任务中的鲁棒性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01109 2026-02-03 cs.AI 79%

Transforming Vehicle Diagnostics: A Multimodal Approach to Error Patterns Prediction

将车辆诊断转型:一种多模态方法用于错误模式预测

Hugo Math, Rainer Lienhart

机构 * Augsburg University(艾尔福特大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出BiCarFormer,通过整合DTC序列和环境条件,实现车辆错误模式的多模态预测,提升诊断准确性与鲁棒性。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00060 2026-02-03 cs.CY cs.AI cs.LG 79%

A longitudinal geospatial multimodal dataset of post-discharge frailty, physiology, mobility, and neighborhoods

出院后老年人 frailty、生理、运动能力和社区的纵向地理多模态数据集

Ali Abedi, Charlene H. Chu, Shehroz S. Khan

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 GEOFRAIL 数据集通过多模态传感和数据分析技术,持续监测出院后老年人的 frailty、生理、运动能力和社区环境,为恢复轨迹研究提供纵向地理数据支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09509 2026-02-03 cs.RO 78%

SMapper: A Multi-Modal Data Acquisition Platform for SLAM Benchmarking

SMapper: 一种用于SLAM基准测试的多模态数据采集平台

Pedro Miguel Bastos Soares, Ali Tourani, Miguel Fernandez-Cortizas, Asier Bikandi-Noya, Holger Voos, Jose Luis Sanchez-Lopez

机构 * Automation and Robotics Research Group (ARG), Interdisciplinary Centre for Security, Reliability, and Trust (SnT), University of Luxembourg(卢森堡大学自动化与机器人研究组(ARG)、安全、可靠与信任跨学科研究中心(SnT))

专题命中 多模态评测 :multi-modal(title);multimodal(abstract)

AI总结 SMapper是一种用于SLAM基准测试的多模态数据采集平台,通过开放硬件设计和可重复的数据收集,提供高精度的SLAM数据集和基准测试结果,推动SLAM算法的发展和评估。

Comments 13 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏