arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 643 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 643 篇

2606.08314 2026-06-09 cs.AI 新提交 57%

Integrating Deep Learning Demand Forecasting with Multi-Objective Optimization for Circular Coffee Supply Chains: A Data-Driven Framework for Cost, Emissions, and Freshness Management

集成深度学习需求预测与多目标优化的循环咖啡供应链:面向成本、排放和新鲜度管理的数据驱动框架

Gerçek Budak, Faraz Gholamzadeh Gharehgheshlaghi, Melika Barjesteh Vaezi, Ahmad Gholizadeh Lonbar

机构 * Ankara Yıldırım Beyazıt University(安卡拉耶尔德勒姆贝亚泽特大学) Texas Tech University(德克萨斯理工大学) University of Alabama(阿拉巴马大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 提出两阶段框架,先用CNN-LSTM模型预测需求(MAE=22.87,R²=0.90),再通过三目标MILP模型优化成本、碳排放和新鲜度,在循环供应链中获得25个Pareto解,平衡政策可减排22.4%仅增成本9.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07965 2026-06-09 cs.AI 新提交 57%

Zero-Shot Learning in Industrial Scenarios: New Large-Scale Benchmark, Challenges and Baseline

工业场景中的零样本学习:新的大规模基准、挑战与基线

Zekai Zhang, Qinghui Chen, Maomao Xiong, Shijiao Ding, Zhanzhi Su, Xinjie Yao, Yiming Sun, Cong Bai, Jinglin Zhang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Huawei Technologies(华为技术有限公司) Tsinghua University(清华大学) Microsoft Research(微软研究院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 针对工业场景中视觉语言模型应用难、数据稀缺的问题,提出大规模多模态工业开放数据集MMIO和精炼文本-视觉提示RTVP,实现零样本工业缺陷检测,在MMIO上达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07542 2026-06-09 cs.CY cs.AI 新提交 57%

DIYHealth Suite: Dataset, Model, and Benchmark for Health Management at Home

DIYHealth Suite:家庭健康管理的数据集、模型与基准

Changshuo Liu, Junran Wu, Zhongle Xie, Wenqiao Zhang, Kaiping Zheng, Jiaqi Zhu, Qingpeng Cai, Ooi Gene Anne, Marcus Chun Jin Tan, Jianwei Yin, James Wei Luen Yip, Beng Chin Ooi

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 针对家庭健康管理中的数据异构、任务多变和缺乏统一基准等问题,提出包含大规模多模态数据集DIYHealth-900K、自适应基础模型DIYHealthGPT(采用混合超低秩适应技术)和首个家庭护理基准DIYHealthBench的综合框架,在11项任务上达到最优性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07289 2026-06-08 cs.LG cs.CV 新提交 57%

Closed-Form Spectral Regularization for Multi-Task Model Merging

多任务模型融合的闭式谱正则化

Yongxian Wei, Runxi Cheng, Xingxuan Zhang, Li Shen, Chun Yuan, Peng Cui, Dacheng Tao

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 针对多任务模型融合中的干扰最小化问题,发现迭代求解器实际充当隐式谱正则化器,据此提出基于谱滤波的闭式方法SWUDI及其自适应变体SWUDI-A,显著提升效率并匹配或超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07233 2026-06-08 cs.CV cs.LG cs.RO 新提交 57%

Does Appearance Help? A Systematic Study of Image-Based Re-Identification in Online 3D Multi-Pedestrian Tracking

外观有帮助吗?在线3D多行人追踪中基于图像的重识别系统研究

Eduardo Borges, Luís Garrote, Urbano J. Nunes

机构 * Institute of Systems and Robotics, Department of Electrical and Computer Engineering, University of Coimbra(系统与机器人研究所,电气与计算机工程系,科英布拉大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 系统研究轻量级投影框架下图像重识别在在线3D多目标追踪中的作用,提出级联匹配策略以在低延迟下恢复遮挡轨迹并防止身份切换。

Comments Accepted for publication at the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06784 2026-06-08 cs.CR cs.AI cs.CY 新提交 57%

What Your Posts Reveal: A Benchmark and Agentic Framework for User-Level Privacy Leakage on Social Media

你的帖子揭示了什么:社交媒体用户级隐私泄露的基准与智能体框架

Zifan Peng, Yini Huang, Aiwen Lu, Qiming Ye, Peixian Zhang, Jingyi Zheng, Yule Liu, Xuechao Wang, Xinlei He, Jiaheng Wei

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Wuhan University(武汉大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 针对社交媒体用户级多模态隐私泄露缺乏统一基准和评估指标的问题,提出SopriBench基准和隐私暴露分数(PES),并开发了无需训练的智能体框架Argus,通过跨帖子线索累积推理实现隐私推断,PES达0.55,较最强基线提升25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20983 2026-08-24 cs.SI cs.HC 新提交 50%

Beyond Truth Discovery: A Two-Stage Framework to Assess the Severity of False Claim during Disasters

超越真相发现:一种评估灾害期间虚假声明严重程度的两阶段框架

Ruichen Yao, Tejna Dasari, Gulshat Baispay, Aizhan Zaurbek, Yifan Liu, Yaokun Liu, Zelin Li, Dong Wang

专题命中 多模态评测 :multimodal(abstract)

AI总结 该研究针对灾害中社交媒体虚假声明严重程度评估问题,提出两阶段框架,结合可信度与危害性维度构建基准,发现LLMs及上下文学习与人工判断对齐度更强。

Comments The 2026 ACM Conference on Human-AI Complementarity and Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19735 2026-08-21 cs.LG 新提交 50%

RecPFN: Prior-Fitted Networks for In-Context-Based Recommendations

RecPFN:用于基于上下文的推荐的先验拟合网络

En Zhi Tan, Jia Xiang Lim, Bryan Lijie Chew, Tze Minh Ng, Benjamin Yan Han Yap

机构 * SAP SE(思爱普公司)

专题命中 多模态评测 :multimodal(abstract)

AI总结 RecPFN是一种将上下文学习引入序列推荐的先验拟合网络,经合成点击流环境预训练,在八个基准测试中实现最优零样本性能,部署高效且鲁棒,为通用推荐系统提供新路径。

Comments 12 pages, 4 figures, 8 tables

Journal ref In Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval, pp. 1731-1742. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18701 2026-08-20 cs.RO 新提交 50%

SoftVTBench: A Deformation-Aware Visuo-Tactile Dataset and Benchmark for Deformable-Object Manipulation

SoftVTBench:面向可变形物体操作的形变感知视觉-触觉数据集与基准

Bowen Jing, Mingxin Wang, Ruiyang Hao, Chenchen Ge, Hanwen Shen, Junjie He, Yang Cui, Yiming Hou, Weitao Zhou, Jiawei Wang, Minglei Li, Dandan Zhang, Ding Zhao, Houde Liu, Xiaofan Li, Si Liu, Ping Luo, Haibao Yu

机构 * Tuojing Intelligence(拓境智能) Tsinghua University(清华大学) Southeast University(东南大学) Stevens Institute of Technology(斯蒂文斯理工学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Manchester(曼彻斯特大学) Simple AI Imperial College London(帝国理工学院) Carnegie Mellon University(卡内基梅隆大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) The University of Hong Kong(香港大学)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本研究推出SoftVTBench视觉-触觉数据集与基准,定义形变感知成功率(DSR),发现触觉信息本身未必提升多模态融合,为可变形物体操作的物理交互研究提供资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17553 2026-08-19 cs.RO 新提交 50%

Scalix: Uncertainty-Aware Scale-Consistent Monocular SLAM

Scalix:感知不确定性的尺度一致单目SLAM

Sebastian Barbas Laina, Tianyi Zhang, Panagiotis Petropoulakis, Simon Schaefer, Simon Boche, Jaehyung Jung, Cedric Le Gentil, Stefan Leutenegger

机构 * University of Technology, Sydney(悉尼科技大学) Centre for Autonomous Systems(自主系统中心)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文提出实时单目SLAM框架Scalix,通过整合带不确定性的学习深度线索到概率因子图,实现度量尺度估计,在多环境基准上性能领先且实时泛化。

Comments 8 pages, 5 figures and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16337 2026-08-18 stat.ME 新提交 50%

High-Dimensional Assisted Learning for Vertically Distributed Data with Blockwise Missingness

面向含分块缺失的垂直分布式数据的高维辅助学习

Yuwen Long, Shuyuan Wu, Yin Xia

专题命中 多模态评测 :multimodal(abstract)

AI总结 针对含分块缺失的垂直分布式数据,提出 ALB 算法,无需合并记录即可实现高维线性估计与推理,性能优于完整样本 Lasso,可近似集中式基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14049 2026-08-17 cs.RO 新提交 50%

FlatLab: A Unified Methodology Framework and Simulation-Based Benchmark for Robotic Manipulation of Flat Objects

FlatLab:面向扁平物体机器人操作的统一方法论框架及基于仿真的基准测试

Xingyu Zhu, Wenshuo Han, Zhouyu Wang, Yuran Wang, Ruihai Wu, Hao Dong, Fan Tang, Hechang Chen, Hyung Jin Chang, Yixing Gao

机构 * Jilin University(吉林大学) Peking University(北京大学) Chinese Academy of Sciences(中国科学院) University of Birmingham(伯明翰大学)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 该研究针对扁平物体机器人操作泛化能力有限的问题,提出含策略生成器与执行模块的统一框架,并构建FlatLab仿真基准,方法泛化效果优于现有基线。

Comments This paper is accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13797 2026-08-17 cs.LG 新提交 50%

Recent Advances in Deep Learning-Based Drug-Target Binding Affinity Prediction

基于深度学习的药物-靶点结合亲和力预测的最新进展

Jafin Khan, Md Hossain Shuvo

机构 * Prairie View A&M University(普雷里维尤农工大学)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文综述近期基于深度学习的药物-靶点结合亲和力预测方法,分析其优势、局限与研究缺口,指出当前方法存在数据集偏差等问题,探讨未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12533 2026-08-14 physics.ed-ph 新提交 50%

Probing AI-generated physics solutions and preparing students to critique them

探究人工智能生成的物理解答并培养学生对其进行评判的能力

Nikhil Sanjay Borse, Amir Bralin, Sean Savage, N. Sanjay Rebello

专题命中 多模态评测 :multimodal(abstract)

AI总结 本研究通过调整框架评估OpenAI的o4-mini生成的物理解答,发现明确提示可提升解答完整性,MAPS指导能让学生更精准评判AI解答,为物理教育研究提供了新视角。

Comments 6 pages, 1 figure, Physics Education Research Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12037 2026-08-13 cs.LG cs.SY eess.SY 新提交 50%

Clustered Randomized Smoothing for Stochastic Prediction Functions

面向随机预测函数的聚类随机平滑方法

Eduardo Figueiredo, Frederik Mathiesen, Julian Schumann, Jens Kober, Arkady Zgonnikov, Luca Laurenti

机构 * Delft University of Technology(代尔夫特理工大学) University of Stuttgart(斯图加特大学) AI4I

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文针对随机多模态回归中随机平滑的模式崩溃问题,提出聚类α-平滑框架,在两个基准实验中较现有方法显著降低了Wasserstein距离与碰撞率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11958 2026-08-13 cs.HC 新提交 50%

Synchronized AMG and EMG Dataset of Lower-limb Muscle Activities in Everyday Training

日常训练中下肢肌肉活动的同步AMG与EMG数据集

Dongxu Tang, Shih Ying-Lei, Zhuoyi Ren, Jianting Liao, Yitian Shao

专题命中 多模态评测 :multimodal(abstract)

AI总结 该研究构建了健康成人下肢活动的同步AMG与EMG多模态数据集,通过基准测试评估其用于关节角估计的性能,为下肢肌肉协调相关研究提供了可重复的资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10096 2026-08-12 stat.ML cs.LG 新提交 50%

Deciding When to Switch: E-Processes for Adaptive Minimax Training for Generative Adversarial Nets

切换时机的判定:生成对抗网络自适应极小极大训练的E-过程

Hyunjoo Kim, Sicheng Wu, Agastya Venkatraman, Guang Lin, Sehwan Kim

专题命中 多模态评测 :multimodal(abstract)

AI总结 本研究将GAN训练的切换时机判定转化为序列假设检验问题,提出基于E-过程的自适应训练流程,在多模态合成分布与图像数据集上表现优于或匹配最优固定比例基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07064 2026-08-10 cs.HC 新提交 50%

XGait: A Multi-Modality Wireless Sensing Dataset for Indoor Human Tracking and Identification

XGait:用于室内人体跟踪与识别的多模态无线传感数据集

Wei Xu, Zhu Wang, Yifan Guo, Changlong Cheng, Yin Zhang, Zhihui Ren, Bin Guo, Zhiwen yu

专题命中 多模态评测 :cross-modal(abstract)

AI总结 针对现有无线传感数据集模态与轨迹局限,本文提出XGait多模态数据集,采用Wi-Fi与声学同步采集,构建统一多普勒频谱图表示,验证了两种传感模态的互补优势,为相关研究提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01482 2026-08-04 eess.IV 新提交 50%

Spinal-Multiple-Myeloma-SEG: A Dual-Energy CT Dataset Extended with Trabecular Bone Segmentation of Lumbar Vertebrae

Spinal-Multiple-Myeloma-SEG:扩展了腰椎骨小梁分割的双能CT数据集

Michal Nohel, Vlastimil Valek, Katerina Krejci, Roman Jakubicek, Marek Dostal, Jiri Chmelik

专题命中 多模态评测 :multimodal(abstract)

AI总结 该研究扩展了Spinal-Multiple-Myeloma-SEG双能CT数据集,添加腰椎骨小梁分割掩码,支持多发性骨髓瘤相关的骨分析与深度学习任务,已通过TCIA和Zenodo公开。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02257 2026-08-04 cs.RO 新提交 50%

Learning Panorama-Aware VLA for Mobile Manipulation with Whole-Body Teleoperation

面向全身遥操作移动操作的全景感知VLA学习

Donglin Yang, Haoran Chen, Xingyu Chen, Lixing Liu, Manyi Li, Changhe Tu, Ke Xu, Xiaojian Ma, Si Liu

机构 * Beihang University(北京航空航天大学) Shandong University(山东大学) Johns Hopkins University(约翰斯·霍普金斯大学) Delta Intelligence(delta智能公司)

专题命中 多模态评测 :multimodal(abstract)

AI总结 针对移动操作VLA策略的局部视野与全身演示数据收集难题,开发全身遥操作系统与PanoVLA全景感知VLA策略,基于5.5小时多模态数据集,在四项真实任务中平均阶段完成率91.3%、端到端成功率73.4%,性能优于局部视角基线。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01934 2026-08-04 cs.DC cs.CE cs.CR cs.PF 新提交 50%

Diagnosing High-Performance BFT Consensus via Mixture Modeling of Block Time Distributions

通过区块时间分布的混合建模诊断高性能拜占庭容错共识

Hongru He, Akihiro Fujihara

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出基于HotStuff的高性能BFT共识区块时间混合建模诊断方法,应用于Hyperliquid与Aptos主网,揭示二者部署异质性差异,为BFT共识分析提供实用诊断工具。

Comments 9 pages, 4 figures, published as a full paper at 2026 IEEE International Conference on Blockchain and Cryptocurrency (ICBC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00330 2026-08-04 cs.HC 新提交 50%

Read, Critique, or Sketch? Investigating Alternative Visualization Literacy Assessment Modalities

阅读、批判还是绘图?探究替代的可视化素养评估模态

Zach Cutler, Lily W. Ge, Matthew Kay, Lane Harrison, Andrew McNutt, Alexander Lex

专题命中 多模态评测 :multimodal(abstract)

AI总结 该研究开发了两种基于网络的可视化素养质性评估,与CALVI、Mini-VLAT对比后发现,其能捕捉独特技能且更好区分有经验个体,可作为现有评估的补充。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29090 2026-08-03 cs.LG 新提交 50%

What Is Missing in Surgical Risk Stratification and Outcome Prediction: A Scoping Review of End-to-End Machine Learning Approaches

手术风险分层与结局预测中缺失的内容:端到端机器学习方法的范围综述

Yizhi Dong, Yuhe Ke, Hairil Rizal Abdullah, Yucheng Xing, Kevan Kai Bing Teo, Ling Huang, Mengling Feng

专题命中 多模态评测 :multimodal(abstract)

AI总结 本范围综述回顾190项研究,分析手术风险分层与结局预测的ML流程,发现数据、方法、评估等方面存在差距,为开发更严谨的围手术期ML工具提供参考。

Comments This work has been submitted to the IEEE JBHI for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27217 2026-07-31 stat.AP cs.LG 新提交 50%

Foundation-Model Earth Representations Enable Regional-Scale Forest Aboveground Biomass Monitoring Across the Northeastern United States

基于基础模型的地球表征实现美国东北部区域尺度森林地上生物量监测

Shashika Lamahewage, Chandi Witharana

专题命中 多模态评测 :multimodal(abstract)

AI总结 该研究利用AlphaEarth基础模型生成的Google卫星嵌入,结合LiDAR数据与森林清查数据构建模型,实现美国东北部区域森林地上生物量的高精度监测,为规模化碳评估提供了新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25151 2026-07-29 cs.IR 新提交 50%

HiEviDR-Bench: A Benchmark for Hierarchical Evidence Aggregation in Deep Research

HiEviDR-Bench:深度研究中分层证据聚合的基准测试

Yubo Sun, Chunyi Peng, Yukun Yan, Zhenghao Liu, Sen Mei, Bangrui Xu, Xuanhe Zhou, Chi Chen, Maosong Sun

专题命中 多模态评测 :multimodal(abstract)

AI总结 针对深度研究中证据聚合评估不足问题,HiEviDR-Bench构建基准测试,涵盖多领域多模态设置,用证据图表示实例,开发评估框架及机制。含2000个问题,实验显示多模型虽报告质量好,但在引用准确性等方面欠佳,瓶颈在证据识别和中间主张构建。

Comments Code and data are available at https://ai9stars.github.io/HiEviDR-Bench.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24207 2026-07-28 cs.RO 新提交 50%

FloAff-Kitchen: Bridging Navigation and Manipulation via Canonical and Progressive Floor Affordance Learning

FloAff-Kitchen:通过规范和渐进式地面可供性学习连接导航与操作

Ping Zhong, Manling Teng, Tao Wu, Bolei Chen, Jiazhi Xia, Jianxin Wang

专题命中 多模态评测 :multimodal(abstract)

AI总结 研究针对移动操作中FloAff预测难题,提出含规范表示学习和渐进式可供性先验学习的统一框架,引入CFAR和PFAL,建立FloAff-Kitchen基准,实验证明该方法优于基线,验证了组件贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22607 2026-07-28 cs.CY 新提交 50%

The Clinical Trial Pipeline Reveals the Next Wave of Artificial Intelligence in Healthcare: A Multidimensional Analysis of 8,532 Registered Studies

临床试验管道揭示医疗保健领域人工智能的下一波浪潮:对8532项注册研究的多维分析

Lior Rokach

专题命中 多模态评测 :multimodal(abstract)

AI总结 该研究通过对8532项注册研究多维分析,揭示医学人工智能临床试验格局。用关键词搜索和分类器识别试验,从多维度分类,发现虽从回顾转向前瞻,但在规模、专业覆盖等方面有差距,未来进展取决于弥合这些差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22118 2026-07-27 cs.HC 新提交 50%

An AI-Driven Virtual Patient for Breaking Bad News: An Expert Formative Study on Facial Expression Intensity

用于传达坏消息的人工智能驱动虚拟患者:面部表情强度的专家形成性研究

Steffen Hauck, Theresa Schell, Sophie Jörg, Jens Grubert

专题命中 多模态评测 :multi-modal(abstract)

AI总结 研究探讨大语言模型驱动的虚拟患者情感表达设计难题,提出结合大语言模型对话与实时面部动画的框架,通过对七位医学专家评估,发现专家通过多渠道评估情感真实感,为未来医学培训模拟器提出需同步多模态管道的路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19381 2026-07-23 cs.LG 新提交 50%

Air Quality Arena: A Large-Scale Multi-Region Ground Monitoring Dataset and Benchmark for Air Quality Forecasting with Time-Series Foundation Models

空气质量竞技场:一个大规模多区域地面监测数据集以及基于时间序列基础模型的空气质量预测基准

Rishi Bharadwaj, Manik Gupta, Pandarasamy Arjunan

专题命中 多模态评测 :cross-modal(abstract)

AI总结 研究针对现有空气质量预测基准不足,提出空气质量竞技场(AQA),它是含多国多污染物的数据集及基准。通过在11个模型和基线测试,表明时间序列基础模型是有效零样本预测器,表现最佳的模型采用跨模态架构,AQA已公开发布。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17813 2026-07-21 cs.RO cs.SY eess.SY 新提交 50%

A2RL V\textsubscript{max}: The A2RL autonomous racing dataset for long-range, high-speed perception and multi-vehicle interaction

A2RL V下标max:用于远程、高速感知和多车辆交互的A2RL自动驾驶数据集

Marvin Klemp, Dominic Ebner, Cornelius Schröder, Davide Malvezzi, László Turányi, Riccardo Donati, Ilia Schminik, Xia Ning, Yanxin Zhou, Matthew Flagg, Christoph Stiller, Markus Lienkamp, Marko Bertogna, Gergely Bári, Andreas Birk, Ren Jin, Chen Lv, Johannes Betz

机构 * Institute of Measurement and Control Systems, Karlsruhe Institute of Technology(测量与控制系统研究所,卡尔斯鲁厄理工学院) Institute of Automotive Technology, Technical University of Munich(汽车技术研究所,慕尼黑工业大学) Professorship of Autonomous Vehicle Systems, Technical University of Munich(自动驾驶车辆系统教授职位,慕尼黑工业大学) University of Modena and Reggio Emilia(摩德纳大学和雷焦艾米利亚大学) Humda Lab, Széchenyi István University(胡姆达实验室,塞切尼·伊什特万大学) Politecnico di Milano(米兰理工大学) Constructor University(康斯坦丁大学) Beijing Institute of Technology(北京理工大学) Nanyang Technological University(南洋理工大学) Code 19 Racing(代码19赛车) Munich Institute of Robotics and Machine Intelligence (MIRMI), Technical University of Munich(慕尼黑机器人与机器智能研究所(MIRMI),慕尼黑工业大学)

专题命中 多模态评测 :multimodal(abstract)

AI总结 介绍A2RL V下标max开源数据集,专为高速自动驾驶和多车辆交互感知任务设计,含多样场景数据及专业标注激光雷达点云,以开发者友好格式提供,还对相关检测和跟踪方法做了实现与评估。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏