arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 643 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 643 篇

2607.04433 2026-07-07 cs.IR cs.CL 新提交 57%

Autonomous Information Seeking: A Roadmap for Agentic Recommender Systems

自主信息寻求:智能推荐系统路线图

Xinyu Lin, Yashar Deldjoo, Sunhao Dai, Honghui Bao, Xiaopeng Ye, Fatemeh Nazary, Wenjie Wang, Tommaso Di Noia, Jun Xu, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Polytechnic University of Bari(巴里理工大学) Renmin University of China(中国人民大学) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 综述基于大语言模型的智能体融入推荐系统带来的转变,介绍基于自主性水平的分类法及三种核心范式,分析各范式采用的架构和智能体对关键组件的增强,探讨评估方法及未解决问题,指出开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03789 2026-07-07 cs.CV 新提交 57%

G$^2$TAM: Geometry Grounded Track Anything Model

G$^2$TAM:几何基础的轨迹任意模型

Chenming Zhu, Peizhou Cao, Jingli Lin, Wenbo Hu, Yunlong Ran, Jiangmiao Pang, Tai Wang, Xihui Liu

机构 * HKU(香港大学) Shanghai AI Lab(上海人工智能实验室) BUAA(北京航空航天大学) SJTU(上海交通大学) UCLA(加州大学洛杉矶分校) ZJU(浙江大学)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 研究利用现代前馈3D重建模型的空间一致性,提出G$^2$TAM框架,用无序RGB图像或视频进行3D实例跟踪。核心是跨模态空间编码器,还构建数据集,实验表明该模型有多种优势,为交互式空间推理奠定基础。

Comments Accepted by ICML 2026. Project Page:https://zcmax.github.io/projects/G2TAM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03233 2026-07-07 cs.CR cs.AI cs.IR cs.SI 新提交 57%

Agentic and Generative AI for Open-Source Intelligence and Cyber Investigations: Taxonomy, Evaluation, Challenges, and Future Directions

用于开源情报和网络调查的智能与生成式人工智能:分类法、评估、挑战及未来方向

Eduardo Almeida Palmieri, Mohamed Chahine Ghanem, Dipo Dunsin, Zubair Baig, Ed de Quincey, Kim-Kwang Raymond Choo

机构 * School of Computer Science and Mathematics, Keele University(基尔大学计算机科学与数学学院) Cybersecurity Institute, University of Liverpool(利物浦大学网络安全研究所) Department of Applied Computing IICL, University of Wales Trinity Saint David(威尔士特里尼达大学应用计算系) Deakin Cyber Research and Innovation Hub, Deakin University(德金大学网络安全研究与创新中心) Department of Information Systems and Cyber Security, The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校信息系与网络安全系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 研究指出公开数字信息增长使人工开源情报分析不足,大语言模型等成解决方案但评估框架滞后。通过综述74项研究,明确智能人工智能类别,找出幻觉验证差距,映射研究到情报生命周期并给出研究议程。

Comments 36 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02553 2026-07-07 cs.CV cs.LG q-bio.NC 新提交 57%

Interpretable machine learning predicts Parkinson's disease severity using motion-corrected QSM MRI and multiband multiecho fMRI features

可解释机器学习利用运动校正QSM MRI和多波段多回波fMRI特征预测帕金森病严重程度

Aixa X. Andrade

机构 * Lyda Hill Department of Bioinformatics(Lyda Hill 生物信息学系) Department of Biomedical Engineering(生物医学工程系) University of Texas Southwestern Medical Center, Dallas, Texas, USA(德克萨斯西南医学中心,德克萨斯州达拉斯)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 利用可解释机器学习,从QSM和多波段多回波静息态fMRI衍生的ReHo特征预测帕金森病运动严重程度。提取特征进行多模型实验,结果显示不同模型表现及特征贡献,表明结构和功能成像依临床预测目标作用不同。

Comments 16 pages from main manuscript and 17 pages from supplementary information

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02549 2026-07-07 cs.CV cs.RO 新提交 57%

Learning 3D Affordances for Blade Insertion in Cluttered Stowing

学习在杂乱收纳中进行刀片插入的3D可用空间

Tianyu Li, Harpreet Sawhney, Minju Jung, Aditya Mehrotra, Kunal Mehrotra, Mudit Agrawal

机构 * Amazon Robotics(亚马逊机器人公司)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 研究杂乱收纳中刀片插入的3D可用空间问题,利用VulcanVoxel方法,通过基于3D占用场的掩码自动编码器,从单峰数据恢复多模态预测,提升了性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03298 2026-07-07 cs.LG cs.AI econ.GN physics.ao-ph q-fin.EC 新提交 57%

A harmonised dataset for Earth system foundation models

用于地球系统基础模型的统一数据集

Carlos Rodriguez-Pardo, Massimo Tavoni

机构 * Politecnico di Milano, Department of Management, Economics and Industrial Engineering(米兰理工大学管理、经济与工业工程系) RFF-CMCC European Institute on Economics and the Environment(资源未来研究所-欧洲经济与环境CMCC研究所) CMCC Foundation - Euro-Mediterranean Center on Climate Change(CMCC基金会-欧洲地中海气候变化中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 研究针对地球系统基础模型训练数据缺乏统一资源的问题,构建WorldTensor数据集,整合多类数据到标准网格,为训练和评估模型提供资源,推动多模态地球系统基础模型发展。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20723 2026-07-07 cs.CV 新提交 57%

Evaluation of Medical Vision Language Models HuluMed and MedGemma, and general purpose chatbots Gemma 3, ChatGPT Plus, and Claude Pro on real previously unseen wound images

医学视觉语言模型 HuluMed 和 MedGemma 以及通用聊天机器人 Gemma 3、ChatGPT Plus 和 Claude Pro 在真实未见伤口图像上的评估

Yunzhe Xue, Mohammed Saim Ahmed Quadri, Neal Panse, Justin W. Ady, Usman Roshan

机构 * Department of Computer Science, New Jersey Institute of Technology(新泽西理工学院计算机科学系) Vascular and Endovascular Surgery, Robert Wood Johnson Hospital(罗伯特·伍德·约翰逊医院血管外科) Department of Data Science, New Jersey Institute of Technology(新泽西理工学院数据科学系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本研究评估了六种视觉语言模型在慢性伤口分析任务上的表现,发现通用模型 ChatGPT 和 Claude 显著优于医学专用模型,表明广泛的多模态推理能力比领域知识更重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01612 2026-07-03 cs.AI 新提交 57%

Scaling with Confidence: Calibrating Confidence of LLMs for Adaptive Test Time Scaling

自信地扩展:校准LLM的置信度以实现自适应测试时扩展

Xuqing Yang, Yi Yuan, Shanzhe Lei, Xuhong Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Southeast University(东南大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 提出C3RL算法,通过结合正确性、校准和数据集参考准确率奖励来校准LLM的置信度,并基于此引入CAS策略,根据置信度自适应分配推理计算资源,在提升校准性的同时降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01442 2026-07-03 cs.CR cs.CV 新提交 57%

From Forgeries to Foundation Models: A Systematic Survey of Identity Document Attack and Detection

从伪造到基础模型:身份证件攻击与检测的系统性综述

Gourab Das, Pavan Kumar C, Raghavendra Ramachandra

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文系统综述了身份证件伪造攻击(物理呈现、数字注入、生成式合成)及检测方法,揭示了基准与现实间的差距,并发现最强模型在零样本场景下APCER超25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31174 2026-07-03 cs.AI 新提交 57%

ClawArena-Team: Benchmarking Subagent Orchestration and Dynamic Workflows in Language-Model Agents

ClawArena-Team: 语言模型智能体中子智能体编排与动态工作流的基准测试

Kaiwen Xiong, Haonian Ji, Shi Qiu, Zeyu Zheng, Cihang Xie, Xinyu Ye, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) University of California, Berkeley(加州大学伯克利分校) University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 提出ClawArena-Team基准,通过41个多轮多模态多目录场景,评估单个LLM作为管理者编排子智能体的能力,发现管理瓶颈在于权限授予而非感知,且成本与质量解耦。

Comments 24 pages, 10 figures, website: https://www.clawarena.cc/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00416 2026-07-02 cs.CV 新提交 57%

DroneIQA-VLE: Multi-Task Drone Image Quality Assessment via Vision-Language Ensemble

DroneIQA-VLE:基于视觉-语言集成的多任务无人机图像质量评估

Wei Sun, Weixia Zhang, Hongjian Zhan, Mingkai Lu, Yixuan Gao, Guangtao Zhai

机构 * East China Normal University(华东师范大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出DroneIQA-VLE框架,通过集成SigLIP2视觉编码器与多任务回归头以及LoRA微调的Qwen3.5-9B多模态大模型,联合预测全局、目标和背景质量分数,在ICME 2026无人机图像质量评估挑战赛中获得第二名。

Comments The model achieves 2nd place in ICME 2026 Drone-IQA Grand Challenge on Target-aware Image Quality Assessment for Low-altitude UAV Images

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00115 2026-07-02 cs.CV 新提交 57%

PixelEyes: Decoupling Perception and Reasoning for Pinpoint Visual Evidence Seeking

PixelEyes: 解耦感知与推理以实现精准视觉证据查找

Dengxian Gong, Yuanzheng Wu, Haobo Yuan, Zhengdong Hu, Tao Zhang, Yikang Zhou, Shihao Chen, Quanzhu Niu, Kai Wang, Jason Li, Haochen Wang, Lu Qi, Shunping Ji, Ming-Hsuan Yang

机构 * Wuhan University(武汉大学) UC Merced(加州大学默塞德分校) UTS(UTS大学) NUS(新加坡国立大学) NTU(南洋理工大学) CASIA(中国科学院自动化所)

专题命中 多模态评测 :MLLM(abstract);分类 cs.CV

AI总结 针对多轮视觉推理中目标定位失败导致轨迹冗余的问题,提出PixelEyes,通过解耦推理与感知(推理器决定查找目标,专用感知工具定位),引入掩码引导视觉搜索和语义区域广度优先搜索,构建PixelEyes-6K数据集和Pinpoint-Bench基准,显著提升定位准确性。

Comments 22pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31332 2026-07-01 cs.AI 新提交 57%

CryoACE: An Atom-centric Framework for Accurate and Automated Model Building in Cryo-EM

CryoACE: 面向冷冻电镜中精确自动模型构建的原子中心框架

Minzhang Li, Mingrui Li, Weichen Qin, Qihe Chen, Sixian Shen, Yuan Pei, Jiakai Zhang, Jingyi Yu

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 提出CryoACE框架,通过原子中心重建范式和无需训练的引导机制,实现冷冻电镜密度图中均质与异质结构的精确原子模型构建,显著优于现有方法。

Journal ref ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31169 2026-07-01 cs.CV 新提交 57%

Beyond Single Character: Evaluating MLLMs for Sentence-Level Oracle Bone Inscription Understanding

超越单字符:评估多模态大语言模型在句子级甲骨文理解中的表现

Ziqi Li, Zijian Chen, Tingzhu Chen, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Nanjing University of Science and Technology(南京理工大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出S-OBI基准,通过字形替换与组合合成清晰标准的句子级甲骨文实例,设计语义匹配、语义槽提取和上下文推理任务,评估多模态大语言模型在句子级甲骨文理解中的表现,发现当前模型仍依赖字符级识别。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31154 2026-07-01 cs.LG cs.AI 新提交 57%

PPT-Eval: A Benchmark for Computer-Use Agents on PowerPoint Tasks

PPT-Eval: 面向PowerPoint任务的计算机使用智能体基准

Apurva Gandhi, Vishwas Suryanarayanan, Raja Hasnain Anwar, Firoz Shaik, Shubhang Desai, Thong Q. Nguyen, Muhammad Taqi Raza, Vishal Chowdhary, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft(微软) UMass Amherst(马萨诸塞大学阿默斯特分校) Google(谷歌) Snowflake

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 提出PPT-Eval基准,包含120个PowerPoint任务,并设计基于评分标准的评估框架,通过部分评分和自然语言反馈衡量智能体表现,发现现有最强模型仅达45%成功率。

Comments Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28274 2026-06-29 cs.LG cs.AI 新提交 57%

Parameter Efficient Hybrid Transformer (PEHT) for Network Traffic Prediction via Dynamic Urban Congestion Integration

参数高效混合Transformer(PEHT)用于通过动态城市拥堵整合进行网络流量预测

Abdolazim Rezaei, Mehdi Sookhak, Mahboobeh Haghparast

机构 * National Science Foundation(国家科学基金会) U.S. Department of Transportation(美国交通部) University Transportation Center (UTC)(大学交通中心) Transportation Cybersecurity Center for Advanced Research and Education (CYBER-CARE)(交通网络安全高级研究与教育中心) NVIDIA Academic Grant Program(NVIDIA学术资助计划)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 提出参数高效混合Transformer(PEHT),通过低秩适应和多模态融合整合城市移动性与拥堵信息,在减少参数的同时提升网络流量预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26942 2026-06-26 cs.CV 新提交 57%

TraMP-LLaMA: Generative Interpretability with Decoupled Instruction Tuning for Facial Expression Quality Assessment

TraMP-LLaMA: 基于解耦指令微调的生成式可解释性用于面部表情质量评估

Shuchao Duan, Alan Whone, Hossein Rahmani, Jun Liu, Majid Mirmehdi

机构 * School of Computer Science University of Bristol(布里斯托大学计算机科学学院) Translational Health Sciences University of Bristol(布里斯托大学转化健康科学学院) School of Computing and Communications Lancaster University(兰卡斯特大学计算与通信学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出TraMP-LLaMA多模态框架,融合外观和轨迹特征,采用解耦指令微调策略,联合预测严重度并生成结构化文本报告,在PFED5-plus数据集上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26923 2026-06-26 cs.CL 新提交 57%

GAVEL: Grounded Caption Error Verification and Localization

GAVEL:基于视觉定位的标题错误验证与定位

Zixian Gao, Atsushi Hashimoto, Kuniaki Saito

机构 * OMRON SINIC X Corporation(欧姆龙SINIC X公司)

专题命中 多模态评测 :image-text(abstract);分类 cs.CL

AI总结 提出GAVEL任务,联合解决图像-文本对的验证、解释和定位问题,构建数据集和基准,监督基线在定位和解释指标上持续改进。

Comments conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26741 2026-06-26 cs.RO cs.CV 新提交 57%

PressMimic: Pressure-Guided Motion Capture and Control for Humanoid Robot Imitation

PressMimic: 压力引导的动作捕捉与控制用于人形机器人模仿

Yi Lu, Shenghao Ren, Tianyu Xiong, Zhaoxiang Li, Jiaqi Li, He Zhang, Tao Yu, Qiu Shen, Xun Cao

机构 * School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与工程学院) Key Laboratory of Optoelectronic Devices and Systems with Extreme Performances of MOE, Nanjing University(南京大学极端性能光电技术与系统教育部重点实验室) BNRist, Tsinghua University(清华大学北京信息科学与技术国家研究中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出PressMimic框架,通过压力模态融合RGB估计3D姿态和全局运动,并利用压力监督策略实现物理一致的接触模式,提升人形机器人模仿的准确性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26694 2026-06-26 cs.CV 新提交 57%

PhysEditWorld: A Large-Scale Dataset Toward Physics-Editable World Models

PhysEditWorld: 一个面向物理可编辑世界模型的大规模数据集

Bin Hu, Yanwen Ma, Jiehui Huang, Ziliang Zhang, Haoning Wu, Ruicheng Zhang, Yaokun Li, Zijun Wang, Yuechen Zhang, Chun-Mei Tseng, Hanhui Li, Shengju Qian, Jun Zhou, Kaipeng Zhang, Xiaodan Liang, Jiaya Jia, Xiu Li

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Beihang University(北京航空航天大学) The Hong Kong University of Science and Technology(香港科技大学) Independent Researcher(独立研究者) Shanghai Jiao Tong University(上海交通大学) Sun Yat-sen University(中山大学) The Chinese University of Hong Kong(香港中文大学) Tencent(腾讯)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出PhysEditWorld数据集,通过UE5重放渲染管线生成多重力配置下的动作条件视频,支持可控物理编辑,用于改进世界模型的动力学建模和一致性。

Comments Project page: https://yizhiqianbi.github.io/physeditworld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26661 2026-06-26 cs.RO cs.AI 新提交 57%

LAMP: Lane-Aligned Motion Primitives for Feasible Trajectory Prediction

LAMP: 面向可行轨迹预测的车道对齐运动基元

Sangjin Han, Hoseong Jung, Jeongtae Her, Changhyun Choi, H. Jin Kim

机构 * Seoul National University(首尔大学) Hyundai Motor Company(现代汽车公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 提出LAMP框架,利用VQ-VAE学习形状感知运动基元作为离散意图查询,并结合车道拓扑先验的可行性意图选择器,在保持行为多样性的同时提升预测轨迹的拓扑一致性和可行性。

Comments IEEE ITSC 2026, 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26602 2026-06-26 cs.CV 新提交 57%

DiCoBench: Benchmarking Multi-Image Fine-Grained Perception via Differential and Commonality Visual Cues

DiCoBench: 通过差异性和共性视觉线索进行多图像细粒度感知的基准测试

Geng Li, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出DiCoBench,一个包含765个样本的高分辨率多图像基准,通过差异性和共性视觉线索评估多模态大模型的细粒度感知能力,发现顶尖模型与人类准确率(98.3%)差距显著。

Comments Accepted by ECCV 2026. Project page with code: https://github.com/PKU-ICST-MIPL/DICO_Bench_ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25701 2026-06-25 cs.CV 新提交 57%

Falcon: Functional Assembly and Language for Compositional Reasoning in X-ray

Falcon: X射线中组合推理的功能组装与语言

Yonathan Michael, Mohamad Alansari, Natnael Takele, Andreas Henschel, Naoufel Werghi

机构 * Khalifa University(哈利法大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 针对X射线安检中威胁来自分散组件功能兼容性的问题,提出Falcon框架,通过结构化安全状态表示实现组合威胁推理,并构建Falcon-X基准验证其有效性。

Comments Accepted at ECCV2026; Project Page: https://yonathan-kiflom.github.io/FALCON/page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25245 2026-06-25 cs.CV 新提交 57%

OrthoTrack: Continuous 6-DoF UAV Trajectory Estimation Anchored in Public Orthophotos

OrthoTrack:基于公开正射影像的连续六自由度无人机轨迹估计

Oussema Dhaouadi, Zuria Bauer, Johannes Michael Meier, Olaf Wysocki, Marc Pollefeys, Daniel Cremers

机构 * ETH Zurich(苏黎世联邦理工学院) University of Cambridge(剑桥大学) Microsoft(微软公司)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 提出OrthoTrack,利用公开正射影像和表面模型实现无训练、实时、无漂移的连续六自由度无人机轨迹估计,无需GPS或后处理对齐。

Comments ECCV 2026 - Project page: http://orthotrack.ethz.ch

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23892 2026-06-24 cs.CV 新提交 57%

REALM: A Unified Red-Teaming Benchmark for Physical-World VLMs

REALM: 面向物理世界视觉语言模型的统一红队基准

Yifei Zhao, Qian Lou, Mengxin Zheng

机构 * University of Central Florida(中佛罗里达大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出REALM,首个统一红队基准,集成12种攻击方法、3种防御和13个视觉语言模型,通过代理目标生成管道实现公平比较,发现文本注入攻击最有效。

Comments 20 pages, 5 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22756 2026-06-23 cs.RO cs.CV cs.MA cs.SY eess.SY 新提交 57%

HERCULES: An Open-Source Simulation Framework for Heterogeneous Multi-Robot SLAM, Collaborative Perception, and Exploration

HERCULES:面向异构多机器人SLAM、协同感知与探索的开源仿真框架

Sandilya Sai Garimella, Daniel Chase Butterfield, Sean Wilson, Lu Gan

机构 * Georgia Institute of Technology(佐治亚理工学院) Georgia Tech Research Institute(佐治亚理工学院研究所)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 提出基于UE5的开源仿真框架HERCULES,支持异构无人机-无人车协同,解决架构限制,提供共享导航栈、红外相机和动态环境,验证了多机器人SLAM与探索的有效性。

Comments 19 pages, 14 figures, and 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22657 2026-06-23 cs.LG cs.AI 新提交 57%

Foundation Models for Epileptogenic Zone Identification in Drug-Resistant Epilepsy

药物难治性癫痫中致痫区识别的基础模型

Thi Kieu Khanh Ho, Thomas Lai, Petr Klimes, Jan Cimbalnik, Martin Pail, Milan Brazdil, Birgit Frauscher, Narges Armanfard

机构 * McGill University(麦吉尔大学) Mila-Quebec AI Institute(米拉-魁北克人工智能研究所) Montreal Neurological Institute and Hospital, McGill University(蒙特利尔神经学研究所与医院,麦吉尔大学) Institute of Scientific Instruments, The Czech Academy of Sciences(捷克科学院科学仪器研究所) Brno Epilepsy Center, Department of Neurology, St Anne’s University Hospital(布尔诺癫痫中心,圣安妮大学医院神经内科) Faculty of Medicine, Masaryk University(马萨里克大学医学院) Duke University Medical Center(杜克大学医学中心) Duke Pratt School of Engineering(杜克普拉特工程学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 提出EpiiSLM双基础模型系统,通过信号基础模型和语言基础模型整合sEEG与临床信息,在接触级PPV上超越传统方法15.1%,仅需一夜发作间期睡眠数据。

Comments Keywords: drug-resistant epilepsy, epileptogenic zone, stereo-electroencephalography, signal foundation models, language foundation models

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21819 2026-06-23 cs.CV 新提交 57%

RAPID: A Reproducible Multi-Agent Pipeline for Interpretable Disaster Damage Assessment from Satellite and Street-View Imagery

RAPID:一种可复现的多智能体管道,用于从卫星和街景图像中进行可解释的灾害损害评估

Yifan Yang, Wenjing Gong, Kaili Zhang, Lei Zou, Zhengzhong Tu, Hao Li, Zongrong Li, Xinyue Ye

机构 * National University of Singapore(新加坡国立大学) The University of Alabama(阿拉巴马大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出RAPID,一种可复现的多智能体管道,无需任务特定微调即可实现零样本灾害损害评估,通过跨视图理解、图像恢复和结构化识别生成可解释的评估报告,在多种灾害中达到0.92的分类准确率。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21474 2026-06-23 cs.AI 新提交 57%

Towards Transparent Mental Health Insights: An Explainable AI Model for Career-Related Depression and Anxiety Among University Students Using Structured Data

迈向透明的心理健康洞察:基于结构化数据的可解释AI模型用于大学生职业相关抑郁与焦虑

Arsham Azam, Rasikh Ali, Tayyaba Farhat, Sheeraz Akram

机构 * Faculty of Computer Science and Information Technology, The Superior University(信息科技学院,超凡大学) Intelligent Data Visual Computing Research (IDVCR)(智能数据可视化计算研究组)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 提出一种结合多模态数据和联邦学习的可解释AI框架,在隐私保护下识别大学生职业相关心理问题早期指标,模型F1达89.12%,并识别出回避直视等关键行为标记。

Comments Accepted at AHTBE 2025 Conference, published in Medical Sciences Forum (MDPI). 18 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21066 2026-06-23 cs.CL 新提交 57%

Demographic Metadata as Construct-Irrelevant Noise in DistilBERT-Based Automated Essay Scoring

人口统计元数据作为基于DistilBERT的自动作文评分中的构念无关噪声

Teik Peng Ch'ng, Hui Na Chua

机构 * Sunway University(Sunway大学) Faculty of Engineering and Technology(工程与技术学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 研究通过ASAP 2.0数据集,发现将人口统计元数据与文本简单拼接会显著降低DistilBERT评分模型的预测准确性和公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏