AudioScene: Integrating Object-Event Audio into 3D Scenes
AudioScene: 将对象事件音频整合到3D场景中
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出AudioScene数据集,通过整合音频事件与3D场景,探索音频条件任务,提升空间学习的准确性与多样性。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
AudioScene: 将对象事件音频整合到3D场景中
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出AudioScene数据集,通过整合音频事件与3D场景,探索音频条件任务,提升空间学习的准确性与多样性。
迈向准确的无人机图像感知:通过更强的任务提示引导视觉-语言模型
机构 * School of Geosciences and InfoPhysics, Central South University(地质科学与信息物理学院,中南大学)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 AerialVP通过增强任务提示提升无人机图像感知性能,引入AerialSense基准评估模型在复杂场景下的表现。
SAT:多模态语言模型的动态空间能力训练
机构 * Boston University(波士顿大学) ; University of Washington(华盛顿大学) ; Allen Institute for AI(人工智能研究院) ; Microsoft Research(微软研究院) ; New York University(纽约大学)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 SAT通过模拟数据提升多模态语言模型在动态空间推理中的能力,实验表明其在多个基准测试中优于现有方法。
Comments Accepted to COLM 2025. Project webpage: https://arijitray.com/SAT/
SIMA 2: 一种通用的具身代理用于虚拟世界
机构 * Google DeepMind(谷歌DeepMind)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 SIMA 2是一种基于Gemini模型的通用具身代理,能够理解和行动于多种3D虚拟世界,具备自我改进能力,显著提升了与人类表现的接近程度。
当有害内容被伪装时:通过CamHarmTI揭示LVLMs的感知失败
机构 * Zhejiang University(浙江大学)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出CamHarmTI基准,揭示LVLMs在识别伪装有害内容时的感知不足,并通过微调提升模型性能。
在任何地方、任何时间描述任何事物
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 DAAAM是一种用于大规模实时4D场景理解的空间时间记忆框架,通过优化前端和分层4D场景图实现高效语义描述与实时性能的平衡。
Comments 14 pages, 5 figures, 6 tables
用于电力系统安全的大型语言模型:一种用于能源管理系统异常检测的新型多模态方法
机构 * Department of Electrical and Computer Engineering, University of Michigan -- Dearborn, MI, 48128 USA.(电气与计算机工程系,密歇根大学迪尔伯恩分校) ; Department of Electrical Sustainable Energy, Technische Universiteit Delft, 2628 CD Delft, Netherlands.(可持续能源系,代尔夫特理工大学) ; Bradley Department of Electrical and Computer Engineering, Virginia Polytechnic Institute and State University, Blacksburg, VA 24061, USA.(布雷德利电气与计算机工程系,弗吉尼亚理工学院和州立大学) ; Smart Grid Research Division System Reliability Research Team, Korea Electrotechnology Research Institute (KERI), Gwangju-si, 61751, South Korea.(智能电网研究分会系统可靠性研究团队,韩国电力技术研究所(KERI))
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出了一种基于大型语言模型的多模态方法,用于电力系统中能源管理系统的安全防护和异常检测。
Comments 10 Figures; 6 Tables; Accepted, IEEE ACCESS 2025
词语进入世界:一种任务自适应代理用于增强现实中的语言引导空间检索
机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出一种任务自适应AR代理,结合多模态大语言模型和视觉模型,实现语言引导的空间检索,支持复杂查询和真实世界交互。
通过视觉-语言导航提升人机协作的综述
机构 * Birla Institute of Technology and Science (BITS)(比拉理工学院和科学学院) ; Macquarie University(麦考瑞大学)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 本文综述了视觉-语言导航在提升人机协作中的最新进展,探讨了多机器人协作中的关键挑战,并提出通过先进NLU技术实现主动澄清和动态角色分配的未来方向。
剪枝后再规划:用于具身问答中稳定前沿探索的分步校准
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 Prune-Then-Plan通过分步校准稳定具身问答中的前沿探索,提升导航效率和回答质量。
Comments webpage: https://noahfrahm.github.io/Prune-Then-Plan-project-page/
Spatial-SSRL: 通过自监督强化学习增强空间理解
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; The Chinese University of Hong Kong(香港中文大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 Spatial-SSRL通过自监督强化学习提升大视觉-语言模型的空间理解能力,无需人工标注,在多个基准测试中取得显著准确率提升。
Comments preprint
世界模型几何对基于好奇心的探索的影响
机构 * LCQB Sorbonne Université & OURAGAN team, Inria Paris(LCQB 索邦大学及 OURAGAN 团队,巴黎研究所) ; CIAMS, Université Paris-Saclay, Orsay & Université d’Orléans(CIAMS,巴黎-萨克雷大学,欧塞比及奥尔良大学) ; Dipartimento di Psicologia, Università Milano-Bicocca(心理学系,米兰-比科卡大学) ; CISA, University of Geneva(日内瓦大学 CISA)
专题命中 视觉空间推理 :planning(abstract);分类 cs.AI
AI总结 本文研究了世界模型几何结构对智能体好奇心驱动探索行为的影响,通过比较投影群与欧几里得群在知识价值和探索行为中的作用,揭示了几何结构在空间意识中的关键作用。
Journal ref Biol Cybern 119, 4 (2025)
NeuroVascU-Net:一种统一的多尺度和跨域自适应特征融合U-Net,用于精确的对比增强T1 MRI脑血管三维分割
机构 * School of Electrical and Computer Engineering, College of Engineering, University of Tehran(电信工程学院,工程学院,德黑兰大学) ; Department of EECS, Lassonde School of Engineering, York University(电子工程系,拉索nde工程学院,约克大学) ; Department of Neurosurgery, School of Medicine, Iran University of Medical Sciences(神经外科系,医学院,伊朗医学科学大学) ; Department of Electrical and Computer Engineering, University of Waterloo(电子工程系,滑铁库大学)
专题命中 视觉空间推理 :planning(abstract);分类 cs.LG
AI总结 NeuroVascU-Net通过多尺度和跨域自适应特征融合模块,实现高精度脑血管分割,适用于临床标准T1CE MRI,提升神经外科手术规划的准确性与效率。
CubeletWorld: 一种可扩展3D建模的新抽象
机构 * L3S Research Center(L3S研究所以) ; Leibniz University Hannover(汉诺威莱布尼茨大学) ; University of Tennessee at Chattanooga(田纳西大学查塔努加分校) ; PLRI Medical Informatics Institute(医学信息学研究所) ; Hannover Medical School(汉诺威医学院)
专题命中 视觉空间推理 :planning(abstract);分类 cs.LG
AI总结 CubeletWorld通过离散3D网格空间单元实现可扩展的城市建模,提升隐私保护和跨区域通用性。
Comments 10 pages, 5 figures
通过3D生成AI和视觉语言模型实现多组件物体的文本到机器人组装
机构 * Massachusetts Institute of Technology (MIT)(麻省理工学院) ; MIT(麻省理工学院) ; Google DeepMind(谷歌DeepMind) ; Google, Paradigms of Intelligence(谷歌、范式智能) ; Autodesk Research(Autodesk研究) ; MIT Mechanical Engineering(麻省理工学院机械工程系) ; MIT Architecture(麻省理工学院建筑系) ; MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出利用3D生成AI和视觉语言模型实现多组件物体的文本到机器人组装,通过多模态推理分解生成网格并优化组件分配。
Comments Accepted to NeurIPS 2025, Conference on Neural Information Processing Systems, Creative AI Track
WorldGen: 从文本到可遍历和交互的3D世界
机构 * Reality Labs, Meta(Meta现实实验室)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 WorldGen通过结合LLM、程序生成和扩散模型,实现从文本到可交互3D世界的自动创建,提升虚拟空间的生成效率与表现力。
CleverDistiller: 简单且空间一致的跨模态知识蒸馏
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 CleverDistiller通过简单有效的跨模态知识蒸馏方法,在自动驾驶任务中实现语义分割和3D目标检测的高性能表现。
Comments Accepted to BMVC 2025
用于手术场景分割的图神经网络
机构 * Medtronic Digital Technologies(梅奥医疗数字技术公司) ; UCL Hawkes Institute, University College London(伦敦大学学院霍克斯研究所)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出基于图神经网络的手术场景分割方法,结合视觉Transformer和图结构建模,提升分割精度与解剖一致性。
Comments 12 pages, 4 figures, 3 tables
机构 * University of Wuppertal(乌珀塔尔大学)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG
Comments Accepted in WACV 2026 Main Conference
机构 * Beijing Key Laboratory of Light Industrial Robot and Safety Verification, Capital Normal University(北京工业机器人与安全验证重点实验室,首都师范大学) ; Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; School of Software, Beihang University(北航软件学院)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
Comments 12 pages, 4 figures and 3 tables
机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) ; Hupan Lab(虎盘实验室) ; Zhejiang University(浙江大学)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
Comments The technical report of RynnEC, an embodied cognition MLLM
机构 * Ph.D. Student, Dept. of Civil Eng., University of Texas at Arlington. E-mail ; Assistant Professor, Dept. of Computer Sci. \& Eng., University of Texas at Arlington. E-mail ; Assistant Professor, Dept. of Civil Eng., University of Texas at Arlington. E-mail
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
机构 * Yale University(耶鲁大学) ; University of Edinburgh(爱丁堡大学)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG
机构 * University of Michigan(密歇根大学)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG
机构 * Oak Ridge National Laboratory(奥克勒斯国家实验室)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
机构 * School of Geospatial Engineering and Science, Sun Yat-sen University(地理空间工程与科学学院,中山大学) ; School of Geographical and Earth Sciences, University of Glasgow(地理与地球科学学院,格拉斯哥大学) ; School of Economics and Management, Shanxi University(经济学与管理学院,山西大学)
专题命中 视觉空间推理 :planning(abstract);分类 cs.LG
Comments 11 pages, 10 figures, The 8th ACM SIGSPATIAL International Workshop on AI for Geographic Knowledge Discovery (GeoAI '25), November 3--6, 2025, Minneapolis, MN, USA
机构 * ByteDance Seed(字节跳动种子) ; NTU(国立科技大学)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
机构 * Department of Electrical Engineering, University of Engineering & Technology, New Campus, Lahore, Pakistan(电子工程系,工程科技大学,新校区,拉合尔,巴基斯坦) ; Department of Electrical, Electronic, and Future Technologies, Sheffield Hallam University, Sheffield S1 1WB, UK(电子、电气与未来技术系,谢菲尔德哈姆大学,谢菲尔德 S1 1WB,英国)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI