SPARGen: Unifying Spatial Perception and Reasoning through Native Multimodal Generation
SPARGen:通过原生多模态生成统一空间感知与推理
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV
AI总结 SPARGen是统一多模态框架,将3D重建等空间任务转为指令条件生成任务,在单一框架内实现异构空间任务的竞争力性能,突破现有方法的知识迁移限制。
视觉与机器人
三维重建、NeRF、Gaussian Splatting、点云和空间智能。
SPARGen:通过原生多模态生成统一空间感知与推理
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV
AI总结 SPARGen是统一多模态框架,将3D重建等空间任务转为指令条件生成任务,在单一框架内实现异构空间任务的竞争力性能,突破现有方法的知识迁移限制。
HandsOnWorld: 无约束的自我中心视频生成,具有相机解耦的手部控制
机构 * Tsinghua University(清华大学) ; Kling Team, Kuaishou Technology(快手科技 Kling 团队) ; Chinese University of Hong Kong(香港中文大学)
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV
AI总结 提出HandsOnWorld框架,通过单目重建从无约束视频中学习手部控制,利用Plücker手部映射解耦相机与手部运动,生成高保真自我中心视频。
Comments Project Page: https://shad0wta9.github.io/handsonworld-page/
包含北部喷流“Jet”的蟹状星云三维运动学重建
专题命中 三维重建 :3D reconstruction(abstract)
AI总结 利用SITELLE光谱数据对蟹状星云进行三维运动学重建,确认了北部喷流底部空腔结构,揭示脉冲星风云在喷流形成中的关键作用,并讨论了多种形成机制。
Comments 23 pages, 15 figures, now published in ApJ. Animations available at https://doi.org/10.5281/zenodo.20822317 and https://www.youtube.com/watch?v=Pi7XSaW6ZPo
Journal ref The Astrophysical Journal, 1007, 130 (2026)
HiCo-GS:面向八叉树高斯溅射的分层上下文聚合与几何一致性
机构 * Northwestern Polytechnical University(西北工业大学)
专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);novel view synthesis(abstract);分类 cs.CV
AI总结 HiCo-GS是结合跨层级上下文聚合与深度-法向量几何一致性正则化的高保真重建框架,在多城市数据集上实现了最优渲染质量与清晰几何。
Comments 21 pages, including supplementary material. To appear in the Proceedings of the 34th ACM International Conference on Multimedia (MM '26)
利用高斯点云进行园艺环境的主动语义映射
机构 * the Siebel School of Computing and Data Science(塞比尔计算与数据科学学院) ; the Department of Agricultural and Biological Engineering(农业与生物工程系) ; National Center for Supercomputing Applications at University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校国家超级计算中心)
专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3D reconstruction(abstract);分类 cs.RO
AI总结 本文提出利用移动机械臂和高斯点云进行园艺环境主动3D重建,提升重建精度与效率,实现水果计数和体积估算。
Comments 23 pages, 12 figures
点云辅助的切线高斯溅射局部统计信道预测
机构 * China Telecom(中国电信)
专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);point cloud(abstract)
AI总结 提出点云辅助切线高斯溅射(PC-TGS)框架,通过融合稀疏无线电测量与密集LiDAR几何数据,将角功率谱外推到未测量网格,实现大规模无线数字孪生中的高效信道预测。
Journal ref IEEE Trans. Wireless Commun. 25, 17816-17830 (2026)
LatentAM:通过在线字典学习实现实时、大规模的潜在高斯注意力映射
机构 * Robotics Department, University of Michigan(密歇根大学机器人系)
专题命中 Gaussian Splatting :3DGS(abstract,abstract_cn);Gaussian Splatting(abstract);分类 cs.CV、cs.RO
AI总结 LatentAM通过在线字典学习实现实时、大规模的潜在高斯注意力映射,提升机器人感知的特征重建保真度与实时性
Comments 8 pages, 7 figures. Accepted for RA-L. Homepage: https://junwoonlee.github.io/projects/LatentAM/ Code: https://github.com/UMich-SSI-Lab/latentam
IRGNN:用于雷达点云目标检测的高效不变雷达图神经网络
机构 * China Agricultural University(中国农业大学) ; Tsinghua University(清华大学)
专题命中 点云 :point cloud(title,abstract);分类 cs.CV
AI总结 针对雷达点云稀疏无序、信息不足难以适配现有激光雷达方法的问题,提出IRGNN,通过不变特征设计、改进MPNN及任务头实现目标检测,在RadarScenes数据集上性能更优且推理效率更高。
Comments Accepted at ICONIP 2026
GhostPoint:通过幻觉生成被遮挡的激光雷达结构实现自监督表示学习
机构 * Bosch Center for AI(博世人工智能中心) ; University of Freiburg(弗莱堡大学) ; University of Luebeck(吕贝克大学)
专题命中 点云 :point cloud(abstract);分类 cs.CV
AI总结 GhostPoint是一种自监督学习框架,通过实例体素膨胀幻觉生成激光雷达被遮挡区域特征,在nuScenes和Waymo数据集上提升了下游3D检测性能,尤其适用于稀疏扫描和有限标签场景。
Comments Accepted by ECCV2026
FlatLab:面向扁平物体机器人操作的统一方法论框架及基于仿真的基准测试
机构 * Jilin University(吉林大学) ; Peking University(北京大学) ; Chinese Academy of Sciences(中国科学院) ; University of Birmingham(伯明翰大学)
专题命中 点云 :point cloud(abstract);分类 cs.RO
AI总结 该研究针对扁平物体机器人操作泛化能力有限的问题,提出含策略生成器与执行模块的统一框架,并构建FlatLab仿真基准,方法泛化效果优于现有基线。
Comments This paper is accepted to ICML 2026
语言模型能否理解毫米波数据?基于毫米波雷达的人类理解任务对大语言模型进行基准测试
机构 * DGIST(大邱庆北科学技术院) ; KAIST(韩国科学技术院) ; InnoCORE LLM
专题命中 点云 :point cloud(abstract)
AI总结 本研究针对毫米波数据与大语言模型融合的研究空白,构建首个毫米波人类感知基准mmWave-QA,评估LLMs在该任务上的零样本推理潜力与视觉退化下的鲁棒性,为相关研究奠定基础。
Comments Accepted to CVPR 2026 Findings
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026
用于帝国网络分析的双拓扑管道:持续同调、结构脆弱性与阿兹特克帝国的崩溃
专题命中 点云 :point cloud(abstract)
AI总结 本研究通过持续同调与双模型拓扑管道分析阿兹特克帝国多层网络,揭示其朝贡层结构脆弱性、特诺奇蒂特兰中心的关键作用、特拉斯卡拉区域的结构空洞,提出“空洞占据树”这一新帝国崩溃模式。
Comments 10 pages, 4 figures
Cloud-ScPO:面向大语言模型推理的半监督偏好优化的隐状态几何
专题命中 点云 :point cloud(abstract)
AI总结 本研究提出Cloud-ScPO框架,利用少量标注集构建参考云,结合拓扑引导的偏好挖掘与自一致性,在GSM8K等数据集上较ScPO提升LLM数学推理性能。
Comments 14 pages, 2 figures, 7 tables. Preprint
学习迁移:神经不变量的Kan扩展
机构 * Friedrich-Alexander Universität Erlangen-Nürnberg(埃尔朗根-纽伦堡大学)
专题命中 点云 :point cloud(abstract)
AI总结 提出用范畴论中的Kan扩展形式化迁移学习中的结构不变量,定义传递差异度量,并在链复形和持久模块中给出有限余核公式,通过瓶颈距离计算持久值不变量,实验验证了该方法能识别正确的任务函子并检测破坏迁移相关拓扑的表征坍塌。
Comments Proof details
ArGEnT:任意几何编码的Transformer用于运算符学习
机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室) ; Sandia National Laboratories(桑地亚国家实验室) ; Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)
专题命中 点云 :point cloud(abstract)
AI总结 本文提出ArGEnT,一种基于Transformer的几何感知架构,用于在任意域上学习运算符。通过整合DeepONet,ArGEnT在流体动力学、固体力学和电化学系统中实现了更准确的预测和泛化性能。
Comments 45 pages, 21 figures, 10 tables
从恢复到骤降:动作后训练如何降低视觉语言模型的深层解码能力
机构 * New York University(纽约大学) ; Reflex ; Université de Montréal(蒙特利尔大学) ; Maastricht University(马斯特里赫特大学)
专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV
AI总结 该研究探究动作后训练对VLM空间理解的影响,发现VLA存在深层解码能力的“基底”差距与“悬崖”骤降,定位其源于深层MLP干扰,消融该模块可恢复多数解码性能。
Comments Accepted to the archival proceedings track of the Embodied Multimodal Reasoning (EMR) Workshop at ECCV 2026
基于并行计算加速激光雷达建图的大规模光束平差法
机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) ; the University of Hong Kong(香港大学)
专题命中 SLAM与定位 :point cloud(abstract);分类 cs.CV、cs.RO
AI总结 该研究提出首个全并行计算框架,结合三项关键技术加速激光雷达建图的大规模光束平差法,经多平台公开数据集测试,效率最高提升10倍且精度相当,代码已开源。
Comments Accepted by IEEE International Conference on Automation Science and Engineering (CASE), 2026