arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3389 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3389 篇

2512.12177 2026-05-13 cs.AI 57%

Floorplan2Guide: LLM-Guided Floorplan Parsing for BLV Indoor Navigation

Floorplan2Guide: 基于LLM的BLV室内导航floorplan解析

Aydin Ayanzadeh, Tim Oates

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出利用基础模型将floor plan转化为可导航的知识图谱,并生成可读的导航指令,通过LLM提取空间信息,提升BLV用户室内导航的精度与安全性。

Comments Accepted for publication in the proceedings of the IEEE International Conference on Big Data (IEEE BigData 2025)

Journal ref IEEE International Conference on Big Data (IEEE BigData 2025), pp. 7477-7485

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16070 2026-05-13 cs.CL 57%

Less Redundancy: Boosting Practicality of Vision Language Model in Walking Assistants

减少冗余:提升视觉语言模型在行走助手中的实用性

Chongyang Li, Zhiqiang Yuan, Hanbo Bi, Zexi Jia, Jinchao Zhang

机构 * Pattern Recognition Center, WeChat AI, Tencent Inc(腾讯人工智能研究院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出WalkVLM-LR模型,通过优化输出和时间冗余,提升视觉语言模型在行走助手中的实用性,实验表明其在输出简洁性和时间冗余方面表现优异。

Comments ICASSP 2026 Best Industry Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10817 2026-05-12 cs.AI 57%

CLEF: EEG Foundation Model for Learning Clinical Semantics

CLEF:用于学习临床语义的EEG基础模型

Peng Cao, Ali Mirzazadeh, Jong Woo Lee, Aleksandar Videnovic, Dina Katabi

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Brigham and Women’s Hospital, Harvard Medical School(哈佛医学院布里奇沃特医院) Massachusetts General Hospital, Harvard Medical School(哈佛医学院麻省总医院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出CLEF,一种基于临床场景的长上下文EEG基础模型,通过对比学习将EEG会话与神经科报告和结构化电子健康记录对齐,提升了EEG解读的临床相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10407 2026-05-12 cs.LG 57%

Identified-Set Geometry of Distributional Model Extraction under Top-$K$ Censored API Access

分布模型提取的识别集几何:在Top-K被剪裁API访问下的研究

Wenhua Nie, ZiCheng Zhu, Jianan Wu, Binhan Luo, Haoran Zheng, Jyh-Shing Roger Jang

机构 * National Taiwan University(国立台湾大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 本文研究了在Top-K被剪裁API访问下分布恢复的限制,提出了识别集的总变差直径公式,并通过实验展示了不同提取方法在任务性能上的层次结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09993 2026-05-12 cs.LG 57%

Learning Graph Foundation Models on Riemannian Graph-of-Graphs

在黎曼图-图上学习图基础模型

Haokun Liu, Zezhong Ding, Xike Xie

机构 * School of Biomedical Engineering, University of Science and Technology of China (USTC), Suzhou, Jiangsu, China(生物医学工程学院,中国科学技术大学(USTC),苏州,江苏,中国) Data Darkness Lab, Suzhou Institute for Advanced Research, USTC, Suzhou, Jiangsu, China(Data Darkness实验室,苏州市先进研究院,USTC,苏州,江苏,中国) School of Artificial Intelligence and Data Science, USTC, Hefei, Anhui, China(人工智能与数据科学学院,USTC,合肥,安徽,中国)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出R-GFM,一种基于黎曼图-图的图基础模型,通过多尺度图-图结构建模,提升结构域泛化性能,在多个数据集上取得最佳表现,下游任务相对提升达49%。

Comments This paper has been accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09679 2026-05-12 cs.CV cs.AI 57%

DeepTumorVQA: A Hierarchical 3D CT Benchmark for Stage-Wise Evaluation of Medical VLMs and Tool-Augmented Agents

DeepTumorVQA: 一种分层的3D CT基准,用于分阶段评估医学视觉语言模型和工具增强代理

Yixiong Chen, Wenjie Xiao, Pedro R. A. S. Bassi, Boyan Wang, Liang He, Xinze Zhou, Sezgin Er, Ibrahim Ethem Hamamci, Zongwei Zhou, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Bologna(博洛尼亚大学) Istanbul Medipol University(伊斯坦布尔梅迪波尔大学) Center for Biomolecular Nanotechnologies, Istituto Italiano di Tecnologia(生物分子纳米技术中心,意大利技术研究院) The First Affiliated Hospital, Sun Yat-Sen University(中山大学第一附属医院) Tongji University(同济大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 DeepTumorVQA通过分阶段证据链分解3D CT推理为四个阶段,提供工具交互环境,揭示医疗VLMs的瓶颈并展示工具增强的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05045 2026-05-12 cs.CV cs.CL 57%

When Relations Break: Analyzing Relation Hallucination in Vision-Language Model Under Rotation and Noise

关系破裂:在旋转和噪声下的视觉语言模型关系幻觉分析

Philip Wootaek Shin, Ajay Narayanan Sridhar, Sivani Devarapalli, Rui Zhang, Jack Sampson, Vijaykrishnan Narayanan

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 研究探讨了旋转和噪声对视觉语言模型关系推理的影响,发现轻微扰动显著降低模型性能,提示需更鲁棒的几何感知模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08816 2026-05-12 cs.AI cs.CY 57%

Mirror, Mirror on the Wall: Can VLM Agents Tell Who They Are at All?

镜中镜:视觉语言模型代理是否真的能辨认自己?

Filippo Ziliotto, Ciro Beneduce, Bruno Lepri, Luciano Serafini, Massimiliano Luca, Tommaso Campari

机构 * University of Padova(帕多瓦大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) University of Trento(特伦托大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨视觉语言模型是否能通过镜像识别自身,通过设计3D基准测试评估其自我识别能力,发现更强的模型能利用镜像信息进行行动,而较弱的模型则无法正确提取自身相关信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05593 2026-05-08 cs.AI 57%

Causal Probing for Internal Visual Representations in Multimodal Large Language Models

多模态大语言模型内部视觉表征的因果探测

Zehao Deng, Tianjie Ju, Zheng Wu, Liangbo He, Jun Lan, Huijia Zhu, Weiqiang Wang, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Ant Group(蚂蚁集团)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 研究通过激活引导框架系统干预四个视觉概念类别,揭示实体记忆局部化与抽象概念全局分布的差异,发现模型深度对复杂抽象概念编码至关重要,且反向引导揭示感知与生成之间的补偿机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03989 2026-05-08 cs.AI 57%

An Agent-Oriented Pluggable Experience-RAG Skill for Experience-Driven Retrieval Strategy Orchestration

面向经验的可插拔经验型RAG技能:用于经验驱动的检索策略编排

Dutao Zhang, Tian Liao

机构 * Macao Polytechnic University(澳门理工学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出经验型RAG技能,通过分析场景和经验记忆选择合适检索策略,提升多任务检索效果,实测在多个数据集上优于固定检索基线。

Comments Preprint. 6 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05081 2026-05-05 cs.AI 57%

MedGemma 1.5 Technical Report

MedGemma 1.5 技术报告

Andrew Sellergren, Chufan Gao, Fereshteh Mahvar, Timo Kohlberger, Fayaz Jamil, Madeleine Traverse, Alberto Tono, Bashir Sadjad, Lin Yang, Charles Lau, Liron Yatziv, Tiffany Chen, Bram Sterling, Kenneth Philbrick, Richa Tiwari, Yun Liu, Madhuram Jajoo, Chandrashekar Sankarapu, Swapnil Vispute, Harshad Purandare, Abhishek Bijay Mishra, Sam Schmidgall, Tao Tu, Anil Palepu, Chunjong Park, Tim Strother, Rahul Thapa, Yong Cheng, Preeti Singh, Kat Black, Yossi Matias, Katherine Chou, Avinatan Hassidim, Kavi Goel, Joelle Barral, Tris Warkentin, Shravya Shetty, Dale Webster, Sunny Virmani, David F. Steiner, Can Kirmizibayrak, Daniel Golden

机构 * Google Research and Google DeepMind(谷歌研究与谷歌深Mind)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 MedGemma 1.5 增强了医学影像处理、解剖定位和多时间点胸部X光分析能力,显著提升了3D MRI和CT分类精度,并在病理图像和临床知识推理中取得突破性进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18900 2026-05-04 physics.chem-ph cond-mat.mtrl-sci cs.LG 57%

Foundation Models for Discovery and Exploration in Chemical Space

化学空间发现与探索中的基础模型

Alexius Wadell, Anoushka Bhutani, Victor Azumah, Austin R. Ellis-Mohr, Andrew J. Stier, Kareem Hegazy, Alexander Brace, Hancheng Zhao, Celia Kelly, Anuj K. Nayak, Yuhan Chen, Dimitrios Simatos, Hongyi Lin, Murali Emani, Venkatram Vishwanath, Kevin Gering, Melisa Alkan, Tom Gibbs, Jack Wells, Wesley W. Qian, Richard C. Gerkin, Benjamin Amorelli, Alexander B. Wiltschko, Lav R. Varshney, Bharath Ramsundar, Karthik Duraisamy, Michael W. Mahoney, Arvind Ramanathan, Venkatasubramanian Viswanathan

机构 * Department of Mechanical Engineering, University of Michigan(密歇根大学机械工程系) Department of Chemical Engineering, University of Michigan(密歇根大学化学工程系) Department of Electrical and Computer Engineering, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校电子与计算机工程系) The Santa Fe Institute(圣菲研究所) International Computer Science Institute(国际计算机科学研究所) Department of Statistics, University of California, Berkeley(加州大学伯克利分校统计学系) Department of Computer Science, University of Chicago(芝加哥大学计算机科学系) Argonne National Laboratory(阿贡国家实验室) Idaho National Laboratory(爱达荷国家实验室) NVIDIA Corporation(英伟达公司) Osmo Labs, PBC AI Innovation Institute, Stony Brook University(石溪大学AI创新研究所) Brookhaven National Laboratory(布鲁赫斯研究所) Deep Forest Sciences, Palo Alto, CA(帕洛阿尔托的Deep Forest Sciences) Department of Aerospace Engineering, University of Michigan(密歇根大学航空航天工程系) Lawrence Berkeley National Laboratory(伯克利劳伦斯国家实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出MIST模型,通过大规模无标签数据训练,实现对化学空间中多种分子性质的预测,展示了其在多目标电解质溶剂筛选和立体化学推理中的应用,以及在超参数感知贝叶斯神经缩放定律下的高效训练能力。

Comments Main manuscript: 30 pages (including references), 7 tables and 5 figures. Supplementary information: 158 pages (including references), 15 tables and 128 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26488 2026-04-30 cs.CV cs.LG 57%

Featurising Pixels from Dynamic 3D Scenes with Linear In-Context Learners

从动态3D场景中提取像素特征的线性上下文学习器

Nikita Araslanov, Martin Sundermeyer, Hidenobu Matsuki, David Joseph Tan, Federico Tombari

机构 * Google(谷歌) TU Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出LILA框架,通过线性上下文学习从视频中提取精确像素特征,解决动态场景中像素级表示问题,应用于视频目标分割、表面法线估计和语义分割等任务。

Comments To appear at CVPR 2026 (oral). Project website: https://lila-pixels.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25526 2026-04-29 cs.SE cs.AI 57%

AI as Consumer and Participant: A Co-Design Agenda for MBSE Substrates and Methodology

AI作为消费者和参与者:MBSE子系统与方法论的协同设计议程

Siyuan Ji

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了AI在MBSE模型中的应用问题,指出现有模型未为AI消费设计,提出需协同设计模型与方法论,使其成为可查询的知识子系统,而非仅为人导航的结构化 artifacts。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22875 2026-04-29 cs.CV cs.AI 57%

SketchVLM: Vision language models can annotate images to explain thoughts and guide users

SketchVLM:视觉语言模型可以注释图像以解释思路并引导用户

Brandon Collins, Logan Bolton, Hung Huy Nguyen, Mohammad Reza Taesiri, Trung Bui, Anh Totti Nguyen

机构 * Auburn University(阿伯拉罕大学) Adobe Research(Adobe研究)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 SketchVLM通过生成可编辑的SVG叠加图提升视觉推理和绘图任务的准确性与注释质量,实现高达28.5%的精度提升和1.48倍的注释质量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00376 2026-04-29 cs.AI 57%

NeuroHex: A Brain-Inspired Hex Coordinate System to Enable Highly Computationally-Efficient World Models for Continuous Online-Adaptive Learning

NeuroHex:一种脑启发的六边形坐标系统,用于构建高效计算的世界模型以支持连续在线自适应学习

Quinn Jacobson, Joe Luo, Jingfei Xu, Shanmuga Venkatachalam, Kevin Wang, Dingchao Rong, John Paul Shen

机构 * NeuroAI Computer Architecture Lab (NCAL)(神经人工智能计算机架构实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 NeuroHex通过六边形坐标系统实现高效世界模型,利用环索引和量化角编码等方法,降低计算成本并支持空间匹配,同时提供OSM2Hex工具将地图数据转换为该坐标系统,提升自主系统空间推理效率。

Comments This is an expanded version of the paper titled "NeuroHex: Highly Efficient Hex Coordinate System for Creating World Models to Enable Adaptive AI" published in the proceedings of the 2026 Neuro Inspired Computational Elements (NICE) [1] conference. This is an archival version of the paper and is currently under review for an ACM journal publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03269 2026-04-28 cs.CV cs.LG 57%

LoGeR: Long-Context Geometric Reconstruction with Hybrid Memory

LoGeR:长上下文几何重建与混合记忆

Junyi Zhang, Charles Herrmann, Junhwa Hur, Chen Sun, Ming-Hsuan Yang, Forrester Cole, Trevor Darrell, Deqing Sun

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 LoGeR通过混合记忆模块实现长序列的高精度3D重建,无需后优化,有效解决长视频中的上下文一致性问题,优于现有方法。

Comments Project page: https://LoGeR-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17411 2026-04-28 cs.RO cs.LG 57%

SPEAR-1: Scaling Beyond Robot Demonstrations via 3D Understanding

SPEAR-1:通过3D理解超越机器人演示

Nikolay Nikolov, Giuliano Albanese, Sombit Dey, Aleksandar Yanev, Luc Van Gool, Jan-Nico Zaech, Danda Pani Paudel

机构 * INSAIT

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出SPEAR-1,通过融合3D感知与语言指导的具身控制,提升机器人基础模型的泛化能力,使用20倍少的机器人演示数据在24个Open X-Embodiment数据集上训练,超越现有最佳模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04733 2026-04-28 cs.CV cs.AI 57%

Discovering Failure Modes in Vision-Language Models using RL

通过强化学习发现视觉-语言模型的失败模式

Kanishk Jain, Qian Yang, Shravan Nayak, Parisa Kordjamshidi, Nishanth Anand, Aishwarya Agrawal

机构 * Mila – Québec AI Institute(魁北克AI研究所) Université de Montréal(蒙特利尔大学) Michigan State University(密歇根州立大学) McGill University(麦吉尔大学) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于强化学习的框架,自动发现视觉-语言模型在特定数据分布上的失败模式,通过生成问题来识别模型在细粒度视觉细节和技能组合上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00813 2026-04-27 cs.CV cs.AI cs.RO 57%

DVGT-2: Vision-Geometry-Action Model for Autonomous Driving at Scale

DVGT-2:面向大规模自动驾驶的视觉-几何-动作模型

Sicheng Zuo, Zixun Xie, Wenzhao Zheng, Shaoqing Xu, Fang Li, Hanbing Li, Long Chen, Zhi-Xin Yang, Jiwen Lu

机构 * Tsinghua University(清华大学) Xiaomi EV(小米电动车) University of Macau(澳门大学) Peking University(北京大学)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

AI总结 本文提出VGA范式,通过密集3D几何信息提升自动驾驶决策,引入DVGT-2实现在线处理,结合时间因果注意力和滑动窗口策略,提升效率与重建性能。

Comments Code is available at https://github.com/wzzheng/DVGT

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21523 2026-04-24 cs.CV cs.CL 57%

Seeing Isn't Believing: Uncovering Blind Spots in Evaluator Vision-Language Models

看到并不等于相信:揭示评估者视觉-语言模型的盲区

Mohammed Safi Ur Rahman Khan, Sanjay Suryanarayanan, Tushar Anand, Mitesh M. Khapra

机构 * Nilekani Centre at AI4Bharat(AI4Bharat的Nilekani中心) Indian Institute of Technology Madras(印度理工学院马德拉斯分校) BITS Pilani, Hyderabad(海得拉巴 BITS学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 本文系统评估了评估者视觉-语言模型在I2T和T2I任务中的可靠性,通过引入针对性扰动测试其在对象幻觉、空间推理等关键错误维度上的检测能力,发现当前模型存在显著盲区。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20981 2026-04-24 q-bio.QM cs.CV cs.LG 57%

PanGuide3D: Cohort-Robust Pancreas Tumor Segmentation via Probabilistic Pancreas Conditioning and a Transformer Bottleneck

PanGuide3D:通过概率胰腺条件和一个Transformer瓶颈实现队列鲁棒的胰腺肿瘤分割

Sunny Joy Ma, Xiang Ma

机构 * Trailridge School(Trailridge学校) Department of Biochemistry, Grand View University(生物化学系,Grand View大学) Department of Computer Science, Iowa State University(计算机科学系,Iowa State大学)

专题命中 视觉空间推理 :planning(abstract);分类 cs.LG

AI总结 本文提出PanGuide3D,通过概率胰腺条件和Transformer瓶颈提升跨队列鲁棒性,实现高效且实用的3D CT肿瘤分割,尤其在小肿瘤和复杂解剖位置表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20304 2026-04-23 cond-mat.mtrl-sci cs.AI 57%

LLM-guided phase diagram construction through high-throughput experimentation

通过高通量实验构建LLM引导的相图

Ryo Tamura, Haruhiko Morito, Yuna Oikawa, Guillaume Deffrennes, Shoichi Matsuda, Naruki Yoshikawa, Tomoaki Takayama, Taichi Abe, Koji Tsuda, Kei Terayama

机构 * Center for Basic Research on Materials(材料基础研究中心) National Institute for Materials Science(国家材料科学研究所) Graduate School of Frontier Sciences(前沿科学研究生院) The University of Tokyo(东京大学) RIKEN Center for Advanced Intelligence Project(RIKEN高级智能项目中心) Core Facility Center(核心设施中心) Tohoku University(东北大学) Univ. Grenoble Alpes(格勒诺布尔阿尔卑斯大学) CNRS(法国国家科学研究中心) Grenoble INP(格勒诺布尔INP) SIMaP Center for Green Research on Energy and Environmental Materials(能源与环境材料绿色研究中心) Nara Institute of Science and Technology(奈良科学技术大学) Research Center for Structural Materials(结构材料研究中心) Graduate School of Medical Life Science(医学生命科学研究生院) Tokyo Institute of Technology(东京技术大学)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

AI总结 本文研究LLM在构建多组分合金相图中的应用,通过高通量实验和X射线衍射分析,展示了LLM在实验规划中的互补优势,验证了其在相图构建中的潜力。

Comments 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09591 2026-04-23 cs.CV cs.AI 57%

Variational Visual Question Answering for Uncertainty-Aware Selective Prediction

变分视觉问答用于不确定性感知的选择性预测

Tobias Jan Wieczorek, Nathalie Daun, Mohammad Emtiyaz Khan, Marcus Rohrbach

机构 * TU Darmstadt(图宾根大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出变分VQA方法,通过变分贝叶斯方法提升视觉问答和视觉推理任务的可靠性,尤其在低误差容忍度下表现优异,且优于AdamW训练模型。

Comments TMLR April 2026 version. 13 pages main paper, 31 pages with appendix. Updated bibliography

Journal ref Transactions on Machine Learning Research (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20409 2026-04-22 cs.CV cs.LG 57%

CLIPoint3D: Language-Grounded Few-Shot Unsupervised 3D Point Cloud Domain Adaptation

CLIPoint3D: 基于语言的少样本无监督3D点云领域适应

Mainak Singha, Sarthak Mehrotra, Paolo Casari, Subhasis Chaudhuri, Elisa Ricci, Biplab Banerjee

机构 * University of Trento(特伦托大学) MDSR Labs Adobe(Adobe MDSR实验室) IIT Bombay(印度理工学院班加罗尔分校) Fondazione Bruno Kessler(布鲁诺·科斯勒基金会)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出CLIPoint3D,首个基于CLIP的3D点云无监督领域适应框架,通过知识驱动的提示调优和熵引导视图采样策略,实现跨领域3D点云适应,实验表明在PointDA-10和GraspNetPC-10基准上性能提升3-16%。

Comments Accepted in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19145 2026-04-22 cs.CV cs.AI 57%

ST-Prune: Training-Free Spatio-Temporal Token Pruning for Vision-Language Models in Autonomous Driving

ST-Prune:面向自动驾驶的视觉-语言模型中无训练的时空令牌修剪

Lin Sha, Haiyun Guo, Tao Wang, Cong Zhang, Min Huang, Jinqiao Wang, Qinghai Miao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Carizon Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

AI总结 针对自动驾驶中多视角相机和多帧视频输入的计算开销问题,ST-Prune提出无训练的时空令牌修剪框架,通过MTP和RSP模块有效压缩时空冗余,实现90%令牌减少下的近无损性能。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19052 2026-04-22 cs.CL 57%

Cell-Based Representation of Relational Binding in Language Models

基于细胞的语言模型中关系绑定的表示

Qin Dai, Benjamin Heinzerling, Kentaro Inui

机构 * Tohoku University(东大大学) RIKEN(日本科学技術研究所) AIP(Advanced Institute for Prognostic Studies) MBZUAI(马克斯·普朗克研究所)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 研究揭示语言模型通过细胞绑定表示进行关系绑定,通过多句子数据验证了细胞子空间的可解码性及跨上下文迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15804 2026-04-22 cs.CL eess.AS 57%

Qwen3.5-Omni Technical Report

Qwen3.5-Omni 技术报告

Qwen Team

机构 * Qwen Team(通义实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 Qwen3.5-Omni在多模态能力上取得突破,支持256k上下文长度和多语言理解,通过混合注意力MoE架构实现高效推理,并引入ARIA提升语音合成稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20279 2026-04-22 cs.CV cs.CL 57%

VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction

VLM-3R:融合指令对齐3D重建的视觉-语言模型

Zhiwen Fan, Jian Zhang, Renjie Li, Junge Zhang, Runjin Chen, Hezhen Hu, Kevin Wang, Huaizhi Qu, Shijie Zhou, Dilin Wang, Zhicheng Yan, Hongyu Xu, Justin Theiss, Tianlong Chen, Jiachen Li, Zhengzhong Tu, Zhangyang Wang, Rakesh Ranjan

机构 * UT Austin(德克萨斯大学奥斯汀分校) XMU(厦门大学) TAMU(德克萨斯大学阿灵顿分校) UCR(加州大学河滨分校) UNC(北卡罗来纳大学教堂山分校) Meta UCLA(加州大学洛杉矶分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出VLM-3R,通过融合3D重建指令微调,实现单目视频的3D空间辅助与具身推理,提升了视觉-空间推理和时间3D上下文理解的准确性和可扩展性。

Comments Project Page: https://vlm-3r.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17846 2026-04-21 cs.CV cs.AI 57%

AI Approach for MRI-only Full-Spine Vertebral Segmentation and 3D Reconstruction in Paediatric Scoliosis

基于AI的MRI-only全脊柱椎体分割及3D重建在儿童脊柱侧弯中的应用

Nathasha Naranpanawa, Maree T. Izatt, Robert D. Labrom, Geoffrey N. Askin, J. Paige Little

机构 * Biomechanics and Spine Research Group, School of Mechanical, Medical, and Process Engineering, Faculty of Engineering, Queensland University of Technology(生物力学与脊柱研究组,机械、医学与过程工程学院,工程学院,昆士兰理工大学) Centre for Biomedical Technologies, School of Mechanical, Medical and Process Engineering, Faculty of Engineering, Queensland University of Technology(生物医学技术中心,机械、医学与过程工程学院,工程学院,昆士兰理工大学) Orthopaedics Department, Queensland Children’s Hospital(骨科部门,昆士兰儿童医院)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

AI总结 本文提出一种AI框架,通过GAN将低剂量CT转换为MRI图像,结合已有MRI数据训练U-Net模型,实现全脊柱3D重建,提升分割精度并缩短处理时间,支持无辐射的脊柱侧弯评估。

Comments Presented at 2026 Spine Society of Australia 37th Annual Scientific Meeting

详情

展开后加载摘要…

URL PDF HTML 收藏