arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3389 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3389 篇

2604.01371 2026-04-03 cs.CV cs.AI cs.RO eess.IV 57%

AffordTissue: Dense Affordance Prediction for Tool-Action Specific Tissue Interaction

AffordTissue: 密集的工具-动作特定组织交互 affordance 预测

Aiza Maksutova, Lalithkumar Seenivasan, Hao Ding, Jiru Xu, Chenhao Yu, Chenyan Jing, Yiqing Shen, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AffordTissue框架,通过多模态方法预测手术中工具-动作特定的组织affordance区域,改进了视觉语言模型在密集手术affordance预测中的表现,为安全手术自动化提供空间推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10853 2026-04-03 cs.AI cs.HC 57%

Advanced Assistance for Traffic Crash Analysis: An AI-Driven Multi-Agent Approach to Pre-Crash Reconstruction

交通碰撞分析的高级辅助:一种基于AI的多智能体方法用于碰撞前重建

Gerui Xu, Boyou Chen, Huizhong Guo, Dave LeBlanc, Arpan Kusari, Efe Yarbasi, Ananna Ahmed, Zhaonan Sun, Shan Bao

机构 * Industrial and Manufacturing Systems Engineering Department, University of Michigan-Dearborn(密歇根大学迪尔伯恩分校工业与制造系统工程系) University of Michigan Transportation Research Institute(密歇根大学交通研究所) Toyota Motor Engineering & Manufacturing North America, Inc.(丰田汽车工程与制造北美公司)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种基于AI的多智能体框架,通过多模态输入生成碰撞前场景重建,并结合事件数据记录器信号识别碰撞车辆,验证了该框架在碰撞前行为推断中的高准确率。

Comments 36 pages, 14 figures

Journal ref SAE International Journal of Transportation Safety, 14(1), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29777 2026-04-01 cs.CV cs.AI 57%

From Skeletons to Semantics: Design and Deployment of a Hybrid Edge-Based Action Detection System for Public Safety

从骨架到语义:一种混合边缘基于的动作检测系统在公共安全中的设计与部署

Ganen Sethupathy, Lalit Dumka, Jan Schagen

机构 * Sopra Steria Germany(Sopra Steria德国) Sopra Steria India(Sopra Steria印度)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种混合边缘动作检测系统,结合骨架运动分析与视觉语言模型,以提升公共安全中的实时视频分析能力,通过系统级对比展示两种方法在边缘计算中的互补性与局限性。

Comments Preprint version of a manuscript currently under review at IEEE Access

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16790 2026-04-01 cs.SE cs.AI 57%

InCoder-32B: Code Foundation Model for Industrial Scenarios

InCoder-32B:面向工业场景的代码基础模型

Jian Yang, Wei Zhang, Jiajun Wu, Junhang Cheng, Shawn Guo, Haowen Wang, Weicheng Gu, Yaxin Du, Joseph Li, Fanglin Xu, Yizhi Li, Lin Jing, Yuanbo Wang, Yuhan Gao, Ruihao Gong, Chuan Hao, Ran Tao, Aishan Liu, Tuney Zheng, Ganqu Cui, Zhoujun Li, Mingjie Tang, Chenghua Lin, Wayne Xin Zhao, Xianglong Liu, Ming Zhou, Bryan Dai, Weifeng Lv

机构 * Beihang University(北京航空航天大学) IQuest Research Shanghai Jiao Tong University(上海交通大学) ELLIS University of Manchester(曼彻斯特大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Langboat(朗博特)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出InCoder-32B,首个统一芯片设计、GPU内核优化等工业领域的32B参数代码基础模型,通过高效架构和多阶段训练方法,在通用和工业任务中均取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29405 2026-04-01 cs.CV cs.AI 57%

Hallucination-aware intermediate representation edit in large vision-language models

具有幻觉意识的中间表示编辑在大视觉-语言模型中

Wei Suo, Hanzu Zhang, Lijun Zhang, Ji Ma, Peng Wang, Yanning Zhang

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种动态检测和消除幻觉表示的框架,通过最小额外计算成本在现有基准上实现最先进的性能,展示了高效且稳健的幻觉消除能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03821 2026-03-31 cs.CV cs.AI 57%

Beyond Recognition: Evaluating Visual Perspective Taking in Vision Language Models

超越识别:评估视觉语言模型中的视觉视角理解

Gracjan Góral, Alicja Ziarko, Piotr Miłoś, Michał Nauman, Maciej Wołczyk, Michał Kosiński

机构 * University of Warsaw(华沙大学) Polish Academy of Sciences(波兰科学院) Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校) IDEAS NCBR Lute

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文通过144个视觉任务评估VLMs的视觉视角理解能力,发现模型在场景理解上表现优异,但在空间推理和视角理解上存在明显不足。

Comments Accepted at CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26690 2026-03-31 cs.RO cs.AI cs.CV 57%

SpatialPoint: Spatial-aware Point Prediction for Embodied Localization

SpatialPoint: 体感-aware 点预测用于具身定位

Qiming Zhu, Zhirui Fang, Tianming Zhang, Chuanxiu Liu, Xiaoke Jiang, Lei Zhang

机构 * Visincept Research(Visincept 研究院) Tsinghua University(清华大学) International Digital Economy Academy (IDEA)(国际数字经济学院(IDEA))

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出SpatialPoint框架,通过整合结构化深度信息提升具身定位性能,采用260万样本RGB-D数据集进行训练与评估,在真实机器人部署中验证了其在抓取、放置和导航任务中的有效性。

Comments 19 pages, 12 figures, supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26211 2026-03-30 cs.CV cs.AI 57%

Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding

迈向GUI代理:用于GUI定位的视觉-语言扩散模型

Shrinidhi Kumbhar, Haofu Liao, Srikar Appalaraju, Kunwar Yashraj Singh

机构 * Arizona State University(亚利桑那州立大学) AWS Agentic AI

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了离散扩散视觉-语言模型在GUI定位中的应用,通过混合掩码策略提升定位精度,并在多个数据集上验证了其有效性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25766 2026-03-30 cs.RO cs.AI 57%

ETA-VLA: Efficient Token Adaptation via Temporal Fusion and Intra-LLM Sparsification for Vision-Language-Action Models

ETA-VLA:通过时间融合和内在LLM稀疏化实现高效标记适应的视觉-语言-动作模型

Yiru Wang, Anqing Jiang, Shuo Wang, Yuwen Heng, Zichong Gu, Hao Sun

机构 * Bosch Corporate Research, Bosch (China) Investment Ltd.(博世企业研究,博世(中国)投资有限公司) School of Communication and Information Engineering, Shanghai University(上海大学通信与信息工程学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ETA-VLA框架,通过时间融合和内在LLM稀疏化技术,减少视觉-语言-动作模型的计算负担,实验表明在保持高精度的同时,显著降低计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24908 2026-03-27 cs.RO cs.AI cs.MA 57%

Integrated Multi-Drone Task Allocation, Sequencing, and Optimal Trajectory Generation in Obstacle-Rich 3D Environments

集成多无人机任务分配、任务序列和最优轨迹生成在障碍密集的3D环境中

Yunes Alqudsi, Murat Makaraci

机构 * Aerospace Engineering Department, Faculty of Aeronautics and Astronautics, Kocaeli University(科贾埃利大学航空与航天学院航空航天工程系) Interdisciplinary Research Center for Aviation and Space Exploration, KFUPM(法赫德国王石油矿产大学航空与空间探索跨学科研究中心) Mechanical Engineering Department, Faculty of Aeronautics and Astronautics, Kocaeli University(科贾埃利大学航空与航天学院机械工程系)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

AI总结 本文提出IMD-TAPP框架,通过结合离散任务规划和连续轨迹合成,解决多无人机在障碍密集环境中的任务分配、序列规划和安全轨迹生成问题,实现动态可行且无碰撞的高效路径。

Comments Resubmission following accepted appeal (MOD-78958). Resubmitting to cs.RO with cross-lists cs.MA and cs.AI as advised by arXiv Support

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23523 2026-03-26 cs.CL cs.RO 57%

Do 3D Large Language Models Really Understand 3D Spatial Relationships?

三维大语言模型真的能理解三维空间关系吗?

Xianzheng Ma, Tao Sun, Shuai Chen, Yash Bhalgat, Jindong Gu, Angel X Chang, Iro Armeni, Iro Laina, Songyou Peng, Victor Adrian Prisacariu

机构 * VGG(视觉信息组) University of Oxford(牛津大学) Stanford University(斯坦福大学) Simon Fraser University(西蒙弗雷泽大学) Google DeepMind(谷歌DeepMind)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 本文挑战了3D-LLM对三维空间关系的理解能力,提出Real-3DQA基准测试,发现现有模型在去除简单线索后表现不佳,并提出3D重加权训练目标以提升空间推理能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13925 2026-03-24 cs.CV cs.AI 57%

Segmenting Visuals With Querying Words: Language Anchors For Semi-Supervised Image Segmentation

通过查询词进行视觉分割:用于半监督图像分割的语言锚点

Numair Nadeem, Saeed Anwar, Muhammad Hamza Asad, Abdul Bais

机构 * University of Regina, Canada(里嘉大学) The University of Western Australia, Australia(西澳大学) University Canada West, Canada(加拿大西大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出HVLFormer,通过生成多尺度文本查询和引入跨视角一致性正则化,提升视觉与文本对齐,以实现更准确的半监督图像分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20308 2026-03-24 cs.MA cs.AI 57%

Reason-to-Transmit: Deliberative Adaptive Communication for Cooperative Perception

为协作感知设计的理性传输:具有适应性的 deliberative 通信

Aayam Bansal, Ishaan Gangwani

机构 * Synthetic Sciences(合成科学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出R2T框架,通过轻量级Transformer模块实现基于场景上下文和带宽预算的理性传输决策,提升多智能体协作感知性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21861 2026-03-24 cs.LG 57%

SpecMol: A Spectroscopy-Grounded Foundation Model for Multi-Task Molecular Learning

SpecMol:一种基于光谱的多任务分子学习基础模型

Shuaike Shen, Jiaqing Xie, Zhuo Yang, Antong Zhang, Shuzhou Sun, Ben Gao, Tianfan Fu, Biqing Qi, Yuqiang Li

机构 * Carnegie Mellon University(卡内基梅隆大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Brown University(布朗大学) Nanjing University(南京大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 SpecMol提出一种统一框架,整合光谱解释、分子表示学习和三维结构生成,通过SpecMol-Bench评估协议实现光谱驱动的结构解析和分子生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08157 2026-03-24 cs.RO cs.AI cs.MA 57%

Risk-Bounded Multi-Agent Visual Navigation via Iterative Risk Allocation

基于迭代风险分配的有界多智能体视觉导航

Viraj Parimi, Brian C. Williams

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

AI总结 本文提出风险有界多智能体路径规划框架,通过动态分配风险预算提升多智能体在高风险环境中的导航效率与安全性。

Comments Published at ICAPS '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18855 2026-03-20 cs.IT cs.LG cs.SY eess.SP eess.SY math.IT 57%

BeamAgent: LLM-Aided MIMO Beamforming with Decoupled Intent Parsing and Alternating Optimization for Joint Site Selection and Precoding

BeamAgent:基于解耦意图解析和交替优化的LLM辅助MIMO波束成形

Xiucheng Wang, Yue Zhang, Nan Cheng

机构 * State Key Laboratory of ISN and School of Telecommunications Engineering, Xidian University(信息与通信工程国家重点实验室和西安电子科技大学电信工程学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出BeamAgent框架,通过解耦语义意图解析与数值优化,结合交替优化算法解决基站选址与预编码设计问题,实现高效波束成形。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07632 2026-03-20 cs.CV cs.AI 57%

GeoMotionGPT: Geometry-Aligned Motion Understanding with Large Language Models

GeoMotionGPT:基于大语言模型的几何对齐运动理解

Zhankai Ye, Bofan Li, Yukai Jin, Shuoqiu Li, Wei Wang, Yanfu Zhang, Shangqian Gao, Xin Liu

机构 * Florida State University(佛罗里达州立大学) Texas Tech University(德克萨斯技术大学) William & Mary University(威廉与玛丽大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出GeoMotionGPT框架,通过几何对齐提升运动理解与运动-语言推理能力,实验表明在HumanML3D和KIT-ML上性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20636 2026-03-20 cs.LG 57%

Image2Gcode: Image-to-G-code Generation for Additive Manufacturing Using Diffusion-Transformer Model

Image2Gcode: 基于扩散-变换器模型的图像到G-code生成用于增材制造

Ziyue Wang, Yayati Jadhav, Peter Pak, Amir Barati Farimani

机构 * Department of Materials Science and Engineering, Carnegie Mellon University, Pittsburgh, PA, USA(材料科学与工程系,卡内基梅隆大学,匹兹堡,PA,USA) Department of Mechanical Engineering, Carnegie Mellon University, Pittsburgh, PA, USA(机械工程系,卡内基梅隆大学,匹兹堡,PA,USA)

专题命中 视觉空间推理 :planning(abstract);分类 cs.LG

AI总结 本文提出Image2Gcode框架,通过图像直接生成可打印的G-code,省去CAD建模步骤,提升增材制造的易用性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13698 2026-03-19 cs.RO cs.AI 57%

SAATT Nav: a Socially Aware Autonomous Transparent Transportation Navigation Framework for Wheelchairs

SAATT Nav:面向轮椅的社交感知自主透明交通导航框架

Yutong Zhang, Shaiv Y. Mehra, Bradley S. Duerstock, Juan P. Wachs

机构 * Edwardson School of Industrial Engineering, Purdue University(帕克大学工业工程学院) Weldon School of Biomedical Engineering, Purdue University(帕克大学生物医学工程学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出SAATT导航框架,通过整合大语言模型实现社交感知与决策透明,提升轮椅用户的导航安全性与信任度。

Comments 8 pages, 4 figures, 2 tables, 1 algorithm. Submitted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17056 2026-03-19 cs.CV cs.LG 57%

DesertFormer: Transformer-Based Semantic Segmentation for Off-Road Desert Terrain Classification in Autonomous Navigation Systems

DesertFormer:基于Transformer的语义分割用于自动驾驶导航系统中的沙漠地形分类

Yasaswini Chebolu

机构 * Department of Computer Science \& Engineering (AI \& ML) Gayatri Vidya Parishad College of Engineering for Women Visakhapatnam, India

专题命中 视觉空间推理 :planning(abstract);分类 cs.LG

AI总结 DesertFormer基于SegFormer B2与层次化Mix Transformer(MiT-B2)架构,针对沙漠地形的低对比度、强光照变化和稀疏植被挑战,实现10类生态意义地形分类,提升地面机器人与自动驾驶车辆的安全路径规划能力。

Comments 10 pages, 6 figures, 3 tables. Preprint also available on Zenodo (DOI: 10.5281/zenodo.19053085)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16264 2026-03-18 cs.AI 57%

Adaptive Theory of Mind for LLM-based Multi-Agent Coordination

自适应理论 of mind 用于基于大语言模型的多智能体协调

Chunjiang Mu, Ya Zeng, Qiaosheng Zhang, Kun Shao, Chen Chu, Hao Guo, Danyang Jia, Zhen Wang, Shuyue Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出自适应理论 of mind 机制,通过估计伙伴的理论 of mind 深度以提升多智能体协作效率,实验验证了该机制在多个任务中的有效性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16143 2026-03-18 eess.SP cs.AI 57%

Structure-Aware Multimodal LLM Framework for Trustworthy Near-Field Beam Prediction

面向可信近场波束预测的结构感知多模态大语言模型框架

Mengyuan Li, Qianfan Lu, Jiachen Tian, Hongjun Hu, Yu Han, Xiao Li, Chao-kai Wen, Shi Jin

机构 * School of Information Science and Engineering, Southeast University(信息科学与工程学院,东南大学) Institute of Communications Engineering, National Sun Yat-sen University(通讯工程学院,国立中山大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的多模态框架,融合历史GPS数据、RGB图像、LiDAR数据及任务特定文本提示,以提升复杂低空环境中的近场波束对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12633 2026-03-18 cs.CV cs.AI 57%

DiG: Differential Grounding for Enhancing Fine-Grained Perception in Multimodal Large Language Model

DiG:通过差异 grounding 提升多模态大语言模型的细粒度感知

Zhou Tao, Shida Wang, Yongxiang Hua, Haoyu Cao, Linli Xu

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出DiG框架,通过学习相似图像对的差异识别提升多模态大语言模型的细粒度感知能力,实验表明其在多个视觉感知基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18546 2026-03-18 cs.RO cs.AI 57%

EfficientNav: Towards On-Device Object-Goal Navigation with Navigation Map Caching and Retrieval

EfficientNav: 面向设备端目标物体导航的导航地图缓存与检索

Zebin Yang, Sunjian Zheng, Tong Xie, Tianshi Xu, Bo Yu, Fan Wang, Jie Tang, Shaoshan Liu, Meng Li

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) School of Integrated Circuits, Peking University(北京大学集成电路学院) Shenzhen Institute of Artificial Intelligence and Robotics for Society(深圳人工智能与机器人研究院) School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院) Beijing Advanced Innovation Center for Integrated Circuits(北京集成电路先进制造创新中心)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

AI总结 本文提出EfficientNav,通过语义感知记忆检索和离散记忆缓存技术,在设备端实现零样本目标物体导航,提升成功率并降低规划延迟。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15624 2026-03-18 cs.CV cs.AI cs.RO 57%

Exploring the Use of VLMs for Navigation Assistance for People with Blindness and Low Vision

探索视觉语言模型在帮助视障和低视力人士导航中的应用

Yu Li, Yuchen Zheng, Giles Hamilton-Fletcher, Marco Mezzavilla, Yao Wang, Sundeep Rangan, Maurizio Porfiri, Zhou Yu, John-Ross Rizzo

机构 * Columbia University(哥伦比亚大学) New York University(纽约大学) Politecnico di Milano(米兰理工大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文评估了多种VLMs在基础视觉技能和导航任务中的表现,发现GPT-4o在空间推理和场景理解上表现最佳,而开源模型在复杂环境中存在不足,需进一步改进以提升实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15386 2026-03-17 cs.CV cs.AI 57%

RieMind: Geometry-Grounded Spatial Agent for Scene Understanding

RieMind:基于几何的场景理解空间智能体

Fernando Ropero, Erkin Turkoz, Daniel Matos, Junqing Du, Antonio Ruiz, Yanfeng Zhang, Lu Liu, Mingwei Sun, Yongliang Wang

机构 * Riemann Lab, Huawei Technologies(华为技术有限公司里斯曼实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出RieMind,通过显式3D场景图实现空间推理,证明解耦感知与推理能显著提升空间推理能力,实验结果显示比现有方法提升16%-50%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15341 2026-03-17 cs.AI cs.HC cs.MA 57%

Intelligent Co-Design: An Interactive LLM Framework for Interior Spatial Design via Multi-Modal Agents

智能协同设计:一种基于多模态代理的交互式LLM框架用于室内空间设计

Ren Jian Lim, Rushi Dai

机构 * Hong Kong Center for Construction Robotics(香港建设机器人中心)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种基于LLM的多模态多代理框架,通过自然语言描述和图像动态生成3D设计,提升用户参与度和设计效率。

Comments 25 pages, 20 figures; accepted for publication in the Proceedings of ACADIA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14669 2026-03-17 cs.AI 57%

RenderMem: Rendering as Spatial Memory Retrieval

RenderMem:将渲染作为空间记忆检索

JooHyun Park, HyeongYeop Kang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 RenderMem通过将渲染作为3D世界与空间推理的接口,使智能体能直接进行视角相关的可见性与遮挡推理,提升空间记忆系统的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13950 2026-03-17 cs.CL 57%

ToolFlood: Beyond Selection -- Hiding Valid Tools from LLM Agents via Semantic Covering

ToolFlood: 超越选择 -- 通过语义覆盖隐藏有效工具于LLM代理

Hussein Jawad, Nicolas J-B Brunel

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 研究针对LLM代理的检索层攻击,通过语义覆盖注入恶意工具,使有效工具被排除在外,实验显示攻击成功率高达95%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12538 2026-03-16 cs.CV cs.AI 57%

Spatio-Semantic Expert Routing Architecture with Mixture-of-Experts for Referring Image Segmentation

具有混合专家的时空语义专家路由架构用于指代图像分割

Alaa Dalaq, Muzammil Behzad

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出SERA架构,通过在视觉语言框架中引入轻量级表达感知专家细化,提升指代图像分割的时空一致性与边界精度,实验表明其在准确定位和精细边界界定上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏