arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3389 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3389 篇

2510.06700 2026-04-21 cs.CL 57%

How Language Models Conflate Logical Validity with Plausibility: A Representational Analysis of Content Effects

语言模型如何将逻辑有效性与合理性混淆:内容效应的表征分析

Leonardo Bertolazzi, Sandro Pezzelle, Raffaella Bernardi

机构 * University of Trento(特伦托大学) University of Amsterdam(阿姆斯特丹大学) Free University of Bozen-Bolzano(博赞-博洛尼亚自由大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 研究揭示语言模型中逻辑有效性与合理性概念的表征关联,通过构建去偏向量减少内容效应,提升推理准确性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07160 2026-04-21 cs.CL 57%

GeometryZero: Advancing Geometry Solving via Group Contrastive Policy Optimization

GeometryZero:通过群体对比策略优化推进几何求解

Yikun Wang, Yibin Wang, Dianyi Wang, Zimian Peng, Qipeng Guo, Dacheng Tao, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出GeometryZero,通过群体对比策略优化训练小型模型,实现高效的几何推理,实验表明其在Geometry3K和MathVista上优于RL基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17504 2026-04-21 cs.CV cs.AI 57%

RS-HyRe-R1: A Hybrid Reward Mechanism to Overcome Perceptual Inertia for Remote Sensing Images Understanding

RS-HyRe-R1: 一种混合奖励机制以克服遥感图像理解中的感知惯性

Gaozhi Zhou, Hu He, Peng Shen, Jipeng Zhang, Liujue Zhang, Linrui Xu, Zeyuan Wang, Ziyu Li, Xuezhi Cui, Wang Guo, Haifeng Li

机构 * School of Mechanical and Electrical Engineering, Central South University(中南大学机械与电气工程学院) School of Geosciences and Info-Physics, Central South University(中南大学地球科学与信息物理学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出RS-HyRe-R1混合奖励机制,旨在克服遥感图像理解中的感知惯性问题,通过引入空间推理激活奖励、感知正确性奖励和视觉-语义路径演化奖励,提升模型的全面视觉证据挖掘能力,实验显示其在多个任务上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17375 2026-04-21 cs.CV cs.AI 57%

When Text Hijacks Vision: Benchmarking and Mitigating Text Overlay-Induced Hallucination in Vision Language Models

当文本劫持视觉:基准测试与减轻文本叠加引起的视觉语言模型幻觉

Cui Yakun, Xingqun Qi, TianTian Geng, Yuyao Zhang, Sirui Han, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) University of Birmingham(伯明翰大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出VisualTextTrap基准测试,通过大规模人工验证样本和定制评估指标,减轻文本叠加引起的幻觉问题,并提出VTHM-MoE框架以提升视觉-文本解耦能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17054 2026-04-21 cs.CV cs.AI 57%

mEOL: Training-Free Instruction-Guided Multimodal Embedder for Vector Graphics and Image Retrieval

mEOL:无需训练的指令引导多模态嵌入器用于矢量图形和图像检索

Kyeong Seon Kim, Baek Seong-Eun, Lee Jung-Mok, Tae-Hyun Oh

机构 * KAIST(韩国科学技术院) POSTECH

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出无需训练的指令引导多模态嵌入框架,通过多模态大语言模型将文本、位图和SVG代码映射到对齐的嵌入空间,利用模态特定指令和结构化SVG提示实现嵌入方向控制,构建首个文本到SVG检索基准,展示出优于传统基线的性能。

Comments Round 1 early acceptance to WACV 2026, Project page: https://scene-the-ella.github.io/meol

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16967 2026-04-21 cs.RO cs.AI 57%

NaviFormer: A Deep Reinforcement Learning Transformer-like Model to Holistically Solve the Navigation Problem

NaviFormer:一种深度强化学习变换器模型,以整体解决导航问题

Daniel Fuertes, Andrea Cavallaro, Carlos R. del-Blanco, Fernando Jaureguizar, Narciso García

机构 * Grupo de Tratamiento de Imágenes, Information Processing and Telecommunications Center, ETSI Telecomunicación, Universidad Politécnica de Madrid(图像处理与电信中心,信息处理与电信中心,电信工程学院,马德里理工大学) Idiap Research Institute(Idiap研究机构)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

AI总结 NaviFormer通过预测高层路线和底层轨迹,整体解决导航问题,实验表明其在准确性和计算速度上表现优异,适用于实时任务。

Comments Published in IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16729 2026-04-21 cs.CV cs.AI 57%

Agentic Large Language Models for Training-Free Neuro-Radiological Image Analysis

基于代理的大型语言模型用于无训练神经放射学图像分析

Ayhan Can Erdur, Daniel Scholz, Jiazhen Pan, Benedikt Wiestler, Daniel Rueckert, Jan C. Peeken

机构 * Department of Radiation Oncology, TUM University Hospital, Munich, Germany(放射肿瘤科,慕尼黑技术大学医院,德国) Chair for AI in Healthcare and Medicine, Technical University of Munich (TUM)(人工智能在医疗和健康领域的主任,慕尼黑技术大学) Chair for AI for Image-Guided Diagnosis and Therapy, Technical University of Munich (TUM)(人工智能在影像引导诊断和治疗领域的主任,慕尼黑技术大学) Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心(MCML),德国慕尼黑) Department of Computing, Imperial College London, London, UK(计算系,伦敦帝国学院,英国伦敦) Deutsches Konsortium für Translationale Krebsforschung (DKTK), Partner Site Munich, Munich, Germany(德国转化癌症研究联盟(DKTK),慕尼黑分部,德国慕尼黑)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种无训练代理框架,利用外部工具实现脑MRI分析,涵盖预处理、病灶分割和体积分析,并通过公开BraTS数据集评估代理AI在神经放射学任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16576 2026-04-21 cs.IR cs.CL 57%

On the Robustness of LLM-Based Dense Retrievers: A Systematic Analysis of Generalizability and Stability

基于LLM的密集检索器的鲁棒性:通用性和稳定性系统分析

Yongkang Li, Panagiotis Eustratiadis, Yixing Fan, Evangelos Kanoulas

机构 * University of Amsterdam(阿姆斯特丹大学) Chinese Academy of Sciences(中国科学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 本文系统分析了基于LLM的密集检索器的通用性和稳定性,发现指令微调模型在复杂推理任务中存在'专业化税',而嵌入几何结构对鲁棒性有预测作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15350 2026-04-20 cs.LG 57%

The Spectral Geometry of Thought: Phase Transitions, Instruction Reversal, Token-Level Dynamics, and Perfect Correctness Prediction in How Transformers Reason

思维的谱几何:相变、指令反向、令牌级动态以及完美正确性预测在Transformer推理中的表现

Yi Liu

机构 * DeepSeek-R1(深Seek-R1) Qwen(通义千问) Pythia Llama

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 研究通过系统谱分析发现,大语言模型在推理与事实回忆时在隐藏激活空间中表现出谱相变现象,揭示了推理的谱压缩、指令调谐的谱反向等七种核心现象,建立了一套关于Transformer推理的谱理论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15332 2026-04-20 cs.HC cs.AI cs.CV cs.SE 57%

Automating Crash Diagram Generation Using Vision-Language Models: A Case Study on Multi-Lane Roundabouts

利用视觉-语言模型自动化生成碰撞图:多车道环形交叉口的案例研究

Xiao Lu, Hao Zhen, Jidong J. Yang

机构 * Smart Mobility and Infrastructure Lab, College of Engineering University of Georgia Athens(智能移动与基础设施实验室,工程学院,佐治亚大学亚特兰大分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文研究利用视觉-语言模型自动化生成碰撞图,针对多车道环形交叉口这一挑战性案例,提出三步提示框架和10项评估指标,发现GPT-4o在空间推理和数据对齐方面表现最佳,为生成式AI在工程可视化中的应用奠定基础。

Comments 16 pages, 5 figures, 3 tables

Journal ref Applied Computing and Intelligence, 2026, 6(1): 38-57

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14399 2026-04-17 cs.RO cs.AI cs.SY eess.SY 57%

SpaceMind: A Modular and Self-Evolving Embodied Vision-Language Agent Framework for Autonomous On-orbit Servicing

SpaceMind:一种模块化且自我进化的具身视觉-语言代理框架,用于自主在轨服务

Aodi Wu, Haodong Han, Xubo Luo, Ruisuo Wang, Shan He, Xue Wan

机构 * University of Chinese Academy of Sciences(中国科学院大学) Technology and Engineering Center for Space Utilization, Chinese Academy of Sciences(中国科学院空间利用技术与工程中心)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出SpaceMind框架,通过模块化和自我进化机制,实现自主在轨服务中的视觉感知、三维空间推理和多阶段任务执行,验证了其在不同环境下的鲁棒性和适应性。

Comments 23 pages, 6 figures, 7 tables. Code available at https://github.com/wuaodi/SpaceMind

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13029 2026-04-15 cs.CV cs.AI 57%

Visual Preference Optimization with Rubric Rewards

基于评分标准的视觉偏好优化

Ya-Qi Yu, Fangyu Hong, Xiangyang Qu, Hao Wang, Gaojie Wu, Qiaoyu Luo, Nuo Xu, Huixin Wang, Wuheng Xu, Yongxin Liao, Zihao Chen, Haonan Li, Ziming Li, Dezhi Peng, Minghui Liao, Jihao Wu, Haoyu Ren, Dandan Tu

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出rDPO框架,通过实例特定的评分标准提升多模态任务中的偏好优化效果,实验表明其在多个基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12948 2026-04-15 cs.AI 57%

Drawing on Memory: Dual-Trace Encoding Improves Cross-Session Recall in LLM Agents

基于记忆的绘制:双轨迹编码提升LLM代理跨会话回忆

Benjamin Stern, Peter Nadel

机构 * Tufts University(塔夫茨大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出双轨迹编码方法,通过将事实与具体场景描述结合,提升LLM代理在跨会话中的回忆能力,实验显示在时间推理、知识更新追踪和多会话聚合方面有显著提升。

Comments 16 pages, 2 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20330 2026-04-15 cs.CV cs.AI cs.GR 57%

OmniHands: Towards Robust 4D Hand Mesh Recovery via A Versatile Transformer

OmniHands: 一种通过通用变压器实现鲁棒四维手形重建的方法

Dixuan Lin, Yuxiang Zhang, Mengcheng Li, Wei Jing, Qi Yan, Qianying Wang, Yebin Liu, Hongwen Zhang

机构 * Beijing Normal University(北京师范大学) Tsinghua University(清华大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出OmniHands,通过通用变压器架构解决单目或多视角输入下手形及相对运动重建问题,引入关系感知双手分词和四维交互推理模块,提升真实场景中手部交互重建性能。

Comments An extended journal version of 4DHands, featured with versatile module that can adapt to temporal task and multi-view task. Additional detailed comparison experiments and results presentation have been added. More demo videos can be seen at our project page: https://OmniHand.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04849 2026-04-14 physics.chem-ph cs.AI cs.MA 57%

El Agente Estructural: An Artificially Intelligent Molecular Editor

结构代理:一种人工智能分子编辑器

Changhyeok Choi, Yunheng Zou, Marcel Müller, Han Hao, Yeonghun Kang, Juan B. Pérez-Sánchez, Ignacio Gustin, Hanyong Xu, Andrew Wang, Mohammad Ghazi Vakili, Chris Crebolder, Alán Aspuru-Guzik, Varinia Bernales

机构 * University of Toronto(多伦多大学) Acceleration Consortium(加速联盟) Vector Institute for Artificial Intelligence(向量人工智能研究所) Canadian Institute for Advanced Research (CIFAR)(加拿大高等研究院) NVIDIA(英伟达)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出El Agente Estructural,一种多模态、自然语言驱动的几何生成与操控代理,用于自主化学和分子建模。该代理通过整合领域知识工具和视觉语言模型,实现对分子结构的精确操控,无需重建核心分子框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10568 2026-04-14 cs.LG cond-mat.mtrl-sci 57%

ReadMOF: Structure-Free Semantic Embeddings from Systematic MOF Nomenclature for Machine Learning

ReadMOF:基于系统化MOF命名的无结构语义嵌入用于机器学习

Kewei Zhu, Cameron Wilson, Bartosz Mazur, Yi Li, Ashleigh M. Chester, Peyman Z. Moghadam

机构 * University College London(伦敦大学学院) Wroclaw University of Science and Technology(弗罗茨瓦夫理工大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 ReadMOF通过系统化MOF命名生成无结构语义嵌入,无需原子坐标或连接图即可建模结构-性质关系,实现材料信息学中的性质预测、相似性检索与聚类,性能可与几何依赖方法相比拟。

Comments 29 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09780 2026-04-14 cs.AI 57%

The Myth of Expert Specialization in MoEs: Why Routing Reflects Geometry, Not Necessarily Domain Expertise

专家专业化在MoEs中的神话:为什么路由反映几何,而非领域专业知识

Xi Wang, Soufiane Hayou, Eric Nalisnick

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了MoEs中专家专业化的机制,指出路由依赖于隐藏状态相似性,而非领域专业知识,并揭示了专业化的几何属性及在不同数据下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13450 2026-04-13 cs.CV cs.CL 57%

LADR: Locality-Aware Dynamic Rescue for Efficient Text-to-Image Generation with Diffusion Large Language Models

LADR:基于局部性的动态救援方法,用于高效文本到图像生成的扩散大语言模型

Chenglin Wang, Yucheng Zhou, Shawn Chen, Tao Wang, Kai Zhang

机构 * East China Normal University(华东师范大学) University of Macau(澳门大学) Zhejiang University(浙江大学) Nanjing University(南京大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出LADR方法,通过利用图像的空间马尔可夫性质加速推理,实现文本到图像生成的高效生成,同时保持生成质量。

Comments ACL2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08042 2026-04-10 cs.CV cs.AI 57%

3DrawAgent: Teaching LLM to Draw in 3D with Early Contrastive Experience

3DrawAgent:通过早期对比经验教LLM进行3D绘制

Hongcan Xiao, Xinyue Xiao, Yilin Wang, Yue Zhang, Yonggang Qi

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Jiangnan University(江南大学) HaoHan Data(浩瀚数据)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 3DrawAgent通过几何反馈利用大语言模型生成3D贝塞尔曲线,引入相对经验优化策略,无需参数更新提升3D空间理解与绘制质量,实现免训练的3D草图智能发展。

Comments CVPR 2026 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07973 2026-04-10 cs.AI 57%

How Far Are Large Multimodal Models from Human-Level Spatial Action? A Benchmark for Goal-Oriented Embodied Navigation in Urban Airspace

大型多模态模型距离人类水平的空间行动还有多远?一个面向城市空域目标导向的具身导航基准测试

Baining Zhao, Ziyou Wang, Jianjie Fang, Zile Zhou, Yanggang Xu, Yatai Ji, Jiacheng Xu, Qian Zhang, Weichen Zhang, Chen Gao, Xinlei Chen

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Northeastern University(东北大学) National University of Defense Technology(国防科技大学) Shandong University(山东大学) BNRist, Tsinghua University(清华大学北京信息科学与技术国家研究中心)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文通过构建包含5037个高质量目标导向导航样本的数据集,评估17种代表性模型在城市3D空间中具身空间行动的能力,发现尽管LMMs展现出新兴行动能力,但仍远未达到人类水平,并揭示导航误差在关键决策分歧后迅速发散的现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07502 2026-04-10 cs.SE cs.AI 57%

Beyond Human-Readable: Rethinking Software Engineering Conventions for the Agentic Development Era

超越人类可读性:为代理开发时代重新思考软件工程惯例

Dmytro Ustynov

机构 * Military Institute of Telecommunications and Information Technologies (MITIT)(军事电信与信息技术研究所)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨代理开发时代软件工程惯例的变革,提出语义密度优化原则,通过实验验证压缩对开发成本的影响,并提出程序骨架概念和语义意图与可读性分离的主张。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10238 2026-04-08 cs.CV cs.AI 57%

ForgeryGPT: A Multimodal LLM for Interpretable Image Forgery Detection and Localization

ForgeryGPT: 一种多模态大语言模型用于可解释的图像伪造检测与定位

Fanrui Zhang, Jiawei Liu, Jiaying Zhu, Esther Sun, Dong Li, Qiang Zhang, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 ForgeryGPT通过多模态大语言模型捕捉伪造图像的高阶取证知识关联,实现可解释的图像伪造检测与定位,提升检测精度和交互能力。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04908 2026-04-07 cs.LG 57%

HI-MoE: Hierarchical Instance-Conditioned Mixture-of-Experts for Object Detection

HI-MoE:基于实例的混合专家架构用于目标检测

Vadim Vashkelis, Natalia Trukhina

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 HI-MoE提出一种分层实例条件混合专家架构,通过两级路由机制提升目标检测效率,尤其在小目标检测上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04843 2026-04-07 cs.CV cs.AI 57%

InfBaGel: Human-Object-Scene Interaction Generation with Dynamic Perception and Iterative Refinement

InfBaGel: 基于动态感知和迭代细化的人-物体-场景交互生成

Yude Zou, Junji Gong, Xing Gao, Zixuan Li, Tianxing Chen, Guanjie Zheng

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Sichuan University(四川大学) Shenzhen University(深圳大学) The University of Hong Kong(香港大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种粗到细的指令条件交互生成框架,结合一致性模型的迭代去噪过程,通过动态感知策略和 bump-aware 指导减少物理伪影,提升 HOSI 和 HOI 生成性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03302 2026-04-07 cs.CV cs.AI 57%

Beyond Static Vision: Scene Dynamic Field Unlocks Intuitive Physics Understanding in Multi-modal Large Language Models

超越静态视觉:场景动态场解锁多模态大语言模型中的直观物理理解

Nanxi Li, Xiang Wang, Yuanjie Chen, Haode Zhang, Hong Li, Yong-Lu Li

机构 * Shanghai Jiao Tong University(上海交通大学) Tianjin University(天津大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨多模态大语言模型在物理理解上的不足,提出Scene Dynamic Field方法提升对连续物体动态的理解能力,实现20.7%的改进并展现良好的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28733 2026-04-07 cs.LG 57%

See it to Place it: Evolving Macro Placements with Vision-Language Models

看清它,放置它:利用视觉-语言模型进行宏放置

Ikechukwu Uchendu, Swati Goel, Karly Hou, Ebrahim Songhori, Kuang-Huei Lee, Joe Wenjie Jiang, Vijay Janapa Reddi, Vincent Zhuang

机构 * Harvard University(哈佛大学) Kempner Institute for the Study of Natural and Artificial Intelligence(肯普纳自然与人工智能研究所) Google DeepMind(谷歌DeepMind)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出利用视觉-语言模型进行芯片布局中的宏放置优化,通过进化搜索策略提升放置质量,在9/10基准上优于现有方法,且能泛化至分析型布局器。

Comments 31 pages, 12 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02689 2026-04-06 cs.CV cs.AI 57%

Efficient3D: A Unified Framework for Adaptive and Debiased Token Reduction in 3D MLLMs

Efficient3D: 一种用于3D多模态大语言模型中自适应和去偏token减少的统一框架

Yuhui Lin, Siyue Yu, Yuxing Yang, Guangliang Cheng, Jimin Xiao

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学) University of Liverpool(利物浦大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Efficient3D框架,通过去偏视觉token重要性估计器和自适应token再平衡策略,实现3D MLLMs的高效推理,提升性能并降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02639 2026-04-06 cs.CV cs.AI 57%

Cross-Vehicle 3D Geometric Consistency for Self-Supervised Surround Depth Estimation on Articulated Vehicles

跨车辆3D几何一致性用于机械臂车辆上的自监督周围深度估计

Weimin Liu, Jiyuan Qiu, Wenjun Wang, Joshua H. Meng

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院) Remote Sensing and Earth Observation Laboratory, University of Copenhagen(哥本哈根大学遥感与地球观测实验室) California PATH, University of California, Berkeley(加州大学伯克利分校加州PATH)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ArticuSurDepth框架,通过跨视图和跨车辆几何一致性提升机械臂车辆周围深度估计的结构一致性与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02389 2026-04-06 cs.SD cs.AI eess.AS 57%

Audio Spatially-Guided Fusion for Audio-Visual Navigation

音频空间引导融合用于音频视觉导航

Xinyu Zhou, Yinfeng Yu

机构 * Joint Research Laboratory for Embodied Intelligence, Xinjiang University(新疆大学联合研究实验室,具身智能) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Xinjiang University(新疆大学丝绸之路多语言认知计算国际联合研究实验室) School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

AI总结 本文提出一种音频空间引导融合方法,通过自适应提取空间状态信息,实现多模态特征动态对齐与融合,提升在未知声源分布下的导航泛化能力。

Comments Main paper (6 pages). Accepted for publication by the International Joint Conference on Neural Networks (IJCNN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02296 2026-04-03 cs.CV cs.AI 57%

VOID: Video Object and Interaction Deletion

VOID:视频对象和交互删除

Saman Motamed, William Harvey, Benjamin Klein, Luc Van Gool, Zhuoning Yuan, Ta-Ying Cheng

机构 * Netflix

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 VOID通过物理合理填充解决复杂场景下的视频对象删除问题,结合视觉语言模型和视频扩散模型,提升场景动态一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏