BOUND: Brief-Guided Corrective Preference Distillation at Search-Control Boundaries
BOUND:在搜索-控制边界处的摘要引导式校正偏好蒸馏
专题命中 规划推理 :reasoning(abstract)
AI总结 针对大语言模型深度搜索智能体的持续漂移问题,提出BOUND框架,通过摘要引导构建偏好对,用DPO蒸馏偏好,在7个基准上多数数据集和指标优于基线。
Comments 15 pages
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
BOUND:在搜索-控制边界处的摘要引导式校正偏好蒸馏
专题命中 规划推理 :reasoning(abstract)
AI总结 针对大语言模型深度搜索智能体的持续漂移问题,提出BOUND框架,通过摘要引导构建偏好对,用DPO蒸馏偏好,在7个基准上多数数据集和指标优于基线。
Comments 15 pages
ComplexityWorld:面向可验证视觉决策的视觉语言模型基准测试
专题命中 规划推理 :verifier(abstract)
AI总结 该研究推出COMPLEXITYWORLD基准测试VLMs在可验证视觉决策任务上的表现,发现多数模型在直接推理下验证器接受率不足40%,且存在视觉到决策的瓶颈。
从神经意图到加密授权:管理智能代理工作流程
专题命中 规划推理 :planning(abstract)
AI总结 研究人工智能驱动的智能代理工作流程中的安全问题,提出神经加密服务(NCS),通过神经符号设计,在大语言模型代理和特权工具间构建安全治理平面,经实验评估,能大幅降低攻击成功率,转变代理安全验证方式。
HJ-Gauss: 一种蒙特卡洛HJ可达性方案
专题命中 规划推理 :planning(abstract)
AI总结 本文提出了一种基于局部PDE线性化的方法,通过冻结系数采样方案解决高维系统中经典网格基HJ求解器内存消耗大的问题,实现了存储和网格无关的算法,适用于高维可达性分析。
基于注意力机制的多站点极端事件随机模拟器用于评估非平稳级联洪水风险
专题命中 规划推理 :planning(abstract)
AI总结 本文提出一种结合注意力机制的多站点洪水模拟框架,通过随机生成多变量洪水频率、强度和持续时间序列,评估非平稳级联洪水风险,为保险和财务规划提供可行的洪水风险模拟。
Journal ref Nayak, A., Gentine, P., and Lall, U. (2026). "Attention-Based Stochastic Simulation of Climate-Informed Spatiotemporal Flood Risk for Multisite Insurance Portfolios." Geophysical Research Letters, 53 (15)
PhysX-CoT:从单张图像生成可用于仿真的3D资产的结构化物理推理
机构 * Space Engineering University(航天工程大学)
专题命中 视觉空间推理 :CoT(title,title_cn);reasoning(title,abstract)
AI总结 PhysX-CoT将单张图像生成仿真3D资产视为显式结构化物理推理过程,通过分解部件级状态轨迹优化相关指标,在多方面优于基线,生成资产在Unreal Engine 5中表现良好。
VideoCoCo:基于智能体双引擎系统的、以代码为思维链(CoT)的物理一致性视频生成方法
机构 * CUHK(香港中文大学) ; USTC(中国科学技术大学) ; SCUT(华南理工大学) ; HKU(香港大学) ; NTU(南洋理工大学) ; PKU(北京大学) ; SJTU(上海交通大学) ; CMU(卡内基梅隆大学) ; THU(清华大学) ; HUST(华中科技大学) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学)
专题命中 视觉空间推理 :CoT(title,title_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 VideoCoCo作为智能体双引擎框架,以可执行Blender代码为过程级思维链,构建专属数据集提升视频编辑器适配性,在两个基准上显著优于基线,实现了高质量物理一致性视频生成。
Comments 15 pages, 3 figures, and 3 tables
优势引导门:重塑基于视觉的空间智能的开放式推理
机构 * University of Science and Technology of China(中国科学技术大学) ; Suzhou Institute for Advanced Research, USTC(中国科学技术大学苏州高等研究院) ; Institute of Advanced Intelligence and Computing (IAIC), Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局高级智能与计算研究所) ; East China Normal University(华东师范大学) ; National University of Singapore(新加坡国立大学) ; Durham University(杜伦大学) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 视觉空间推理 :reasoning(title,summary_cn)
AI总结 本文针对MLLMs开放式推理易出错的问题,提出优势引导门框架,结合蒙特卡洛价值评估与两类优势门,构建Reasoning-Tree-160k数据集并经两阶段学习,有效提升了基准MLLMs的视觉空间推理性能。
回溯应达到何种程度?探索SFT与RL在增强大语言模型推理能力中的相互作用
机构 * Duke University(杜克大学) ; Mila - Quebec AI Institute(魁北克人工智能研究所)
专题命中 视觉空间推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.AI
AI总结 本研究探索SFT与RL在LLM推理中的相互作用,提出回溯是关键算子,发现最优回溯深度随任务难度变化,引入以回溯为核心的训练方案,证实合理回溯可提升模型推理能力。
LEGO-Puzzles:多模态大语言模型(MLLMs)在多步骤空间推理上的表现如何?
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Tongji University(同济大学) ; Tsinghua University(清华大学)
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI
AI总结 该研究推出多步骤空间推理基准LEGO-Puzzles,评估29个顶尖MLLMs,发现其在基础空间推理、多步骤规划任务上远逊于人类,凸显其空间推理能力存在关键局限。
MedPixel:用于医学推理与分割的统一像素-语言模型
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI
AI总结 该研究提出统一医学像素-语言模型MedPixel,引入44万样本的MedPLG-440K数据集,通过联合多任务微调与像素级偏好优化训练,支持多类医学任务,性能优异且具备零样本迁移与鲁棒性。
听、看与跟踪:面向全模态大模型的时空视听声音事件推理
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI
AI总结 针对现有模型缺失的时空视听推理能力,构建ST-OmniQA基准,提出ST-Omni-R1模型,在该基准上平均语义准确率达77.83%,且空间运动表示可跨基准迁移。
VectraYX-Vision-1B:一款具备结构化视觉推理与原生工具使用能力的20亿参数以下西班牙语/拉丁美洲网络安全多模态模型
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL
AI总结 本研究推出VectraYX-Vision-1B,一款20亿参数以下西班牙语/拉丁美洲网络安全多模态模型,支持结构化推理与工具调用,针对网络UI优化,同时报告了其视觉定位的负面结果及相关修复方案,开源了模型与数据。
Comments 11 pages, 1 figure
面向工具增强空间推理的自演化神经符号技能
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI
AI总结 该研究针对视觉-语言模型在细粒度空间任务上的不可靠问题,提出神经符号框架NeSy-Spatial,通过自演化空间技能提升工具利用精度与空间推理准确率。
Comments 25 pages, 9 figures, 10 tables; includes supplementary material
用工具思考,而非用像素思考:工具调用作为视觉推理的文本支架
机构 * Hong Kong University of Science and Technology(香港科技大学) ; The Chinese University of Hong Kong(香港中文大学) ; Ant Group(蚂蚁集团) ; Zhejiang University(浙江大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 该研究提出工具调用支架假设,引入TextCall方法验证返回图像冗余,仅用结构化文本支架即可实现视觉推理,降低延迟并消除工具API调用,结论适用于现有相关基准。
基于主动感知的全切片病理图像智能体视觉推理
机构 * College of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与技术学院) ; School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 该研究提出AdaptivePath主动感知框架,通过序列决策实现千兆像素病理切片的视觉推理,在病理VQA基准及TCGA六队列癌症亚型分类上取得最优性能,辅助病理学家诊断。
Comments 14 pages, 5 figures
Evidence-RL:面向证据密集型视觉推理
机构 * National University of Singapore(新加坡国立大学) ; Zhejiang University(浙江大学) ; Fudan University(复旦大学) ; Tsinghua University(清华大学) ; Tencent(腾讯)
专题命中 视觉空间推理 :reasoning(title);分类 cs.AI
AI总结 针对视觉-语言模型依赖语言先验等问题,提出反事实证据解缠方法,结合GRPO框架在9个基准和4种骨干模型上优于现有基于RL的后训练方法。
Comments 22 pages, 10 figures
利用年际一致的历史预测作为免费输入模态的多年地理空间推理
机构 * VITO Remote Sensing(VITO遥感公司)
专题命中 视觉空间推理 :reasoning(title)
AI总结 该研究将过往预测和BVL掩码纳入模型,提出CTY嵌入编码器,在540万像素的泛欧数据集上使作物F1提升,纠正召回偏差,为地理空间模型提供低成本方案。
Comments 17 pages, 7 figures Updated abstract to match with arxiv submission
MELLON——面向在线导航的多模态增强型大语言模型
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 针对网页导航智能体现有模型的不足,本文以WebShop为基准,提出MELLON等三项多模态增强方案,训练1个epoch后MELLON任务完成准确率提升9.26%,验证了多模态方法的重要性。
语言的成本:质心擦除揭示并利用多模态语言模型中的模态竞争
机构 * Stanford University(斯坦福大学) ; University of Washington(华盛顿大学) ; UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; USI Lugano(卢加诺大学)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究发现多模态语言模型在视觉任务中表现不佳,通过质心替换方法揭示语言表征优于视觉,通过文本质心对比解码提升准确率,不同训练方法影响结果。
Comments 37 pages, 8 figures, 28 tables
大型语言模型在创造性思维过程中与人类大脑对齐
机构 * EPFL(瑞士联邦理工学院洛桑) ; Università della Svizzera italiana (USI)(意大利语区大学(瑞士)) ; Wesleyan University(卫斯理大学) ; Paris Brain Institute (ICM)(巴黎大脑研究所) ; Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究探讨了在创造性思维过程中,fMRI数据揭示了大脑与不同规模LLM之间的对齐关系,发现模型大小和想法原创性影响对齐程度,且训练目标影响表示与人类创造力神经几何的匹配程度。
Comments Accepted at COLM 2026
CEAA:面向交互式计算系统的认知具身智能体架构
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 该研究针对具身IVAs在实时交互式虚拟环境中实现认知能力的挑战,提出基于Sense-Think-Act等框架的模块化认知架构,弥合高级推理与实时执行的差距,用于部署可扩展的具身IVAs。
NeuroRefiner:面向3D荧光显微镜神经元分割的形态感知多智能体细化方法
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Beijing Normal University(北京师范大学)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 针对3D荧光显微镜神经元分割的拓扑与细节保留难题,本文提出NeuroRefiner多智能体系统结合TopoRefineNet工具,在多数据集上实现优于现有方法的分割性能,ZBFWB数据集F1分数提升3.02%。
Comments Accept by ECCV 2026
探索大语言模型(LLM)在现实世界海事航行场景中的情境理解与《国际海上避碰规则》(COLREG)遵从能力
机构 * Technical University of Denmark(丹麦技术大学) ; University of Copenhagen(哥本哈根大学)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 本研究探索LLM在海事航行中的应用,构建含50个真实场景的AIS数据集,评估不同LLM的理解与推理能力,发现不微调则难以解决海事航行任务。
Comments Submitted and accepted to the IFAC WC 2026 as an invited session paper for track 7.2 Transportation and Vehicle Systems - Marine Systems
AeroDPO:释放具备高保真感知与自动偏好优化的轻量级无人机导航能力
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出AeroDPO,通过高保真感知与自动偏好优化,使20亿参数轻量级无人机导航模型达到70亿参数模型的成功率,同时降低分布外场景碰撞率,成为自主空中智能体新SOTA。
Comments 7 pages, 3 figures, 4 tables
在领域特定语言动作空间中学习室内布局策略
机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 针对现有室内布局生成方法的缺陷,该研究提出基于LLM的LayoutDSL框架,通过领域特定语言动作空间学习布局策略,结合数据集构建与强化学习优化,显著提升了布局的空间合理性与设计逻辑性。
GraphWalker: 通过合成轨迹课程实现基于知识图谱的代理问答
机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) ; Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL
AI总结 GraphWalker通过自动化轨迹合成和分阶段微调解决知识图谱问答中的探索与泛化问题,提升轻量强化学习性能,在CWQ和WebQSP上取得最优效果。
Comments COLM 2026
RefineAny3D:作为语义对齐的深度细化用于单目3D检测
机构 * Michigan State University(密歇根州立大学) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 视觉空间推理 :chain-of-thought(abstract)
AI总结 RefineAny3D将单目3D检测的深度细化转化为视觉对齐问题,通过VLM实现无需数值预测的深度修正,在多类检测工具上均有性能提升且可泛化。
基于旅游视频先验的面向目标的导航指令生成
机构 * Uni-Ubi AI(优必爱人工智能) ; Zhejiang University(浙江大学) ; Tongji University(同济大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 本研究提出面向目标的视频 grounding 导航指令生成任务VideoNIG,设计两阶段课程学习框架解决该任务,实验表明其可提升指令质量,集成VLN智能体后可实现端到端导航。
无序地标视觉导航
专题命中 视觉空间推理 :planning(abstract)
AI总结 针对无序图像导航的挑战,本文提出无需时间与里程计先验的ULVN框架,通过整合建图、定位与规划,在仿真和真实场景中性能优于现有最优方法。
Comments ECCV2026 Oral & Spotlight