On the Identifiability of Controlled World Models
关于受控世界模型的可识别性
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 研究受控世界模型的可识别性问题,建立在状态依赖高斯行为策略下的联合可识别性理论,识别出两个条件,证明满足条件时JEPA目标的全局极小值可识别潜在状态和受控转移,推导定量界限并通过实验验证理论。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
关于受控世界模型的可识别性
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 研究受控世界模型的可识别性问题,建立在状态依赖高斯行为策略下的联合可识别性理论,识别出两个条件,证明满足条件时JEPA目标的全局极小值可识别潜在状态和受控转移,推导定量界限并通过实验验证理论。
资本市场大语言模型可靠性评分(CM-LRS):从似是而非到可信赖
专题命中 规划决策 :workflow(abstract);分类 cs.CL
AI总结 研究资本市场大语言模型输出的可信赖问题,提出CM-LRS从七个维度评估工作流程输出,通过五个工作流程对四个模型与四位评判者评分,发现前沿闭源模型聚类近,差距集中在检索合成,决策有用性离散度大且评判者一致性高。
Comments 23 pages. Rubrics, prompts, and demonstration tasks are publicly available
MARS:用于知识图谱问答的多跳自适应检索与SPARQL生成
机构 * Heinz Nixdorf Institute, Paderborn University(海因茨·尼克斯多夫研究所,帕德博恩大学)
专题命中 规划决策 :agentic(abstract);分类 cs.CL
AI总结 研究针对大型语言模型在知识密集型任务中可靠性受限的问题,提出MARS方法,通过结构化检索过程链接问题实体与知识图谱,迭代获取信息并决定检索深度或生成SPARQL查询,在多个基准测试中性能有竞争力且高效可扩展。
Comments EKAW 2026 (accepted-posters-and-demos" target="_blank" rel="noopener">https://ekaw2026.di.unito.it/accepted-posters-and-demos)
通用决策学习器
机构 * Adobe Research(Adobe研究院) ; University of Massachusetts(马萨诸塞大学) ; Amherst(阿默斯特)
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 本文提出通用决策学习器(UDL)的范畴论框架,通过左Kan扩展和右Kan扩展将局部决策行为规范地扩展到全局一致行为,统一了规划、强化学习、因果干预、在线学习和博弈均衡等多种决策形式。
Comments Revised the central construction to use type-correct staged left/right Kan extensions; corrected the semantic quotient theorem; added an explicit discounted-MDP/Bellman derivation; and expanded the non-RL decision examples and limitations. A detailed change log appears in the supplement
变分神经信念参数化用于多模态不确定性下的鲁棒灵巧抓取
机构 * Department of Electrical & Computer Engineering and Institute for Systems Research, University of Maryland, College Park, MD, USA(电气与计算机工程系和系统研究所,马里兰大学,College Park, MD, USA) ; Maryland Applied Graduate Engineering, A. James Clark School of Engineering, University of Maryland, College Park, MD, USA(马里兰应用研究生工程学院,A. James Clark工程学院,马里兰大学,College Park, MD, USA)
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 本文提出变分推理方法,通过可微高斯混合模型表示信念,利用Gumbel-Softmax和位置-尺度重参数化实现平滑采样,提升抓取鲁棒性并减少规划时间。
Comments 11 pages, 10 figures. Accepted for publication at IROS 2026. Code, simulation assets, and dataset at https://github.com/coenwerem/vnb-grasp
GFLAN:生成功能布局
机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 GFLAN通过两阶段分解生成功能布局,结合拓扑规划与几何实现,提升建筑生成的准确性与合理性。
Comments 21 pages, 15 figures
VTM-Nav:用于跨情节对象目标导航的分层视觉拓扑记忆
机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) ; School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学交叉科学学院) ; Tsinghua University(清华大学) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 规划决策 :agent(abstract);分类 cs.AI
AI总结 研究跨情节对象目标导航问题,提出无训练的VLM导航框架\method,其带有分层视觉拓扑记忆,通过粗到细匹配检索经验,在三个基准测试中性能最佳,证明跨数据集结构化视觉拓扑经验复用有效且鲁棒。
PRO-LONG:程序化内存实现长程推理
机构 * Duke University(杜克大学)
专题命中 规划决策 :agent(abstract);分类 cs.AI
AI总结 针对长程任务中LLM智能体的挑战,提出PRO-LONG框架,通过程序化内存管理上下文,保留交互日志并利用编码智能体进展高效搜索历史,在ARC-AGI-3上有显著提升,减少令牌使用并达到高准确率。
一种用于机器人的智能云边缘多模态交互系统
机构 * Hainan University(海南大学)
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 针对复杂环境下资源受限机器人的交互问题,提出云边缘多模态交互框架,集成增强YOLO手势检测器与LLM、VLM智能体,改进手势检测方法,经实验验证该系统在手势检测精度、任务成功率及用户满意度方面表现良好,证明了方法的可行性。
随心所欲驾驶:基于强化学习的多头部扩散个性化驾驶
机构 * School of Information Technology, Monash University Malaysia(墨尔本大学马来西亚分校信息科技学院) ; Southwest University, China(西南大学)
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 研究旨在解决自动驾驶规划器忽视人类驾驶行为多样性及难以理解用户意图的问题。提出基于强化学习的多策略框架,集成多头部扩散规划器与语义理解,采用两阶段训练范式。实验表明该方法在nuPlan基准测试中性能良好,能满足实时规划并对齐用户意图。
Comments Has been submitted to AAAI 2026
AdaHome:一种使用本地小语言模型的自适应智能家居助手
机构 * University of Southampton(南安普顿大学)
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 研究旨在解决智能家居助手问题,提出AdaHome,通过意图感知规划框架、草稿链策略及偏好适应机制,在本地小语言模型上实现高效决策与个性化,实验显示其在命令准确性、延迟及多轮场景中有良好表现。
用于肌肉骨骼护理的基于证据的人工智能
机构 * Ruijin Hospital, College of Health Science and Technology, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属瑞金医院,健康科学技术学院) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) ; MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(中国科学技术大学脑启发智能感知与认知教育部重点实验室) ; School of Basic Medical Sciences, Intelligent Medicine Institute, Fudan University(复旦大学基础医学院智能医学研究院) ; Department of Radiation Oncology, Stanford University School of Medicine(斯坦福大学医学院放射肿瘤学系) ; School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) ; College of AI, Tsinghua University(清华大学人工智能学院)
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 研究针对肌肉骨骼护理中证据分散问题,提出基于大语言模型的OrthoPilot系统,整合多源数据进行持续管理。该系统在诊断推理等方面超越专家,优于其他智能系统,还提升了管理成功率和病床病例数等,推动临床人工智能实现纵向管理。
Comments All co-authors have now consented to the submission and approved the authorship
跨越电路设计的最后一英里:PostEDA-Bench,一个用于PPA收敛和DRC修复的分层基准
机构 * University of Minnesota(明尼苏达大学)
专题命中 规划决策 :agent(abstract);分类 cs.AI
AI总结 提出PostEDA-Bench分层基准,包含145个任务,覆盖DRC修复和PPA优化,实验发现现有LLM代理在复杂DRC推理和多目标PPA优化上表现不佳,视觉增强可提升DRC性能,权衡推理是PPA多目标瓶颈。
基于肿瘤锚定的深度特征随机森林用于肺癌分割中的分布外检测
机构 * Memorial Sloan Kettering Cancer Center(纪念斯隆凯特林癌症中心)
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 本文提出RF-Deep框架,利用深度特征提升CT扫描的分布外检测性能,通过少量标注数据改进分割管道的安全性。
Comments Accepted for publication in Transactions on Machine Learning Research (TMLR), 2026. Code available at: https://github.com/aneesh3108/RF-Deep
AnchorRefine:基于轨迹锚点和残差细化的轨迹-锚点与残差细化的视觉-语言-动作模型
机构 * Beijing University of Technology(北京理工大学) ; Beihang University(北航) ; Nanjing University of Science and Technology(南京理工大学)
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 本文提出AnchorRefine框架,通过分解视觉-语言-动作动作建模为轨迹锚点和残差细化,提升几何和接触精度,实验表明在模拟和现实任务中均取得显著提升。
Comments The authors have decided to withdraw this manuscript because the work requires substantial revision and further experimental validation
基于架构的CBOMs用于密码迁移:一种安全感知的架构权衡方法
专题命中 规划决策 :planning(abstract);分类 cs.SE
AI总结 本文提出SATAM方法,通过整合ATAM、arc42等方法,生成包含安全意图和迁移关键元数据的架构基础CBOM,提升密码迁移规划的信息可用性。
Comments Accepted at the International Workshop on Migration and Agility in Cryptographic Systems (MAgiCS 2026). This version matches the open-access conference paper published by Springer
Journal ref CCIS, vol. 3002, pp. 20-39 (2026)
推理模型中的流体表示
机构 * ETH Zurich(苏黎世联邦理工学院) ; University of Toronto(多伦多大学)
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 研究揭示了推理模型通过上下文细化令牌表示提升抽象问题解决能力的机制,提出流体推理表示概念。
Comments EMNLP 2026
评估具有视觉语言动作能力的机器人的不确定性和质量
机构 * Mondragon University(蒙dragon大学) ; Simula Research Laboratory(Simula研究实验室)
专题命中 规划决策 :planning(abstract);分类 cs.SE
AI总结 研究针对具有视觉语言动作能力的机器人,采用八个不确定性指标和五个质量指标,通过大规模实证研究评估其有效性,发现部分指标与人类评估有相关性且能区分任务执行质量,挑战了仅依赖成功率的评估做法。
MafiaScope:社交推理游戏中对大语言模型智能体的非侵入性、时间分辨信念探测
机构 * HSE University(俄罗斯高等经济研究大学)
专题命中 规划决策 :agent(abstract);分类 cs.CL
AI总结 研究社交推理游戏中LLM智能体信念探测问题,提出MafiaScope测试平台,通过结构化问题让智能体私下作答并自动评分,可视化呈现信念轨迹,以DeepSeek为例进行研究,得出相关校准误差等结果并开源相关内容。
SEC-bench Pro:语言模型能解决长周期软件安全任务吗?
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 规划决策 :agent(abstract);分类 cs.LG
AI总结 提出SEC-bench Pro基准,通过三阶段流程构建包含V8和SpiderMonkey共183个已验证漏洞的测试集,评估前沿语言模型在长周期漏洞狩猎任务中的表现,发现最高成功率仅48.8%。
错误作为透镜:通过合成误解生成探究LLM推理
机构 * CUNY Graduate Center(纽约大学研究生中心) ; CUNY Queens College(纽约市立大学皇后学院)
专题命中 规划决策 :agent(abstract);分类 cs.CL
AI总结 提出一个框架,通过生成针对Bloom分类学五类错误的合成误解,以诊断LLM推理能力,并发现目标错误生成比自由形式错误生成更难。
行为可信度三难困境:当校准自主性变得不可能
机构 * Future Computing Group University of Oulu(奥卢大学未来计算组) ; Department of Computer Science University of Helsinki(赫尔辛基大学计算机科学系)
专题命中 规划决策 :agent(abstract);分类 cs.LG
AI总结 本文证明,在理性监督下,当某些任务超出智能体的可靠能力时,任何具有置信门控自主性的强化学习策略都无法同时实现最大帮助性、最优校准和完全自主性,即行为可信度三难困境。
Comments 49 pages, 3 figures, 5 tables
自适应多轮分配与随机到达
机构 * Harvard University(哈佛大学) ; University of Witwatersrand(沃特沙兰大学)
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 研究了受适应性网络招募启发的序列资源分配问题,提出基于截断概率生成函数的动态规划算法,实现多项式复杂度的多轮分配方案,并分析了模型误差下的鲁棒性。
Comments Accepted into ICML 2026
通过扩展到100万个并行环境防止PPO学习停滞
专题命中 规划决策 :agent(abstract);分类 cs.LG
AI总结 通过扩展PPO到100万个并行环境,有效解决学习停滞问题,实现性能持续提升。
Comments Accepted to RLC 2026
使用带强化学习引导标记的SILVER解释深度强化学习中的策略:一种针对高维多动作环境的模型级方法
专题命中 规划决策 :agent(abstract);分类 cs.LG
AI总结 研究针对深度强化学习缺乏可解释性问题展开,提出带强化学习引导标记的SILVER,通过提取特征、进行归因、生成数据集及训练代理模型来解释策略,在雅达利环境评估并经人体研究验证,提升透明度与人类理解,推进可解释强化学习发展。
Comments Some co-authors do not agree with uploading this paper to arXiv
Sign-SZPO:具有未知链接函数的基于可证明偏好的强化学习
机构 * University of Michigan(密歇根大学)
专题命中 规划决策 :agent(abstract);分类 cs.LG
AI总结 研究具有未知链接函数的基于偏好的强化学习问题,提出Sign-SZPO零阶策略优化算法,该算法仅估计价值函数差的符号来构建更新方向,可证明收敛到平稳策略,实证显示其在链接函数错误指定下具有鲁棒性。
监督奖励推理
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 研究人类通过多样行为表明目标时的奖励推理问题,提出监督奖励推理(SRI)方法,证明其理论上渐近贝叶斯最优,实证上在相关基准和机器人任务中表现出色,还展示了框架对动作和目标预测的通用性。
Comments 35 pages, 8 figures. Updated with public code link
OmniFood-Bench:评估用于营养推理和个性化健康建议的视觉语言模型
专题命中 规划决策 :autonomous agent(abstract);分类 cs.AI
AI总结 介绍OmniFood-Bench基准评估用于营养推理和个性化健康建议的VLMs,基于MM-Food-100K数据集,评估其三种能力,实验发现模型在菜品命名与质量估计等方面存在“语义-物理差距”,为公共卫生自主智能体建立可信度标准。
具有交互意识的全身控制用于柔顺物体运输
机构 * Department of Electrical Engineering, the University of Texas at Arlington(电气工程系,德克萨斯大学阿灵顿分校) ; Department of Mechanical Engineering, Carnegie Mellon University(机械工程系,卡内基梅隆大学)
专题命中 规划决策 :agent(abstract);分类 cs.AI
AI总结 本文提出了一种生物启发式的交互导向全身控制方法,通过分离上身交互执行与下身支撑控制,实现稳定且灵活的柔顺物体运输。
一种用于图数据概率推理的神经符号方法
机构 * Aalborg University(奥尔堡大学) ; University of Trento(特伦托大学)
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 本文提出神经符号框架,将GNNs集成到RBNs中,结合二者优势。开发两种集成实现及MAP推理方法,通过节点分类转换和环境规划问题展示通用性,引入新基准数据集,为图数据处理带来新方法,提升多样任务性能。
Comments Submitted to the Journal of Artificial Intelligence Research (JAIR); under revision. 43 pages, 10 figures. Code available at https://github.com/raffaelepojer/NeSy-for-graph-data