Where Instruction Hierarchy Breaks: Diagnosing and Repairing Failures in Reasoning Language Models
指令层级失效之处:诊断与修复推理语言模型的故障
机构 * NVIDIA(英伟达)
专题命中 规划决策 :agentic(abstract);分类 cs.AI
AI总结 提出白盒诊断框架,将指令层级失效定位为指令识别、冲突解决和响应实现三个环节,并设计两种免训练自监控机制,将违规率降低81-99%。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
指令层级失效之处:诊断与修复推理语言模型的故障
机构 * NVIDIA(英伟达)
专题命中 规划决策 :agentic(abstract);分类 cs.AI
AI总结 提出白盒诊断框架,将指令层级失效定位为指令识别、冲突解决和响应实现三个环节,并设计两种免训练自监控机制,将违规率降低81-99%。
面向中学的AI集成学习管理系统:一项从高中到毕业后的学习成果纵向研究
机构 * National Agricultural University(国立农业大学)
专题命中 规划决策 :workflow(abstract);分类 cs.AI
AI总结 提出一种隐私优先的AI集成学习管理系统,通过政策约束的AI辅助(形成性反馈、间隔复习、适应性练习)和教师仪表盘,在中学日常课程中提供即时支持,并设计纵向研究评估其对高中及毕业后学习轨迹的长期影响。
美国国防采办是否准备好采办人工智能赋能能力?通过基于场景的政策分析评估国防部软件采办路径
专题命中 规划决策 :planning(abstract);分类 cs.SE
AI总结 通过基于场景的政策分析,评估美国国防部软件采办路径是否足以应对AI采办的独特需求,发现核心指南中存在可操作性不足,建议增设AI支持子路径并完善工件。
Comments Submitted to ACM Digital Government: Research and Practice Journal on April 2026
自演化分布内优化的LLM智能体
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 规划决策 :agent(abstract);分类 cs.LG
AI总结 提出Q-Evolve框架,通过分布内强化学习统一过程奖励标注与策略学习,利用加权隐式Q学习稳定贝尔曼更新,实现智能体自演化,在AlfWorld等任务上优于基线。
Comments ICML 2026
Dash2Sim: 来自野外行车记录仪视频的闭环驾驶仿真
机构 * Carnegie Mellon University(卡内基梅隆大学) ; NEC Labs America(NEC美国实验室) ; MIT(麻省理工学院) ; UC San Diego(加州大学圣地亚哥分校)
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 提出Dash2Sim框架,将单目行车记录仪视频转化为度量级、地理参考的4D驾驶日志,用于闭环仿真,并构建ROADWork4D基准数据集,验证了施工区场景对规划器的挑战。
考虑情境:塑造道德信念以实现价值对齐
机构 * University of Oxford(牛津大学)
专题命中 规划决策 :agent(abstract);分类 cs.AI
AI总结 本文针对价值对齐中道德多元性问题,提出在聚合道德评估时必须考虑情境因素,并形式化道德不确定性下的决策,揭示弱帕累托原则的违反是辛普森悖论的一种变体。
SCOUT: 基于不确定性引导遍历的语义场景覆盖
机构 * Nokia Bell Labs, France(诺基亚贝尔实验室,法国) ; Nokia Bell Labs, Murray Hill, NJ, USA(诺基亚贝尔实验室,美国,新泽西州 Murray Hill) ; Imperial College London(帝国理工学院伦敦分校) ; Locus Robotics(Locus机器人技术公司)
专题命中 规划决策 :autonomous agent(abstract);分类 cs.AI
AI总结 提出SCOUT框架,通过不确定性引导的遍历规划与概率场景图构建的闭环,使机器人主动探索并逐步理解环境,实现语义场景完整性作为操作目标。
Comments 2026 ICRA Workshop on Uncertainty in Open World Robotics
平面曲线的几何高斯混合表示
机构 * Fraunhofer IOSB(弗劳恩霍夫研究所) ; KIT, IES(卡尔斯鲁厄理工学院,信息工程系)
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 提出一种用户定义的平面曲线概率多边形表示,通过为每个线段赋予法向不确定性参数,构造高斯混合模型,保留局部几何与法向不确定性,适用于多种曲线类型。
当思维链更清楚时:多轮推理模型的失败模式
专题命中 规划决策 :分类 cs.AI、cs.CL、cs.LG;agentic(comments)
AI总结 提出CoT-Output 2x2安全矩阵诊断多轮推理模型隐藏的时间动态失败,发现监督悖论和上下文注入失败两种可复现漏洞。
Comments Accepted at the ICML 2026 Workshop on Failure Modes in Agentic AI (FAGEN)
RKSC:面向多步LLM推理的感知推理的KV缓存共享与自信提前退出
机构 * Anirudh Sekar(安尼鲁德·塞卡)
专题命中 规划决策 :分类 cs.AI、cs.CL、cs.LG;agentic(comments)
AI总结 提出RKSC框架,通过注意力相似性KV共享、置信门控提前退出和推理选择性块缓存管理,消除多分支LLM推理中的结构冗余,实现平均3.008倍加速,错误率仅0.37%。
Comments Accepted to the ICML 2026 Workshop on Statistical Frameworks for Uncertainty in Agentic Systems
THA-Flow生成模型:基于术前CT的假体几何预测
机构 * Changzhou Jinse Medical Information Technology Co., Ltd.(常州金色医疗信息技术有限公司) ; Shanghai Ninth People’s Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属第九人民医院)
专题命中 规划决策 :planning(abstract)
AI总结 本研究提出THA-Flow生成模型,通过AutoencoderKL和三维UNet从术前CT生成三维假体几何,在1355个髋关节数据上验证,实现了THA三维手术规划的生成式AI首次应用。
Comments 17 pages, 7 figures, 2 tables
引导采样而非卷积核网格:面向体积分割的几何引导采样算子
机构 * Monash University(莫纳什大学)
专题命中 规划决策 :planning(abstract)
AI总结 该研究针对3D体积分割中精细结构易被卷积模糊的问题,提出几何引导采样算子,替换U-Net等骨干网络的下采样算子,在多医学影像数据集上提升分割性能并减少参数量。
Comments Accepted at MICCAI 2026
RAEM:面向四足机器人的多层级环境鲁棒自主探索框架
机构 * AI Chip Center for Emerging Smart Systems(新兴智能系统AI芯片中心) ; InnoHK Centers(创新香港中心) ; HongKong University of Science and Technology(香港科技大学) ; Southeast University(东南大学) ; City University of Hong Kong(香港城市大学) ; Huazhong University of Science and Technology(华中科技大学) ; University of Hong Kong(香港大学) ; Wuhan University(武汉大学)
专题命中 规划决策 :planning(abstract)
AI总结 本文提出RAEM框架,通过混合局部-全局可通行性表示、楼梯中心对齐策略与双路径搜索机制,实现四足机器人在多层级环境的鲁棒自主探索,经仿真与真实实验验证有效。
Comments 21 pages, 23 figures
闭环抽水蓄能水电站选址优化
专题命中 规划决策 :planning(abstract)
AI总结 针对可再生能源并网的电网挑战,提出HERA-S框架优化闭环抽水蓄能选址,经里约热内卢案例验证可提升预可行性规划敏捷性。
磁性稀土-过渡金属合金的高通量发现
专题命中 规划决策 :workflow(abstract)
AI总结 该研究结合扩散晶体结构生成与分层筛选的加速材料发现框架,筛选超24万种结构,识别300余种低能磁性候选物,发现4种富铁高饱和磁化强度稳定相,为磁性材料设计提供指导。
Comments 11 pages, 5 figures
用于通用脑肿瘤分割的多阶段提示引导特征调制
专题命中 规划决策 :planning(abstract)
AI总结 本文提出多阶段动态提示nnU-Net,通过多阶段动态提示调制编码器特征,在BraTS GOAT数据集上较基线nnU-Net提升了脑肿瘤分割的Dice分数,增强了模型泛化性。
Comments Accepted to BraTS MICCAI 2026 Task 3 (Generalizability Across Tumors)
VizAnchor:通过双锚推理从篡改可视化中解码操纵意图
机构 * School of Data Science and Engineering, East China Normal University(华东师范大学数据科学与工程学院) ; Division of Emerging Interdisciplinary Areas, The Hong Kong University of Science and Technology(香港科技大学新兴跨学科领域分部) ; School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院)
专题命中 规划决策 :agent(abstract)
AI总结 本文提出VizAnchor框架,通过双锚构建与VLM推理实现可视化操纵理解,含三个专用智能体,构建相关数据集,可准确定位篡改并生成忠实解释。
Comments 39 pages
感知安全的带信号时序逻辑的模型预测路径积分控制
机构 * University of Southern California(南加州大学) ; University of Michigan(密歇根大学) ; Toyota Motor North America R&D(丰田北美研发中心) ; ETH Zürich(苏黎世联邦理工学院)
专题命中 规划决策 :planning(abstract)
AI总结 本文提出safety-aware-stl-mppi框架,将STL公式编码为CBF并集成到MPPI控制器,经火星车与四旋翼实验验证,可在复杂约束下实现高安全与效率的运动规划。
DreamLedger:机器人决策回路中用于世界模型想象的执行结算信用文件
机构 * University of Florida(佛罗里达大学)
专题命中 规划决策 :planning(abstract)
AI总结 该研究提出DreamLedger执行结算信用文件,管控机器人世界模型预测的消耗,在多模拟域和真实机械臂上验证,可减少无效想象、降低验证探测次数,适用于多模型与硬件场景。
Comments 10 pages, 6 figures
月球南极微生物生命的潜在可生存生态位
专题命中 规划决策 :planning(abstract)
AI总结 该研究结合遥感与高分辨率光照模型,发现月球南极存在大量持续低温、紫外线通量低的区域,可能具备微生物生存条件,提示需关注载人探索带来的生命转移风险。
Comments 43 pages, 3 figures, 3 tables, Preprint of Science Advances published on Aug. 19, 2026
Journal ref Science Advances, 9, eae0811 (2023)
用于放疗中危及器官分割质量保证的图像条件扩散模型
机构 * UCL Hawkes Institute(UCL霍克斯研究所) ; University College London(伦敦大学学院) ; National Physical Laboratory(英国国家物理实验室) ; University College London Hospital(伦敦大学学院医院) ; National Radiotherapy Trials Quality Assurance Group(国家放射治疗试验质量保证组) ; Mount Vernon Hospital(芒特弗农医院) ; University of Manchester(曼彻斯特大学)
专题命中 规划决策 :planning(abstract)
AI总结 该研究针对放疗中危及器官分割审阅耗时主观的问题,对比VAE框架与图像条件分割扩散模型,发现后者能更一致地定位细微边界错误,为分割质量保证提供了有前景的框架。
Comments Submitted to the MICCAI 2026 UNSURE Workshop
用于凸多边形区域高效无线覆盖的快速改进类物理动态算法
专题命中 规划决策 :planning(abstract)
AI总结 针对凸多边形无线节点部署问题,提出改进类物理动态算法IQPD,通过保结构初始化、精细化虚拟力模型与边界环绕策略,实现更高的覆盖率与节点利用率,性能优于多种元启发式算法。
通过Real2Sim动力学估计与强化学习增强力矩控制机器人的Sim2Real迁移
机构 * University of Bologna(博洛尼亚大学) ; University of Twente(特文特大学)
专题命中 规划决策 :agent(abstract)
AI总结 本研究提出Real2Sim2Real流水线,结合轨迹匹配等方法校准7自由度Franka Emika Panda机器人动力学,训练TQC智能体,实现力矩控制机器人Sim2Real迁移,提升了跟踪精度与鲁棒性。
Comments 6 pages, 8 figures. Presented at the 2026 IEEE/ASME International Conference on Advanced Intelligent Mechatronics (AIM 2026)
在剩余使用寿命不确定性下整合 prognostics、维护与尾部分配:一种面向航空公司可靠性的随机优化方法
专题命中 规划决策 :planning(abstract)
AI总结 该研究针对航空公司运营中 RUL 不确定性下 TA 与 MS 单独优化的问题,提出联合整合 TA、MS 与 PdM 的随机优化框架,经真实数据验证可降低运营风险。
解析气候科学的跨学科复杂性:伏羲气候基础模型
专题命中 规划决策 :agent(abstract)
AI总结 该研究提出气候专用大型语言模型Fuxi-Climate基础模型,其在跨学科气候推理中性能更稳定,能实现高权衡覆盖度与不确定性感知推理,可为气候风险分析及智能体决策系统提供支撑。
Comments 28 pages, 17 figures
ViSMoE:面向具身指代表达接地的视觉感知稀疏混合专家模型
机构 * College of Artificial Intelligence(人工智能学院) ; Nanjing University of Aeronautics and Astronautics(南京航空航天大学)
专题命中 规划决策 :agent(abstract)
AI总结 针对现有具身指代表达接地方法无法区分视角与物体导致表示模糊的问题,提出带视觉感知路由策略的ViSMoE框架,在REVERIE和SOON数据集上性能优于现有SOTA方法。
Comments Accepted by ICANN 2025
UrbanGazeVis:用于分析城市安全感知眼动数据的可视化系统
专题命中 规划决策 :planning(abstract)
AI总结 本研究开发UrbanGazeVis可视化系统,通过30名参与者使用HoloLens 2分析150张里约街景的眼动数据,揭示注视与城市安全感知的关联,为城市设计提供见解。
Journal ref Computers & Graphics, 2026
基于自车条件生成预测的主动交互感知模型预测路径积分方法
机构 * TU Delft(代尔夫特理工大学) ; Aumovio SE(奥莫维奥股份公司) ; Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)
专题命中 规划决策 :planning(abstract)
AI总结 本文提出将自车条件生成自回归预测模型集成到MPPI控制的规划框架,通过嵌套采样评估代价与风险,使自车主动探测交互、降低歧义,仿真显示其安全效率优于传统方法。
微笑的拓扑:牙科成像中的持续同调
机构 * ETH Zürich(苏黎世联邦理工学院) ; PSU(宾夕法尼亚州立大学) ; University of Zürich(苏黎世大学) ; University of Fribourg(弗里堡大学)
专题命中 规划决策 :planning(abstract)
AI总结 该研究将拓扑数据分析中的持续同调与支持向量机结合,实现CBCT扫描中牙齿分类与诊断,准确率优于CNN,为牙科成像的自动化分析提供了新方法。
近地轨道接近满容量时的随机动力学
专题命中 规划决策 :planning(abstract)
AI总结 该研究针对近地轨道容量评估的确定性模型缺陷,构建两物种Lotka–Volterra模型的随机扩展,揭示不同时间尺度下的Kessler级联特性,指出碎片失控概率高于确定性预测,需考虑碰撞动力学方差。