Towards a Bridge Layer Between Bibliographic and Formalized Mathematical Knowledge
迈向文献与形式化数学知识之间的桥梁层
专题命中 规划决策 :workflow(abstract);agentic(abstract);分类 cs.AI
AI总结 提出一个关系型桥接数据库,对齐出版物元数据与形式化工件,并引入论文级形式化评分,通过跨文档对齐估计形式化覆盖度,以整合文献与形式化数学生态系统。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
迈向文献与形式化数学知识之间的桥梁层
专题命中 规划决策 :workflow(abstract);agentic(abstract);分类 cs.AI
AI总结 提出一个关系型桥接数据库,对齐出版物元数据与形式化工件,并引入论文级形式化评分,通过跨文档对齐估计形式化覆盖度,以整合文献与形式化数学生态系统。
ReViSQL:实现人水平的文本到SQL
机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校)
专题命中 规划决策 :AI agent(abstract);workflow(abstract);分类 cs.CL
AI总结 本文提出ReViSQL框架,通过高质量训练数据提升SQL推理能力,首次在BIRD基准上达到人水平准确率,且在不同模型规模下均表现优异。
思考使大语言模型代理变得内向:强制性思考在用户参与代理中的反效果
专题命中 规划决策 :agent(abstract,abstract_cn);分类 cs.CL
AI总结 本文研究了强制性思考在用户参与代理中的反效果,发现其导致性能下降,而主动透明性可提升代理性能。
Comments 26 pages, 5 figures, 7 tables
信念-愿望-意图本体用于建模心理现实与代理
机构 * CNR - Institute of Cognitive Sciences and Technologies(CNR认知科学与技术研究所) ; CNR - Institute for Research on Population and Social Policies(CNR人口与社会政策研究所) ; CNR - Research Institute on Sustainable Economic Growth(CNR可持续经济增长研究所) ; University of Bologna - Department of Philosophy(博洛尼亚大学哲学系)
专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 本文提出了一种形式化的BDI本体,通过模块化设计模式实现信念、愿望、意图及其动态关系,结合LLMs和Semas平台验证其在认知基础和语义可互操作性中的应用。
Journal ref Journal of Web Semantics (2026) 90:100885
先反射,后反思:面向动态响应的延迟感知具身大语言模型智能体
机构 * School of Computer Science, The University of Sydney(计算机科学学院,悉尼大学)
专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI
AI总结 该研究针对动态环境中具身LLM智能体的推理延迟问题,提出RRARA智能体及相关评估指标,通过时间转换机制与预规划器实现决策质量与响应能力的平衡。
Comments Accepted by the CVPR 2025 Embodied AI Workshop
HarnessWAM:弥合世界动作模型中的预测与审议差距
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Yinwang Intelligent Technology Co., Ltd.(银湾智能科技有限公司) ; Beijing Institute of Technology(北京理工大学) ; Wuhan AI Research(武汉人工智能研究院)
专题命中 规划决策 :planning(abstract);agentic(abstract)
AI总结 针对世界动作模型的预测-审议差距,提出HarnessWAM框架,通过双时间尺度反馈环等机制,在两个基准数据集上取得最优任务成功率,扩展了WAMs的具身任务执行能力。
AI作为独立游戏开发中的民主化力量
专题命中 规划决策 :planning(abstract);agentic(abstract)
AI总结 该研究考察AI对2024-2026年游戏行业分化的影响,发现AI大幅降低独立游戏制作的协调成本,推动第三波民主化浪潮,披露AI的游戏接受度与传统游戏相当,但市场已呈现结构性过剩的前提条件。
金融领域机构准备状态的AI治理
专题命中 规划决策 :agentic(abstract,abstract_cn)
AI总结 针对金融领域智能体AI治理滞后于部署的问题,本文提出四层可计算AI治理框架,通过实证研究验证其有效性并给出90天实施序列,明确跨主体风险控制的可转移措施。
Comments 44 pages
从神经意图到加密授权:管理智能代理工作流程
专题命中 规划决策 :planning(abstract);workflow(abstract)
AI总结 研究人工智能驱动的智能代理工作流程中的安全问题,提出神经加密服务(NCS),通过神经符号设计,在大语言模型代理和特权工具间构建安全治理平面,经实验评估,能大幅降低攻击成功率,转变代理安全验证方式。
确定性视界:当扩展推理失败时工具委托变得必要
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文通过注意力瓶颈定理和确定性视界概念,证明解码器-only注意力在确定性状态追踪任务中存在信息论容量限制,导致扩展推理性能退化,并指出当视界超过19-31时工具委托成为必要。
去中心化的定义:一种本体论视角
专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.LG
AI总结 本研究针对计算机领域缺乏通用去中心化定义的问题,提出基于图的本体框架,区分去中心化与分布性,引入两个新指标并实现浏览器工具,为联邦学习等系统提供一致的去中心化评估基础。
Comments 27 pages, 6 figures, preparing for submission
Avalon-ToM-Bench:通过非对称游戏机制评估细粒度心理理论
机构 * National Taiwan University(台湾大学) ; CyCraft AI Lab(CyCraft人工智能实验室)
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL
AI总结 本文提出Avalon-ToM-Bench基准,基于阿瓦隆游戏机制评估大语言模型的细粒度心理理论,发现模型ToM能力不足源于推理策略而非知识或表征,推理训练比测试时思维链增益更显著。
《雅达利乒乓球游戏中用于世界模型的概念引导空间正则化》
机构 * UC Davis(加州大学戴维斯分校)
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG
AI总结 研究雅达利乒乓球游戏中五个视觉世界模型智能体,发现其存在诸多问题。提出概念引导空间正则化(CGSReg),实验表明该方法在部分模型中改善了闭环展开和像素空间零样本MBRL,但不能解决所有世界模型瓶颈。
Comments Revised manuscript with updated presentation
EHR-MPC:利用生成式患者数字孪生进行脓毒症治疗的推理时间控制
机构 * Broad Institute of MIT and Harvard(MIT和哈佛大学Broad研究所) ; Harvard University(哈佛大学) ; Brigham and Women’s Hospital(布莱根妇女医院) ; Technion–Israel Institute of Technology(技术学院-以色列理工学院)
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG
AI总结 针对脓毒症治疗策略有争议且现有强化学习方法适应性不足的问题,提出EHR-MPC框架,通过训练生成式电子健康记录模型形式的患者数字孪生解耦学习与治疗优化,经模拟评估性能优于强化学习基线,建立了决策通用框架。
RSPO:用于多轮语言模型智能体的奖励交换策略优化
机构 * Tencent YouTu Lab(腾讯优图实验室)
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG
AI总结 研究多轮语言模型智能体训练问题,针对稀疏结果奖励训练收敛慢等问题,提出奖励交换策略优化方法,利用密集过程奖励信息,确保轨迹多样性和目标与真实奖励一致性,提升模型性能。
人类放弃,推理模型坚持:将难度登记与深思分配分离
机构 * The University of Hong Kong(香港大学)
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL
AI总结 本文通过分离难度登记与深思分配,发现人类与大型推理模型(LRM)在问题解决中的时间/令牌分配模式相反:人类在错误问题上用时更少,而LRM在错误问题上使用更多令牌。
并非所有转折都同样困难:为高效多轮推理的自适应思维预算
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.LG
AI总结 本文提出TAB方法,通过自适应预算分配提升多轮推理效率,在数学推理基准中实现更高的准确率与token节省。
复杂逻辑指令生成
机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) ; Independent Researcher(独立研究者) ; Duke University(杜克大学) ; University of Central Florida(佛罗里达大学中央分校)
专题命中 规划决策 :agentic(abstract);分类 cs.CL、cs.LG
AI总结 本文提出LogicIFGen和LogicIFEval,用于生成和评估复杂逻辑指令,揭示了当前LLMs在复杂指令跟随上的不足。
Comments COLM 2026 Acceptance
CEAA:面向交互式计算系统的认知具身智能体架构
专题命中 规划决策 :agent(abstract);分类 cs.AI
AI总结 该研究针对具身IVAs在实时交互式虚拟环境中实现认知能力的挑战,提出基于Sense-Think-Act等框架的模块化认知架构,弥合高级推理与实时执行的差距,用于部署可扩展的具身IVAs。
基于近端策略优化(PPO)的卫星轨道优化用于空间碎片规避
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Embry-Riddle Aeronautical University(安柏瑞德航空大学)
专题命中 规划决策 :agent(abstract);分类 cs.LG
AI总结 本研究针对轨道拥堵下卫星碰撞规避难题,提出基于PPO的强化学习策略,经高保真模拟器训练,在GEO任务中碰撞规避成功率达97.5%,优于传统方法,构建了公开可用框架
Comments 18 pages, 16 figures. Published in IEEE Access, vol. 14, pp. 18138-18154, 2026
Journal ref L. Luna, J. Ortiz Couder, and R. A. Vargas-Acosta, "Satellite Trajectory Optimization via Proximal Policy Optimization for Space Debris Avoidance," IEEE Access, vol. 14, pp. 18138-18154, 2026
从语义接地到决策优化:面向长 horizon 无人机视觉语言导航的统一框架
机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) ; School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)
专题命中 规划决策 :agent(abstract);分类 cs.AI
AI总结 本文针对无人机视觉语言导航的现有问题,提出统一语义到决策框架,经实验在AerialVLN和OpenFly基准上达到SOTA性能。
Comments 10 pages, 5 figures. Accepted at ACM Multimedia 2026 (MM '26)
分层构型空间中接触感知不确定性校准的基于粒子的保形预测
机构 * University of Michigan(密歇根大学)
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 针对机器人接触障碍物时运动模型不准确、未来构型分布异常的问题,提出CaPTURe算法,实现了接触与非接触场景下的指定覆盖率要求,任务成功率较最佳基线提升30%。
Comments 31 pages, 10 figures, 5 tables. Accepted at COPA 2026 (Conformal and Probabilistic Prediction with Applications). Project page: https://um-arm-lab.github.io/capture/
面向不完整信息诊断推理的深度概率逻辑编程:以脑卒中检测为例
机构 * German University of Digital Science(德国数字科学大学)
专题命中 规划决策 :workflow(abstract);分类 cs.AI
AI总结 本研究以脑卒中检测为案例,提出结合最大熵技术与DeepProbLog的诊断系统构建方法,分析了不完整数据模型的性能及ProbFOIL 2压缩模型的潜力,拓展了神经符号方法在医疗诊断中的应用。
Comments Accepted for presentation at IJCLR 2026. This is the accepted version, _not_ the camera-ready version for the post-proceedings of the conference
不值得再增加一个Token:面向高效深度研究智能体的边际价值估计
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Adobe Research(奥多比研究院)
专题命中 规划决策 :agentic(abstract);分类 cs.AI
AI总结 该研究针对长周期研究智能体的上下文冗余问题,系统比较不同阶段的剪枝策略,发现早期剪枝可大幅降本,轻量级启发式方法能减73%Token用量且质量损失小,为高效智能体设计提供指导。
长SKILL合规性检测作为逻辑推理:基于闭包的检测与尺度引导的在线策略蒸馏
机构 * Meituan(美团)
专题命中 规划决策 :agent(abstract);分类 cs.AI
AI总结 针对长SKILL合规性检测的成本与精度矛盾,提出SkillCDG框架,结合两级检索与依赖闭包实现检测,在多数据集上优于基线,还发现尺度趋势以优化小模型性能。
CORDA:面向大语言模型的以伤害为核心的分层道德推理基准
机构 * University of the Witwatersrand(威特沃特斯兰德大学)
专题命中 规划决策 :agent(abstract);分类 cs.AI
AI总结 研究提出CORDA基准,评估大语言模型的以伤害为核心的分层道德推理,发现多数模型优先避免直接个人伤害,部分模型无法遵循指定优先级,该基准填补了LLM道德评估的核心空白。
Comments 8 pages, 6 figures. Accepted at the Fourth International Workshop on Value Engineering in AI (VALE 2026), affiliated with IJCAI-ECAI 2026
DA-NBV:一种用于海上船舶高效3D重建的方向感知最优下一个视点规划器
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 针对海上船舶3D重建中现有NBV策略忽略方向观测历史的问题,本文提出DA-NBV策略,结合PAF等方法,在SeaShip-3D数据集与仿真环境下实现了更高效的船舶3D重建性能。
Comments 16pages, 11 figures
KGCache:基于大型语言模型的知识图谱推理的摊销子图检索
机构 * Texas A&M University(得克萨斯农工大学)
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 本研究针对KGQA中重复检索知识图谱邻域的问题,提出兼容ToG与RoG范式的KGCache,经在WebQSP和CWQ上评估,可显著加速知识图谱检索。
Comments 11 pages, 5 figures
CausalNav:用于物理参数偏移下控制的可靠性可验证因果世界模型
机构 * University of Wollongong(卧龙岗大学) ; CSIRO’s Data61(联邦科学与工业研究组织Data61) ; Adelaide University(阿德莱德大学)
专题命中 规划决策 :agent(abstract);分类 cs.AI
AI总结 本文提出CausalNav控制器,其结合因果转移图与多门控可靠性验证机制,在物理参数偏移的CartPole-v1和Pendulum-v1任务上,较9种基准取得最佳平均排名,关键在于经认证的弃权(不执行)提升了部署安全性。
平均奖励强化学习的有限常数前沿与可审计后悔证书
机构 * Iowa State University(爱荷华州立大学) ; BRAC University(BRAC大学)
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 本文针对平均奖励强化学习,提出感知常数的比较协议,推导通信MDP的有限下界证书,改进已发表系数,给出跨度约束乐观学习者的可审计组合规则,完成相关形式化与诊断测试。