Contrastive Reinforced Policy Optimization via Privileged Self-Distillation
基于特权自蒸馏的对比强化策略优化
专题命中 规划推理 :reasoning(abstract);分类 cs.LG
AI总结 该研究针对在线策略自蒸馏的暴露偏差问题,提出CRPO方法,通过对比学习与分组对比保留优化信号,在13个推理基准上提升了训练稳定性与泛化性。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
基于特权自蒸馏的对比强化策略优化
专题命中 规划推理 :reasoning(abstract);分类 cs.LG
AI总结 该研究针对在线策略自蒸馏的暴露偏差问题,提出CRPO方法,通过对比学习与分组对比保留优化信号,在13个推理基准上提升了训练稳定性与泛化性。
规模化的记忆解码器:一种预训练的参数化长期记忆
专题命中 规划推理 :reasoning(abstract);分类 cs.CL
AI总结 本研究将记忆解码器扩展至69亿参数并在3000亿token上预训练,通过分布式Faiss等技术解决索引瓶颈,发现独立扩展记忆可更高效提升语言模型性能,在多基准测试中验证了其优势。
SAFViT:用于基于视觉Transformer的细胞核分割与分类的空间注意力融合门控
机构 * School of Computer Science, University of Leeds(利兹大学计算机学院)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 本研究针对数字病理学中细胞分割与分类的冗余信息问题,提出SAF门控模块替换CellViT的传统跳跃连接,在PanNuke和MoNuSeg数据集上使mPQ达0.471,死亡类F1分数提升14.5个百分点。
心理世界建模
专题命中 规划推理 :planning(abstract);分类 cs.CL
AI总结 该研究提出将心理变量作为核心组件的MWM框架,实例化为MENTIS基线,实验证明显式建模心理状态对预测人类决策至关重要,推动世界建模从物理场景模拟转向心智模拟。
Comments project website: https://mental-world.github.io/
面向临时团队中任务无关适应的伙伴能力估计
机构 * King’s College London(伦敦国王学院)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 该研究针对临时团队协作中伙伴能力隐藏与人类行为不可预测问题,提出CE-CM及CE-CM-Div方法,通过仿真采样与多样规划器rollout实现任务无关的能力估计,提升了团队协作的可行性与鲁棒性。
Comments 44 pages, 18 figures, submitted
AgentMap:用于本体匹配的联合等价与包含关系发现
机构 * The University of Manchester(曼彻斯特大学) ; Zhejiang University(浙江大学)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出统一等价与包含发现的混合本体匹配任务,构建基于LLM的多智能体框架AgentMap,在三类设置下的本体匹配任务中均取得优异性能。
Comments 21 pages, 5 figures
用于连贯急诊科预测的分层时空Transformer
机构 * Institute for Systems and Robotics(系统与机器人研究所) ; LARSyS ; Instituto Superior Técnico(高等技术学院) ; NOVA School of Science and Technology(NOVA科学技术学院)
专题命中 规划推理 :planning(abstract);分类 cs.LG
AI总结 该研究针对现有急诊科预测方法忽略层级关联导致预测不连贯的问题,提出HierSTT分层时空Transformer框架,在葡萄牙ED数据集上实现多层面连贯预测,性能优于非分层基线及经典分层协调方法。
Comments Accepted at 11th Workshop on Data Science for Social Good - ECML PKDD 2026
检测AI智能体需要什么?浏览器自动化下行为检测的最小特征集
机构 * Technical University of Munich(慕尼黑工业大学) ; Kontext
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 该研究提出三类检测框架区分人类、机器人与AI智能体,发现最小特征集可实现AI智能体的稳健检测,且基于浏览器自动化的缺失特征构建判别信号,抗规避能力优异。
Comments 17 pages (11 main + appendices), 7 figures. Accepted at the North East AI Agents Day 2026 workshop, Jane Street, New York City. Workshop: https://ne-agents-day.github.io/
面向对话式AI智能体的原生图双时态内存存储
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 该研究针对对话式AI智能体跨会话持久内存缺失的问题,提出原生图双时态内存存储方案,经LongMemEval基准测试,在知识更新等任务上取得良好效果,为纯检索的局限性提供了改进方向。
使用和评估生成式人工智能工具以支持系统文献综述的初步指南
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 研究探讨如何用GenAI支持系统文献综述,通过快速审查、思想实验等方法,识别评估GenAI用于SLRs的问题及过程要点,形成GUEST建议,助研究人员利用GenAI开展可靠综述与评估研究,强调其需人工监督及能提供成本效益帮助。
Comments 58 pages, 2 figures, 11 tables
当记忆成为媒介时会失去什么?评估人工智能生成的口述历史可视化
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 研究散居海外者口述历史可视化中记忆变媒介时的问题,基于口述历史理论设计指标,比较两种管道,发现场景规划与叙事保留冲突,提出基于失败模式的评估框架、冲突分析及系统选择路由协议。
Comments Accepted at ICML 2026 Workshop on Culture x AI: Evaluating AI as a Cultural Technology
OmniQEC:通过人工智能科学家发现实用的量子纠错码
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 研究旨在发现实用量子纠错码,核心方法是用OmniQEC,它结合自我进化推理与慢快协同工作流程,通过代码级代理探索候选方案并经电路级评估反馈证据。贡献是发现的代码性能优且硬件友好,为大语言模型辅助量子纠错发现奠基。
Comments Comments are welcome
评估可解释人工智能对人工智能辅助代码审查中信任的影响
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 研究可解释人工智能(XAI)对开发人员在人工智能辅助代码审查中信任的影响,通过对34名参与者的受试者内用户研究,比较不同XAI支持水平的系统,发现解释水平显著影响信任和认同,结果为可信代码审查系统设计等研究提供信息。
Comments 23 pages, 4 figures, 5 tables. To appear in Proceedings of the ACM on Software Engineering (PACMSE), Vol. 3, No. ISSTA, Article ISSTA093 (ISSTA 2026). Published under CC BY 4.0. Replication package: https://doi.org/10.5281/zenodo.21457282
从专有模型到开源模型:通过智能体搜索中的多智能体协议蒸馏弥合分布差距
机构 * Beijing Institute of Technology(北京理工大学) ; East China Normal University(华东师范大学) ; University of Science and Technology of China(中国科学技术大学) ; Tsinghua University(清华大学) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 研究旨在弥合专有与开源模型分布差距,提出多智能体协议蒸馏(MAPD)框架,利用结构化协议作中间表示,结合蒸馏与强化学习,在问答基准测试中表现出色,有效减轻学生策略问题,优于其他竞争方法。
从认知架构到语言智能体:谱系、融合与迁移差距的机制层面综述
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 该综述连接多个认知架构与语言智能体系统,重构机制并编码相关关系,指出现代智能体部分功能已实现,最强机会在机制耦合,存在五个剩余组合,贡献了机制目录、证据深度框架及可证伪议程。
Comments 28 pages, 9 figures, 14 tables. Review article
SCTA:一种用于从单细胞RNA测序中稳定且可解释地发现靶基因的智能体框架
机构 * Novartis Biomedical Research(诺华生物医学研究公司)
专题命中 规划推理 :reasoning(abstract);分类 cs.LG
AI总结 研究旨在从scRNA-seq数据中稳定且可解释地发现靶基因,提出SCTA智能体框架,将靶标发现分解为专门智能体并结合结构化证据约束推理,通过遗传性慢性胰腺炎研究验证其能提高靶标发现的多项性能。
Comments 10 pages, 4 figures. To appear in the ACM SIGKDD Workshop on Data Mining in Bioinformatics (BioKDD 2026)
ACM:长期任务的智能体上下文管理
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Meta
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 研究长期智能体任务上下文管理问题,提出ACM框架,受人类记忆启发让智能体自主管理上下文,还开发训练后管道,能提升模型在相关任务上的性能,有效管理上下文可降低压力、实现扩展探索并产生更一致方案。
用于视觉语言模型智能体强化学习的统一评论家混合优势估计
机构 * KAUST(沙特阿卜杜拉国王科技大学)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 研究视觉语言模型智能体强化学习,提出HyGAE框架,用统一评论家估计值,推导混合优势联合优化令牌和轮次级目标,在多轮决策环境评估中平均成功率91%,比其他方法显著提升10%,证明混合优势解析形式对优化关键。
Comments Accepted by ECCV 2026
评估大语言模型作为动态系统的可解释控制器
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 研究探讨大语言模型能否成为动态热环境的可解释控制器,评估五个不同规模模型在多场景下的表现。结果显示控制性能与模型复杂度有关,高复杂度模型表现更佳,整合物理模型可提升性能,还揭示了不同规模模型推理的进展,为混合控制策略提供机会。
HydroAgent:将预报员专业知识形式化为技能编排的洪水预报工作流程
专题命中 规划推理 :reasoning(abstract);分类 cs.LG
AI总结 研究针对业务洪水预报中隐性预报员专业知识难形式化等问题,提出HydroAgent框架,将大语言模型嵌入洪水预报工作流程,经实验验证其有效性,能转化隐性知识为可审核流程,辅助决策并展示规则引导语言模型推理补充物理模拟的作用。
VecTree-RAG:一种结合向量和树检索的智能检索增强生成框架,以提高效率和准确性
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 研究针对科学问答中识别相关论文及找支持证据的问题,提出VecTree-RAG框架,结合向量与树检索机制。经多组问题评估,该框架在多个基准上获高分,证据页面精度高,且完整架构所需推理令牌少,为科学文献问答提供结构感知且可追溯的架构。
一种用于自主边缘资源分配的自校准智能体人工智能框架
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 针对大语言模型驱动系统运行可靠性受挑战的问题,提出自校准智能体人工智能框架,设计自校准机制,应用于边缘计算网络零知识工作负载资源分析,提高预测准确率和速度,为自主人工智能部署奠定基础,且生成基本事实速度更快。
Comments This work has been submitted to the IEEE Transactions on Network and Service Management for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible
ToolGuardian:人工智能代理与工具交互的声明式安全
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 研究人工智能代理与工具交互安全问题,提出ToolGuardian框架,通过预准入审查和任务感知运行时授权保障安全,利用渐进式特征化和基于ASP的声明式策略层,实验表明该框架在审查和授权方面性能良好。
用于智能工作流合成的拓扑与执行耦合分层搜索
机构 * Baylor University(贝勒大学) ; NEC Laboratories America(美国NEC实验室) ; University of Arkansas(阿肯色大学) ; Southern Illinois University(南伊利诺伊大学)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 针对大语言模型结构化工作流创建自动化难题,提出拓扑与执行耦合的搜索范式,引入HierFlow架构,通过反馈引导拓扑调整与树搜索优化子工作流,经多基准测试验证其性能优于基线,平衡了质量与效率且无需额外训练。
智能体上下文管理:将智能体内存和成本视为生命周期和架构问题来解决
机构 * Maximem
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 研究生产型人工智能智能体因无法管理推理上下文而失败的问题,提出智能体上下文管理(ACM),分解为五个原语,经经济分析和参考实现验证,在特定配置下取得较好结果,还指出了现有基准未涵盖的维度及上下文前沿。
Comments 23 pages, 6 figures, 4 tables. Evaluation harness and study data: github.com/maximem-ai
ICAE-Bench:将编码智能体评估为交互式项目构建者
机构 * Meituan(美团)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 研究针对编码智能体在交互式项目构建中作用转变,现有基准未跟上的问题,提出ICAE-Bench基准。从模糊需求出发,经自动化用户智能体模拟动态范式,引入避免需求模糊性、确保用户模拟质量、公平评估开放式仓库的关键设计。
SafeStep:为体弱或痴呆老年人提供的人工智能旅行辅助
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 针对体弱或痴呆老人出行难题,SafeStep利用旅行图表示,结合大语言模型与Anticip8行为预测引擎,生成个性化失败场景并提出干预措施。经实验和实地研究评估,结合两者的方法性能可靠,虽界面可用性待改进,但能提升旅行信心与安全感,还可拓展应用于其他领域。
GuardianAgentBench:智能体何处失败及如何防范
机构 * Vectara, Inc.(Vectara公司) ; Anthropic(Anthropic公司) ; OpenAI(OpenAI公司) ; Google DeepMind(谷歌DeepMind) ; DeepSeek-AI(DeepSeek人工智能公司)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 研究大语言模型智能体安全可靠行为问题,提出GuardianAgentBench基准测试,含多阶段验证和攻击模式。实验发现模型有两种失败模式,性能随工具集和轮次深度下降。护栏实现优于系统提示防御,证明执行时结构干预可提升安全性且不影响正确行为。
用于证据感知材料文献分析的技能收缩代理
专题命中 规划推理 :reasoning(abstract);分类 cs.CL
AI总结 研究针对材料科学文献分析难题,提出技能驱动的AlphaAgent框架,通过明确技能契约解耦任务。其含专门检索技能和报告生成技能,在盲评中显著优于基线系统,提升了文献分析效果。
Comments 9 pages, 5 figures
MOF-Sleuth:用于可解释细粒度MOF CIF审核的工具基础奖励对齐
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 研究针对MOF数据库CIF输入错误影响下游结果及人工检查的问题,提出MOF-Sleuth,通过强化引导CIF审核代理的两个模块,利用奖励引导强化学习将工具测量转化为监督,提升检测、归因及解释质量,在多基准测试中性能领先。