Extending Environments To Measure Self-Reflection In Reinforcement Learning
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
Comments 24 pages, 2 figures, 1 table, 2 listings
Journal ref Journal of Artificial General Intelligence, volume 13, 2022
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
Comments 24 pages, 2 figures, 1 table, 2 listings
Journal ref Journal of Artificial General Intelligence, volume 13, 2022
上下文作为环境:面向长程智能体的程序化上下文管理
机构 * Alibaba Group(阿里巴巴集团) ; Columbia University(哥伦比亚大学)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI
AI总结 本研究提出名为Scroll的上下文管理器,将智能体会话视为可执行环境,结合事件日志与Python内核实现程序化上下文管理,在多个长程智能体基准测试中大幅超越现有最优系统。
一种用于机器人行为的基于fNIRS引导的强化学习的离线方法
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI
AI总结 研究利用fNIRS脑信号调节机器人模拟学习的可行性,比较不同交互任务训练的智能体,测试多种增强强化学习算法的方法,发现该框架能有效利用神经信号增强学习,还可离线学习,为特定场景提供替代方案。
Comments Preliminary results
无对称可塑性的前向与反向延迟驱动海马重放
专题命中 记忆与上下文管理 :planning(abstract)
AI总结 提出延迟耦合的CA3神经场模型,证明无论对称或不对称可塑性均可实现双向海马重放,推导动力学低维描述并分析重放速度稳定性,为双向重放的机制提供新解释。
Comments 15 pages, 16 figures
MomADv2:面向端到端自动驾驶的可靠时序记忆
专题命中 记忆与上下文管理 :planning(abstract)
AI总结 针对自动驾驶时序记忆易失效的问题,提出 MomADv2 框架,含选择性记忆查询模块与流匹配残差修正器,在多数据集上使碰撞率降 15.6%。
Comments 16 pages, 6 figures
是什么让初始反应适合讨论?:用于立场反思与写作的多角色AI支持
专题命中 记忆与上下文管理 :workflow(abstract)
AI总结 本研究提出多角色AI工具StanceLab,通过对比三角色模式与独立LLM模式的试点,明确了设计需求并规划了未来工作流,助力用户准备讨论立场。
Comments 5 pages, 3 figures, 2 tables. Accepted to TAICHI 2026 (https://taichi2026.taiwanchi.org/program)
AffAdapt:面向流畅对话的情感驱动型自适应AI角色
专题命中 记忆与上下文管理 :agent(abstract)
AI总结 研究提出AffAdapt框架,整合多模块构建AI角色交互循环,实现流畅人机对话,在高风险对话场景验证其有效性,指出相关挑战并说明其应用场景。
Comments 3 pages, 2 figures, Adjunct Proceedings of the 39th Annual ACM Symposium on User Interface Software and Technology (UIST '26 Adjunct), Detroit, MI, USA
扩张细菌菌落的动力学:连续介质建模与分析
专题命中 记忆与上下文管理 :agent(abstract)
AI总结 本研究针对硬质基质上扩张的细菌菌落,构建含反应-扩散方程、拉普拉斯方程的移动边界连续介质模型,分析其垂直与径向扩张特性,结果与实验及智能体模拟相符。
Comments 56 pages, 10 figures
Prime Agent:一种自改进的RLM管控框架
机构 * Princeton University(普林斯顿大学) ; MIT(麻省理工学院) ; Prime Intellect
专题命中 Agent评测 :agent(title,title_cn);分类 cs.AI、cs.CL、cs.SE
AI总结 Prime Agent是一款开源RLM管控框架,通过标准化流程提升模型长周期能力,在ARC-AGI-3等任务中大幅提升性能,支持编码等工作流与并行化任务。
Comments 16 pages, 10 figures. Technical report. Code: https://github.com/PrimeIntellect-ai/prime-agent
重新审视Agentic-SQL:面向LLM文本转SQL的基于自主性的分类与实证基准分析
专题命中 Agent评测 :agentic(title,title_cn);agent(abstract_cn);分类 cs.AI
AI总结 本研究针对LLM文本转SQL领域,构建基于自主性的分类框架,通过Spider案例研究分析8B开源模型与DeepSeek-V3等基线的表现,发布工具链用于构建可追溯的基准排行榜。
基于小型语言模型的语言条件认知雷达自主智能体
专题命中 Agent评测 :agent(title,abstract);autonomous agent(title,abstract);分类 cs.AI
AI总结 本文提出一种小型语言模型驱动的自主智能体框架,作为语言条件认知雷达的智能控制器,经实验验证可在多种雷达场景下完成算法选择,且雷达特定提示与基于物理的工具执行是可靠决策的必要条件。
Comments Accepted at MLSP 2026, ATL, USA
PersonaMem-v3:面向全平台个人智能以实现全面的用户理解、推荐及智能体任务
专题命中 Agent评测 :agentic(title,abstract);AI agent(abstract);tool use(abstract);分类 cs.CL
AI总结 该研究提出PersonaMem-v3基准,用于评估全平台个人智能,助力开发兼具跨场景用户理解、可控推荐及合理个性化能力的LLM驱动智能体。
你的智能体大模型会秘密编码间接提示注入暴露的潜在信号
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI
AI总结 本文研究智能体大模型的间接提示注入暴露问题,通过探测、防御、解释三方面分析,提出AGRI防御方法,可大幅降低攻击成功率且保持任务效用
Comments v2. Compared to v1, we include the Kimi-K3 model's results and conduct a series of new experiments on understanding probe generalization
智能体自动研究即模糊测试
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL
AI总结 该研究提出自主研究智能体的“生成-排序”范式存在反馈稀疏性问题,类比灰盒模糊测试,指出自动研究需具备密集进展信号与反馈导向搜索能力,强调反馈架构是自动研究的核心瓶颈。
面向需求驱动型候选人挖掘的交互式智能体
专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.SE
AI总结 该研究针对自然语言描述的人才挖掘任务,提出首个交互式需求驱动型候选人挖掘智能体,在21个系统和691项需求上,其广度和召回率均优于现有基线模型。
Comments 12 pages
DPIAgent:面向智能体复现测试用例生成的Divide、Protocol、Isolate方法
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.SE
AI总结 DPIAgent是基于Divide、Protocol、Isolate原则的结构化智能体框架,将复现测试用例生成拆分为单目标阶段,在SWT-Bench Verified上优于七个基线方法,GPT-5成功率达81.76%,添加测试选择后升至86.17%,通用性良好。
面向安全关键多无人机系统的智能体人工智能:挑战与机遇
机构 * Aalborg University(奥尔堡大学) ; University of Southern Denmark(南丹麦大学)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI
AI总结 本文针对安全关键多无人机系统应用受限问题,结合NAMUR、PERSIST项目经验,提出将智能体AI作为社会技术设计问题,采用以人为本的迭代方法开发可迁移的概念验证系统与评估策略。
Comments 9 pages, 4 figures, presented at the AgentCraft Workshop at IUI2026 Conference, https://agentcraft-iui.github.io/2026/ - CEUR-WS.org proceedings forthcoming
SchemaRouter:面向高效异构智能体检索增强生成的字段感知工具路由
机构 * KailosLab(凯洛斯实验室)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI
AI总结 SchemaRouter是轻量级字段感知工具路由层,通过模式图实现工具与字段的精准选择,在材料科学基准中,其效率、准确率、工具精确率等表现优于基线,还能提供来源与许可信息。
Comments 13 pages, 4 figures, 6 tables. Code, benchmark, and fixtures: https://github.com/JDeun/SchemaRouter_research
智能体AI编码的安全概念与Terok环境
机构 * Center for Advanced Systems Understanding (CASUS)(高级系统理解中心(CASUS)) ; Helmholtz-Zentrum Dresden-Rossendorf (HZDR)(德累斯顿-罗森多夫亥姆霍兹中心(HZDR))
专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.SE;agent(comments);multi-agent(comments)
AI总结 本文针对智能体AI编码的IT安全风险,提出风险评估、无损失缓解概念及实现概述,助力社区安全评估该技术的应用潜力。
Comments to be published in the proceedings of the AGENSYS workshop (Workshop on Knowledge Discovery, Maintenance and Distributed Intelligence in Multi-Agent Systems) at ECML PKDD 2026 conference in Sept. 2026
无文档移动数据库中的结构推断:用于评估数字取证中智能体推理能力的可复现基准
专题命中 Agent评测 :agentic(title,abstract);agent(abstract)
AI总结 本研究构建了可复现基准,评估智能体对无文档移动数据库的结构推断能力,发现其在规则模式下可靠,模式模糊时性能骤降,需额外验证以确保推断关系可作为可靠取证证据。
Comments 10 pages, 2 figures. Published in Proc. 50th IEEE Annual Computers, Software, and Applications Conference (COMPSAC), Madrid, Spain, July 2026
Journal ref Proc. 50th IEEE Annual Computers, Software, and Applications Conference (COMPSAC), Madrid, Spain, 2026
从惯性到客观性:通过噪声隔离改进深度研究智能体
机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) ; Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团)
专题命中 Agent评测 :agent(summary_cn,abstract);分类 cs.AI
AI总结 针对深度研究智能体存在的惯性偏差问题,提出NIS-Agent方法,在网页分类和最终答案验证环节应用上下文隔离,降低33%的token成本,训练的8B模型性能可与GPT-4o相当。
Comments EMNLP 2026
训练知识库:智能体策划文档存储的监督结构学习
机构 * University of Nebraska–Lincoln(内布拉斯加大学林肯分校)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL
AI总结 该研究提出监督式结构学习方法训练知识库,以智能体策划文档存储,提升动作效率与准确率,其泛化性与键覆盖相关,欠训练的存储可通过增加训练问题进一步优化。
Comments 10 pages, 4 figures, 5 tables. Submitted to IEEE BigData 2026
K-Bench:衡量模型在真实科学智能体请求上的性能
机构 * K-Dense, Inc.(K-Dense公司)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL
AI总结 本研究构建K-Bench 01基准,评估9个前沿模型处理真实科学请求的性能,发现无模型达领域科学家接受阈值,科学准确性难度高于沟通能力,核心应关注交付、宣称与产物的联合分布。
Comments 48 pages, 17 figures
GenomeHarness:利用AI智能体实现基因组语言模型的可靠适配
专题命中 Agent评测 :agent(abstract);AI agent(abstract);workflow(abstract);agentic(abstract)
AI总结 GenomeHarness是一种智能体式工具,通过受控搜索微调方案适配基因组语言模型,在52个模型-任务设置中多数提升了测试MCC,使下游适配更可靠可审计。
Comments 10 pages, 4 figures
S²×S³上具有正截面曲率的度量
专题命中 Agent评测 :agent(summary_cn,abstract)
AI总结 Odin Automatic AI Research Agent构造S²×S²上第一陈类(1,1)的主S¹-丛,经Cheeger形变等步骤,得到S²×S³上的正截面曲率黎曼度量。
SkillAlchemy:开放世界智能体技能创建
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 SkillAlchemy是一个以准入为中心的基于源的开放世界智能体技能创建框架,在87个SkillsBench v1.1任务上,其技能通过率较无技能执行提升19.9个百分点、较最强自动化基线提升8.6个百分点,性能接近人工策划技能。
Comments 33 pages, 7 figures, 8 tables. Includes appendices
信号还是噪声?智能体在Web开发中的技能基准研究
机构 * Baidu(百度)
专题命中 Agent评测 :agent(title,abstract);分类 cs.CL
AI总结 该研究构建WebDev-Skills-Bench基准,通过实证分析Web开发智能体技能的效果,发现技能注入会降低任务性能、增加成本,提出需将技能视为特定三元组假设并建立对应评估标准。
CatchBench:智能体故障何时能被检测?
机构 * University of Southern California(南加州大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.LG
AI总结 CatchBench是首个在同一任务-方法接口下对智能体运行前、运行中、完成后三种信息状态进行评分的基准,涵盖多类模型与配置,揭示基准分数需结合标签过程才可解释。
Comments 39 pages, 6 figures, 21 tables. Work in progress. Code and data: https://github.com/yzhao062/catchbench
ClawProBench:基于运行时覆盖与冻结工作空间保留集的轨迹感知AI智能体评估
机构 * The Chinese University of Hong Kong(香港中文大学)
专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI
AI总结 该研究提出ClawProBench基准,基于OpenClaw运行时构建,通过含102场景的全配置集与68场景的冻结保留集评估AI智能体,采用安全门控公式评分,发现最终答案排行榜存在缺陷,不同评估视角的智能体排名差异显著。
Comments 29 pages, 4 figures
单独对齐,共同错位:预测大语言模型智能体群体中的对抗捕获
专题命中 Agent评测 :agent(title,abstract);分类 cs.CL
AI总结 该研究针对LLM智能体群体,提出从群体无攻击时的良性运行状态校准响应函数,可提前预测坚定少数群体引发的对抗捕获,且捕获为临时状态,孤立对齐不等同于群体对齐。