Self-Improving AI Agents through Self-Play
通过自play实现自我改进的AI代理
专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种通过自play实现自我改进的AI代理框架,通过GVU算子和方差不等式理论,统一了语言自play、自我修正和合成数据 bootstrap 的研究。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
通过自play实现自我改进的AI代理
专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种通过自play实现自我改进的AI代理框架,通过GVU算子和方差不等式理论,统一了语言自play、自我修正和合成数据 bootstrap 的研究。
IACT:一种自组织递归模型用于通用人工智能代理:kragent.ai背后架构的技术白皮书
专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI、cs.SE
AI总结 IACT是一种通过用户对话自主生成递归代理拓扑的通用人工智能代理模型,旨在解决传统静态工作流的局限性,并通过双向对话实现运行时错误修正。
Comments 13 pages, 2 figures, 1 table
NeLLCom-Lex: 一种神经代理框架用于研究词汇系统与语言使用之间的相互作用
机构 * Center for Language and Cognition, University of Groningen(语言与认知中心,格罗宁根大学) ; Department of Translation and Language Sciences, Universitat Pompeu Fabra(翻译与语言科学系,庞培法拉大学) ; Leiden Institute of Advanced Computer Science, Leiden University(莱顿高级计算机科学研究所,莱顿大学) ; Catalan Institution for Research and Advanced Studies (ICREA)(加泰罗尼亚研究与高级科学研究所(ICREA))
专题命中 Agent评测 :agent(title,abstract);分类 cs.CL
AI总结 NeLLCom-Lex通过神经代理框架模拟词汇系统演变,研究词汇与语言使用间的相互作用及语义变化机制。
Comments Findings of EMNLP 2025
EZYer: 一种高中学校的模拟体与生成代理
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 EZYer通过生成代理技术模拟高中教学环境,提供结构化教学材料和互动笔记生成,确保学术严谨性和教学适宜性,实验表明其生成内容质量高,应用前景广阔。
Comments AgentIR@SIGIR 2025
探讨一种由治疗陪伴代理交付的整合数字干预措施对有抑郁症状的年轻成人效果:概念验证研究
专题命中 Agent评测 :agent(title,abstract)
AI总结 本研究开发了一种基于治疗陪伴代理的数字干预措施,通过整合生态瞬间评估、干预、行为激活和游戏化,验证了其对轻度至中度抑郁症状年轻成人抑郁症状和生活质量的改善效果。
当拒绝失效时:长上下文LLM代理中的不稳定安全机制
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 研究发现长上下文LLM代理在性能和拒绝率上存在不稳定安全问题,揭示了评估长多步骤任务代理安全性的挑战。
Comments 12 pages, 11 figures. Accepted at AAAI 2026 TrustAgent Workshop
通过知识引导语言模型反馈增强双钙钛矿的条件生成
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG
AI总结 本研究提出了一种多智能体框架,通过知识引导的文本梯度提升双钙钛矿生成的稳定性与有效性。
具有图RAG的PersonaAgent:面向个性化LLM的社区感知知识图谱
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG
AI总结 PersonaAgent结合图RAG技术,通过构建社区感知的知识图谱,提升个性化LLM在新闻分类、电影标签和产品评分任务中的性能。
对财富管理流程的LLM代理进行基准测试
机构 * Rory Milsom(独立研究者)
专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI
AI总结 本研究通过构建12个任务对的基准,评估通用LLM代理在财富管理任务中的准确性和经济性,发现其性能受自主性水平和工作流程可靠性影响显著。
Comments 56 pages, 8 figures, The University of Edinburgh
Feed-O-Meter:探究AI生成的指导者人设作为交互代理在支架设计反馈实践中的应用
专题命中 Agent评测 :agent(abstract);AI agent(abstract)
AI总结 Feed-O-Meter通过AI代理帮助学生练习设计反馈,提升其反馈能力和反思能力。
自主单交叉口交通流的公平性与效率干预策略
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract)
AI总结 本文提出了一种基于混合整数线性规划的干预策略,用于在无信号灯的交叉口上优化自主代理的公平性与效率,通过仿真验证早干预和公平性意识控制的效果。
具有多阶段验证的相适应LLM框架用于施工机器人任务分配:与传统优化算法的系统基准测试
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出LTAA框架,结合LLM推理与结构化验证,实现施工机器人任务分配的高效协调,展示LLM在任务分配中的优越性能和可解释性。
通过在线模型选择改进强化学习的训练机制
机构 * Boston University(波士顿大学) ; Broad Institute of MIT and Harvard(MIT和哈佛大学Broad研究所)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出通过在线模型选择改进强化学习训练,提升效率和性能,探讨了资源分配、非平稳动态适应及训练稳定性等理论问题,并通过实验验证。
软件的进化生态:约束、创新与人工智能颠覆
专题命中 Agent评测 :agent(abstract);分类 cs.SE
AI总结 本文研究软件进化生态,探讨人工智能驱动开发工具对软件创新和文化演变的影响。
Comments This article is a contributed chapter to the SFI edited volume: The Economy as a Complex Evolving System, Part IV (2025)
最小最大假设检验用于布雷德利-蒂尔-刘模型
机构 * Department of Computer Science and the Elmore Family School of Electrical and Computer Engineering, Purdue University(计算机科学系和埃尔莫尔家族电气与计算机工程学院,普渡大学)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文提出了一种基于最小最大理论的假设检验方法,用于判断给定的成对比较数据是否源自布雷德利-蒂尔-刘模型,并通过实验验证了该方法的性能。
Comments 41 pages, 5 figures
Journal ref IEEE Transactions on Information Theory, vol. 71, no. 12, December 2025
QJoin: 基于强化学习的变换感知可连接数据发现
机构 * Cornell University(康奈尔大学)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 QJoin通过强化学习框架学习并重用变换策略,提升连接发现的准确性和效率。
TradeTrap: LLM-based Trading Agents 是否 truly 可靠和忠实?
机构 * Shanghai AI Laboratory(上海人工智能实验室)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 TradeTrap 提出了一种统一的评估框架,用于系统性压力测试基于 LLM 的交易代理,揭示其在系统级扰动下的鲁棒性问题。
学习大规模多任务世界模型用于连续控制
机构 * University of California San Diego(加州大学圣地亚哥分校)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 Newt通过大规模预训练和在线交互,实现智能体在数百个任务上的多任务学习,提升连续控制的效率和适应性。
Comments Webpage: https://www.nicklashansen.com/NewtWM
基于微调小语言模型的网络自配置
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出SLM_netconfig,一种基于微调小语言模型的网络自配置框架,通过参数高效适应技术实现高效、准确且隐私保护的本地化配置生成。
Comments 16 pages, 11 figures, 3 tables
PPTBench: 向大语言模型在PowerPoint布局和设计理解的全面评估迈进
机构 * University of Science and Technology of China(中国科学技术大学) ; State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)
专题命中 Agent评测 :planning(abstract)
AI总结 PPTBench通过全面评估大语言模型在PowerPoint布局和设计理解上的能力,揭示了当前模型在视觉布局推理和生成中的不足。
输入顺序影响多文档摘要中LLM语义对齐
机构 * University of Zurich(苏黎世大学)
专题命中 其他Agent :agentic(abstract);分类 cs.CL
AI总结 研究发现输入顺序显著影响LLM在多文档摘要中的语义对齐,优先位置的文章对摘要的语义相似性有显著影响。
Comments 9 pages, 3 figures, 2 tables