Agents of Chaos
混沌的代理
专题命中 记忆与上下文管理 :agent(abstract);tool use(abstract);分类 cs.AI
AI总结 研究探讨自主语言模型代理在真实环境中的行为,揭示安全、隐私和治理漏洞,呼吁跨学科关注。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
混沌的代理
专题命中 记忆与上下文管理 :agent(abstract);tool use(abstract);分类 cs.AI
AI总结 研究探讨自主语言模型代理在真实环境中的行为,揭示安全、隐私和治理漏洞,呼吁跨学科关注。
关于观察与语义的动力学
机构 * Bytedance Seed(字节跳动种子)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出智能是物理可实现的代理属性,通过语义常数 B 限制信息处理复杂性,强调语言和逻辑是本体论必要性。
CNOT最小电路综合:一种强化学习方法
机构 * Ca' Foscari University of Venice(威尼斯Ca' Foscari大学) ; University of Udine(乌迪内大学) ; University of Naples Federico II(那不勒斯费德里科二世大学) ; IT University of Copenhagen(哥本哈根IT大学)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI
AI总结 本文提出了一种基于强化学习的CNOT门最小化方法,通过单一代理处理不同规模的电路,有效提升了算法性能。
重新思考基于强化学习的深度研究代理的设计
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI
AI总结 本文提出了一种基于强化学习的深度研究代理设计,通过改进奖励机制、训练算法、样本过滤和测试策略,实现了在多个基准测试中的最优性能。
用于恶意软件分析的可解释性内存取证方法
专题命中 记忆与上下文管理 :workflow(abstract)
AI总结 本文提出了一种基于AI的可解释内存取证方法,利用大语言模型解释内存分析结果并提取入侵指标,提升恶意软件分析的可解释性和实用性。
对始终S连接的时间图的探索
专题命中 记忆与上下文管理 :agent(abstract)
AI总结 本文研究了始终S连接时间图的探索问题,提出了一种新的方法,能够高效地探索具有特定结构的时间图。
基于扩散模型的人体网格恢复中的群体偏好对齐
机构 * Nanyang Technological University(南洋理工大学) ; HKUST(GZ)(香港科技大学(广州)) ; SenseTime Research(商汤科技研究院) ; A*STAR(新加坡科技研究局)
专题命中 记忆与上下文管理 :agent(abstract)
AI总结 本文提出了一种基于群体偏好的扩散模型微调框架,通过双内存增强的批评代理生成质量评分,提升人体网格恢复的物理合理性和图像一致性。
Comments Accepted to CVPR 2026
动作-动态建模与跨时间交互用于在线动作理解
机构 * School of Computing and Mathematical Sciences, University of Leicester, United Kingdom(莱斯特大学计算与数学科学学院) ; School of Eye and Vision Sciences, University of Liverpool, United Kingdom(利物浦大学眼科学与视觉科学学院) ; School of Information Science and Engineering, University of Jinan, China(济南大学信息科学与工程学院) ; School of Automation and Information Engineering, Xi’an University of Technology, China(西安理工大学自动化与信息工程学院)
专题命中 记忆与上下文管理 :agent(abstract)
AI总结 本文提出状态特定模型(SSM)用于统一动作检测与预见,通过关键状态压缩、动作模式学习和跨时间交互模块,提升动作理解性能。
Comments 10 pages, 9 figures
MAS-FIRE:基于大语言模型的多智能体系统故障注入与可靠性评估
机构 * Sun Yat-sen University(中山大学)
专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.SE
AI总结 MAS-FIRE通过故障注入和分层分析,揭示多智能体系统在容错和鲁棒性方面的关键因素,为提升系统可靠性提供系统性方法。
代理问题框架:一种系统化的方法用于工程可靠领域代理
机构 * Institute of Engineering Research(工程研究所) ; Seoul National University(首尔国立大学)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI
AI总结 本研究提出代理问题框架(APF),通过系统化工程方法提升领域代理的可靠性,结合AJD规范工具和AVR循环实现任务要求的渐近收敛。
Comments 18 pages, 2 figures
DREAM: 基于代理度量的深度研究评估
机构 * AWS Agentic AI(AWS敏捷人工智能) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool-use(abstract);分类 cs.AI
AI总结 DREAM提出一种基于代理度量的深度研究评估框架,通过能力平衡原则解决现有基准在事实和时间衰减检测上的不足,实现可扩展的无参考评估。
OpenClaw AI Agents作为Moltbook中的非正式学习者:在大规模层面表征一个涌现的学习社区
机构 * Carnegie Mellon University(卡内基梅隆大学) ; GiveRep Labs(GiveRep实验室)
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI
AI总结 研究通过分析Moltbook中由AI代理组成的非正式学习社区,发现参与不平等、广播倒置和参与生命周期等特征,揭示了大规模AI学习社区的动态模式。
Comments 10 Pages
超越单一通道代理基准测试
机构 * Florida State University(佛罗里达州立大学)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 本文提出通过人类-人工智能双元组的可靠性评估代理安全性,强调不相关错误模式对风险降低的重要性,以改进AI安全性评估方法。
Comments 8 pages; 1 figure; 1 table
AgenticSum: 一种用于临床文本忠实总结的代理推理框架
机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) ; School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) ; University of Delaware, Newark, DE, USA(特拉华大学)
专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.CL
AI总结 AgenticSum通过代理推理框架提升临床文本摘要的准确性与一致性。
财产回收激励与社会互动对自然灾害中自我撤离决策的影响:基于代理的建模方法
专题命中 Agent评测 :agent(title,abstract)
AI总结 本文通过基于代理的建模方法,研究了财产回收激励和社会互动对自然灾害中家庭撤离决策的影响,发现社会网络结构和优先级设置对撤离率有显著影响。
Comments 21 pages, 9 figures
面向可解释和可争议法律推理的 Arena 基础论证 LLM 自适应协作
专题命中 Agent评测 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.AI
AI总结 ACAL通过自适应多智能体协作和 Arena 基础论证框架,提升法律推理的可解释性和可争议性,实验证明其在效率和透明度上的优势。
AI代理生产力指数(APEX-Agents)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 APEX-Agents是一个评估AI代理执行长期跨应用任务的基准,通过测试八个代理展示了Gemini 3 Flash的高分表现,并开源了相关资源和基础设施。
通用大语言模型代理的基准测试时间扩展
机构 * Language Technologies Institute, School of Computer Science, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) ; Meta
专题命中 Agent评测 :agent(abstract);tool-use(abstract);分类 cs.AI、cs.CL
AI总结 研究提出General AgentBench基准测试,用于评估通用大语言模型代理在多个技能和工具上的表现,发现顺序和并行扩展方法在实际应用中均存在性能限制。
Emotion-LLaMAv2 和 MMEVerse:多模态情感理解的新框架和基准
机构 * Shenzhen Technology University(深圳技术大学) ; Shenzhen University of Information Technology(深圳信息科技学院) ; University of Washington(华盛顿大学) ; Foundation Model Team, Meituan(美团基础模型团队) ; National University of Singapore(新加坡国立大学) ; Tongji University(同济大学)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 Emotion-LLaMAv2和MMEVerse通过端到端多视图编码器、Conv Attention预融合模块和课程指令调制方案,提升了多模态情绪理解和推理能力,并构建了统一的多模态情绪基准。
解释是一种手段:决策理论解释评估
专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI
AI总结 本文提出了一种决策理论框架,用于评估解释的价值,通过理论基准、人类互补价值和行为价值三个估计目标,评估解释对决策任务的改进效果。
Ambig-SWE: 交互式代理以克服软件工程中的不充分性
机构 * Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 Ambig-SWE研究LLM代理在交互式代码生成中处理不充分指令的能力,通过检测不充分性、提问澄清和利用交互提升性能,发现交互能显著提高74%的性能。
Comments 22 pages, 7 figures, Accepted at ICLR 2026
基于LLM的频率感知流扩散模型:用于自然语言引导的电力系统场景生成
专题命中 Agent评测 :agent(abstract);planning(abstract)
AI总结 本文提出LLM赋能的频率感知流扩散模型,通过自然语言引导生成多样可控的电力系统场景,提升生成效率和质量。
故事并非科学:基于执行的机制可解释性研究评估
机构 * University of Chicago(芝加哥大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 Agent评测 :AI agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出基于执行的评估框架,通过代码和数据验证机制可解释性研究的严谨性,发现大量方法学问题,展示AI在研究评估中的潜力。
Comments Our code is available, see https://github.com/ChicagoHAI/MechEvalAgent/
RDBLearn: 关系数据库中的简单上下文预测
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 RDBLearn通过关系数据库中的上下文学习方法,实现了对多表关联数据的高效预测,优于传统监督基线。
SOP-Bench:复杂工业SOP用于评估LLM代理
机构 * Amazon(亚马逊公司) ; ex-Amazon(前亚马逊)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 SOP-Bench通过真实工业SOP任务评估LLM代理性能,揭示模型升级和领域影响的复杂性。
Comments Under review
为优化低技能用户策略的个性化帮助
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 本文提出通过CICERO生成个性化建议,帮助低技能玩家在Diplomacy游戏中提升策略表现,即使玩家不遵循建议,其存在也具有优势。
Comments 9 pages, 3 figures
符合信号时间逻辑用于鲁棒强化学习控制:一个案例研究
机构 * ICASSP 2026
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文提出一种符合STL的屏蔽,用于增强强化学习在航空航天中的鲁棒性和安全性,通过实验验证其在复杂环境下的有效性。
Comments 6 pages, 2 figures
通过用户-助手模拟开发前瞻性与个性化的人工智能助手
机构 * KAIST(韩国科学技术院)
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 ProPerSim通过用户-助手模拟框架开发了能够主动和个性化推荐的AI助手,实验显示其在多样化的用户场景中有效提升了用户满意度。
Comments Accepted at ICLR 2026
当LLM偏好预测下游行为时是什么情况?
机构 * UK AI Security Institute(英国人工智能安全研究所)
专题命中 Agent评测 :agentic(abstract);分类 cs.AI
AI总结 研究发现LLM的偏好能预测捐赠建议,但对任务表现的影响不一致。
Comments 31 pages, 16 figures
Perlin噪声作为AI协调器
机构 * McGill University(麦吉尔大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出将Perlin噪声应用于大规模AI控制,通过连续噪声场实现稳定、协调的行为生成,提升游戏AI的效率与可控性。