arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2025-12-03 至 2025-12-03 共收录 21 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 21 篇

2505.15216 2025-12-03 cs.CR cs.AI cs.CL cs.LG 89%

BountyBench: Dollar Impact of AI Agent Attackers and Defenders on Real-World Cybersecurity Systems

BountyBench: AI代理攻击者和防御者对现实世界网络安全系统的影响

Andy K. Zhang, Joey Ji, Celeste Menders, Riya Dulepet, Thomas Qin, Ron Y. Wang, Junrong Wu, Kyleen Liao, Jiliang Li, Jinghan Hu, Sara Hong, Nardos Demilew, Shivatmica Murgai, Jason Tran, Nishka Kacheria, Ethan Ho, Denis Liu, Lauren McLane, Olivia Bruvik, Dai-Rong Han, Seungwoo Kim, Akhil Vyas, Cuiyuanxiu Chen, Ryan Li, Weiran Xu, Jonathan Z. Ye, Prerit Choudhary, Siddharth M. Bhatia, Vikram Sivashankar, Yuxuan Bao, Dawn Song, Dan Boneh, Daniel E. Ho, Percy Liang

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 BountyBench通过评估AI代理在漏洞检测、利用和修补中的表现,揭示AI在网络安全中的影响。

Comments 113 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02731 2025-12-03 cs.AI cs.LG 81%

Self-Improving AI Agents through Self-Play

通过自play实现自我改进的AI代理

Przemyslaw Chojecki

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种通过自play实现自我改进的AI代理框架,通过GVU算子和方差不等式理论,统一了语言自play、自我修正和合成数据 bootstrap 的研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02605 2025-12-03 cs.AI cs.MA cs.SE 81%

IACT: A Self-Organizing Recursive Model for General AI Agents: A Technical White Paper on the Architecture Behind kragent.ai

IACT:一种自组织递归模型用于通用人工智能代理:kragent.ai背后架构的技术白皮书

Pengju Lu

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI、cs.SE

AI总结 IACT是一种通过用户对话自主生成递归代理拓扑的通用人工智能代理模型,旨在解决传统静态工作流的局限性,并通过双向对话实现运行时错误修正。

Comments 13 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22479 2025-12-03 cs.CL 79%

NeLLCom-Lex: A Neural-agent Framework to Study the Interplay between Lexical Systems and Language Use

NeLLCom-Lex: 一种神经代理框架用于研究词汇系统与语言使用之间的相互作用

Yuqing Zhang, Ecesu Ürker, Tessa Verhoef, Gemma Boleda, Arianna Bisazza

机构 * Center for Language and Cognition, University of Groningen(语言与认知中心,格罗宁根大学) Department of Translation and Language Sciences, Universitat Pompeu Fabra(翻译与语言科学系,庞培法拉大学) Leiden Institute of Advanced Computer Science, Leiden University(莱顿高级计算机科学研究所,莱顿大学) Catalan Institution for Research and Advanced Studies (ICREA)(加泰罗尼亚研究与高级科学研究所(ICREA))

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 NeLLCom-Lex通过神经代理框架模拟词汇系统演变,研究词汇与语言使用间的相互作用及语义变化机制。

Comments Findings of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02561 2025-12-03 cs.MA cs.AI 79%

EZYer: A simulacrum of high school with generative agent

EZYer: 一种高中学校的模拟体与生成代理

Jinming Yang, Zimu Ji, Weiqi Luo, Gaoxi Wang, Bin Ma, Yueling Deng

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 EZYer通过生成代理技术模拟高中教学环境,提供结构化教学材料和互动笔记生成,确保学术严谨性和教学适宜性,实验表明其生成内容质量高,应用前景广阔。

Comments AgentIR@SIGIR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02608 2025-12-03 cs.HC 78%

Investigating the Integrated Digital Interventions Delivered by a Therapeutic Companion Agent for Young Adults with Symptoms of Depression: A Proof-of-Concept Study

探讨一种由治疗陪伴代理交付的整合数字干预措施对有抑郁症状的年轻成人效果:概念验证研究

Youngjae Yoo, Minuk Kim, Soyoung Kim, Gayeon Lee, Jinwoo Kim

专题命中 Agent评测 :agent(title,abstract)

AI总结 本研究开发了一种基于治疗陪伴代理的数字干预措施,通过整合生态瞬间评估、干预、行为激活和游戏化,验证了其对轻度至中度抑郁症状年轻成人抑郁症状和生活质量的改善效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02445 2025-12-03 cs.LG cs.AI cs.CL 75%

When Refusals Fail: Unstable Safety Mechanisms in Long-Context LLM Agents

当拒绝失效时:长上下文LLM代理中的不稳定安全机制

Tsimur Hadeliya, Mohammad Ali Jauhar, Nidhi Sakpal, Diogo Cruz

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究发现长上下文LLM代理在性能和拒绝率上存在不稳定安全问题,揭示了评估长多步骤任务代理安全性的挑战。

Comments 12 pages, 11 figures. Accepted at AAAI 2026 TrustAgent Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22307 2025-12-03 cs.AI cs.LG 73%

Enhanced Conditional Generation of Double Perovskite by Knowledge-Guided Language Model Feedback

通过知识引导语言模型反馈增强双钙钛矿的条件生成

Inhyo Lee, Junhyeong Lee, Jongwon Park, KyungTae Lim, Seunghwa Ryu

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出了一种多智能体框架,通过知识引导的文本梯度提升双钙钛矿生成的稳定性与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17467 2025-12-03 cs.LG cs.AI 73%

PersonaAgent with GraphRAG: Community-Aware Knowledge Graphs for Personalized LLM

具有图RAG的PersonaAgent:面向个性化LLM的社区感知知识图谱

Siqi Liang, Yudi Zhang, Yue Guo

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 PersonaAgent结合图RAG技术,通过构建社区感知的知识图谱,提升个性化LLM在新闻分类、电影标签和产品评分任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02230 2025-12-03 cs.AI 70%

Benchmarking LLM Agents for Wealth-Management Workflows

对财富管理流程的LLM代理进行基准测试

Rory Milsom

机构 * Rory Milsom(独立研究者)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI

AI总结 本研究通过构建12个任务对的基准,评估通用LLM代理在财富管理任务中的准确性和经济性,发现其性能受自主性水平和工作流程可靠性影响显著。

Comments 56 pages, 8 figures, The University of Edinburgh

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07424 2025-12-03 cs.HC 67%

Feed-O-Meter: Investigating AI-Generated Mentee Personas as Interactive Agents for Scaffolding Design Feedback Practice

Feed-O-Meter:探究AI生成的指导者人设作为交互代理在支架设计反馈实践中的应用

Hyunseung Lim, Dasom Choi, DaEun Choi, Sooyohn Nam, Hwajung Hong

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

AI总结 Feed-O-Meter通过AI代理帮助学生练习设计反馈,提升其反馈能力和反思能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02562 2025-12-03 eess.SY cs.SY 67%

Intervention Strategies for Fairness and Efficiency at Autonomous Single-Intersection Traffic Flows

自主单交叉口交通流的公平性与效率干预策略

Salman Ghori, Ania Adil, Melkior Ornik, Eric Feron

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract)

AI总结 本文提出了一种基于混合整数线性规划的干预策略,用于在无信号灯的交叉口上优化自主代理的公平性与效率,通过仿真验证早干预和公平性意识控制的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02810 2025-12-03 cs.RO cs.AI cs.LG 62%

Phase-Adaptive LLM Framework with Multi-Stage Validation for Construction Robot Task Allocation: A Systematic Benchmark Against Traditional Optimization Algorithms

具有多阶段验证的相适应LLM框架用于施工机器人任务分配:与传统优化算法的系统基准测试

Shyam prasad reddy Kaitha, Hongrui Yu

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LTAA框架,结合LLM推理与结构化验证,实现施工机器人任务分配的高效协调,展示LLM在任务分配中的优越性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02214 2025-12-03 cs.LG cs.AI 62%

Improved Training Mechanism for Reinforcement Learning via Online Model Selection

通过在线模型选择改进强化学习的训练机制

Aida Afshar, Aldo Pacchiano

机构 * Boston University(波士顿大学) Broad Institute of MIT and Harvard(MIT和哈佛大学Broad研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过在线模型选择改进强化学习训练,提升效率和性能,探讨了资源分配、非平稳动态适应及训练稳定性等理论问题,并通过实验验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02953 2025-12-03 cs.SE cond-mat.dis-nn 57%

The Evolutionary Ecology of Software: Constraints, Innovation, and the AI Disruption

软件的进化生态:约束、创新与人工智能颠覆

Sergi Valverde, Blai Vidiella, Salva Duran-Nebreda

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 本文研究软件进化生态,探讨人工智能驱动开发工具对软件创新和文化演变的影响。

Comments This article is a contributed chapter to the SFI edited volume: The Economy as a Complex Evolving System, Part IV (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08360 2025-12-03 cs.LG cs.IT math.IT math.ST stat.TH 57%

Minimax Hypothesis Testing for the Bradley-Terry-Luce Model

最小最大假设检验用于布雷德利-蒂尔-刘模型

Anuran Makur, Japneet Singh

机构 * Department of Computer Science and the Elmore Family School of Electrical and Computer Engineering, Purdue University(计算机科学系和埃尔莫尔家族电气与计算机工程学院,普渡大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种基于最小最大理论的假设检验方法,用于判断给定的成对比较数据是否源自布雷德利-蒂尔-刘模型,并通过实验验证了该方法的性能。

Comments 41 pages, 5 figures

Journal ref IEEE Transactions on Information Theory, vol. 71, no. 12, December 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02444 2025-12-03 cs.DB cs.LG 57%

QJoin: Transformation-aware Joinable Data Discovery Using Reinforcement Learning

QJoin: 基于强化学习的变换感知可连接数据发现

Ning Wang, Sainyam Galhotra

机构 * Cornell University(康奈尔大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 QJoin通过强化学习框架学习并重用变换策略,提升连接发现的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02261 2025-12-03 cs.AI 57%

TradeTrap: Are LLM-based Trading Agents Truly Reliable and Faithful?

TradeTrap: LLM-based Trading Agents 是否 truly 可靠和忠实?

Lewen Yan, Jilin Mei, Tianyi Zhou, Lige Huang, Jie Zhang, Dongrui Liu, Jing Shao

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 TradeTrap 提出了一种统一的评估框架,用于系统性压力测试基于 LLM 的交易代理,揭示其在系统级扰动下的鲁棒性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19584 2025-12-03 cs.LG cs.CV cs.RO 57%

Learning Massively Multitask World Models for Continuous Control

学习大规模多任务世界模型用于连续控制

Nicklas Hansen, Hao Su, Xiaolong Wang

机构 * University of California San Diego(加州大学圣地亚哥分校)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 Newt通过大规模预训练和在线交互,实现智能体在数百个任务上的多任务学习,提升连续控制的效率和适应性。

Comments Webpage: https://www.nicklashansen.com/NewtWM

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02861 2025-12-03 cs.NI 50%

Network Self-Configuration based on Fine-Tuned Small Language Models

基于微调小语言模型的网络自配置

Oscar G. Lira, Oscar M. Caicedo, Nelson L. S. Da Fonseca

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出SLM_netconfig,一种基于微调小语言模型的网络自配置框架,通过参数高效适应技术实现高效、准确且隐私保护的本地化配置生成。

Comments 16 pages, 11 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02624 2025-12-03 cs.CV 50%

PPTBench: Towards Holistic Evaluation of Large Language Models for PowerPoint Layout and Design Understanding

PPTBench: 向大语言模型在PowerPoint布局和设计理解的全面评估迈进

Zheng Huang, Xukai Liu, Tianyu Hu, Kai Zhang, Ye Liu

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 Agent评测 :planning(abstract)

AI总结 PPTBench通过全面评估大语言模型在PowerPoint布局和设计理解上的能力,揭示了当前模型在视觉布局推理和生成中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏