arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 93793 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 35686 篇

cs/9711103 2009-11-30 cs.AI 83%

A Model Approximation Scheme for Planning in Partially Observable Stochastic Domains

N. L. Zhang, W. Liu

专题命中 规划决策 :planning(title,abstract);agent(abstract);分类 cs.AI

Comments See http://www.jair.org/ for any accompanying files

Journal ref Journal of Artificial Intelligence Research, Vol 7, (1997), 199-230

详情

展开后加载摘要…

URL PDF HTML 收藏
cmp-lg/9406020 2009-11-30 cmp-lg cs.CL 83%

DPOCL: A Principled Approach to Discourse Planning

R. Michael Young, Johanna D. Moore

专题命中 规划决策 :planning(title,abstract);agent(abstract);分类 cs.CL

Journal ref proceedings of the Seventh International Workshop on Natural Langauge Generation, Kennebunkport, ME, June, 1994

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04166 2026-08-06 cs.HC 新提交 83%

Enacting Constructive Conflicts with AI Agents to Enhance Reconsideration among Novice Interaction Designers

借助AI智能体构建建设性冲突以提升新手交互设计师的重新考量能力

Howard Ziyu Han, Nikolas Martelaro

专题命中 规划决策 :AI agent(title,abstract);agent(abstract,comments)

AI总结 该研究构建受对抗性设计理论启发的AI智能体,通过45名设计学生的实验发现,该智能体实施的建设性冲突可提升新手交互设计师的重新考量能力,推动设计改进与创意拓展。

Comments 8 pages, 4 figures, conditionally accepted to Human-Agent Interaction 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13820 2026-05-28 cs.LG cs.AI cs.CL 83%

Structured Agent Distillation for Large Language Model

大型语言模型的结构化智能体蒸馏

Jun Liu, Zhenglun Kong, Peiyan Dong, Changdi Yang, Tianqi Li, Hao Tang, Geng Yuan, Wei Niu, Wenbin Zhang, Pu Zhao, Xue Lin, Dong Huang, Yanzhi Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) Harvard University(哈佛大学) MIT(麻省理工学院) Northeastern University(东北大学) Adobe Research(Adobe研究) National University of Singapore(新加坡国立大学) University of Georgia(佐治亚大学) Florida International University(佛罗里达国际大学)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG;autonomous agent(journal_ref)

AI总结 提出结构化智能体蒸馏框架,通过分段对齐推理和动作跨度,将大型语言模型智能体压缩为小型学生模型,在保持决策性能的同时降低推理成本。

Journal ref The 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20164 2026-05-12 cs.LG cs.AI cs.CL 83%

What's the plan? Metrics for implicit planning in LLMs and their application to rhyme generation and question answering

计划是什么?LLMs中隐式规划的度量及其在押韵生成和问答中的应用

Jim Maar, Denis Paperno, Callum Stuart McDougall, Neel Nanda

机构 * HPI / University of Potsdam(HPI/波茨坦大学) Utrecht University(乌特勒支大学) Google DeepMind(谷歌DeepMind)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出简单方法评估LLM隐式规划,通过押韵生成和问答案例展示其可扩展性,发现隐式规划在1B参数模型中普遍存在,为AI安全提供新视角。

Comments 41 pages, 34 figures, Accepted at ICLR 2026, Code available at https://github.com/Jim-Maar/implicit-planning-in-llms

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29039 2026-04-01 astro-ph.IM astro-ph.HE physics.data-an 83%

AI Cosplaying as Astrophysicists: A Controlled Synthetic-Agent Study of AI-Assisted Astrophysical Research Workflows

AI 伪装成天体物理学家:一个受控的合成智能体研究,探讨AI辅助天体物理研究流程

Chun Huang

专题命中 规划决策 :agent(title,comments);AI agent(abstract);workflow(abstract)

AI总结 本文通过模拟144名合成研究者完成2592项日常天体物理研究任务,评估AI在不同任务类型和使用风格下的效果,发现AI辅助在特定任务和使用策略下能提升效率,但对推导密集型任务存在风险。

Comments 16 pages, 8 figures. Began as an April Fools' idea, regrettably became a real methods paper, No language models were physically harmed. GitHub repository of this work: https://github.com/ChunHuangPhy/agent_astro

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23682 2025-10-29 cs.LG cs.AI cs.LO cs.SE 83%

Beyond Prompt Engineering: Neuro-Symbolic-Causal Architecture for Robust Multi-Objective AI Agents

Gokturk Aytug Akarlar

专题命中 规划决策 :AI agent(title);autonomous agent(abstract,comments);分类 cs.AI、cs.LG、cs.SE

Comments 35 pages, 15 figures, 2 tables. Keywords: Large Language Models, Autonomous Agents, Neuro-Symbolic AI, Causal Inference, Formal Verification, Multi-Objective Optimization. Open-source code and interactive demo available

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19339 2025-10-17 cs.CL cs.AI cs.LG 83%

Explanatory Summarization with Discourse-Driven Planning

Dongqi Liu, Xi Yu, Vera Demberg, Mirella Lapata

机构 * Saarland University(萨尔兰大学) University of Edinburgh(爱丁堡大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.CL、cs.LG

Comments Accepted by the Transactions of the Association for Computational Linguistics (TACL 2025)

Journal ref Dongqi Liu, Xi Yu, Vera Demberg, Mirella Lapata; Explanatory Summarization with Discourse-Driven Planning. Transactions of the Association for Computational Linguistics 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19571 2025-09-25 cs.RO cs.CV 83%

Agentic Scene Policies: Unifying Space, Semantics, and Affordances for Robot Action

Sacha Morin, Kumaraditya Gupta, Mahtab Sandhu, Charlie Gauthier, Francesco Argenziano, Kirsty Ellis, Liam Paull

机构 * Université de Montréal(蒙特利尔大学) Mila - Quebec AI Institute(魁北克人工智能研究院) Sapienza University of Rome(罗马萨皮恩扎大学)

专题命中 规划决策 :agentic(title,abstract);planning(abstract)

Comments Project page: https://montrealrobotics.ca/agentic-scene-policies.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06469 2024-06-11 cs.AI cs.CL cs.LG 83%

Husky: A Unified, Open-Source Language Agent for Multi-Step Reasoning

Joongwon Kim, Bhargavi Paranjape, Tushar Khot, Hannaneh Hajishirzi

专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

Comments 50 pages, 42 figures. Project webpage available [here](https://agent-husky.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12741 2024-05-27 cs.CV 83%

MuLan: Multimodal-LLM Agent for Progressive and Interactive Multi-Object Diffusion

Sen Li, Ruochen Wang, Cho-Jui Hsieh, Minhao Cheng, Tianyi Zhou

专题命中 规划决策 :agent(title,abstract);planning(abstract)

Comments Added the application to human-agent interaction; added discussion with concurrent work

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.00296 2024-02-02 cs.RO 83%

High-Level, Collaborative Task Planning Grammar and Execution for Heterogeneous Agents

Amy Fang, Hadas Kress-Gazit

专题命中 规划决策 :planning(title);agent(abstract);multi-agent(abstract);autonomous agent(comments)

Comments To appear in the Proceedings of the 2024 International Conference on Autonomous Agents and Multiagent Systems (AAMAS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.04614 2023-05-09 cs.RO 83%

Reducing Onboard Processing Time for Path Planning in Dynamically Evolving Polygonal Maps

Aditya Shirwatkar, Aman Singh, Jana Ravi Kiran

专题命中 规划决策 :planning(title,abstract);autonomous agent(abstract)

Comments Course Project Report for CP:230 Motion Planning and Autonomous Navigation by Dr. Debasish Ghose

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03502 2026-08-20 cs.AI cs.LG cs.MA 版本更新 82%

Hybrid LLM-Augmented Reinforcement Learning Agents for Complex Sequential Decision Tasks

用于复杂序列决策任务的混合大语言模型增强强化学习智能体

Christophe D. Hounwanou, John Emeka Eze, Yaé Ulrich Gaba

专题命中 规划决策 :agent(abstract);autonomous agent(abstract);tool-use(abstract);planning(abstract)

AI总结 本文提出混合LLM增强RL智能体,融合LLM规划与RL动作优化,经实验验证其在序列决策任务上优于仅RL、仅LLM的基线方法,为构建更强自主系统提供了新方向。

Comments This submission is withdrawn because the uploaded manuscript does not accurately reflect the intended structure or results. Several components referenced in the text are incomplete or not represented in the PDF, and the current version may mislead readers. The work is therefore withdrawn to maintain clarity of the record

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06008 2026-08-18 cs.AI cs.CL 版本更新 82%

PolyWorkBench: Benchmarking LLM Agents for Cross-Lingual Long-Horizon Workflows

PolyWorkBench:多语言长视野语言模型智能体基准测试

Hongliang Li, Yijin Liu, Zhiwei Zhang, Zihe Liu, Xinyue Lou, Jinan Xu, Fandong Meng, Kaiyu Huang

机构 * Beijing Jiaotong University(北京交通大学) Weixin AI, Tencent Inc(腾讯微云人工智能实验室)

专题命中 规划决策 :agent(abstract);tool use(abstract);tool-use(abstract);planning(abstract)

AI总结 研究多语言长视野工作流程中LLM智能体的表现,提出PolyWorkBench基准测试及结合多种评估方式的混合框架,发现最先进LLM智能体在多语言设置中性能降,强调联合建模语言变化和程序决策对智能体评估的重要性。

Comments 17 Pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18947 2026-06-18 cs.AI cs.CL cs.IR cs.MA 新提交 82%

Decoupling Search from Reasoning: A Vendor-Agnostic Grounding Architecture for LLM Agents

将搜索与推理解耦:面向LLM Agent的供应商无关的接地架构

Emmanuel Aboah Boateng, Kyle MacDonald, Amardeep Kumar, Siddharth Kodwani, Sudeep Das

机构 * DoorDash, Inc.(DoorDash公司)

专题命中 规划决策 :agent(title_cn,abstract_cn);agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出解耦搜索接地(DSG)架构,将搜索接地从推理模型中分离,通过MCP兼容网关实现供应商路由、缓存等控制,在降低成本和延迟的同时保持或提升准确性。

Comments 15 pages, Figure 8

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07682 2026-06-09 cs.SE cs.AI 新提交 82%

SWE-Marathon: Can Agents Autonomously Complete Ultra-Long-Horizon Software Work?

SWE-Marathon: 智能体能否自主完成超长时程软件工作?

Rishi Desai, Jesse Hu, Joan Cabezas, Neel Harsola, Pratyush Shukla, Roey Ben Chaim, Adnan El Assadi, Omkaar Mukund Kamath, Fenil Faldu, Prannay Hebbar, Jiankai Sun, Yiyuan Li, Pramod Srinivasan, Ishan Gupta, Christopher Settles, Daniel Wang, Derek Chen, Pranav Raja, Albert Liu, Marek Šuppa, Nevasini Sasikumar, Luyang Kong, Erik Quintanilla, Xiangyi Li, Ivan Bercovich, Steven Dillmann

机构 * Abundant Zenity Harvard University(哈佛大学) University of Waterloo(滑铁卢大学) Gujarat Technological University(古吉拉特技术大学) Warping Stanford University(斯坦福大学) UNC-Chapel Hill(北卡罗来纳大学教堂山分校) Independent(独立) Refresh Soleda AI Near AI Georgia Tech(佐治亚理工学院) Comenius University in Bratislava(布拉迪斯拉发Comenius大学) UC San Diego(圣地亚哥大学) BenchFlow UC Santa Barbara(圣巴巴拉大学)

专题命中 规划决策 :agent(abstract);AI agent(abstract);planning(abstract);workflow(abstract)

AI总结 提出SWE-Marathon基准,包含20个超长时程任务,平均消耗2720万token,评估智能体在规划、长上下文理解和记忆方面的能力,当前前沿编码智能体解决率低于30%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14084 2026-05-22 cs.LG cs.AI 82%

TIP: Token Importance in On-Policy Distillation

TIP: on-policy distillation 中的 token 重要性

Yuanda Xu, Hejian Sang, Zhengze Zhou, Ran He, Zhipeng Wang, Alborz Geramifard

专题命中 规划决策 :planning(abstract,abstract_cn);agentic(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本研究探讨了在 on-policy 知识蒸馏中哪些 token 对学习信号最有用,提出了一种基于学生熵和教师-学生分歧的双轴分类方法,并通过实验验证了在有限内存条件下使用少量 token 进行蒸馏的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09217 2026-05-12 cs.AI cs.LG cs.MA 82%

Learning the Preferences of a Learning Agent

学习学习代理的偏好

Karim Abdel Sadek, Mark Bedaywi, Rhys Gould, Stuart Russell

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.LG;multi-agent(comments)

AI总结 本文研究学习代理偏好学习问题,通过分析在线学习者行为推断潜在奖励函数,探讨无 regrets 或收敛到最优 Boltzmann 策略的理论保证。

Comments Published at ICLR 2026, Workshop on Multi-Agent Learning and Its Opportunities in the Era of Generative AI. 9 pages main text

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08257 2026-05-12 cs.CR cs.AI cs.LG 82%

Research on Security Enhancement Methods for Adversarial Robust Large Language Model Intelligent Agents for Medical Decision-Making Tasks

对抗鲁棒性增强方法研究:用于医疗决策任务的对抗鲁棒大语言模型智能体

Saisai Hu

机构 * Pace University(帕克大学)

专题命中 规划决策 :agent(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文提出ARSM-Agent框架,通过多模块协同提升医疗决策智能体的对抗鲁棒性与安全性,实验表明其在多种攻击下攻击成功率降低至8.7%。

Comments 5 pages, 2 figures, 1 table.Accepted for oral presentation at AINIT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05632 2026-05-08 cs.CR cs.CL cs.LG 82%

Architecture Matters: Comparing RAG Systems under Knowledge Base Poisoning

架构至关重要:在知识库中毒情况下比较RAG系统

Samuel Korn

专题命中 规划决策 :agentic(abstract,abstract_cn);agent(abstract);multi-agent(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨了在知识库中毒情况下不同RAG架构的鲁棒性,发现架构设计对攻击成功率影响显著,MADAM-RAG在矛盾检测上表现最佳但仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00798 2026-05-04 cs.LG cs.CL cs.MA 82%

RunAgent: Interpreting Natural-Language Plans with Constraint-Guided Execution

RunAgent:通过约束引导执行解释自然语言计划

Arunabh Srivastava, Mohammad A., Khojastepour, Srimat Chakradhar, Sennur Ulukus

机构 * University of Maryland, College Park(马里兰大学学院公园分校) NEC Laboratories America, Inc.(NEC美国实验室)

专题命中 规划决策 :agent(abstract);workflow(abstract);agentic(abstract);multi-agent(abstract)

AI总结 RunAgent通过约束引导执行解释自然语言计划,结合代理语言的显式控制构造,提升结构化工作流执行的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07791 2026-04-21 cs.AI cs.LG 82%

SEARL: Joint Optimization of Policy and Tool Graph Memory for Self-Evolving Agents

SEARL:自进化智能体中策略与工具图记忆的联合优化

Xinshun Feng, Xinhao Song, Lijun Li, Gongshen Liu, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学)

专题命中 规划决策 :agent(abstract);planning(abstract);agentic(abstract);multi-agent(abstract)

AI总结 SEARL通过构建结构化经验记忆实现策略与工具图记忆的联合优化,提升智能体在知识推理和数学任务中的实用性和效率。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12230 2026-04-07 cs.LG cs.AI cs.CR 82%

Security Considerations for Artificial Intelligence Agents

人工智能代理的安全性考虑

Ninghui Li, Kaiyuan Zhang, Kyle Polley, Jerry Ma

机构 * Perplexity

专题命中 规划决策 :agent(abstract);AI agent(abstract);agentic(abstract);multi-agent(abstract)

AI总结 本文探讨了前沿AI代理的安全性问题,分析了代理架构对代码-数据分离、权限边界和执行可预测性的影响,并提出了针对间接提示注入、混淆代理行为和长流程级联故障的防护措施。

Comments This article is adapted from Perplexity's response to NIST/CAISI Request for Information 2025-0035. 91 Fed. Reg. 698 (Jan. 8, 2026). The originally submitted response can be found on the public docket at https://www.regulations.gov/comment/NIST-2025-0035-0505

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00324 2026-04-02 cs.LG cs.AI 82%

The Persistent Vulnerability of Aligned AI Systems

对齐AI系统持续的脆弱性

Aengus Lynch

机构 * University College London(伦敦大学学院)

专题命中 规划决策 :agent(abstract);AI agent(abstract);planning(abstract);agentic(abstract)

AI总结 本文探讨了自主AI代理在文件系统访问、电子邮件控制和多步骤规划中的部署问题,提出ACDC、LAT等方法以解决AI安全四大难题,通过实验展示对抗性攻击的成功率及模型对齐测试结果。

Comments PhD thesis, University College London, 2025. 157 pages. Supervised by Ricardo Silva

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26458 2026-03-30 cs.SE cs.AI 82%

Can AI Models Direct Each Other? Organizational Structure as a Probe into Training Limitations

AI模型能否相互指导?组织结构作为训练限制的探测器

Rui Liu

机构 * Independent Researcher(独立研究员)

专题命中 规划决策 :agent(abstract);tool use(abstract);planning(abstract);multi-agent(abstract)

AI总结 本文研究AI模型通过ManagerWorker双agent流水线相互指导的有效性,发现强管理者指导弱工作者与单体强模型性能相近,但弱管理者指导弱工作者效果更差,揭示了多agent指导的潜力与限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19248 2026-03-23 cs.CL cs.AI 82%

DuCCAE: A Hybrid Engine for Immersive Conversation via Collaboration, Augmentation, and Evolution

DuCCAE:通过协作、增强和进化实现沉浸式对话的混合引擎

Xin Shen, Zhishu Jiang, Jiaye Yang, Haibo Liu, Yichen Wan, Jiarui Zhang, Tingzhi Dai, Luodong Xu, Shuchen Wu, Guanqiang QI, Chenxi Miao, Jiahui Liang, Yang Li, Weikang Li, Deguo Xia, Jizhou Huang

机构 * Baidu Inc(百度公司)

专题命中 规划决策 :agent(abstract);planning(abstract);agentic(abstract);multi-agent(abstract)

AI总结 DuCCAE通过解耦实时响应与异步代理执行,提升沉浸式对话的响应速度与任务能力,减少延迟并增强用户留存与复杂任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20796 2026-03-16 econ.GN cs.AI cs.LG q-fin.EC 82%

Aligning Large Language Model Agents with Rational and Moral Preferences: A Supervised Fine-Tuning Approach

对齐大型语言模型代理的理性与道德偏好:一种监督微调方法

Wei Lu, Amit Dhanda, Daniel L. Chen, Christian B. Hansen

机构 * Zicklin School of Business, CUNY Baruch College(纽约大学法学院) Amazon(亚马逊) Toulouse School of Economics(图卢兹经济学院)

专题命中 规划决策 :agent(abstract);AI agent(abstract);autonomous agent(abstract);multi-agent(abstract)

AI总结 本文通过监督微调方法对齐LLM代理的理性与道德偏好,揭示了代理在经济游戏中的系统性偏差,并展示了不同偏好结构对均衡结果的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04276 2025-12-05 cs.AI cs.LG math.ST stat.TH 82%

The Geometry of Benchmarks: A New Path Toward AGI

基准的几何学:通向通用人工智能的新路径

Przemyslaw Chojecki

机构 * Przemyslaw Chojecki(独立研究者)

专题命中 规划决策 :agent(abstract);AI agent(abstract);tool use(abstract);planning(abstract)

AI总结 本文提出了一种基于几何框架的基准评估方法,通过自主AI尺度和GVU操作符,为通用人工智能的发展提供了新的理论视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01654 2025-10-03 cs.CL cs.AI 82%

SoK: Measuring What Matters for Closed-Loop Security Agents

Mudita Khurana, Raunak Jain

机构 * IEEE

专题命中 规划决策 :autonomous agent(abstract);tool use(abstract);planning(abstract);agentic(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏