arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15756 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15756 篇

2604.11806 2026-04-14 cs.AI cs.CL 84%

Detecting Safety Violations Across Many Agent Traces

在大量智能体轨迹中检测安全违规

Adam Stein, Davis Brown, Hamed Hassani, Mayur Naik, Eric Wong

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Meerkat方法,通过聚类与智能体搜索结合,有效发现自然语言指定的安全违规,提升检测效率并发现广泛开发者作弊和奖励黑客行为。

Comments 35 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06111 2026-04-13 cs.AI cs.CL 84%

AgentCE-Bench: Agent Configurable Evaluation with Scalable Horizons and Controllable Difficulty under Lightweight Environments

AgentCE-Bench: 一种可配置的智能体评估基准,具备可扩展的视野和可控难度,在轻量环境中

Wang Yang, Chaoda Song, Xinpeng Li, Debargha Ganguly, Chuang Ma, Shouren Wang, Zhihao Dou, Yuli Zhou, Vipin Chaudhary, Xiaotian Han

机构 * Case Western Reserve University(凯斯西储大学) NII LLMC (Japan)(日本国立信息学研究所LLMC) University of Zurich(苏黎世大学)

专题命中 Agent评测 :agent(title,abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 AgentCE-Bench通过可扩展视野和可控难度,解决现有基准的高交互开销和任务分布不平衡问题,提供可靠、可解释的智能体评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07883 2026-04-10 cs.AI cs.CL cs.CY cs.MA 84%

An Agentic Evaluation Architecture for Historical Bias Detection in Educational Textbooks

用于教育教科书历史偏见检测的代理评估架构

Gabriel Stefan, Adrian-Marius Dumitran

机构 * University of Bucharest(布加勒斯特大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出一种代理评估架构,通过多模态筛查代理、异质陪审团和元代理,有效检测教育教科书中的隐性偏见,实验表明其在经济性和准确性上具有优势。

Comments Accepted for ITS(Intelligent Tutoring Systems) 2026 Full Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07775 2026-04-10 cs.AI cs.CL cs.CR 84%

ACIArena: Toward Unified Evaluation for Agent Cascading Injection

ACIArena:迈向多智能体系统统一评估

Hengyu An, Minxi Li, Jinghuai Zhang, Naen Xu, Chunyi Zhou, Changjiang Li, Xiaogang Xu, Tianyu Du, Shouling Ji

机构 * Zhejiang University(浙江大学) State Key Laboratory of Internet Architecture, Tsinghua University(清华大学网络架构国家重点实验室) University of California, Los Angeles(加州大学洛杉矶分校) Palo Alto Networks Ningbo Global Innovation Center, Zhejiang University(浙江大学宁波全球创新中心)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出ACIArena框架,用于评估多智能体系统(MAS)的鲁棒性,通过多攻击面和目标的系统化测试,揭示单纯依赖拓扑结构评估不足,强调需通过角色设计和受控交互提升系统安全性。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23448 2026-04-08 cs.SE cs.AI 84%

Code Review Agent Benchmark

代码审查代理基准

Yuntong Zhang, Zhiyuan Pan, Imam Nur Bani Yusuf, Haifeng Ruan, Ridwan Shariffdeen, Abhik Roychoudhury

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出c-CRAB基准,用于评估代码审查代理的能力,发现现有代理仅能解决40%的任务,揭示了未来研究的潜力及人机协作的可能性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04759 2026-04-07 cs.CR cs.AI cs.CL 84%

Your Agent, Their Asset: A Real-World Safety Analysis of OpenClaw

你的代理,他们的资产:OpenClaw的现实世界安全性分析

Zijun Wang, Haoqin Tu, Letian Zhang, Hardy Chen, Juncheng Wu, Xiangyan Liu, Zhenlong Yuan, Tianyu Pang, Michael Qizhe Shieh, Fengze Liu, Zeyu Zheng, Huaxiu Yao, Yuyin Zhou, Cihang Xie

机构 * UC Santa Cruz(加州大学圣克鲁兹分校) NUS(新加坡国立大学) Tencent(腾讯) ByteDance(字节跳动) UC Berkeley(加州大学伯克利分校) UNC-Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 本文首次对OpenClaw进行现实世界安全性评估,引入CIK分类法分析代理的持久状态,发现攻击单个CIK维度可显著提高攻击成功率,强调需系统性保障个人AI代理的安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06448 2026-04-07 cs.MA cs.AI cs.CL cs.SI 84%

When AI Agents Collude Online: Financial Fraud Risks by Collaborative LLM Agents on Social Platforms

当AI代理在线合谋:社交平台上基于协作LLM代理的金融欺诈风险

Qibing Ren, Zhijie Zheng, Jiaxuan Guo, Junchi Yan, Lizhuang Ma, Jing Shao

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Beihang University(北京航空航天大学)

专题命中 Agent评测 :AI agent(title);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 研究大型多代理系统中集体金融欺诈的风险,通过MultiAgentFraudBench基准测试分析欺诈行为协作机制及影响因素,提出内容警告、LLM监控和群体韧性提升等缓解策略。

Comments ICLR 2026, Code is available at https://github.com/zheng977/MutiAgent4Fraud

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02145 2026-04-03 cs.AI cs.CL 84%

MTI: A Behavior-Based Temperament Profiling System for AI Agents

MTI:一种基于行为的 temperament 评估系统用于 AI 代理

Jihoon Jeong

机构 * ModuLabs

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出 MTI 评估系统,通过四个维度测量 AI 代理 temperament,发现行为差异与模型大小无关,揭示了 RLHF 对 temperament 的影响。

Comments 29 pages, 6 figures, 12 tables. Paper #3 in the Model Medicine Series (Paper #1: arXiv:2603.04722)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01437 2026-04-03 cs.SE cs.AI 84%

Reproducible, Explainable, and Effective Evaluations of Agentic AI for Software Engineering

可重复、可解释和有效的代理AI在软件工程中的评估

Jingyue Li, André Storhaug

机构 * Norwegian University of Science and Technology(挪威科技大学)

专题命中 Agent评测 :agentic(title,abstract);autonomous agent(abstract);分类 cs.AI、cs.SE

AI总结 本文分析了18篇关于代理AI在软件工程中评估的论文,提出指南以提升评估的可重复性、可解释性和有效性,通过公开TAR轨迹和LLM交互数据促进不同方法的系统比较。

Comments 7 pages, 5 figures, accepted to the 2nd International Workshop on Responsible Software Engineering (ResponsibleSE 2026), co-located with FSE

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00280 2026-04-02 cs.SE cs.AI 84%

VeriAct: Beyond Verifiability -- Agentic Synthesis of Correct and Complete Formal Specifications

VeriAct:超越可验证性——基于代理的正确且完整的正式规范合成

Md Rakib Hossain Misu, Iris Ma, Cristina V. Lopes

机构 * University of California, Irvine(加利福尼亚大学尔湾分校)

专题命中 Agent评测 :agentic(title,abstract);planning(abstract);分类 cs.AI、cs.SE

AI总结 本文提出VeriAct框架,通过迭代合成与修复规范,超越传统方法的性能极限,生成正确且完整的正式规范。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06188 2026-03-31 cs.AI cs.CL cs.MA 84%

SkillFlow: Scalable and Efficient Agent Skill Retrieval System

SkillFlow:可扩展且高效的智能体技能检索系统

Fangzhou Li, Pagkratios Tagkopoulos, Ilias Tagkopoulos

机构 * University of California, Davis(加州大学戴维斯分校) USDA/NSF AI Institute for Next Generation Food Systems(美国农业部/国家科学基金会下一代食品系统人工智能研究所) Process Integration and Predictive Analytics(过程集成与预测分析)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 SkillFlow通过多阶段检索流程提升智能体技能检索效率,实现在SkillsBench上Pass@1提升78.3%,但Terminal-Bench显示检索效果受限于技能库质量

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26710 2026-03-31 cs.IR cs.AI cs.CL cs.MA 84%

Agentic AI for Human Resources: LLM-Driven Candidate Assessment

面向人力资源的代理AI:基于大语言模型的候选人评估

Kamer Ali Yuksel, Abdul Basit Anees, Ashraf Elneima, Sanjika Hewavitharana, Mohamed Al-Badrashiny, Hassan Sawaf

机构 * aiXplain, Inc.(aiXplain公司)

专题命中 Agent评测 :agentic(title);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出一个模块化且可解释的框架,利用大语言模型自动化招聘中的候选人评估。系统整合多种来源生成结构化评估报告,采用LLM生成的评分标准和多代理架构进行细粒度评估,输出透明、可审计的评估报告和推荐。

Comments Published in 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026)

Journal ref 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026), Rabat, Morocco

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21321 2026-03-24 cs.AI cs.CL 84%

Improving Coherence and Persistence in Agentic AI for System Optimization

提升系统优化代理AI的连贯性与持续性

Pantea Karimi, Kimia Noorbakhsh, Mohammad Alizadeh, Hari Balakrishnan

机构 * MIT(麻省理工学院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Engram架构,通过解耦长周期探索与单一上下文窗口约束,提升代理AI在多领域系统优化中的连贯性和持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20300 2026-03-24 cs.SE cs.AI 84%

From Human Interfaces to Agent Interfaces: Rethinking Software Design in the Age of AI-Native Systems

从人机界面到代理界面:在AI原生系统时代重新思考软件设计

Shaolin Wang, Yi Mei, Haoyang Che, He Jiang, Shui Yu, Ying Gu

机构 * Victoria University of Wellington, New Zealand(维多利亚大学惠灵顿分校) Independent Researcher(独立研究员) Dalian University of Technology, China(大连理工大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.SE

AI总结 本文探讨了软件设计从以人为中心的界面转向以代理为中心的调用系统,提出了代理接口的概念和设计原则,为AI原生软件设计提供理论基础。

Comments 4 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04017 2026-03-18 cs.AI cs.LG physics.ao-ph 84%

Zephyrus: An Agentic Framework for Weather Science

Zephyrus:一种用于气象科学的代理框架

Sumanth Varambally, Marshall Fisher, Jas Thakker, Yiwei Chen, Zhirui Xia, Yasaman Jafari, Ruijia Niu, Manas Jain, Veeramakali Vignesh Manivannan, Zachary Novack, Luyu Han, Srikar Eranky, Salva Rühling Cachay, Taylor Berg-Kirkpatrick, Duncan Watson-Parris, Yi-An Ma, Rose Yu

机构 * UC San Diego(加州大学圣地亚哥分校)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Zephyrus框架,结合大语言模型与天气数据交互,解决传统模型缺乏语言推理的问题,通过新基准测试展示其在天气任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12310 2026-03-16 cs.CV cs.AI cs.LG cs.MA 84%

VQQA: An Agentic Approach for Video Evaluation and Quality Improvement

VQQA:视频评估与质量提升的代理方法

Yiwen Song, Tomas Pfister, Yale Song

机构 * Google(谷歌)

专题命中 Agent评测 :agentic(title);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VQQA框架,通过动态生成视觉问题并利用视觉语言模型进行语义梯度优化,实现高效的闭环提示优化,提升视频生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10745 2026-03-13 cs.AI cs.CV cs.LG cs.MA cs.MM 84%

Agentic Design Review System

代理设计评审系统

Sayan Nag, K J Joseph, Koustava Goswami, Vlad I Morariu, Balaji Vasan Srinivasan

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AgenticDRS系统,通过多个代理协作分析设计,结合图匹配和提示扩展方法,实现高效的设计评估与反馈生成。

Comments Project Page: https://sayannag.github.io/AgenticDRS

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10060 2026-03-12 cs.CR cs.AI cs.CL 84%

Tool Receipts, Not Zero-Knowledge Proofs: Practical Hallucination Detection for AI Agents

工具 receipts,而非零知识证明:面向 AI agent 的实用幻觉检测

Abhinaba Basu

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 NabaOS 通过 epistemic 分类和 receipts 验证,实现交互式 AI agent 幻觉检测的高效高精度验证方法

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07379 2026-03-10 cs.AI cs.CL cs.CR cs.IR 84%

SoK: Agentic Retrieval-Augmented Generation (RAG): Taxonomy, Architectures, Evaluation, and Research Directions

SoK:基于代理的检索增强生成(RAG):分类、架构、评估及研究方向

Saroj Mishra, Suman Niroula, Umesh Yadav, Dilip Thakur, Srijan Gyawali, Shiva Gaire

机构 * University of North Dakota(北达科他大学) Youngstown State University(青年州大学) University of Toledo(托莱多大学) University of Missouri(密苏里大学) Tribhuvan University(特里布文大学)

专题命中 Agent评测 :agentic(title,abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 本文系统化地分析了基于代理的RAG系统,提出统一框架,识别关键风险并提出研究方向,以构建可靠可扩展的自主检索生成系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04403 2026-03-06 cs.IR cs.AI cs.CL 84%

FinRetrieval: A Benchmark for Financial Data Retrieval by AI Agents

FinRetrieval:通过AI代理进行金融数据检索的基准测试

Eric Y. Kim, Jie Huang

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 FinRetrieval通过AI代理进行金融数据检索的基准测试,揭示了工具可用性对性能的主导作用及不同代理在推理模式和基础能力上的差异。

Comments 26 pages, 2 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02798 2026-03-04 cs.AI cs.CL 84%

Guideline-Grounded Evidence Accumulation for High-Stakes Agent Verification

基于指南的证据积累用于高风险代理验证

Yichi Zhang, Nabeel Seedat, Yinpeng Dong, Peng Cui, Jun Zhu, Mihaela van de Schaar

机构 * Tsinghua University(清华大学) University of Cambridge(剑桥大学) Thomson Reuters Foundational Research(汤姆森路透基础研究)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 GLEAN通过基于指南的证据积累框架,提升高风险代理决策的验证可靠性,实验显示其在AUROC和Brier分数减少方面均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00214 2026-03-03 cs.SE cs.AI cs.MS physics.geo-ph 84%

Agentic Scientific Simulation: Execution-Grounded Model Construction and Reconstruction

代理科学模拟:基于执行的模型构建与重建

Knut-Andreas Lie, Olav Møyner, Elling Svee, Jakob Torben

机构 * SINTEF Digital(SINTEF数字研究院) Department of Mathematical Sciences(数学科学系) NTNU(挪威特纳厄大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出JutulGPT,通过代理科学模拟实现基于执行的模型构建与重建,解决模拟描述中的歧义问题,并公开所有代码和日志以确保可重现性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23373 2026-03-02 cs.AI cs.CL cs.IR 84%

An Agentic LLM Framework for Adverse Media Screening in AML Compliance

面向反面媒体筛查的代理LLM框架用于反洗钱合规

Pavel Chernakov, Sasan Jafarnejad, Raphaël Frank

机构 * Interdisciplinary Centre for Security, Reliability and Trust(安全、可靠与信任跨学科中心)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出基于LLM与RAG的代理框架,用于自动化反面媒体筛查,通过多步骤流程实现高风险个体的准确识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04072 2026-02-11 cs.AI cs.LG 84%

Among Us: A Sandbox for Measuring and Detecting Agentic Deception

Among Us: 一种用于衡量和检测代理欺骗的沙盒

Satvik Golechha, Adrià Garriga-Alonso

机构 * MATS FAR AI

专题命中 Agent评测 :agentic(title);agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 Among Us通过开放的沙盒游戏评估LLM的欺骗能力,发现强化学习训练的模型更擅长生成欺骗而非检测,且基于激活的逻辑回归和SAEs在检测中表现优异。

Comments 21 pages, preprint

Journal ref NeurIPS 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20694 2026-02-10 cs.AI astro-ph.SR cs.LG physics.space-ph 84%

Reasoning With a Star: A Heliophysics Dataset and Benchmark for Agentic Scientific Reasoning

用恒星进行推理:一个用于代理科学推理的太阳物理数据集和基准

Kevin Lee, Russell Spiewak, James Walsh

机构 * Frontier Development Lab(前沿发展实验室) Department of Mechanical and Aerospace Engineering, UCLA(机械与航空航天工程系,加州大学洛杉矶分校) Trillium Technologies Inc.(Trillium技术公司) Department of Engineering, University of Cambridge(工程系,剑桥大学)

专题命中 Agent评测 :agentic(title);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出一个太阳物理数据集和基准,用于评估代理在科学推理中的表现,发现系统工程原则在演绎推理任务中优于直接提示方法。

Comments Accepted at NeurIPS 2025 Machine Learning and the Physical Sciences (ML4PS) Workshop. Dataset: https://huggingface.co/datasets/SpaceML/ReasoningWithAStar

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02424 2026-02-10 cs.CR cs.AI cs.SE 84%

CyberRAG: An Agentic RAG cyber attack classification and reporting tool

CyberRAG: 一种基于代理的RAG网络攻击分类与报告工具

Francesco Blefari, Cristian Cosentino, Francesco Aurelio Pironti, Angelo Furfaro, Fabrizio Marozzo

机构 * University of Calabria(卡利博里大学) IMT School for Advanced Studies(IMT高级研究学院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 CyberRAG是一种基于代理的RAG框架,通过模块化设计实现网络攻击的实时分类、解释和结构化报告,提高检测准确性和可解释性。

Journal ref Future Generation Computer Systems, 176, 2026, 108186

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02389 2026-02-05 cs.SE cs.CR cs.LG 84%

From Trace to Line: LLM Agent for Real-World OSS Vulnerability Localization

从痕迹到行:面向真实世界OSS漏洞定位的LLM代理

Haoran Xi, Minghao Shao, Brendan Dolan-Gavitt, Muhammad Shafique, Ramesh Karri

机构 * NYU Tandon School of Engineering(纽约大学唐纳德工程学院)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.LG、cs.SE

AI总结 T2L框架通过基于AST的分块和证据引导细化,实现项目级和行级漏洞定位,提升LLM在开源软件中的精准诊断能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18352 2026-01-30 cs.CL cs.AI 84%

LLM-based Few-Shot Early Rumor Detection with Imitation Agent

基于大语言模型的少样本早期谣言检测与模仿代理

Fengzhu Zeng, Qian Shao, Ling Cheng, Wei Gao, Shih-Fen Cheng, Jing Ma, Cheng Niu

机构 * Singapore Management University(新加坡管理大学) Hong Kong Baptist University(香港 Baptist大学)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出基于自主代理和大语言模型的少样本早期谣言检测框架,通过轻量级代理提升效率,实现准确性和早熟性的提升。

Comments Accepted at KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17087 2026-01-29 cs.HC cs.AI cs.CY cs.LG 84%

Lost in Simulation: LLM-Simulated Users are Unreliable Proxies for Human Users in Agentic Evaluations

陷入模拟:LLM模拟用户在代理评估中是不可靠的人类用户代理

Preethi Seshadri, Samuel Cahyawijaya, Ayomide Odumakinde, Sameer Singh, Seraphina Goldfarb-Tarrant

机构 * UC Irvine(加州大学欧文分校) Cohere(Cohere公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 研究发现LLM模拟用户在代理评估中存在稳健性不足、校准误差和文化差异问题,影响评估准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03310 2026-01-13 cs.AI cs.SE 84%

app.build: A Production Framework for Scaling Agentic Prompt-to-App Generation with Environment Scaffolding

app.build:一种用于扩展基于代理的提示到应用程序生成的生产框架

Evgenii Kniazev, Arseny Kravchenko, Igor Rekun, James Broadhead, Nikita Shamgunov, Pranav Sah, Pratik Nichite, Ivan Yamshchikov

机构 * Databricks THWS University of Applied Sciences Würzburg-Schweinfurt (CAIRO)(THWS应用科学大学沃尔夫斯堡-施维林(CAIRO))

专题命中 Agent评测 :agentic(title);agent(abstract);AI agent(abstract);分类 cs.AI、cs.SE

AI总结 app.build通过结构化环境和系统验证提升基于代理的应用程序生成效率,实现高可行性与质量,为生产级代理系统提供参考实现。

详情

展开后加载摘要…

URL PDF HTML 收藏