arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2025-12-15 至 2025-12-15 共收录 15 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15 篇

2512.10501 2025-12-15 cs.AI 83%

Zero-shot 3D Map Generation with LLM Agents: A Dual-Agent Architecture for Procedural Content Generation

无监督3D地图生成与LLM代理:一种双代理架构用于程序化内容生成

Lim Chien Her, Ming Yan, Yunshu Bai, Ruihao Li, Hao Zhang

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 本文提出一种双代理架构,利用LLM代理实现无监督3D地图生成,通过迭代推理优化参数配置,提升PCG指令遵循能力。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09142 2025-12-15 cs.AI 83%

SDialog: A Python Toolkit for End-to-End Agent Building, User Simulation, Dialog Generation, and Evaluation

SDialog:一个用于端到端代理构建、用户模拟、对话生成和评估的Python工具包

Sergio Burdisso, Séverin Baroudi, Yanis Labrak, David Grunert, Pawel Cyrta, Yiyang Chen, Srikanth Madikeri, Esaú Villatoro-Tello, Thomas Schaaf, Ricard Marxer, Petr Motlicek

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

AI总结 SDialog是一个开源Python工具包,提供端到端的对话代理构建、用户模拟、对话生成和评估功能,结合机理可解释性工具和综合评估方法,帮助研究人员更系统地研究对话系统。

Comments We have an old version of the paper at arXiv:2506.10622, we will update this old version instead (even though the authors and the title have changed since this first old version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02925 2025-12-15 cs.LG cs.CL q-bio.BM 81%

Large Language Model Agent for Modular Task Execution in Drug Discovery

用于药物发现模块化任务执行的大型语言模型代理

Janghoon Ock, Radheesh Sharma Meda, Srivathsan Badrinarayanan, Neha S. Aluru, Achuth Chandrasekhar, Amir Barati Farimani

机构 * Department of Chemical Engineering, Carnegie Mellon University(化学工程系,卡内基梅隆大学) Department of Material Science and Engineering, Carnegie Mellon University(材料科学与工程系,卡内基梅隆大学) Department of Mechanical Engineering, Carnegie Mellon University(机械工程系,卡内基梅隆大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种基于大型语言模型的模块化框架,用于药物发现中的任务执行,通过自动化分子生成和属性预测提升药物筛选效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12306 2025-12-15 cs.AI cs.CY 79%

UpBench: A Dynamically Evolving Real-World Labor-Market Agentic Benchmark Framework Built for Human-Centric AI

UpBench: 一个动态演化的现实劳动力市场代理基准框架,专为以人为本的AI设计

Darvin Yi, Teng Liu, Mattie Terzolo, Lance Hasson, Ayan Sinha, Pablo Mendes, Andrew Rabinovich

机构 * Upwork

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 UpBench是一个动态演化的现实劳动力市场代理基准框架,通过真实工作和财务结果评估AI与人类协作的能力,推动人机协作的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10206 2025-12-15 cs.AI 77%

CP-Env: Evaluating Large Language Models on Clinical Pathways in a Controllable Hospital Environment

CP-Env:在可控医院环境中评估大型语言模型在临床路径中的表现

Yakun Zhu, Zhongzhen Huang, Qianhan Feng, Linjie Mu, Yannian Gu, Shaoting Zhang, Qi Dou, Xiaofan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学) SenseTime Research(商汤科技研究院)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI

AI总结 CP-Env通过可控医院环境评估大型语言模型在复杂临床路径中的表现,揭示其在决策和伦理方面的挑战,并推动医疗AI的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11315 2025-12-15 cs.LG 70%

Benchmarking the Generality of Vision-Language-Action Models

对视觉-语言-动作模型通用性的基准测试

Pranav Guruprasad, Sudipta Chowdhury, Harsh Sikka, Mridul Sharma, Helen Lu, Sean Rivera, Aryan Khurana, Hangliang Ren, Yangyue Wang

机构 * Manifold Research Metarch AI Georgia Tech(佐治亚理工学院) Tufts University(塔夫茨大学) Northeastern University(东北大学) Birla Institute of Technology and Science, Pilani(比拉理工学院,帕利尼) Institute for Research and Innovation in Intelligent Systems (IRIIS)(智能系统研究与创新研究所)

专题命中 Agent评测 :agent(abstract);tool use(abstract);分类 cs.LG

AI总结 本文提出MultiNet v1.0基准,评估视觉-语言-动作模型在六个基础能力领域的跨领域泛化能力,发现现有模型在未见领域和模态转移时表现显著退化。

Comments 23 pages, 7 figures, and 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18221 2025-12-15 cs.MA cs.AI cs.NE 70%

The Emergence of Complex Behavior in Large-Scale Ecological Environments

大规模生态环境中复杂行为的出现

Joseph Bejjani, Chase Van Amburg, Chengrui Wang, Chloe Huangyuan Su, Sarah M. Pratt, Yasin Mazloumi, Naeem Khoshnevis, Sham M. Kakade, Kianté Brantley, Aaron Walsman

机构 * Harvard University(哈佛大学) Fudan University(复旦大学) University of Washington(华盛顿大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 研究通过大规模生态模拟探索复杂行为的涌现机制,利用进化算法和大规模智能体系统揭示环境规模对行为稳定性的影响。

Comments 33 pages, 23 figures, 12 tables, experiment code available at https://github.com/jbejjani2022/ecological-emergent-behavior

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11612 2025-12-15 cs.CV eess.IV 67%

Embodied Image Compression

具身图像压缩

Chunyi Li, Rui Qing, Jianbo Zhang, Yuan Tian, Xiangyang Zhu, Zicheng Zhang, Xiaohong Liu, Weisi Lin, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室) Nanyang Technological University(南洋理工大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本文提出具身图像压缩问题,建立EmbodiedComp基准测试,证明现有模型在超低比特率下无法完成简单任务,推动具身AI在现实中的应用。

Comments 15 pages, 12 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05860 2025-12-15 cs.SE cs.AI 62%

Benchmarking AI Models in Software Engineering: A Review, Search Tool, and Unified Approach for Elevating Benchmark Quality

在软件工程中评估AI模型:一项综述、搜索工具和统一方法以提高基准质量

Roham Koohestani, Philippe de Bekker, Begüm Koç, Maliheh Izadi

机构 * EEMCS faculty, Delft University of Technology(代尔夫特理工大学EEMCS学院)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文提出BenchScout和BenchFrame,通过统一框架提升软件工程AI模型的基准质量,改进现有基准并验证其有效性。

Comments Accepted for publication in IEEE Transactions on Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10985 2025-12-15 q-bio.NC cs.AI cs.LG 62%

Marti-5: A Mathematical Model of "Self in the World" as a First Step Toward Self-Awareness

Marti-5:作为自我意识第一步的‘自我在世界’的数学模型

Igor Pivovarov, Sergey Shumsky

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 Marti-5模型通过区分自我与环境,提出自我意识的必要条件,用于预测和决策的强化学习代理在虚拟环境中成功学习游戏。

Comments 21 pages, 2 figures, 2 videos, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06915 2025-12-15 cs.SE 57%

Multi-Docker-Eval: A `Shovel of the Gold Rush' Benchmark on Automatic Environment Building for Software Engineering

多Docker评估:软件工程自动环境构建的‘淘金之铲’基准

Kelin Fu, Tianyu Liu, Zeyu Shang, Yingwei Ma, Jian Yang, Jiaheng Liu, Kaigui Bian

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 Multi-Docker-Eval基准通过评估自动环境构建的性能,揭示了当前模型在成功率、效率及影响因素上的关键发现,为构建全自动SWE流水线提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08442 2025-12-15 cs.CV cs.AI cs.RO 57%

Gaze on the Prize: Shaping Visual Attention with Return-Guided Contrastive Learning

聚焦奖励:通过回报引导的对比学习塑造视觉注意力

Andrew Lee, Ian Chuang, Dechen Gao, Kai Fukazawa, Iman Soltani

机构 * Department of Computer Science University of California Davis(加州大学戴维斯分校计算机科学系) Department of Electrical Engineering and Computer Sciences University of California Berkeley(加州大学伯克利分校电气工程与计算机科学系) Department of Mechanical and Aerospace Engineering University of California Davis(加州大学戴维斯分校机械与航空航天工程系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 Gaze on the Prize通过回报引导的对比学习,提升视觉强化学习的样本效率,解决ManiSkill3基准中难以学习的任务。

Comments Project page: https://andrewcwlee.github.io/gaze-on-the-prize

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16396 2025-12-15 cs.LG 57%

GoalLadder: Incremental Goal Discovery with Vision-Language Models

GoalLadder: 基于视觉语言模型的增量目标发现

Alexey Zakharov, Shimon Whiteson

机构 * University of Oxford(牛津大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 GoalLadder利用视觉语言模型在视觉环境中通过增量目标发现提升RL智能体性能,实现高成功率。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11264 2025-12-15 physics.app-ph cond-mat.mtrl-sci 50%

Electrical Stability of Cr2O3/\b{eta}-Ga2O3 and NiOx/\b{eta}-Ga2O3 Heterojunction Diodes

Cr2O3/η-Ga2O3和NiOx/η-Ga2O3异质结二极管的电气稳定性

Yizheng Liu, Haochen Wang, Carl Peterson, Chinmoy Nath Saha, Chris G. Van de Walle, Sriram Krishnamoorthy

专题命中 Agent评测 :agent(abstract)

AI总结 Cr2O3基异质结二极管在高温和环境暴露下表现出更高的稳定性和性能,优于NiOx基异质结二极管。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16763 2025-12-15 cond-mat.soft cond-mat.stat-mech 50%

Generalized non-reciprocal phase transitions in multipopulation systems

多群体系统中非互易相变的推广

Cheyne Weis, Ryo Hanai

专题命中 Agent评测 :agent(abstract)

AI总结 研究多群体非互易系统中相变的普遍特征,揭示时间依赖相和相变的多样性,发现恢复对称性的机制及同宿混沌的生成途径。

Comments 23 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏