arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2025-12-16 至 2025-12-16 共收录 115 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 1 篇

2512.12806 2025-12-16 cs.AI 70%

Fault-Tolerant Sandboxing for AI Coding Agents: A Transactional Approach to Safe Autonomous Execution

面向AI编码代理的容错沙盒:一种用于安全自主执行的事务方法

Boyang Yan

机构 * University of Virginia(弗吉尼亚大学)

专题命中 软件智能体 :agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文提出一种基于事务的容错沙盒框架,通过事务性文件系统快照和策略拦截层,实现对AI编码代理自主执行的安全保障,显著降低延迟并提高安全性。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. GUI与网页智能体 3 篇

2512.13438 2025-12-16 cs.SE cs.AI 81%

From User Interface to Agent Interface: Efficiency Optimization of UI Representations for LLM Agents

从用户界面到代理界面:UI表示的效率优化以提升LLM代理性能

Dezhi Ran, Zhi Gong, Yuzhe Guo, Mengzhou Wu, Yuan Cao, Haochuan Lu, Hengyu Zhang, Xia Zeng, Gang Cao, Liangchao Yao, Yuetang Deng, Wei Yang, Tao Xie

机构 * Key Lab of HCST (PKU), MOE(HCST关键实验室(PKU),教育部) SCS, Peking University(SCS,北京大学) Tencent Inc.(腾讯公司) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 UIFormer通过约束优化和结构分解,优化LLM代理的UI表示效率,实现令牌减少与性能提升的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18734 2025-12-16 cs.RO 67%

Learning Obstacle Avoidance using Double DQN for Quadcopter Navigation

使用双DQN学习避障以实现四旋翼导航

Nishant Doshi, Amey Sutavani, Sanket Gujar

机构 * Worcester Polytechnic Institute(沃斯特理工学院)

专题命中 GUI与网页智能体 :agent(abstract);planning(abstract)

AI总结 本文提出使用双DQN算法,通过深度相机实现四旋翼机器人在模拟城市环境中的避障导航学习。

Comments Fixed typo in second author's name throughout the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11876 2025-12-16 cs.RO cs.SY eess.SY 50%

Traversability Aware Autonomous Navigation for Multi-Modal Mobility Morphobot (M4)

多模态移动形变机器人(M4)的可 traversability 自主导航

Hrigved Mahesh Suryawanshi

机构 * SiliconSynapse Lab(硅合成实验室)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本研究提出了一种基于LiDAR的多模态移动形变机器人M4的可 traversability 自主导航框架,通过学习地形分析生成节能路径,提升地形适应能力。

Comments Master's thesis

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 记忆与上下文管理 4 篇

2512.12686 2025-12-16 cs.AI cs.CL 84%

Memoria: A Scalable Agentic Memory Framework for Personalized Conversational AI

Memoria: 一种可扩展的代理记忆框架用于个性化对话式AI

Samarth Sarin, Lovepreet Singh, Bhaskarjit Sarmah, Dhagash Mehta

机构 * BlackRock, Inc.(黑石公司)

专题命中 记忆与上下文管理 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 Memoria通过结合动态摘要和加权知识图,为LLM提供持久记忆,实现对话连贯性和个性化,适用于需要适应性用户体验的行业应用。

Comments Paper accepted at 5th International Conference of AIML Systems 2025, Bangalore, India

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12818 2025-12-16 cs.CL cs.AI cs.IR cs.LG 82%

Hindsight is 20/20: Building Agent Memory that Retains, Recalls, and Reflects

事后诸葛亮:构建具有保留、回忆和反思能力的智能体记忆

Chris Latimer, Nicoló Boschi, Andrew Neeser, Chris Bartholomew, Gaurav Srivastava, Xuan Wang, Naren Ramakrishnan

机构 * The Washington Post(华盛顿邮报) Virginia Tech(弗吉尼亚理工大学)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 Hindsight通过结构化内存架构提升智能体在长对话中的记忆与推理能力,显著提高多会话和开放领域问题的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17248 2025-12-16 cs.LG cs.CR 57%

Backdoors in DRL: Four Environments Focusing on In-distribution Triggers

DRL中的后门:聚焦于分布内触发器的四个环境

Chace Ashcraft, Ted Staley, Josh Carney, Cameron Hickert, Derek Juba, Kiran Karra, Nathan Drenkow

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG

AI总结 本文针对深度强化学习中的后门攻击,通过四个环境探讨分布内触发器的特性与影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13096 2025-12-16 cs.DC 50%

Toward Self-Healing Networks-on-Chip: RL-Driven Routing in 2D Torus Architectures

迈向自修复网络-on-Chip:基于强化学习的2D Torus架构路由

Mohammad Walid Charrwi, Zaid Hussain

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本研究通过强化学习方法在2D Torus架构中实现自适应路由,显著提升吞吐量和故障容忍性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. Agent评测 17 篇

2512.12719 2025-12-16 cs.SE 83%

Towards AI Agents Supported Research Problem Formulation

Anrafel Fernandes Pereira, Maria Teresa Baldassarre, Daniel Mendez, Marcos Kalinowski

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25540 2025-12-16 cs.AI 79%

RadOnc-GPT: An Autonomous LLM Agent for Real-Time Patient Outcomes Labeling at Scale

RadOnc-GPT:一种用于大规模实时患者结果标注的自主大语言模型代理

Jason Holmes, Yuexing Hao, Mariana Borras-Osorio, Federico Mastroleo, Santiago Romero Brufau, Valentina Carducci, Katie M Van Abel, David M Routman, Andrew Y. K. Foong, Liv M Muller, Satomi Shiraishi, Daniel K Ebner, Daniel J Ma, Sameer R Keole, Samir H Patel, Mirek Fatyga, Martin Bues, Brad J Stish, Yolanda I Garces, Michelle A Neben Wittich, Robert L Foote, Sujay A Vora, Nadia N Laack, Mark R Waddle, Wei Liu

机构 * Mayo Clinic, Phoenix, AZ, USA(梅奥诊所,凤凰城,亚利桑那州,美国) Mayo Clinic, Rochester, MN, USA(梅奥诊所,罗切斯特,明尼苏达州,美国)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 RadOnc-GPT是一种自主大语言模型代理,通过自主检索和评估实现大规模实时患者结果标注,提升放射肿瘤学研究的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12443 2025-12-16 cs.AI cs.SE 73%

AI Transparency Atlas: Framework, Scoring, and Real-Time Model Card Evaluation Pipeline

AI透明度地图:框架、评分与实时模型卡片评估流程

Akhmadillo Mamirov, Faiaz Azmain, Hanyu Wang

机构 * Department of Computer Science, The College of Wooster, Wooster, OH, USA(计算机科学系,沃斯特学院,沃斯特,OH,USA) Robert F. Wagner Graduate School of Public Service, New York University, New York, NY, USA(罗伯特·F·瓦格纳公共事务研究生学院,纽约大学,纽约,NY,USA)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出AI透明度框架和实时评估流程,评估50个模型发现前沿实验室合规率约80%,而多数供应商低于60%,安全关键领域存在显著缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23046 2025-12-16 cs.CL cs.AI cs.CV cs.RO 73%

SoMi-ToM: Evaluating Multi-Perspective Theory of Mind in Embodied Social Interactions

SoMi-ToM:评估具身社会互动中的多视角理论之心假设

Xianzhe Fan, Xuhui Zhou, Chuanyang Jin, Kolby Nottingham, Hao Zhu, Maarten Sap

机构 * The University of Hong Kong(香港大学) Carnegie Mellon University(卡内基梅隆大学) Johns Hopkins University(约翰霍普金斯大学) University of California Irvine(加州大学尔湾分校) Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 SoMi-ToM基准通过多视角评估人类与模型在具身社会互动中的理论之心能力,揭示大型视觉-语言模型在复杂社交场景中的不足。

Comments 24 pages, 6 figures

Journal ref Proceedings of the 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13262 2025-12-16 cs.RO cs.CV 71%

Post-Training and Test-Time Scaling of Generative Agent Behavior Models for Interactive Autonomous Driving

生成代理行为模型在交互式自动驾驶中的训练和测试时间缩放

Hyunki Seong, Jeong-Kyun Lee, Heesoo Myeong, Yongho Shin, Hyun-Mook Cho, Duck Hoon Kim, Pranav Desai, Monu Surana

专题命中 Agent评测 :agent(title)

AI总结 本文提出GRBO和Warm-K两种方法,用于提升交互式自动驾驶中生成代理行为模型的训练和测试时间性能,提高安全性和鲁棒性。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02904 2025-12-16 eess.IV cs.CV cs.LG 70%

Surgical Vision World Model

手术视觉世界模型

Saurabh Koju, Saurav Bastola, Prashant Shrestha, Sanskar Amgain, Yash Raj Shrestha, Rudra P. K. Poudel, Binod Bhattarai

机构 * University of Aberdeen, UK(阿伯丁大学,英国) Cambridge Research Laboratory, Toshiba Europe Ltd, UK(剑桥研究实验室,东芝欧洲有限公司,英国) Nepal Applied Mathematics and Informatics Institute for research (Naamii), Nepal(尼泊尔应用数学与信息学研究所(Naamii),尼泊尔) University of Lausanne, Switzerland(洛桑大学,瑞士)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.LG

AI总结 本文提出首个手术视觉世界模型,通过生成动作可控的手术数据,提升自主手术代理训练的现实感与交互性。

Comments This paper has been accepted at the Data Engineering in Medical Imaging Workshop, MICCAI 2025

Journal ref MICCAI Workshop on Data Engineering in Medical Imaging (2025) 1-10

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12042 2025-12-16 cs.CL 70%

Benchmarking Contextual Understanding for In-Car Conversational Systems

车载对话系统上下文理解评估

Philipp Habicht, Lev Sorokin, Abdullah Saydemir, Ken E. Friedl, Andrea Stocco

机构 * Humboldt University of Berlin(柏林洪堡大学) Technical University of Munich(慕尼黑技术大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文通过LLM和提示技术评估车载对话系统上下文理解,发现非推理模型在成本效率上表现最佳,DeepSeek-R1达到高F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13297 2025-12-16 cs.AI cs.LG 62%

MedInsightBench: Evaluating Medical Analytics Agents Through Multi-Step Insight Discovery in Multimodal Medical Data

MedInsightBench: 通过多步骤洞察发现评估医疗分析代理在多模态医疗数据中的能力

Zhenghao Zhu, Chuxue Cao, Sirui Han, Yuanfeng Song, Xing Chen, Caleb Chen Cao, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ByteDance(字节跳动)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 MedInsightBench通过多步骤洞察发现评估医疗分析代理在多模态医疗数据中的能力,提出MedInsightAgent框架提升医疗数据洞察发现性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12856 2025-12-16 cs.AI cs.LG 62%

Forgetful but Faithful: A Cognitive Memory Architecture and Benchmark for Privacy-Aware Generative Agents

忘却却忠实:一种认知记忆架构与隐私意识生成代理的基准测试

Saad Alqithami

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种认知记忆架构和隐私意识生成代理的基准测试,通过平衡性能、隐私和计算效率,提升生成代理在资源受限环境中的应用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19929 2025-12-16 physics.soc-ph cs.AI 57%

DynamiX: Large-Scale Dynamic Social Network Simulator

DynamiX: 大规模动态社交网络模拟器

Yanhui Sun, Wu Liu, Wentao Wang, Hantao Yao, Jiebo Luo, Yongdong Zhang

机构 * School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) Department of Computer Science, University of Rochester(计算机科学系,罗切斯特大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 DynamiX通过动态层级模块和不同用户类型的社交关系建模策略,提升了大规模动态社交网络模拟的准确性与实用性。

Comments Social and Information Networks

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12461 2025-12-16 cs.CL 57%

Is GPT-OSS Good? A Comprehensive Evaluation of OpenAI's Latest Open Source Models

GPT-OSS好吗?对OpenAI最新开源模型的综合评估

Ziqian Bi, Keyu Chen, Chiung-Yi Tseng, Danyang Zhang, Tianyang Wang, Hongying Luo, Lu Chen, Junming Huang, Jibin Guan, Junfeng Hao, Xinyuan Song, Junhao Song

机构 * AI Agent Lab, Vokram Group(AI代理实验室,Vokram集团) Purdue University(普渡大学) Georgia Institute of Technology(佐治亚理工学院) University of Minnesota(明尼苏达大学) Emory University(埃默里大学) Imperial College London(伦敦帝国学院)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 GPT-OSS在代码生成方面表现优异,但在多语言任务上存在不足,研究发现稀疏架构扩展未必能带来性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12211 2025-12-16 cs.RO cs.AI cs.SY eess.SY 57%

Measuring What Matters: Scenario-Driven Evaluation for Trajectory Predictors in Autonomous Driving

衡量重要性:面向自动驾驶轨迹预测器的场景驱动评估

Longchao Da, David Isele, Hua Wei, Manish Saroya

机构 * HRI, San Jose(HRI, 洛杉矶)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种基于场景驱动的评估流程,通过准确性与多样性两个维度评估自动驾驶轨迹预测器,以更合理地反映其对自动驾驶车辆性能的影响。

Comments 9 Pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12420 2025-12-16 q-fin.PM q-fin.RM 50%

Deep Hedging with Reinforcement Learning: A Practical Framework for Option Risk Management

深度对冲与强化学习:期权风险管理的实用框架

Travon Lucius, Christian Koch, Jacob Starling, Julia Zhu, Miguel Urena, Carrie Hu

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出基于强化学习的深度对冲框架,通过动态对冲股票指数期权头寸,提升风险调整后收益,同时控制换手率和回撤。

Comments All code, configuration files, and experiment scripts are available at https://github.com/tlucius16/deep-hedging-rl

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19253 2025-12-16 cs.IR 50%

DeepResearchGym: A Free, Transparent, and Reproducible Evaluation Sandbox for Deep Research

DeepResearchGym: 一个免费、透明且可复现的深度研究评估沙盒

João Coelho, Jingjie Ning, Jingyuan He, Kangrui Mao, Abhijay Paladugu, Pranav Setlur, Jiahe Jin, Jamie Callan, João Magalhães, Bruno Martins, Chenyan Xiong

专题命中 Agent评测 :agentic(abstract)

AI总结 DeepResearchGym提供了一个免费、透明且可复现的深度研究评估沙盒,结合可复现的搜索API和严谨的评估协议,用于评估深度研究系统性能,展示其在成本效益训练中的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13244 2025-12-16 cs.GT cs.CC cs.MA econ.TH 50%

Fair Coordination in Strategic Scheduling

战略调度中的公平协调

Wei-Chen Lee, Martin Bullinger, Alessandro Abate, Michael Wooldridge

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种统一算法,通过调整子程序实现公平协调的调度问题,结合可信度和平等性属性,以在战略考虑下实现公平的调度结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12803 2025-12-16 eess.SY cs.SY 50%

Distributed Reinforcement Learning using Local Smart Meter Data for Voltage Regulation in Distribution Networks

利用本地智能电表数据进行分布式强化学习以实现配电网电压调节

Dong Liu, Juan S. Giraldo, Peter Palensky, Pedro P. Vergara

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种利用本地智能电表数据的分布式强化学习算法,通过动态Thevenin模型和校正策略提升配电网电压调节效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11805 2025-12-16 cs.CY 50%

AI Integration In ERP Evaluation Across Trends and Architectures

人工智能在ERP评估中的整合:跨趋势与架构

Monu Sharma

专题命中 Agent评测 :planning(abstract)

AI总结 本文提出了一种理论模型,将AI赋能的ERP性能评估指标与预测智能和自适应自动化相结合,以改进AI整合ERP的评估方法。

Comments 9 pages, 2 Figures. Journal of Information Systems Engineering and Management,2025

详情

展开后加载摘要…

URL PDF HTML 收藏