arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2025-12-10 至 2025-12-10 共收录 85 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工作流自动化 17 篇

2512.08465 2025-12-10 eess.SY cs.PF cs.SY 50%

High-performance computing enabled contingency analysis for modern power networks

高性能计算赋能的现代电力网络 contingency 分析

Alexandre Gracia-Calvo, Francesca Rossi, Eduardo Iraola, Juan Carlos Olives-Camps, Eduardo Prieto-Araujo

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出基于概率风险指数的高性能计算方法,用于现代电力网络的N-2 contingency分析与小扰动稳定性评估,通过大规模模拟识别易引发连锁故障的关键组件。

Comments 10 apges, 5 figures, pending to be submitted on IJEPES

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08284 2025-12-10 physics.geo-ph cs.CV 50%

Self-Reinforced Deep Priors for Reparameterized Full Waveform Inversion

自增强深度先验用于参数化全波反演

Guangyuan Zou, Junlun Li, Feng Liu, Xuejing Zheng, Jianjian Xie, Guoyi Chen

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出自增强深度先验FWI方法,通过自适应更新网络参数和输入,提升地下速度模型重建的精度和稳定性。

Comments Submitted to GEOPHYSICS

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04191 2025-12-10 math.CO math.PR 50%

Sharp thresholds, hitting times and the power of choice for random geometric graphs

随机几何图的尖锐阈值、到达时间以及选择力量

Dawid Ignasiak, Lyuben Lichev

专题命中 工作流自动化 :agent(abstract)

AI总结 本文研究了随机几何图中连通性、哈密顿性和$k$-连通性的到达时间及选择力量,证明在离线2选择过程中这些属性可更快实现,且使用更少点数。

Comments 33 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00729 2025-12-10 physics.optics cond-mat.mtrl-sci 50%

Windowing in terahertz time-domain spectroscopy: resolving resonances in thin-film samples

太赫兹时域光谱中的窗口技术:解析薄膜样品中的共振现象

Esteban Marulanda, Fernanda L. Costa, Nicolas M. Kawahala, Felix G. G. Hernandez

专题命中 工作流自动化 :workflow(abstract)

AI总结 本研究提出了一种基于时间域窗口技术的实用流程,用于提高太赫兹时域光谱在薄层样品中解析共振特征的准确性。

Comments 18 pages, 5 figures

Journal ref J Infrared Milli Terahz Waves 46, 75 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07915 2025-12-10 quant-ph 50%

Fair Benchmarking of Optimisation Applications

公平评估优化应用

Frank Phillipson

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出了一种公平评估量子优化应用的框架,强调端到端工作流程、透明调优和问题多样性,以提高评估的可重复性和可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 1 篇

2512.07921 2025-12-10 cs.SE cs.AI 76%

DeepCode: Open Agentic Coding

DeepCode: 开放代理编程

Zongwei Li, Zhonghang Li, Zirui Guo, Xubin Ren, Chao Huang

机构 * The University of Hong Kong(香港大学)

专题命中 软件智能体 :agentic(title);分类 cs.AI、cs.SE

AI总结 DeepCode通过系统信息流管理,实现文档到代码库的高保真合成,超越现有商业代理和人类专家,推动自主科学复现的发展。

Comments for source code, please see https://github.com/HKUDS/DeepCode

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与网页智能体 3 篇

2512.08286 2025-12-10 cs.SE cs.AI cs.LG 89%

Empowering smart app development with SolidGPT: an edge-cloud hybrid AI agent framework

通过SolidGPT赋能智能应用开发:一种边缘-云混合AI代理框架

Liao Hu, Qiteng Wu, Ruoyu Qi

机构 * University of Illinois, Chicago, USA(伊利诺伊大学芝加哥分校) North Carolina State University, North Carolina, USA(北卡罗来纳州立大学)

专题命中 GUI与网页智能体 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 SolidGPT是一种结合边缘计算与云计算的AI代理框架,通过交互式代码查询、自动化项目生成和人机协作提升开发者生产力,适用于智能移动和软件工程领域。

Journal ref Advances in Engineering Innovation 16.7 (2025): 86-92

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08084 2025-12-10 cond-mat.mtrl-sci 67%

Bayesian Co-Navigation of a Computational Physical Model and AFM Experiment to Autonomously Survey a Combinatorial Materials Library

基于计算物理模型和原子力显微镜实验的贝叶斯协同导航以自主调查组合材料库

Boris N. Slautin, Kamyar Barakati, Yu Liu, Reece Emery, Philip Rack, Sergei V. Kalinin

专题命中 GUI与网页智能体 :agent(abstract);autonomous agent(abstract)

AI总结 本文提出通过贝叶斯协同导航框架,结合计算物理模型与AFM实验,自主调查组合材料库,实现理论模型与实验的动态整合与持续修正。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06912 2025-12-10 cs.RO cs.LG 57%

Khalasi: Energy-Efficient Navigation for Surface Vehicles in Vortical Flow Fields

Khalasi:在涡流流场中表面车辆的节能导航

Rushiraj Gadhvi, Sandeep Manjanna

机构 * Plaksha University(普拉克斯大学)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.LG

AI总结 本文提出了一种基于强化学习的端到端方法,用于在涡流流场中实现表面车辆的节能导航,通过局部速度测量学习流感知的导航策略,显著提升能源效率和泛化能力。

Comments Under Review for International Conference on Robotics and Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 记忆与上下文管理 2 篇

2512.07853 2025-12-10 cs.LG cs.AI cs.DC 66%

GPU Memory Prediction for Multimodal Model Training

多模态模型训练的GPU内存预测

Jinwoo Jeong, Minchul Kang, Younghun Go, Changyong Shin, Hyunho Lee, Junho Yoon, Gyeongsik Yang, Chuck Yoo

机构 * Korea University(韩国大学) KT Corporation(KT公司)

专题命中 记忆与上下文管理 :agentic(abstract,comments);分类 cs.AI、cs.LG

AI总结 本文提出了一种用于多模态模型训练的GPU内存预测框架,通过分解模型结构和分析训练行为,实现了高精度的内存预测。

Comments 1st Workshop on Systems for Agentic AI (SAA '25), co-located with SOSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08058 2025-12-10 cond-mat.stat-mech physics.bio-ph 50%

Emergent memory in cell-like active systems

细胞样活性系统中的涌现记忆

Marc Besse, Raphaël Voituriez

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本研究提出了一种新的活性粒子模型,通过引入内部状态动态和环境感知,揭示了细胞样系统中环境记忆的自发涌现及其对集体行为的影响。

Comments Main: 23 pages, 5 figures. SM: 39 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. Agent评测 14 篇

2512.07497 2025-12-10 cs.AI cs.SE 86%

How Do LLMs Fail In Agentic Scenarios? A Qualitative Analysis of Success and Failure Scenarios of Various LLMs in Agentic Simulations

大型语言模型在代理场景中为何失败?对各种LLM在代理模拟中成功与失败场景的定性分析

JV Roig

机构 * Kamiwaza AI

专题命中 Agent评测 :agentic(title,abstract);autonomous agent(abstract);tool-use(abstract);分类 cs.AI、cs.SE

AI总结 研究分析了LLM在代理任务中的失败原因,发现模型规模不决定鲁棒性,强调训练和设计对可靠性的重要性。

Comments 48 pages, 3 tables, 2 listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07909 2025-12-10 cs.CR cs.CY 82%

Agentic Artificial Intelligence for Ethical Cybersecurity in Uganda: A Reinforcement Learning Framework for Threat Detection in Resource-Constrained Environments

代理人工智能用于乌干达的伦理网络安全:一种强化学习框架用于资源受限环境中的威胁检测

Ibrahim Adabara, Bashir Olaniyi Sadiq, Aliyu Nuhu Shuaibu, Yale Ibrahim Danjuma, Venkateswarlu Maninti, Mutebi Joe

专题命中 Agent评测 :agentic(title,abstract);agent(abstract)

AI总结 本研究提出一种结合强化学习和伦理治理的代理人工智能框架,用于资源受限环境中的网络安全威胁检测,实现了100%的检测率和零假阳性,提升网络安全效果和公平性。

Comments 29 pages, 7 figures, 2 tables, 1 appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08629 2025-12-10 cs.AI cs.CV cs.HC 79%

See-Control: A Multimodal Agent Framework for Smartphone Interaction with a Robotic Arm

See-Control: 一种多模态代理框架用于智能手机与机械臂的交互

Haoyu Zhao, Weizhong Ding, Yuhao Yang, Zheng Tian, Linyi Yang, Kun Shao, Jun Wang

机构 * University College London(伦敦大学学院) Imperial College London(伦敦帝国学院) Huawei Noah’s Ark Lab(华为诺亚实验室) ShanghaiTech University(上海科技大学) Southern University of Science(南方科技大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 See-Control通过直接与机械臂交互实现智能手机操作,无需ADB或系统后台访问,提供了一个平台无关的多模态代理框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15593 2025-12-10 cs.AI 79%

What Does It Take to Be a Good AI Research Agent? Studying the Role of Ideation Diversity

要成为优秀的AI研究代理需要什么?研究思想多样性的作用

Alexis Audran-Reiss, Jordi Armengol-Estapé, Karen Hambardzumyan, Amar Budhiraja, Martin Josifoski, Edan Toledo, Rishi Hazra, Despoina Magka, Michael Shvartsman, Parth Pathak, Justine T Kao, Lucia Cipolina-Kun, Bhavul Gauri, Jean-Christophe Gagnon-Audet, Emanuel Tewolde, Jenny Zhang, Taco Cohen, Yossi Adi, Tatiana Shavrina, Yoram Bachrach

机构 * FAIR at Meta(FAIR(人工智能研究机构)于Meta) University College London(伦敦大学学院) Meta SuperIntelligence Labs(Meta超智能实验室) University of British Columbia(不列颠哥伦比亚大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 研究思想多样性对AI研究代理性能的影响,通过分析不同模型和框架的轨迹及实验验证,发现高思想多样性提升代理表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23856 2025-12-10 cs.AI 79%

From Benchmarks to Business Impact: Deploying IBM Generalist Agent in Enterprise Production

从基准到业务影响:在企业生产中部署IBM通用代理

Segev Shlomov, Alon Oved, Sami Marreed, Ido Levy, Offer Akrabi, Avi Yaeli, Łukasz Strąk, Elizabeth Koumpan, Yinon Goldshtein, Eilam Shapira, Nir Mashkif, Asaf Adi

机构 * IBM

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 IBM开发并试点了CUGA,展示了通用代理在企业生产环境中的应用,通过分层规划-执行架构实现先进性能,并在人才招聘领域验证其可扩展性和安全性。

Comments AAAI Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08762 2025-12-10 q-bio.PE physics.bio-ph 78%

Resource and population dynamics in an agent-environment interaction model

代理-环境交互模型中的资源与种群动态

G. Briozzo, G. J. Sibona, F. Peruani

专题命中 Agent评测 :agent(title,abstract)

AI总结 该研究提出一个代理-环境交互模型,探讨资源与种群动态的关系,揭示种群大小与能量、代谢及资源获取之间的复杂关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07785 2025-12-10 physics.data-an cs.AI cs.LG hep-ex 73%

Automating High Energy Physics Data Analysis with LLM-Powered Agents

利用LLM代理自动化高能物理数据分析

Eli Gendreau-Distler, Joshua Ho, Dongwon Kim, Luc Tomas Le Pottier, Haichen Wang, Chengxi Yang

机构 * Department of Physics, University of California, Berkeley, Berkeley, CA 94720, USA(加州大学伯克利分校物理系) Physics Division, Lawrence Berkeley National Laboratory, Berkeley, CA 94720, USA(伯克利国家实验室物理部)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.LG

AI总结 本研究利用LLM代理自动化高能物理数据分析,通过混合系统结合LLM和Snakemake工作流管理器,评估代理在多阶段工作流中的性能。

Comments 16 pages, 6 figures, 2 tables, the 39th Conference on Neural Information Processing Systems (NeurIPS 2025) - Machine Learning and the Physical Sciences (ML4PS) workshop (poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25643 2025-12-10 cs.AI 70%

SOCK: A Benchmark for Measuring Self-Replication in Large Language Models

SOCK:一种衡量大语言模型自我复制能力的基准

Justin Chavarria, Rohan Raizada, Justin White, Eyad Alhetairshi

机构 * Albion College(阿尔比恩学院) Hunter College(亨特学院) University of Arizona(亚利桑那大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 SOCK提出了一种评估大语言模型自我复制能力的基准,旨在建立标准并减少多代理系统中的潜在风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07904 2025-12-10 cs.LG cs.AI 62%

Test-driven Reinforcement Learning in Continuous Control

连续控制中的测试驱动强化学习

Zhao Yu, Xiuping Wu, Liangjun Ke

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出测试驱动强化学习框架,通过多测试函数替代传统奖励函数,简化任务定义并提升多目标优化能力。

Comments AAAI 2026 oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08036 2025-12-10 cs.HC cs.AI cs.SY eess.SY 57%

Joint Activity Design Heuristics for Enhancing Human-Machine Collaboration

增强人机协作的联合活动设计启发式方法

Mohammadreza Jalaeian, Dane A. Morey, Michael F. Rayo

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出十四条启发式方法,用于设计支持联合人机协作的技术,强调五个关键宏观认知功能的支持与易用性同等重要。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08012 2025-12-10 cs.LG 57%

Benchmarking Offline Multi-Objective Reinforcement Learning in Critical Care

在重症护理中评估离线多目标强化学习基准

Aryaman Bansal, Divya Sharma

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文评估了三种离线多目标强化学习算法在重症护理中的性能,发现PEDA DT在灵活性和多目标决策方面表现优异,为个性化医疗决策提供了新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07874 2025-12-10 cs.LG 57%

Controllable risk scenario generation from human crash data for autonomous vehicle testing

从人类碰撞数据生成可控的风险场景用于自动驾驶测试

Qiujing Lu, Xuanhan Wang, Runze Yuan, Wei Lu, Xinyi Gong, Shuo Feng

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Beijing DiDi Infinity Technology and Development Co., Ltd.(北京滴滴无限科技发展有限公司) Space Information Research Institute and Zhejiang Key Laboratory of Space Information Sensing and Transmission, Hangzhou Dianzi University(空间信息研究所和浙江空间信息感知与传输重点实验室,杭州电子科技大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 CRAG通过生成可控的风险场景,提升自动驾驶车辆在罕见安全关键条件下的鲁棒性评估效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08556 2025-12-10 eess.SP 50%

Contextual Bandits and Reconfigurable Intelligent Surfaces for Predictive LTM Handover Decisions

上下文老虎机与可重构智能表面用于预测性LTM切换决策

Ainna Yue Moreno-Locubiche, Josep Vidal, Olga Muñoz-Medina, Margarita Cabrera-Bean

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出利用可重构智能表面和上下文老虎机预测切换决策,以减少切换次数和信令开销,提升链路可靠性。

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08422 2025-12-10 math.OC 50%

Optimal Operation and Valuation of Electricity Storages in Intraday Markets

日内市场中电力存储的最优运营与估值

Jean-Philippe Chancelier, Michel de Lara, François Pacaud, Tanguy Lindegaard, Teemu Pennanen, Ari-Pekka Perkkiö

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出利用随机双动态规划算法,在日内市场中通过考虑风险偏好和电池特性,实现电力存储的最优运营与估值。

详情

展开后加载摘要…

URL PDF HTML 收藏