arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2025-12-23 至 2025-12-23 共收录 155 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 6 篇

2508.01923 2025-12-23 astro-ph.IM astro-ph.GA 50%

SPAN: A cross-platform Python GUI software for optical and near-infrared spectral analysis

SPAN:一种跨平台的Python GUI软件,用于光学和近红外光谱分析

Daniele Gasparri, Lorenzo Morelli, Umberto Battino, Jairo Méndez Abreu, Adriana de Lorenzo-Cáceres

专题命中 GUI与网页智能体 :workflow(abstract)

AI总结 SPAN是一款跨平台Python GUI软件,用于光学和近红外光谱分析,提供统一的光谱处理工具,简化分析流程并保持科学准确性。

Comments 33 pages, 16 figures. Published on Astronomy and Computing

Journal ref Astronomy and Computing, Volume 55, April 2026, 101051

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 记忆与上下文管理 9 篇

2512.18746 2025-12-23 cs.CL cs.MA 83%

MemEvolve: Meta-Evolution of Agent Memory Systems

MemEvolve: 代理记忆系统的元进化

Guibin Zhang, Haotian Ren, Chong Zhan, Zhenhong Zhou, Junhao Wang, He Zhu, Wangchunshu Zhou, Shuicheng Yan

机构 * OPPO AI Agent Team, LV-NUS lab(OPPO 人工智能代理团队,LV-NUS 实验室)

专题命中 记忆与上下文管理 :agent(title,abstract);agentic(abstract);分类 cs.CL

AI总结 MemEvolve通过元进化框架联合进化代理的经验知识和记忆架构,实现代理在环境交互中的高效学习与泛化能力提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22732 2025-12-23 cs.LG cs.AI cs.CL cs.IR cs.MA cs.RO 82%

WebATLAS: An LLM Agent with Experience-Driven Memory and Action Simulation

WebATLAS: 一种基于经验驱动记忆和动作模拟的LLM代理

Jiali Cheng, Anjishnu Kumar, Roshan Lal, Rishi Rajasekaran, Hani Ramezani, Omar Zia Khan, Oleg Rokhlenko, Sunny Chiu-Webster, Gang Hua, Hadi Amiri

机构 * University of Massachusetts Lowell(马萨诸塞大学洛威尔分校) Amazon Alexa AI(亚马逊Alexa人工智能)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 WebATLAS通过经验驱动的记忆和前瞻动作模拟,实现无需微调的自主网页导航,成功率达63%。

Comments 9 pages, NeurIPS 2025 Workshop on Language Agents and World Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18892 2025-12-23 econ.TH cs.AI cs.LG 81%

Structural Reinforcement Learning for Heterogeneous Agent Macroeconomics

异质主体宏观经济学的结构强化学习

Yucheng Yang, Chiyuan Wang, Andreas Schaab, Benjamin Moll

机构 * University of Zurich and SFI(苏黎世大学和SFI) Peking University, School of Computer Science and BIGAI(北京大学计算机学院和BIGAI) UC Berkeley(加州大学伯克利分校) London School of Economics(伦敦经济学院)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出结构强化学习方法,用于高效求解异质主体宏观经济学模型,克服传统方法限制,实现快速全局求解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10218 2025-12-23 cs.SE 79%

Does SWE-Bench-Verified Test Agent Ability or Model Memory?

SWE-Bench-Verified测试的是代理能力还是模型记忆?

Thanosan Prathifkumar, Noble Saji Mathews, Meiyappan Nagappan

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.SE

AI总结 研究发现SWE-Bench-Verified基准可能反映模型训练记忆而非真实问题解决能力,建议转向更注重污染控制的新数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08139 2025-12-23 cs.IT cs.LG math.IT 79%

SCA-LLM: Spectral-Attentive LLM-Based Wireless World Modeling for Agentic Communications

SCA-LLM:基于频谱-注意力的LLM无线世界建模用于智能通信

Ke He, Le He, Lisheng Fan, Xianfu Lei, Thang X. Vu, George K. Karagiannidis, Symeon Chatzinotas

机构 * Interdisciplinary Centre for Security, Reliability and Trust (SnT), University of Luxembourg(安全、可靠性与信任跨学科研究中心(SnT),卢森堡大学) School of Computer Science of Guangzhou University(广州大学计算机科学学院) School of Information Science and Technology, Institute of Mobile Communications, Southwest Jiaotong University(信息科学与技术学院,移动通信研究所,西南交通大学) Department of Electrical and Computer Engineering, Aristotle University of Thessaloniki(电气与计算机工程系,塞萨洛尼基阿瑞斯托大学) Cyber Security Systems and Applied AI Research Center, Lebanese American University (LAU)(网络安全与应用人工智能研究中心,黎巴嫩美国大学)

专题命中 记忆与上下文管理 :agentic(title,abstract);分类 cs.LG

AI总结 SCA-LLM通过频谱-注意力适配器将信道状态信息与LLM结合,实现无线世界建模,提升预测性能和零样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19154 2025-12-23 cs.LG cs.AI 62%

Beyond Sliding Windows: Learning to Manage Memory in Non-Markovian Environments

超越滑动窗口:在非马尔可夫环境中学习管理内存

Geraud Nangue Tasse, Matthew Riemer, Benjamin Rosman, Tim Klinger

机构 * CSAM School, University of the Witwatersrand(瓦茨堡大学CSAM学院) IBM Research(IBM研究院) Mila, Université de Montréal(蒙特利尔大学Mila)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出自适应堆叠元算法,通过维护较小的记忆堆栈,在非马尔可夫环境中减少计算和内存需求,同时有效管理记忆以避免过度删除重要经验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18940 2025-12-23 cs.CL cs.SE 62%

FASTRIC: Prompt Specification Language for Verifiable LLM Interactions

FASTRIC:用于可验证大语言模型交互的提示规范语言

Wen-Long Jin

机构 * Department of Civil and Environmental Engineering(土木与环境工程系) California Institute for Telecommunications and Information Technology(电信与信息科技学院) Institute of Transportation Studies(交通研究学院) University of California, Irvine, CA 92697-3600(加州大学伊维德分校)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.CL、cs.SE

AI总结 FASTRIC通过显式化有限状态机构建可验证的大语言模型交互协议,揭示模型特定的规范正式程度范围,实现交互设计的系统化工程。

Comments 13 pages, 3 figures. Supplementary materials at https://doi.org/10.17605/OSF.IO/PV6R3

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19537 2025-12-23 cs.CL 57%

Event Extraction in Large Language Model

大规模语言模型中的事件提取

Bobo Li, Xudong Han, Jiang Liu, Yuzhe Ding, Liqiang Jing, Zhaoqi Zhang, Jinheng Li, Xinya Du, Fei Li, Meishan Zhang, Min Zhang, Aixin Sun, Philip S. Yu, Hao Fei

机构 * National University of Singapore(新加坡国立大学) University of Sussex(苏塞克斯大学) Wuhan University(武汉大学) University of Texas at Dallas(德克萨斯大学达拉斯分校) Nanyang Technological University(南洋理工大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) University of Illinois at Chicago(伊利诺伊大学香槟分校)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.CL

AI总结 本文探讨了大规模语言模型中事件提取的系统组件,提出通过事件方案、结构和存储提升事件处理的可靠性与智能体准备性。

Comments 38 pages, 9 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18109 2025-12-23 eess.SY cs.SY 50%

Timing-Aware Two-Player Stochastic Games with Self-Triggered Control

具有自触发控制的时序感知双人随机游戏

Yunian Pan, Quanyan Zhu

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文提出了一种基于自触发控制的双人随机游戏框架,解决了纳什和斯塔克尔伯格时序承诺问题,并通过动态规划分解实现了可解的策略优化。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. Agent评测 24 篇

2512.18450 2025-12-23 cs.AI cs.CV cs.MA 79%

Agent-Based Output Drift Detection for Breast Cancer Response Prediction in a Multisite Clinical Decision Support System

基于代理的输出漂移检测用于多中心临床决策支持系统中的乳腺癌反应预测

Xavier Rafael-Palou, Jose Munuera, Ana Jimenez-Pastor, Richard Osuala, Karim Lekadir, Oliver Diaz

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出基于代理的多中心临床决策支持系统中的输出漂移检测方法,通过模拟多中心环境验证了其在乳腺癌反应预测中的有效性,展示了自适应方案在漂移检测和严重性分类上的优越性能。

Comments Accepted at MICAD (Medical Imaging and Computer-Aided Diagnosis) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18803 2025-12-23 cs.CY cs.MA 78%

Quantifying the Lifelong Impact of Resilience Interventions via Agent-Based LLM Simulation

通过基于代理的LLM模拟量化韧性干预的终身影响

Vivienne L'Ecuyer Ming

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出LALS框架,通过基于代理的LLM模拟量化韧性干预的终身影响,揭示早期干预对财富积累的显著正向作用。

Comments 31 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20068 2025-12-23 cs.DC cs.LG cs.SY eess.SY 77%

JITServe: SLO-aware LLM Serving with Imprecise Request Information

JITServe: 带有服务级别目标的LLM服务系统

Wei Zhang, Zhiyu Wu, Yi Mu, Rui Ning, Banruo Liu, Nikhil Sarda, Myungjin Lee, Fan Lai

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.LG

AI总结 JITServe通过即时调度和优化资源分配,提升LLM服务吞吐量并实现资源节省。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19018 2025-12-23 cs.SE 70%

PEAK: A Performance Engineering AI-Assistant for GPU Kernels Powered by Natural Language Transformations

PEAK:一种基于自然语言转换的GPU内核性能工程AI助手

Muhammad Usman Tariq, Abhinav Jangda, Angelica Moreira, Madan Musuvathi, Tyler Sorensen

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.SE

AI总结 PEAK是一种基于自然语言转换的GPU内核性能工程AI助手,通过自然语言编写代码优化并验证性能,适用于CUDA、HIP和HLSL等后端,实现与供应商库相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13524 2025-12-23 cs.AI cs.HC 70%

FreeAskWorld: An Interactive and Closed-Loop Simulator for Human-Centric Embodied AI

FreeAskWorld: 一种面向人类的交互式闭环模拟器用于具身人工智能

Yuhang Peng, Yizhou Pan, Xinning He, Jihaoyu Yang, Xinyu Yin, Han Wang, Xiaoji Zheng, Chao Gao, Jiangtao Gong

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 FreeAskWorld通过整合大语言模型和交互式闭环模拟,提升具身人工智能在复杂社会行为和自然交互中的表现。

Comments 9 pages, 4 figures

Journal ref AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19247 2025-12-23 cs.CL cs.AI 62%

Auto-Prompting with Retrieval Guidance for Frame Detection in Logistics

基于检索引导的自动提示法用于物流帧检测

Do Minh Duc, Quan Xuan Truong, Nguyen Tat Dat, Nguyen Van Vinh

机构 * Faculty of Information Technology, VNU University of Engineering and Technology(信息技术学院,越南工程大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出基于检索引导的自动提示法,通过优化提示提升物流文本帧检测的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19551 2025-12-23 cs.AI 57%

Towards Closed-Loop Embodied Empathy Evolution: Probing LLM-Centric Lifelong Empathic Motion Generation in Unseen Scenarios

迈向闭环式具身共情进化:探索以LLM为中心的终身共情动作生成在未见场景中的能力

Jiawen Wang, Jingjing Wang Tianyang Chen, Min Zhang, Guodong Zhou

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出L^2-EMG任务,旨在通过情感解耦和场景适应挑战提升LLM在未见场景中的共情动作生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18906 2025-12-23 cs.CL 57%

Remedy-R: Generative Reasoning for Machine Translation Evaluation without Error Annotations

Remedy-R:无错误标注的机器翻译评估生成推理

Shaomu Tan, Ryosuke Mitani, Ritvik Choudhary, Qiyu Wu, Toshiyuki Sekiya, Christof Monz

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 Remedy-R是一种无需错误标注的生成式机器翻译评估方法,通过强化学习训练,提供可解释的评估和翻译改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15584 2025-12-23 cs.AI cs.GT 57%

A Decision-Theoretic Approach for Managing Misalignment

一种用于管理偏差的决策理论方法

Daniel A. Herrmann, Abinav Chari, Isabelle Qian, Sree Sharvesh, B. A. Levinstein

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Georgia Institute of Technology(佐治亚理工学院) University of California, Berkeley(加州大学伯克利分校) Amrita Vishwa Vidyapeetham(阿米特拉维瓦大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种决策理论框架,用于在不确定情况下评估人工智能代理的偏差是否足够,以决定是否委托决策。

Comments Second Conference of the International Association for Safe and Ethical Artificial Intelligence (IASEAI '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17559 2025-12-23 cs.CL cs.DB 57%

SCARE: A Benchmark for SQL Correction and Question Answerability Classification for Reliable EHR Question Answering

SCARE:一个用于SQL校正和问题可回答性分类的基准,以实现可靠的EHR问答系统

Gyubok Lee, Woosog Chay, Edward Choi

机构 * Korea Advanced Institute of Science & Technology(韩国科学技术院)

专题命中 Agent评测 :agentic(abstract);分类 cs.CL

AI总结 SCARE是一个用于评估SQL校正和问题可回答性分类的基准,旨在提升EHR问答系统的安全性与可靠性。

Comments ML4H 2025 Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02864 2025-12-23 cs.NE cs.AI math.CA math.CO math.MG 57%

Mathematical exploration and discovery at scale

大规模数学探索与发现

Bogdan Georgiev, Javier Gómez-Serrano, Terence Tao, Adam Zsolt Wagner

机构 * Google DeepMind(谷歌DeepMind) Department of Mathematics, Brown University(布朗大学数学系) Institute for Advanced Study(高级研究院) UCLA Department of Mathematics(加州大学洛杉矶分校数学系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 AlphaEvolve通过进化搜索发现数学构造,提升数学问题解决效率

Comments 81 pages, 35 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12815 2025-12-23 cs.LG 57%

From Novelty to Imitation: Self-Distilled Rewards for Offline Reinforcement Learning

从新颖性到模仿:用于离线强化学习的自蒸馏奖励

Gaurav Chaudhary, Laxmidhar Behera

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 ReLOAD通过自蒸馏生成内在奖励,解决离线强化学习中显式奖励标注的难题,实现稳健的策略学习并达到传统方法的性能水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18189 2025-12-23 cs.AI cs.SC 57%

NL2CA: Auto-formalizing Cognitive Decision-Making from Natural Language Using an Unsupervised CriticNL2LTL Framework

NL2CA: 一种基于无监督批评树的自然语言自动形式化认知决策方法

Zihao Deng, Yijia Li, Renrui Zhang, Peijun Ye

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 NL2CA通过自动形式化自然语言描述的认知决策规则,实现无监督学习下的认知代理构建与优化,提升认知建模的可解释性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21176 2025-12-23 cs.AI 57%

Toward Revealing Nuanced Biases in Medical LLMs

向揭示医疗大语言模型中的细微偏见迈进

Farzana Islam Adiba, Rahmatollah Beheshti

机构 * University of Delaware(特拉华大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 本文提出结合知识图谱与辅助LLMs的框架,通过对抗性扰动和多跳表征技术,系统揭示医疗大语言模型中的复杂偏见模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20348 2025-12-23 cs.DC cs.LG 57%

Improving the Efficiency of a Deep Reinforcement Learning-Based Power Management System for HPC Clusters Using Curriculum Learning

通过课程学习改进基于深度强化学习的HPC集群电源管理系统效率

Thomas Budiarjo, Santana Yuda Pradata, Kadek Gemilang Santiyuda, Muhammad Alfian Amrizal, Reza Pulungan, Hiroyuki Takizawa

机构 * Department of Computer Science and Electronics, Universitas Gadjah Mada(加雅达大学计算机科学与电子系) Cyberscience Center, Tohoku University(东大网络科学中心) Department of Industrial Management, National Taiwan University of Science and Technology(台湾科技大学工业管理系)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本研究通过课程学习改进HPC集群电源管理的深度强化学习效率,实现能耗降低和作业执行优化。

Comments 13 pages, 17 figures, accepted at Supercomputing Asia '25, published by ACM

Journal ref SCA '25: Proceedings of the 2025 Supercomputing Asia Conference (SCA 2025), Singapore, Mar 10-13, 2025. Association for Computing Machinery, New York, NY, USA, pp. 1-13 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19168 2025-12-23 physics.optics cs.SY eess.SY 50%

Optical design and characterization of a multi-depth vision simulator

多深度视觉模拟器的光学设计与表征

Parviz Zolfaghari, Ehsan Varasteh, Koray Kavakli, Arda Gulersoy, Afsun Sahin, Hakan Urey

专题命中 Agent评测 :planning(abstract)

AI总结 多深度视觉模拟器通过模块化设计实现多深度渲染与IOL表征,支持术前规划和术后视力模拟。

Comments 16 pages, 8 figures. Preprint submitted to Biomedical Optics Express journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19014 2025-12-23 cond-mat.mtrl-sci physics.app-ph physics.bio-ph physics.chem-ph physics.med-ph 50%

Enhanced sinterability and in vitro bioactivity of diopside through fluoride doping

通过氟掺杂增强方石英的烧结性和体外生物活性

E. Salahinejad, M. Jafari Baghjeghaz

专题命中 Agent评测 :agent(abstract)

AI总结 本研究通过氟掺杂改善方石英的烧结性和生物活性,发现掺杂后材料在体外能形成更多羟基磷灰石。

Journal ref Ceramics International, 43 (2017) 4680-4686

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18620 2025-12-23 cs.GT 50%

Obnoxious Facility Location Problems: Strategyproof Mechanisms Optimizing $L_p$-Aggregated Utilities and Costs

令人反感的设施选址问题:设计策略证明机制以优化L_p-聚合效用和成本

Hau Chan, Jianan Lin, Chenhao Wang

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了如何通过策略证明机制优化L_p-聚合效用和成本的令人反感设施选址问题,分析了确定性和随机性机制的近似比界限。

Comments To appear in AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18587 2025-12-23 math.ST stat.ME stat.TH 50%

Graphon-Level Bayesian Predictive Synthesis for Random Network

图核层面的贝叶斯预测合成用于随机网络

Marios Papamichalis, Regina Ruane

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出图核层面的贝叶斯预测合成方法,用于随机网络,证明其在最小最大L^2速率最优,并展示其在结构特性控制和厚尾理论方面的贡献。

Comments This paper may be reorganized during submission to match journal requirements

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05998 2025-12-23 econ.TH 50%

Propose or Vote: A Canonical Democratic Procedure

提出或投票:一种民主程序

Hans Gersbach

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种无需中央机制设计的民主程序PoV,通过提案制定与投票结合的方式实现Condorcet赢家,并解决了偶数成员数量下的唯一性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏