arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2025-12-23 至 2025-12-23 共收录 24 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 24 篇

2512.18450 2025-12-23 cs.AI cs.CV cs.MA 79%

Agent-Based Output Drift Detection for Breast Cancer Response Prediction in a Multisite Clinical Decision Support System

基于代理的输出漂移检测用于多中心临床决策支持系统中的乳腺癌反应预测

Xavier Rafael-Palou, Jose Munuera, Ana Jimenez-Pastor, Richard Osuala, Karim Lekadir, Oliver Diaz

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出基于代理的多中心临床决策支持系统中的输出漂移检测方法,通过模拟多中心环境验证了其在乳腺癌反应预测中的有效性,展示了自适应方案在漂移检测和严重性分类上的优越性能。

Comments Accepted at MICAD (Medical Imaging and Computer-Aided Diagnosis) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18803 2025-12-23 cs.CY cs.MA 78%

Quantifying the Lifelong Impact of Resilience Interventions via Agent-Based LLM Simulation

通过基于代理的LLM模拟量化韧性干预的终身影响

Vivienne L'Ecuyer Ming

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出LALS框架,通过基于代理的LLM模拟量化韧性干预的终身影响,揭示早期干预对财富积累的显著正向作用。

Comments 31 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20068 2025-12-23 cs.DC cs.LG cs.SY eess.SY 77%

JITServe: SLO-aware LLM Serving with Imprecise Request Information

JITServe: 带有服务级别目标的LLM服务系统

Wei Zhang, Zhiyu Wu, Yi Mu, Rui Ning, Banruo Liu, Nikhil Sarda, Myungjin Lee, Fan Lai

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.LG

AI总结 JITServe通过即时调度和优化资源分配,提升LLM服务吞吐量并实现资源节省。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19018 2025-12-23 cs.SE 70%

PEAK: A Performance Engineering AI-Assistant for GPU Kernels Powered by Natural Language Transformations

PEAK:一种基于自然语言转换的GPU内核性能工程AI助手

Muhammad Usman Tariq, Abhinav Jangda, Angelica Moreira, Madan Musuvathi, Tyler Sorensen

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.SE

AI总结 PEAK是一种基于自然语言转换的GPU内核性能工程AI助手,通过自然语言编写代码优化并验证性能,适用于CUDA、HIP和HLSL等后端,实现与供应商库相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13524 2025-12-23 cs.AI cs.HC 70%

FreeAskWorld: An Interactive and Closed-Loop Simulator for Human-Centric Embodied AI

FreeAskWorld: 一种面向人类的交互式闭环模拟器用于具身人工智能

Yuhang Peng, Yizhou Pan, Xinning He, Jihaoyu Yang, Xinyu Yin, Han Wang, Xiaoji Zheng, Chao Gao, Jiangtao Gong

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 FreeAskWorld通过整合大语言模型和交互式闭环模拟,提升具身人工智能在复杂社会行为和自然交互中的表现。

Comments 9 pages, 4 figures

Journal ref AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19247 2025-12-23 cs.CL cs.AI 62%

Auto-Prompting with Retrieval Guidance for Frame Detection in Logistics

基于检索引导的自动提示法用于物流帧检测

Do Minh Duc, Quan Xuan Truong, Nguyen Tat Dat, Nguyen Van Vinh

机构 * Faculty of Information Technology, VNU University of Engineering and Technology(信息技术学院,越南工程大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出基于检索引导的自动提示法,通过优化提示提升物流文本帧检测的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19551 2025-12-23 cs.AI 57%

Towards Closed-Loop Embodied Empathy Evolution: Probing LLM-Centric Lifelong Empathic Motion Generation in Unseen Scenarios

迈向闭环式具身共情进化:探索以LLM为中心的终身共情动作生成在未见场景中的能力

Jiawen Wang, Jingjing Wang Tianyang Chen, Min Zhang, Guodong Zhou

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出L^2-EMG任务,旨在通过情感解耦和场景适应挑战提升LLM在未见场景中的共情动作生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18906 2025-12-23 cs.CL 57%

Remedy-R: Generative Reasoning for Machine Translation Evaluation without Error Annotations

Remedy-R:无错误标注的机器翻译评估生成推理

Shaomu Tan, Ryosuke Mitani, Ritvik Choudhary, Qiyu Wu, Toshiyuki Sekiya, Christof Monz

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 Remedy-R是一种无需错误标注的生成式机器翻译评估方法,通过强化学习训练,提供可解释的评估和翻译改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15584 2025-12-23 cs.AI cs.GT 57%

A Decision-Theoretic Approach for Managing Misalignment

一种用于管理偏差的决策理论方法

Daniel A. Herrmann, Abinav Chari, Isabelle Qian, Sree Sharvesh, B. A. Levinstein

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Georgia Institute of Technology(佐治亚理工学院) University of California, Berkeley(加州大学伯克利分校) Amrita Vishwa Vidyapeetham(阿米特拉维瓦大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种决策理论框架,用于在不确定情况下评估人工智能代理的偏差是否足够,以决定是否委托决策。

Comments Second Conference of the International Association for Safe and Ethical Artificial Intelligence (IASEAI '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17559 2025-12-23 cs.CL cs.DB 57%

SCARE: A Benchmark for SQL Correction and Question Answerability Classification for Reliable EHR Question Answering

SCARE:一个用于SQL校正和问题可回答性分类的基准,以实现可靠的EHR问答系统

Gyubok Lee, Woosog Chay, Edward Choi

机构 * Korea Advanced Institute of Science & Technology(韩国科学技术院)

专题命中 Agent评测 :agentic(abstract);分类 cs.CL

AI总结 SCARE是一个用于评估SQL校正和问题可回答性分类的基准,旨在提升EHR问答系统的安全性与可靠性。

Comments ML4H 2025 Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02864 2025-12-23 cs.NE cs.AI math.CA math.CO math.MG 57%

Mathematical exploration and discovery at scale

大规模数学探索与发现

Bogdan Georgiev, Javier Gómez-Serrano, Terence Tao, Adam Zsolt Wagner

机构 * Google DeepMind(谷歌DeepMind) Department of Mathematics, Brown University(布朗大学数学系) Institute for Advanced Study(高级研究院) UCLA Department of Mathematics(加州大学洛杉矶分校数学系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 AlphaEvolve通过进化搜索发现数学构造,提升数学问题解决效率

Comments 81 pages, 35 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12815 2025-12-23 cs.LG 57%

From Novelty to Imitation: Self-Distilled Rewards for Offline Reinforcement Learning

从新颖性到模仿:用于离线强化学习的自蒸馏奖励

Gaurav Chaudhary, Laxmidhar Behera

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 ReLOAD通过自蒸馏生成内在奖励,解决离线强化学习中显式奖励标注的难题,实现稳健的策略学习并达到传统方法的性能水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18189 2025-12-23 cs.AI cs.SC 57%

NL2CA: Auto-formalizing Cognitive Decision-Making from Natural Language Using an Unsupervised CriticNL2LTL Framework

NL2CA: 一种基于无监督批评树的自然语言自动形式化认知决策方法

Zihao Deng, Yijia Li, Renrui Zhang, Peijun Ye

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 NL2CA通过自动形式化自然语言描述的认知决策规则,实现无监督学习下的认知代理构建与优化,提升认知建模的可解释性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21176 2025-12-23 cs.AI 57%

Toward Revealing Nuanced Biases in Medical LLMs

向揭示医疗大语言模型中的细微偏见迈进

Farzana Islam Adiba, Rahmatollah Beheshti

机构 * University of Delaware(特拉华大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 本文提出结合知识图谱与辅助LLMs的框架,通过对抗性扰动和多跳表征技术,系统揭示医疗大语言模型中的复杂偏见模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20348 2025-12-23 cs.DC cs.LG 57%

Improving the Efficiency of a Deep Reinforcement Learning-Based Power Management System for HPC Clusters Using Curriculum Learning

通过课程学习改进基于深度强化学习的HPC集群电源管理系统效率

Thomas Budiarjo, Santana Yuda Pradata, Kadek Gemilang Santiyuda, Muhammad Alfian Amrizal, Reza Pulungan, Hiroyuki Takizawa

机构 * Department of Computer Science and Electronics, Universitas Gadjah Mada(加雅达大学计算机科学与电子系) Cyberscience Center, Tohoku University(东大网络科学中心) Department of Industrial Management, National Taiwan University of Science and Technology(台湾科技大学工业管理系)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本研究通过课程学习改进HPC集群电源管理的深度强化学习效率,实现能耗降低和作业执行优化。

Comments 13 pages, 17 figures, accepted at Supercomputing Asia '25, published by ACM

Journal ref SCA '25: Proceedings of the 2025 Supercomputing Asia Conference (SCA 2025), Singapore, Mar 10-13, 2025. Association for Computing Machinery, New York, NY, USA, pp. 1-13 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19168 2025-12-23 physics.optics cs.SY eess.SY 50%

Optical design and characterization of a multi-depth vision simulator

多深度视觉模拟器的光学设计与表征

Parviz Zolfaghari, Ehsan Varasteh, Koray Kavakli, Arda Gulersoy, Afsun Sahin, Hakan Urey

专题命中 Agent评测 :planning(abstract)

AI总结 多深度视觉模拟器通过模块化设计实现多深度渲染与IOL表征,支持术前规划和术后视力模拟。

Comments 16 pages, 8 figures. Preprint submitted to Biomedical Optics Express journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19014 2025-12-23 cond-mat.mtrl-sci physics.app-ph physics.bio-ph physics.chem-ph physics.med-ph 50%

Enhanced sinterability and in vitro bioactivity of diopside through fluoride doping

通过氟掺杂增强方石英的烧结性和体外生物活性

E. Salahinejad, M. Jafari Baghjeghaz

专题命中 Agent评测 :agent(abstract)

AI总结 本研究通过氟掺杂改善方石英的烧结性和生物活性,发现掺杂后材料在体外能形成更多羟基磷灰石。

Journal ref Ceramics International, 43 (2017) 4680-4686

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18620 2025-12-23 cs.GT 50%

Obnoxious Facility Location Problems: Strategyproof Mechanisms Optimizing $L_p$-Aggregated Utilities and Costs

令人反感的设施选址问题:设计策略证明机制以优化L_p-聚合效用和成本

Hau Chan, Jianan Lin, Chenhao Wang

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了如何通过策略证明机制优化L_p-聚合效用和成本的令人反感设施选址问题,分析了确定性和随机性机制的近似比界限。

Comments To appear in AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18587 2025-12-23 math.ST stat.ME stat.TH 50%

Graphon-Level Bayesian Predictive Synthesis for Random Network

图核层面的贝叶斯预测合成用于随机网络

Marios Papamichalis, Regina Ruane

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出图核层面的贝叶斯预测合成方法,用于随机网络,证明其在最小最大L^2速率最优,并展示其在结构特性控制和厚尾理论方面的贡献。

Comments This paper may be reorganized during submission to match journal requirements

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05998 2025-12-23 econ.TH 50%

Propose or Vote: A Canonical Democratic Procedure

提出或投票:一种民主程序

Hans Gersbach

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种无需中央机制设计的民主程序PoV,通过提案制定与投票结合的方式实现Condorcet赢家,并解决了偶数成员数量下的唯一性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13537 2025-12-23 math.LO 50%

Models for the common knowledge logic

共同知识逻辑的模型

Yoshihito Tanaka

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了共同知识逻辑的模型,探讨了其框架和代数的定义及性质,指出CKL框架是模态可定义的,而CKL代数并非构成变种。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17925 2025-12-23 q-fin.ST nlin.AO physics.soc-ph 50%

Stylized Facts and Their Microscopic Origins: Clustering, Persistence, and Stability in a 2D Ising Framework

stylized facts 和其微观起源:在二维伊辛框架中的聚类、持续性和稳定性

Hernán Ezequiel Benítez, Claudio Oscar Dorso

专题命中 Agent评测 :agent(abstract)

AI总结 本文通过二维伊辛模型研究金融市场中的stylized facts,揭示聚团结构和动态如何解释收益率尖峰、重尾分布和零自相关等现象。

Journal ref Physica A (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10059 2025-12-23 quant-ph 50%

Cooling a Qubit using n Others

利用n个其他量子比特冷却一个量子比特

Jake Xuereb, Benjamin Stratton, Alberto Rolandi, Jinming He, Marcus Huber, Pharnam Bakhshinezhad

专题命中 Agent评测 :agent(abstract)

AI总结 通过分析机器结构对冷却能力的影响,提出基于二分图完美匹配的冷却协议优化方法,建立量子冷却的新理论框架。

Comments 11 + 31 pages, 15 figures, comments welcome!

Journal ref PRX Quantum 6, 040368 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.02590 2025-12-23 cs.DM 50%

Stable Matching: Dealing with Changes in Preferences

稳定匹配:应对偏好变化

Rohith Reddy Gangam, Tung Mai, Nitya Raju, Vijay V. Vazirani

专题命中 Agent评测 :agent(abstract)

AI总结 研究了在双侧稳定匹配设定中,针对偏好变化的鲁棒稳定匹配问题,探讨了鲁棒匹配的多项式时间求解、格结构以及多面体整性,发现临界阈值下这些属性可能失效。

Comments 37 pages and 8 figures, New XP-time Algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏