arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15756 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15756 篇

2506.03333 2026-01-14 cs.LG cs.AI 62%

A Differential Perspective on Distributional Reinforcement Learning

分布强化学习的微分视角

Juan Sebastian Rojas, Chi-Guhn Lee

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文从微分视角扩展分布强化学习至平均奖励设置,提出首个能有效学习长期每步奖励分布和微分回报分布的算法,并展示其在性能和信息捕捉方面的优势。

Comments In AAAI Conference on Artificial Intelligence 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06636 2026-01-13 cs.CL cs.AI 62%

MedEinst: Benchmarking the Einstellung Effect in Medical LLMs through Counterfactual Differential Diagnosis

MedEinst:通过反事实差异诊断基准测试医疗大语言模型中的Einstellung效应

Wenting Chen, Zhongrui Zhu, Guolin Huang, Wenxuan Wang

机构 * Stanford University(斯坦福大学) Xi’an Jiaotong University(西安交通大学) Shenzhen University(深圳大学) Renmin University of China(中国人民大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 MedEinst通过反事实差异诊断基准测试,揭示医疗大语言模型中的Einstellung效应,并提出ECR-Agent提升循证医学标准。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05657 2026-01-12 cs.CL cs.AI 62%

Stephanie2: Thinking, Waiting, and Making Decisions Like Humans in Step-by-Step AI Social Chat

Stephanie2:在步骤式AI社交聊天中像人类一样思考、等待和做决定

Hao Yang, Hongyuan Lu, Dingkang Yang, Wenliang Yang, Peng Sun, Xiaochuan Zhang, Jun Xiao, Kefan He, Wai Lam, Yang Liu, Xinhua Zeng

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 Stephanie2通过主动等待和信息节奏适应,实现了更自然的步骤式AI社交聊天,实验显示其在自然度和参与度等指标上优于前代系统。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03389 2026-01-08 cs.AI cs.LG 62%

Exploration Through Introspection: A Self-Aware Reward Model

反思中的探索:一种自知奖励模型

Michael Petrowski, Milica Gašić

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于反思的奖励模型,通过模拟疼痛信号探索自我意识对强化学习代理学习能力的影响,并展示了其在复杂行为复制中的优势。

Comments Accepted at AAAI-26 ToM4AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09583 2026-01-07 cs.CL cs.CY cs.HC cs.LG cs.SI 62%

Personality-Enhanced Social Recommendations in SAMI: Exploring the Role of Personality Detection in Matchmaking

在SAMI中融入人格因素的社会推荐:探索人格检测在匹配中的作用

Brittany Harbison, Samuel Taubman, Travis Taylor, Ashok. K. Goel

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 本文提出利用GPT零样本能力推断大五人格特质,整合至SAMI社交推荐系统,探索人格检测对社交匹配的影响。

Comments Preprint. Appears in INTED 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06539 2026-01-07 cs.LG cs.AI 62%

Learning Optimal Defender Strategies for CAGE-2 using a POMDP Model

基于POMDP模型学习CAGE-2的最优防御策略

Duc Huy Le, Rolf Stadler

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出BF-PPO方法,基于POMDP模型高效学习CAGE-2的最优防御策略,优于现有最高排名方法CARDIFF。

Comments The paper is accepted for the 21st International Conference on Network and Service Management (CNSM-2025) and the official version is published in the conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00268 2026-01-05 cs.CL cs.AI 62%

Beyond Perfect APIs: A Comprehensive Evaluation of LLM Agents Under Real-World API Complexity

超越完美API:对LLM代理在现实API复杂性下的全面评估

Doyoung Kim, Zhiwei Ren, Jie Hao, Zhongkai Sun, Lichao Wang, Xiyao Ma, Zack Ye, Xu Han, Jun Yin, Heng Ji, Wei Shen, Xing Fan, Benjamin Yao, Chenlei Guo

机构 * Amazon(亚马逊公司) KAIST(韩国科学技术院) University of Pittsburgh(匹兹堡大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出WildAGTEval基准测试,用于评估LLM代理在现实API复杂性下的功能调用能力,发现无关信息复杂性显著降低强LLM性能并影响用户满意度。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00007 2026-01-05 cs.LG cs.AI 62%

Yahtzee: Reinforcement Learning Techniques for Stochastic Combinatorial Games

Yahtzee:用于随机组合游戏的强化学习技术

Nicholas A. Pape

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出使用强化学习技术解决随机组合游戏Yahtzee的多人策略问题,通过A2C方法在有限预算下达到接近最优性能,但其他方法在超参数敏感性和长期信用分配方面存在挑战。

Comments 20 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24848 2026-01-01 cs.CL cs.AI 62%

PrivacyBench: A Conversational Benchmark for Evaluating Privacy in Personalized AI

PrivacyBench: 一个用于评估个性化AI隐私的对话基准

Srija Mukhopadhyay, Sathwik Reddy, Shruthi Muthukumar, Jisun An, Ponnurangam Kumaraguru

机构 * International Institute of Information Technology Hyderabad(国际信息科技研究所(海得拉巴)) Indiana University(印第安纳大学)

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI、cs.CL

AI总结 PrivacyBench通过多轮对话评估揭示RAG助手在隐私保护上的缺陷,指出需结构性隐私保障措施以确保伦理网络环境。

Comments 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23762 2026-01-01 cs.LG cs.AI cs.NI 62%

Drift-Based Dataset Stability Benchmark

基于漂移的数据集稳定性基准

Dominik Soukup, Richard Plný, Daniel Vašata, Tomáš Čejka

机构 * Czech Technical University in Prague(捷克技术大学布拉格分校) CESNET

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于概念漂移检测的方法,用于评估数据集稳定性并提供基准工作流程,以比较不同数据集的稳定性及优化影响。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23739 2026-01-01 cs.CL cs.AI cs.CV cs.RO 62%

Break Out the Silverware -- Semantic Understanding of Stored Household Items

拿出银器——对存储家居物品的语义理解

Michaela Levi-Richter, Reuth Mirsky, Oren Glickman

机构 * Bar Ilan University, Computer Science Department(巴伊兰大学计算机科学系) Tufts University, Department of Computer Science(塔夫茨大学计算机科学系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究提出NOAM模型,通过结合结构化场景理解和大语言模型推理,实现对家庭物品存储位置的语义理解,显著提升预测准确率并接近人类水平。

Comments Poster presented at the Israeli Seminar on Computational Linguistics 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05407 2025-12-30 cs.LG cs.AI stat.ML 62%

Dictionary Learning: The Complexity of Learning Sparse Superposed Features with Feedback

字典学习:通过反馈学习稀疏叠加特征的复杂性

Akash Kumar

机构 * Department of Computer Science \& Engineering, University of California, San Diego, USA

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 通过反馈机制,研究在稀疏设置下学习字典特征的复杂性,并验证了理论结果在特征恢复和字典提取中的有效性。

Comments ICML'25, 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22100 2025-12-29 cs.CL cs.AI 62%

Introducing TrGLUE and SentiTurca: A Comprehensive Benchmark for Turkish General Language Understanding and Sentiment Analysis

引入TrGLUE和SentiTurca:土耳其通用语言理解与情感分析的综合基准

Duygu Altinok

机构 * Independent Researcher(独立研究者)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 本文提出TrGLUE和SentiTurca两个土耳其语综合基准,用于评估自然语言理解和情感分析能力,通过半自动化流程构建高质量数据集,支持研究人员进行模型微调和评估。

Comments under review by Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20292 2025-12-24 cs.CL cs.AI cs.MM 62%

SlideTailor: Personalized Presentation Slide Generation for Scientific Papers

SlideTailor: 科学论文个性化演示文稿生成

Wenzheng Zeng, Mingyu Ouyang, Langyuan Cui, Hwee Tou Ng

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 SlideTailor通过用户指定的偏好生成个性化科学论文演示文稿,结合人类行为启发的代理框架和语音链机制,提升生成质量与应用效果。

Comments AAAI 2026 (with appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19696 2025-12-24 cs.NI cs.AI cs.LG 62%

QoS-Aware Dynamic CU Selection in O-RAN with Graph-Based Reinforcement Learning

基于图的强化学习的O-RAN中服务质量感知的动态CU选择

Sebastian Racedo, Brigitte Jaumard, Oscar Delgado, Meysam Masoudi

机构 * Concordia University(康科迪亚大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于图的强化学习方法,实现O-RAN中动态CU选择以降低能耗并满足服务质量约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19247 2025-12-23 cs.CL cs.AI 62%

Auto-Prompting with Retrieval Guidance for Frame Detection in Logistics

基于检索引导的自动提示法用于物流帧检测

Do Minh Duc, Quan Xuan Truong, Nguyen Tat Dat, Nguyen Van Vinh

机构 * Faculty of Information Technology, VNU University of Engineering and Technology(信息技术学院,越南工程大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出基于检索引导的自动提示法,通过优化提示提升物流文本帧检测的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17259 2025-12-22 cs.MA cs.AI cs.LG 62%

Verifiability-First Agents: Provable Observability and Lightweight Audit Agents for Controlling Autonomous LLM Systems

可验证性优先代理:可证明的可观测性和轻量级审计代理用于控制自主大语言模型系统

Abhivansh Gupta

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种以可验证性为核心的代理架构,通过加密和符号方法实现运行时认证,嵌入轻量级审计代理并采用挑战-响应协议,以提高自主大语言模型系统的可控性和可审计性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16553 2025-12-19 cs.AI cs.CL 62%

Needle in the Web: A Benchmark for Retrieving Targeted Web Pages in the Wild

网络中的针:评估在真实世界中检索和推理网页的基准测试

Yumeng Wang, Tianyu Fan, Lingrui Xu, Chao Huang

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 Needle in the Web 是一个评估现代搜索代理和LLM在模糊探索性查询中检索和推理真实网页能力的基准测试,揭示了当前搜索系统在处理模糊性和复杂性时的挑战。

Comments Data and code are available at https://github.com/Tango-Whiskyman/Needle_in_the_Web

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15784 2025-12-19 cs.AI cs.LG 62%

Beyond Training: Enabling Self-Evolution of Agents with MOBIMEM

超越训练:通过MOBIMEM实现智能体的自我进化

Zibin Liu, Cheng Zhang, Xi Zhao, Yunfei Feng, Bingyu Bai, Dahu Feng, Erhu Feng, Yubin Xia, Haibo Chen

机构 * Institute of Parallel and Distributed Systems, Shanghai Jiao Tong University(并行与分布式系统研究所,上海交通大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 MOBIMEM通过引入内存原语和操作系统启发的服务,实现了无需模型重训练的智能体自我进化,显著提升了任务成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14865 2025-12-18 cs.SD cs.CL cs.LG 62%

Audio MultiChallenge: A Multi-Turn Evaluation of Spoken Dialogue Systems on Natural Human Interaction

音频多挑战:对语音对话系统在自然人类交互中的多轮评估

Advait Gosai, Tyler Vuong, Utkarsh Tyagi, Steven Li, Wenjia You, Miheer Bavare, Arda Uçar, Zhongwang Fang, Brian Jang, Bing Liu, Yunzhong He

专题命中 Agent评测 :agentic(abstract);分类 cs.CL、cs.LG

AI总结 Audio MultiChallenge通过多轮交互评估语音对话系统在自然对话中的表现,揭示模型在多轮对话、语音修复和长上下文处理上的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13297 2025-12-16 cs.AI cs.LG 62%

MedInsightBench: Evaluating Medical Analytics Agents Through Multi-Step Insight Discovery in Multimodal Medical Data

MedInsightBench: 通过多步骤洞察发现评估医疗分析代理在多模态医疗数据中的能力

Zhenghao Zhu, Chuxue Cao, Sirui Han, Yuanfeng Song, Xing Chen, Caleb Chen Cao, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ByteDance(字节跳动)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 MedInsightBench通过多步骤洞察发现评估医疗分析代理在多模态医疗数据中的能力,提出MedInsightAgent框架提升医疗数据洞察发现性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12856 2025-12-16 cs.AI cs.LG 62%

Forgetful but Faithful: A Cognitive Memory Architecture and Benchmark for Privacy-Aware Generative Agents

忘却却忠实:一种认知记忆架构与隐私意识生成代理的基准测试

Saad Alqithami

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种认知记忆架构和隐私意识生成代理的基准测试,通过平衡性能、隐私和计算效率,提升生成代理在资源受限环境中的应用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05860 2025-12-15 cs.SE cs.AI 62%

Benchmarking AI Models in Software Engineering: A Review, Search Tool, and Unified Approach for Elevating Benchmark Quality

在软件工程中评估AI模型:一项综述、搜索工具和统一方法以提高基准质量

Roham Koohestani, Philippe de Bekker, Begüm Koç, Maliheh Izadi

机构 * EEMCS faculty, Delft University of Technology(代尔夫特理工大学EEMCS学院)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文提出BenchScout和BenchFrame,通过统一框架提升软件工程AI模型的基准质量,改进现有基准并验证其有效性。

Comments Accepted for publication in IEEE Transactions on Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10985 2025-12-15 q-bio.NC cs.AI cs.LG 62%

Marti-5: A Mathematical Model of "Self in the World" as a First Step Toward Self-Awareness

Marti-5:作为自我意识第一步的‘自我在世界’的数学模型

Igor Pivovarov, Sergey Shumsky

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 Marti-5模型通过区分自我与环境,提出自我意识的必要条件,用于预测和决策的强化学习代理在虚拟环境中成功学习游戏。

Comments 21 pages, 2 figures, 2 videos, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08952 2025-12-11 cs.LG cs.AI cs.HC cs.RO 62%

Learning When to Ask: Simulation-Trained Humanoids for Mental-Health Diagnosis

学习何时提问:为心理健康诊断训练的仿真 humanoid

Filippo Cenacchi, Deborah Richards, Longbing Cao

机构 * Macquarie University(麦考瑞大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于仿真的方法,通过训练人形机器人以更有效地进行心理健康诊断,利用反事实回放和安全学习循环提升对话节奏和关系建立。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07904 2025-12-10 cs.LG cs.AI 62%

Test-driven Reinforcement Learning in Continuous Control

连续控制中的测试驱动强化学习

Zhao Yu, Xiuping Wu, Liangjun Ke

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出测试驱动强化学习框架,通过多测试函数替代传统奖励函数,简化任务定义并提升多目标优化能力。

Comments AAAI 2026 oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07079 2025-12-09 cs.LG cs.AI 62%

Procrustean Bed for AI-Driven Retrosynthesis: A Unified Framework for Reproducible Evaluation

AI驱动的逆合成回溯的普罗克鲁斯床:可重复评估的统一框架

Anton Morgunov, Victor S. Batista

机构 * Yale University(耶鲁大学)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RetroCast框架,通过标准化评估基础设施,揭示了基于搜索和序列的方法在可解性与路线质量上的差异,并释放了标准化数据库以促进可重复发展。

Comments 11 pages + 7 pages of SI. RetroCast is available on GitHub, see https://github.com/ischemist/project-procrustes. SynthArena is publicly available, see https://syntharena.ischemist.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05734 2025-12-08 cs.AI cs.LG 62%

KANFormer for Predicting Fill Probabilities via Survival Analysis in Limit Order Books

KANFormer通过生存分析在限价订单簿中预测成交概率

Jinfeng Zhong, Emmanuel Bacry, Agathe Guilloux, Jean-François Muzy

机构 * LIASD – Université Paris 8, 93200 Saint-Denis(巴黎第八大学LIASD) Ceremade, CNRS-UMR 7534, Université Paris-Dauphine PSL(巴黎第十一大学PSL Ceremade) Inria, Université Paris Cité, Inserm, HeKA (UMR 1346)(Inria巴黎城市大学、法国国家医学研究院、HeKA(UMR 1346)) Laboratoire ``Sciences Pour l'Environnement'' UMR 6134 CNRS - Université de Corse - Campus Grimaldi(环境科学实验室(UMR 6134 CNRS)- 科尔索大学-格拉马迪校区)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 KANFormer通过结合市场信号与神经网络架构,实现对限价订单簿成交概率的准确预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11433 2025-12-08 cs.RO cs.AI cs.LG cs.SY eess.SY 62%

Adaptive Torque Control of Exoskeletons under Spasticity Conditions via Reinforcement Learning

通过强化学习实现脊髓病变条件下外骨骼的自适应扭矩控制

Andrés Chavarrías, David Rodriguez-Cianca, Pablo Lanillos

机构 * Neuro AI and Robotics Group(神经人工智能与机器人组) Cajal International Neuroscience Center(卡贾尔国际神经科学中心) Spanish National Research Council(西班牙国家研究理事会) Rey Juan Carlos University (URJC)(雷奥恩卡洛斯大学(URJC))

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于深度强化学习的膝外骨骼自适应扭矩控制器,通过数字双胞胎训练,有效降低痉挛状态下人体关节扭矩和交互力。

Comments Accepted for publication in IEEE 19th International Conference on Rehabilitation Robotics (ICORR2025)

Journal ref International Conference On Rehabilitation Robotics : [Proceedings]. 705-711 - 2025-01-01

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04597 2025-12-05 cs.CV cs.AI cs.LG cs.RO 62%

When Robots Should Say "I Don't Know": Benchmarking Abstention in Embodied Question Answering

机器人何时应说'我不知道':身体化问答中退避的基准测试

Tao Wu, Chuhao Zhou, Guangyu Zhao, Haozhi Cao, Yewen Pu, Jianfei Yang

机构 * Nanyang Technological University(南洋理工大学) Peking University(北京大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了身体化问答中退避机制的重要性,通过构建AbstainEQA数据集,发现人类在退避任务中表现优异,而模型退避能力有限。

详情

展开后加载摘要…

URL PDF HTML 收藏