arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15866 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15866 篇

2602.08121 2026-02-10 cs.AI 57%

Initial Risk Probing and Feasibility Testing of Glow: a Generative AI-Powered Dialectical Behavior Therapy Skills Coach for Substance Use Recovery and HIV Prevention

Glow的初始风险探测与可行性测试:一种生成式人工智能驱动的辩证行为疗法技能教练,用于物质使用康复和HIV预防

Liying Wang, Madison Lee, Yunzhang Jiang, Steven Chen, Kewei Sha, Yunhe Feng, Frank Wong, Lisa Hightow-Weidman, Weichao Yuwen

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 Glow是一种生成式人工智能驱动的辩证行为疗法技能教练,旨在通过风险探测和可行性测试评估其在物质使用康复和HIV预防中的安全性与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08052 2026-02-10 cs.AI cs.ET 57%

Graph-Enhanced Deep Reinforcement Learning for Multi-Objective Unrelated Parallel Machine Scheduling

图增强深度强化学习用于多目标无关平行机调度

Bulent Soykan, Sean Mondesire, Ghaith Rabadi, Grace Bochenek

机构 * Institute for Simulation and Training(模拟与培训研究所) University of Central Florida(中央佛罗里达大学) School of Modeling, Simulation, and Training(建模、模拟与培训学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出图增强深度强化学习方法,用于解决具有复杂约束的多目标无关平行机调度问题,通过PPO和GNN实现对总加权延误和总设置时间的优化。

Comments 11 pages, 2 figures, Winter Simulation Conference (WSC) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06955 2026-02-09 cs.LG 57%

Improving Credit Card Fraud Detection with an Optimized Explainable Boosting Machine

通过优化可解释提升机改善信用卡欺诈检测

Reza E. Fazel, Arash Bakhtiary, Siavash A. Bigdeli

机构 * ReDi School(ReDi学院)

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 本文通过优化可解释提升机算法,提升信用卡欺诈检测的准确性和可解释性,实验结果显示其在ROC-AUC指标上优于多种传统方法。

Comments 22 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05975 2026-02-09 cs.IR cs.CL 57%

SAGE: Benchmarking and Improving Retrieval for Deep Research Agents

SAGE:深度研究代理检索的基准测试与改进

Tiansheng Hu, Yilun Zhao, Canyu Zhang, Arman Cohan, Chen Zhao

机构 * NYU Shanghai(纽约大学上海校区) Yale University(耶鲁大学) Center for Data Science, New York University(纽约大学数据科学中心)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 SAGE基准测试评估了深度研究代理的检索能力,发现BM25在推理密集型检索中表现优于大语言模型检索器,并提出基于语料库的测试时扩展框架提升检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21798 2026-02-09 cs.CV cs.HC cs.LG 57%

An Evaluation of Hybrid Annotation Workflows on High-Ambiguity Spatiotemporal Video Footage

对高歧义时空视频 footage 的混合标注流程的评估

Juan Gutiérrez, Victor Gutiérrez, Ángel Mora, Silvia Rodriguez, José Luis Blanco

机构 * IPTC(信息处理与电信中心) Telecommunications Center, Escuela Técnica Superior de Ingenieros de Telecomunicación, Av. Complutense 30, 28040 Madrid, Spain(电信中心,电信工程师高级学院,Complutense大道30号,28040马德里,西班牙)

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 本文评估了混合标注流程在高歧义时空视频中的有效性,通过实验表明其能显著减少标注时间并提供更严谨的AI辅助工作流程评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19275 2026-02-09 cs.SE 57%

Mut4All: Fuzzing Compilers via LLM-Synthesized Mutators Learned from Bug Reports

Mut4All:通过从错误报告中学习的LLM合成变异器模糊编译器

Bo Wang, Pengyang Wang, Chong Chen, Ming Deng, Jieke Shi, Qi Sun, Chengran Yang, Youfang Lin, Zhou Yang, Junjie Chen, Jun Sun, David Lo

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 Mut4All通过LLM合成变异器自动发现编译器错误,实现高效且跨语言的模糊测试

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06053 2026-02-09 cs.CL 57%

PersonaPlex: Voice and Role Control for Full Duplex Conversational Speech Models

PersonaPlex:面向全双工对话语音模型的语音与角色控制

Rajarshi Roy, Jonathan Raiman, Sang-gil Lee, Teodor-Dumitru Ene, Robert Kirby, Sungwon Kim, Jaehyeon Kim, Bryan Catanzaro

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 PersonaPlex通过融合角色条件和语音克隆技术,实现全双工对话语音模型的语音与角色控制,提升角色一致性、说话人相似性和对话自然度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05920 2026-02-06 cs.AI cs.ET 57%

Quantum Reinforcement Learning with Transformers for the Capacitated Vehicle Routing Problem

基于变压器的量子强化学习在有容量限制的车辆路径问题中的应用

Eva Andrés

机构 * Department of Computer Science and Artificial Intelligence(计算机科学与人工智能系) University of Granada(格拉纳达大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出利用量子强化学习与变压器架构解决有容量限制的车辆路径问题,通过混合模型实现更高效、稳健的路由策略。

Comments 22 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05690 2026-02-06 cs.LG cs.IT math.IT 57%

Almost Asymptotically Optimal Active Clustering Through Pairwise Observations

通过成对观测实现近似最优的主动聚类

Rachel S. Y. Teo, P. N. Karthik, Ramya Korlakai Vinayak, Vincent Y. F. Tan

机构 * National University of Singapore(国立新加坡大学) Indian Institute of Technology Hyderabad(印度海得拉巴理工学院) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 通过成对观测实现近似最优的主动聚类,利用测度变化技术建立查询次数下界,并设计渐近最优算法。

Comments 31 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05249 2026-02-06 cs.AI 57%

Automatic Cognitive Task Generation for In-Situ Evaluation of Embodied Agents

为在场评估具身智能体而自动产生认知任务

Xinyi He, Ying Yang, Chuanjian Fu, Sihan Guo, Songchun Zhu, Lifeng Fan, Zhenliang Zhang, Yujia Peng

机构 * Peking University(北京大学) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) BIGAI

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出TEA系统,通过动态在场任务生成方法评估具身智能体在未见环境中的能力,揭示模型在基本感知和3D交互方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04449 2026-02-05 cs.SE 57%

What's in a Benchmark? The Case of SWE-Bench in Automated Program Repair

基准中有什么?SWE-Bench在自动程序修复中的案例

Matias Martinez, Xavier Franch

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 本文研究了SWE-Bench排行榜上的提交来源、LLM使用情况及行业参与度,揭示了专有LLM在自动程序修复中的主导地位。

Comments Accepted in 2026 IEEE/ACM 48th International Conference on Software Engineering (ICSE-SEIP'26). https://doi.org/10.1145/3786583.3786904

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03954 2026-02-05 stat.ML cs.LG stat.CO stat.ME 57%

Learning Multi-type heterogeneous interacting particle systems

学习多类型异质相互作用粒子系统

Quanjun Lang, Xiong Wang, Fei Lu, Mauro Maggioni

机构 * Department of Mathematics, Duke University(杜克大学数学系) School of Mathematics, Sun Yat-sen University(中山大学数学学院) Department of Mathematics, Johns Hopkins University(约翰霍普金斯大学数学系) Department of Applied Mathematics and Statistics, Johns Hopkins University(约翰霍普金斯大学应用数学与统计学系)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种三阶段方法,用于从多轨迹数据中联合推断异质相互作用粒子系统的网络拓扑、多类型交互核和潜在类型分配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03776 2026-02-04 q-fin.CP cs.AI 57%

DiffLOB: Diffusion Models for Counterfactual Generation in Limit Order Books

DiffLOB: 基于扩散模型的限价单簿反事实生成

Zhuohan Wang, Carmine Ventre

机构 * King’s College London(伦敦国王学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 DiffLOB提出一种基于扩散模型的可控反事实生成方法,用于模拟限价单簿在不同市场制度下的演变,提升市场分析与预测能力。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03286 2026-02-04 cs.AI cs.MA 57%

Rejecting Arguments Based on Doubt in Structured Bipolar Argumentation

基于怀疑的结构双极论证中的论点拒绝

Michael A. Müller, Srdjan Vesic, Bruno Yun

机构 * Université de Fribourg(弗里堡大学) CRIL CNRS Univ Artois(CRIL CNRS阿维尼昂大学) Univ Lyon, UCBL, CNRS, INSA Lyon, LIRIS, UMR5205(里昂大学、UCBL、CNRS、INSA里昂、LIRIS、UMR5205)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种基于怀疑的结构双极论证方法,允许智能体合理拒绝论点,并引入了新的语义框架来处理句子和论点的接受问题。

Comments Accepted to AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03146 2026-02-04 cs.AI 57%

General Agents Contain World Models, even under Partial Observability and Stochasticity

通用智能体包含世界模型,即使在部分可观测性和随机性下

Santiago Cifuentes

机构 * Dovetail Research(Dovetail研究)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本研究证明了即使在部分可观测性和随机性下,通用智能体仍需学习环境模型。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02196 2026-02-04 cs.AI 57%

TIDE: Trajectory-based Diagnostic Evaluation of Test-Time Improvement in LLM Agents

基于轨迹的测试时改进诊断评估:LLM代理中的测试时改进

Hang Yan, Xinyu Che, Fangzhi Xu, Qiushi Sun, Zichen Ding, Kanzhi Cheng, Jian Zhang, Tao Qin, Jun Liu, Qika Lin

机构 * Xi’an Jiaotong University(西安交通大学) The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 TIDE提出了一种评估框架,用于诊断LLM代理在测试时改进中的性能瓶颈,通过分析任务完成的时间动态、递归循环行为和记忆负担,优化代理与环境的交互。

Comments 29pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01590 2026-02-04 cs.CL 57%

Wiki Live Challenge: Challenging Deep Research Agents with Expert-Level Wikipedia Articles

Wiki Live Challenge: 用专家级维基百科文章挑战深度研究代理

Shaohan Wang, Benfeng Xu, Licheng Zhang, Mingxuan Du, Chiwei Zhu, Xiaorui Wang, Zhendong Mao, Yongdong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Metastone Technology(metastone技术公司)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 Wiki Live Challenge通过专家级维基百科文章挑战深度研究代理,提出Wiki Eval框架以评估其写作质量和事实准确性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22254 2026-02-04 cs.AI 57%

Co-Evolving Agents: Learning from Failures as Hard Negatives

共进化代理:从失败中学习作为困难负例

Yeonsung Jung, Trilok Padhi, Sina Shaham, Dipika Khullar, Joonhyun Jeong, Ninareh Mehrabi, Eunho Yang

机构 * Georgia State University(佐治亚州立大学) Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出共进化代理框架,通过辅助失败代理生成困难负例,提升目标代理的决策边界和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15090 2026-02-04 cs.LG cs.GT econ.TH 57%

Emergent Alignment via Competition

通过竞争实现涌现对齐

Natalie Collina, Surbhi Goel, Aaron Roth, Emily Ryu, Mirah Shi

机构 * Department of Computer and Information Sciences, University of Pennsylvania(计算机与信息科学系,宾夕法尼亚大学) Department of Computer Science, Cornell University(计算机科学系,康奈尔大学)

专题命中 Agent评测 :AI agent(abstract);分类 cs.LG

AI总结 通过竞争实现AI与人类价值观的对齐,证明在特定条件下战略竞争可产生与完全对齐模型相当的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01917 2026-02-03 cs.CL 57%

GuideWeb: A Benchmark for Automatic In-App Guide Generation on Real-World Web UIs

GuideWeb: 一个用于真实世界Web UI上的自动应用内引导生成的基准测试

Chengguang Gan, Yoshihiro Tsujii, Yunhao Liang, Tatsunori Mori, Shiwen Ni, Hiroki Itoh

机构 * Techtouch Inc.(Techtouch公司) University of Chinese Academy of Sciences(中国科学院大学) Shenzhen Institute of Advanced Technology Chinese Academy of Sciences(中国科学院深圳先进技术研究所) Yokohama National University(Yokohama国立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 GuideWeb提出一个用于真实世界Web UI的自动应用内引导生成基准测试,通过选择引导目标元素和生成用户意图文本,实验显示其在引导目标预测和生成质量上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19110 2026-02-03 cs.CL 57%

APE-Bench: Evaluating Automated Proof Engineering for Formal Math Libraries

APE-Bench: 评估形式数学库中的自动化证明工程

Huajian Xin, Luming Li, Xiaoran Jin, Jacques Fleuriot, Wenda Li

机构 * University of Edinburgh(爱丁堡大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 APE-Bench提出了一种系统性评估仓库级证明工程的框架,通过双验证机制评估语法编译和语义要求满足,并提供开源工具进行标准化评估和公平比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01270 2026-02-03 cs.LG 57%

Mixture-of-World Models: Scaling Multi-Task Reinforcement Learning with Modular Latent Dynamics

混合世界模型:通过模块化潜在动态扩展多任务强化学习

Boxuan Zhang, Weipu Zhang, Zhaohan Feng, Wei Xiao, Jian Sun, Jie Chen, Gang Wang

机构 * School of Automation, Beijing Institute of Technology(自动化学院,北京理工大学) Jiangxing Intelligence Inc.(江行智能有限公司)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 混合世界模型通过模块化架构和任务聚类策略,在多任务强化学习中实现了高效的参数利用和样本效率,展示了在Atari和Meta-World基准上的卓越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01163 2026-02-03 cs.CV cs.AI 57%

Semantically Aware UAV Landing Site Assessment from Remote Sensing Imagery via Multimodal Large Language Models

基于多模态大语言模型的语义感知无人机着陆地评估:从遥感图像

Chunliang Hua, Zeyuan Yang, Lei Zhang, Jiayang Sun, Fengwen Chen, Chunlan Zeng, Xiao Hu

机构 * School of Information Science and Engineering, Southeast University(信息科学与工程学院,东南大学) LASER, International Digital Economy Academy(LASER,国际数字经济学院) Department of Electronic Engineering, East China Normal University(电子工程系,华东师范大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出基于多模态大语言模型的无人机着陆地评估方法,通过语义感知与多模态融合提升风险识别精度与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00950 2026-02-03 cs.AI 57%

MindGuard: Guardrail Classifiers for Multi-Turn Mental Health Support

MindGuard: 多轮心理健康支持中的防护分类器

António Farinhas, Nuno M. Guerreiro, José Pombal, Pedro Henrique Martins, Laura Melton, Alex Conway, Cara Dochat, Maya D'Eon, Ricardo Rei

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 MindGuard通过临床验证的危险分类法,提升多轮心理健康对话中的安全性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00133 2026-02-03 q-fin.ST cs.AI 57%

PredictionMarketBench: A SWE-bench-Style Framework for Backtesting Trading Agents on Prediction Markets

PredictionMarketBench: 一个用于预测市场回测交易代理的SWE-bench风格框架

Avi Arora, Ritesh Malpani

机构 * Oddpool

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 PredictionMarketBench是一个用于预测市场回测的框架,通过标准化数据处理和模拟器评估算法和大语言模型交易代理,展示费用意识策略在波动市场中的竞争力。

Comments 10 pages, 5 figures. Code available at https://github.com/oddpool/PredictionMarketBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00641 2026-02-03 cs.AI 57%

AgentAuditor: Human-Level Safety and Security Evaluation for LLM Agents

AgentAuditor: 为LLM代理提供人类水平的安全性和安全性评估

Hanjun Luo, Shenyu Dai, Chiming Ni, Xinfeng Li, Guibin Zhang, Kun Wang, Tongliang Liu, Hanan Salam

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 AgentAuditor通过构建经验记忆和多阶段检索生成过程,提升LLM在代理安全性和安全性评估中的性能,达到人类水平的准确性。

Comments This paper is accepted by 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22746 2026-02-02 cs.ET cs.AI 57%

UrbanMoE: A Sparse Multi-Modal Mixture-of-Experts Framework for Multi-Task Urban Region Profiling

UrbanMoE: 一种用于多任务城市区域刻画的稀疏多模态专家混合框架

Pingping Liu, Jiamiao Liu, Zijian Zhang, Hao Miao, Qi Jiang, Qingliang Li, Qiuzhan Zhou, Irwin King

机构 * Jilin University(吉林大学) The Hong Kong Polytechnic University(香港理工大学) Changchun Normal University(长春师范大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 UrbanMoE提出了一种稀疏多模态专家混合框架,用于解决多任务城市区域刻画问题,通过多模态特征动态路由实现高效预测,提升了城市分析的性能和可重复性。

Comments 12 pages, 6 figures, 5tables, Proceedings of the ACM Web Conference 2026 (WWW '26), April 13--17, 2026, Dubai, United Arab Emirates

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00205 2026-02-02 cs.SE cs.CR 57%

Towards a Benchmark for Dependency Decision-Making

面向依赖决策制定的基准测试

Tanmay Singla, Berk Çakar, Paschal C. Amusuo, James C. Davis

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 本文提出DepDec-Bench基准测试,用于评估人工智能编码代理在依赖决策中的安全性和效率,通过分析实际依赖变更数据,揭示代理在版本选择、依赖重用及安全影响方面的表现。

Comments Under review at JAWS 2026. 5 pages, 1 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02883 2026-02-02 cs.LG 57%

A Continual Offline Reinforcement Learning Benchmark for Navigation Tasks

连续离线强化学习导航任务基准测试

Anthony Kobanda, Odalric-Ambrym Maillard, Rémy Portelas

机构 * Inria, Univ. Lille, CNRS, Centrale Lille, UMR 9198-CRIStAL, F-59000 Lille, France(法国里尔大学、法国国家科学研究中心、中央里尔学院、UMR 9198-CRIStAL)

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.LG

AI总结 本文提出一个连续离线强化学习导航任务基准测试,通过视频游戏场景评估算法性能,解决灾难性遗忘、任务适应和内存效率等关键挑战。

Comments arXiv admin note: text overlap with arXiv:2412.14865

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22633 2026-02-02 cs.NI cs.AI 57%

MCP-Diag: A Deterministic, Protocol-Driven Architecture for AI-Native Network Diagnostics

MCP-Diag:一种确定性的、基于协议的架构用于AI原生网络诊断

Devansh Lodha, Mohit Panchal, Sameer G. Kulkarni

机构 * Indian Institute of Technology Gandhinagar(印度理工学院加尔各答分校)

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.AI

AI总结 MCP-Diag通过确定性翻译层和强制性 elicitation循环,实现高精度的AI原生网络诊断,提升实体提取准确性和上下文token使用效率。

Comments Accepted at COMSNETS 2026 Graduate Forum. Best Paper Award (Runner Up). 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏