arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-02-04 至 2026-02-04 共收录 31 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 31 篇

2602.03128 2026-02-04 cs.AI 90%

Understanding Multi-Agent LLM Frameworks: A Unified Benchmark and Experimental Analysis

理解多智能体大语言模型框架:一个统一的基准测试和实验分析

Abdelghny Orogat, Ana Rostam, Essam Mansour

机构 * Concordia University(康科迪亚大学)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出MAFBench统一评估套件,系统比较多智能体LLM框架,揭示架构设计对性能的显著影响。

Comments 25 pages, 9 figures and 13 tables; introduces MAFBench unified multi-agent evaluation suite

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02995 2026-02-04 cs.AI 83%

Agent Alpha: Tree Search Unifying Generation, Exploration and Evaluation for Computer-Use Agents

Agent Alpha:通过树搜索统一生成、探索和评估计算机使用代理

Sizhe Tang, Rongqian Chen, Tian Lan

机构 * The George Washington University(乔治·华盛顿大学)

专题命中 Agent评测 :agent(title,abstract);planning(abstract);分类 cs.AI

AI总结 Agent Alpha通过步骤级MCTS统一生成、探索和评估,实现计算机使用代理的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02564 2026-02-04 cs.LG cs.MA 83%

Label Curation Using Agentic AI

使用代理AI进行标签校准

Subhodeep Ghosh, Bayan Divaaniaazar, Md Ishat-E-Rabban, Spencer Clarke, Senjuti Basu Roy

机构 * New Jersey Institute of Technology(新泽西理工学院)

专题命中 Agent评测 :agentic(title,abstract);AI agent(abstract);分类 cs.LG

AI总结 AURA通过代理AI框架实现大规模多模态数据标注,通过概率模型联合推断真实标签和标注者可靠性,提升标注准确性并评估标注者质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01709 2026-02-04 cs.CL 83%

ARTIS: Agentic Risk-Aware Test-Time Scaling via Iterative Simulation

ARTIS: 通过迭代模拟实现代理风险感知的测试时间扩展

Xingshan Zeng, Lingzhi Wang, Weiwen Liu, Liangyou Li, Yasheng Wang, Lifeng Shang, Xin Jiang, Qun Liu

机构 * Huawei Technologies Co., Ltd(华为技术有限公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shanghai Jiao Tong University(上海交通大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.CL

AI总结 ARTIS通过迭代模拟提升代理在高风险环境中的可靠性和鲁棒性,采用风险感知的模拟器改进决策效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03130 2026-02-04 cs.CV cs.CE 82%

FinMTM: A Multi-Turn Multimodal Benchmark for Financial Reasoning and Agent Evaluation

FinMTM:面向金融推理和智能体评估的多轮多模态基准

Chenxi Zhang, Ziliang Gan, Liyun Zhu, Youwei Pang, Qing Zhang, Rongjunchen Zhang

机构 * HiThink Research(HiThink研究机构) Wuhan University(武汉大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Shanghai Institute of Technology(上海理工大学)

专题命中 Agent评测 :agent(title,abstract);planning(abstract)

AI总结 FinMTM提出一个多轮多模态基准,用于评估金融推理和智能体任务,通过多样化数据和任务设计,揭示了VLMs在视觉感知、推理和复杂工作流中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02625 2026-02-04 cs.SI 82%

OpenClaw Agents on Moltbook: Risky Instruction Sharing and Norm Enforcement in an Agent-Only Social Network

OpenClaw代理在Moltbook上的应用:代理-only社交网络中风险性指令分享与规范执行

Md Motaleb Hossen Manik, Ge Wang

专题命中 Agent评测 :agent(title,abstract);agentic(abstract)

AI总结 OpenClaw代理在Moltbook上通过风险性指令分享和规范执行展现选择性社会调节行为,揭示了代理-only社交系统中规范行为的涌现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03100 2026-02-04 cs.AI 79%

Risky-Bench: Probing Agentic Safety Risks under Real-World Deployment

Risky-Bench: 探索现实部署中智能体安全风险

Jingnan Zheng, Yanzhen Luo, Jingjun Xu, Bingnan Liu, Yuxin Chen, Chenhang Cui, Gelei Deng, Chaochao Lu, Xiang Wang, An Zhang, Tat-Seng Chua

机构 * National University of Singapore(国立新加坡大学) University of Science and Technology of China(中国科学技术大学) Southern University of Science and Technology(南方科技大学) University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

AI总结 Risky-Bench通过基于现实部署的安全原则,系统评估智能体在复杂任务中的安全风险,适用于多种部署场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01355 2026-02-04 cs.AI 79%

Aggregation Queries over Unstructured Text: Benchmark and Agentic Method

无结构文本上的聚合查询:基准测试与代理方法

Haojia Zhu, Qinyuan Xu, Haoyu Li, Yuxi Liu, Hanchen Qiu, Jiaoyan Chen, Jiahui Jin

机构 * Southeast University(东南大学) Imperial College London(伦敦帝国学院) The University of Manchester(曼彻斯特大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出DFA方法,用于在无结构文本上进行完整性导向的聚合查询,通过模块化设计提升证据覆盖能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15784 2026-02-04 q-bio.NC cs.LG 79%

Emergent time-keeping mechanisms in a deep reinforcement learning agent performing an interval timing task

深度强化学习代理在区间定时任务中涌现的时间保持机制

Amrapali Pednekar, Alvaro Garrido, Pieter Simoens, Yara Khaluf

机构 * IDLab, Department of Information Technology, Ghent University - imec(IDLab信息科技系,根特大学-imec) Department of Social Sciences, Wageningen University and Research(社会科学系,瓦赫宁根大学与研究所)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 本研究通过深度强化学习代理在区间定时任务中的表现,揭示了类似生物节律的时间保持机制,并探讨了其与生物模型的类比。

Comments Accepted at 2025 Artificial Life Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06189 2026-02-04 physics.soc-ph 78%

On the Effect of Missing Transmission Chain Information in Agent-Based Models: Outcomes of Superspreading Events and Workplace Transmission

关于代理模型中缺失传播链信息的影响:超传播事件和工作场所传播的后果

Sascha Korf, Sophia Johanna Wagner, Gerta Köster, Martin J. Kühn

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文研究了代理模型中缺失传播链信息对流行病预测的影响,通过比较超传播事件和工作场所传播的不同场景,揭示简化假设对结果的影响。

Comments 54 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03468 2026-02-04 cs.AI cs.LG 73%

IntentRL: Training Proactive User-intent Agents for Open-ended Deep Research via Reinforcement Learning

IntentRL: 通过强化学习训练主动的用户意图代理以进行开放性深度研究

Haohao Luo, Zexi Li, Yuexiang Xie, Wenhao Zhang, Yaliang Li, Ying Shen

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 IntentRL通过强化学习训练主动用户意图代理,提升开放性深度研究的意图识别与任务性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02760 2026-02-04 cs.CL cs.LG 73%

From Task Solving to Robust Real-World Adaptation in LLM Agents

从任务解决到在LLM代理中的鲁棒现实适应

Pouya Pezeshkpour, Estevam Hruschka

机构 * Megagon Labs(梅加戈恩实验室)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了LLM代理在现实环境中的鲁棒适应能力,发现任务解决与实际部署鲁棒性存在显著差距,揭示了在部分可观测性和噪声环境下代理的决策挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02589 2026-02-04 cs.AI cs.LG 73%

PeerRank: Autonomous LLM Evaluation Through Web-Grounded, Bias-Controlled Peer Review

PeerRank: 通过基于网络的、受偏见控制的同行评审实现自主LLM评估

Yanki Margalit, Erni Avram, Ran Taig, Oded Margalit, Nurit Cohen-Inger

机构 * Computer Science and Information, Ben-Gurion University of the Negev(本·加里翁大学(内盖夫)计算机科学与信息学院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 PeerRank通过基于网络的、受偏见控制的同行评审实现自主LLM评估,产生稳定且具有区分性的排名,并揭示可测量的身份和呈现偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00611 2026-02-04 cs.AI 70%

Structured Self-Consistency:A Multi-Task Evaluation of LLMs on VirtualHome

结构自一致性:基于虚拟家庭的多任务评估

Jiaqi Xu, Tao Huang, Kai Zhang

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出结构自一致性方法,评估两种大型语言模型在虚拟家庭任务中的表现,发现不同模型在不同任务中各有优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03633 2026-02-04 cs.CL cs.AI cs.DB 62%

BIRDTurk: Adaptation of the BIRD Text-to-SQL Dataset to Turkish

BIRDTurk: BIRD文本到SQL数据集对土耳其语的适应

Burak Aktaş, Mehmet Can Baytekin, Süha Kağan Köse, Ömer İlbilgi, Elif Özge Yılmaz, Çağrı Toraman, Bilge Kaan Görür

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 BIRDTurk是首个将BIRD文本到SQL基准适应到土耳其语的数据集,通过受控翻译流程保持SQL逻辑结构,评估了代理推理和监督微调在土耳其语中的表现,揭示了语言差异对性能的影响。

Comments Accepted by EACL 2026 SIGTURK

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04075 2026-02-04 cs.LG cs.AI cs.CV 62%

Accurate and Efficient World Modeling with Masked Latent Transformers

基于掩码潜在变换器的精准高效世界建模

Maxime Burchi, Radu Timofte

机构 * Computer Vision Lab, CAIDAS \& IFI, University of Würzburg, Germany

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 EMERALD通过高效掩码潜在变换器实现精准高效的世界建模,首次在1000万环境步骤内超越人类专家性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03419 2026-02-04 cs.SE cs.CL 62%

SWE-World: Building Software Engineering Agents in Docker-Free Environments

SWE-World:在无Docker环境中构建软件工程代理

Shuang Sun, Huatong Song, Lisheng Huang, Jinhao Jiang, Ran Le, Zhihao Lv, Zongchao Chen, Yiwen Hu, Wenyang Luo, Wayne Xin Zhao, Yang Song, Hongteng Xu, Tao Zhang, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学耿丽学校人工智能学院) BOSS Zhipin, Beijing, China(BOSS智聘,北京,中国)

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.SE

AI总结 SWE-World提出了一种无Docker环境的框架,利用学习模型预测执行结果,提升软件工程代理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02567 2026-02-04 cs.LG cs.AI eess.IV 62%

IceBench-S2S: A Benchmark of Deep Learning for Challenging Subseasonal-to-Seasonal Daily Arctic Sea Ice Forecasting in Deep Latent Space

IceBench-S2S:一种深度学习用于挑战性亚季节至季节每日北极海冰预测的基准

Jingyi Xu, Shengnan Wang, Weidong Yang, Siwei Tu, Lei Bai, Ben Fei

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) Chinese University of Hong Kong(香港中文大学)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 IceBench-S2S通过深度学习框架提升北极海冰预测的季节尺度能力,为极地环境监测提供统一的训练和评估流程。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01995 2026-02-04 cs.AI cs.CL 62%

Thinking Like a Doctor: Conversational Diagnosis through the Exploration of Diagnostic Knowledge Graphs

像医生一样思考:通过探索诊断知识图谱进行对话诊断

Jeongmoon Won, Seungwon Kook, Yohan Jo

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出一种通过探索诊断知识图谱进行对话诊断的系统,通过两步推理生成和验证诊断假设,提高诊断准确性和效率,并通过医生评估验证其临床实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00408 2026-02-04 cs.LG cs.AI 62%

Variational Approach for Job Shop Scheduling

变分方法用于作业车间调度

Seung Heon Oh, Jiwon Baek, Ki Young Cho, Hee Chang Yoon, Jong Hun Woo

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出变分图到调度器框架,通过解耦表示学习与策略优化,提升作业车间调度问题的训练稳定性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19120 2026-02-04 cs.IR cs.AI cs.LG 62%

RobustExplain: Evaluating Robustness of LLM-Based Explanation Agents for Recommendation

RobustExplain: 评估基于LLM的推荐解释代理的鲁棒性

Guilin Zhang, Kai Zhao, Jeffrey Friedman, Xu Chu

机构 * Workday

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 RobustExplain提出首个评估框架,用于衡量LLM生成推荐解释的鲁棒性,揭示当前模型鲁棒性较低,较大模型稳定性更高。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03776 2026-02-04 q-fin.CP cs.AI 57%

DiffLOB: Diffusion Models for Counterfactual Generation in Limit Order Books

DiffLOB: 基于扩散模型的限价单簿反事实生成

Zhuohan Wang, Carmine Ventre

机构 * King’s College London(伦敦国王学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 DiffLOB提出一种基于扩散模型的可控反事实生成方法,用于模拟限价单簿在不同市场制度下的演变,提升市场分析与预测能力。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03286 2026-02-04 cs.AI cs.MA 57%

Rejecting Arguments Based on Doubt in Structured Bipolar Argumentation

基于怀疑的结构双极论证中的论点拒绝

Michael A. Müller, Srdjan Vesic, Bruno Yun

机构 * Université de Fribourg(弗里堡大学) CRIL CNRS Univ Artois(CRIL CNRS阿维尼昂大学) Univ Lyon, UCBL, CNRS, INSA Lyon, LIRIS, UMR5205(里昂大学、UCBL、CNRS、INSA里昂、LIRIS、UMR5205)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种基于怀疑的结构双极论证方法,允许智能体合理拒绝论点,并引入了新的语义框架来处理句子和论点的接受问题。

Comments Accepted to AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03146 2026-02-04 cs.AI 57%

General Agents Contain World Models, even under Partial Observability and Stochasticity

通用智能体包含世界模型,即使在部分可观测性和随机性下

Santiago Cifuentes

机构 * Dovetail Research(Dovetail研究)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本研究证明了即使在部分可观测性和随机性下,通用智能体仍需学习环境模型。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02196 2026-02-04 cs.AI 57%

TIDE: Trajectory-based Diagnostic Evaluation of Test-Time Improvement in LLM Agents

基于轨迹的测试时改进诊断评估:LLM代理中的测试时改进

Hang Yan, Xinyu Che, Fangzhi Xu, Qiushi Sun, Zichen Ding, Kanzhi Cheng, Jian Zhang, Tao Qin, Jun Liu, Qika Lin

机构 * Xi’an Jiaotong University(西安交通大学) The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 TIDE提出了一种评估框架,用于诊断LLM代理在测试时改进中的性能瓶颈,通过分析任务完成的时间动态、递归循环行为和记忆负担,优化代理与环境的交互。

Comments 29pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01590 2026-02-04 cs.CL 57%

Wiki Live Challenge: Challenging Deep Research Agents with Expert-Level Wikipedia Articles

Wiki Live Challenge: 用专家级维基百科文章挑战深度研究代理

Shaohan Wang, Benfeng Xu, Licheng Zhang, Mingxuan Du, Chiwei Zhu, Xiaorui Wang, Zhendong Mao, Yongdong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Metastone Technology(metastone技术公司)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 Wiki Live Challenge通过专家级维基百科文章挑战深度研究代理,提出Wiki Eval框架以评估其写作质量和事实准确性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22254 2026-02-04 cs.AI 57%

Co-Evolving Agents: Learning from Failures as Hard Negatives

共进化代理:从失败中学习作为困难负例

Yeonsung Jung, Trilok Padhi, Sina Shaham, Dipika Khullar, Joonhyun Jeong, Ninareh Mehrabi, Eunho Yang

机构 * Georgia State University(佐治亚州立大学) Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出共进化代理框架,通过辅助失败代理生成困难负例,提升目标代理的决策边界和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15090 2026-02-04 cs.LG cs.GT econ.TH 57%

Emergent Alignment via Competition

通过竞争实现涌现对齐

Natalie Collina, Surbhi Goel, Aaron Roth, Emily Ryu, Mirah Shi

机构 * Department of Computer and Information Sciences, University of Pennsylvania(计算机与信息科学系,宾夕法尼亚大学) Department of Computer Science, Cornell University(计算机科学系,康奈尔大学)

专题命中 Agent评测 :AI agent(abstract);分类 cs.LG

AI总结 通过竞争实现AI与人类价值观的对齐,证明在特定条件下战略竞争可产生与完全对齐模型相当的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03543 2026-02-04 cs.GT 50%

Sequential Linear Contracts on Matroids

matroid 上的顺序线性契约

Kanstantsin Pashkovich, Jacob Skitsko, Yun Xing

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了在 matroid 约束下,通过线性契约激励代理依次采取行动以最大化主人效用的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02713 2026-02-04 physics.med-ph cs.CV eess.IV 50%

Perfusion Imaging and Single Material Reconstruction in Polychromatic Photon Counting CT

灌注成像与单材料重建在多能X射线计数CT中的应用

Namhoon Kim, Ashwin Pananjady, Amir Pourmorteza, Sara Fridovich-Keil

机构 * School of Industrial and Systems Engineering(工业与系统工程学院) Georgia Institute of Technology(佐治亚理工学院) School of Electrical and Computer Engineering(电气与计算机工程学院) Department of Radiology and Imaging Sciences(放射学与影像科学系) Emory University School of Medicine(埃默里大学医学院) Winship Cancer Institute(Winship癌症研究所) Emory University(埃默里大学) Department of Biomedical Engineering(生物医学工程系)

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出VI-PRISM算法,用于低剂量灌注CT中的单材料重建,实现比传统方法更精确且更高效的对比剂浓度成像。

Comments Code is available at https://github.com/voilalab/VI-PRISM

详情

展开后加载摘要…

URL PDF HTML 收藏