arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-02-02 至 2026-02-02 共收录 107 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 21 篇

2601.22964 2026-02-02 cs.AI 79%

EvoClinician: A Self-Evolving Agent for Multi-Turn Medical Diagnosis via Test-Time Evolutionary Learning

EvoClinician: 一种通过测试时进化学习进行多轮医学诊断的自进化代理

Yufei He, Juncheng Liu, Zhiyuan Hu, Yulin Chen, Yue Liu, Yuan Sui, Yibo Li, Nuo Chen, Jun Hu, Bryan Hooi, Xinxing Xu, Jiang Bian

机构 * Microsoft Research(微软研究院) National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 EvoClinician通过测试时进化学习实现多轮医学诊断,采用'诊断-评分-进化'循环提升诊断效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22290 2026-02-02 cs.AI 79%

The Six Sigma Agent: Achieving Enterprise-Grade Reliability in LLM Systems Through Consensus-Driven Decomposed Execution

六西格玛代理:通过共识驱动的分解执行实现企业级可靠性

Khush Patel, Siva Surendira, Jithin George, Shreyas Kapale

机构 * Lyzr Research(Lyzr研究)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 六西格玛代理通过共识驱动的分解执行实现企业级可靠性,显著提升AI系统可靠性并降低成本。

Comments 25 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16993 2026-02-02 cs.DL cs.AI 79%

BibAgent: An Agentic Framework for Traceable Miscitation Detection in Scientific Literature

BibAgent: 一种用于科学文献中可追溯的误引检测代理框架

Peiran Li, Fangzhou Lin, Shuo Xing, Xiang Zheng, Xi Hong, Siyuan Yang, Jiashuo Sun, Zhengzhong Tu, Chaoqun Ni

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Worcester Polytechnic Institute(沃斯特理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 BibAgent是一种用于科学文献中可追溯误引检测的代理框架,通过整合检索、推理和自适应证据聚合,实现高效且透明的引文验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10197 2026-02-02 cs.AI 79%

Don't Just Fine-tune the Agent, Tune the Environment

不要只微调智能体,而是微调环境

Siyuan Lu, Zechuan Wang, Hongxuan Zhang, Qintong Wu, Leilei Gan, Chenyi Zhuang, Jinjie Gu, Tao Lin

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Nanjing University(南京大学)

专题命中 Agent评测 :agent(title);tool-use(abstract);分类 cs.AI

AI总结 本文提出环境微调方法,通过结构化课程和环境增强,使智能体无需专家轨迹即可高效学习复杂行为,实现更稳健的泛化能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21903 2026-02-02 cs.SE cs.AI 73%

TOM-SWE: User Mental Modeling For Software Engineering Agents

TOM-SWE:软件工程代理的用户心理建模

Xuhui Zhou, Valerie Chen, Zora Zhiruo Wang, Graham Neubig, Maarten Sap, Xingyao Wang

机构 * Language Technology Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.SE

AI总结 TOM-SWE通过双代理架构实现用户心理建模,提升软件工程代理的任务成功率和用户满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20730 2026-02-02 cs.CL 70%

AgentLongBench: A Controllable Long Benchmark For Long-Contexts Agents via Environment Rollouts

AgentLongBench: 通过环境回放构建可控的长上下文代理基准

Shicheng Fang, Yuxin Wang, Xiaoran Liu, Jiahao Lu, Chuanyuan Tan, Xinchi Chen, Yining Zheng, Xuanjing Huang, Xipeng Qiu

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.CL

AI总结 AgentLongBench通过模拟环境回放评估代理在长上下文任务中的表现,揭示代理在动态信息综合方面的不足。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.09807 2026-02-02 cs.RO cs.AI cs.GT cs.MA 70%

I Know You Can't See Me: Dynamic Occlusion-Aware Safety Validation of Strategic Planners for Autonomous Vehicles Using Hypergames

我无法看到你:基于超游戏的动态遮挡感知的自动驾驶战略规划器安全验证

Maximilian Kahn, Atrisha Sarkar, Krzysztof Czarnecki

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出基于超游戏理论的动态遮挡风险度量方法和加速安全验证框架,用于提升自动驾驶战略规划器的安全性。

Comments This work is 6 pages long and contains 5 figures. For the supplementary video, see https://youtu.be/-crio3rA_IU

Journal ref 2022 International Conference on Robotics and Automation (ICRA). IEEE, 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22701 2026-02-02 cs.AI 70%

Best-of-Q: Improving VLM agents with Q-function Action Ranking at Inference

Best-of-Q: 通过推理中的Q函数动作排名提升VLM代理

Emilien Biré, María Santos, Kai Yuan

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 Best-of-Q通过在推理过程中利用Q函数动作排名提升VLM代理性能,显著提高任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20886 2026-02-02 cs.SE cs.LG 62%

IDE-Bench: Evaluating Large Language Models as IDE Agents on Real-World Software Engineering Tasks

IDE-Bench:通过IDE原生工具接口评估大型语言模型作为IDE代理在真实软件工程任务中的表现

Spencer Mateega, Jeff Yang, Tiana Costello, Shaurya Jadhav, Nicole Tian, Agustin Garcinuño

专题命中 Agent评测 :agent(abstract);分类 cs.LG、cs.SE

AI总结 IDE-Bench通过IDE原生工具接口评估大型语言模型作为IDE代理在真实软件工程任务中的表现,提供首个系统性的多语言全栈环境评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22746 2026-02-02 cs.ET cs.AI 57%

UrbanMoE: A Sparse Multi-Modal Mixture-of-Experts Framework for Multi-Task Urban Region Profiling

UrbanMoE: 一种用于多任务城市区域刻画的稀疏多模态专家混合框架

Pingping Liu, Jiamiao Liu, Zijian Zhang, Hao Miao, Qi Jiang, Qingliang Li, Qiuzhan Zhou, Irwin King

机构 * Jilin University(吉林大学) The Hong Kong Polytechnic University(香港理工大学) Changchun Normal University(长春师范大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 UrbanMoE提出了一种稀疏多模态专家混合框架,用于解决多任务城市区域刻画问题,通过多模态特征动态路由实现高效预测,提升了城市分析的性能和可重复性。

Comments 12 pages, 6 figures, 5tables, Proceedings of the ACM Web Conference 2026 (WWW '26), April 13--17, 2026, Dubai, United Arab Emirates

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00205 2026-02-02 cs.SE cs.CR 57%

Towards a Benchmark for Dependency Decision-Making

面向依赖决策制定的基准测试

Tanmay Singla, Berk Çakar, Paschal C. Amusuo, James C. Davis

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 本文提出DepDec-Bench基准测试,用于评估人工智能编码代理在依赖决策中的安全性和效率,通过分析实际依赖变更数据,揭示代理在版本选择、依赖重用及安全影响方面的表现。

Comments Under review at JAWS 2026. 5 pages, 1 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02883 2026-02-02 cs.LG 57%

A Continual Offline Reinforcement Learning Benchmark for Navigation Tasks

连续离线强化学习导航任务基准测试

Anthony Kobanda, Odalric-Ambrym Maillard, Rémy Portelas

机构 * Inria, Univ. Lille, CNRS, Centrale Lille, UMR 9198-CRIStAL, F-59000 Lille, France(法国里尔大学、法国国家科学研究中心、中央里尔学院、UMR 9198-CRIStAL)

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.LG

AI总结 本文提出一个连续离线强化学习导航任务基准测试,通过视频游戏场景评估算法性能,解决灾难性遗忘、任务适应和内存效率等关键挑战。

Comments arXiv admin note: text overlap with arXiv:2412.14865

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22633 2026-02-02 cs.NI cs.AI 57%

MCP-Diag: A Deterministic, Protocol-Driven Architecture for AI-Native Network Diagnostics

MCP-Diag:一种确定性的、基于协议的架构用于AI原生网络诊断

Devansh Lodha, Mohit Panchal, Sameer G. Kulkarni

机构 * Indian Institute of Technology Gandhinagar(印度理工学院加尔各答分校)

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.AI

AI总结 MCP-Diag通过确定性翻译层和强制性 elicitation循环,实现高精度的AI原生网络诊断,提升实体提取准确性和上下文token使用效率。

Comments Accepted at COMSNETS 2026 Graduate Forum. Best Paper Award (Runner Up). 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22426 2026-02-02 cs.HC 50%

ScamPilot: Simulating Conversations with LLMs to Protect Against Online Scams

ScamPilot:利用大语言模型模拟对话以防范网络诈骗

Owen Hoffman, Kangze Peng, Sajid Kamal, Zehua You, Sukrit Venkatagiri

专题命中 Agent评测 :agent(abstract)

AI总结 ScamPilot通过模拟诈骗场景和实时反馈提升用户识别诈骗的能力,有效提高用户防御效果和自信心。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22346 2026-02-02 cs.GT 50%

FAIRFORMER: A transformer architecture for discrete fair division

FAIRFORMER:一种用于离散公平分配的变压器架构

Chris Mascioli, Satyam Goyal, Mithun Chakraborty

专题命中 Agent评测 :agent(abstract)

AI总结 FAIRFORMER通过双塔变压器架构实现离散公平分配,无需监督训练,能高效分配物品并提升纳什福利。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 2 篇

2512.10350 2026-02-02 cs.LG cs.AI 84%

Geometric Dynamics of Agentic Loops in Large Language Models

大语言模型中代理循环的几何动力学

Nicolas Tacheny

机构 * University of Mons(蒙斯大学)

专题命中 其他Agent :agentic(title,abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

AI总结 研究揭示大语言模型中代理循环的动力学特性,通过几何方法分类其收缩、振荡或探索行为,并展示提示设计对动力学模式的控制作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23206 2026-02-02 cs.AI 57%

High-quality generation of dynamic game content via small language models: A proof of concept

通过小型语言模型实现高质量动态游戏内容生成:概念验证

Morten I. K. Munk, Arturo Valdivia, Paolo Burelli

机构 * brAIn lab\ University of Copenhagen Copenhagen Denmark \&\ Power Labs Copenhagen Denmark Data Science Section\ University of Copenhagen Copenhagen Denmark brAIn lab\ University of Copenhagen \&\ Power Labs Data Science Section\ University of Copenhagen

专题命中 其他Agent :agentic(abstract);分类 cs.AI

AI总结 本文提出通过激进微调小型语言模型生成高质量动态游戏内容的方法,并通过概念验证展示其在实时生成中的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏