arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-02-03 至 2026-02-03 共收录 247 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 43 篇

2602.00751 2026-02-03 cs.AI cs.SE 81%

Engineering AI Agents for Clinical Workflows: A Case Study in Architecture,MLOps, and Governance

为临床工作流程工程AI代理:架构、MLOps和治理的案例研究

Cláudio Lúcio do Val Lopes, João Marcus Pitta, Fabiano Belém, Gildson Alves, Flávio Vinícius Cruzeiro Martins

机构 * A3Data CEFET-MG

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出通过整合四个工程支柱构建可信临床AI系统,展示Maria平台在架构、MLOps和治理方面的创新实践。

Comments 9 pages, 5 figures 2026 IEEE/ACM 5th International Conference on AI Engineering - Software Engineering for AI}{April 12--13, 2026}{Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02455 2026-02-03 cs.AI cs.CL cs.SE 80%

Drift-Bench: Diagnosing Cooperative Breakdowns in LLM Agents under Input Faults via Multi-Turn Interaction

Drift-Bench: 通过多轮交互诊断LLM代理在输入故障下的合作破裂

Han Bao, Zheyuan Zhang, Pengcheng Jing, Zhengqing Yuan, Kaiwen Shi, Yanfang Ye

机构 * University of Notre Dame(内布拉斯加大学)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 Drift-Bench通过多轮交互评估LLM代理在输入故障下的合作破裂,采用角色驱动的用户模拟器和Rise评估协议,揭示澄清效果随用户角色和故障类型的变化,推动代理安全评估。

Comments 65 pages, 40 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02345 2026-02-03 cs.SE 79%

A Task-Level Evaluation of AI Agents in Open-Source Projects

对开源项目中AI代理的任务级评估

Shojibur Rahman, Md Fazle Rabbi, Minhaz Zibran

专题命中 Agent评测 :AI agent(title,abstract);分类 cs.SE

AI总结 本文评估了五个AI代理在开源项目中的表现,发现Codex在PR接受率上表现优异,而Copilot在审查讨论量上领先,但提交质量因任务类型而异。

Comments 5 pages, accepted at MSR Mining Challenge 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00352 2026-02-03 cs.CL 79%

DETOUR: An Interactive Benchmark for Dual-Agent Search and Reasoning

DETOUR:双智能体搜索与推理的交互基准

Li Siyan, Darshan Deshpande, Anand Kannappan, Rebecca Qian

机构 * Patronus AI DAP Lab(DAP实验室) Columbia University(哥伦比亚大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 DETOUR基准通过双智能体机制评估双智能体搜索与推理能力,揭示现有模型在模糊不明确场景下的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01858 2026-02-03 cs.AI 77%

SOPRAG: Multi-view Graph Experts Retrieval for Industrial Standard Operating Procedures

SOPRAG:面向工业标准操作规程的多视图图专家检索

Liangtao Lin, Zhaomeng Zhu, Tianwei Zhang, Yonggang Wen

机构 * Nanyang Technological University(南洋理工大学)

专题命中 Agent评测 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.AI

AI总结 SOPRAG通过多视图图专家检索框架,解决工业SOP检索中的结构复杂性和条件依赖性问题,提升检索准确性和响应实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00676 2026-02-03 cs.AI cs.MA 77%

OpenGuanDan: A Large-Scale Imperfect Information Game Benchmark

OpenGuanDan: 一个大规模非完全信息游戏基准

Chao Li, Shangdong Yang, Chiheng Zhan, Zhenxing Ge, Yujing Hu, Bingkun Bao, Xingguo Chen, Yang Gao

机构 * School of Computer Science, Nanjing University of Posts(南京邮电大学计算机科学学院) NetEase Fuxi AI Lab, Netease Inc(网易凤凰AI实验室,网易公司) School of Intelligent Science(智能科学学院) Technology, Nanjing University(技术,南京大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 OpenGuanDan是一个用于评估多智能体决策算法的新型大规模非完全信息游戏基准,通过模拟中国四人纸牌游戏并支持人机对抗,揭示了当前AI在复杂决策任务中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08952 2026-02-03 cs.LG 77%

When LLM Agents Meet Graph Optimization: An Automated Data Quality Improvement Approach

当大语言模型代理遇见图优化:一种自动化数据质量改进方法

Zhihan Zhang, Xunkai Li, Yilong Zuo, Yanzhe Wen, Zhaoxin Fan, Zhenjun Li, Bing Zhou, Rong-Hua Li, Guoren Wang

机构 * Shenzhen Institute of Technology(深圳理工大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.LG

AI总结 LAGA是一种统一的多代理框架,通过协调多模态优化全面提升文本属性图的数据质量,验证了数据驱动的质量优化在可靠分析中的重要性。

Comments 12 pages, 10figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00456 2026-02-03 cs.AI 77%

Benchmarking Agents in Insurance Underwriting Environments

在保险承保环境中评估智能体

Amanda Dsouza, Ramya Ramakrishnan, Charles Dickens, Bhavishya Pohani, Christopher M Glaze

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出UNDERWRITE基准,通过专家协作模拟真实保险承保场景,揭示了代理性能与企业需求间的差距,强调了专家参与和组合性方法的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01171 2026-02-03 cs.AI cs.CL cs.LO 73%

ASP-Bench: From Natural Language to Logic Programs

ASP-Bench: 从自然语言到逻辑程序

Stefan Szeider

机构 * Algorithms and Complexity Group TU Wien(算法与复杂性组维也纳技术大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 ASP-Bench通过自然语言到逻辑程序的转换基准,评估了基于ReAct框架的代理方法,揭示了建模难度的多维因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13448 2026-02-03 cs.MA cs.AI cs.ET cs.LG 73%

BMG-Q: Localized Bipartite Match Graph Attention Q-Learning for Ride-Pooling Order Dispatch

BMG-Q:局部双图匹配图注意力Q学习用于拼车订单调度

Yulong Hu, Siyuan Feng, Sen Li

机构 * Department of Civil and Environmental Engineering, The Hong Kong University of Science and Technology(香港科学与技术大学土木与环境工程系) Intelligent Transportation Thrust, Systems Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)智能交通 thrust,系统中心) Department of Aeronautical and Aviation Engineering, The Hong Kong Polytechnic University(香港理工大学航空与航空工程系)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 BMG-Q通过局部双图匹配图注意力Q学习提升拼车订单调度的决策效率与鲁棒性。

Journal ref IEEE Transactions on Intelligent Transportation Systems ( Volume: 26, Issue: 10, October 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02360 2026-02-03 cs.CL 70%

Automated Multiple Mini Interview (MMI) Scoring

自动化多轮面试(MMI)评分

Ryan Huynh, Frank Guerin, Alison Callwood

机构 * University of Surrey(萨里大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文提出多智能体提示框架,通过转录优化和标准特定评分提升MMI评分的准确性和可靠性,优于传统微调方法。

Comments 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01611 2026-02-03 cs.LG 70%

What Do Agents Learn from Trajectory-SFT: Semantics or Interfaces?

轨迹SFT中智能体学习了语义还是接口?

Weizheng Gu, Chengze Li, Zhuohao Yu, Mengyuan Sun, Zhibang Yang, Wei Wang, Hongrui Jia, Shikun Zhang, Wei Ye

机构 * National Engineering Research Center for Software Engineering, Peking University, Beijing, China(软件工程国家工程研究中心,北京大学,北京,中国) Nanjing University, Nanjing, China(南京大学,南京,中国) Tongji University, Shanghai, China(同济大学,上海,中国)

专题命中 Agent评测 :agent(abstract);tool-use(abstract);分类 cs.LG

AI总结 本文提出PIPE协议用于评估智能体在轨迹SFT中对接口的依赖性,发现轨迹SFT显著放大了接口捷径,且引入了接口依赖性指标以量化训练时接口的偏好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00340 2026-02-03 cs.CV cs.AI 70%

Bridging the Semantic Chasm: Synergistic Conceptual Anchoring for Generalized Few-Shot and Zero-Shot OOD Perception

弥合语义鸿沟:协同概念锚定用于通用少样本和零样本OOD感知

Alexandros Christoforos, Sarah Jenkins, Michael Brown, Tuan Pham, David Chen

机构 * Boston University(波士顿大学) Suffolk University(苏富比大学) Kyung Hee University, South Korea(韩国庆熙大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 SynerNet通过协同神经代理网络框架,解决视觉语言模型在分布外概念感知中的跨模态对齐退化问题,提升少样本和零样本场景下的精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01930 2026-02-03 cs.RO cs.CV 67%

LIEREx: Language-Image Embeddings for Robotic Exploration

LIEREx: 语言-图像嵌入用于机器人探索

Felix Igelbrink, Lennart Niecksch, Marian Renz, Martin Günther, Martin Atzmueller

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract)

AI总结 LIEREx通过整合视觉-语言基础模型与3D语义场景图,实现机器人在部分未知环境中的目标导向探索。

Comments This preprint has not undergone peer review or any post-submission improvements or corrections. The Version of Record of this article is published in KI - Künstliche Intelligenz, and is available online at https://doi.org/10.1007/s13218-026-00902-6

Journal ref Künstliche Intelligenz (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01854 2026-02-03 cs.CV 67%

Fact or Fake? Assessing the Role of Deepfake Detectors in Multimodal Misinformation Detection

事实还是假象?评估深度伪造检测器在多模态虚假信息检测中的作用

A S M Sharifuzzaman Sagar, Mohammed Bennamoun, Farid Boussaid, Naeha Sharif, Lian Xu, Shaaban Sahmoud, Ali Kishk

机构 * The University of Western Australia(西澳大学) Fatih Sultan Mehmet Vakif University(法提赫·苏丹·梅赫梅特·瓦基夫大学) Aljazeera Media Network Investigative Department(半岛电视台调查部门)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 研究评估了深度伪造检测器在多模态虚假信息检测中的作用,发现其独立价值有限,而证据驱动的事实核查系统表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23245 2026-02-03 math.RT math.NT 67%

Eigenweights for arithmetic Hirzebruch Proportionality

特征权重与算术希格泽布鲁克比例性

Tony Feng

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

AI总结 本文通过AI代理结合代数组合学工具,将特征权重与对称群表示论联系,确定了所有经典群的特征权重。

Comments Fix broken reference, clarify some phrasing

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19016 2026-02-03 cs.CR 67%

DREAM: Dynamic Red-teaming across Environments for AI Models

DREAM: 为AI模型跨环境动态红队测试

Liming Lu, Xiang Gu, Junyu Huang, Jiawei Du, Xu Zheng, Yunhuai Liu, Yongbin Zhou, Shuchao Pang

专题命中 Agent评测 :agent(abstract);agentic(abstract)

AI总结 DREAM通过动态多阶段攻击测试揭示LLM代理在跨环境安全中的关键漏洞,指出上下文脆弱性和长期恶意意图追踪不足,并提出评估工具以提升防御能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01291 2026-02-03 cs.LO 67%

Construction-Verification: A Benchmark for Applied Mathematics in Lean 4

构造-验证:Lean 4中的应用数学基准

Bowen Yang, Yi Yuan, Chenyi Li, Ziyu Wang, Liangqi Li, Bo Zhang, Zhe Li, Zaiwen Wen

专题命中 Agent评测 :agent(abstract);workflow(abstract)

AI总结 本文提出Lean 4中的构造-验证框架,通过AMBER基准评估应用数学领域中显式解决方案合成与验证能力,揭示通用模型在复杂构造任务中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10304 2026-02-03 cs.LG cs.AI cs.GT 62%

Large-Scale Auto-bidding with Nash Equilibrium Constraints

大规模自动出价与纳什均衡约束

Zhiyu Mou, Miao Xu, Rongquan Bai, Zhuoran Yang, Chuan Yu, Jian Xu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团) Department of Statistics and Data Science(统计与数据科学系) Yale University(耶鲁大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出纳什均衡约束出价框架,通过理论严谨的惩罚对偶梯度方法实现大规模自动出价的稳定性和最优性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01367 2026-02-03 cs.LG cs.AI 62%

Deep Variational Contrastive Learning for Joint Risk Stratification and Time-to-Event Estimation

深度变分对比学习用于联合风险分层和生存时间估计

Pinar Erbil, Alberto Archetti, Eugenio Lomurno, Matteo Matteucci

机构 * Politecnico di Milano, AIRLab(米兰理工学院,AIRLab)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 CONVERSE通过结合变分自编码器和对比学习,实现可解释的风险分层和生存时间估计,提升深度生存模型的性能与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16584 2026-02-03 cs.CL cs.AI 62%

From Scores to Steps: Diagnosing and Improving LLM Performance in Evidence-Based Medical Calculations

从分数到步骤:诊断和改进证据医学计算中LLM的性能

Benlu Wang, Iris Xia, Yifan Zhang, Junda Wang, Feiyun Ouyang, Shuo Han, Arman Cohan, Hong Yu, Zonghai Yao

机构 * Department of Computer Science, Yale University, CT, USA(耶鲁大学计算机科学系) Center for Healthcare Organization and Implementation Research, VA Bedford Health Care(VA贝福德医疗中心健康组织与实施研究中心) Miner School of Computer and Information Sciences, UMass Lowell, MA, USA(UMass洛厄尔矿尔计算机与信息科学学院) Manning College of Information and Computer Sciences, UMass Amherst, MA, USA(UMass阿默斯特马宁信息与计算机科学学院)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出MedRaC框架,通过分步评估和代码执行提升LLM在证据医学计算中的准确性,揭示现有评估方法的不足,并推动临床可信度的提升。

Comments Equal contribution for the first two authors. To appear as an Oral presentation in the proceedings of the Main Conference on Empirical Methods in Natural Language Processing (EMNLP) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09751 2026-02-03 cs.LG cs.AI 62%

Meta-Learning Reinforcement Learning for Crypto-Return Prediction

元学习强化学习用于加密货币收益预测

Junqiao Wang, Zhaoyang Guan, Guanyu Liu, Tianze Xia, Xianzhi Li, Shuo Yin, Xinyuan Song, Chuhan Cheng, Tianyu Shi, Alex Lee

机构 * Sichuan University(四川大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Northwestern University(西北大学) Huazhong University of Science and Technology(华中科技大学) Queen’s University(女王大学) University of Toronto(多伦多大学) TrueNorth Tsinghua University(清华大学) Emory University(埃默里大学) University of Macau(澳门大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 Meta-RL-Crypto通过结合元学习和强化学习,构建了一个自我改进的交易代理,有效提升加密货币收益预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01917 2026-02-03 cs.CL 57%

GuideWeb: A Benchmark for Automatic In-App Guide Generation on Real-World Web UIs

GuideWeb: 一个用于真实世界Web UI上的自动应用内引导生成的基准测试

Chengguang Gan, Yoshihiro Tsujii, Yunhao Liang, Tatsunori Mori, Shiwen Ni, Hiroki Itoh

机构 * Techtouch Inc.(Techtouch公司) University of Chinese Academy of Sciences(中国科学院大学) Shenzhen Institute of Advanced Technology Chinese Academy of Sciences(中国科学院深圳先进技术研究所) Yokohama National University(Yokohama国立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 GuideWeb提出一个用于真实世界Web UI的自动应用内引导生成基准测试,通过选择引导目标元素和生成用户意图文本,实验显示其在引导目标预测和生成质量上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19110 2026-02-03 cs.CL 57%

APE-Bench: Evaluating Automated Proof Engineering for Formal Math Libraries

APE-Bench: 评估形式数学库中的自动化证明工程

Huajian Xin, Luming Li, Xiaoran Jin, Jacques Fleuriot, Wenda Li

机构 * University of Edinburgh(爱丁堡大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 APE-Bench提出了一种系统性评估仓库级证明工程的框架,通过双验证机制评估语法编译和语义要求满足,并提供开源工具进行标准化评估和公平比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01270 2026-02-03 cs.LG 57%

Mixture-of-World Models: Scaling Multi-Task Reinforcement Learning with Modular Latent Dynamics

混合世界模型:通过模块化潜在动态扩展多任务强化学习

Boxuan Zhang, Weipu Zhang, Zhaohan Feng, Wei Xiao, Jian Sun, Jie Chen, Gang Wang

机构 * School of Automation, Beijing Institute of Technology(自动化学院,北京理工大学) Jiangxing Intelligence Inc.(江行智能有限公司)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 混合世界模型通过模块化架构和任务聚类策略,在多任务强化学习中实现了高效的参数利用和样本效率,展示了在Atari和Meta-World基准上的卓越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01163 2026-02-03 cs.CV cs.AI 57%

Semantically Aware UAV Landing Site Assessment from Remote Sensing Imagery via Multimodal Large Language Models

基于多模态大语言模型的语义感知无人机着陆地评估:从遥感图像

Chunliang Hua, Zeyuan Yang, Lei Zhang, Jiayang Sun, Fengwen Chen, Chunlan Zeng, Xiao Hu

机构 * School of Information Science and Engineering, Southeast University(信息科学与工程学院,东南大学) LASER, International Digital Economy Academy(LASER,国际数字经济学院) Department of Electronic Engineering, East China Normal University(电子工程系,华东师范大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出基于多模态大语言模型的无人机着陆地评估方法,通过语义感知与多模态融合提升风险识别精度与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00950 2026-02-03 cs.AI 57%

MindGuard: Guardrail Classifiers for Multi-Turn Mental Health Support

MindGuard: 多轮心理健康支持中的防护分类器

António Farinhas, Nuno M. Guerreiro, José Pombal, Pedro Henrique Martins, Laura Melton, Alex Conway, Cara Dochat, Maya D'Eon, Ricardo Rei

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 MindGuard通过临床验证的危险分类法,提升多轮心理健康对话中的安全性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00133 2026-02-03 q-fin.ST cs.AI 57%

PredictionMarketBench: A SWE-bench-Style Framework for Backtesting Trading Agents on Prediction Markets

PredictionMarketBench: 一个用于预测市场回测交易代理的SWE-bench风格框架

Avi Arora, Ritesh Malpani

机构 * Oddpool

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 PredictionMarketBench是一个用于预测市场回测的框架,通过标准化数据处理和模拟器评估算法和大语言模型交易代理,展示费用意识策略在波动市场中的竞争力。

Comments 10 pages, 5 figures. Code available at https://github.com/oddpool/PredictionMarketBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00641 2026-02-03 cs.AI 57%

AgentAuditor: Human-Level Safety and Security Evaluation for LLM Agents

AgentAuditor: 为LLM代理提供人类水平的安全性和安全性评估

Hanjun Luo, Shenyu Dai, Chiming Ni, Xinfeng Li, Guibin Zhang, Kun Wang, Tongliang Liu, Hanan Salam

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 AgentAuditor通过构建经验记忆和多阶段检索生成过程,提升LLM在代理安全性和安全性评估中的性能,达到人类水平的准确性。

Comments This paper is accepted by 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02457 2026-02-03 cs.CY 50%

MetaCLASS: Metacognitive Coaching for Learning with Adaptive Self-regulation Support

MetaCLASS:基于自适应自我调节支持的元认知辅导

Naiming Liu, Richard Baraniuk, Shashank Sonkar

专题命中 Agent评测 :planning(abstract)

AI总结 MetaCLASS通过元认知辅导框架提升学习者自我调节能力,验证了传统教学模型在元认知任务中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏