arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-02-13 至 2026-02-13 共收录 17 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 17 篇

2602.12056 2026-02-13 cs.AI 83%

LawThinker: A Deep Research Legal Agent in Dynamic Environments

LawThinker: 动态环境中的一种深度法律研究代理

Xinyu Yang, Chenlong Deng, Tongyu Wen, Binyu Xie, Zhicheng Dou

机构 * Renmin University of China(中国人民大学)

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 LawThinker是一种用于动态司法环境的自主法律研究代理,通过探索-验证-记忆策略提升法律推理的准确性和程序合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11136 2026-02-13 cs.AI 83%

FormalJudge: A Neuro-Symbolic Paradigm for Agentic Oversight

FormalJudge: 一种用于代理监管的神经符号范式

Jiayi Zhou, Yang Sheng, Hantao Lou, Yaodong Yang, Jie Fu

机构 * Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学) State Key Laboratory of General Artificial Intelligence, Peking University(通用人工智能国家重点实验室,北京大学) Fudan University(复旦大学) Shanghai AI Lab(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 FormalJudge通过神经符号框架结合形式验证,提升代理行为安全性和欺骗检测能力,实现数学保证而非概率评分。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02388 2026-02-13 cs.CL 79%

Learning to Route: A Rule-Driven Agent Framework for Hybrid-Source Retrieval-Augmented Generation

学习路由:一种基于规则的代理框架用于混合源检索增强生成

Haoyue Bai, Haoyu Wang, Shengyu Chen, Zhengzhang Chen, Lu-An Tang, Wei Cheng, Haifeng Chen, Yanjie Fu

机构 * Arizona State University(亚利桑那州立大学) NEC Laboratories America(NEC美国实验室)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本文提出基于规则的路由框架,通过系统规则选择合适来源提升检索增强生成的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12102 2026-02-13 cs.MA 78%

DEpiABS: Differentiable Epidemic Agent-Based Simulator

DEpiABS:可微分流行病基于代理的模拟器

Zhijian Gao, Shuxin Li, Bo An

专题命中 Agent评测 :agent(title,abstract)

AI总结 DEpiABS是一种可微分基于代理的流行病模拟器,通过平衡机理细节、计算效率和可解释性,提升流行病预测的准确性与通用性。

Comments 17 pages, 9 figures, to be published in AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10081 2026-02-13 cs.CL cs.AI 73%

Anagent For Enhancing Scientific Table & Figure Analysis

一个增强科学表格及图表分析的代理

Xuehang Guo, Zhiyong Lu, Tom Hope, Qingyun Wang

机构 * College of William \& Mary The Allen Institute for AI (AI2)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 Anagent通过多代理框架提升科学表格及图表分析的准确性和效率,实现显著的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11918 2026-02-13 cs.AI 70%

MEME: Modeling the Evolutionary Modes of Financial Markets

MEME:金融市场的进化模式建模

Taian Guo, Haiyang Shen, Junyu Luo, Zhongshi Xing, Hanchun Lian, Jinsheng Huang, Binqi Chen, Luchen Liu, Yun Ma, Ming Zhang

机构 * National Key Laboratory for Multimedia Information Processing, PKU-Anker LLM Lab, School of Computer Science, Peking University(国家多媒体信息处理重点实验室、PKU-Anker LLM实验室、计算机科学学院、北京大学) School of Electronics Engineering(电子工程学院) Computer Science, Peking University(计算机科学、北京大学) Institute for Artificial Intelligence, Peking University(人工智能研究所、北京大学) Sun Yat-sen University(中山大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 MEME通过建模金融市场中的动态进化思维模式,利用多代理提取和高斯混合模型,实现对市场动态的精准重建,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11877 2026-02-13 cs.CL cs.AI 62%

Towards Fair and Comprehensive Evaluation of Routers in Collaborative LLM Systems

迈向协作大语言模型系统中路由器的公平且全面评估

Wanxing Wu, He Zhu, Yixia Li, Lei Yang, Jiehui Zhao, Hongru Wang, Jian Yang, Benyou Wang, Bingyi Jing, Guanhua Chen

机构 * Southern University of Science and Technology(南方科技大学) Institut Polytechnique de Paris(巴黎政治学院) Peking University(北京大学) Deepexi Technology Co. Ltd.(深醒科技有限公司) University of Edinburgh(爱丁堡大学) Beihang University(北航) Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出RouterXBench框架和ProbeDirichlet路由器,通过内部隐藏状态提升路由能力与跨领域鲁棒性,实现对协作大语言模型系统中路由器的公平全面评估。

Comments Our code is publicly available at https://github.com/zhuchichi56/RouterXBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11964 2026-02-13 cs.AI 57%

Gaia2: Benchmarking LLM Agents on Dynamic and Asynchronous Environments

Gaia2:在动态和异步环境中评估大语言模型代理的基准测试

Romain Froger, Pierre Andrews, Matteo Bettini, Amar Budhiraja, Ricardo Silveira Cabral, Virginie Do, Emilien Garreau, Jean-Baptiste Gaya, Hugo Laurençon, Maxime Lecanu, Kunal Malkan, Dheeraj Mekala, Pierre Ménard, Gerard Moreno-Torres Bertran, Ulyana Piterbarg, Mikhail Plekhanov, Mathieu Rita, Andrey Rusakov, Vladislav Vorotilov, Mengjue Wang, Ian Yu, Amine Benhalloum, Grégoire Mialon, Thomas Scialom

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 Gaia2通过动态和异步环境评估大语言模型代理,揭示了推理、效率和鲁棒性之间的权衡,为代理系统的发展提供灵活的基础设施。

Comments Accepted as Oral at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13220 2026-02-13 cs.CR cs.AI 57%

MCPSecBench: A Systematic Security Benchmark and Playground for Testing Model Context Protocols

MCPSecBench: 一个系统化的安全基准和测试平台用于测试模型上下文协议

Yixuan Yang, Cuifeng Gao, Daoyuan Wu, Yufan Chen, Yingjiu Li, Shuai Wang

机构 * Lingnan University(岭南大学) University of Oregon(俄勒冈大学)

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI

AI总结 MCPSecBench是一个系统化的安全基准和测试平台,用于评估模型上下文协议的安全性,揭示了不同攻击面和模型中的核心漏洞及保护机制的不足。

Comments This is a technical report from Lingnan University, Hong Kong. Code is available at https://github.com/AIS2Lab/MCPSecBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11643 2026-02-13 cs.RO cs.AI cs.CV 57%

ViTaS: Visual Tactile Soft Fusion Contrastive Learning for Visuomotor Learning

ViTaS: 用于视觉-运动学习的视觉触觉软融合对比学习

Yufeng Tian, Shuiqi Cheng, Tianming Wei, Tianxing Zhou, Yuanhang Zhang, Zixian Liu, Qianwei Han, Zhecheng Yuan, Huazhe Xu

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 ViTaS通过融合视觉和触觉信息,利用软融合对比学习提升视觉-运动学习的性能。

Comments Published to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11400 2026-02-13 cs.GT 56%

Maximizing Index Diversity in Committee Elections

在委员会选举中最大化指数多样性

Paula Böhm, Robert Bredereck, Till Fluschnik

专题命中 Agent评测 :agent(abstract);autonomous agent(comments)

AI总结 本文提出两种多赢家选举模型,旨在通过评分函数和满意度约束最大化委员会的多样性,并引入新的多样性指数进行分析。

Comments A short version was published in the proceedings of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18037 2026-02-13 cs.MA 50%

Normative Feeling: Socially Patterned Affective Mechanisms

规范性情感:社会模式的情感机制

Stavros Anagnou, Daniel Polani, Christoph Salge

专题命中 Agent评测 :agent(abstract)

AI总结 该研究通过代理模型探讨规范性过程如何影响情绪机制,揭示了规范性行为在资源管理中的进化路径及社会偏好形成的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11757 2026-02-13 cs.CV 50%

Code2Worlds: Empowering Coding LLMs for 4D World Generation

Code2Worlds: 赋能编码大语言模型进行4D世界生成

Yi Zhang, Yunshuang Wang, Zeyu Zhang, Hao Tang

专题命中 Agent评测 :agent(abstract)

AI总结 Code2Worlds通过双流架构和闭环机制,提升编码大语言模型在4D世界生成中的动态真实性和物理一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11580 2026-02-13 cs.AR 50%

Benchmarking for Single Feature Attribution with Microarchitecture Cliffs

基于微架构悬崖的单特征归因基准测试

Hao Zhen, Qingxuan Kang, Yungang Bao, Trevor E. Carlson

专题命中 Agent评测 :workflow(abstract)

AI总结 提出微架构悬崖基准方法,用于校准模拟器与RTL之间的微架构差异,显著降低性能误差。

Comments 12 pages, 14 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11417 2026-02-13 cs.GT 50%

Fair Data-Exchange Mechanisms

公平的数据交换机制

Rashida Hakim, Christos Papadimitriou, Mihalis Yannakakis

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种公平数据交换机制,通过确保数据点的平等交换,避免了搭便车行为,并在无支付情况下实现了帕累托最优的均衡结果。

Comments 29 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11404 2026-02-13 cs.GT cs.DS 50%

The Distortion of Prior-Independent b-Matching Mechanisms

先验独立 b-匹配机制的失真

Ioannis Caragiannis, Vasilis Gkatzelis, Sebastian Homrighausen

专题命中 Agent评测 :agent(abstract)

AI总结 该研究提出了一种在代理偏好随机生成时具有最优失真和近最优失真间隙的 ordinal 机制,改进了传统最坏情况分析的悲观结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11330 2026-02-13 cs.GT cs.DS 50%

When agents choose bundles autonomously: guarantees beyond discrepancy

当代理自主选择组合时:超越偏差的保证

Sushmita Gupta, Pallavi Jain, Sanjay Seetharaman, Meirav Zehavi

专题命中 Agent评测 :agent(abstract)

AI总结 研究提出了一种在多项式时间内实现高价值公平分配的方法,通过克服偏差障碍,为每个代理保证至少PROP - O(log n)的价值。

Comments 40 pages; abstract shortened due to arXiv requirements

详情

展开后加载摘要…

URL PDF HTML 收藏