arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-02-11 至 2026-02-11 共收录 17 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 17 篇

2505.15935 2026-02-11 cs.DB cs.CL cs.CR 85%

MAPS: A Multilingual Benchmark for Agent Performance and Security

MAPS: 一种多语言评估基准,用于代理性能和安全

Omer Hofman, Jonathan Brokman, Oren Rachmil, Shamik Bose, Vikas Pahuja, Toshiya Shimizu, Trisha Starostina, Kelly Marchisio, Seraphina Goldfarb-Tarrant, Roman Vainshtein

机构 * Fujitsu Research of Europe(富士通欧洲研究部) Fujitsu Limited(富士通有限公司) Cohere

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);agentic(abstract);分类 cs.CL

AI总结 MAPS是一个多语言评估基准,用于评估代理AI在不同语言和任务中的性能与安全性。

Comments Accepted to EACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10936 2026-02-11 cs.CL 85%

Cochain: Balancing Insufficient and Excessive Collaboration in LLM Agent Workflows

Cochain: 在LLM代理工作流中平衡不足与过度的合作

Jiaxing Zhao, Hongbin Xie, Yuzhen Lei, Xuan Song, Zhuoran Shi, Lianxin Li, Shuangxue Liu, Linguo Xie, Haoran Zhang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) School of Urban Planning and Design, Peking University(北京大学城市规划与设计学院)

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);multi-agent(abstract);分类 cs.CL

AI总结 Cochain通过整合知识图谱和提示树,有效解决业务工作流中LLM代理合作问题,优于基线模型。

Comments 35 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04072 2026-02-11 cs.AI cs.LG 84%

Among Us: A Sandbox for Measuring and Detecting Agentic Deception

Among Us: 一种用于衡量和检测代理欺骗的沙盒

Satvik Golechha, Adrià Garriga-Alonso

机构 * MATS FAR AI

专题命中 Agent评测 :agentic(title);agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 Among Us通过开放的沙盒游戏评估LLM的欺骗能力,发现强化学习训练的模型更擅长生成欺骗而非检测,且基于激活的逻辑回归和SAEs在检测中表现优异。

Comments 21 pages, preprint

Journal ref NeurIPS 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09286 2026-02-11 cs.AI cs.CY cs.HC 83%

Human Control Is the Anchor, Not the Answer: Early Divergence of Oversight in Agentic AI Communities

人类控制是锚点而非答案:代理AI社区中的早期监管分歧

Hanjing Shi, Dominic DiFranzo

机构 * Lehigh University(莱斯利大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文通过分析两个代理AI社区,揭示了

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09063 2026-02-11 q-bio.GN cs.AI 79%

scBench: Evaluating AI Agents on Single-Cell RNA-seq Analysis

scBench:在单细胞RNA测序分析中评估AI代理

Kenny Workman, Zhen Yang, Harihara Muralidharan, Aidan Abdulali, Hannah Le

机构 * LatchBio

专题命中 Agent评测 :AI agent(title,abstract);分类 cs.AI

AI总结 scBench通过394个可验证问题评估AI代理在单细胞RNA测序分析中的性能,揭示模型与平台选择对准确率的影响,为开发可靠分析工具提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09339 2026-02-11 cs.CL 70%

Understanding Risk and Dependency in AI Chatbot Use from User Discourse

理解AI聊天机器人使用中的风险与依赖性:从用户话语出发

Jianfeng Zhu, Karin G. Coifman, Ruoming Jin

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 本研究通过分析用户话语揭示AI聊天机器人使用中的心理风险维度,发现自我调节困难和对自主性、控制和技术风险的恐惧为主要特征。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09336 2026-02-11 cs.CL 70%

FM SO.P: A Progressive Task Mixture Framework with Automatic Evaluation for Cross-Domain SOP Understanding

FM SO.P: 一种具有自动评估的渐进式任务混合框架用于跨域SOP理解

Siyuan Huang, Ziyu Wang, Chao Pan, Han Zhao

机构 * Amazon(亚马逊) Johns Hopkins University(约翰霍普金斯大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 FM SO.P提出了一种渐进式任务混合框架和自动评估系统,以提升跨领域SOP理解的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11239 2026-02-11 cs.LG 70%

Massive-STEPS: Massive Semantic Trajectories for Understanding POI Check-ins -- Dataset and Benchmarks

Massive-STEPS: 用于理解POI签到的大量语义轨迹 -- 数据集和基准测试

Wilson Wongso, Hao Xue, Flora D. Salim

机构 * University of New South Wales(新南威尔士大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.LG

AI总结 Massive-STEPS通过提供大规模、公开的POI签到数据集和基准测试,推动人类移动性和POI轨迹建模的可重复研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09047 2026-02-11 quant-ph 67%

Empirical Evaluation of QAOA with Zero Noise Extrapolation on NISQ Hardware for Carbon Credit Portfolio Optimization in the Brazilian Cerrado

基于零噪声外推的QAOA在巴西塞拉多碳信用组合优化中的实证评估

Hugo José Ribeiro

专题命中 Agent评测 :planning(abstract);workflow(abstract)

AI总结 本研究利用QAOA与零噪声外推在NISQ设备上优化碳信用组合,展示了量子方法在环境科学中的实际应用价值。

Comments 29 pages, 3 figures, 6 tables. Code and data available at https://github.com/hgribeirogeo/qaoa-carbon-cerrado (DOI: 10.5281/zenodo.18418053)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09138 2026-02-11 cs.AI cs.CL 62%

PABU: Progress-Aware Belief Update for Efficient LLM Agents

PABU:面向高效LLM代理的进度感知信念更新

Haitao Jiang, Lin Ge, Hengrui Cai, Rui Song

机构 * North Carolina State University, Raleigh, NC, USA(北卡罗来纳州立大学) University of California, Irvine, CA, USA(加州大学伊市分校) Amazon, Seattle, WA, USA(亚马逊公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 PABU通过显式建模任务进度和选择性保留历史信息,提升了LLM代理的任务完成效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10017 2026-02-11 cs.CL 57%

SCORE: Specificity, Context Utilization, Robustness, and Relevance for Reference-Free LLM Evaluation

SCORE:特定性、上下文利用、鲁棒性与相关性用于无参考LLM评估

Homaira Huda Shomee, Rochana Chaturvedi, Yangxinyu Xie, Tanwi Mallick

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Argonne National Laboratory(阿贡国家实验室) University of Pennsylvania(宾夕法尼亚大学)

专题命中 Agent评测 :planning(abstract);分类 cs.CL

AI总结 本文提出了一种无参考评估框架,用于评估LLM在高风险领域任务中的特定性、鲁棒性、相关性和上下文利用,通过精心编纂的数据集和人工评估验证了多指标评估的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09757 2026-02-11 cs.LG 57%

Towards Poisoning Robustness Certification for Natural Language Generation

面向自然语言生成的中毒鲁棒性认证

Mihnea Ghitu, Matthew Wicker

机构 * Department of Computing, Imperial College London, London, UK(计算系,伦敦帝国学院,伦敦,英国)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出TPA算法,通过计算最小中毒预算认证自然语言生成的有效性和稳定性,为安全关键应用提供可证明的鲁棒性保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09772 2026-02-11 cs.RO 50%

Design and Evaluation of an Assisted Programming Interface for Behavior Trees in Robotics

行为树在机器人中的辅助编程接口设计与评估

Jonathan Styrud, Matteo Iovino, Rebecca Stower, Mart Kartašev, Mikael Norrlöf, Mårten Björkman, Christian Smith

专题命中 Agent评测 :planning(abstract)

AI总结 本文提出BETR-GUI,结合AI助手与拖放编辑器,通过整合多种技术提升机器人行为树编程效率,实验证明人类用户优于纯AI助手。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09732 2026-02-11 physics.optics 50%

The mixture of glycerin with tartrazine: a solution to reversibly increase tissue transparency for in vitro quantitative phase imaging

甘油与焦糖色素的混合物:一种可逆性增加组织透明度用于体外定量相位成像的解决方案

Mikolaj Krysa, Anna Chwastowicz, Malgorzata Lenarcik, Pawel Matrybak, Piotr Zdankowski, Maciej Trusiak

专题命中 Agent评测 :agent(abstract)

AI总结 本研究提出了一种低成本且安全的甘油与焦糖色素混合物,用于提高组织透明度,从而实现高通量无标记定量相位成像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09728 2026-02-11 econ.TH 50%

Competitive Credit and Present Bias: A Stochastic Discounting Approach

竞争信贷与现时偏好:一种随机折扣方法

Siddharth Chatterjee, Daniel F. Garrett

专题命中 Agent评测 :agent(abstract)

AI总结 本文通过随机折扣方法研究竞争信贷中代理人的时间不一致偏好,揭示了在均衡合同中消费时间分配的特征及影响因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02347 2026-02-11 cs.CE cs.MA 50%

Modelling Socio-Psychological Drivers of Land Management Intensity

土地管理强度的社会心理驱动因素建模

Ronja Hotz, Calum Brown, Yongchao Zeng, Thomas Schmitt, Mark Rounsevell

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种基于计划行为理论的土地管理强度建模方法,通过整合社会心理因素,揭示其对土地利用决策和生态系统服务的影响。

Comments 34 pages (including references and appendix), 27 figures. Submitted to JASSS

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06747 2026-02-11 cs.CV 50%

Wandering around: A bioinspired approach to visual attention through object motion sensitivity

游走探索:一种受生物启发的通过物体运动敏感性实现视觉注意的方法

Giulia D'Angelo, Victoria Clerico, Chiara Bartolozzi, Matej Hoffmann, P. Michael Furlong, Alexander Hadjiivanov

机构 * Department of Cybernetics, Faculty of Electrical Engineering, Czech Technical University in Prague(捷克技术大学普拉茨分校电子工程系) IBM Research Europe, Zurich, Switzerland(IBM欧洲研究院,瑞士苏黎世) Italian Institute of Technology, Genoa, Italy(意大利理工学院,热那亚) National Research Council of Canada & Systems Design Engineering, University of Waterloo, Canada(加拿大国家研究理事会与系统设计工程,滑铁卢大学) European Space Agency, Noordwijk, The Netherlands(欧洲航天局,荷兰诺德维克) Adapsent, Leiden, The Netherlands(Adapsent,荷兰莱顿)

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种受生物启发的视觉注意系统,通过物体运动敏感性实现选择性注意,利用动态视觉传感器和神经形态算法,实现高效低延迟的实时目标检测与分割。

Journal ref Neuromorphic Computing and Engineering 5.2 (2025): 024019

详情

展开后加载摘要…

URL PDF HTML 收藏