arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-02-09 至 2026-02-09 共收录 13 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 13 篇

2602.06345 2026-02-09 cs.CR cs.AI 85%

Zero-Trust Runtime Verification for Agentic Payment Protocols: Mitigating Replay and Context-Binding Failures in AP2

面向代理支付协议的零信任运行时验证:缓解AP2中的重放和上下文绑定失败

Qianlong Lan, Anuj Kaul, Shaun Jones, Stephanie Westrum

机构 * eBay Inc(eBay公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出了一种零信任运行时验证框架,通过动态生成非ces强制显式上下文绑定和一次性使用命令语义,以缓解AP2中的重放和上下文重定向攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18226 2026-02-09 cs.AI 79%

Yunjue Agent Tech Report: A Fully Reproducible, Zero-Start In-Situ Self-Evolving Agent System for Open-Ended Tasks

yunjue代理技术报告:一种完全可重现、零起点现场自我进化代理系统用于开放性任务

Haotian Li, Shijun Yang, Weizhen Qi, Silei Zhao, Rui Hua, Mingzhu Song, Xiaojian Yang, Chao Peng

机构 * Harbin Institute of Technology(哈尔滨工业大学) University of Science and Technology of China(中国科学技术大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 Yunjue代理系统通过现场自我进化范式实现零起点环境下开放性任务的可重现、自适应能力扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06340 2026-02-09 cond-mat.stat-mech cond-mat.soft 78%

Ornstein-Uhlenbeck information particle: A new candidate of active agent

信息粒子:一种新的活性代理候选者

Xin Song, Xiji Shao, Yanwen Zhu, Cheng Yang, Linli He, Shigeyuki Komura, Zhanglin Hou

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出了一种基于OU浴反馈控制的信息粒子,通过调整惯性效应和波动强度,实现两种不同运动模式,展示了其在活性代理中的潜力。

Comments 8 pages, 5 figures including 3 figures in main text and 2 figures in Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06714 2026-02-09 cs.HC 71%

PrefIx: Understand and Adapt to User Preference in Human-Agent Interaction

PrefIx: 在人机交互中理解并适应用户偏好

Jialin Li, Zhenhao Chen, Hanjun Luo, Hanan Salam

专题命中 Agent评测 :agent(title)

AI总结 PrefIx通过交互作为工具范式,评估智能体在人机交互中的偏好适应能力,提升用户体验和偏好对齐度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06955 2026-02-09 cs.LG 57%

Improving Credit Card Fraud Detection with an Optimized Explainable Boosting Machine

通过优化可解释提升机改善信用卡欺诈检测

Reza E. Fazel, Arash Bakhtiary, Siavash A. Bigdeli

机构 * ReDi School(ReDi学院)

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 本文通过优化可解释提升机算法,提升信用卡欺诈检测的准确性和可解释性,实验结果显示其在ROC-AUC指标上优于多种传统方法。

Comments 22 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05975 2026-02-09 cs.IR cs.CL 57%

SAGE: Benchmarking and Improving Retrieval for Deep Research Agents

SAGE:深度研究代理检索的基准测试与改进

Tiansheng Hu, Yilun Zhao, Canyu Zhang, Arman Cohan, Chen Zhao

机构 * NYU Shanghai(纽约大学上海校区) Yale University(耶鲁大学) Center for Data Science, New York University(纽约大学数据科学中心)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 SAGE基准测试评估了深度研究代理的检索能力,发现BM25在推理密集型检索中表现优于大语言模型检索器,并提出基于语料库的测试时扩展框架提升检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21798 2026-02-09 cs.CV cs.HC cs.LG 57%

An Evaluation of Hybrid Annotation Workflows on High-Ambiguity Spatiotemporal Video Footage

对高歧义时空视频 footage 的混合标注流程的评估

Juan Gutiérrez, Victor Gutiérrez, Ángel Mora, Silvia Rodriguez, José Luis Blanco

机构 * IPTC(信息处理与电信中心) Telecommunications Center, Escuela Técnica Superior de Ingenieros de Telecomunicación, Av. Complutense 30, 28040 Madrid, Spain(电信中心,电信工程师高级学院,Complutense大道30号,28040马德里,西班牙)

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 本文评估了混合标注流程在高歧义时空视频中的有效性,通过实验表明其能显著减少标注时间并提供更严谨的AI辅助工作流程评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19275 2026-02-09 cs.SE 57%

Mut4All: Fuzzing Compilers via LLM-Synthesized Mutators Learned from Bug Reports

Mut4All:通过从错误报告中学习的LLM合成变异器模糊编译器

Bo Wang, Pengyang Wang, Chong Chen, Ming Deng, Jieke Shi, Qi Sun, Chengran Yang, Youfang Lin, Zhou Yang, Junjie Chen, Jun Sun, David Lo

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 Mut4All通过LLM合成变异器自动发现编译器错误,实现高效且跨语言的模糊测试

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06053 2026-02-09 cs.CL 57%

PersonaPlex: Voice and Role Control for Full Duplex Conversational Speech Models

PersonaPlex:面向全双工对话语音模型的语音与角色控制

Rajarshi Roy, Jonathan Raiman, Sang-gil Lee, Teodor-Dumitru Ene, Robert Kirby, Sungwon Kim, Jaehyeon Kim, Bryan Catanzaro

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 PersonaPlex通过融合角色条件和语音克隆技术,实现全双工对话语音模型的语音与角色控制,提升角色一致性、说话人相似性和对话自然度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06582 2026-02-09 cs.GT econ.TH 50%

The Impossibility of Strategyproof Rank Aggregation

策略证明排名聚合的不可能性

Manuel Eberl, Patrick Lederer

专题命中 Agent评测 :agent(abstract)

AI总结 本文证明了在至少四个选项的情况下,不存在同时满足一致性和策略证明性的排名聚合方法。

Comments Published as full paper at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06366 2026-02-09 cs.RO 50%

Towards Adaptive Environment Generation for Training Embodied Agents

面向训练具身智能体的自适应环境生成

Teresa Yeo, Dulaj Weerakoon, Dulanga Weerakoon, Archan Misra

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一种闭环环境生成方法,通过反馈驱动调整环境难度,提升具身智能体的训练效率和泛化能力。

Comments Accepted to AAAI-26 Bridge Program B10: Making Embodied AI Reliable with Testing and Formal Verification

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02885 2026-02-09 eess.SY cs.SY q-bio.NC 50%

A Mathematical Formalization of Self-Determining Agency

自我决定代理的数学形式化

Yoshiyuki Ohmura, Earnest Kota Carr, Yasuo Kuniyoshi

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种数学形式化方法,用于描述自我决定代理的因果机制,通过衍生因果性理论揭示代理行为与物理基础层之间的动态关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06243 2026-02-09 cs.RO cs.HC 50%

A Dialogue-Based Human-Robot Interaction Protocol for Wheelchair and Robotic Arm Integrated Control

基于对话的人机交互协议:轮椅与机械臂集成控制

Guangping Liu, Nicholas Hawkins, Billy Madden, Tipu Sultan, Madi Babaiasl

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一种基于对话的人机交互协议,通过轮椅和机械臂的集成控制提升脊髓损伤和上肢障碍患者的生活质量。

详情

展开后加载摘要…

URL PDF HTML 收藏