arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-01-13 至 2026-01-13 共收录 36 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 36 篇

2507.05558 2026-01-13 cs.CR cs.AI 88%

AI Agent Smart Contract Exploit Generation

AI代理智能合约漏洞生成

Arthur Gervais, Liyi Zhou

机构 * University College London(伦敦大学学院) The University of Sydney(悉尼大学) Decentralized Intelligence AG(去中心化智能有限公司) UC Berkeley RDI(伯克利大学RDI)

专题命中 Agent评测 :AI agent(title,abstract);agent(title);agentic(abstract);分类 cs.AI

AI总结 A1通过代理系统结合大语言模型,实现智能合约漏洞的高效生成与验证,成功率达63%,并揭示了攻击与防御在经济上的不对称性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03310 2026-01-13 cs.AI cs.SE 84%

app.build: A Production Framework for Scaling Agentic Prompt-to-App Generation with Environment Scaffolding

app.build:一种用于扩展基于代理的提示到应用程序生成的生产框架

Evgenii Kniazev, Arseny Kravchenko, Igor Rekun, James Broadhead, Nikita Shamgunov, Pranav Sah, Pratik Nichite, Ivan Yamshchikov

机构 * Databricks THWS University of Applied Sciences Würzburg-Schweinfurt (CAIRO)(THWS应用科学大学沃尔夫斯堡-施维林(CAIRO))

专题命中 Agent评测 :agentic(title);agent(abstract);AI agent(abstract);分类 cs.AI、cs.SE

AI总结 app.build通过结构化环境和系统验证提升基于代理的应用程序生成效率,实现高可行性与质量,为生产级代理系统提供参考实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01149 2026-01-13 cs.AI 83%

A3: Android Agent Arena for Mobile GUI Agents with Essential-State Procedural Evaluation

A3: 用于移动GUI代理的Android代理竞技场:基于本质状态的程序评估

Yuxiang Chai, Shunye Tang, Han Xiao, Weifeng Lin, Hanhao Li, Jiayu Zhang, Liang Liu, Pengxiang Zhao, Guangyi Liu, Guozhi Wang, Shuai Ren, Rongduo Han, Haining Zhang, Siyuan Huang, Hongsheng Li

机构 * Nankai University(南开大学) vivo AI Lab(vivo 人工智能实验室) SJTU(上海交通大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 A3提出了一种基于本质状态的程序评估系统,通过动态在线应用的100个任务基准和工具包,提升移动GUI代理的评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06640 2026-01-13 cs.AI cs.NI 83%

Agentic AI Empowered Intent-Based Networking for 6G

基于代理AI的意图驱动网络用于6G

Genze Jiang, Kezhi Wang, Xiaomin Chen, Yizhou Huang

机构 * Department of Computer Science, Brunel University London, UK(布伦埃尔大学伦敦计算机科学系) Department of Computer Science, University of Reading, UK(阅读大学计算机科学系)

专题命中 Agent评测 :agentic(title);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出基于多代理框架的意图驱动网络方案,通过LLM自主分解意图并生成可行网络配置,提升6G无线网络的自主编排能力。

Comments Submitted for Possible Journal Publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07143 2026-01-13 cs.HC 82%

EZBlender: Efficient 3D Editing with Plan-and-ReAct Agent

EZBlender:基于计划与反应代理的高效3D编辑

Hao Wang, Wenhui Zhu, Shao Tang, Zhipeng Wang, Xuanzhao Dong, Xin Li, Xiwen Chen, Ashish Bastola, Xinhao Huang, Yalin Wang, Abolfazl Razi

专题命中 Agent评测 :agent(title,abstract);planning(abstract)

AI总结 EZBlender通过结合计划与反应机制,实现高效且语义忠实的3D编辑,提升Human AI协作效率与经济性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03113 2026-01-13 cs.CE 82%

A Probabilistic Digital Twin of UK En Route Airspace for Training and Evaluating AI Agents for Air Traffic Control

基于英国航路空域的概率数字孪生:用于训练和评估空管AI代理

Nick Pepper, Adam Keane, Amy Hodgkin, Dewi Gould, Edward Henderson, Lynge Lauritsen, Christos Vlahos, George De Ath, Richard Everson, Richard Cannon, Alvaro Sierra Castro, John Korna, Ben Carvell, Marc Thomas

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract)

AI总结 本文提出基于英国航路空域的概率数字孪生,用于训练和评估空管AI代理,通过结合历史与实时数据及概率模型,提供高保真虚拟环境以支持AI代理的开发与评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07309 2026-01-13 cs.AI cs.LG 81%

ARM: Role-Conditioned Neuron Transplantation for Training-Free Generalist LLM Agent Merging

ARM:基于角色的神经元移植用于无训练通用大语言模型代理融合

Zhuoka Feng, Kang Chen, Sihan Zhao, Kai Xiong, Yaoning Wang, Minshen Yu, Junjie Nian, Changyi Xiao, Yixin Cao, Yugang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 ARM通过角色条件神经元移植方法提升大语言模型代理在多环境中的泛化能力,实现无训练的模型融合。

Comments 17 pages, 12 figures. Project page: https://arkazhuo.github.io/ARM-homepage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06034 2026-01-13 cs.SE cs.AI 81%

Autonomous QA Agent: A Retrieval-Augmented Framework for Reliable Selenium Script Generation

自主问答代理:一种增强检索的框架,用于可靠的Selenium脚本生成

Dudekula Kasim Vali

机构 * Department of Computer Science(计算机科学系) VIT-AP University(VIT-AP大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本文提出了一种基于增强检索的框架,通过项目文档和HTML结构生成可靠的Selenium测试脚本,显著提高了脚本生成的准确性和执行成功率。

Comments 13 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07413 2026-01-13 cs.LG cs.MA 79%

The Practicality of Normalizing Flow Test-Time Training in Bayesian Inference for Agent-Based Models

归一化流在基于代理模型的贝叶斯推断中的实用性研究

Junyao Zhang, Jinglai Li, Junqi Tang

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 本文提出在基于代理模型的贝叶斯推断中使用测试时间训练归一化流的方法,通过对抗分布偏移提升参数推断的实时调整能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06424 2026-01-13 cs.CL 79%

Can a Unimodal Language Agent Provide Preferences to Tune a Multimodal Vision-Language Model?

单模语言代理能否为调整多模态视觉-语言模型提供偏好?

Sazia Tabasum Mim, Jack Morris, Manish Dhakal, Yanming Xiu, Maria Gorlatova, Yi Ding

机构 * Georgia State University(佐治亚州立大学) Duke University(杜克大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本文提出通过单模语言代理提供偏好反馈,提升多模态视觉-语言模型的描述能力,实验显示在准确率上提升13%,且人类偏好匹配率达64.6%。

Comments Accepted to IJCNLP-AACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06112 2026-01-13 cs.AI 79%

ReliabilityBench: Evaluating LLM Agent Reliability Under Production-Like Stress Conditions

ReliabilityBench: 评估LLM代理在生产类压力条件下可靠性

Aayush Gupta

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 ReliabilityBench通过评估LLM代理在生产类压力条件下的可靠性,提出统一的可靠性表面和动作元关系,评估不同模型和架构的可靠性表现。

Comments 18 pages, 5 figures, 8 tables. Evaluates ReAct vs Reflexion across four tool-using domains with perturbation (epsilon) and fault-injection (lambda) stress testing; 1,280 total episodes

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04288 2026-01-13 cs.HC cs.LG cs.MA 79%

Human-in-the-Loop Testing of AI Agents for Air Traffic Control with a Regulated Assessment Framework

有人参与的AI空中交通管制代理评估框架

Ben Carvell, Marc Thomas, Andrew Pace, Christopher Dorney, George De Ath, Richard Everson, Nick Pepper, Adam Keane, Samuel Tomlinson, Richard Cannon

机构 * NATS University of Exeter(埃克塞特大学) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 Agent评测 :AI agent(title,abstract);分类 cs.LG

AI总结 本文提出了一种基于监管认证模拟器的AI空中交通管制代理评估框架,通过人类参与评估提升AI性能测量的真实性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07763 2026-01-13 cs.GT 78%

Structural Approach to Guiding a Present-Biased Agent

结构化方法用于引导现时偏好代理

Tatiana Belova, Yuriy Dementiev, Artur Ignatiev, Danil Sagunov

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出了一种结构化方法,用于引导现时偏好代理,通过参数化算法分析任务图的计算复杂性,并给出了固定参数可 tractable 算法。

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06920 2026-01-13 cs.NE cs.MA 78%

Calibrating Agent-Based Financial Markets Simulators with Pretrainable Automatic Posterior Transformation-Based Surrogates

基于可预训练的自动后验变换的代理基于金融市场模拟器校准

Boquan Jiang, Zhenhua Yang, Chenkai Wang, Muyao Zhong, Heping Fang, Peng Yang

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出ANTR方法,通过可预训练的神经密度估计器和自适应信任区域策略,提升代理基于金融市场模拟器的校准精度和效率。

Comments 32 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06216 2026-01-13 cs.CY cs.AI 77%

LLM Agents in Law: Taxonomy, Applications, and Challenges

法律中的LLM代理:分类、应用与挑战

Shuang Liu, Ruijia Zhang, Ruoyun Ma, Yujia Deng, Lanyi Zhu, Jiayu Li, Zelong Li, Zhibin Shen, Mengnan Du

机构 * Carnegie Mellon University(卡内基梅隆大学) National University of Singapore(国立新加坡大学) Stanford University(斯坦福大学) University of Washington(华盛顿大学) The University of Chicago(芝加哥大学) Rutgers University(罗格斯大学) Columbia University(哥伦比亚大学) New Jersey Institute of Technology(新泽西理工学院)

专题命中 Agent评测 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.AI

AI总结 本文探讨了法律领域中LLM代理的分类、应用及挑战,分析了技术转变、应用分类、评估方法及未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07606 2026-01-13 cs.CL cs.AI 73%

Proof of Time: A Benchmark for Evaluating Scientific Idea Judgments

证明时间:评估科学思想判断的基准

Bingyang Ye, Shan Chen, Jingxuan Tu, Chen Liu, Zidi Xiong, Samuel Schmidgall, Danielle S. Bitterman

机构 * Harvard University(哈佛大学) Mass General Brigham(麻省总医院) Boston Children’s Hospital(波士顿儿童医院) Brandeis University(布兰迪大学) Yale University(耶鲁大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 Agent评测 :agent(abstract);tool use(abstract);分类 cs.AI、cs.CL

AI总结 PoT通过半可验证的基准框架评估科学思想判断,利用时间分区和未来可验证的目标,结合离线沙盒实现可扩展的评估。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07403 2026-01-13 cs.CL 70%

LongEmotion: Measuring Emotional Intelligence of Large Language Models in Long-Context Interaction

LongEmotion: 测量大语言模型在长上下文交互中的情感智能

Weichu Liu, Jing Xiong, Yuxuan Hu, Zixuan Li, Minghuan Tan, Ningning Mao, Hui Shen, Wendong Xu, Chaofan Tao, Min Yang, Chengming Li, Lingpeng Kong, Ngai Wong

机构 * Shenzhen MSU-BIT University(深圳MSU-BIT大学) The University of Hong Kong(香港大学) City University of Hong Kong(香港城市大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) Beijing Normal University(北京师范大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 LongEmotion是一个评估大语言模型在长上下文交互中情感智能的基准,通过多任务和协作框架提升模型在情绪识别与共情生成中的表现。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06838 2026-01-13 cs.CR cs.SE 70%

CHASE: LLM Agents for Dissecting Malicious PyPI Packages

CHASE:用于拆解恶意PyPI包的LLM代理

Takaaki Toda, Tatsuya Mori

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.SE

AI总结 CHASE通过多代理架构提升恶意PyPI包检测的可靠性,实现高召回率与低误报率。

Comments Accepted for publication and presented at the 2nd IEEE International Conference on AI-powered Software (AIware 2025). 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07484 2026-01-13 cs.GR 67%

R3-RECON: Radiance-Field-Free Active Reconstruction via Renderability

R3-RECON:通过可渲染性进行无辐射场主动重建

Xiaofeng Jin, Matteo Frosi, Yiran Guo, Matteo Matteucci

专题命中 Agent评测 :agent(abstract);planning(abstract)

AI总结 R3-RECON通过无辐射场的可渲染性场实现高效主动重建,提升新视角质量和3DGS重建精度。

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01592 2026-01-13 cs.CR cs.CV 67%

OpenRT: An Open-Source Red Teaming Framework for Multimodal LLMs

OpenRT: 一种用于多模态大语言模型的开源红队框架

Xin Wang, Yunhao Chen, Juncheng Li, Yixu Wang, Yang Yao, Tianle Gu, Jie Li, Yan Teng, Yingchun Wang, Xia Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 OpenRT框架通过模块化设计和高吞吐量运行时,系统性评估多模态大语言模型的安全性,揭示了前沿模型在复杂攻击下的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06636 2026-01-13 cs.CL cs.AI 62%

MedEinst: Benchmarking the Einstellung Effect in Medical LLMs through Counterfactual Differential Diagnosis

MedEinst:通过反事实差异诊断基准测试医疗大语言模型中的Einstellung效应

Wenting Chen, Zhongrui Zhu, Guolin Huang, Wenxuan Wang

机构 * Stanford University(斯坦福大学) Xi’an Jiaotong University(西安交通大学) Shenzhen University(深圳大学) Renmin University of China(中国人民大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 MedEinst通过反事实差异诊断基准测试,揭示医疗大语言模型中的Einstellung效应,并提出ECR-Agent提升循证医学标准。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07395 2026-01-13 cs.CR cs.AI 57%

MCP-ITP: An Automated Framework for Implicit Tool Poisoning in MCP

MCP-ITP:一种用于MCP中隐式工具中毒的自动化框架

Ruiqi Li, Zhiqiang Wang, Yunhao Yao, Xiang-Yang Li

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 MCP-ITP是一种用于MCP中隐式工具中毒的自动化框架,通过黑箱优化策略提升攻击成功率并规避检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02598 2026-01-13 cs.DL cs.AI 57%

LongDA: Benchmarking LLM Agents for Long-Document Data Analysis

LongDA:评估基于LLM的代理在长文档数据分析中的基准测试

Yiyang Li, Zheyuan Zhang, Tianyi Ma, Zehong Wang, Keerthiram Murugesan, Chuxu Zhang, Yanfang Ye

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 LongDA通过评估基于LLM的代理在长文档数据分析中的性能,揭示了现有模型在处理复杂任务时的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06361 2026-01-13 cs.MA cs.AI cs.GT 57%

A Graph-Theoretical Perspective on Law Design for Multiagent Systems

多智能体系统的法律设计图论视角

Qi Shi, Pavel Naumov

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文从图论角度研究多智能体系统中法律设计问题,提出两种法律类型并证明其最小化问题的计算复杂性,同时利用超图顶点覆盖的近似算法进行高效近似。

Comments The 40th AAAI Conference on Artificial Intelligence (AAAI-26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02225 2026-01-13 cs.LG 57%

Metric Design != Metric Behavior: Improving Metric Selection for the Unbiased Evaluation of Dimensionality Reduction

度量设计不等于度量行为:改进无偏评估降维的度量选择

Jiyeon Bae, Hyeon Jeon, Jinwook Seo

机构 * Seoul National University(首尔国立大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 本文提出了一种基于度量相关性聚类的工作流程,以减少降维评估中的偏差,提高评估的稳定性。

Comments IEEE VIS 2025 (short paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06027 2026-01-13 cs.HC cs.AI cs.CE cs.IR cs.PL 57%

AI-Assisted Authoring for Transparent, Data-Driven Documents

辅助作者生成透明、数据驱动的文档

Alfonso Piscitelli, Cristina David, Mattia De Rosa, Ali Mohammed, Federico Nanni, Jacob Pake, Roly Perera, Jessy Sodimu, Chenyiqiu Zheng

机构 * University of Salerno(萨勒诺大学) University of Bristol(布里斯托大学) Manchester Metropolitan University(曼彻斯特 Metropolitan 大学) The Alan Turing Institute(艾伦·图灵研究所) University of Kent(肯特大学) University of Cambridge(剑桥大学) University of Bath(巴斯大学) University College London(伦敦大学学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种基于大语言模型的工具,用于生成透明、数据驱动的文档,通过交互式数据溯源技术增强学术文章的可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07278 2026-01-13 cs.AI 57%

Lifelong Learning of Large Language Model based Agents: A Roadmap

基于大语言模型代理的终身学习:路线图

Junhao Zheng, Chengming Shi, Xidi Cai, Qiuke Li, Duzhen Zhang, Chenxing Li, Dong Yu, Qianli Ma

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种基于大语言模型代理的终身学习框架,通过三个模块整合多模态输入、知识存储与动态环境交互,以实现持续适应和长期性能提升。

Comments Accepted to IEEE TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07523 2026-01-13 cs.IT math.IT 50%

Sparse Point-wise Privacy Leakage: Mechanism Design and Fundamental Limits

稀疏点隐私泄露:机制设计与基本限制

Amirreza Zamani, Sajad Daei, Parastoo Sadeghi, Mikael Skoglund

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了稀疏点隐私泄露机制设计问题,提出了一种基于信息几何的二次近似方法,并通过凸半正定规划松弛解决NP难问题,同时确定了稀疏最优的阈值条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07402 2026-01-13 cs.CR 50%

Peacock: UEFI Firmware Runtime Observability Layer for Detection and Response

Peacock:用于检测和响应的UEFI固件运行时可观察性层

Hadar Cochavi Gorelik, Orel Fadlon, Denis Klimov, Oleg Brodt, Asaf Shabtai, Yuval Elovici

专题命中 Agent评测 :agent(abstract)

AI总结 Peacock通过模块化框架实现UEFI启动过程的完整性保证监控和远程验证,有效检测多种现实中的固件启动套件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07001 2026-01-13 cs.CV 50%

Spatial Multi-Task Learning for Breast Cancer Molecular Subtype Prediction from Single-Phase DCE-MRI

空间多任务学习用于从单相DCE-MRI预测乳腺癌分子亚型

Sen Zeng, Hong Zhou, Zheng Zhu, Yang Liu

机构 * Tsinghua University(清华大学) Southwest Forestry University(西南林业大学) GigaAI KCL

专题命中 Agent评测 :agent(abstract)

AI总结 本研究提出空间多任务学习框架,利用单相DCE-MRI实现乳腺癌分子亚型的非侵入性预测,通过多任务学习提升ER、PR、HER2及Ki-67的预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏