arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-01-27 至 2026-01-27 共收录 34 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 34 篇

2601.01126 2026-01-27 cs.CL 89%

RoboPhD: Self-Improving Text-to-SQL Through Autonomous Agent Evolution

RoboPhD:通过自主代理进化实现自我改进的文本到SQL系统

Andrew Borthwick, Stephen Ash

机构 * Independent Researchers(独立研究者)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(title);AI agent(abstract);agentic(abstract)

AI总结 RoboPhD通过自主进化代理提升文本到SQL性能,无需外部指导,在低成本模型上实现显著改进。

Comments 18 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22846 2026-01-27 cs.LG cs.AI cs.LO cs.SE 88%

RocqStar: Leveraging Similarity-driven Retrieval and Agentic Systems for Rocq generation

RocqStar: 利用相似性驱动检索与智能体系统进行Rocq生成

Andrei Kozyrev, Nikita Khramov, Gleb Solovev, Anton Podkopaev

机构 * JetBrains Research(JetBrains研究)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 RocqStar通过结合相似性驱动检索和智能体系统,显著提升Rocq证明生成的性能和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02567 2026-01-27 cs.AI cs.LG 86%

Agentic Additive Manufacturing Alloy Evaluation

代理式增材制造合金评估

Peter Pak, Achuth Chandrasekhar, Amir Barati Farimani

机构 * Department of Mechanical Engineering, Carnegie Mellon University, Pittsburgh, PA, USA(机械工程系,卡内基梅隆大学,匹兹堡,PA,USA)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用LLM赋能的多代理系统,自动化加速增材制造合金的评估,通过智能工具调用实现热物理性质计算和工艺窗口分析。

Journal ref Additive Manufacturing Letters, Vol. 17, January 2026, Article 100355

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17920 2026-01-27 cs.AI 85%

Agentic AI for Self-Driving Laboratories in Soft Matter: Taxonomy, Benchmarks,and Open Challenges

代理AI在软物质中的自主实验室:分类、基准和开放挑战

Xuanzhou Chen, Audrey Wang, Stanley Yin, Hanyang Jiang, Dong Zhang

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract);分类 cs.AI

AI总结 本文探讨了自主实验室在软物质中的应用,提出了基于智能体的环境交互框架,回顾了闭环实验的主要方法,并指出了多模态表示、校准不确定性、安全探索和共享基准基础设施等开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17168 2026-01-27 cs.AI cs.MA 85%

Interpreting Agentic Systems: Beyond Model Explanations to System-Level Accountability

解释代理系统:超越模型解释到系统级问责

Judy Zhu, Dhari Gandhi, Himanshu Joshi, Ahmad Rezaie Mianroodi, Sedef Akinli Kocak, Dhanesh Ramachandran

机构 * Vector Institute for Artificial Intelligence(向量人工智能研究所) University of Texas, Austin(德克萨斯大学奥斯汀分校) Dalhousie University(达尔豪斯大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract);分类 cs.AI

AI总结 本文探讨了代理系统中可解释性技术的必要性,提出需设计专门方法以确保系统在目标形成、环境交互和结果评估等阶段的可追溯性和问责性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17879 2026-01-27 cs.CL cs.AI cs.IR 81%

Self-Manager: Parallel Agent Loop for Long-form Deep Research

自管理:用于长篇深度研究的并行代理循环

Yilong Xu, Zhi Zheng, Xiang Long, Yujun Cai, Yiwei Wang

机构 * University of Chinese Academy of Sciences(中国科学院大学) ModelBest Inc.(ModelBest公司) University of Queensland(昆士兰大学) University of California Merced(加州大学默塞德分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 Self-Manager通过并行代理循环提升长篇深度研究的效率和灵活性,实现异步执行和上下文隔离,优于现有单代理方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08996 2026-01-27 cs.SE cs.AI 81%

Saving SWE-Bench: A Benchmark Mutation Approach for Realistic Agent Evaluation

保存SWE-Bench:一种用于现实代理评估的基准突变方法

Spandan Garg, Benjamin Steenhoek, Yufan Huang

机构 * Microsoft(微软)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本文提出一种基准突变方法,通过分析开发者与聊天代理的互动模式,将现有基准转化为现实用户查询,揭示现有基准对代理能力的高估问题。

Comments Accepted at CAIN 2026 (Research Track). Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17173 2026-01-27 cs.CL cs.AI 79%

Beyond Factual QA: Mentorship-Oriented Question Answering over Long-Form Multilingual Content

超越事实问答:面向长形式多语言内容的指导型问答

Parth Bhalerao, Diola Dsouza, Ruiwen Guan, Oana Ignat

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出MentorQA,首个多语言长形式视频指导型问答数据集和评估框架,通过对比不同架构发现Multi-Agent在复杂和低资源语言中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17058 2026-01-27 cs.DB cs.AI cs.CL cs.LG 75%

Can LLMs Clean Up Your Mess? A Survey of Application-Ready Data Preparation with LLMs

大模型能帮你清理数据吗?基于大模型的应用级数据准备综述

Wei Zhou, Jun Zhou, Haoyu Wang, Zhenghao Li, Qikang He, Shaokun Han, Guoliang Li, Xuanhe Zhou, Yeye He, Chunwei Liu, Zirui Tang, Bin Wang, Shen Tang, Kai Zuo, Yuyu Luo, Zhenzhe Zheng, Conghui He, Jingren Zhou, Fan Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Microsoft Research(微软研究院) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Shanghai AI Laboratory(上海人工智能实验室) Xiaohongshu Inc.(小红书公司) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Alibaba Group(阿里巴巴集团)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文综述了基于大语言模型的应用级数据准备方法,探讨了数据清洗、整合与丰富三大任务的技术、优势与局限,并提出了可扩展的大语言模型-数据系统和稳健评估协议的未来研究方向。

Comments Please refer to our repository for more details: https://github.com/weAIDB/awesome-data-llm

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18225 2026-01-27 cs.AI 74%

ShopSimulator: Evaluating and Exploring RL-Driven LLM Agent for Shopping Assistants

ShopSimulator: 评估和探索基于强化学习的LLM代理用于购物助手

Pei Wang, Yanan Wu, Xiaoshuai Song, Weixun Wang, Gengru Chen, Zhongwen Li, Kezhong Yan, Ken Deng, Qi Liu, Shuaibing Zhao, Shaopan Xiong, Xuepeng Liu, Xuefeng Chen, Wanxi Deng, Wenbo Su, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 本文提出ShopSimulator,一个大规模中文购物环境,用于评估和探索基于强化学习的LLM代理在购物助手中的性能和改进方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00435 2026-01-27 cs.AI cs.HC cs.RO 74%

Towards Real-time Adaptation of Embodied Agent in Human-Robot Collaboration

面向人机协作中具身代理的实时适应

Shipeng Liu, Boshen Zhang, Zhehui Huang

机构 * University of Southern California Department of Electrical(南加州大学电气与计算机工程系) University of Southern California Department of Computer Science Los Angeles CA USA(南加州大学计算机科学系洛杉矶加州美国) University of Southern California(南加州大学)

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 本文提出MonTA框架,通过轻量级监控和高效适配器提升人机协作中具身代理的实时适应能力,实现更高效的协作性能。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17191 2026-01-27 cs.CV cs.CL 74%

VaseVQA: Multimodal Agent and Benchmark for Ancient Greek Pottery

VaseVQA: 古代希腊陶器的多模态代理与基准

Jinchao Ge, Tengfei Cheng, Biao Wu, Zeyu Zhang, Shiya Huang, Judith Bishop, Gillian Shepherd, Meng Fang, Ling Chen, Yang Zhao

机构 * University of Adelaide(阿德莱德大学) University of Liverpool(利物浦大学) University of Technology Sydney(悉尼技术大学) The Australian National University(澳大利亚国立大学) La Trobe University(拉特罗布大学)

专题命中 Agent评测 :agent(title);分类 cs.CL

AI总结 VaseVQA通过引入VaseVL强化学习方法,提升对古代希腊陶器的多模态推理能力,尤其在复杂推理任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08235 2026-01-27 cs.AI cs.CL 73%

MPCI-Bench: A Benchmark for Multimodal Pairwise Contextual Integrity Evaluation of Language Model Agents

MPCI-Bench: 一种用于语言模型代理多模态成对情境完整性评估的基准

Shouju Wang, Haopeng Zhang

机构 * University of Hawaii at Manoa(夏威夷大学曼瑙分校)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 MPCI-Bench是首个用于评估语言模型代理多模态情境完整性隐私行为的基准,揭示了现有模型在隐私与效用平衡及模态泄漏方面的系统性失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04663 2026-01-27 cs.CL cs.LG cs.MA 73%

Debate, Deliberate, Decide (D3): A Cost-Aware Adversarial Framework for Reliable and Interpretable LLM Evaluation

辩论、 deliberative、决定(D3):一种成本意识的对抗框架,用于可靠且可解释的LLM评估

Abir Harrasse, Chaithanya Bandi, Hari Bandi

机构 * Martian NUS(新加坡国立大学) MIT(麻省理工学院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL、cs.LG

AI总结 D3是一种通过结构化辩论和聚合机制提升LLM评估可靠性和可解释性的对抗框架,通过预算停止机制优化成本效率。

Journal ref EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17722 2026-01-27 cs.AI 70%

EntWorld: A Holistic Environment and Benchmark for Verifiable Enterprise GUI Agents

EntWorld: 一个综合环境和基准,用于可验证的企业GUI代理

Ying Mo, Yu Bai, Dapeng Sun, Yuqian Shi, Yukai Miao, Li Chen, Dan Li

机构 * Zhongguancun Laboratory(中关村实验室) Tsinghua University(清华大学)

专题命中 Agent评测 :planning(abstract);agentic(abstract);分类 cs.AI

AI总结 EntWorld是一个综合的企业GUI代理基准,通过基于模式的任务生成和SQL验证机制,评估代理在企业环境中的表现,揭示当前代理能力的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17344 2026-01-27 cs.CL 70%

The Shadow Self: Intrinsic Value Misalignment in Large Language Model Agents

阴影自我:大型语言模型代理中的内在价值偏差

Chen Chen, Kim Young Il, Yuan Yang, Wenhao Su, Yilin Zhang, Xueluan Gong, Qian Wang, Yongsen Zheng, Ziyao Liu, Kwok-Yan Lam

机构 * Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 研究提出IMPRESS框架,系统评估大型语言模型代理中的内在价值偏差风险,发现其在不同模型中普遍存在,且受上下文化和框架机制显著影响。

Comments 21 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01993 2026-01-27 cs.AI 70%

Towards Privacy-Preserving Mental Health Support with Large Language Models

面向隐私保护的大型语言模型在心理健康支持中的应用

Dong Xue, Jicheng Tu, Ming Wang, Xin Yan, Fangzhou Liu, Jie Hu

机构 * IEEE

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出MindChat和MindCorpus,通过多智能体角色扮演框架生成高质量咨询数据,结合联邦学习和差分隐私优化,实现隐私保护的高效心理健康支持系统。

Comments 15 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09493 2026-01-27 cs.IR 67%

Evaluating Conversational Recommender Systems via Large Language Models: A User-Centric Framework

通过大语言模型评估对话推荐系统:一种以用户为中心的框架

Nuo Chen, Quanyu Dai, Xiaoyu Dong, Piaohong Wang, Qinglin Jia, Zhaocheng Du, Zhenhua Dong, Xiao-Ming Wu

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本文提出CoRE框架,通过大语言模型评估对话推荐系统,结合用户评价和多代理辩论,提升用户体验评估的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17588 2026-01-27 cs.AI cs.CL 62%

Intelligence Requires Grounding But Not Embodiment

智能需要具身但不需要身体

Marcus Ma, Shrikanth Narayanan

机构 * University of Southern California(南加州大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出智能需要基础性而非具身,通过定义智能的四个属性并论证非具身智能体可实现这些属性,从而得出结论:基础性是智能的必要条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09715 2026-01-27 cs.CL cs.AI cs.HC cs.IR 62%

Introducing Axlerod: An LLM-based Chatbot for Assisting Independent Insurance Agents

引入Axlerod:一种基于大语言模型的聊天机器人,用于协助独立保险代理

Adam Bradley, John Hastings, Khandaker Mamun Ahmed

机构 * The Beacom College of Computer and Cyber Sciences, Dakota State University(计算机与网络安全学院,达科他州立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 Axlerod是一种基于大语言模型的聊天机器人,旨在通过自然语言处理、检索增强生成和领域知识整合,提高独立保险代理的工作效率。

Comments 6 pages, 2 figures, 1 table

Journal ref 2025 IEEE Cyber Awareness and Research Symposium (CARS'25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10994 2026-01-27 cs.CL cs.AI 62%

Deep Research with Open-Domain Evaluation and Multi-Stage Guardrails for Safety

基于开放领域评估和多阶段防护机制的深度研究

Wei-Chieh Huang, Henry Peng Zou, Yaozu Wu, Dongyuan Li, Yankai Chen, Weizhi Zhang, Yangning Li, Angelo Zangari, Jizhou Guo, Chunyu Miao, Liancheng Fang, Langzhou He, Yinghui Li, Renhe Jiang, Philip S. Yu

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.CL

AI总结 本文提出DeepResearchGuard和DRSafeBench,通过开放领域评估和多阶段防护机制提升深度研究的安全性和报告质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18754 2026-01-27 cs.CR cs.AI 57%

$α^3$-SecBench: A Large-Scale Evaluation Suite of Security, Resilience, and Trust for LLM-based UAV Agents over 6G Networks

$α^3$-SecBench:一个大规模评估套件,用于评估基于LLM的无人机代理在6G网络中的安全、韧性与信任

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, College of Information Technology, United Arab Emirates University(计算机与网络工程系,信息科技学院,阿拉伯联合酋长国大学) Khalifa University of Science and Technology(科学与技术喀拉奇大学)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 $α^3$-SecBench通过大规模评估基于LLM的无人机代理在6G网络中的安全、韧性和信任,揭示了现有模型在对抗环境下的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13588 2026-01-27 cs.AI cs.CE cs.CY 57%

CoBRA: Programming Cognitive Bias in Social Agents Using Classic Social Science Experiments

CoBRA:利用经典社会科学实验编程社会代理中的认知偏差

Xuan Liu, Haoyang Shang, Haojian Jin

机构 * University of California San Diego(加州大学圣地亚哥分校) Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 CoBRA通过经典社会科学实验设计,为社会代理提供了一种可编程的认知偏差控制方法,实现一致的行为模拟与可重用的AI训练环境。

Comments CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17596 2026-01-27 cs.CL 57%

Learning to Ideate for Machine Learning Engineering Agents

为机器学习工程代理学习创意

Yunxiang Zhang, Kang Zhou, Zhichao Xu, Kiran Ramnath, Yun Zhou, Sangmin Woo, Haibo Ding, Lin Lee Cheong

机构 * AWS AI Labs(AWS人工智能实验室) University of Michigan(密歇根大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出MLE-Ideator双代理框架,通过强化学习训练生成更有效的创意,显著提升机器学习工程代理的性能。

Comments EACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17335 2026-01-27 cs.AI 57%

The Relativity of AGI: Distributional Axioms, Fragility, and Undecidability

AGI的相对性:分布公理、脆弱性与不可判定性

Angshul Majumdar

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文研究了AGI的理论定义问题,证明其泛化本质为关系性,且无法通过计算过程可靠认证,指出强AGI主张在无明确索引时是未定义的。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18587 2026-01-27 stat.ME stat.AP 50%

Vaccine Efficacy Estimands Implied by Common Estimators Used in Individual Randomized Field Trials

由个体随机现场试验中常用估计器隐含的疫苗效力估计量

Michael P. Fay, Dean Follmann, Bruce J. Swihart, Lauren E. Dang

专题命中 Agent评测 :agent(abstract)

AI总结 本文探讨了个体随机现场试验中常用估计器隐含的疫苗效力估计量,分析了其在不同时间点的解释困难及敏感性分析方法。

Comments 28 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18416 2026-01-27 physics.chem-ph 50%

Refinement and Performance Benchmark for Range-Separated Water Force Field

范围分离水力场的改进与性能基准

Qian Gao, Junmin Chen, Kuang Yu

专题命中 Agent评测 :workflow(abstract)

AI总结 本文改进了范围分离水力场,通过新训练流程提升稳定性,实现亚化学精度并展现先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18263 2026-01-27 cs.CV 50%

Revisiting Aerial Scene Classification on the AID Benchmark

重新审视AID基准上的空域场景分类

Subhajeet Das, Susmita Ghosh, Abhiroop Chatterjee

专题命中 Agent评测 :planning(abstract)

AI总结 本文提出Aerial-Y-Net模型,通过多尺度特征融合和空间注意力机制,在AID数据集上实现91.72%的分类准确率,优于现有方法。

Comments Presented at the IEEE India Geoscience and Remote Sensing Symposium 2025 and accepted for publication in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19233 2026-01-27 cs.NI 50%

An O-RAN Framework for AI/ML-Based Localization with OpenAirInterface and FlexRIC

面向AI/ML定位的O-RAN框架:结合OpenAirInterface和FlexRIC

Nada Bouknana, Mohsen Ahadi, Florian Kaltenberger, Robert Schmidt

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种基于O-RAN框架的AI/ML定位方案,利用OpenAirInterface和FlexRIC实现实时定位,验证了其在真实环境中的可行性。

Comments to be published in Proceedings of the Wireless On-demand Network systems and Services conference, 2-4 March 2026, Crans-Montana, Switzerland (WONS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09965 2026-01-27 cs.DS 50%

Seat Arrangement Problems under B-utility and W-utility

在B效用和W效用下的座位安排问题

José Rodríguez

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出B效用和W效用模型,研究在考虑一维偏好下座位安排问题的算法与复杂性。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏