arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-01-09 至 2026-01-09 共收录 19 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 19 篇

2601.04790 2026-01-09 cs.CL cs.AI 88%

Belief in Authority: Impact of Authority in Multi-Agent Evaluation Framework

权威信念:权威在多智能体评估框架中的影响

Junhyuk Choi, Jeongyoun Kwon, Heeju Kim, Haeun Cho, Hayeong Jung, Sehee Min, Bugeun Kim

机构 * Chung-Ang University(Chung-Ang 大学)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文研究了权威角色在多智能体评估中的影响,发现专家和参照角色比合法角色更具影响力,并揭示了权威偏见的产生机制。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04879 2026-01-09 cs.CL 85%

Mind2Report: A Cognitive Deep Research Agent for Expert-Level Commercial Report Synthesis

Mind2Report: 一种用于专家级商业报告综合的认知深度研究代理

Mingyue Cheng, Daoyu Wang, Qi Liu, Shuo Yu, Xiaoyu Tao, Yuqian Wang, Chengzhong Chu, Yu Duan, Mingkang Long, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) Artificial Intelligence Engineering Institute, iFLYTEK Co., Ltd(人工智能工程院,iFLYTEK公司)

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);agentic(abstract);分类 cs.CL

AI总结 Mind2Report是一种通过动态内存增强大语言模型,实现专家级商业报告综合的认知深度研究代理,优于现有基线模型。

Comments 26 Pages, 9 Figures, 7 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04583 2026-01-09 cs.AI cs.MA 85%

Autonomous Agents on Blockchains: Standards, Execution Models, and Trust Boundaries

区块链上的自主代理:标准、执行模型与信任边界

Saad Alqithami

机构 * Saad Alqithami(萨德·阿利萨米)

专题命中 Agent评测 :autonomous agent(title);agent(abstract);agentic(abstract);multi-agent(abstract)

AI总结 本文系统梳理了区块链与自主代理的互操作性领域,提出了五类整合模式、定制化的威胁模型和能力矩阵,并提出了研究路线图和评估套件,旨在提升链上执行的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07505 2026-01-09 cs.LG 83%

PEAR: Planner-Executor Agent Robustness Benchmark

PEAR:规划-执行代理鲁棒性基准

Shen Dong, Mingxuan Zhang, Pengfei He, Li Ma, Bhavani Thuraisingham, Hui Liu, Yue Xing

机构 * Michigan State University(密歇根州立大学) Purdue University(普渡大学) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.LG

AI总结 PEAR基准通过评估规划-执行多智能体系统的鲁棒性,揭示了规划器弱点对任务性能的影响及鲁棒性与性能的权衡。

Comments arXiv admin note: This submission has been withdrawn by arXiv administrators due to incorrect authorship. Author list truncated

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05101 2026-01-09 cs.AI 81%

Arabic Prompts with English Tools: A Benchmark

阿拉伯提示与英语工具:一个基准

Konstantin Kubrak, Ahmed El-Moselhy, Ammar Alsulami, Remaz Altuwaim, Hassan Ismail Fawaz, Faisal Alsaby

专题命中 Agent评测 :AI agent(abstract);autonomous agent(abstract);tool-use(abstract);agentic(abstract)

AI总结 本文提出首个阿拉伯语言LLMs工具调用能力评估基准,揭示阿拉伯语交互环境下工具调用准确率下降5-10%的显著差距。

Comments 10 pages, 10 figures, LLMs, Big Data, and Multilinguality for All (LLMs4All) Workshop at IEEE BigData 2025 Conference, Macau, December 10, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04794 2026-01-09 cs.AI 79%

APEX: Academic Poster Editing Agentic Expert

APEX:学术海报编辑智能专家

Chengxin Shi, Qinnan Cai, Zeyuan Chen, Long Zeng, Yibo Zhao, Jing Yu, Jianxiang Yu, Xiang Li

机构 * School of Data Science and Engineering, East China Normal University(数据科学与工程学院,东华大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 APEX是首个交互式学术海报编辑框架,通过多级API和审查机制实现细粒度控制,并引入首个系统性基准APEX-Bench评估编辑效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04556 2026-01-09 cs.SE 79%

4D-ARE: Bridging the Attribution Gap in LLM Agent Requirements Engineering

4D-ARE:弥合LLM代理需求工程中的归因差距

Bo Yu, Lei Zhao

专题命中 Agent评测 :agent(title,abstract);分类 cs.SE

AI总结 4D-ARE提出一种四维归因驱动代理需求工程方法,解决代理应推理什么的问题,补充运行时推理框架如何推理的不足。

Comments 39 pages, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04554 2026-01-09 cs.IR 78%

Exploring Recommender System Evaluation: A Multi-Modal User Agent Framework for A/B Testing

探索推荐系统评估:一种用于A/B测试的多模态用户代理框架

Wenlin Zhang, Xiangyang Li, Qiyuan Ge, Kuicai Dong, Pengyue Jia, Xiaopeng Li, Zijian Zhang, Maolin Wang, Yichao Wang, Huifeng Guo, Ruiming Tang, Xiangyu Zhao

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出一种多模态用户代理框架,用于替代传统A/B测试,通过模拟真实用户行为提升推荐系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04692 2026-01-09 cs.CL cs.CV 74%

See, Explain, and Intervene: A Few-Shot Multimodal Agent Framework for Hateful Meme Moderation

见、解释与干预:一种少样本多模态代理框架用于仇恨表情包审查

Naquee Rizwan, Subhankar Swain, Paramananda Bhaskar, Gagan Aryan, Shehryaar Shah Khan, Animesh Mukherjee

机构 * Indian Institute of Technology (IIT), Kharagpur(印度理工学院(IIT)Khargpur分校) Simbian

专题命中 Agent评测 :agent(title);分类 cs.CL

AI总结 本文提出了一种少样本多模态代理框架,用于在有限数据条件下实现通用仇恨表情包审查,通过检测、解释和干预三方面提升审查效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10991 2026-01-09 cs.CR cs.AI 74%

MCP-Guard: A Multi-Stage Defense-in-Depth Framework for Securing Model Context Protocol in Agentic AI

MCP-Guard: 一种多阶段纵深防御框架,用于保障代理AI中的模型上下文协议安全

Wenpeng Xing, Zhonghao Qi, Yupeng Qin, Yilin Li, Caini Chang, Jiahui Yu, Changting Lin, Zhenzhen Xie, Meng Han

机构 * Zhejiang University(浙江大学) Binjiang Institute of Zhejiang University(浙江大学滨江研究院) The Chinese University of Hong Kong(香港中文大学) Shandong University(山东大学)

专题命中 Agent评测 :agentic(title);分类 cs.AI

AI总结 MCP-Guard通过多阶段防御框架提升LLM与工具交互的安全性,利用E5模型和仲裁器实现高准确率的对抗性提示检测,并通过MCP-ATTACKBENCH验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04235 2026-01-09 cs.AI 70%

Actively Obtaining Environmental Feedback for Autonomous Action Evaluation Without Predefined Measurements

主动获取环境反馈以实现自主行动评估而无需预定义测量

Hong Su

机构 * School of Computer Science, Chengdu University of Information Technology(计算机学院,成都信息科技大學)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出一种主动反馈获取模型,通过自主探索环境差异来识别未预定义的反馈,提升智能体在动态环境中的行动评估效率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04196 2026-01-09 cs.CL cs.IR 70%

RAGVUE: A Diagnostic View for Explainable and Automated Evaluation of Retrieval-Augmented Generation

RAGVUE:一种用于可解释和自动评估检索增强生成的诊断视图

Keerthana Murugaraj, Salima Lamsiyah, Martin Theobald

机构 * University of Luxembourg(卢森堡大学)

专题命中 Agent评测 :workflow(abstract);agentic(abstract);分类 cs.CL

AI总结 RAGVUE通过分解RAG行为并提供结构化解释,实现无参考的自动评估,揭示RAG流程中的细粒度失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00826 2026-01-09 cs.CY 67%

Digital Homunculi and Institutional Design: Breaking Through the Experimentation Bottleneck

数字人偶与制度设计:突破实验瓶颈

Petr Specian

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本文提出利用生成式AI驱动的数字人偶方法,通过模拟人类行为生成合成数据,以突破民主研究中的实验瓶颈,提升制度创新的效率与可行性。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01802 2026-01-09 cs.AI 57%

PsychEval: A Multi-Session and Multi-Therapy Benchmark for High-Realism AI Psychological Counselor

PsychEval: 一个多会话和多疗法的基准,用于高真实感的AI心理顾问

Qianjun Pan, Junyi Wang, Jie Zhou, Yutao Yang, Junsong Li, Kaiyin Xu, Yougen Zhou, Yihan Li, Jingyuan Zhao, Qin Chen, Ningning Zhou, Kai Chen, Liang He

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Shanghai AI Laboratory(上海人工智能实验室) School of Psychology and Cognitive Science, East China Normal University(东华大学心理学与认知科学学院)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 PsychEval是一个多会话和多疗法的基准,用于评估高真实感的AI心理顾问,通过多阶段数据集和全面评估框架提升AI在心理咨询服务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03508 2026-01-09 cs.CL 57%

One Battle After Another: Probing LLMs' Limits on Multi-Turn Instruction Following with a Benchmark Evolving Framework

一战接一战:通过一个演进框架探测LLMs在多轮指令遵循中的极限

Qi Jia, Ye Shen, Xiujie Song, Kaiwei Zhang, Shibo Wang, Dun Pei, Xiangyang Zhu, Guangtao Zhai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Jilin University(吉林大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出EvolIF演进框架,通过多轮对话测试LLMs的指令遵循能力,揭示失败恢复和细粒度指令遵循的不足,GPT-5在鲁棒性上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19850 2026-01-09 cs.CV 50%

FALCONEye: Finding Answers and Localizing Content in ONE-hour-long videos with multi-modal LLMs

FALCONEye: 在一小时内视频中寻找答案并定位内容的多模态大语言模型

Carlos Plou, Cesar Borja, Ruben Martinez-Cantin, Ana C. Murillo

机构 * DIIS-I3A, University of Zaragoza(DIIS-I3A,西班牙阿利坎特大学)

专题命中 Agent评测 :agent(abstract)

AI总结 FALCONEye通过多模态大语言模型在小时长视频中高效定位内容并回答问题,超越现有模型性能并显著降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04896 2026-01-09 cond-mat.supr-con cond-mat.mtrl-sci 50%

Achieving superconductivity in infinite-layer nickelate thin films by aluminum sputtering deposition

通过铝溅射沉积实现无限层镍酸盐薄膜的超导性

Dongxin Zhang, Aravind Raji, Luis M. Vicente-Arche, Alexandre Gloter, Manuel Bibes, Lucía Iglesias

专题命中 Agent评测 :agent(abstract)

AI总结 通过铝溅射沉积法合成无限层镍酸盐薄膜,实现17K超导转变温度,提供更可控的拓扑转变方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04815 2026-01-09 cs.IT math.IT 50%

Privacy-Utility Trade-offs Under Multi-Level Point-Wise Leakage Constraints

在多级点wise泄露约束下研究隐私与效用的权衡

Amirreza Zamani, Parastoo Sadeghi, Mikael Skoglund

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种在多级点wise泄露约束下最大化隐私与效用权衡的机制设计方法,通过信息几何近似和矩阵奇异值分解实现高效隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04547 2026-01-09 cs.RO 50%

Data-Driven Terramechanics Approach Towards a Realistic Real-Time Simulator for Lunar Rovers

数据驱动的地形力学方法:一种用于月球车的逼真实时模拟器

Jakob M. Kern, James M. Hurrell, Shreya Santra, Keisuke Takehana, Kentaro Uno, Kazuya Yoshida

机构 * Space Robotics Lab (SRL) in the Department of Aerospace Engineering, Graduate School of Engineering, Tohoku University(太空机器人实验室(SRL)位于航空工程系,工学院,东大)

专题命中 Agent评测 :planning(abstract)

AI总结 本研究提出一种数据驱动的地形力学方法,通过结合高视觉保真度与真实地形交互,实现月球表面越野车的逼真实时模拟。

Comments Author's version of a manuscript accepted at the International Conference on Space Robotics 2025 (iSpaRo 2025). (c) IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏