arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-01-09 至 2026-01-09 共收录 95 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工作流自动化 11 篇

2508.12611 2026-01-09 cs.AI cs.CL 81%

An LLM + ASP Workflow for Joint Entity-Relation Extraction

基于LLM与ASP的工作流联合实体-关系抽取

Trang Tran, Trung Hoang Le, Huiping Cao, Tran Cao Son

机构 * New Mexico State University(新墨西哥州立大学)

专题命中 工作流自动化 :workflow(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出基于LLM与ASP的工作流,利用其优势在有限数据下提升JERE任务性能,尤其在SciERC基准上表现突出。

Comments In Proceedings ICLP 2025, arXiv:2601.00047

Journal ref EPTCS 439, 2026, pp. 63-75

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04795 2026-01-09 cs.AI cs.CL cs.CR cs.MA 62%

Defense Against Indirect Prompt Injection via Tool Result Parsing

通过工具结果解析防御间接提示注入

Qiang Yu, Xinran Cheng, Chuanyi Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 工作流自动化 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出通过工具结果解析来防御间接提示注入,有效过滤恶意代码并降低攻击成功率。

Comments 20 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04631 2026-01-09 cs.AI cs.SI 57%

Beyond the "Truth": Investigating Election Rumors on Truth Social During the 2024 Election

超越‘真相’:在2024年大选期间探究Truth Social上的选举谣言

Etienne Casanova, R. Michael Alvarez

机构 * California Institute of Technology(加利福尼亚理工学院)

专题命中 工作流自动化 :agent(abstract);分类 cs.AI

AI总结 本文利用LLMs开发多阶段谣言检测代理,通过大规模数据集和自然环境实验,揭示谣言传播中的虚假真相效应及信念强化机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25104 2026-01-09 cs.LG 57%

Towards generalizable deep ptychography neural networks

迈向通用的深度ptychography神经网络

Albert Vong, Steven Henke, Oliver Hoidn, Hanna Ruth, Junjing Deng, Alexander Hexemer, David Shapiro, Apurva Mehta, Arianna Gleason, Levi Hancock, Nicholas Schwarz

机构 * Argonne National Laboratory(阿贡国家实验室) SLAC National Accelerator Laboratory(SLAC国家加速器实验室) Lawrence Berkeley National Laboratory(伯克利劳伦斯国家实验室) Brigham Young University

专题命中 工作流自动化 :workflow(abstract);分类 cs.LG

AI总结 本文提出了一种基于探针学习的深度神经网络方法,通过结合实验测量和合成数据,实现了跨多个光束线的通用ptychography重建。

Comments Submitted to scientific journal for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04915 2026-01-09 cs.HC 50%

OnomaCompass: A Texture Exploration Interface that Shuttles between Words and Images

OnomaCompass: 一种连接词语与图像的纹理探索界面

Miki Okamura, Shuhey Koyama, Li Jingjing, Yoichi Ochiai

专题命中 工作流自动化 :workflow(abstract)

AI总结 OnomaCompass通过连接拟声词与图像的潜在空间,帮助用户更高效地发现材料,减少工作量并提升用户体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04680 2026-01-09 cs.HC 50%

Leveraging LLMs for Efficient and Personalized Smart Home Automation

利用LLMs实现高效且个性化的智能家居自动化

Chaerin Yu, Chihun Choi, Sunjae Lee, Hyosu Kim, Steven Y. Ko, Young-Bae Ko, Sangeun Oh

专题命中 工作流自动化 :agent(abstract)

AI总结 IoTGPT通过分解用户指令和记忆子任务,实现高效且个性化的智能家居自动化,提升可靠性和减少用户负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04349 2026-01-09 cs.DC 50%

Hybrid Cloud Architectures for Research Computing: Applications and Use Cases

混合云架构用于科研计算:应用与用例

Xaver Stiensmeier, Alexander Kanitz, Jan Krüger, Santiago Insua, Adrián Rošinec, Viktória Spišáková, Lukáš Hejtmánek, David Yuan, Gavin Farrell, Jonathan Tedds, Juha Törnroos, Harald Wagener, Alex Sczyrba, Nils Hoffmann, Matej Antol

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文探讨了混合云架构在科研计算中的应用,分析了网格和云平台及工作流管理工具,并提出了促进混合云采用的路线图,强调治理框架和技术解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12874 2026-01-09 physics.ins-det 50%

Optimization of 3D diamond detectors with graphitized electrodes based on an innovative numerical simulation

基于创新数值模拟的3D金刚石探测器优化

Lucio Anderlini, Alessandro Bombini, Clarissa Buti, Djunes Janssens, Stefano Lagomarsino, Giovanni Passaleva, Michele Veltri

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文通过创新数值模拟方法,研究了3D金刚石探测器中信号传播的优化问题,发现降低石墨柱电阻率是提升时间分辨率的关键,后续需优化几何结构和读出电路设计。

Comments 29 pages, 18 figures, 2 tables

Journal ref JINST 21 (2026) P01008

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 3 篇

2601.04327 2026-01-09 cs.DC cs.AI 85%

ParaCodex: A Profiling-Guided Autonomous Coding Agent for Reliable Parallel Code Generation and Translation

ParaCodex: 一种基于性能分析的自主编码代理,用于可靠并行代码生成与翻译

Erel Kaplan, Tomer Bitan, Lian Ghrayeb, Le Chen, Tom Yotam, Niranjan Hasabnis, Gal Oren

专题命中 软件智能体 :agent(title,abstract);planning(abstract);workflow(abstract);分类 cs.AI

AI总结 ParaCodex是一种基于性能分析的自主编码代理,通过分阶段热点分析、显式数据规划和正确性门控,实现高效并行代码生成与翻译,显著提升GPU性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12730 2026-01-09 cs.CL 70%

NL2Repo-Bench: Towards Long-Horizon Repository Generation Evaluation of Coding Agents

NL2Repo-Bench: 向编码代理的长周期仓库生成评估迈进

Jingzhe Ding, Shengda Long, Changxin Pu, Huan Zhou, Hongwan Gao, Xiang Gao, Chao He, Yue Hou, Fei Hu, Zhaojian Li, Weiran Shi, Zaiyuan Wang, Daoguang Zan, Chenchen Zhang, Xiaoxu Zhang, Qizhi Chen, Xianfu Cheng, Bo Deng, Qingshui Gu, Kai Hua, Juntao Lin, Pai Liu, Mingchen Li, Xuanguang Pan, Zifan Peng, Yujia Qin, Yong Shan, Zhewen Tan, Weihao Xie, Zihan Wang, Yishuo Yuan, Jiayu Zhang, Enduo Zhao, Yunfei Zhao, He Zhu, Liya Zhu, Chenyang Zou, Ming Ding, Jianpeng Jiao, Jiaheng Liu, Minghao Liu, Qian Liu, Chongyang Tao, Jian Yang, Tong Yang, Zhaoxiang Zhang, Xinjie Chen, Wenhao Huang, Ge Zhang

机构 * Nanjing University(南京大学) Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北航)

专题命中 软件智能体 :planning(abstract);agentic(abstract);分类 cs.CL

AI总结 NL2Repo-Bench通过评估编码代理在长周期内生成仓库的能力,揭示了自主软件开发中的核心挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04526 2026-01-09 cs.SE cs.AI cs.CL 67%

Advancing Language Models for Code-related Tasks

推动与代码相关的语言模型

Zhao Tian

机构 * School of Computer Software, Tianjin University(天津大学软件学院)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 本研究通过改进代码数据质量、模型架构和推理能力,推动语言模型在软件开发中的实际应用。

Comments Accepted by ICSE 2026 (DS)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与网页智能体 1 篇

2601.04500 2026-01-09 cs.AI 77%

GUITester: Enabling GUI Agents for Exploratory Defect Discovery

GUITester: 使GUI代理用于探索性缺陷发现

Yifei Gao, Jiang Wu, Xiaoyi Chen, Yifan Yang, Zhe Cui, Tianyi Ma, Jiaming Zhang, Jitao Sang

机构 * Beijing Jiaotong University(北京交通大学) Hithink Research(慧思科技) Nanyang Technological University(南洋理工大学)

专题命中 GUI与网页智能体 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI

AI总结 GUITester通过解耦导航与验证的多代理框架,有效解决了探索性GUI测试中目标导向遮蔽和执行偏差归因的问题,实现了48.90%的F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 记忆与上下文管理 4 篇

2601.05107 2026-01-09 cs.AI 79%

Controllable Memory Usage: Balancing Anchoring and Innovation in Long-Term Human-Agent Interaction

可控的记忆使用:在长期人机交互中平衡锚定与创新

Muzhao Tian, Zisu Huang, Xiaohua Wang, Jingwen Xu, Zhengkang Guo, Qi Qian, Yuanzhe Shen, Kaitao Song, Jiakang Yuan, Changze Lv, Xiaoqing Zheng

机构 * College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI

AI总结 SteeM通过动态调节记忆依赖程度,在长期人机交互中平衡锚定与创新,提升个性化协作效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04219 2026-01-09 cs.CY cs.AI cs.MA 70%

AgentTutor: Empowering Personalized Learning with Multi-Turn Interactive Teaching in Intelligent Education Systems

AgentTutor: 通过多轮互动教学赋能个性化学习在智能教育系统中

Yuxin Liu, Zeqing Song, Jiong Lou, Chentao Wu, Jie Li

专题命中 记忆与上下文管理 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 AgentTutor通过多轮互动教学系统提升个性化学习效果,结合多代理系统和学习者档案实现动态优化的教学策略。

Comments AAAI2026 Workshop AI4EDU

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04463 2026-01-09 cs.CL cs.AI 62%

Beyond Static Summarization: Proactive Memory Extraction for LLM Agents

超越静态摘要:为LLM代理的主动记忆提取

Chengyuan Yang, Zequn Sun, Wei Wei, Wei Hu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学) National Institute of Healthcare Data Science, Nanjing University, China(健康数据科学国家研究院,南京大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出ProMem,一种主动记忆提取方法,通过递归反馈机制提升LLM代理的记忆完整性和问答准确性,实现高质量与低成本的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15490 2026-01-09 cs.CL 57%

Collaborative Problem-Solving in an Optimization Game

优化游戏中的协作问题解决

Isidora Jeknic, Alex Duchnowski, Alexander Koller

机构 * Saarland University(萨尔兰大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.CL

AI总结 本文提出了一种新的对话游戏,通过协作解决双人旅行商问题,结合大语言模型与符号机制,实现了在自我对战中45%的最优解率,并展示了与人类用户协作和泛化能力。

Comments 23 pages, 16 figures

Journal ref Proceedings of the 26th Annual Meeting of the Special Interest Group on Discourse and Dialogue (2025) 780-799

详情

展开后加载摘要…

URL PDF HTML 收藏

5. Agent评测 19 篇

2601.04790 2026-01-09 cs.CL cs.AI 88%

Belief in Authority: Impact of Authority in Multi-Agent Evaluation Framework

权威信念:权威在多智能体评估框架中的影响

Junhyuk Choi, Jeongyoun Kwon, Heeju Kim, Haeun Cho, Hayeong Jung, Sehee Min, Bugeun Kim

机构 * Chung-Ang University(Chung-Ang 大学)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文研究了权威角色在多智能体评估中的影响,发现专家和参照角色比合法角色更具影响力,并揭示了权威偏见的产生机制。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04879 2026-01-09 cs.CL 85%

Mind2Report: A Cognitive Deep Research Agent for Expert-Level Commercial Report Synthesis

Mind2Report: 一种用于专家级商业报告综合的认知深度研究代理

Mingyue Cheng, Daoyu Wang, Qi Liu, Shuo Yu, Xiaoyu Tao, Yuqian Wang, Chengzhong Chu, Yu Duan, Mingkang Long, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) Artificial Intelligence Engineering Institute, iFLYTEK Co., Ltd(人工智能工程院,iFLYTEK公司)

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);agentic(abstract);分类 cs.CL

AI总结 Mind2Report是一种通过动态内存增强大语言模型,实现专家级商业报告综合的认知深度研究代理,优于现有基线模型。

Comments 26 Pages, 9 Figures, 7 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04583 2026-01-09 cs.AI cs.MA 85%

Autonomous Agents on Blockchains: Standards, Execution Models, and Trust Boundaries

区块链上的自主代理:标准、执行模型与信任边界

Saad Alqithami

机构 * Saad Alqithami(萨德·阿利萨米)

专题命中 Agent评测 :autonomous agent(title);agent(abstract);agentic(abstract);multi-agent(abstract)

AI总结 本文系统梳理了区块链与自主代理的互操作性领域,提出了五类整合模式、定制化的威胁模型和能力矩阵,并提出了研究路线图和评估套件,旨在提升链上执行的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07505 2026-01-09 cs.LG 83%

PEAR: Planner-Executor Agent Robustness Benchmark

PEAR:规划-执行代理鲁棒性基准

Shen Dong, Mingxuan Zhang, Pengfei He, Li Ma, Bhavani Thuraisingham, Hui Liu, Yue Xing

机构 * Michigan State University(密歇根州立大学) Purdue University(普渡大学) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.LG

AI总结 PEAR基准通过评估规划-执行多智能体系统的鲁棒性,揭示了规划器弱点对任务性能的影响及鲁棒性与性能的权衡。

Comments arXiv admin note: This submission has been withdrawn by arXiv administrators due to incorrect authorship. Author list truncated

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05101 2026-01-09 cs.AI 81%

Arabic Prompts with English Tools: A Benchmark

阿拉伯提示与英语工具:一个基准

Konstantin Kubrak, Ahmed El-Moselhy, Ammar Alsulami, Remaz Altuwaim, Hassan Ismail Fawaz, Faisal Alsaby

专题命中 Agent评测 :AI agent(abstract);autonomous agent(abstract);tool-use(abstract);agentic(abstract)

AI总结 本文提出首个阿拉伯语言LLMs工具调用能力评估基准,揭示阿拉伯语交互环境下工具调用准确率下降5-10%的显著差距。

Comments 10 pages, 10 figures, LLMs, Big Data, and Multilinguality for All (LLMs4All) Workshop at IEEE BigData 2025 Conference, Macau, December 10, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04794 2026-01-09 cs.AI 79%

APEX: Academic Poster Editing Agentic Expert

APEX:学术海报编辑智能专家

Chengxin Shi, Qinnan Cai, Zeyuan Chen, Long Zeng, Yibo Zhao, Jing Yu, Jianxiang Yu, Xiang Li

机构 * School of Data Science and Engineering, East China Normal University(数据科学与工程学院,东华大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 APEX是首个交互式学术海报编辑框架,通过多级API和审查机制实现细粒度控制,并引入首个系统性基准APEX-Bench评估编辑效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04556 2026-01-09 cs.SE 79%

4D-ARE: Bridging the Attribution Gap in LLM Agent Requirements Engineering

4D-ARE:弥合LLM代理需求工程中的归因差距

Bo Yu, Lei Zhao

专题命中 Agent评测 :agent(title,abstract);分类 cs.SE

AI总结 4D-ARE提出一种四维归因驱动代理需求工程方法,解决代理应推理什么的问题,补充运行时推理框架如何推理的不足。

Comments 39 pages, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04554 2026-01-09 cs.IR 78%

Exploring Recommender System Evaluation: A Multi-Modal User Agent Framework for A/B Testing

探索推荐系统评估:一种用于A/B测试的多模态用户代理框架

Wenlin Zhang, Xiangyang Li, Qiyuan Ge, Kuicai Dong, Pengyue Jia, Xiaopeng Li, Zijian Zhang, Maolin Wang, Yichao Wang, Huifeng Guo, Ruiming Tang, Xiangyu Zhao

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出一种多模态用户代理框架,用于替代传统A/B测试,通过模拟真实用户行为提升推荐系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04692 2026-01-09 cs.CL cs.CV 74%

See, Explain, and Intervene: A Few-Shot Multimodal Agent Framework for Hateful Meme Moderation

见、解释与干预:一种少样本多模态代理框架用于仇恨表情包审查

Naquee Rizwan, Subhankar Swain, Paramananda Bhaskar, Gagan Aryan, Shehryaar Shah Khan, Animesh Mukherjee

机构 * Indian Institute of Technology (IIT), Kharagpur(印度理工学院(IIT)Khargpur分校) Simbian

专题命中 Agent评测 :agent(title);分类 cs.CL

AI总结 本文提出了一种少样本多模态代理框架,用于在有限数据条件下实现通用仇恨表情包审查,通过检测、解释和干预三方面提升审查效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10991 2026-01-09 cs.CR cs.AI 74%

MCP-Guard: A Multi-Stage Defense-in-Depth Framework for Securing Model Context Protocol in Agentic AI

MCP-Guard: 一种多阶段纵深防御框架,用于保障代理AI中的模型上下文协议安全

Wenpeng Xing, Zhonghao Qi, Yupeng Qin, Yilin Li, Caini Chang, Jiahui Yu, Changting Lin, Zhenzhen Xie, Meng Han

机构 * Zhejiang University(浙江大学) Binjiang Institute of Zhejiang University(浙江大学滨江研究院) The Chinese University of Hong Kong(香港中文大学) Shandong University(山东大学)

专题命中 Agent评测 :agentic(title);分类 cs.AI

AI总结 MCP-Guard通过多阶段防御框架提升LLM与工具交互的安全性,利用E5模型和仲裁器实现高准确率的对抗性提示检测,并通过MCP-ATTACKBENCH验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04235 2026-01-09 cs.AI 70%

Actively Obtaining Environmental Feedback for Autonomous Action Evaluation Without Predefined Measurements

主动获取环境反馈以实现自主行动评估而无需预定义测量

Hong Su

机构 * School of Computer Science, Chengdu University of Information Technology(计算机学院,成都信息科技大學)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出一种主动反馈获取模型,通过自主探索环境差异来识别未预定义的反馈,提升智能体在动态环境中的行动评估效率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04196 2026-01-09 cs.CL cs.IR 70%

RAGVUE: A Diagnostic View for Explainable and Automated Evaluation of Retrieval-Augmented Generation

RAGVUE:一种用于可解释和自动评估检索增强生成的诊断视图

Keerthana Murugaraj, Salima Lamsiyah, Martin Theobald

机构 * University of Luxembourg(卢森堡大学)

专题命中 Agent评测 :workflow(abstract);agentic(abstract);分类 cs.CL

AI总结 RAGVUE通过分解RAG行为并提供结构化解释,实现无参考的自动评估,揭示RAG流程中的细粒度失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00826 2026-01-09 cs.CY 67%

Digital Homunculi and Institutional Design: Breaking Through the Experimentation Bottleneck

数字人偶与制度设计:突破实验瓶颈

Petr Specian

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本文提出利用生成式AI驱动的数字人偶方法,通过模拟人类行为生成合成数据,以突破民主研究中的实验瓶颈,提升制度创新的效率与可行性。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01802 2026-01-09 cs.AI 57%

PsychEval: A Multi-Session and Multi-Therapy Benchmark for High-Realism AI Psychological Counselor

PsychEval: 一个多会话和多疗法的基准,用于高真实感的AI心理顾问

Qianjun Pan, Junyi Wang, Jie Zhou, Yutao Yang, Junsong Li, Kaiyin Xu, Yougen Zhou, Yihan Li, Jingyuan Zhao, Qin Chen, Ningning Zhou, Kai Chen, Liang He

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Shanghai AI Laboratory(上海人工智能实验室) School of Psychology and Cognitive Science, East China Normal University(东华大学心理学与认知科学学院)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 PsychEval是一个多会话和多疗法的基准,用于评估高真实感的AI心理顾问,通过多阶段数据集和全面评估框架提升AI在心理咨询服务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏