arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-02-05 至 2026-02-05 共收录 103 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工作流自动化 12 篇

2511.20276 2026-02-05 eess.SY cs.SY 67%

LLM-Driven Transient Stability Assessment: From Automated Simulation to Neural Architecture Design

基于大语言模型的暂态稳定评估:从自动化仿真到神经网络架构设计

Lianzhe Hu, Yu Wang, Bikash Pal

专题命中 工作流自动化 :workflow(abstract);agentic(abstract)

AI总结 本文提出利用大语言模型驱动的神经网络设计流程,实现电力系统暂态稳定评估的自动化和智能化,提升准确率与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23228 2026-02-05 cs.AI cs.CL cs.ET cs.MA 62%

Scaling Multiagent Systems with Process Rewards

通过过程奖励扩展多智能体系统

Ed Li, Junyu Ren, Cat Yan

机构 * Yale University(耶鲁大学) University of Chicago(芝加哥大学) University of Oxford(牛津大学)

专题命中 工作流自动化 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出MAPPA方法,通过每动作过程奖励微调多智能体系统,提升复杂任务的性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04579 2026-02-05 cs.IR cs.CL 57%

AIANO: Enhancing Information Retrieval with AI-Augmented Annotation

AIANO:通过AI增强标注提升信息检索

Sameh Khattab, Marie Bauer, Lukas Heine, Till Rostalski, Jens Kleesiek, Julian Friedrich

机构 * Institute for Artificial Intelligence in Medicine (IKIM), University Hospital Essen (AöR)(人工智能医学研究所(IKIM)、埃森大学医院(AöR))

专题命中 工作流自动化 :workflow(abstract);分类 cs.CL

AI总结 AIANO通过结合人类专业知识与LLM帮助,提升信息检索数据集的创建效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04841 2026-02-05 cs.HC 50%

Vivifying LIME: Visual Interactive Testbed for LIME Analysis

使LIME焕发生机:用于LIME分析的视觉交互测试平台

Jeongmin Rhee, Changhee Lee, DongHwa Shin, Bohyoung Kim

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出LIMEVis,一种交互式可视化工具,用于提升LIME分析的效率,通过同时探索多个结果并直接修改以识别模型分类的关键特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04624 2026-02-05 cs.CV 50%

A labeled dataset of simulated phlebotomy procedures for medical AI: polygon annotations for object detection and human-object interaction

带有标注的模拟采血程序数据集用于医疗AI:用于目标检测和人-物交互的多边形标注

Raúl Jiménez Cruz, César Torres-Huitzil, Marco Franceschetti, Ronny Seiger, Luciano García-Bañuelos, Barbara Weber

机构 * Institute of Computer Science(计算机科学研究所) University of St.Gallen(圣加伦大学)

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出一个包含11884张标注图像的数据集,用于医疗AI中的目标检测和人-物交互研究,支持医疗培训自动化和教育系统开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04578 2026-02-05 eess.SY cs.SY 50%

Reinforcement Learning-based Home Energy Management with Heterogeneous Batteries and Stochastic EV Behaviour

基于强化学习的异质电池家庭能源管理与随机电动车行为

Meng Yuan, Ye Wang, Xinghuo Yu, Torsten Wik, Changfu Zou

专题命中 工作流自动化 :agent(abstract)

AI总结 本文提出基于深度强化学习的家庭能源管理框架,考虑异质电池退化和随机电动车行为,通过约束马尔可夫决策过程和SAC算法实现优化,有效降低运行成本和电池退化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04483 2026-02-05 physics.optics physics.ins-det 50%

Passive Incoherent Ultrafast Mid-Infrared Upconversion Imaging and Its Calibration

被动非相干超快中红外上转换成像及其校准

Jin-Peng Li, Zhi-You Li, Zhao-Qi-Zhi Han, Xiao-Hua Wang, He Zhang, Yin-Hai Li, Bo-Wen Liu, Wen-Tao Luo, Zhi-Yuan Zhou, Bao-Sen Shi

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出了一种基于CPLN的被动非相干超快中红外上转换成像技术,实现了100kHz超快成像和基于Allan偏差分析的校准方法,用于实时热监控和早期预警系统。

Comments 13 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02743 2026-02-05 cs.HC 50%

Exploring Collaborative Immersive Visualization & Analytics for High-Dimensional Scientific Data through Domain Expert Perspectives

探索通过领域专家视角的协作沉浸式可视化与分析以高维科学数据

Fahim Arsad Nafis, Jie Li, Simon Su, Songqing Chen, Bo Han

专题命中 工作流自动化 :workflow(abstract)

AI总结 通过访谈领域专家,研究探讨了多用户协作在高维科学数据可视化与分析中的挑战与机遇,提出设计改进以提升协作效率与公平性。

Comments Conditionally accepted at the Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI 26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.10121 2026-02-05 econ.TH 50%

A Dutch-Book Trap for Misspecification

针对规范性错误的荷兰赌局陷阱

Emiliano Catonini, Giacomo Lanzani

专题命中 工作流自动化 :agent(abstract)

AI总结 本文通过荷兰赌局论点指出,使用贝叶斯规则更新信念可避免规范性错误导致的确定性损失。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 7 篇

2602.04254 2026-02-05 cs.CL 83%

Scaling Agentic Verifier for Competitive Coding

为竞争编程设计的扩展代理验证器

Zeyao Ma, Jing Zhang, Xiaokang Zhang, Jiaxi Yang, Zongmeng Zhang, Jiajun Zhang, Yuheng Jing, Lei Zhang, Hao Zheng, Wenting Zhao, Junyang Lin, Binyuan Hui

机构 * Renmin University of China(中国人民大学) Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.CL

AI总结 本文提出Agentic Verifier,通过主动推理和高效测试输入生成,提升竞争编程问题解决的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04226 2026-02-05 cs.SE 83%

Why Agentic-PRs Get Rejected: A Comparative Study of Coding Agents

为何智能代理生成的拉取请求被拒绝:智能代理的比较研究

Sota Nakashima, Yuta Ishimoto, Masanari Kondo, Shane Mclntosh, Yasutaka Kamei

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.SE

AI总结 本文研究了不同智能代理生成的拉取请求被拒绝的原因差异,发现七种仅出现在智能代理生成PR中的拒绝模式,并提出启发式方法以减少无反馈的拒绝案例。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04296 2026-02-05 cs.SE cs.AI 73%

ProxyWar: Dynamic Assessment of LLM Code Generation in Game Arenas

ProxyWar: 动态评估LLM代码生成在游戏竞技场中的表现

Wenjun Peng, Xinyu Wang, Qi Wu

机构 * adelaide.edu.au(阿德莱德大学)

专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 ProxyWar通过在动态游戏环境中评估LLM代码生成的质量,揭示了基准分数与实际性能之间的差异,为算法发现和自适应问题解决研究提供新视角。

Comments ICSE2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04518 2026-02-05 cs.CY cs.AI cs.LG 68%

Learning the Value Systems of Agents with Preference-based and Inverse Reinforcement Learning

基于偏好和逆强化学习的学习代理价值系统

Andrés Holgado-Sánchez, Holger Billhardt, Alberto Fernández, Sascha Ossowski

机构 * Universidad Rey Juan Carlos(雷乌安卡洛斯大学)

专题命中 软件智能体 :agent(comments,journal_ref);autonomous agent(comments,journal_ref);multi-agent(comments,journal_ref);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于偏好和逆强化学习的方法,用于自动从观察和人类示范中学习代理的价值系统,以解决不同用户价值系统差异带来的协议一致性问题。

Comments 42 pages, 5 figures. Published in Journal of Autonomous Agents and Multi-Agent Systems

Journal ref Holgado-Sánchez, A., Billhardt, H., Fernández, A., Ossowski, S. Learning the value systems of agents with preference-based and inverse reinforcement learning. Autonomous Agents Multi-Agent Systems 40, 4 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10192 2026-02-05 cs.LG cs.AI cs.DM quant-ph 62%

Multi-Excitation Projective Simulation with a Many-Body Physics Inspired Inductive Bias

多激发投影模拟:受多体物理启发的归纳偏置

Philip A. LeMaitre, Marius Krumm, Hans J. Briegel

机构 * University of Innsbruck, Institute for Theoretical Physics(因斯布鲁克大学理论物理研究所)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出多激发投影模拟(mePS)方法,通过受多体物理启发的归纳偏置解决超图建模中的指数复杂性问题,并在多个场景中验证了其资源节省和可解释性优势。

Comments 41 pages, 9 figures; Code repository at https://github.com/MariusKrumm/ManyBodyMEPS. Updated to be consistent with AIJ version

Journal ref Artificial Intelligence 352, 104489 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12434 2026-02-05 cs.AI 57%

Building Coding Agents via Entropy-Enhanced Multi-Turn Preference Optimization

通过熵增强的多轮偏好优化构建编码代理

Jiahao Yu, Zelei Cheng, Xian Wu, Xinyu Xing

机构 * Department of Computer Science, Northwestern University, Evanston, USA(西北大学计算机科学系) Meta AI, Bellevue, USA(Meta AI)

专题命中 软件智能体 :tool use(abstract);分类 cs.AI

AI总结 本文提出EntroPO框架,通过增强熵的方法提升多轮交互中编码代理的性能,实现更高效的测试时间扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19207 2026-02-05 cs.CR 50%

Defending Against Prompt Injection with DataFilter

用DataFilter抵御提示注入

Yizhu Wang, Sizhe Chen, Raghad Alkhudair, Basel Alomair, David Wagner

专题命中 软件智能体 :agent(abstract)

AI总结 DataFilter通过在数据到达LLM前移除恶意指令,有效防御提示注入攻击,同时保持模型的效用。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与网页智能体 2 篇

2510.02250 2026-02-05 cs.AI cs.CL cs.CV cs.LG 67%

Scaling Agents for Computer Use

用于计算机使用的扩展代理

Gonzalo Gonzalez-Pumariega, Vincent Tu, Chih-Lun Lee, Jiachen Yang, Ang Li, Xin Eric Wang

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出BJudge方法,通过行为叙述比较提升CUAs在长周期任务中的鲁棒性和成功率,实现OSWorld新状态-of-the-art并超越人类水平。

Comments 21 pages, 7 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10322 2026-02-05 cs.AI 57%

User-Feedback-Driven Adaptation for Vision-and-Language Navigation

基于用户反馈的视觉-语言导航适应

Yongqiang Yu, Xuhui Li, Hazza Mahmood, Jinxing Zhou, Haodong Hong, Longtao Jiang, Zhiqiang Xu, Qi Wu, Xiaojun Chang

机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed大学人工智能学院) School of Electrical Engineering and Computer Science, The University of Queensland(电气工程与计算机科学学院,昆士兰大学) University of Science and Technology of China(中国科学技术大学) School of Computer Science, The University of Adelaide(计算机科学学院,阿德莱德大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出基于用户反馈的视觉-语言导航适应方法,通过拓扑感知轨迹构建和持久记忆库机制,提升代理对用户指令的响应能力,实现高效模仿学习和跨指令风格的强适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 记忆与上下文管理 8 篇

2601.11653 2026-02-05 q-bio.NC cs.LG cs.MA 83%

AI Agents Need Memory Control Over More Context

AI代理需要对更多上下文进行记忆控制

Fouad Bousetouane

机构 * The University of Chicago(芝加哥大学)

专题命中 记忆与上下文管理 :AI agent(title,abstract);agent(abstract);分类 cs.LG

AI总结 本文提出了一种生物启发式的记忆控制器ACC,通过有界内部状态实现稳定多轮交互,降低幻觉和漂移,提升长视图AI代理的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04496 2026-02-05 cs.AI 81%

ReThinker: Scientific Reasoning by Rethinking with Guided Reflection and Confidence Control

ReThinker:通过引导反思与置信度控制实现科学推理

Zhentao Tang, Yuqi Cui, Shixiong Kai, Wenqian Zhao, Ke Ye, Xing Li, Anxin Tian, Zehua Pei, Hui-Ling Zhen, Shoubo Hu, Xiaoguang Li, Yunhe Wang, Mingxuan Yuan

机构 * Noah's Ark Lab, Huawei, China(诺亚实验室,华为,中国) The Chinese University of Hong Kong, Hong Kong, China(香港中文大学,香港,中国)

专题命中 记忆与上下文管理 :agent(abstract);tool use(abstract);agentic(abstract);multi-agent(abstract)

AI总结 ReThinker通过引导反思与置信度控制,提升大语言模型在专家级科学推理任务中的性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02164 2026-02-05 cs.LG cs.CR 70%

Co-RedTeam: Orchestrated Security Discovery and Exploitation with LLM Agents

Co-RedTeam: 基于LLM代理的协同安全发现与利用

Pengfei He, Ash Fox, Lesly Miculicich, Stefan Friedli, Daniel Fabian, Burak Gokturk, Jiliang Tang, Chen-Yu Lee, Tomas Pfister, Long T. Le

机构 * Google(谷歌) Google Cloud AI Research(谷歌云人工智能研究) Michigan State University(密歇根州立大学)

专题命中 记忆与上下文管理 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 Co-RedTeam通过整合安全知识、代码分析和执行反馈,提升漏洞发现与利用的自动化水平,实现超过60%的漏洞利用成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04837 2026-02-05 cs.AI 57%

Group-Evolving Agents: Open-Ended Self-Improvement via Experience Sharing

群体进化代理:通过经验共享实现开放式自我改进

Zhaotian Weng, Antonis Antoniades, Deepak Nathani, Zhen Zhang, Xiao Pu, Xin Eric Wang

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 GEA通过经验共享实现开放式自我改进,显著优于现有自我进化方法并在编码基准上表现优异。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04829 2026-02-05 physics.soc-ph cs.SI 50%

Opinion dynamics under electoral shocks in competitive campaigns

选举竞争中的意见动态受选举冲击影响

Jaime L. C. da C. Filho, Nuno Crokidakis

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文提出一个结合选民记忆和外生冲击的计算框架,研究选举竞争中意见动态受冲击影响的行为特征。

Comments 19 pages, 7 figures, to appear in IJMPC

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04817 2026-02-05 cs.GT 50%

Properties of the core and other solution concepts of Bel coalitional games in the ex-ante scenario

Bel联盟博弈中核心及其他解概念的性质(事前场景)

Michel Grabisch, Silvia Lorenzini

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文研究了Bel联盟博弈中核心及其他解概念在事前场景下的性质,探讨了不确定性环境下合同分配与偏好建模,并发现这些解概念的包含关系与经典情况一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04261 2026-02-05 cs.DB 50%

Data Agents: Levels, State of the Art, and Open Problems

数据代理:等级、现状与开放问题

Yuyu Luo, Guoliang Li, Ju Fan, Nan Tang

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文提出数据代理的分层分类体系,从无自主性到完全自主,探讨其现状、挑战及未来发展方向。

Journal ref SIGMOD 2026 Tutorial

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20728 2026-02-05 econ.TH 50%

Dynamic Mechanism Design without Monetary Transfers: A Queueing Theory Approach

无货币转移的动态机制设计:一种排队论方法

Zihao Li, Xuandong Chen

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文提出了一种无货币转移的动态阈值机制,用于在稳态下优化随机环境中代理人和物品的分配问题。

Comments A substantial revised version is in progress, and the current version is considered incomplete by the authors

详情

展开后加载摘要…

URL PDF HTML 收藏

5. Agent评测 15 篇

2602.04813 2026-02-05 cs.AI cs.CY 85%

Agentic AI in Healthcare & Medicine: A Seven-Dimensional Taxonomy for Empirical Evaluation of LLM-based Agents

医疗与医学中的代理AI:一个七维分类法用于评估基于大语言模型的代理

Shubham Vatsal, Harsh Dubey, Aditi Singh

机构 * Department of Computer Science, New York University, CIMS, New York, USA(纽约大学计算机科学系,CIMS,纽约,美国) Department of Computer Science, Cleveland State University, Cleveland, USA(克利夫兰州立大学计算机科学系,克利夫兰,美国)

专题命中 Agent评测 :agentic(title);agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 本文提出一个七维分类法,用于评估基于大语言模型的医疗代理在认知能力、知识管理、交互模式等方面的能力分布与实现情况。

Journal ref IEEE Access, vol. 14, pp. 4840-4863, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02389 2026-02-05 cs.SE cs.CR cs.LG 84%

From Trace to Line: LLM Agent for Real-World OSS Vulnerability Localization

从痕迹到行:面向真实世界OSS漏洞定位的LLM代理

Haoran Xi, Minghao Shao, Brendan Dolan-Gavitt, Muhammad Shafique, Ramesh Karri

机构 * NYU Tandon School of Engineering(纽约大学唐纳德工程学院)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.LG、cs.SE

AI总结 T2L框架通过基于AST的分块和证据引导细化,实现项目级和行级漏洞定位,提升LLM在开源软件中的精准诊断能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17729 2026-02-05 cs.AI 83%

M^3-Bench: Multi-Modal, Multi-Hop, Multi-Threaded Tool-Using MLLM Agent Benchmark

M^3-Bench: 多模态、多跳、多线程工具使用 MLLM agent 评估基准

Yang Zhou, Mingyu Zhao, Zhenting Wang, Difei Gu, Bangwei Guo, Ruosong Ye, Ligong Han, Can Jin, Dimitris N. Metaxas

机构 * Rutgers University(新泽西罗格斯大学)

专题命中 Agent评测 :agent(title);tool use(abstract);workflow(abstract);分类 cs.AI

AI总结 M^3-Bench是首个评估多模态工具使用下模型上下文协议的基准,通过多跳、多线程工作流和可追溯的一对一对应关系,揭示了多模态大语言模型在论点保真度和结构一致性方面的持续差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04197 2026-02-05 cs.CL cs.AI 79%

From Helpfulness to Toxic Proactivity: Diagnosing Behavioral Misalignment in LLM Agents

从有益到有毒的主动性:诊断LLM代理的行为不一致

Xinyue Wang, Yuanhe Zhang, Zhengshuo Gong, Haoran Gao, Fanyu Meng, Zhenhong Zhou, Li Sun, Yang Liu, Sen Su

机构 * Beijing University of Posts(北京邮电大学) China Mobile Research Institute(中国移动研究院) Nanyang Technological University(南洋理工大学)

专题命中 Agent评测 :agent(abstract);tool-use(abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 本文研究了LLM代理在权衡有益与无害时产生的有毒主动性行为,提出了一种基于双模型互动的评估框架,并通过实验揭示了该现象的普遍性及两种主要趋势。

Comments 9 pages (excluding appendices), 6 figures. Code is available at https://github.com/wxyoio-0715/Toxic-Proactivity

详情

展开后加载摘要…

URL PDF HTML 收藏