arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-01-29 至 2026-01-29 共收录 86 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工作流自动化 9 篇

2508.11967 2026-01-29 cs.CE cond-mat.mtrl-sci 50%

Persistence is All You Need -- A Topological Lens on Microstructural Characterization

持久性是全部所需——从拓扑学角度审视微结构表征

Maksym Szemer, Szymon Buchaniec, Grzegorz Brus

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出了一种结合计算拓扑与装配学习的回归方法,用于快速表征功能多孔材料的八个关键微结构描述符。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 5 篇

2601.20171 2026-01-29 cs.SE 83%

Who Writes the Docs in SE 3.0? Agent vs. Human Documentation Pull Requests

在 SE 3.0 中谁撰写文档?代理 vs. 人类文档拉取请求

Kazuma Yamasaki, Joseph Ayobami Joshua, Tasha Settewong, Mahmoud Alfadel, Kazumasa Shimari, Kenichi Matsumoto

专题命中 软件智能体 :agent(title,abstract);AI agent(abstract);分类 cs.SE

AI总结 研究发现 AI 代理在文档拉取请求中比人类更活跃,且其文档修改较少被人类跟进,引发对文档质量和人机协作的担忧。

Comments Comments: 5 pages, 5 figures. To appear in MSR 2026 Mining Challenge (April 2026). Code available at https://github.com/NAIST-SE/msr2026-docs-prs-replication

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18345 2026-01-29 cs.SE 79%

Promises, Perils, and (Timely) Heuristics for Mining Coding Agent Activity

承诺、危险与(及时的)启发式方法用于挖掘编码代理活动

Romain Robbes, Théo Matricon, Thomas Degueule, Andre Hora, Stefano Zacchiroli

专题命中 软件智能体 :agent(title,abstract);分类 cs.SE

AI总结 本文探讨了编码代理在软件工程中的影响,分析了其快速采用带来的机遇与风险,并提出了研究此类代理活动的启发式方法。

Comments Preprint. Accepted for publication at MSR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20109 2026-01-29 cs.SE 79%

Beyond Bug Fixes: An Empirical Investigation of Post-Merge Code Quality Issues in Agent-Generated Pull Requests

超越Bug修复:对代理生成拉取请求合并后代码质量问题的实证研究

Shamse Tasnim Cynthia, Al Muttakin, Banani Roy

专题命中 软件智能体 :agent(title,abstract);分类 cs.SE

AI总结 本研究通过分析代理生成的bug修复PR合并后代码质量问题,发现代码异味主导,且合并成功不等于代码质量高,需系统化质量检查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20106 2026-01-29 cs.SE 77%

Are We All Using Agents the Same Way? An Empirical Study of Core and Peripheral Developers Use of Coding Agents

我们是否都在以相同的方式使用代理?核心和边缘开发者对编码代理使用的一次实证研究

Shamse Tasnim Cynthia, Joy Krishan Das, Banani Roy

专题命中 软件智能体 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.SE

AI总结 本文通过实证研究发现,核心和边缘开发者在使用编码代理时存在差异,核心开发者更关注文档和测试,而边缘开发者更频繁使用代理进行任务分配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20085 2026-01-29 cs.HC 50%

Editrail: Understanding AI Usage by Visualizing Student-AI Interaction in Code

Editrail: 通过可视化学生与AI交互理解AI的使用

Ashley Ge Zhang, Yan-Ru Jhou, Yinuo Yang, Shamita Rao, Maryam Arab, Yan Chen, Steve Oney

专题命中 软件智能体 :workflow(abstract)

AI总结 Editrail通过可视化学生与AI的交互,帮助教师理解AI在代码编写中的使用情况,从而优化教学策略和干预措施。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与网页智能体 3 篇

2601.20380 2026-01-29 cs.AI 85%

OmegaUse: Building a General-Purpose GUI Agent for Autonomous Task Execution

OmegaUse:构建一个通用的 GUI 代理以实现自主任务执行

Le Zhang, Yixiong Xiao, Xinjiang Lu, Jingjia Cao, Yusai Zhao, Jingbo Zhou, Lang An, Zikan Feng, Wanxiang Sha, Yu Shi, Congxi Xiao, Jian Xiong, Yankai Zhang, Hua Wu, Haifeng Wang

机构 * Baidu Frontier Research Department(百度前沿研究部)

专题命中 GUI与网页智能体 :agent(title,abstract);planning(abstract);agentic(abstract);分类 cs.AI

AI总结 OmegaUse 是一种通用 GUI 代理模型,通过高质量数据和解耦训练方法实现跨平台自主任务执行,展现卓越的 GUI 任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20162 2026-01-29 cs.CL 79%

Me-Agent: A Personalized Mobile Agent with Two-Level User Habit Learning for Enhanced Interaction

Me-Agent:一种具有两级用户习惯学习的个性化移动代理以增强交互

Shuoxin Wang, Chang Liu, Gowen Loo, Lifan Zheng, Kaiwen Wei, Xinyi Zeng, Jingyuan Zhang, Yu Tian

机构 * Yunnan University(云南大学) Hong Kong Polytechnic University(香港理工大学) University of Electronic Science and Technology of China(电子科技大学) Southeast University(东南大学) Chongqing University(重庆大学) Tsinghua University(清华大学) Kuaishou Technology(快手科技)

专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.CL

AI总结 Me-Agent通过两级用户习惯学习方法,提升移动代理在个性化交互中的性能与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18759 2026-01-29 cs.HC 50%

UI Remix: Supporting UI Design Through Interactive Example Retrieval and Remixing

UI Remix:通过交互式示例检索与混搭支持 UI 设计

Junling Wang, Hongyi Lan, Xiaotian Su, Mustafa Doga Dogan, April Yi Wang

专题命中 GUI与网页智能体 :workflow(abstract)

AI总结 UI Remix 通过交互式示例检索与混搭,帮助终端用户更高效地进行移动UI设计,提升设计可控性与信任度。

Comments Accepted at the 31st International Conference on Intelligent User Interfaces (IUI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 记忆与上下文管理 4 篇

2601.20465 2026-01-29 cs.CL 88%

BMAM: Brain-inspired Multi-Agent Memory Framework

基于大脑的多智能体记忆框架 BMAM

Yang Li, Jiaxiang Liu, Yusong Wang, Yujie Wu, Mingkun Xu

机构 * Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) Institute of Science Tokyo(东京科学研究所) The Hong Kong Polytechnic University(香港理工大学)

专题命中 记忆与上下文管理 :agent(title,abstract);multi-agent(title,abstract);分类 cs.CL

AI总结 BMAM 提出了一种基于大脑认知机制的多智能体记忆框架,通过分解记忆为事件型、语义型等子系统,提升长时间交互中的信息保持和行为一致性,实验显示其在 LoCoMo 基准上达到 78.45% 的准确率。

Comments Submitted to ACL (ARR 2026 January submission); non-anonymous preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19935 2026-01-29 cs.CL cs.AI 81%

Mem2ActBench: A Benchmark for Evaluating Long-Term Memory Utilization in Task-Oriented Autonomous Agents

Mem2ActBench: 一个评估面向任务的自主代理长期记忆利用的基准

Yiting Shen, Kun Li, Wei Zhou, Songlin Hu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 记忆与上下文管理 :autonomous agent(title);tool-use(abstract);分类 cs.AI、cs.CL

AI总结 Mem2ActBench是一个评估自主代理利用长期记忆执行任务能力的基准,通过合成工具使用任务验证记忆应用的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20843 2026-01-29 cs.AI 57%

Deep Researcher with Sequential Plan Reflection and Candidates Crossover (Deep Researcher Reflect Evolve)

具有序列计划反思和候选交叉的深度研究员(深度研究员反思进化)

Saurav Prateek

机构 * Saurav Prateek(独立研究者)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 深度研究员通过序列计划反思和候选交叉算法,实现对博士级别研究任务的高效处理,取得优于现有方法的性能。

Comments 11 pages, 6 figures, 2 tables, source code: https://github.com/SauravP97/deep-researcher-reflect-evolve/

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.03607 2026-01-29 econ.TH 50%

Learning about a changing state

学习一个变化的状态

Benjamin Davies

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文研究了在状态随时间变化时,贝叶斯代理人如何选择信号精度以平衡成本和信息性,比较了布朗运动和其他高斯过程下的最优策略。

Comments 23 pages; 2 figures. V2 fixes typos/grammar, adds some references, and removes some footnotes

详情

展开后加载摘要…

URL PDF HTML 收藏

5. Agent评测 13 篇

2506.00856 2026-01-29 econ.EM cs.AI 89%

Can AI Master Econometrics? Evidence from Econometrics AI Agent on Expert-Level Tasks

AI能否掌握计量经济学?来自计量经济学AI代理在专家级任务上的证据

Qiang Chen, Tianyang Han, Jin Li, Ye Luo, Zigan Wang, Yuxiao Wu, Xiaowei Zhang, Tuo Zhou

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出MetricsAI,一个基于MetaGPT框架的计量经济学AI代理,通过实证分析展示其在专家级任务中超越传统模型的能力,推动社会科学研究的智能化与教育应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07972 2026-01-29 cs.LG cs.AI cs.CL 88%

HeuriGym: An Agentic Benchmark for LLM-Crafted Heuristics in Combinatorial Optimization

HeuriGym: 一个用于评估LLM生成启发式算法的代理基准

Hongzheng Chen, Yingheng Wang, Yaohui Cai, Hins Hu, Jiajie Li, Shirley Huang, Chenhui Deng, Rongjian Liang, Shufeng Kong, Haoxing Ren, Samitha Samaranayake, Carla P. Gomes, Zhiru Zhang

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);planning(abstract)

AI总结 HeuriGym是一个用于评估LLM生成启发式算法的代理基准,通过代码执行反馈和迭代改进,揭示了LLM在组合优化中的局限性。

Comments Accepted to ICLR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17087 2026-01-29 cs.HC cs.AI cs.CY cs.LG 84%

Lost in Simulation: LLM-Simulated Users are Unreliable Proxies for Human Users in Agentic Evaluations

陷入模拟:LLM模拟用户在代理评估中是不可靠的人类用户代理

Preethi Seshadri, Samuel Cahyawijaya, Ayomide Odumakinde, Sameer Singh, Seraphina Goldfarb-Tarrant

机构 * UC Irvine(加州大学欧文分校) Cohere(Cohere公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 研究发现LLM模拟用户在代理评估中存在稳健性不足、校准误差和文化差异问题,影响评估准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20617 2026-01-29 cs.CY cs.AI 79%

Agent Benchmarks Fail Public Sector Requirements

代理基准测试未能满足公共部门要求

Jonathan Rystrøm, Chris Schmitz, Karolina Korgul, Jan Batzner, Chris Russell

机构 * Oxford Internet Institute, University of Oxford(牛津大学互联网研究所) Centre for Digital Governance, Hertie School(数字治理中心) Weizenbaum Institute(魏泽瑙研究所) Technical University of Munich(慕尼黑技术大学)

专题命中 Agent评测 :agent(title);agentic(abstract);分类 cs.AI

AI总结 本文提出公共部门基准测试需满足过程性、现实性、特定性和指标性标准,指出现有基准测试未能全面反映公共部门需求,并呼吁研究人员和公共部门官员共同改进相关评估方法。

Comments Forthcoming @ IASEAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20323 2026-01-29 cs.AI 79%

ECG-Agent: On-Device Tool-Calling Agent for ECG Multi-Turn Dialogue

ECG-Agent: 用于ECG多轮对话的设备端工具调用代理

Hyunseung Chung, Jungwoo Oh, Daeun Kyung, Jiho Kim, Yeonsu Kwon, Min-Gyu Kim, Edward Choi

机构 * KAIST(韩国科学技术院) Ajou University School of Medicine(全州大学医学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 ECG-Agent是一种基于LLM的多轮ECG对话工具调用代理,通过ECG-MTD数据集实现了设备端高效且准确的ECG对话处理。

Comments Accepted to ICASSP 2026 (5 pages, 2 figures, 5 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20452 2026-01-29 econ.GN physics.soc-ph q-fin.EC q-fin.TR 79%

Manipulation in Prediction Markets: An Agent-based Modeling Experiment

预测市场中的操控:基于代理的建模实验

Bridget Smart, Ebba Mark, Anne Bastian, Josefina Waugh

专题命中 Agent评测 :agent(title,abstract)

AI总结 该研究通过基于代理的模拟实验,探讨了高预算代理如何在预测市场中引入价格扭曲,并分析了市场中从众行为和学习率对价格波动的影响。

Comments Open source code for the agent-based model and Dash application available at https://github.com/ebbam/power_prediction/ 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20714 2026-01-29 cs.LG cs.AI 62%

Adapting the Behavior of Reinforcement Learning Agents to Changing Action Spaces and Reward Functions

适应强化学习智能体的行为以应对变化的动作空间和奖励函数

Raul de la Rosa, Ivana Dusparic, Nicolas Cardozo

机构 * Trinity College Dublin(都柏林三一学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 MORPHIN通过动态调整超参数和概念漂移检测,实现强化学习智能体在变化的奖励函数和动作空间中的自适应学习,提升收敛速度和学习效率。

Journal ref 2025 IEEE International Conference on Autonomic Computing and Self-Organizing Systems Companion (ACSOS-C), Tokyo, Japan, 2025, pp. 148-153

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00282 2026-01-29 cs.AI cs.CL 62%

Mind the Gap: The Divergence Between Human and LLM-Generated Tasks

注意差距:人类与LLM生成任务之间的差异

Yi-Long Lu, Jiajun Song, Chunhui Zhang, Wei Wang

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究揭示了人类与LLM在任务生成中的核心差异,指出人类受心理驱动影响,而LLM在生成具身目标方面存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14398 2026-01-29 cs.CL 57%

YNTP-100: A Benchmark for Your Next Token Prediction with 100 People

YNTP-100: 一个用于下一步令牌预测的基准,包含100人

Shiyao Ding, Takayuki Ito

机构 * Kyoto University(京都大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 YNTP-100是一个包含100人的多语言对话基准,用于评估个性化响应生成的对齐方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20035 2026-01-29 econ.TH 50%

Obviously Strategy-Proof Multi-Dimensional Allocation and the Value of Choice

显然策略证明的多维分配与选择的价值

Quitzé Valenzuela-Stookey

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了主导者如何通过委托部分控制权给代理人来优化多维分配,并提出了一类显然策略证明的机制以提高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15301 2026-01-29 cond-mat.soft nlin.AO 50%

Collective behaviors of self-propelled particles with tunable alignment angles

具有可调对齐角度的自驱动粒子集体行为

Zichen Qin, Nariya Uchida

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种具有可调对齐角度的自驱动粒子模型,通过数值模拟发现其在特定参数范围内表现出反平行带等独特集体行为,揭示了多体相互作用对向列序的破坏作用。

Comments 7 pages, 5 figures

Journal ref Phys. Rev. E 113, 015411 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09407 2026-01-29 cs.MA 50%

Value-Enriched Population Synthesis: Integrating a Motivational Layer

价值增强的人口合成:整合动机层

Alba Aguilera, Miquel Albertí, Nardine Osman, Georgina Curto

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出价值增强的人口合成框架,通过整合动机层提升社会模拟中代理行为的决策机制,生成保留真实人口分布的合成人口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.06344 2026-01-29 cs.MA 50%

Modelleme ve Simulasyon

模型与仿真

Serdar Abut

专题命中 Agent评测 :agent(abstract)

AI总结 本书介绍了自1970年代以来的建模与仿真方法,涵盖社会科学、风险管理及云信息系统的应用,并总结了基于代理的仿真方法。

Comments in Turkish language. Published journal version available at the publisher website

Journal ref Teorik ve Uygulamali Muhendislik Calismalari, IKSAD, vol. 1, no. 1, pp. 135-156, Dec. 2021

详情

展开后加载摘要…

URL PDF HTML 收藏