arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-01-28 至 2026-01-28 共收录 86 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 9 篇

2601.13597 2026-01-28 cs.SE 85%

AI IDEs or Autonomous Agents? Measuring the Impact of Coding Agents on Software Development

AI集成开发环境还是自主代理?衡量编码代理对软件开发的影响

Shyam Agarwal, Hao He, Bogdan Vasilescu

专题命中 软件智能体 :autonomous agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.SE

AI总结 研究探讨了基于LLM的编码代理对软件开发的影响,发现其在提升开发速度方面效果有限,但对软件质量产生持续负面影响,强调了需加强质量保障和选择性部署自主代理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18418 2026-01-28 cs.SE cs.AI 84%

daVinci-Dev: Agent-native Mid-training for Software Engineering

daVinci-Dev:面向软件工程的代理原生中训练

Ji Zeng, Dayuan Fu, Tiantian Mi, Yumin Zhuang, Yaxing Huang, Xuefeng Li, Lyumanshan Ye, Muhang Xie, Qishuo Hua, Zhen Huang, Mohan Jiang, Hanning Wang, Jifan Lin, Yang Xiao, Jie Sun, Yunze Wu, Pengfei Liu

专题命中 软件智能体 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 daVinci-Dev通过代理原生数据合成和中训练方法,在软件工程中实现了更高效的代理能力,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19636 2026-01-28 cs.SE 70%

Who Said CVE? How Vulnerability Identifiers Are Mentioned by Humans, Bots, and Agents in Pull Requests

谁说CVE?人类、机器人和智能体在拉取请求中提及漏洞标识符的方式

Pien Rooijendijk, Christoph Treude, Mairieli Wessel

专题命中 软件智能体 :agent(abstract);autonomous agent(abstract);分类 cs.SE

AI总结 本文研究了人类、机器人和智能体在GitHub拉取请求中提及漏洞标识符的方式,发现机器人占多数提及,而人类和智能体则更广泛地用于修复和讨论。

Journal ref International Conference on Mining Software Repositories 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19055 2026-01-28 cs.LG cs.AI cs.CL stat.ML 67%

Principled Fine-tuning of LLMs from User-Edits: A Medley of Preference, Supervision, and Reward

基于用户修改的LLM原理化微调:偏好、监督与奖励的融合

Dipendra Misra, Aldo Pacchiano, Ta-Chung Chi, Ge Gao

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出了一种基于用户修改的LLM微调方法,通过融合偏好、监督和奖励反馈,提升模型在不同任务中的适应能力。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19367 2026-01-28 cs.CR cs.LG 57%

CHEHAB RL: Learning to Optimize Fully Homomorphic Encryption Computations

CHEHAB RL: 学习优化完全同态加密计算

Bilel Sefsaf, Abderraouf Dandani, Abdessamed Seddiki, Arab Mohammed, Eduardo Chielle, Michail Maniatakos, Riyadh Baghdadi

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校)

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 CHEHAB RL通过深度强化学习自动优化FHE代码,提升执行速度和减少噪声,编译过程更高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12360 2026-01-28 cs.SE 57%

Discovering 100+ Compiler Defects in 72 Hours via LLM-Driven Semantic Logic Recomposition

通过LLM驱动的语义逻辑重组发现100余项编译器缺陷

Xingbang He, Yuanwei Chen, Hao Wu, Jikang Zhang, Zicheng Wang, Ligeng Chen, Junjie Peng, Haiyang Wei, Yi Qian, Tiantai Zhang, Linzhang Wang, Bing Mao

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 FeatureFuzz通过语义逻辑重组发现编译器缺陷,有效提升模糊测试的多样性与发现能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00753 2026-01-28 cs.SE 57%

Early-Stage Prediction of Review Effort in AI-Generated Pull Requests

AI生成拉取请求中早期阶段的审查努力预测

Dao Sy Duy Minh, Huynh Trung Kiet, Nguyen Lam Phu Quy, Pham Phu Hoa, Tran Chi Nguyen, Nguyen Dinh Ha Duong, Truong Bao Tran

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本研究提出一种基于创建时间的电路断开模型,用于预测AI生成拉取请求的高维护需求,通过静态复杂性线索识别高成本贡献,提升维护效率。

Comments 5 pages, 4 figures. Accepted to the 23rd International Conference on Mining Software Repositories (MSR '26)

Journal ref 23rd International Conference on Mining Software Repositories (MSR '26), April 13-14, 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏

2. GUI与网页智能体 5 篇

2410.17520 2026-01-28 cs.LG cs.CL 81%

MobileSafetyBench: Evaluating Safety of Autonomous Agents in Mobile Device Control

MobileSafetyBench: 评估移动设备控制自主代理的安全性

Juyong Lee, Dongyoon Hahm, June Suk Choi, W. Bradley Knox, Kimin Lee

专题命中 GUI与网页智能体 :autonomous agent(title,abstract);分类 cs.CL、cs.LG

AI总结 MobileSafetyBench通过Android模拟器评估移动设备控制自主代理的安全性,揭示基于LLMs的代理在安全任务中存在缺陷,提出提示方法提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10809 2026-01-28 cs.CR cs.LG 79%

MIP against Agent: Malicious Image Patches Hijacking Multimodal OS Agents

针对代理的恶意图像补丁:多模态操作系统代理劫持

Lukas Aichberger, Alasdair Paren, Guohao Li, Philip Torr, Yarin Gal, Adel Bibi

机构 * Johannes Kepler University Linz(约翰内斯·开普勒大学林茨) University of Oxford(牛津大学)

专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.LG

AI总结 本文提出恶意图像补丁(MIPs)攻击,通过篡改屏幕区域使多模态OS代理执行有害操作,揭示了OS代理的安全漏洞。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18799 2026-01-28 cs.CY cs.AI cs.ET 79%

Agentic Digital Twins: A Taxonomy of Capabilities for Understanding Possible Futures

代理数字孪生:理解可能未来的能力分类

Christopher Burr, Mark Enzer, Jason Shepherd, David Wagg

机构 * The Alan Turing Institute(艾伦·图灵研究所) Mott MacDonald(莫特麦克劳林公司) Fujitsu Services Limited(富士通服务有限公司) University of Sheffield(谢菲尔德大学)

专题命中 GUI与网页智能体 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出代理数字孪生的能力分类,探讨其在不同配置下的表现力与本体重构潜力。

Comments 32 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19306 2026-01-28 cs.AI 70%

Curiosity Driven Knowledge Retrieval for Mobile Agents

基于好奇心的知识检索用于移动代理

Sijia Li, Xiaoyu Tan, Shahir Ali, Niels Schmidt, Gengchen Ma, Xihe Qiu

机构 * Shanghai University of Engineering Science(上海工程技术大学) National University of Singapore(新加坡国立大学)

专题命中 GUI与网页智能体 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 本研究提出一种基于好奇心的知识检索框架,通过结构化AppCards提升移动代理在复杂任务中的规划可靠性与执行稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21850 2026-01-28 cs.CV cs.CL 57%

SCoPE VLM: Selective Context Processing for Efficient Document Navigation in Vision-Language Models

SCoPE VLM:面向视觉语言模型高效文档导航的 selective context processing

Gyubeum Lim, Yemo Koo, Vijay Krishna Madisetti

机构 * Georgia Institute of Technology(佐治亚理工学院) Konkuk University(韩国康克伦大学)

专题命中 GUI与网页智能体 :agentic(abstract);分类 cs.CL

AI总结 SCoPE VLM通过引入滚动链机制和定制强化学习方法,实现高效文档导航,提升视觉语言模型在多页文档问答中的代理阅读能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 记忆与上下文管理 4 篇

2506.14852 2026-01-28 cs.DC cs.AI cs.CL cs.LG cs.PF 87%

Agentic Plan Caching: Test-Time Memory for Fast and Cost-Efficient LLM Agents

代理计划缓存:用于快速且低成本LLM代理的测试时间内存

Qizheng Zhang, Michael Wornow, Gerry Wan, Kunle Olukotun

机构 * Stanford University(斯坦福大学)

专题命中 记忆与上下文管理 :agentic(title,abstract);agent(abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 Agentic Plan Caching通过测试时间内存提取并重用结构化计划模板,降低LLM代理服务成本和延迟,提升效率。

Comments NeurIPS 2025. 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01857 2026-01-28 cs.AI 83%

Jenius Agent: Towards Experience-Driven Accuracy Optimization in Real-World Scenarios

Jenius Agent:迈向真实世界场景中的经验驱动准确性优化

Defei Xia, Bingfeng Pi, Shenbin Zhang, Song Hua, Yunfei Wei, Lei Zuo

专题命中 记忆与上下文管理 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI

AI总结 Jenius Agent通过整合自适应提示生成、上下文感知工具编排和分层记忆机制,提升智能体在真实世界场景中的执行稳定性和鲁棒性,实验显示任务完成率提升35%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19249 2026-01-28 cs.AI 70%

GLOVE: Global Verifier for LLM Memory-Environment Realignment

GLOVE:LLM内存-环境重对齐的全局验证器

Xingkun Yin, Hongyang Du

机构 * University of Hong Kong(香港大学)

专题命中 记忆与上下文管理 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 GLOVE通过引入相对真理的概念,实现LLM内存与环境的自适应重对齐,无需地面真相监督或强依赖模型反思,提升代理在动态环境中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03102 2026-01-28 cs.LG cs.AI stat.CO 62%

Dynamic Correction of Erroneous State Estimates via Diffusion Bayesian Exploration

通过扩散贝叶斯探索动态修正错误状态估计

Yiwei Shi, Hongnan Ma, Mengyue Yang, Cunjia Liu, Weiru Liu

机构 * University of Bristol(布里斯托大学) Loughborough University(洛桑大学)

专题命中 记忆与上下文管理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种扩散驱动的贝叶斯探索框架,用于动态修正早期状态估计误差,通过熵正则化采样和协方差缩放扩散扩展后验支持,解决S-PSI问题并保持统计严谨性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. Agent评测 10 篇

2601.19738 2026-01-28 quant-ph cs.AI cs.LG 62%

Quantum Circuit Pre-Synthesis: Learning Local Edits to Reduce $T$-count

量子电路预合成:学习局部编辑以减少T门数量

Daniele Lizzio Bosco, Lukasz Cincio, Giuseppe Serra, M. Cerezo

机构 * Department of Mathematics, Computer Science Physics, University of Udine, Udine, Italy Department of Biology, University of Naples Federico II, Naples, Italy Theoretical Division, Los Alamos National Laboratory, Los Alamos, New Mexico 87545, USA Quantum Science Center, Oak Ridge, TN 37931, USA Information Sciences, Los Alamos National Laboratory, Los Alamos, New Mexico 87545, USA

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 Q-PreSyn通过强化学习优化局部编辑,有效减少量子电路的T门数量,提升编译效率

Comments 10+5 pages, 10 figures, 3 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18827 2026-01-28 cs.SE cs.AI 62%

Automated structural testing of LLM-based agents: methods, framework, and case studies

基于大语言模型的智能体的自动化结构测试:方法、框架与案例研究

Jens Kohl, Otto Kruse, Youssef Mostafa, Andre Luckow, Karsten Schroer, Thomas Riedl, Ryan French, David Katz, Manuel P. Luitz, Tanrajbir Takher, Ken E. Friedl, Céline Laurent-Winter

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出基于大语言模型的智能体结构测试方法,通过跟踪、模拟和断言实现自动化测试,提升测试效率与质量。

Comments 10 pages, 5 figures. Preprint of an accepted paper at IEEE BigData 2025 (main track). Source code for the introduced methods and framework available at https://github.com/awslabs/generative-ai-toolkit

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19794 2026-01-28 cs.LG cs.SY eess.SY 57%

Component-Aware Pruning Framework for Neural Network Controllers via Gradient-Based Importance Estimation

面向神经网络控制器的组件感知剪枝框架:基于梯度的重要性估计

Ganesh Sundaram, Jonas Ulmen, Daniel Görges

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出一种基于梯度的重要性估计框架,用于神经网络控制器中的组件感知剪枝,通过梯度累积、Fisher信息和贝叶斯不确定性度量,提升压缩决策的准确性。

Comments 8 pages, Submitted to the 2026 IFAC World Congress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19583 2026-01-28 cs.SE 57%

Toward Architecture-Aware Evaluation Metrics for LLM Agents

迈向面向架构的LLM代理评估指标

Débora Souza, Patrícia Machado

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 本文提出了一种面向架构的LLM代理评估方法,通过连接代理组件与可观察行为及评估指标,提升评估的针对性和透明度。

Comments Accepted at CAIN 2026 (IEEE/ACM 5th International Conference on AI Engineering)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06917 2026-01-28 cs.LG cs.DS stat.ML 57%

Sample-Efficient Optimization over Generative Priors via Coarse Learnability

通过粗粒学习能力实现生成先验的高效优化

Pranjal Awasthi, Sreenivas Gollapudi, Ravi Kumar, Kamesh Munagala

机构 * Google Research(谷歌研究)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出粗粒学习能力假设,设计迭代算法在多项式样本内近似目标分布,为深度生成先验的基于模型优化提供样本复杂度保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19309 2026-01-28 cs.CV 50%

Beyond Shadows: A Large-Scale Benchmark and Multi-Stage Framework for High-Fidelity Facial Shadow Removal

超越阴影:一个大规模基准和多阶段框架用于高保真面部阴影去除

Tailong Luo, Jiesong Bai, Jinyang Huang, Junyu Xia, Wangyu Wu, Xuhang Chen

机构 * New York Institute of Technology(纽约理工学院) Shanghai University(上海大学) Central South University(中南大学) Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学) Huizhou University(惠州大学)

专题命中 Agent评测 :workflow(abstract)

AI总结 本文提出首个大规模真实世界面部阴影去除数据集ASFW,并引入FSE方法,通过实验验证其在提升阴影去除性能方面的有效性。

Comments Accepted by ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12589 2026-01-28 cs.HC 50%

Conversing with Objects toward Fluid Human and Artificial Identities during Life Transitions

与物体对话:在人生过渡期间实现流体的人工和人工身份

Yuhui Xu, Minha Lee, Stephan Wensveen, Mahla Alizadeh, Mathias Funk

专题命中 Agent评测 :agent(abstract)

AI总结 本文探讨通过聊天机器人与日常物品对话如何帮助人们在人生过渡期间实现流体的人工和人工身份。

Comments A preprint of an accepted CHI 2026 full paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04375 2026-01-28 cs.RO 50%

Studying the Effect of Explicit Interaction Representations on Learning Scene-level Distributions of Human Trajectories

研究显式交互表示对人类轨迹场景级分布学习的影响

Anna Mészáros, Javier Alonso-Mora, Jens Kober

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了显式交互表示对自动驾驶中人类轨迹场景级分布学习的影响,发现明确的交互定义能显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14947 2026-01-28 cs.HC cs.SD nlin.AO physics.pop-ph 50%

Echoes of the Land: An Interactive Installation Based on Physical Model of Earthquake

大地的回声:基于地震物理模型的互动装置

Ivan C. H. Liu, Chung-En Hao, Jing Xie

机构 * Future Narratives Lab(未来叙事实验室) Institute of Applied Arts(应用艺术研究所) National Yang Ming Chiao Tung University(阳明交通大学)

专题命中 Agent评测 :agent(abstract)

AI总结 《大地的回声》通过地震物理模型生成多感官互动体验,结合运动捕捉与颗粒合成,探索地震动力学与自组织临界性的可视化表现。

Comments 7 pages, 8 figures, submitted to Leonardo

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25554 2026-01-28 q-bio.PE 50%

Continuum models describing probabilistic motion of tagged agents in exclusion processes

连续模型描述排除过程中标记代理概率性运动

Michael J. Plank, Matthew J. Simpson

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出连续模型描述排除过程中标记代理的概率性运动,通过偏微分方程捕捉轨迹概率密度,揭示随机性作用并推广至多子群体。

Journal ref Physical Review E (2026), 113: 014137

详情

展开后加载摘要…

URL PDF HTML 收藏