arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-01-19 至 2026-01-19 共收录 7 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 7 篇

2601.10343 2026-01-19 cs.CL cs.AI 81%

OctoBench: Benchmarking Scaffold-Aware Instruction Following in Repository-Grounded Agentic Coding

OctoBench:面向仓库基础代理编程的支架意识指令遵循基准测试

Deming Ding, Shichun Liu, Enhui Yang, Jiahang Lin, Ziying Chen, Shihan Dou, Honglin Guo, Weiyu Cheng, Pengyu Zhao, Chengjun Xiao, Qunhong Zeng, Qi Zhang, Xuanjing Huang, Qidi Xu, Tao Gui

机构 * Fudan University(复旦大学) MiniMax Peking University(北京大学)

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 OctoBench通过评估仓库基础代理编程中的支架意识指令遵循能力,揭示了任务解决与合规性之间的差距,推动更高效的编码代理发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18852 2026-01-19 cs.SE 79%

What Drives Issue Resolution Speed? An Empirical Study of Scientific Workflow Systems on GitHub

是什么驱动了问题解决速度?对GitHub上科学工作流系统的实证研究

Khairul Alam, Banani Roy

专题命中 软件智能体 :workflow(title,abstract);分类 cs.SE

AI总结 本文通过实证研究分析了GitHub上科学工作流系统中问题解决速度的影响因素,发现标签和分配问题等机制与更快的解决速度相关,并提出了改进建议。

Comments 7

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11421 2026-01-19 cs.RO cs.AI 74%

The Great March 100: 100 Detail-oriented Tasks for Evaluating Embodied AI Agents

伟大的百日行进100:100个注重细节的任务用于评估具身体验人工智能代理

Ziyu Wang, Chenyuan Liu, Yushun Xiang, Runhao Zhang, Qingbo Hao, Hongliang Lu, Houyu Chen, Zhizhong Feng, Kaiyue Zheng, Dehao Ye, Xianchao Zeng, Xinyu Zhou, Boran Wen, Jiaxin Li, Mingyu Zhang, Kecheng Zheng, Qian Zhu, Ran Cheng, Yong-Lu Li

机构 * SJTU(上海交通大学) SII(上海人工智能研究院) Robbyant

专题命中 软件智能体 :AI agent(title);分类 cs.AI

AI总结 GM-100通过100个精心设计的任务全面评估具身体验人工智能代理的能力,推动机器人数据集任务设计的多样性和复杂性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09122 2026-01-19 cs.SE cs.AI 62%

Vendor-Aware Industrial Agents: RAG-Enhanced LLMs for Secure On-Premise PLC Code Generation

面向供应商的工业代理:增强型LLM用于安全本地PLC代码生成

Joschka Kersting, Michael Rummel, Gesa Benndorf

机构 * Centre for Machine Learning(机器学习中心) Fraunhofer IOSB-INA(弗劳恩霍夫IOSB-INA研究所) FA-EDC Mitsubishi Electric Europe(三菱电机欧洲)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出了一种基于RAG增强的LLM方法,用于在低数据域中安全生成本地PLC代码,通过提示工程和定向检索提升代码生成质量。

Comments ICIT2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10773 2026-01-19 cs.SE cs.AI 62%

LogicLens: Leveraging Semantic Code Graph to explore Multi Repository large systems

LogicLens: 通过语义代码图探索多仓库大型系统

Niko Usai, Dario Montagnini, Kristian Ilianov Iliev, Raffaele Camanzo

机构 * Sourcesense

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 LogicLens通过构建语义多仓库图,帮助开发者探索复杂软件系统,支持自然语言交互和动态检索子图,实现领域逻辑和运行时行为的分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.17380 2026-01-19 cs.AI cs.LG 62%

Traffic expertise meets residual RL: Knowledge-informed model-based residual reinforcement learning for CAV trajectory control

交通专家与残差强化学习相遇:基于知识的模型驱动残差强化学习用于智能交通车辆轨迹控制

Zihao Sheng, Zilin Huang, Sikai Chen

机构 * Department of Civil and Environmental Engineering, University of Wisconsin-Madison, Madison, WI, 53706, USA(土木与环境工程系,威斯尼大学麦迪逊分校)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于知识的模型驱动残差强化学习框架,用于智能交通车辆轨迹控制,结合交通专家知识与传统控制方法,提升学习效率与交通流平滑度。

Comments Accepted by Communications in Transportation Research

Journal ref Communications in Transportation Research 4 (2024): 100142

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11510 2026-01-19 cs.LO cs.SE 57%

Applying Formal Methods Tools to an Electronic Warfare Codebase (Experience report)

将形式方法工具应用于电子战代码库(经验报告)

Letitia W. Li, Denley Lam, Vu Le, Daniel Mitchell, Mark J. Gerken, Robert B. Ross

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 本文报告了将形式方法工具应用于电子战系统中的经验,探讨了工具可用性及漏洞检测比较,并提出改进建议。

详情

展开后加载摘要…

URL PDF HTML 收藏