arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2025-12-23 至 2025-12-23 共收录 3 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 3 篇

2512.10713 2025-12-23 cs.SE cs.AI 62%

PACIFIC: a framework for generating benchmarks to check Precise Automatically Checked Instruction Following In Code

PACIFIC:用于检查精确自动指令遵循的代码基准生成框架

Itay Dreyfuss, Antonio Abu Nassar, Samuel Ackerman, Axel Ben David, Eitan Farchi, Rami Katan, Orna Raz, Marcel Zalmanovici

机构 * IBM Research(IBM研究)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 PACIFIC框架通过生成具有明确预期输出的基准,评估LLM在代码指令遵循和dry运行能力上的表现,提供了一种抗污染且可扩展的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14757 2025-12-23 cs.SE cs.AI 62%

SWE-Synth: Synthesizing Verifiable Bug-Fix Data to Enable Large Language Models in Resolving Real-World Bugs

SWE-Synth:合成可验证的bug修复数据以使大语言模型能够解决现实中的bug

Minh V. T. Pham, Huy N. Phan, Hoang N. Phan, Cuong Le Chi, Tien N. Nguyen, Nghi D. Q. Bui

机构 * FPT Software AI Center, Viet Nam(越南FPT软件AI中心) Nanyang Technological University, Singapore(新加坡南洋理工大学) University of Texas at Dallas, US(美国德克萨斯大学达拉斯分校)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 SWE-Synth通过合成可验证的bug修复数据集,提升大语言模型在解决现实bug中的性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11068 2025-12-23 cs.LG cs.DC cs.SE 62%

A Reinforcement Learning Environment for Automatic Code Optimization in the MLIR Compiler

为MLIR编译器自动代码优化设计的一种强化学习环境

Mohammed Tirichine, Nassim Ameur, Nazim Bendib, Iheb Nassim Aouadj, Bouchama Djad, Rafik Bouloudene, Riyadh Baghdadi

机构 * New York University Abu Dhabi(纽约大学阿布扎赫尔分校) ESI(埃斯国际研究所) USTHB(阿尔及利亚国家技术与高等理工学院)

专题命中 软件智能体 :agent(abstract);分类 cs.LG、cs.SE

AI总结 本文提出MLIR RL,一种为MLIR编译器设计的强化学习环境,用于自动代码优化,通过多离散动作空间和level pointers方法提升策略学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏