SWE-Manager: Selecting and Synthesizing Golden Proposals Before Coding
SWE-Manager:编码前选择并合成黄金方案
专题命中 软件智能体 :workflow(abstract);分类 cs.SE
AI总结 研究软件工程中提案选择问题,引入SWE-Manager方法,通过强化学习训练8B模型进行提案比较、选择及合成黄金方案,在基准测试中表现优异,并设计框架评估其在实际问题解决中的有效性。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
SWE-Manager:编码前选择并合成黄金方案
专题命中 软件智能体 :workflow(abstract);分类 cs.SE
AI总结 研究软件工程中提案选择问题,引入SWE-Manager方法,通过强化学习训练8B模型进行提案比较、选择及合成黄金方案,在基准测试中表现优异,并设计框架评估其在实际问题解决中的有效性。
ToolRosella: 将代码仓库翻译为科学智能体的标准化工具
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 提出ToolRosella框架,通过仓库分析、工具接口构建、执行测试和迭代修复,自动将异构科学代码仓库转化为标准化、可被智能体调用的工具,在122个仓库上达到61.5%的转换成功率,下游任务成功率为84.0%。
Comments 20 pages
BadRobot: 在物理世界中越狱具身LLM智能体
机构 * Huazhong University of Science and Technology(华中科技大学) ; Beihang University(北航) ; Griffith University(格里菲斯大学)
专题命中 软件智能体 :planning(abstract);分类 cs.AI
AI总结 提出BadRobot攻击范式,利用LLM在机器人系统中的操纵、语言输出与物理动作的错位以及世界知识缺陷三个漏洞,通过语音交互使具身LLM执行有害行为,并在基准测试中验证了有效性。
Comments Accepted to ICLR 2025. Please cite the conference version. Project page: https://Embodied-LLMs-Safety.github.io
Journal ref International Conference on Learning Representations (ICLR) 2025
可执行世界模型在编码智能体时代的ARC-AGI-3应用
机构 * SingularityNET
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 提出一种编码智能体系统,通过维护可执行Python世界模型、验证观察、重构简化抽象和模型内规划,在ARC-AGI-3游戏中取得初步成果,GPT-5.5高推理下完全解决15个游戏。
Comments 13 pages. Accepted for publication at AGI-2026
RAVEN: 用于用户代码和二进制程序中内存损坏分析的检索增强漏洞探索网络
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 提出RAVEN框架,结合LLM代理与检索增强生成,自动生成遵循Google Project Zero模板的漏洞分析报告,在105个样本上平均质量得分54.21%。
信任但要验证?揭示自主编码代理的安全债务
专题命中 软件智能体 :agent(abstract);agentic(comments)
AI总结 本文利用AIDev数据集,通过大语言模型评判框架和人工分析,研究自主编码代理生成拉取请求中的安全代码异味。发现38.9%的请求含安全异味,供应链问题和硬编码凭证占比高,揭示了安全风险及开发者警惕性降低问题,强调需实施上下文感知安全护栏。
Comments Accepted at the KDD 2026 Workshop on Agentic Software Engineering (AgenticSE)
展示chart-plot:弥合学术图表生成的最后一英里
专题命中 软件智能体 :agentic(abstract,comments)
AI总结 提出chart-plot系统,通过风格感知代码生成、部署感知渲染循环和结构化编辑层,解决学术图表从代码到发表的质量差距问题。
Comments 7 pages, 6 figures. Submitted to the VLDB ADS 2026 Workshop: The Joint Workshop on Agentic Data Systems and Data-Centric AI
r2py:用于AI辅助将R统计包转换为Python的框架
专题命中 软件智能体 :agentic(abstract)
AI总结 本文提出r2py,这是Claude Code环境中首个七阶段AI辅助方法,可将R包系统转换为数值保真的原生Python库,在KernSmooth包上实现的r2py_kernsmooth通过518项测试,有效数字一致性达6-10位。
Comments v2: substantially extended. Adds a second case study (rpart) reached through R's .Call() interface, and a five-phase prologue reconstructing the portion of R's C API the package uses so its original C compiles without R. v1 covered KernSmooth only. Title shortened
用于模拟真实城市几何中住宅入室盗窃的有限元框架
专题命中 软件智能体 :agent(abstract)
AI总结 本文提出一种有限元框架,将基于智能体的概率入室盗窃模型转化为PDE模型,采用解耦方案求解,经芝加哥市真实几何测试,鲁棒高效且开源,为多尺度多物理场模型研究奠基。
面向全自动铁路运行的GitOps驱动标注目录
专题命中 软件智能体 :workflow(abstract)
AI总结 针对全自动铁路运行的标注数据管理难题,提出基于GitOps的轻量级元数据管理架构,结合Data-as-Code、CI/CD与SSG,实现以开发者为中心的工作流,保障可追溯性与合规性并自动生成数据集概览。
Journal ref 16th International Conference on Advanced Computer Information Technologies in Zlín, Czech Republic, 2026
独立复杂或维伯犯罪?探索生成AI工具、编码助手和代理在网络犯罪生态系统中的采用与创新
专题命中 软件智能体 :agentic(abstract)
AI总结 本文通过创新理论和演化经济学分析网络犯罪生态系统,提出独立复杂和维伯犯罪概念,发现AI在现有低利润方案中有早期应用,但未造成广泛破坏。
Comments Updated with results on developments in the first half of 2026
SATLOCK:用于低地球轨道星座上抗天气量子密钥分发的切换耦合调度
专题命中 软件智能体 :agent(abstract)
AI总结 研究低地球轨道卫星星座上量子密钥分发路由难题,提出SATLOCK框架,结合综合信道模型、整数线性规划和去中心化深度Q网络,评估不同竞争模式下性能,ILP给出吞吐量上限,DQN智能体学习策略但受跨需求协调限制。
SymFT:基于符号Clifford–Pauli框架和稳定子坐标的通用容错量子电路模拟
专题命中 软件智能体 :planning(abstract)
AI总结 SymFT是一款高吞吐量容错量子电路模拟器,通过符号Clifford–Pauli框架分解和自适应稳定子坐标规划优化采样,在多种量子电路上实现了比Stim、Clifft、SOFT更优的采样性能。
Comments 28 pages, 1 figure, 5 tables; v2: update benchmark results and related work. SymFT is the second-generation successor to SOFT, see GitHub repository: https://github.com/haoliri0/SOFT
MadAgents通过智能代理提升MadGraph的使用效率
专题命中 软件智能体 :agentic(abstract)
AI总结 MadAgents通过智能代理提升MadGraph的使用效率,简化了高能物理模拟流程,并加速了LHC研究。
Comments 59 pages, 3 figures, 1 table. v3: includes a Claude Code implementation with a self-improvement loop
视觉目标姿态估计的不确定性量化
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 软件智能体 :planning(abstract)
AI总结 SLUE通过凸优化方法为视觉目标姿态估计提供高概率的椭球不确定性界,有效缩小平移界限并保持方向精度。
Comments 18 pages, 9 figures. Code available: https://github.com/MIT-SPARK/PoseUncertaintySets. Published in IEEE Transactions on Robotics
一种更精确的有理非交换算法用于使用48次乘法的4x4矩阵乘法
专题命中 软件智能体 :agent(abstract)
AI总结 本文提出一种更精确的4x4矩阵乘法算法,使用48次非交换乘法,改进了误差界指数并提升了实际精度。
整合建模TRANSP代码对托卡马克等离子体的预测能力
专题命中 软件智能体 :workflow(abstract)
AI总结 本文探讨TRANSP代码在预测托卡马克等离子体中的能力,重点介绍PT_SOLVER模块和高保真T3D/GX框架的开发,用于基于高保真gyrokinetic模型的湍流输运预测。
基于语音AI的可扩展与个性化口头评估
专题命中 软件智能体 :agent(abstract)
AI总结 本文提出利用语音AI进行个性化口头评估,通过Viva系统实现高效评估,降低成本,并发现需分解模块、约束行为、保持随机化、多模型评分等改进方法。
Comments 34 pages, 6 figures, 9 tables. Author's version of a paper published in Communications of the ACM
Journal ref Communications of the ACM (2026)
TANDE:在与年轻人的情感人工智能-虚拟化身对话中区分言语和非言语反馈渠道
专题命中 软件智能体 :agent(abstract)
AI总结 研究在与年轻人的情感人工智能-虚拟化身对话中反馈渠道模式的影响,引入TANDE这个由LLM驱动的ECA,通过实验探讨其对融洽关系、同理心和参与度的作用及性别差异,得出相关设计启示。
Comments This paper has been accepted for publication at the 28th ACM International Conference on Multimodal Interaction (ICMI 2026)
混合视觉与文本代码
专题命中 软件智能体 :workflow(abstract)
AI总结 本文提出Hybrid ClojureScript,一种混合编程语言,允许开发者结合视觉和文本语法表达领域特定概念,同时保持静态推理和工作流程流畅。
Comments to be published in JFP
Journal ref Journal of Functional Programming, Volume 36 (August 9, 2026) jfp:17766
公平稳定资源共享的动态访问定价控制
专题命中 软件智能体 :autonomous agent(abstract)
AI总结 研究不同价格敏感度用户在动态定价下的共存问题,提出基于非单调价格函数的新动态定价方案,该方案能让各类用户更公平共存,通过研究非线性常微分方程刻画平衡点及吸引域,数值模拟验证了方案有效性。
Comments 41 pages, 7 figures
C-BerryTrans:用于贝里曲率驱动反常霍尔和能斯特电导率第一性原理计算的C++代码
专题命中 软件智能体 :workflow(abstract)
AI总结 研究利用C++代码C-BerryTrans进行贝里曲率驱动的反常霍尔和能斯特电导率第一性原理计算,通过提取数据、评估曲率并并行化处理,在多种铁磁材料上测试,结果与报告数据相符,为相关研究提供有力工具。
Comments arXiv admin note: substantial text overlap with arXiv:2504.00123, arXiv:2505.19280
代码语义缩放
专题命中 软件智能体 :agent(abstract)
AI总结 提出基于伪代码的CodeZoom方法,通过多层语义抽象迭代探索、理解和优化代码,在用户研究中相比Claude Code显著提升代码理解与控制感。
骨骼的新视角:X射线和超声中的鲁棒姿态估计
机构 * Medical Informatics, University of Lübeck(吕贝克大学医学信息学系) ; Institut of Radiology and Nuclear Medicine, University Hospital Schleswig-Holstein(石勒苏益格-荷尔斯泰因大学医院放射学与核医学研究所) ; Paediatric Surgery, University Hospital Schleswig-Holstein(石勒苏益格-荷尔斯泰因大学医院小儿外科) ; EchoScout GmbH
专题命中 软件智能体 :planning(abstract)
AI总结 提出基于学习的关键点候选和鲁棒线模型(RANSAC、霍夫变换)的自动骨骼姿态估计方法,在儿科骨折和髋关节发育不良评估中达到临床可接受的误差并优于地标方法。
Comments Accepted at MIUA 2026 (oral presentation); Code and annotations for fracture angle assessment in radiographs: https://github.com/multimodallearning/RobustBonePoseEstimation
OmniRobotHome:一个多摄像头平台用于实时多对多人机交互
机构 * Seoul National University(首尔国立大学) ; RLWRLD
专题命中 软件智能体 :agent(abstract)
AI总结 OmniRobotHome通过多摄像头和双Franka机械臂实现多对多人机协作的实时3D感知与协同动作,解决了近距离交互中的遮挡和状态变化问题,为多对多协作实验提供了可行平台。
Comments Project Page: https://junc0ng.github.io/omnirobothome
数值相对论代码AMSS-NCKU的用户友好型Python接口
专题命中 软件智能体 :workflow(abstract)
AI总结 为数值相对论代码AMSS-NCKU开发用户友好的Python接口,实现模拟初始化、执行和输出数据可视化的自动化,降低技术门槛,并通过双黑洞和三黑洞并合示例验证其有效性。
Comments 14 pages, 4 figures, 1 appendix. V2: minor revisions; V3: formulas used to exact gravitational waves were added; V4: modifying some background discussions and figures; V5: published version
Journal ref Astronomy and Computing 55 (2026) 101093
当小问题重要时:基于相似性观点动力学中的对称性、多元性与极化
专题命中 软件智能体 :agent(abstract)
AI总结 通过随机主体模型研究议题权重异质性对观点演化的影响,发现极小权重议题可破坏稳定态,增加收敛时间,并基于对称性分类揭示极化与议题重要性分布的关系。
Comments The supplement is provided as a pdf
GCD: 乱码、修正、证明——修复并验证Go语言的扩展GCD实现
专题命中 软件智能体 :AI agent(abstract)
AI总结 本文修复了Go标准库中extendedGCD实现的两个偏差,并使用Gobra和Lean进行了形式化验证,证明了正确性和终止性,同时发现AI代理可辅助验证过程。