Strained Coherence: A Pre-Failure Signal in Coding Agent Execution Trajectories
应变连贯性:编码代理执行轨迹中的故障前信号
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出“应变连贯性”模式,即编码代理识别到问题但仍按原计划行动,通过构建Claude Sonnet 4.6检测器在44条轨迹上实现94%故障预测精度,优于基线方法。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
应变连贯性:编码代理执行轨迹中的故障前信号
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出“应变连贯性”模式,即编码代理识别到问题但仍按原计划行动,通过构建Claude Sonnet 4.6检测器在44条轨迹上实现94%故障预测精度,优于基线方法。
构建用于HPC代码现代化的智能体AI
机构 * San Diego Supercomputer Center(圣地亚哥超级计算机中心) ; University of California, San Diego(加州大学圣地亚哥分校) ; La Jolla, California, United States(圣地亚哥, 加州, 美国)
专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.SE
AI总结 提出一种结构化智能体AI方法,通过手动示例、持续可构建性和限制会话范围,成功将6万行Fortran MPI代码在数月内转换为C++ OpenMP并行代码。
Comments 10 pages
AutoMegaKernel:用于自我重定目标超内核合成的静态检查代理框架
机构 * RightNow AI
专题命中 软件智能体 :agent(title,abstract);分类 cs.LG
AI总结 提出AutoMegaKernel系统,将Llama模型编译为单个持久CUDA内核,通过静态调度验证器确保无死锁和无竞争,自动生成10种模型正确超内核,并在NVIDIA推理卡上以W8A16精度超越cuBLAS bf16。
Comments 18 pages, 5 figures. Open-source code, data, and agent harness: https://github.com/RightNow-AI/AutoMegaKernel
TICoder: 一种具有测试驱动规划和实现感知复用的仓库级代码生成框架
专题命中 软件智能体 :planning(title,abstract);分类 cs.SE
AI总结 提出TICoder框架,通过测试驱动迭代规划机制和实现感知代码复用策略,解决仓库级代码生成中的依赖和上下文限制问题,在多个基准上平均提升11.52%。
Comments 11 pages
HDRAgent: 一种用于多曝光HDR成像的智能体框架
机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) ; Shenzhen Research Institute, Northwestern Polytechnical University(西北工业大学深圳研究院) ; Zhejiang University(浙江大学) ; Camera Group, DJI(大疆相机部门)
专题命中 软件智能体 :agentic(title);agent(abstract)
AI总结 提出首个智能体驱动的HDR成像框架HDRAgent,通过细粒度上下文知识匹配、感知-失真反馈机制和智能体引导的生成对齐策略,自适应选择重建策略,减少复杂动态场景中的鬼影和局部伪影。
QuickLAP: 为半自主代理快速语言-动作偏好学习
专题命中 软件智能体 :autonomous agent(title);分类 cs.AI
AI总结 本研究提出QuickLAP,一种融合物理和语言反馈的贝叶斯框架,用于实时推断奖励函数,通过大规模语言模型提取奖励特征注意力掩码和偏好偏移,从而在半自主驾驶模拟器中将奖励学习误差降低70%,并通过用户研究验证其可理解性和协作性。
超越准确率:智能体多块修复的行为动力学
专题命中 软件智能体 :agentic(title);分类 cs.SE
AI总结 研究LLM驱动的编码智能体在多块缺陷修复中的行为,通过404个多块bug的1616条修复轨迹分析定位、修复准确率、回归行为及操作动力学,发现修复准确率随bug分散度和复杂度下降,且失败修复消耗更多资源。
FASE: 用于代码质量的快速自适应语义熵
机构 * University of Waterloo(滑铁卢大学)
专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE
AI总结 提出快速自适应语义熵(FASE),通过最小生成树近似功能正确性,在HumanEval和BigCodeBench上相比现有语义熵方法在Spearman相关性和ROCAUC上分别提升25%和19%,且计算开销仅为传统方法的0.3%。
将遗留科学代码系统性地LLM翻译为可微分框架:以陆面模型为例
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; NASA Goddard Space Flight Center(国家航空航天局戈达德空间飞行中心)
专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 提出基于LLM的五阶段流水线,将遗留Fortran代码自动翻译为JAX可微分框架,在CLM-ml-v2模型上实现完整雅可比矩阵计算和24倍加速。
抗挫写入:一种六层耐用写入表面用于大语言模型编码代理
机构 * Sperixlabs, Ghana(塞普里克斯实验室,加纳) ; Kwame Nkrumah University of Science and Technology, Kumasi, Ghana(库马西技术大学,加纳) ; VIA Cybersecurity Lab, Kwame Nkrumah University of Science and Technology, Kumasi, Ghana(VIA网络安全实验室,库马西技术大学,加纳)
专题命中 软件智能体 :agent(abstract);tool-use(abstract);分类 cs.AI、cs.SE
AI总结 本文提出Resilient Write,通过六层耐用写入表面提升编码代理在文件写入时的容错能力,减少恢复时间并提高自我纠正率。
代码不仅仅是文本:代码生成的不确定性估计
机构 * Shanghai Jiao Tong University(上海交通大学) ; University of Cambridge(剑桥大学)
专题命中 软件智能体 :agentic(abstract);分类 cs.CL、cs.LG、cs.SE
AI总结 针对代码生成中错误程序的可靠性问题,提出基于词法、算法和功能三个正交轴的不确定性估计方法,在五个代码LLM上将AUROC提升8.1个百分点。
MOLOT系统卡:恶意操作逻辑观察变换器
机构 * False Positive Community
专题命中 软件智能体 :workflow(abstract);分类 cs.LG、cs.SE
AI总结 提出MOLOT系统,利用静态调用图的行为序列进行恶意代码检测,结合解释阶段定位可疑行为,在PyPI和npm包上评估,并发布Open Malicious-Code Bench基准。
Comments 13 pages, 3 figures
RepoLaunch:跨语言和平台的代码仓库构建与管理自动化
机构 * Microsoft(微软)
专题命中 软件智能体 :agentic(abstract);分类 cs.LG、cs.SE
AI总结 RepoLaunch通过自动化依赖解析、编译和测试结果提取,提升了多语言多平台代码仓库的构建效率,其构建成功率达78%,并展示了全自动SWE数据集创建流程。
Comments Under peer review. 22 pages, 5 figures, 9 tables
通过小型语言模型的代码重构实现高效技能落地
机构 * KAIST(韩国科学技术院)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 提出RECENT框架,通过将技能语义与执行绑定解耦,利用小型语言模型进行代码重构实现高效技能落地,在动态环境中达到与大型语言模型相当的性能。
Comments Accepted to ICML 2026
审查代码,而非故事:代码优先同行评审的愿景与协议
专题命中 软件智能体 :workflow(abstract);分类 cs.SE
AI总结 提出代码优先同行评审协议,由AI系统构建环境、执行实验并生成标准化审查包,将评审焦点从叙述转向可执行证据。
Comments 17 pages, vision and protocol paper
可执行世界模型在编码智能体时代的ARC-AGI-3应用
机构 * SingularityNET
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 提出一种编码智能体系统,通过维护可执行Python世界模型、验证观察、重构简化抽象和模型内规划,在ARC-AGI-3游戏中取得初步成果,GPT-5.5高推理下完全解决15个游戏。
Comments 13 pages. Accepted for publication at AGI-2026
Claude Code驱动的Argoverse 2挑战赛场景挖掘
机构 * Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 软件智能体 :agent(abstract)
AI总结 提出四阶段管道:Claude Code自主生成代码、迭代训练集筛选、语义代码审查和场景级验证,用于Argoverse 2场景挖掘挑战。
LongRTL:基于图相似性的LLM驱动的长上下文RTL优化
专题命中 软件智能体 :agent(abstract)
AI总结 提出一种基于图相似性的LLM驱动RTL优化框架,通过分区、优化和重构三个智能体解决长上下文RTL代码的优化问题。
Comments 7 pages, 6 figures, 5 tables, conference
Syll: 开源个人自动化与跨界面执行
机构 * Adobe Systems Inc.(Adobe系统公司) ; Stardew Valley(《星露谷物语》) ; macOS ; University of Science and Technology of China(中国科学技术大学)
专题命中 GUI与网页智能体 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 提出开源多模态智能体框架Syll,通过统一API、CLI和GUI控制,支持用户演示教学和可审计执行,实现跨界面个人自动化。
Comments Code: https://github.com/THU-SAGE/syll
Web 智能体应使用类型化动作而非基于点击的浏览
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 GUI与网页智能体 :workflow(abstract);agentic(abstract);分类 cs.AI
AI总结 本文提出通过语义层支持的类型化动作(web verbs)替代低层交互原语,以构建可靠、可审计的Web智能体,并通过案例展示其优势。
Comments Accepted to the ICML 2026 Position Paper Track
AliyunConsoleAgent:通过蒸馏和强化学习在真实云环境中训练Web智能体
机构 * Alibaba Cloud China(阿里云中国)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 提出AliyunConsoleAgent框架,通过蒸馏前沿模型轨迹进行监督微调,再结合GRPO和双通道结果奖励模型在真实云环境中强化学习,实现文档验证自动化,以低成本达到接近前沿专有模型的成功率。
RunAgent SuperBrowser: 基于人类浏览行为的自主网页导航理论
机构 * RunAgent AI
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 提出SuperBrowser自主网页导航代理,通过模仿人类浏览的感知-认知-行动三元机制,在Mind2Web Hard基准上以89.47%成功率超越现有开源研究代理。
Comments 31 pages, 8 figures, preprint/work in progress
IR-SIM:一种用于导航、学习和基准测试的轻量级技能原生模拟器
机构 * The University of Hong Kong(香港大学) ; Shenzhen Institutes of Advanced Technology(深圳先进技术研究院) ; Southern University of Science and Technology(南方科技大学) ; University of Michigan(密歇根大学) ; University of Macau(澳门大学)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.LG
AI总结 提出轻量级技能原生导航模拟器IR-SIM,通过YAML配置完全定义场景,支持文本提示生成与修改,用于导航算法基准测试和训练数据自动生成,并桥接高保真模拟器和真实部署。
Comments 12 pages, 6 figures, project website: https://github.com/hanruihua/ir-sim
MIRAGE: 具有隐式推理和生成世界模型的移动智能体
机构 * Beihang University(北京航空航天大学) ; Northwestern Polytechnical University(西北工业大学) ; Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; National University of Singapore(新加坡国立大学) ; Peking University(北京大学)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 提出MIRAGE框架,通过从显式推理轨迹学习连续潜在表示,使移动智能体能够内部推理并预测未来屏幕状态,在减少生成token的同时提升执行效率。
VGP-Nav:用于机器人导航的度量感知视觉几何感知
机构 * Southern University of Science and Technology(南方科技大学) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; Shenzhen University(深圳大学) ; SpatialTemporal AI(时空人工智能)
专题命中 GUI与网页智能体 :planning(abstract)
AI总结 提出VGP-Nav,一种仅依赖单目RGB输入的框架,通过地面平面几何约束解决尺度模糊,实现度量定位与障碍物感知的统一。
LLM Agent系统中的静默故障:熵原理与自主智能体的不可避免的无序性
专题命中 记忆与上下文管理 :agent(title,title_cn);autonomous agent(title,abstract)
AI总结 通过分析4万次受控试验和10万次生产交互,发现LLM agent系统存在无外部触发的静默故障,提出熵原理S(t)=S0*e^(αt)描述无序累积,并设计PIG引擎与ADE协议套件作为工程对策。
Comments 10 pages, 7 figures
DeltaBox: 通过毫秒级沙箱检查点/回滚扩展状态化AI代理
机构 * Institute of Parallel and Distributed Systems, Shanghai Jiao Tong University(并行与分布式系统研究所,上海交通大学) ; Engineering Research Center for Domain-specific Operating Systems, Ministry of Education, China(领域特定操作系统工程研究中心,中华人民共和国教育部,中国) ; Huawei Technologies Co., Ltd(华为技术有限公司)
专题命中 记忆与上下文管理 :AI agent(title,abstract);agent(abstract);分类 cs.AI
AI总结 本文提出DeltaBox,一种通过DeltaFS和DeltaCR机制实现毫秒级检查点/回滚的新型AI代理沙箱,解决了传统方法在高频状态探索中的延迟问题。
TAME: 一种可信的智能体记忆测试时演化与系统化基准测试
机构 * East China Normal University(东华师范大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Key Laboratory of Computer Software Evaluating and Testing(上海计算机软件评测与测试重点实验室) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI、cs.LG
AI总结 提出TAME框架,通过执行器-评估器循环实现记忆的可信演化,解决良性任务演化中智能体可信度下降问题,在GPT-5.2 AIME上准确率提升14.6个百分点。
媲美Transformer:用于智能体6G O-RAN的多尺度结构化状态空间混合模型
专题命中 记忆与上下文管理 :agentic(title,abstract)
AI总结 针对6G O-RAN中多时间尺度动态下的近实时控制需求,提出轻量级多尺度结构化状态空间混合模型(MS3M),通过HiPPO-LegS核混合和双线性离散化实现高效时序预测,在保持精度前提下将推理延迟降至Transformer的1/3至1/10。
Comments 12 pages, 2 Figures, 5 Tables
语义法定数保证:面向非确定性AI基础设施的集体认证
机构 * OpenKedge.io
专题命中 记忆与上下文管理 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 提出语义法定数保证(SQA),一种通过多样化验证者群体和风险自适应法定数谓词,将非确定性LLM代理的不安全操作批准率从18.5%降至0.3%的控制平面原语。
Comments 21 pages, 2 figures, 6 tables