Safety Alignment of LMs via Non-cooperative Games
通过非合作博弈实现语言模型的安全对齐
机构 * DeepMind, London, UK(深度Mind,伦敦,英国)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 提出将安全对齐建模为攻击者与防御者语言模型之间的非零和博弈,通过在线强化学习联合训练,迭代提升安全性与实用性。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
通过非合作博弈实现语言模型的安全对齐
机构 * DeepMind, London, UK(深度Mind,伦敦,英国)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 提出将安全对齐建模为攻击者与防御者语言模型之间的非零和博弈,通过在线强化学习联合训练,迭代提升安全性与实用性。
UniRTL:统一代码和图以实现稳健的RTL表示学习
机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong, Hong Kong SAR(计算机科学与工程系,香港中文大学,香港特别行政区) ; Noah's Ark Lab, Huawei, Hong Kong SAR(华为诺亚实验室,香港特别行政区)
专题命中 软件智能体 :workflow(abstract);分类 cs.LG
AI总结 提出UniRTL多模态预训练框架,通过互掩码建模和分层训练策略联合利用RTL代码与控制数据流图,实现细粒度对齐,在性能预测和代码检索任务上优于现有方法。
Comments Forty-Third International Conference on Machine Learning (ICML 2026)
学习的中继表示用于前向思考的离散扩散模型
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; University of Toronto(多伦多大学) ; Stanford University(斯坦福大学) ; Imperial College London(伦敦帝国学院) ; Mila ; Vijil
专题命中 软件智能体 :planning(abstract);分类 cs.LG
AI总结 提出Learned Relay Representations (Relay)方法,通过可微通道传递潜在信息,使掩码扩散模型在去噪步骤间前向思考,减少推理延迟并提升性能。
Comments 16 pages, 3 figures. Equal contribution: Benjamin Rozonoyer, Jacopo Minniti, and Dhruvesh Patel. Code: https://github.com/jacopo-minniti/relay
PictSure:预训练嵌入对上下文学习图像分类器至关重要
机构 * German Research Center for AI (DFKI)(德国人工智能研究中心(DFKI)) ; Centrum Wiskunde & Informatica (CWI)(数学与信息学研究中心(CWI))
专题命中 软件智能体 :agentic(abstract);分类 cs.AI
AI总结 本文提出PictSure视觉上下文学习模型,发现预训练嵌入质量是下游性能的关键瓶颈,而融合层训练数据的多样性影响有限。
Comments 10 pages, 2 figures
CompilerDream: 学习编译器世界模型以实现通用代码优化
机构 * School of Software, BNRist Tsinghua University Beijing China(软件学院、北师大清华大学北京中国) ; Tsinghua University(清华大学)
专题命中 软件智能体 :agent(abstract);分类 cs.LG
AI总结 提出基于模型的强化学习方法CompilerDream,通过编译器世界模型模拟优化pass属性并训练智能体,实现跨应用场景和语言的通用代码优化,在零样本泛化上超越LLVM内置优化。
Comments KDD 2025 camera-ready version with extended appendix. Code is available at https://github.com/thuml/CompilerDream. This update additionally fixes an issue in Table 6 where the dataset names in three rows were ordered incorrectly
DeepSurvey: 提升自动综述生成中的分析深度与引用可靠性
机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院X-LANCE实验室) ; Jiangsu Key Lab of Language Computing, Suzhou, China(江苏省语言计算重点实验室) ; Suzhou Laboratory, Suzhou, China(苏州实验室)
专题命中 软件智能体 :agentic(abstract);分类 cs.AI
AI总结 提出DeepSurvey智能体系统,通过结构化全文笔记、跨论文关系建模和代码仓库分析增强分析深度,结合引文图扩展与混合过滤、证据约束引用分配及多粒度智能体精炼提升引用可靠性,在内容质量和引用准确性上超越现有方法。
MigrationBench:从Java 8的仓库级代码迁移基准
专题命中 软件智能体 :agentic(abstract);分类 cs.SE
AI总结 提出MigrationBench基准,用于评估大语言模型在从Java 8迁移到Java 17/21的仓库级代码迁移任务上的表现,并设计了智能体框架实现高成功率。
面向智能体的查询引擎
机构 * Hyperparam(Hyperparam公司)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 提出一个轻量级、JS原生、支持异步SQL和LLM UDF的查询引擎Hyperparam,用于在AI应用中分析非结构化文本,性能优于DuckDB-WASM。
Comments 4 pages, 1 figure, 3 tables
GenSBI: 基于JAX的模拟推断生成方法
机构 * Instituto de Física Corpuscular (IFIC) Universitat de València & CSIC(粒子物理研究所(IFIC)瓦伦西亚大学 & 西班牙国家科研委员会)
专题命中 软件智能体 :workflow(abstract);分类 cs.LG
AI总结 提出GenSBI库,在JAX中实现流匹配、分数匹配和去噪扩散等生成模型,用于模拟推断,提供统一接口和多种Transformer架构,并在标准基准上达到接近理想的C2ST分数。
Comments 48 pages + 1 appendix, 33 figures, 18 tables. For the associated Python code, see https://github.com/aurelio-amerio/GenSBI
基于有限元分析反馈的自改进CAD生成智能体
机构 * Seoul National University(首尔国立大学) ; OneLineAI ; Sungkyunkwan University(成均馆大学) ; Ewha Womans University(成乙女子大学)
专题命中 软件智能体 :agent(abstract);分类 cs.CL
AI总结 提出一种以有限元分析为反馈的CAD生成框架,通过蓝图和渲染图监督信号提升多部件装配质量,使生成结果满足工程需求。
Comments Work in progress
结构治理的机械化基础:受治理智能的机器验证证明
机构 * Mashin, Inc.(Mashin公司)
专题命中 软件智能体 :workflow(abstract);分类 cs.AI
AI总结 本文通过Coq机械化证明和纸上证明,建立了认知工作流系统中结构治理的理论基础,包括共归纳安全谓词、治理不变性定理、充分性定理、交替范式、必要性定理,并通过属性测试验证了BEAM运行时与规范的一致性。
Comments 27 pages, 4 figures, 1 table. Code and proofs: https://github.com/mashin-live/governance-proofs. Project: https://mashin.live. v2: corrected cross-reference identifiers for companion papers. Updated license
可信软件项目生成:以交互式定理证明器为例的案例研究
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 本文研究利用交互式定理证明器(ITP)从自然语言需求自动生成大规模可信软件项目,通过将纯逻辑与有副作用的代码分离,在Rocq中完成验证并提取C++代码,成功生成一个RISC-V RV32I CPU解释器,证明了ITP作为LLM生成软件验证后端的可行性。
多项Logit模型的最优设计及其在最佳组合识别中的应用
机构 * Seoul National University, Seoul, Korea(首尔国立大学)
专题命中 软件智能体 :agent(abstract);分类 cs.LG
AI总结 针对多项Logit(MNL)模型,提出计算高效的最优实验设计框架,通过混合整数线性规划和多项式时间松弛方法实现统计效率与可扩展性,并应用于线性效用和非均匀收益下的最佳组合识别。
Comments Accepted at ICML 2026
CODESKILL:学习自进化技能的编码智能体
机构 * Nanyang Technological University(南洋理工大学) ; Zhejiang University(浙江大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 提出CODESKILL框架,通过强化学习从编码智能体轨迹中提取多粒度程序性技能并维护技能库,提升下游任务解决能力。
PR感知的自动化单元测试生成:挑战与机遇
专题命中 软件智能体 :agentic(abstract);分类 cs.SE
AI总结 本研究评估了EvoSuite和GPT-4o在拉取请求(PR)级别生成测试用例的能力,发现两者均难以有效生成捕获变更的测试,但EvoSuite优于GPT-4o,并指出智能体代码生成方法具有潜力。
将游戏代码世界模型生成蒸馏到轻量级大型语言模型
机构 * Brown University(布朗大学)
专题命中 软件智能体 :AI agent(abstract);分类 cs.AI
AI总结 研究通过后训练将游戏代码世界模型生成能力蒸馏到小型模型,采用监督微调和带可验证奖励的强化学习提升生成代码的语法正确性和规则遵循性。
EvoCode-Bench:评估多轮迭代交互中的编码智能体
机构 * UniPat AI ; Peking University(北京大学) ; Tsinghua University(清华大学) ; HKU(香港大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 提出EvoCode-Bench基准,通过多轮状态化任务和累积测试评估编码智能体在需求变化下维持代码库工作的能力,发现多轮指标远低于单轮指标,且最强智能体多轮成功率仅约50%。
Comments Work in Progress; 32 pages, 10 figures, preprint
MileStone:一种面向基于图的IR级优化的多目标编译器阶段排序框架
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 提出MileStone框架,将编译器阶段排序建模为多目标优化问题,利用图神经网络预测性能,并通过强化学习代理探索满足用户约束的优化序列,实现执行时间、代码大小和能耗的Pareto最优权衡。
评估LLM生成的领域特定语言代码:使用LAMMPS进行分子动力学模拟
专题命中 软件智能体 :agentic(abstract);分类 cs.SE
AI总结 提出一种评估流程,结合标准化、解析、低成本执行和准确性检查,系统评估LLM为分子动力学代码LAMMPS生成输入文件的有效性,发现当前模型在科学准确性上有限,但通过可复用的智能体技能可显著提升。
Comments 19 pages, 5 figures, Supporting Info, 27 total pages
我们距离用基础模型生成缺失模态还有多远?
机构 * Institute of Data Science and Intelligent Decision Support, Beijing Jiaotong University(数据科学与智能决策支持研究所,北京交通大学) ; School of Computing and Information Systems, Singapore Management University(计算与信息系统学院,新加坡管理大学) ; State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) ; School of Computer Science and Technology, Harbin Institute of Technology(计算机科学与技术学院,哈尔滨工业大学)
专题命中 软件智能体 :agentic(abstract);分类 cs.CL
AI总结 本文系统评估了基础模型在缺失模态重建中的三种范式,发现其在细粒度语义提取和生成模态验证方面存在不足,并提出一个包含模态感知挖掘和自精炼机制的智能框架,显著提升了重建质量。
Comments T-PAMI
CODE-SHARP: 连续开放发现和演化的技能作为层次奖励程序
机构 * Imperial College London(帝国理工学院伦敦分校) ; Sony Interactive Entertainment(索尼互动娱乐)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 该研究提出CODE-SHARP框架,通过基础模型自主发现和演化技能作为层次奖励程序,实现通用智能体政策的从零开始强化学习,无需预定义奖励,有效学习长周期技能。
Comments Preprint
Trace2Skill: 验证器引导的技能进化用于长上下文EDA代理
机构 * NVIDIA
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出Trace2Skill框架,通过验证器引导的技能进化提升硬件代理在复杂验证问题上的性能,无需RTL专用模型微调,通过密集验证器反馈实现任务通过率的显著提升。
自主大语言模型代理与CTF:再看一次
机构 * Politecnico di Torino(托尔托纳理工大学) ; Università di Torino(托尔托纳大学) ; Huawei Technologies France(华为法国技术)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 本文重新审视了大语言模型代理在自动化进攻性安全任务中的表现,通过在30个基于网络的CTF挑战中测试不同架构的代理,发现通用代理在性能上与定制架构相当,并揭示了当前代理在某些类别中的持续障碍。
Comments Accepted at DeMeSSAI Workshop @ IEEE EuroS&P 2026
Wikidata查询日志数据集
机构 * University of Freiburg(弗赖堡大学) ; University of Freiburg Department of Computer Science(弗赖堡大学计算机科学系)
专题命中 软件智能体 :agent(abstract);分类 cs.CL
AI总结 本文提出了一个包含335,000个问题-查询对的Wikidata查询日志(WDQL)数据集,该数据集通过真实世界中的SPARQL查询构建,无需模板生成查询,且规模是现有类似数据集的11倍多。通过代理方法去匿名化、清理和验证查询,生成对应的自然语言问题,用于训练问答方法。
Comments Accepted for publication at SIGIR 2026
何时回答,何时延迟:一种可靠代码预测的决策框架
专题命中 软件智能体 :workflow(abstract);分类 cs.SE
AI总结 本文提出了一种决策框架,用于在代码预测中可靠地判断何时回答何时延迟,通过整合不确定性估计、模型校准和工具基于的延迟处理,提高代码模型的可靠性。
Comments In Proceedings of the 48th IEEE/ACM International Conference on Software Engineering- New Idea and Emerging Results Track (ICSE-NIER 2026)
通过强化学习优化LLM代码生成的提示
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 本文提出了一种基于强化学习的框架,通过将提示优化视为序列决策问题,利用PPO代理结合直接生成、遗传词法突变和语义重写动作空间,指导由单元测试反馈获得的形状奖励,从而提升LLM代码生成的准确性。
基于大语言模型的代码对自然语言要求的静态验证:一项工业经验报告
专题命中 软件智能体 :workflow(abstract);分类 cs.SE
AI总结 本文提出一种基于大语言模型的两阶段工作流,用于在智能汽车网络安全案例中验证代码是否符合自然语言要求,通过引入结构化中间表示减少幻觉和输出变异,提升静态分析的准确性与解释性。
一个模型翻译它们所有:面向异构协作感知的通用任意到任意翻译
机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出UniTrans,一种通用任意到任意特征模态翻译模型,通过预训练一组翻译专家参数并学习其组合系数来实现零样本翻译,从而在OPV2V-H和DAIR-V2X数据集上实现了优于现有方法的性能。
Comments 19 pages, accepted at the 43rd International Conference on Machine Learning (ICML 2026)
MultiMat: 多模态程序合成用于基于过程的材料生成
机构 * University of Mannheim(曼海姆大学) ; Adobe Research(Adobe研究)
专题命中 软件智能体 :workflow(abstract);分类 cs.CL
AI总结 MultiMat利用大规模多模态模型实现多模态程序合成,提升生成过程材料图的效率与视觉质量,优于纯文本基线方法。
Comments Accepted at ICLR 2026 (poster)
Rule2DRC:用于DRC脚本合成的LLM代理基准测试
机构 * Department of Computer Science and Engineering, Seoul National University(首尔国立大学计算机科学与工程系) ; Neural Processing Research Center(神经处理研究所以) ; Samsung Electronics Co., Ltd(三星电子公司)
专题命中 软件智能体 :agent(abstract);分类 cs.LG
AI总结 Rule2DRC是一个大规模基准,用于评估DRC脚本生成代理,包含1000个规则到脚本任务和13921个用于执行评分的评估芯片布局。它提供了一种通过DRC执行结果衡量功能正确性的评估流程,并引入SplitTester生成区分性测试用例以提升Best-of-N选择性能。
Comments ICML 2026