Training Fast Robot Policies with Slow Foundation Models
用慢速基础模型训练快速机器人策略
专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.LG
AI总结 本文提出VGRS方法,通过利用慢速基础模型训练快速机器人策略,结合LLM生成奖励与视觉分析诊断,提升机器人在复杂任务中的表现和部署效率。
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
用慢速基础模型训练快速机器人策略
专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.LG
AI总结 本文提出VGRS方法,通过利用慢速基础模型训练快速机器人策略,结合LLM生成奖励与视觉分析诊断,提升机器人在复杂任务中的表现和部署效率。
跨Transformer深度的残差流几何分析
机构 * ProRata AI(ProRata人工智能公司)
专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG
AI总结 研究跨Transformer深度的残差流几何规律,提出以转换为中心的分析方法,通过相对位移等测量揭示规律,如相对位移与层有关、旋转幅度恒定等,构建了测量框架,表明深度曲线依赖模型且条件稳定。
验证、修复、重复还是停止?大语言模型代理中用于有噪声验证-修复循环的稳健停止方法
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI
AI总结 研究大语言模型代理中验证-修复循环有噪声时缺乏停止原则的问题,提出VRR-Stop框架,通过四参数噪声模型和信念过滤估计有效性,依真实边际增益符号决策,配对VRR-Guard,提升了停止可靠性与真实有效性。
Comments 18 pages, 10 figures, 10 tables. Under review
OMAC:一种面向基于大语言模型的多智能体协作的综合优化框架
机构 * Department of Electrical and Computer Engineering, The University of Texas at Austin, Austin, United States(得克萨斯大学奥斯汀分校电子与计算机工程系) ; Intuit AI Research, Mountain View, United States(Intuit AI研究)
专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG
AI总结 本文提出OMAC框架,通过五个关键优化维度提升基于大语言模型的多智能体系统性能,采用语义初始化器和对比比较器算法实现单维和多维联合优化。
Comments Accepted as a Oral paper at ICML 2026
NL2LOGIC: 基于抽象语法树的自然语言到一阶逻辑翻译框架
机构 * Virginia Tech(弗吉尼亚理工大学) ; Universitas Ary Ginanjar(阿里·金纳jar大学)
专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI
AI总结 NL2LOGIC通过引入抽象语法树,结合递归大语言模型和生成器,实现了高准确性的自然语言到一阶逻辑转换,提升了逻辑求解的准确性和可执行性。
Comments Accepted to Findings of EACL 2026. 17 pages, 6 figures
Journal ref 2026.findings-eacl.317
基于大语言模型的代理系统在软件工程中的应用:挑战与机遇
机构 * Siemens AG(西门子股份公司) ; Technical University of Munich(慕尼黑技术大学)
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI
AI总结 本文探讨了基于大语言模型的多代理系统在软件工程中的应用,分析了其挑战与未来研究方向。
Comments Accepted to GenSE 2026 workshop
定义和评估大语言模型的物理安全性
机构 * The Chinese University of Hong Kong(香港中文大学) ; IBM Research(IBM研究院)
专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种无人机控制的全面基准,评估大语言模型在物理安全方面的风险与权衡,揭示了模型在安全性和实用性之间的不理想平衡。
Journal ref Communications of the ACM, 2026
使用Copilot进行注释:学生代码生成规范的分类法和多年分析
机构 * University of Auckland(奥克兰大学) ; University of New South Wales(新南威尔士大学)
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI
AI总结 研究人工智能代码工具融入编程环境下学生代码生成规范,通过分析四年数据集,引入涵盖注释类型、代码表达水平和代码结构的分类法,用自动分类研究维度变化及学生反思,发现学生注释特点及关注点。
Comments 7 pages, 2 figures, 2 tables. Accepted in the Proceedings of the 2nd ACM Virtual Global Computing Education Conference (SIGCSE Virtual 2026)
具有可验证物理的强化学习:具有连续奖励的训练后语言模型
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG
AI总结 研究针对偏微分方程求解器代码生成,引入RLVP强化学习训练后框架,通过混合验证器解决可验证性问题,在多PDE族训练单个策略,优于基线且有零样本改进转移,训练后小LLM表现良好,策略有组合性证据。
LLMlambda 计算:人工智能代理、对话与信息流
机构 * University of Nottingham, UK(诺丁汉大学) ; University of Edinburgh, UK(爱丁堡大学) ; Chalmers University of Technology(查尔姆斯理工大学) ; The University of Gothenburg, Sweden(哥德堡大学)
专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.PL
AI总结 本文提出了一种无类型的lambda计算模型,用于形式化描述和验证人工智能代理中对话和信息流的安全性。
大型语言模型(LLMs)和生成式人工智能在网络安全与隐私中的应用:两用风险、人工智能生成的恶意软件、可解释性及防御策略综述
机构 * Virelya Intelligence Research Labs(Virelya智能研究实验室) ; Google(谷歌)
专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI
AI总结 综述大型语言模型和生成式人工智能在网络安全中的应用,涵盖两用风险等多方面。通过回顾众多资料及实际案例研究,给出负责任部署建议与安全路线图,为应对人工智能驱动的网络安全挑战提供关键参考。
Comments Invited survey paper. 10 pages, 5 figures, 2 tables
Journal ref IEEE 6th Silicon Valley Cybersecurity Conference (SVCC), San Francisco, CA, USA, 2025, pp. 1-10
撒更宽的网:面向代码推理的协调 Pass@K 策略优化
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; NVIDIA Research(英伟达研究)
专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI
AI总结 提出协调 Pass@K 策略优化 (CPPO),通过规划器生成多种策略并协调求解器尝试,以解决代码生成中重复采样导致冗余推理路径的问题,在多个基准上显著提升 pass@4。
Comments Code reasoning; pass@K optimization; coordinated planning; verifiable rewards; strategy diversity
通过检索增强生成和约束解码减轻大语言模型生成的Web API调用中的错误
机构 * Technische Universität Darmstadt(德累斯顿技术大学) ; Hessian Center for Artificial Intelligence (hessian.AI)(黑森人工智能中心) ; Pariton AI ; National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE)
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.LG
AI总结 研究如何减轻大语言模型生成的Web API调用错误,提出检索增强生成(RAG)和约束解码(CD)两种互补方法,设计相应技术细节,在合成和真实数据集上评估,结果显示RAG、CD各有优劣,能提升Web API调用代码正确性。
Comments 54 pages, 11 figures; supersedes arXiv:2509.20172v6, which is a discarded journal extension of our work
KAT-Coder-V2.5技术报告
机构 * KwaiKAT Team(快手KwaiKAT团队)
专题命中 代码生成 :repository(abstract);分类 cs.SE、cs.AI
AI总结 介绍KAT-Coder-V2.5这一专注编码的智能模型,针对其受环境等因素限制的问题,通过端到端框架及多种技术手段解决,经多方法扩展强化学习并统一专家知识,在多个基准测试中取得优异成绩。
Comments 24 pages, 5 figures
dOPSD:扩散语言模型的策略内自蒸馏
机构 * National University of Singapore(新加坡国立大学)
专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI
AI总结 研究扩散语言模型强化推理难的问题,提出dOPSD,通过从学生去噪轨迹直接推导教师特权信息,实现策略内自蒸馏,提升模型在数学推理和代码生成等任务表现。
构建者、防御者、破坏者:反对从人工智能驱动的安全生命周期中移除人类的理由
机构 * School of Computer Science and Mathematics, Keele University(基尔大学计算机科学与数学学院) ; Cybersecurity Institute, University of Liverpool(利物浦大学网络安全研究所)
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI
AI总结 探讨人工智能在安全生命周期中集多角色于一身的现象,指出移除人类会带来问题,基于多领域证据论证人类应是安全生命周期的永久结构要求,并阐述人机合理分工。
Comments 7 pages
基于大语言模型的软件多样性对可靠性提升的有效性——一项实证研究
机构 * University of Coimbra, CISUC/LASI(科英布拉大学,CISUC/LASI) ; Centre for Software Reliability(软件可靠性中心) ; Department of Informatics Engineering(信息工程系) ; Department of Computer Science(计算机科学系) ; City St George’s, University of London(伦敦城市圣乔治大学)
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI
AI总结 研究大语言模型能否成为软件多样性的实用生成器及提升可靠性程度。通过扩展经典实证研究,对多种规范程序进行测试,探索大语言模型多样性多维度影响,结果表明其能助力可靠性提升。
跨连续软件开发工具包版本对大语言模型生成的量子代码中的 API 漂移进行基准测试
机构 * Department of Computer Science(计算机科学系) ; Khalifa University(卡利法大学)
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI
AI总结 研究大语言模型生成的量子代码能否可靠适配特定 SDK 版本(API 漂移问题),引入量子 API 漂移基准,以 Qiskit 为例评估 17 个模型,揭示版本对齐是量子代码生成评估新维度及 API 漂移恢复情况。
聚焦会议:加速多模态基础模型的硬件和软件技术
机构 * eBRAIN Lab, New York University (NYU) Abu Dhabi(eBRAIN实验室,纽约大学(NYU)阿布扎比)
专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种多层方法,通过硬件和软件协同设计和优化流程,提升多模态基础模型的效率。方法包括混合精度量化、结构剪枝、推测解码等技术,结合硬件加速器优化计算和内存需求,验证了在医疗和代码生成任务中的有效性。
Comments Accepted at the Design, Automation and Test in Europe Conference (DATE), April 20-22, 2026 in Verona, Italy
安全且自适应的云修复:使用神经符号世界模型验证LLM生成的恢复计划
机构 * Zhejiang University(浙江大学)
专题命中 代码生成 :program synthesis(abstract);分类 cs.CL、cs.AI
AI总结 提出PASE框架,将LLM作为规划引擎生成恢复计划,通过神经符号世界模型验证可行性,并利用DRL优化提示,实现动态自适应修复,显著降低恢复时间并提高未知故障检测精度。
Comments 13 pages
一层就够了吗?训练单个Transformer层可以匹配全参数RL训练
机构 * University of Minnesota(明尼苏达大学) ; Peking University(北京大学) ; Amazon(亚马逊)
专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.LG
AI总结 发现RL训练收益高度集中在少数Transformer层,仅训练单层即可恢复大部分全参数RL收益,且高贡献层集中在模型中部。
RedCoder: 面向代码大语言模型的自动化多轮红队测试
机构 * University of California, Davis(加州大学戴维斯分校) ; University of Southern California(南加州大学)
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI
AI总结 提出RedCoder,一个通过多轮对话诱导代码大模型生成漏洞代码的自动化红队测试智能体,采用多智能体博弈生成原型对话和攻击策略库,并微调LLM作为骨干,实验表明其优于现有单轮和多轮方法。
Comments ACL 2026
少即是多:8位量化改善大型语言模型的持续学习
机构 * Algoverse
专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG
AI总结 本文系统研究量化精度(FP16、INT8、INT4)与重放缓冲区策略在大型语言模型持续学习中的交互,发现量化模型在后续任务上优于FP16,INT8在学习可塑性与知识保留间取得最佳平衡,量化噪声充当隐式正则化防止过拟合。
规范驱动开发中的引用规范:LLM生成代码的输出确定性与自动幻觉检测的跨模型实证研究
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI
AI总结 通过对比三种规范驱动开发框架,发现强制引用要求会降低输出确定性但能实现自动幻觉检测,该权衡在不同模型间一致。
Comments 17 pages
量化膨胀推理:低比特推理模型的隐藏成本——令牌膨胀
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Microsoft(微软) ; Anyscale ; Snowflake
专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG
AI总结 研究发现低比特后训练量化虽保持推理准确性,但会显著增加推理令牌使用量,导致端到端服务性能下降,并提出了CoT令牌膨胀比来量化该效应。
CaveAgent:将LLM转变为具有状态的运行时操作符
机构 * Hong Kong Generative AI Research and Development Center (HKGAI)(香港生成式AI研究与开发中心(HKGAI))
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI
AI总结 CaveAgent通过引入双流架构,将LLM从文本生成器转变为运行时操作符,解决了长周期任务中上下文漂移问题,提升了多轮交互的稳定性和数据处理能力。
Comments ver.2
超越缩放定律:一种数据高效的蒸馏框架用于推理
专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种数据高效的蒸馏框架DED,通过优化推理蒸馏的帕累托前沿,提升推理能力而不依赖大规模数据集。
面向结构的语料构建与用户感知对齐的代码补全评估指标
专题命中 代码生成 :repository(abstract);分类 cs.SE、cs.AI
AI总结 本文提出LCP和ROUGE-LCP评估指标,从概率建模角度解决代码补全中用户感知与现有指标的差距问题,并通过SPSR-Graph方法提升模型性能。
Comments 14 pages,8 figures
Journal ref ICASSP2026
先排序后服务:通过成对学习排序实现低延迟LLM服务
机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; Argonne National Laboratory(阿贡国家实验室)
专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG
AI总结 提出PARS调度器,通过成对排序预测任务响应长度,近似最短作业优先调度,减少队头阻塞,在vLLM上实现高达15.7倍延迟降低。
Comments 13 pages, 4 figures. Published in ISC High Performance 2026 Research Paper Proceedings (41st International Conference)
Journal ref ISC High Performance 2026 Research Paper Proceedings (41st International Conference), Hamburg, Germany, 2026
Axon:张量程序的综合超优化器
机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Amazon Web Services(亚马逊网络服务)
专题命中 代码生成 :program synthesis(abstract);分类 cs.CL、cs.PL
AI总结 提出Axon,一种通过程序综合自动生成目标指令并探索语义等价变体以选择最佳性能内核的张量程序超优化器,利用SMT保证变换语义正确性。