arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 208 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 208 篇

2603.04419 2026-07-14 cs.CL cs.AI cs.LG 版本更新 67%

Context-Dependent Affordance Computation in Vision-Language Models

视觉-语言模型中基于情境的可及性计算

Murad Farzulla

机构 * Dissensus AI King’s College London(伦敦国王学院)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本研究揭示视觉-语言模型中可及性计算的高度情境依赖性,通过大规模实验显示超过90%的词汇描述受情境影响,提出动态本体投影方法替代静态世界建模。

Comments 33 pages, 13 tables, 3 figures. Code available at: https://github.com/studiofarzulla/semantic-vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24432 2026-07-07 cs.CL cs.AI cs.IR cs.LG 版本更新 67%

Kwai Summary Attention Technical Report

快手总结注意力技术报告

Chenglong Chu, Guorui Zhou, Guowang Zhang, Han Li, Hao Peng, Hongtao Cheng, Hui Wang, Jian Liang, Jiangxia Cao, Kun Gai, Lingzhi Zhou, Lu Ren, Qi Zhang, Ruiming Tang, Ruitao Wang, Xinchen Luo, Yi Su, Zhiyuan Liang, Ziqi Wang, Boyang Ding, Chengru Song, Dunju Zang, Jiao Ou, Jiaxin Deng, Jijun Shi, Jinghao Zhang, Junmin Chen, Lejian Ren, Minxuan Lv, Qianqian Wang, Qigen Hu, Shiyao Wang, Siyang Mao, Tao Wang, Xingmei Wang, Zhixin Ling, Ziming Li, Zixing Zhang

机构 * Kuaishou(快手)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究长上下文能力这一重要迭代方向,针对标准softmax注意力在长序列下时间复杂度高的问题,提出新路径,通过将历史上下文压缩为可学习总结令牌降低序列建模成本,即提出快手总结注意力机制。

Comments update related works

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17450 2026-07-03 cs.SE cs.AI cs.CL cs.CR 版本更新 67%

ContraFix: Skill-Enhanced Contrastive Runtime Analysis for Vulnerability Repair

ContraFix:通过差分运行时证据和技能重用进行代理漏洞修复

Simiao Liu, Fang Liu, Peiding Wang, Taichuan Li, Yinghao Zhu, Xiaoli Lian, Li Zhang

机构 * Beihang University(北京航空航天大学) The University of Hong Kong(香港大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 本文提出ContraFix框架,通过差分运行时证据和可重用的修复技能,解决大型语言模型代理在自动漏洞修复中的语义误解问题,实现了在SEC-Bench和PatchEval上的高准确率。

Comments Code: https://figshare.com/s/f173c78e44bca88ebaea

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01522 2026-06-26 cs.PL 版本更新 67%

Type-Error Ablation and AI Coding Agents

类型错误消融与AI编码代理

Shriram Krishnamurthi, Matthew Flatt

专题命中 软件智能体 :agent(abstract);AI agent(abstract)

AI总结 通过消融实验研究AI编码代理在修复类型错误时,更详细的错误消息是否比简洁消息更有效,并发现详细错误消息提升修复能力,类型系统比仅测试失败报告更有帮助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25692 2026-08-20 cs.SE cs.LG 版本更新 62%

A Configuration-First Framework for Reproducible, Low-Code Machine Learning: a Localization Use Case

一种面向可重复、低代码定位的配置优先框架

Tim Strnad, Blaž Bertalanič, Carolina Fortuna

机构 * Jožef Stefan Institute(乔塞夫·斯蒂芬研究所)

专题命中 软件智能体 :workflow(abstract);分类 cs.LG、cs.SE

AI总结 本文提出了一种低代码、配置优先的框架,通过版本化配置和自动化流程提升定位任务的可重复性和效率。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10319 2026-08-18 cs.SE cs.AI 版本更新 62%

Do Personalized Skills Help Coding Agents? An Empirical Study of Developer Interaction Histories

个性化技能对编码智能体有帮助吗?开发者交互历史的实证研究

Shuyan Huang, Kai Du, Andrew Lan

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本研究通过对13位开发者的206个真实会话实验,发现从交互历史提炼的开发者个性化技能改进有限,而汇集自所有开发者的通用技能增益最大且最一致,为编码智能体的个性化策略提供了实证依据。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09018 2026-08-18 cs.NE cs.AI cs.LG 版本更新 62%

Evolving Ensemble of Agents

进化代理群体

Zongmin Yu, Liu Yang

机构 * National University of Singapore(新加坡国立大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出EvE框架,通过进化编码代理群体实现算法发现,解决了传统方法的局限,展示了自修正群体在复杂代码库中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29516 2026-08-17 cs.SE cs.AI 版本更新 62%

From Code Review to Code Critique: Intent, Drift, and Spotlight for AI-Generated Diffs at Scale

从代码审查到代码批判:大规模AI生成代码差异的意图、漂移与焦点

Chandra Maddila, Mashrur Rashik, Euna Mehnaz Khan, Smriti Jha, James Saindon, Nachi Nagappan, Peter C. Rigby

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 针对AI生成代码超出传统审查能力且现有工具忽视核心问题的缺陷,提出ARCTIC系统,经实验验证其在意图预测、漂移检测等方面表现优异,可降低代码不一致性并获高认可。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14573 2026-08-14 cs.AI cs.SE 版本更新 62%

Alipay-PIBench: A Realistic Payment Integration Benchmark for Coding Agents

支付宝-PIBench:用于编码代理的现实支付集成基准测试

Shiyu Ying, Xuejie Cao, Yingfan Ma, Yuanhao Dong, Wenyu Chen, Bowen Song, Lin Zhu

机构 * Ant Group(蚂蚁集团)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究旨在评估编码代理在支付宝支付集成任务中的表现,引入支付宝-PIBench基准测试,含九个产品项目和18个任务实例,分不同场景。通过评估六个编码代理模型得出评分通过率,发现有技能条件下RPR提升,为诊断模型能力和评估支付集成指导提供可控环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20667 2026-08-13 cs.SE cs.AI 版本更新 62%

REVERE: Reflective Evolving Research Engineer

REVERE:面向科学工作流的反思性进化研究工程师

Balaji Dinesh Gangireddi, Aniketh Garikaparthi, Manasi Patwardhan, Arman Cohan

机构 * TCS Research(TCS研究) Yale University(耶鲁大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 REVERE通过全局训练上下文学习和反思优化框架,提升科研编码任务性能,实现4.50%、3.51%和4.89%的提升。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03818 2026-08-13 cs.LG cs.AI cs.PL 版本更新 62%

Program Semantic Inequivalence Game with Large Language Models

基于大语言模型的程序语义不等价博弈

Antonio Valerio Miceli-Barone, Vaishak Belle, Ali Payani

机构 * University of Edinburgh(爱丁堡大学) Cisco Systems(思科系统)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出基于语义不等价博弈(SInQ)的方法,通过生成器与评估器智能体半对抗训练合成代码推理数据,在跨语言漏洞检测等基准上显著提升LLMs的代码语义理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19329 2026-08-11 cs.SE cs.AI 版本更新 62%

Goedel-Code-Prover: Hierarchical Proof Search for Open State-of-the-Art Code Verification

Goedel-Code-Prover:面向开放状态的最新代码验证的分层证明搜索

Zenan Li, Ziran Yang, Deyuan He, Haoyu Zhao, Andrew Zhao, Shange Tang, Kaiyu Yang, Aarti Gupta, Zhendong Su, Chi Jin

机构 * ETH Zürich(苏黎世联邦理工学院) Princeton Language and Intelligence(普林斯顿语言与智能实验室) Department of Computer Science, Princeton University(普林斯顿大学计算机科学系) MiroMind

专题命中 软件智能体 :planning(abstract);分类 cs.AI、cs.SE

AI总结 本文提出Goedel-Code-Prover框架,通过分层证明搜索提升Lean4中代码验证的自动化水平,实现62%的成功率,优于现有基线方法。

Comments Published as a COLM paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00023 2026-08-07 cs.CL cs.AI 版本更新 62%

Role Steering of Language Models for Social Simulations

用于社会模拟的语言模型角色引导

Isaac Song, Mohammed Rehan Parwani, Glenn Matlin, Emile Anand, Akhil Theerthala, Arjun Chatterjee, Anthony Wen-Ming Zang, Maria Kostylew, Yonadav G. Shavit, Sebastien Krier, Mark Riedl

机构 * Georgia Institute of Technology(佐治亚理工学院) ML Alignment & Theory Scholars (MATS)(ML对齐与理论学者组织(MATS)) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Oxford(牛津大学) Google DeepMind(谷歌DeepMind) OpenAI(开放人工智能公司)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 该研究提出针对语言模型智能体的角色引导筛选工作流,在OLMo-3-7B-Instruct上验证其角色画像对齐度更高且词汇多样性更好,发现需按角色选引导系数而非统一高强度设置。

Comments 35 pages. Published at the Social Sim'26 Workshop, COLM 2026. Code: https://github.com/eilab-gt/casting-call-vectors

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12153 2026-08-06 cs.SE cs.AI 版本更新 62%

CIDR: A Large-Scale Industrial Source Code Dataset for Software Engineering Research

CIDR:一个大规模工业源代码数据集用于软件工程研究

Vladislav Savenkov

机构 * Fermatix AI

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 CIDR是首个基于工业合作的大型源代码数据集,包含2440个仓库、138种语言和3.73亿行代码,支持代码智能、软件质量分析和语言模型预训练等研究。

Comments 60 pages, 13 figures, 8 appendices. Dataset access: https://fermatix.ai/#Contact. Anonymization tool: https://github.com/Fermatix/repo-sanitizer. Metadata utility: https://github.com/Fermatix/repo_metadata_cli

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25333 2026-08-04 cs.SE cs.AI cs.DC cs.OS 版本更新 62%

Specula: Scaling formal specifications for autonomous model checking of system code

Specula:扩展用于系统代码自主模型检查的形式规范

Qian Cheng, Saad Mohammad Rafid Pial, Ruize Tang, Yiming Su, Emilie Ma, Finn Hackett, Ivan Beschastnikh, Yu Huang, Tianyin Xu

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 Specula利用大语言模型编码代理为系统代码生成形式规范,通过自我进化循环解决LLM技术局限,实现自主模型检查,应用于48个开源项目发现众多错误,消除形式方法应用障碍,助力系统代码验证。

Comments 17 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07195 2026-07-29 cs.SE cs.LG 版本更新 62%

Automated Modernization of Machine Learning Engineering Notebooks for Reproducibility

机器学习工程笔记本的自动化现代化进程以实现可重现性

Bihui Jin, Kaiyuan Wang, Pengyu Nie

机构 * University of Waterloo(滑铁卢大学) Google(谷歌公司)

专题命中 软件智能体 :agentic(abstract);分类 cs.LG、cs.SE

AI总结 本文提出MLEModernizer,通过LLM驱动的框架自动化现代化工机器学习工程笔记本,以恢复其在不断变化的环境中的可重现性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14169 2026-07-21 cs.AI cs.LG 版本更新 62%

When a Verified World Model Still Loses: Play-Adequacy vs Prediction-Accuracy in LLM-Synthesized Code World Models

当经过验证的世界模型仍然失败时:大语言模型合成代码世界模型中的游戏充分性与预测准确性

Javier Aguilar Martín

机构 * AGILabs(AGILabs实验室)

专题命中 软件智能体 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型合成的代码世界模型,发现其虽预测准确率高,但在游戏中仍失败,存在验证与正确的差距,揭示危害规律,指出更多数据无法修复,相同机制在信念推理函数上重现,表明规划世界模型充分性应基于搜索分布或游戏衡量。

Comments 41 pages, 4 figures. Code and reproduction log: https://github.com/JaviMaligno/code-world-models

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14335 2026-07-21 cs.CR cs.AI cs.SE 版本更新 62%

Is "Knowing It's Malicious Enough?" Evaluating LLMs for Fine-Grained Malware Behavior Auditing

“知道它足够恶意吗?”评估用于细粒度恶意软件行为审计的大语言模型

Xinran Zheng, Xingzhi Qian, Yiling He, Shuo Yang, Lorenzo Cavallaro

机构 * University College London(伦敦大学学院) The University of Hong Kong(香港大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 研究针对大语言模型用于恶意软件审计可靠性不明问题,引入MalEval诊断框架,通过配对代码库与审计报告提供基本事实,经中间表示压缩代码库,映射输出到证据链,分解审计为四阶段任务,评估发现大语言模型在审计中有诸多问题,为后续可靠工作流程研究提供参考。

Comments Paper has beed accepted by ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01211 2026-07-17 cs.SE cs.AI 版本更新 62%

Are Performance-Optimization Benchmarks Reliably Measuring Coding Agents?

性能优化基准测试是否可靠地衡量编码智能体?

Zhi Chen, Zhensu Sun, Yuling Shi, David Lo, Lingxiao Jiang

机构 * Singapore Management University(新加坡管理大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本研究审计了三个仓库级性能优化基准(GSO、SWE-Perf、SWE-fficiency),发现参考补丁的可复现性差、评分规则导致排名不一致,且多数任务已被公开提交解决,揭示了聚合排名掩盖的性能差距。

Comments 12 pages, 7 figures. Public data: https://github.com/chenzhi-cz/performance-optimization-benchmark-reliability

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19387 2026-07-15 cs.SE cs.AI 版本更新 62%

Interpretable and Verifiable Hardware Generation with LLM-Driven Stepwise Refinement

可解释且可验证的硬件生成:基于LLM驱动的逐步细化

You Li, Samuel Mandell, David Z. Pan

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Fudan University(复旦大学) USA(美国)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 提出结合LLM创造力与形式化方法可解释性的硬件生成框架,通过迭代应用变换规则将设计规范转换为正确性有保证的RTL程序。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23449 2026-07-13 cs.AI cs.CR cs.SE 版本更新 62%

Beyond Embeddings: Interpretable Feature Extraction for Binary Code Similarity

超越嵌入:用于二进制代码相似性的可解释特征提取

Charles E. Gagnon, Steven H. H. Ding, Philippe Charland, Benjamin C. M. Fung

机构 * Defence Research and Development Canada(加拿大国防研究与发展署) McGill University(麦吉尔大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究二进制代码相似性检测问题,利用基于语言模型的智能体对汇编代码结构化推理分析生成可解释特征,无需匹配训练,在跨架构和跨优化任务中召回率表现良好,结合嵌入优于现有技术,实现准确性、可扩展性和可解释性共存。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01708 2026-06-25 cs.DC cs.AI cs.LG 版本更新 62%

SplitZip: Ultra Fast Lossless KV Compression for Disaggregated LLM Serving

SplitZip:超快无损KV压缩用于解耦的大语言模型服务

Yipin Guo, Siddharth Joshi

机构 * University of Notre Dame IN, USA(诺丁汉大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 SplitZip通过GPU友好的无损压缩技术,提升大规模LLM服务中KV缓存的传输效率,实现快速压缩和解压,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11988 2026-06-25 cs.SE cs.AI 版本更新 62%

Evaluating AGENTS.md: Are Repository-Level Context Files Helpful for Coding Agents?

评估 AGENTS.md:仓库级上下文文件对编码助手有帮助吗?

Thibaud Gloaguen, Niels Mündler, Mark Müller, Veselin Raychev, Martin Vechev

机构 * Department of Computer Science(计算机科学系) ETH Zurich(苏黎世联邦理工学院)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 通过SWE-bench任务和开发者提交的上下文文件,评估发现上下文文件并未普遍提升编码助手的任务成功率,反而平均增加20%以上的推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25764 2026-06-23 cs.SE cs.AI 版本更新 62%

Confident and Wrong: Silent Semantic Failures in Coding Agents

自信且错误:编码智能体中的无声语义失败

Aman Mehta

机构 * Snowflake AI Research(Snowflake AI研究院)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文揭示编码智能体在任务完成率与可信度之间存在系统性偏差,提出“无声语义失败”这一危险模式,并建议通过多次运行的测试验证正确率来评估智能体。

Comments 8 pages, 8 figures. Request: please change the primary category to cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00491 2026-06-23 cs.PL cs.AI cs.SE 版本更新 62%

Executing as You Generate: Hiding Execution Latency in LLM Code Interpreters

边生成边执行:在LLM代码解释器中隐藏执行延迟

Zhensu Sun, Zhihao Lin, Zhi Chen, Chengran Yang, Mingyi Zhou, Li Li, David Lo

机构 * Singapore Management University Singapore(新加坡国立管理学院新加坡) Beihang University China(北航大学中国)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 提出并行执行范式,通过将生成、检测和执行三阶段流水线化,在代码生成过程中提前执行,显著降低端到端延迟。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00012 2026-06-23 cs.LG cs.AI cs.CY cs.IR 版本更新 62%

OGD4All: A Framework for Accessible Interaction with Geospatial Open Government Data Based on Large Language Models

OGD4All: 基于大语言模型的可访问地理空间开放政府数据交互框架

Michael Siebenmann, Javier Argota Sánchez-Vaquerizo, Stefan Arisona, Krystian Samp, Luis Gisler, Dirk Helbing

机构 * Professorship of Computational Social Science, ETH Zurich(计算社会科学教授职位,苏黎世联邦理工学院) Esri R&D Center Zurich(埃斯里苏黎世研发中心) Complexity Science Hub(复杂性科学中心)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 提出OGD4All框架,结合语义检索、智能体推理和沙盒执行,实现基于大语言模型的地理空间开放政府数据交互,在430个数据集上达到98%分析正确率和94%召回率,有效减少幻觉风险。

Comments Author Accepted Manuscript (AAM). Proceedings of 2026 IEEE CAI (Granada, Spain). Update manuscript with final DOI. Code & data available at: https://github.com/ethz-coss/ogd4all

Journal ref 2026 IEEE Conference on Artificial Intelligence (CAI), pp. 882-888

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28734 2026-06-16 cs.CR cs.CL cs.LG 版本更新 62%

Code as a Weapon: A Consensus-Labeled Prompt Bank for Measuring Coding-Model Compliance with Malicious-Code Requests

代码即武器:用于衡量编码模型对恶意代码请求遵从性的共识标记提示库

Richard J. Young, Gregory D. Moody

机构 * University of Nevada Las Vegas(内华达大学拉斯维加斯分校) Department of Information Systems(信息系统系)

专题命中 软件智能体 :agent(abstract);分类 cs.CL、cs.LG

AI总结 本文通过构建一个经五名评审共识标记的提示库(包含4,748个可执行恶意代码请求和1,923个有害安全知识请求),为编码模型对恶意代码请求的拒绝行为提供了可靠且可跨语料库比较的测量基准。

Comments 23 pages, 9 figures, 6 tables. Consensus-labeled prompt bank consolidating eight malicious-code corpora (ASTRA, CySecBench, AdvBench/harmful_behaviors, JailbreakBench, MalwareBench, RedCode, RMCBench, Scam2Prompt) spanning diverse elicitation paradigms; 6,675 prompts, 33,375 classification calls

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30208 2026-06-16 cs.SE cs.AI 版本更新 62%

Automating Low-Risk Code Review at Meta: RADAR, Risk Calibration, and Review Efficiency

自动化低风险代码审查在Meta:RADAR、风险校准与审查效率

Chris Adams, Arjun Singh Banga, Parveen Bansal, Souvik Bhattacharya, Payal Bhuptani, Rujin Cao, Pedro Canahuati, Nate Cook, Brian Ellis, Prabhakar Goyal, Gurinder Grewal, Tianyu He, Matt Labunka, Alex Manners, David Molnar, Ging Cee Ng, Vishal Parekh, Jiefu Pei, Frederic Sagnes, James Saindon, Will Shackleton, Sid Sidhu, Gursharan Singh, Karthik Chengayan Sridhar, Matt Steiner, Pratibha Udmalpet, Sean Xia, Stacey Yan, Audris Mockus, Peter Rigby, Nachiappan Nagappan

机构 * Meta USA, UK, Canada(Meta美国、英国、加拿大)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 提出RADAR系统,通过多阶段漏斗对代码差异进行风险分层自动化审查,在Meta部署后显著提升审查效率并降低风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17106 2026-06-16 cs.CL cs.LG 版本更新 62%

HyDRA: Hybrid Dynamic Routing Architecture for Heterogeneous LLM Pools

HyDRA:异构LLM池的混合动态路由架构

Aashna Garg, Siddharth Singha Roy, Jinu Jang, Federico Brancasi, Shengyu Fu

机构 * Microsoft(微软)

专题命中 软件智能体 :tool use(abstract);分类 cs.CL、cs.LG

AI总结 本文提出HyDRA,一种能够根据查询预测细粒度多维能力需求并匹配配置定义模型配置的混合动态路由架构,实现了在异构LLM池中高效且无需重新训练的模型选择。

Comments preprint v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20709 2026-06-16 cs.SE cs.AI cs.CR 版本更新 62%

DualGauge: Automated Joint Security-Functionality Benchmarking of Specification-Only Code Generation by LLMs and Coding Agents

DualGauge: 对仅由LLM和编码代理生成的规范代码进行自动化联合安全-功能基准测试

Rupam Patir, Keyan Guo, Suvadra Barua, Abhijeet Pathak, Dinesh Gudimetla, Jiawei Guo, Hongxin Hu, Haipeng Cai

机构 * University at Buffalo, SUNY(布法罗大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 提出DualGauge框架,首个自动化联合评估规范代码正确性与安全性的系统,通过307个任务基准测试发现功能正确性高估可靠代码生成,联合成功率低于15%,且模型因素和代理系统均无法可靠提升。

详情

展开后加载摘要…

URL PDF HTML 收藏