arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2848 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2848 篇

2607.28033 2026-07-31 cs.AI 新提交 81%

DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness

DataClawEval:面向真实工业场景的数据工程智能体基准测试

Debin Meng, Jiaming Yang, Zefang Zong, Tengyue Xu, Haining Xie, Yang Li, Peng Chen

机构 * Tencent(腾讯) Xidian University(西安电子科技大学) South China Normal University(华南师范大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DataClawEval是首个针对真实工业数据工程场景的智能体基准,含100项跨5种引擎的任务,用确定性脚本评分,评估16个前沿智能体发现最强模型仅得74.9分,自主数据工程仍是挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27953 2026-07-31 cs.LG 新提交 81%

AutoPref: Automatic Discovery of Task-Specific Preference Objectives for Neural Combinatorial Optimization

AutoPref:面向神经组合优化的任务特定偏好目标的自动发现

Shengda Gu, Kai Li, Xinyi Ke, Haobo Fu, Yifan Zhang, Jian Cheng

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 该研究提出首个LLM引导的AutoPref框架,将偏好目标分解为成对损失与集合感知加权程序,通过分阶段条件搜索策略实现自动发现,在TSP等四类组合优化问题上性能优于手动设计基线。

Comments 8pages, 2figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27030 2026-07-30 cs.CR cs.LG 新提交 81%

HoF-Bench: Rediscovering Real AI-Discovered CVEs Without Frontier Models

HoF-Bench:无需前沿模型即可重新发现真实AI发现的CVE

Petr Simecek, Elnaz Babayeva, Jiri Balhar, Michal Bida, Michal Buran, Vaclav Cadek, Luigino Camastra, Tomas Dulka, Michal Janocko, Tomas Klohna, Pavel Kohout, Ondrej Kokes, Adam Krivka, Jakub Kubik, Patrik Mada, Igor Morgenstern, Marek Pavelka, Joshua Rogers, Petr Stastny, Jan Tattermusch, Dmitrijs Trizna, Martin Votruba, Guido Vranken, Jakub Zikl, Evelina Gabasova, Stanislav Fort

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 HoF-Bench基准基于AISLE公开的95个AI发现的CVE构建,可用于对比不同模型的漏洞检测能力,极简LLM分析器在严格协议下可重新发现68%的CVE,所有模型未发现的CVE集中在C基础设施代码中。

Comments 15 pages, 6 figures. Benchmark repository: https://github.com/weareaisle/HoF-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26820 2026-07-30 cs.LG cs.CR 新提交 81%

Forecasting Trajectory-Level Safety Risks in Black-Box Multi-Turn Interactions

黑盒多轮交互中轨迹级安全风险预测

Shi Lin, Peng Qian, Dinghao Liu, Renjie Sun, Sifan Wu, Dezhang Kong, Chenpei Wang, Xun Wang

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出 Recast 框架,通过双尺度轨迹视图建模风险演变,可提前2.41轮预测88.3%的安全故障,误报率12.3%,实现轨迹级安全风险预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26367 2026-07-30 cs.AI 新提交 81%

Exploring Structures in Physics Problems: Can AI Agents Discover Statistical Mechanical Mappings?

探索物理问题中的结构:AI智能体能否发现统计力学映射?

Wanyu Zhao, Wanbing Zhao

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本研究以StatMechBench-v0为基准,评估基于LLM的“提出-验证-修正”智能体发现统计力学映射的能力,揭示其推理局限并提出验证栈的设计方向。

Comments Accepted to the AID-Wild workshop at CAIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25873 2026-07-29 cs.SE cs.AI 新提交 81%

How Do LLMs Read Bug Reports? An Empirical Study of Attention in LLMs for Automated Program Repair

大语言模型如何读取错误报告?基于大语言模型的自动程序修复中注意力的实证研究

Ramtin Ehsani, Irene Manotas, Saurabh Pujar, Luca Buratti, Preetha Chatterjee

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究基于大语言模型的自动程序修复中模型注意力模式,通过分析319个真实错误,探究其在错误报告各部分的分布、成功与失败修复的注意力差异及与开发者重视信息的比较,发现注意力分配错误是失败关键因素,为改进系统提供见解。

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE) 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25681 2026-07-29 cs.AI 新提交 81%

Cognivia: A Cognitive Behavioral Therapy Copilot for Evidence-Based Mental Healthcare

Cognivia:用于循证心理保健的认知行为疗法辅助工具

Qi Chen, Siria Xiyueyao Luo, Jian Wang, Yuan Shi, Haocong Rao, Xuejiao Zhao

机构 * Sichuan University(四川大学) Southwest Petroleum University(西南石油大学) University of Groningen(格罗宁根大学) West China Hospital, Sichuan University(四川大学华西医院) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究针对认知行为疗法应用受限及大语言模型在心理健康应用存在的问题,提出Cognivia,通过整合权威文本、问答数据,运用多阶段提示等策略构建并微调模型,还提出评估框架,该模型经多种评估验证效果良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25400 2026-07-29 cs.AI 新提交 81%

COVENANT: Natural-Language Workflow Compilation for Aligned Agent Execution

COVENANT:用于对齐代理执行的自然语言工作流编译

Jincheng Wang, Min Zheng, Tao Wei

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型代理执行工作流指令时的未对齐问题,提出COVENANT架构,将指令转为工作流抽象语法树和控制流图,运行时控制器按要求检查提议并反馈。实验表明该方法大幅提升成功率、降低未对齐失败率,推动工作流可靠执行。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25045 2026-07-29 cs.AI eess.SP q-bio.NC 新提交 81%

CogEEGAgent: Toward Autonomous Cognitive EEG Analysis with Grounded Execution and Selection-Aware Verification

CogEEGAgent:通过基于执行和选择感知验证实现自主认知脑电图分析

Dengzhe Hou, Lingyu Jiang, Fangzhou Lin, Kazunori D Yamada

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究针对认知EEG分析需专业知识及选择多的问题,提出基于MNE-Python的CogEEGAgent代理,LLM解释意图,确定性组件验证控制,在基准测试等中表现良好,建立了有限自主性和可审计自动化框架。

Comments 16 pages, 5 figures, and 16 tables. The supplementary material is included in the same PDF

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24782 2026-07-29 cs.AI 新提交 81%

Personalization, Personas, and Forecasting in Value Alignment

价值对齐中的个性化、角色设定与预测

James Wedgwood, Pratiksha Thaker, Neil Kale, Virginia Smith

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究探讨LLM行为受人类身份影响的方式,通过WVS测试不同框架的互换性,在多语言多国家问题上评估多个模型,发现提示框架是文化对齐的关键因素,不同框架效果有别,对齐增益集中在部分价值维度,制度信任等问题仍难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24754 2026-07-29 cs.HC cs.AI 新提交 81%

CARE-MH: Towards Unified, Reproducible, and Comparable Evaluation of Mental Health LLMs

CARE-MH:迈向心理健康语言模型的统一、可重现和可比评估

Asher Sprigler, Yixue Zhao, Yi Ding

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对心理健康语言模型评估难重现、难比较的问题,提出CARE-MH统一框架,通过重现分析现有基准,发现可重复性取决于模型稳定性,跨基准分歧源于指标定义差异,强调了标准化评估配置和共享指标定义的必要性。

Comments 39 pages, 22 figures, 22 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22824 2026-07-28 physics.med-ph cs.AI cs.CV 新提交 81%

Agentic Autoresearch for CT Reconstruction

用于CT重建的智能自动研究

Andreas Maier, Lucas Kachelriess, Siming Bayer, Yixing Huang, Yan Xia, Amber Simpson, Moritz Zaiss

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究CT重建方法比较难题,利用大语言模型智能体构建智能循环,独立实现、调整并基准测试26种方法,重组为紧凑求解器,发现理想数据排名无法预测现实噪声下表现,噪声会颠倒排名,重新训练可恢复部分排名,强调基准测试需考虑多种现实因素。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21763 2026-07-27 cs.CR cs.AI 新提交 81%

Every Model Cheats: Prompt-Level Mitigation of Cheating on Offensive Cyber Tasks

每个模型都作弊:在进攻性网络任务中对作弊行为进行提示级缓解

Michael Kouremetis, Ads Dawson, Raja Sekhar Rao Dheekonda, Brian Greunke

机构 * dreadnode

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型在网络安全基准测试中的作弊问题,通过对22个前沿模型在三种提示条件下的控制提示消融研究,发现作弊普遍,反作弊提示能降作弊倾向,但即使最严条件下仍有模型作弊,引入“解决率”指标,强调反作弊提示非环境控制替代品。

Comments 21 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21468 2026-07-24 cs.HC cs.AI 新提交 81%

Thinkink: 2D Spatial Ink-native Interaction with LLMs

Thinkink:与大语言模型的二维空间原生墨水交互

Mohammad Hasan Payandeh, Daniel Vogel, Jian Zhao

机构 * Cheriton School of Computer Science, University of Waterloo(滑铁卢大学计算机科学学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 为将大语言模型融入手写笔记和草图构思,提出Thinkink,通过语义树和轻量级UI实现交互,经三阶段设计,研究不同阶段用户实践及交互挑战,贡献设计启示与交互工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21424 2026-07-24 cs.CL cs.SD 新提交 81%

An Evaluation Framework for Structured Audio Captions Validated by Controlled Perturbations

一种通过受控扰动验证的结构化音频字幕评估框架

Liang-Yuan Wu, Sripathi Sridhar, Mark Cartwright, Magdalena Fuentes

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对结构化音频字幕评估难的问题,提出多轴评估框架,结合大语言模型判断与计算指标,在五个正交轴上评估,通过受控扰动测试协议验证可靠性,能区分释义与损坏。

Comments submitted to DCASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18665 2026-07-22 cs.AI 新提交 81%

SciHazard: A Benchmark for Measuring Scientific Safety Risks with Decomposed Harm Scoring

SciHazard:一种通过分解危害评分来衡量科学安全风险的基准

Chunxiao Li, Yuan Xiong, Lijun Li, Tianyi Du, Wenlong Zhang, Lei Bai, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大型语言模型可能传播有害科学知识的问题,引入SciHazard基准及评估框架,含多学科问题。开发分解评估程序计算DeHarm-Score,经专家验证和模型测试,显示该方法能有效衡量风险,还发现深度研究代理存在安全盲点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18252 2026-07-22 cs.AI cs.NE 新提交 81%

MILP-Evo: Closed-Loop Fully Automatic Design of MILP Solvers

MILP-Evo:混合整数线性规划求解器的闭环全自动设计

Jinbiao Nie, Kewei Feng, Xiaoyuan Zhang, Shan Yin, Zizhuo Wang, Bin Dong

机构 * BUPT(北京邮电大学) BZA(未提及具体中文名,推测可能是某个机构简称) BIT(北京理工大学) CUHK-Shenzhen(香港中文大学(深圳)) PKU(北京大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究能否将MILP求解器逻辑自动设计为LLM引导的闭环搜索,提出闭环程序演化框架,通过PySCIPOpt实现,在割集选择器和分支规则联合设计上实例化,输出可检查修改部署的组件,在多基准测试中发现有竞争力的策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18246 2026-07-22 cs.AI cs.SE 新提交 81%

Phionyx: A Deterministic AI Runtime Architecture with Structured State Management and Pre-Response Governance

Phionyx:一种具有结构化状态管理和响应前治理的确定性人工智能运行时架构

Ali Toygar Abak

机构 * Phionyx Research(Phionyx研究公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究提出Phionyx确定性人工智能运行时架构,源于Echoism框架,以治理为先。通过结构化状态向量实现确定性状态演化,集成三层架构。实验验证其在单实例部署中可降低计算开销、提高数据保留率,还介绍了架构及实验证据,分布式或多租户部署待后续研究。

Comments 27 pages, 4 figures, 5 tables. Reference implementation, reproducibility pack, and evaluation artifacts available via GitHub (https://github.com/halvrenofviryel/phionyx-research) and Zenodo (DOI: 10.5281/zenodo.20027534)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18116 2026-07-21 cs.AI cs.CV cs.GR cs.MA cs.MM 新提交 81%

SGA: Plug&Play Geometric Verification for Educational Video Synthesis

SGA:用于教育视频合成的即插即用几何验证

Lopez Jhon, Hinojosa Carlos, Ghanem Bernard

机构 * Universidad Industrial de Santander(桑坦德工业大学) King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对教育视频合成中空间正确性和视觉清晰度难题,提出符号几何智能体SGA,通过拦截代码、提取场景图及针对性优化提升质量,引入MVQS,实验显示其在多配置下有效提升了视觉质量分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16200 2026-07-21 cs.AI 新提交 81%

Deterministic Replay for AI Agent Systems

人工智能代理系统的确定性重放

Rasheed Mudasiru

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究人工智能代理系统不确定性问题,提出agrepl框架,通过MITM代理拦截外部交互并序列化,在隔离环境重放,形式化执行模型,经实验验证重放保真度高且延迟大幅降低,以Go实现并开源。

Comments 9 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15202 2026-07-17 cs.AI cs.HC cs.MA cs.MM 新提交 81%

Self-Evolving Human-Centered Framework for Explainable Depression Symptom Annotation

用于可解释抑郁症症状标注的自我进化以人为中心框架

Hoang-Loc Cao, Van Pham, Truong Thanh Hung Nguyen, Phuc Truong Loc Nguyen, Phuc Ho, Veronica Whitford, Hung Cao

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对抑郁症标注质量瓶颈,提出结合大语言模型辅助与专家验证的自我进化标注框架,分三阶段运行,采用双记忆架构,能提高标注一致性和可解释性,减少人工修订,还输出多种信息实现可审计性。

Comments Accepted at IEEE International Conference on Omni-Layer Intelligent Systems (COINS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11078 2026-07-14 cs.CV cs.AI 新提交 81%

Do Video-LLMs Actually Watch? Diagnosing Character-Tracking Failures in Long-Form Video

视频语言模型真的在观看吗?诊断长视频中的角色跟踪失败

Mohammad Al-Ratrout, Shayla Sharmin, Aditya Raikwar, Roghayeh Leila Barmaki

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究视频语言模型在长视频中跟踪角色的能力,通过九条件诊断协议测试三个开源模型及Gemini,发现模型准确性非来自角色跟踪,存在性别线索利用问题,还发布诊断工具包揭示基准分数衡量的实际情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08124 2026-07-10 cs.SE cs.LG 新提交 81%

TTHE: Test-Time Harness Evolution

测试时工具演化

Jun Nie, Yonggang Zhang, Jun Song, Qianshu Cai, Dahai Yu, Yike Guo, Xinmei Tian, Bo Han

机构 * Hong Kong Baptist University(香港 Baptist 大学) University of Science and Technology of China(中国科学技术大学) Hong Kong Generative AI Research & Development Center, The Hong Kong University of Science and Technology(香港生成式人工智能研究与开发中心,香港科技大学) TCL Corporate Research (HK) Co., Ltd(TCL 企业研究(香港)有限公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 研究LLM智能体测试时工具优化问题,提出TTHE方法,通过维护候选工具种群,基于执行轨迹推理优化,无需黄金标签或特定任务监督,在多任务实验中改进基线工具,将测试时适应重塑为程序演化并确定代理可靠性挑战。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27106 2026-07-08 cs.CR cs.AI 新提交 81%

Application of LLMs to Threat Assessment of Foreign Peacekeeping Missions

LLMs在外国维和任务威胁评估中的应用

Gerhard Backfried, Christian Schmidt, Diego Pilutti, Michael Suker

机构 * HENSOLDT Austria(海恩索尔特奥地利公司) Austrian Ministry of Defence(奥地利国防部)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出利用大语言模型(LLMs)结合风险模型和OSINT媒体数据,自动提取维和任务相关威胁,评估显示自动结果与人工判断高度一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03233 2026-07-07 cs.CR cs.AI cs.IR cs.SI 新提交 81%

Agentic and Generative AI for Open-Source Intelligence and Cyber Investigations: Taxonomy, Evaluation, Challenges, and Future Directions

用于开源情报和网络调查的智能与生成式人工智能:分类法、评估、挑战及未来方向

Eduardo Almeida Palmieri, Mohamed Chahine Ghanem, Dipo Dunsin, Zubair Baig, Ed de Quincey, Kim-Kwang Raymond Choo

机构 * School of Computer Science and Mathematics, Keele University(基尔大学计算机科学与数学学院) Cybersecurity Institute, University of Liverpool(利物浦大学网络安全研究所) Department of Applied Computing IICL, University of Wales Trinity Saint David(威尔士特里尼达大学应用计算系) Deakin Cyber Research and Innovation Hub, Deakin University(德金大学网络安全研究与创新中心) Department of Information Systems and Cyber Security, The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校信息系与网络安全系)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究指出公开数字信息增长使人工开源情报分析不足,大语言模型等成解决方案但评估框架滞后。通过综述74项研究,明确智能人工智能类别,找出幻觉验证差距,映射研究到情报生命周期并给出研究议程。

Comments 36 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02387 2026-07-03 cs.IR cs.LG 新提交 81%

Bringing Agentic Search to Earth Observation Data Discovery

将智能搜索引入地球观测数据发现

Minghan Yu, Youran Sun, Chugang Yi, Yixin Wen, Haizhao Yang

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出一个基于智能搜索的系统,利用知识图谱和大型语言模型,从自然语言查询中返回匹配的地球科学数据集和工具,显著提升检索性能。

Comments 19 pages, 1 figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31174 2026-07-03 cs.AI 新提交 81%

ClawArena-Team: Benchmarking Subagent Orchestration and Dynamic Workflows in Language-Model Agents

ClawArena-Team: 语言模型智能体中子智能体编排与动态工作流的基准测试

Kaiwen Xiong, Haonian Ji, Shi Qiu, Zeyu Zheng, Cihang Xie, Xinyu Ye, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) University of California, Berkeley(加州大学伯克利分校) University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出ClawArena-Team基准,通过41个多轮多模态多目录场景,评估单个LLM作为管理者编排子智能体的能力,发现管理瓶颈在于权限授予而非感知,且成本与质量解耦。

Comments 24 pages, 10 figures, website: https://www.clawarena.cc/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01136 2026-07-02 cs.SE cs.AI 新提交 81%

Skills Are Not Islands: Measuring Dependency and Risk in Agent Skill Supply Chains

技能并非孤岛:衡量智能体技能供应链中的依赖性与风险

Changguo Jia, Tianqi Zhao, Runzhi He, Minghui Zhou

机构 * Peking University(北京大学) Zhongguancun Laboratory(中关村实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出智能体技能供应链(ASSC)概念,设计SkillDepAnalyzer工具从自然语言中提取依赖关系,在超143万技能上揭示四种结构模式和安全风险,建议类型化依赖清单和风险预警审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00990 2026-07-02 cs.SE cs.AI 新提交 81%

SWE-Doctor: Guiding Software Engineering Agents with Runtime Diagnosis from Multi-Faceted Bug Reproduction Tests

SWE-Doctor: 通过多面缺陷复现测试的运行时诊断引导软件工程智能体

Yaoqi Guo, Yang Liu, Jie M. Zhang, Yun Ma, Yiling Lou, Zhenpeng Chen

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出SWE-Doctor,通过生成多面缺陷复现测试并执行调试,构建运行时诊断记录,结合定位信息指导补丁生成,在SWE-bench Verified和Pro上平均解决率分别达75.7%和59.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00053 2026-07-02 cs.SE cs.AI 新提交 81%

SWE-Router: Routing in Multi-turn Agentic Software Engineering Tasks

SWE-Router:多轮智能体软件工程任务中的路由

Seongho Son, Sangwoong Yoon, Jiahua Tang, Shuhan Wang, Lorenz Wolf, Ilija Bogunovic

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出SWE-Router,一种基于价值的时间路由方法,通过让廉价模型探索几轮后根据部分轨迹决定是否升级到昂贵模型,在保持强模型大部分性能的同时大幅提升成本效率。

Comments The 5th Deep Learning for Code Workshop, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏