arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-08-25 至 2026-08-25 共收录 48 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 12 篇

2608.22938 2026-08-25 cs.SE cs.AR 新提交 79%

Execution-Anchored Hallucination Calibration Reranking for Verilog Code Generation

面向Verilog代码生成的执行锚定幻觉校准重排序

Guang Yang, Xing Hu, Xiang Chen, Terry Yue Zhuo, Xin Xia

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 该研究针对LLM生成Verilog代码时的性能问题,提出EAHC重排序框架,通过双通道架构融合执行与推理信号,解决现有方法的域迁移差和推理幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22529 2026-08-25 cs.SE 新提交 79%

Benchmarking the Titans: A Multi-Dimensional Empirical Evaluation of LLM Code Generation Quality in the.NET Ecosystem

巨头基准测试:.NET生态系统中LLM代码生成质量的多维度实证评估

Seyed Mohammad Mahdi Ghalandarian, Majid Bazargani, Masoumeh Taromirad

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 本文提出自动化多维度评估框架,针对C#代码生成评估GPT等四个LLM,发现Pass@k排名无法反映LLM在软件工程场景的完整性能概况,还明确了GPT的双峰失败行为。

Comments 12 pages, 8 figures. Accepted at the Second Workshop on Large Language Models for Generative Software Engineering (LLM4SE 2026), co-located with STAF 2026, Rennes, France, June 29 - July 3, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09146 2026-08-25 cs.SE 版本更新 79%

Exploring the Potential of Program Flowcharts on Code Generation Using Multimodal LLMs

利用多模态大语言模型探索程序流程图在代码生成中的潜力

Yuki Toi, Tao Xiao, Kazushi Tomoto, Masanari Kondo, Yasutaka Kamei

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 研究利用多模态大语言模型探索程序流程图对代码生成的潜力,通过从示例代码生成流程图并与问题陈述一起提供给模型进行代码生成实验,发现结合流程图可提升性能,不同细节程度的流程图效果有差异,还比较了与少样本学习的效果。

Comments 21 pages, Accepted at the 26th IEEE International Conference on Software Quality, Reliability, and Security (QRS 2026), Regular Papers Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00391 2026-08-25 cs.CV 版本更新 78%

VinciCoder: Unifying Multimodal Code Generation via Coarse-to-fine Visual Reinforcement Learning

VinciCoder:通过粗到细的视觉强化学习统一多模态代码生成

Xuanle Zhao, Deyang Jiang, Zhixiong Zeng, Lei Chen, Haoyue Yang, Haibo Qiu, Jing Huang, Yufeng Zhong, Liming Zheng, Yilin Cao, Lin Ma

机构 * Meituan(美团)

专题命中 代码生成 :code generation(title,abstract)

AI总结 VinciCoder通过粗到细的视觉强化学习框架,统一多模态代码生成,实现最先进的性能,超越现有开源模型。

Comments Accepted by EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22652 2026-08-25 cs.SE cs.AI 新提交 62%

Evaluating Inference-Time Defenses Against Package Hallucination in LLM-Generated Code

评估针对大语言模型生成代码中包幻觉的推理时防御措施

Alberick Euraste Djire, Iyiola E. Olatunji, Melissa Tessa, Earl T. Barr, Jacques Klein, Tegawendé F. Bissyandé

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文针对LLM生成代码的包幻觉问题,修正了评估方法,评估了七种推理时防御措施,提出包效用指标,发现对抗提示下RAG与Self-Refine表现更优,明确防御需匹配威胁模型与效用。

Comments Accepted ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21483 2026-08-25 cs.SE cs.PL 新提交 62%

SLICE: Specification-Level Isolation of Contract Enforcement

SLICE:规约级别的契约执行隔离

Soohan Lim, Hyundong Jin, Yo-Sub Han

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.PL

AI总结 SLICE是一个分阶段的代码生成框架,通过规约结构化、函数体生成、契约断言生成三个阶段,在ContractEval数据集上使代码满足功能需求与输入契约的性能平均提升6.58%。

Comments 17 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00708 2026-08-25 cs.AI cs.LG 版本更新 62%

MOSAIC: Modular Orchestration for Structured Agentic Intelligence and Composition

MOSAIC:结构化智能体智能与组合的模块化编排

Yifan Bao, Xinyu Xi, Xinyu Liu, Wen Ge, Lei Jiang, Kevin Zhang, Raad Khraishi, Yihao Ang, Anthony K.H. Tung, Lukasz Szpruch, Hao Ni

机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系) University College London(伦敦大学学院) University of Edinburgh(爱丁堡大学) Data & Analytics, Digital X(Digital X 数据与分析部) Alan Turing Institute(艾伦·图灵研究所)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 提出MOSAIC框架,通过结构化智能体编排、记忆驱动的模型选择和蓝图构建,将自动化数据科学转化为可验证、可复用的模型选择问题,在金融时间序列任务中优于AutoML和智能体基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23200 2026-08-25 cs.CL 新提交 57%

LongWoF-Bench: Evaluating EvoMap Genes for Verifiable Long-Workflow Tasks

LongWoF-Bench:评估用于可验证长工作流任务的EvoMap基因

Xiao Zhang, Qumeng Sun, Jihao Li, Yiming Ren, Xiang Liu, Haoyang Zhang, Junjie Wang

机构 * EvoMap Tsinghua University(清华大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 该研究提出LongWoF-Bench基准,发现通过EvoMap将验证的执行轨迹转化为可复用的Gene,能显著提升多模型在长工作流任务上的表现,且优于Skill和参考蒸馏的Gene。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22068 2026-08-25 cs.AI cs.CE 新提交 57%

Decision-Support and Modeling with Large Language Models for Geothermal Well Arrays

面向地热井阵列的大型语言模型决策支持与建模

Edwin Ouko, Emmanuel Lujan, Alan Edelman, Robert Metcalfe

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 本研究评估ChatGPT等前沿LLMs在地热领域的应用潜力,提出用NotebookLM加速生成地热基准,分析地热井阵列等技术的机遇,还展示了LLMs助力地热数值模型自动并行化的案例。

Comments 10 pages, 8 figures. Presented at the 50th Workshop on Geothermal Reservoir Engineering, Stanford University, February 10-12, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21417 2026-08-25 cs.AI cs.RO 新提交 57%

Retrieval-grounded robot program generation and simulation-based correction via Model Context Protocol

基于检索的机器人程序生成与基于仿真的修正:通过模型上下文协议

Zhichao Zhou, Siyuan Chen, Omkar Salunkhe, Ebru Turanoglu Bekar, Johan Stahre, Anders Skoogh

机构 * Chalmers University of Technology(查尔姆斯理工大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 该研究针对柔性制造中机器人快速重编程需求,提出结合RAG与MCP的工作流,可生成并修正ABB RAPID机器人程序,借助仿真暴露代码执行故障,减少专家监督需求。

Comments Accepted by CIE53; to appear in the CIE53 Proceedings, Khalifa University, Abu Dhabi, UAE, October 20-23, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04384 2026-08-25 cs.AI 版本更新 57%

Improving Auto-Design of Neural PDE Solvers with a Domain-Specific Language

用领域特定语言改进神经偏微分方程求解器的自动设计

Shengxin Kong, Liwen Xu, Jingwen Fu

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 该研究提出ADSL-PDE领域特定语言,通过结构化搜索空间提升神经PDE求解器自动设计的搜索效率与优化稳定性,前十次迭代性能提升超52%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08405 2026-08-25 cs.AI physics.flu-dyn 版本更新 57%

Self-Evolving Scientific Agent Discovers Generalizable Physically-Reasoned Fluid Control

自进化科学智能体发现可泛化的物理推理流体控制

Boai Sun, Wenjin Guo, Zongmin Yu, Liu Yang

机构 * National University of Singapore(新加坡国立大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 提出一种由大语言模型驱动的自进化科学智能体工作流,通过迭代代码生成和物理仿真诊断,自动构建可解释的控制器,并在欠驱动双关节狗鲨游泳器目标到达任务中实现零样本泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 10 篇

2608.23564 2026-08-25 cs.CL cs.AI cs.SE 新提交 89%

SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration?

SWE Refactor Bench:编码智能体能完成长周期的全仓库栈迁移吗?

Deyao Hong, Yizhe Chi, Wenyi Li, Xiaoqiu Wang, Mingju Gao, Kaisen Yang, Bingxiang He, Youjie Zheng, Calvin Xiao, Qinhuai Na

机构 * Navers Lab(Navers实验室) Tsinghua University(清华大学)

专题命中 软件智能体 :repository(title,abstract);coding agent(title,abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本研究推出SWE Refactor Bench基准,通过三阶段评估发现前沿编码智能体仅5.4%能完成全仓库迁移,且迁移完整性与行为正确性是不同能力,该基准可作为可靠全仓库迁移编码智能体的测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21747 2026-08-25 cs.SE cs.AI cs.CL 新提交 82%

Architecture as Capability Equalizer for Coding Agents

架构作为编码智能体的能力均衡器

Arquimedes Canedo

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 该研究对比5种架构规范格式对6种LLM编码智能体的代码生成质量影响,发现结构化格式可作为能力均衡器,显著提升弱模型性能,对成本优化部署价值最大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22191 2026-08-25 cs.AI cs.SE 新提交 81%

Disagree to Explore, Agree to Commit: Routing-Guided Test-Time Scaling for Software Agents

探索时持异议,提交时持共识:面向软件智能体的路由引导测试时缩放

Kang Chen, Junjie Nian, Yixin Cao, Yugang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 软件智能体 :software agent(title);repository(abstract);分类 cs.SE、cs.AI

AI总结 该研究针对软件智能体测试时缩放难题,提出Risa方法,利用MoE路由轨迹引导探索与仲裁,在SWE-bench等基准上提升了仓库级软件工程任务的解决率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21833 2026-08-25 cs.AI cs.CL 新提交 81%

GameXpert-Bench: How Far Are Coding Agents from Expert Game Development?

GameXpert-Bench:编码智能体距离专家级游戏开发还有多远?

Kun Chen, Haorong Hong, Peizhong Gao, Jianfeng Lin, Tongxu Luo, Yuxuan Xie, Chenxu Liu, Jieling He, Zhongyuan Liu, Zeno Zeng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Lightspeed Studios, Tencent(腾讯光速工作室)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL、cs.AI

AI总结 GameXpert-Bench是覆盖游戏开发全生命周期的基准,含三个赛道,测评显示当前编码智能体在生成可玩游戏基础上表现较好,在缺陷发现等方面仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22960 2026-08-25 cs.AI 新提交 79%

What Process Evaluation of Coding Agents Actually Measures: Action, Task, and Step Are Three Different Levels

代码智能体的过程评估实际测量什么:动作、任务和步骤是三个不同的层级

Jiawei He, Mengyu Shi, Jie jia, Xikai Yang, Dong Sun

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 该研究提出代码智能体过程评估的测量框架,用SCAE实现步骤级因果归因,经499个文件定位场景实验发现当前过程评估多测量语义相关性而非因果贡献。

Comments 38 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21929 2026-08-25 cs.CR cs.CL 新提交 79%

SkillBloat: Token Amplification Attacks via Skill Injection in LLM Coding Agents

SkillBloat:通过大语言模型编码智能体中的技能注入实现的令牌放大攻击

Yuanjin Zheng, Jingbang Chen

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL

AI总结 本文提出SkillBloat两阶段框架,通过技能注入对LLM编码智能体实施令牌放大攻击,在真实基准上实现5.4184x-10.1455x平均最佳放大,揭示了技能生态系统的新型资源攻击面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01317 2026-08-25 cs.SE cs.CR 版本更新 79%

SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces

SABER:在有状态项目工作区中对LLM编码代理的操作安全性进行基准测试

Qi Hu, Yifeng Tang, Qinghua Wang, Lanyang Zhao, Pengji Zhang, Yuhao Qing, Xin Yao, Dong Huang, Lin Zhang, Zhuoran Ji

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 提出SABER基准,通过将模型置于真实代理式项目中并评估最终环境状态,来衡量LLM编码代理的操作安全性,发现最佳模型的有害安全违规率超过54%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23336 2026-08-25 cs.CV 新提交 78%

Can Coding Agents Build Robust Baselines? A Skill-Based Approach for Automating the Medical Imaging Model-Development Pipeline

编码智能体能构建鲁棒基线吗?一种基于技能的医学影像模型开发流水线自动化方法

Eugenia Moris, José Ignacio Orlando

机构 * Arionkoder LLC(阿里昂科德有限责任公司) Yatiris(亚蒂里斯) UNICEN-CONICET(国立中央大学-阿根廷国家科学技术研究委员会)

专题命中 软件智能体 :coding agent(title);code generation(abstract)

AI总结 该研究提出一种结合文献引导推理等的智能体式AI科学家工作流,可自动化医学影像模型开发流水线,在四个公开基准上取得竞争力结果,大幅降低相关工程工作量。

Comments MICCAI 2026 Workshop AgenticMed

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01347 2026-08-25 cs.CL 版本更新 74%

Prompt-Induced Waste in Coding Agents: Reasoning, Effort, Harness Design, and End-to-End Cost

提示词诱导的大推理模型浪费:一项预注册的双框架编码智能体基准测试

Sarel Weinberger, Amir Hozez

机构 * PointFive

专题命中 软件智能体 :coding agent(title);分类 cs.CL

AI总结 该研究通过预注册基准测试发现,提示词措辞和智能体框架会大幅影响大推理编码智能体的成本,部分提示指令可成倍增加推理成本却不提升任务成功率,框架选择的成本差异更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21942 2026-08-25 cs.AI cs.CR cs.MA cs.NI 新提交 57%

TessIndex: Capability Verified Identity System for the Agent Economy

TessIndex:面向智能体经济的能力验证身份系统

Mehul Goenka, Tejas Pathak, Siddharth Asthana

机构 * University of Oxford(牛津大学) Indian Institute of Technology, Delhi(印度理工学院德里分校)

专题命中 软件智能体 :software agent(abstract);分类 cs.AI

AI总结 针对智能体经济基础设施的三大缺陷,提出采用双平面架构的TessIndex系统,实现智能体原语的持久身份、可验证能力声明及价值捕获,为智能体经济提供集成化身份支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 2 篇

2601.19066 2026-08-25 cs.SE cs.AI 版本更新 81%

Dynamic Cogeneration of Bug Reproduction Test in Agentic Program Repair

代理程序修复中的动态共生测试生成

Runxiang Cheng, Michele Tufano, José Cambronero, Renyao Wei, Sherry Shi, Grant Uy, Pat Rondon, Franjo Ivančić

机构 * Google, USA(谷歌(美国))

专题命中 程序修复 :program repair(title,abstract);分类 cs.SE、cs.AI

AI总结 本文研究了在程序修复中动态共生生成测试的方法,通过在同一补丁中生成修复和测试用例,提高修复的可信度并减少维护成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21718 2026-08-25 cs.SE 新提交 57%

XRFix: Exploring Performance Bug Repair of Extended Reality Applications with Large Language Models

XRFix:利用大语言模型探索扩展现实应用的性能缺陷修复

Jingwen Wu, Hanyang Guo, Hong-Ning Dai, Xiapu Luo

专题命中 程序修复 :program repair(abstract);分类 cs.SE

AI总结 该研究针对XR应用性能缺陷修复的技术挑战,提出基于大语言模型的XRFix框架,构建缺陷数据集与定制检测工具,经实验验证其修复性能优于SOTA APR方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 测试生成 3 篇

2605.26851 2026-08-25 cs.SE 版本更新 83%

LLM-based Low-Level Integration Test Generation for Java

基于LLM的Java无模拟单元测试生成

Qinghua Xu, Guancheng Wang, Lionel Briand, Zhaoqiang Guo, Kui Liu

专题命中 测试生成 :unit test generation(title,abstract);code generation(abstract);分类 cs.SE

AI总结 提出MocklessTester方法,通过上下文增强生成和约束强制修复解决LLM生成无模拟单元测试时的幻觉问题,在Defects4J和Deps4J上显著提升覆盖率和变异得分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17177 2026-08-25 cs.SE 版本更新 57%

Grounding AI Agents in Contracts: An Empirical Evaluation of Spec-Driven Test Generation

将AI智能体建立在契约基础上:对规范驱动测试生成的实证评估

Michele Tufano, James McClure, José Cambronero, Runxiang Cheng, Sherry Y. Shi, Renyao Wei, Dorothy Chen, Franjo Ivančić, Livio Dalloro, Pat Rondon

专题命中 测试生成 :repository(abstract);分类 cs.SE

AI总结 本研究针对LLM智能体生成测试时易遗漏契约相关边界的问题,提出规范驱动测试生成方法,经Google生产缺陷评估,其缺陷检测率、分支覆盖率均优于基线,测试套件质量也显著更高。

Comments To appear in Proceedings of the 1st International Workshop on Specification-Driven Development Life Cycle (SpecOps 2026), co-located with SPLASH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09689 2026-08-25 cs.AI math.PR math.ST 版本更新 57%

Evidence-Aware MapReduce for Forkable Compute

玻尔兹曼MapReduce:可分叉沙盒的配分函数归约

Yossi Eliaz

机构 * Incredibuild(Incredibuild公司) HIT CS Department(以色列理工学院计算机科学系)

专题命中 测试生成 :repository(abstract);分类 cs.AI

AI总结 研究在局部渐近正态性下工作节点发出的置信密度,指出其为吉布斯 - 玻尔兹曼测度,逆温度是样本大小。高斯/线性下相关结果精确,MapReduce归约是配分函数,还有频率主义一致性等结论。

Comments N/A

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 代码评测 7 篇

2606.11864 2026-08-25 cs.IR 版本更新 67%

CORE-Bench: A Comprehensive Benchmark for Code Retrieval in the Era of Agentic Coding

CORE-Bench:智能体编程时代代码检索的综合基准

Fuwei Zhang, Yanzhao Zhang, Mingxin Li, Dingkun Long, Lexiang Hu, Pengjun Xie, Zhao Zhang, Fuzhen Zhuang

专题命中 代码评测 :repository(abstract);coding agent(abstract)

AI总结 针对智能体编程中需求驱动的仓库级代码检索问题,构建了包含18万查询和10.6万上下文相关性标签的三级基准CORE-Bench,实验表明现有嵌入模型性能显著下降,微调可提升效果。

Comments Accepted By EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04448 2026-08-25 cs.AI cs.CL cs.CV cs.LG cs.MA 版本更新 67%

SkillNet: Create, Evaluate, and Connect AI Skills

SkillNet: 创建、评估和连接AI技能

Yuan Liang, Ruobin Zhong, Haoming Xu, Chen Jiang, Yi Zhong, Runnan Fang, Jia-Chen Gu, Shumin Deng, Yunzhi Yao, Mengru Wang, Shuofei Qiao, Yida Xue, Xin Xu, Tongtong Wu, Kun Wang, Yang Liu, Zhen Bi, Jungang Lou, Yuchen Eleanor Jiang, Hangcheng Zhu, Gang Yu, Haiwen Hong, Longtao Huang, Hui Xue, Chenxi Wang, Yijun Wang, Zifei Shan, Xi Chen, Zhaopeng Tu, Feiyu Xiong, Xin Xie, Peng Zhang, Zhengke Gui, Lei Liang, Jun Zhou, Chiyu Wu, Jin Shang, Yu Gong, Junyu Lin, Changliang Xu, Hongjie Deng, Wen Zhang, Keyan Ding, Qiang Zhang, Fei Huang, Ningyu Zhang, Jeff Z. Pan, Guilin Qi, Haofen Wang, Huajun Chen

机构 * Zhejiang University(浙江大学) Tongji University(同济大学) Southeast University(东南大学) Alibaba Group(阿里巴巴集团) Tencent(腾讯) Fudan University(复旦大学) The University of Edinburgh(爱丁堡大学) Monash University(墨尔本大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Huzhou University(湖州大学) Hornor Device Co., Ltd(Hornor设备有限公司) Hangzhou Institute for Advanced Study, UCAS(杭州先进研究所,UCAS)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SkillNet通过统一的本体和多维评估机制,大规模创建、评估和连接AI技能,提升代理性能并促进技能的持久掌握。

Comments this http URL (http://skillnet.openkg.cn/;) add SkillNet-Gym, a benchmark for evaluating skill retrieval, utilization, composition, and SkillNet-Fabric for task-specific skill routing through lightweight Wikis

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12295 2026-08-25 cs.CL cs.AI cs.LG 版本更新 67%

Text-ADBench: Text Anomaly Detection Benchmark Based on LLM Embeddings

Text-ADBench:基于大语言模型嵌入的文本异常检测基准

Feng Xiao, Jicong Fan

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究构建了基于LLM嵌入的文本异常检测基准,通过多模型、多数据集的实验发现嵌入质量决定检测效果,深度学习方法在LLM嵌入下无性能优势,还提出了高效评估策略并开源工具包。

详情

展开后加载摘要…

URL PDF HTML 收藏