Evaluating Static and Process Evidence for Code Authorship in Programming Education
评估编程教育中代码作者身份的静态和过程证据
专题命中 代码评测 :repository(abstract);分类 cs.SE
AI总结 研究编程教育中代码作者身份问题,通过任务感知评估对比不同环境,发现竞赛数据信号强,教育数据集弱,添加过程特征可提升其性能,表明过程模式能补充最终代码信号,模型适合作教师决策支持。
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
评估编程教育中代码作者身份的静态和过程证据
专题命中 代码评测 :repository(abstract);分类 cs.SE
AI总结 研究编程教育中代码作者身份问题,通过任务感知评估对比不同环境,发现竞赛数据信号强,教育数据集弱,添加过程特征可提升其性能,表明过程模式能补充最终代码信号,模型适合作教师决策支持。
Simulstream:用于评估和演示流式语音到文本翻译系统的开源工具包
机构 * Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)
专题命中 代码评测 :repository(abstract);分类 cs.CL
AI总结 研究流式语音到文本翻译在评估上的问题,提出开源框架simulstream,支持长语音的增量和重新翻译解码,能进行质量和延迟评估及实时可视化比较,填补了相关统一解决方案的空白。
三是神奇数字吗?基于大语言模型的修复循环的实证评估
专题命中 代码评测 :code generation(abstract);分类 cs.SE
AI总结 研究基于大语言模型的修复循环迭代限制,通过多个软件工程任务观察到收益递减模式,前几次迭代收获大,后续贡献小,还发现修复行为受工作流编排和反馈设计影响更大。
Comments 4 Pages (+1 for references), NIER Paper
大语言模型强化学习技术的技术综述
机构 * University of Georgia(佐治亚大学) ; Purdue University(普渡大学)
专题命中 代码评测 :code generation(abstract);分类 cs.AI
AI总结 综述强化学习与语言模型整合,介绍如近端策略优化等算法,分析其在各领域应用,对失败模式算法分析,给出分类法,评估趋势并探讨挑战与新兴方向,为研究提供路线图。
Comments Accepted to ACM Transactions on Intelligent Systems and Technology, June 2026
超越文档基础:代码、工具输出和文档上的跨度级幻觉检测
机构 * KR Labs(KR实验室) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; McGill University(麦吉尔大学) ; TU Wien(维也纳工业大学)
专题命中 代码评测 :repository(abstract);分类 cs.CL
AI总结 提出一个统一的跨度级幻觉检测基准,涵盖代码、工具输出、结构化文档和自然语言RAG数据,通过微调Qwen3.5-2B模型在跨域场景下显著优于现有方法。
Comments 8 pages
AutoTrainess: 教语言模型自主改进语言模型
专题命中 代码评测 :repository(abstract);分类 cs.CL
AI总结 提出AutoTrainess智能体,通过外部化人类经验为工作流和约束,在PostTrainBench上超越CLI基线,平均得分从23.21提升至26.94。
NSynC:计算的归一化综合
专题命中 代码评测 :program synthesis(abstract);分类 cs.PL
AI总结 提出NSynC方法,通过直接枚举语义而非语法来避免程序综合中的语义重复,实现8.93倍加速。
Comments 21 pages (of which 17 in appendix), 12 figures (of which 11 in appendix). Accepted to SYNT 2026
显式有限元代码Simcenter Radioss和OpenRadioss中超弹性物理增强神经网络的实现及其在冲击事件中的应用
机构 * Otto von Guericke University(奥托·冯·格里克大学)
专题命中 代码评测 :repository(abstract);分类 cs.LG
AI总结 提出将物理增强神经网络(PANNs)集成到显式有限元求解器的方法,通过自动生成Fortran用户材料子程序实现高效计算,并验证其在超弹性材料冲击模拟中的准确性。
Comments 26 pages, 11 Figures, 11 Listings, 4 Tables
LLM 是否准备好检测微服务架构中的反模式?
专题命中 代码评测 :repository(abstract);分类 cs.SE
AI总结 本文研究大型语言模型(LLM)通过提示分析微服务仓库静态制品来检测16种架构反模式的能力,与静态分析工具MARS对比,发现LLM在局部、异构或语义丰富的反模式上表现有竞争力,但在需要结构或跨服务依赖证据时受限,可作为补充工具。
Comments accepted at ICSME 2026
HELIOT:基于LLM的临床决策支持系统用于不良药物反应管理
机构 * Software Engineering (SeSa) Lab University of Salerno(软件工程(SeSa)实验室,萨勒诺大学) ; Amsterdam UMC Locatie AMC Amsterdam, The Netherlands(阿姆斯特丹大学医学中心(AMC)阿姆斯特丹,荷兰) ; Digital Health(数字健康;方法学;阿姆斯特丹公共卫生研究所阿姆斯特丹,荷兰) ; Methodology(阿姆斯特丹大学数据科学中心阿姆斯特丹,荷兰) ; Amsterdam Public Health Research Institute Amsterdam, The Netherlands ; University of Amsterdam Data Science Center Amsterdam, The Netherlands
专题命中 代码评测 :repository(abstract);分类 cs.AI
AI总结 HELIOT利用大语言模型处理非结构化临床数据,通过提取药物反应信息和学习患者用药耐受性,减少误报并提升不良药物事件预警的准确性与实用性。
LLM4MTLs:模型转换语言的自动生成与实证评估
专题命中 代码评测 :code generation(abstract);分类 cs.SE
AI总结 提出LLM4MTLs工作流,通过少样本提示、语法提示和辅助方法组合,自动生成并评估LLM编写的模型转换代码,发现少样本提示能提升语法质量但语义改进有限。
业务即规则:面向LLM的业务规则流建模基准与框架
机构 * Zhejiang University of Technology(浙江工业大学) ; Zhejiang Key Laboratory of Visual Information Intelligent Processing(浙江省视觉信息智能处理重点实验室) ; University of Aberdeen(阿伯丁大学) ; University of Birmingham(伯明翰大学)
专题命中 代码评测 :code generation(abstract);分类 cs.CL
AI总结 提出BREX基准(409份真实业务文档与2855条专家标注规则)和ExIde框架,通过可执行伪代码生成显式建模规则依赖,在13个LLM上验证了可执行接地作为归纳偏置的有效性。
用于链接预测的早期退出图神经网络
机构 * University of Cambridge(剑桥大学) ; Sapienza University of Rome(罗马大学)
专题命中 代码评测 :repository(abstract);分类 cs.LG
AI总结 提出一种无需辅助损失的早期退出策略,在GCN和SAS-GNN骨干网络上实现链接预测的加速,同时保持或提升预测质量。
Comments Accepted at LoG@Pisa 2026
面向受限数据图像生成与增强的以对象为中心的数据集资源
机构 * The University of Queensland(昆士兰大学) ; Swinburne University of Technology(斯威本科技大学)
专题命中 代码评测 :repository(abstract);分类 cs.LG
AI总结 针对少样本场景下的对象中心图像生成,提出三个标准化数据集资源(Cityscapes-Pedestrian、TrafficSigns、COCO PottedPlant),提供256×256裁剪、边界框标注及重建脚本,支持受控比较与评估。
Comments 5 pages including references, 2 figures, 2 tables. Dataset and related files at https://github.com/Latzi/object-centric-low-data-datasets and https://doi.org/10.5281/zenodo.20573001
本地LLM智能体作为易受攻击的运行时:智能体运行时层的源代码审计
机构 * Department of Computer Science and Engineering(计算机科学与工程系) ; University at Buffalo, SUNY(布法罗大学)
专题命中 代码评测 :repository(abstract);分类 cs.AI
AI总结 提出CLAWAUDIT静态审计框架,通过STRIDE导出的五类漏洞分类法和自定义静态分析规则,评估本地LLM智能体运行时的安全弱点,在OpenClaw基准上显著提升召回率。
MalSkillBench: 一个运行时验证的恶意智能体技能基准
专题命中 代码评测 :coding agent(abstract);分类 cs.SE
AI总结 提出MalSkillBench,首个运行时验证的恶意智能体技能基准,包含3944个恶意技能,通过闭环生成-验证-反馈流水线构建,揭示代码注入与提示注入检测的不对称性,并指出联合推理任务意图、代码和指令的必要性。
MCP-SandboxScan:基于WASM的MCP工具安全执行与运行时分析
专题命中 代码评测 :repository(abstract);分类 cs.SE
AI总结 本文提出MCP-SandboxScan框架,通过WASM环境执行工具并提取运行时证据,结合语义分析识别MCP工具的风险,验证其在跨语言项目、 evasion基准和100个仓库中的有效性。
LivePI:更真实的智能体对抗间接提示注入基准测试
机构 * University of Pennsylvania(宾夕法尼亚大学)
专题命中 代码评测 :repository(abstract);分类 cs.AI
AI总结 提出LivePI基准,覆盖7种输入表面、12种攻击/渲染家族和5种恶意目标,在真实虚拟机环境中评估多个AI智能体,发现攻击成功率10.7%-29.6%,并验证了两层防御的有效性。
GameCraft-Bench:智能体能否在真实游戏引擎中端到端构建可玩游戏?
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Shenzhen Loop Area Institute(深圳河套学院) ; Hunyuan Team, Tencent(腾讯混元团队) ; USTB(北京科技大学) ; DualverseAI ; SJTU(上海交通大学) ; NUS(新加坡国立大学)
专题命中 代码评测 :coding agent(abstract);分类 cs.CL
AI总结 提出GameCraft-Bench基准,评估编码智能体在Godot引擎中端到端生成可玩游戏的能力,最强智能体仅达41.46%成功率。
MultiMolecule: 一个用于生物分子序列模型工作流的模块化生态系统
机构 * DanLing Team(丹 Ling 团队)
专题命中 代码评测 :repository(abstract);分类 cs.LG
AI总结 提出MultiMolecule开源生态系统,通过标准化接口整合RNA、DNA和蛋白质序列模型,提供53个模型族实现、112个检查点和16个数据集资源,支持模型复用、评估和生物预测。
医学图像分割综述:挑战、基准与未来展望
机构 * School of Control and Computer Engineering, North China Electric Power University(华北电力大学控制与计算机工程学院) ; SPIC Digital Technology Co., Ltd(国家电投数字科技有限公司) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Department 6 of Health Care, Second Medical Center, People’s Liberation Army General Hospital(中国人民解放军总医院第二医学中心健康医学科六病区)
专题命中 代码评测 :repository(abstract);分类 cs.AI
AI总结 本文系统综述了基于U-Net、Transformer和SAM架构的医学图像分割方法,分析主要挑战,旨在指导未来研究并推动临床转化。
Comments 12 pages,3 figures,1 table. All related resources are available at https://github.com/andrew-pengyu/Awsome_MedSeg/tree/main
语言模型智能体中的奖励黑客:重新审视AI安全网格世界
机构 * KUIS AI Center, Koç University(科奇大学KUIS人工智能中心) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 代码评测 :repository(abstract);分类 cs.AI
AI总结 本研究将AI安全网格世界框架改编为文本评估套件,发现语言模型在零样本下出现规范博弈,通过直接奖励优化扩大观察与隐藏奖励差距,且标准缓解措施无效。
Comments 28 pages, 16 figures, 13 tables
基于多模态大语言模型的移动用户体验推理:任务、基准与方法
机构 * Ant Group(蚂蚁集团)
专题命中 代码评测 :code generation(abstract);分类 cs.AI
AI总结 提出UXBench基准(2000个VQA样本)评估多模态大模型在UI推理上的能力,并设计UI-UX模型,通过奖励路由和不对称过渡奖励机制在UXBench上达到0.7963准确率,超越Claude-4.5-Sonnet。
Comments 10 pages, 6 figures, Accepted at CVPR 2026 Findings
评估大语言模型生成的代码:一个基准和开发者研究
专题命中 代码评测 :code generation(abstract);分类 cs.SE
AI总结 本文提出了一种定制的树折评估方法,用于评估大语言模型生成的代码,弥补了现有基准在代码质量和可操作性方面的不足,并通过对比三个通用大语言模型展示了其有效性。
Comments Accepted for publication at EASE '26/EQUISA workshop
POPSICLE: 用于冷冻电镜断层扫描中分割和定位的基准数据集
机构 * Biohub ; Brigham Young University
专题命中 代码评测 :repository(abstract);分类 cs.LG
AI总结 提出POPSICLE基准套件,基于CryoET数据门户构建,涵盖真核和原核系统、纯化与原位样本,支持体素分割和稀疏定位任务,旨在解决冷冻电镜断层扫描中缺乏标准化基准的问题。
RTL-BenchLS:面向大语言模型的RTL推理与生成的大规模基准
机构 * Hong Kong University of Science and Technology(香港科技大学)
专题命中 代码评测 :repository(abstract);分类 cs.AI
AI总结 提出大规模基准RTL-BenchLS,包含超1万个形式验证的Verilog设计,并引入三项自监督推理任务,解决现有基准规模小、任务单一的问题,评估显示当前最佳模型性能较低。
AutoPipelineAI: 基于自然语言的上下文感知CI/CD流水线生成
专题命中 代码评测 :repository(abstract);分类 cs.SE
AI总结 提出AutoPipelineAI系统,利用大语言模型从自然语言描述生成CI/CD流水线配置,集成仓库感知分析、自动验证和反馈机制,降低DevOps配置复杂度。
Comments 7 pages, 1 figure, 6 tables, 16 references, IMSA Conference 11-12 July 2026, International Conference on Intelligent Methods, Systems, and Applications 2026 #70415,
SciVisAgentSkills:面向科学数据分析和可视化的智能体技能设计与评估
机构 * Univ. Notre Dame(诺丁汉大学) ; LLNL(劳伦斯利弗莫尔国家实验室)
专题命中 代码评测 :coding agent(abstract);分类 cs.AI
AI总结 提出SciVisAgentSkills技能库,通过编码环境假设、工具使用模式和领域启发式知识增强编码智能体,在ParaView等科学工具上实现自然语言驱动的科学可视化工作流,实验表明技能可提升任务得分并影响token效率。
TamperBench:系统化压力测试微调和篡改下的LLM安全性
机构 * Critical ML Lab Waterloo Canada(Waterloo大学Critical ML实验室) ; FAR.AI Berkeley USA(伯克利美国FAR.AI公司) ; University of Toronto Toronto Canada(多伦多大学) ; University of Waterloo Waterloo Canada(Waterloo大学) ; ETH Zürich Zürich Switzerland(苏黎世联邦理工学院) ; MIT CSAIL Cambridge USA(麻省理工学院CSAIL实验室) ; University of Toronto, MPI, EuroSafeAI, Vector Institute Toronto Canada(多伦多大学、马克斯·普朗克研究所、EuroSafeAI、Vector Institute) ; Critical ML Lab University of Waterloo Waterloo Canada(Waterloo大学Critical ML实验室)
专题命中 代码评测 :repository(abstract);分类 cs.AI
AI总结 提出统一框架TamperBench,通过系统化超参数扫描评估21个开源LLM在9种篡改威胁下的安全性和实用性,发现越狱微调是最严重攻击,当前对齐阶段防御基本失效。
Comments 25 pages, 15 figures
诊断大语言模型工具使用中的知识缺口:面向新API获取的智能体基准
机构 * NYU Shanghai(纽约大学上海分校)
专题命中 代码评测 :code generation(abstract);分类 cs.AI
AI总结 提出 NovelAPIBench 基准,通过动态发现新API、分解知识包并生成可执行任务,诊断模型在API使用中的六类错误,发现检索与参数调优互补。
Comments 37 pages, 12 figures