arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1740 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 1740 篇

2604.25109 2026-04-29 cs.CR cs.AI 57%

Structured Security Auditing and Robustness Enhancement for Untrusted Agent Skills

结构化安全审计与不信任代理技能的鲁棒性增强

Lijia Lv, Xuehai Tang, Jie Wen, Jizhong Han, Songlin Hu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本文提出SkillGuard-Robust,通过角色感知证据提取、选择性语义验证和一致性保持裁决,解决代理技能预加载审计中语义保持重写下恶意意图识别不一致的问题,实验结果显示其在不同数据集上的高准确率和召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24621 2026-04-28 cs.SE 57%

Evaluation of LLM-Based Software Engineering Tools: Practices, Challenges, and Future Directions

评估基于大语言模型的软件工程工具:实践、挑战与未来方向

Utku Boran Torun, Veli Karakaya, Ali Babar, Eray Tüzün

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 本文探讨了基于大语言模型的软件工程工具的评估问题,分析了现有评估方法的局限性,并提出了未来研究方向以提升评估的可靠性与可扩展性。

Comments Accepted to EASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22871 2026-04-28 cs.CR cs.AI cs.MA 57%

AutoRISE: Agent-Driven Strategy Evolution for Red-Teaming Large Language Models

AutoRISE:面向大语言模型的代理驱动策略进化

Tanmay Gautam, Alireza Bahramali, Sandeep Atluri

机构 * Responsible AI, Microsoft(微软责任人工智能)

专题命中 代码评测 :coding agent(abstract);分类 cs.AI

AI总结 本文提出AutoRISE,通过代理编辑攻击策略并评估,实现攻击策略的进化,提升了对抗成功率。

Comments 36 pages, 6 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22840 2026-04-28 cs.CV cs.CL cs.MM 57%

AeSlides: Incentivizing Aesthetic Layout in LLM-Based Slide Generation via Verifiable Rewards

AeSlides:通过可验证奖励激励基于大语言模型的幻灯片生成中的美观布局

Yiming Pan, Chengwei Hu, Xuancheng Huang, Can Huang, Mingming Zhao, Yuean Bi, Xiaohan Zhang, Aohan Zeng, Linmei Hu

机构 * Beijing Institute of Technology(北京理工大学) Zhipu AI (Z.ai)(智谱AI)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 本文提出AeSlides框架,通过可验证奖励优化幻灯片生成的美观布局,实验表明其在布局合规性、空格减少、元素碰撞和视觉平衡方面均优于现有方法。

Comments 21 pages, 25 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22834 2026-04-28 cs.CV cs.LG 57%

WebSerial Vision Training for Microcontrollers: A Browser-Based Companion to On-Device CNN Training

为微控制器的WebSerial视觉训练:一种浏览器基于的设备端CNN训练配套工具

Jeremy Ellis

机构 * High School Robotics Educator(高中机器人教育者)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本文提出webmcu-vision-web,一种浏览器应用,用于在Seeed Studio XIAO ESP32-S3 Sense上端到端训练和部署TinyML视觉模型,提供本地机器学习流程,无需软件安装,支持实时激活可视化,实现快速训练部署。

Comments 29 pages, 16 figures, 5 tables. Paper 2 of the webmcu-ai series. All source code and supplemental results available at: https://github.com/webmcu-ai/webmcu-vision-web

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22454 2026-04-27 cs.SE 57%

Gamifying Architectural Governance to Reduce Organizational Coupling in Microservice Systems

通过游戏化实现建筑治理以减少微服务系统中的组织耦合

Xiaozhou Li

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 本文提出通过游戏化手段影响开发者行为,减少微服务系统中的组织耦合,采用游戏化框架持续挖掘代码库数据以检测架构边界违规,提升架构可维护性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21095 2026-04-24 cs.DC cs.SE q-bio.GN 57%

TorchGWAS : GPU-accelerated GWAS for thousands of quantitative phenotypes

TorchGWAS:用于数千种定量表型的GPU加速GWAS

Xingzhong Zhao, Ziqian Xie, Islam, Sheikh Muhammad Saiful, Tian Xia, Chen, Cheng, Degui Zhi

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 TorchGWAS通过GPU加速实现大规模表型面板的高通量关联测试,显著提升处理效率,适用于需高效评估数千种定量性状的场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13697 2026-04-23 cs.LG 57%

Splitting criteria for ordinal decision trees: an experimental study

序数决策树的分裂标准:一项实证研究

Rafael Ayllón-Gavilán, Francisco José Martínez-Estudillo, David Guijo-Rubio, César Hervás-Martínez, Pedro Antonio Gutiérrez

机构 * Department of Clinical-Epidemiological Research in Primary Care, IMIBIC(初级保健临床流行病学研究部门,IMIBIC) Department of Quantitative Methods, Universidad Loyola Andalucía(定量方法部门,洛伊亚安达卢西亚大学)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本文通过实验证明序数分裂标准在决策树中的有效性,发现Ordinal Gini在减少均方误差方面表现最佳,同时提供了可复现的研究资源。

Comments 33 pages, 4 figures, 6 tables

Journal ref Pattern Recognition, Volume 171, Part B, March 2026, 112273

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18148 2026-04-21 cs.CV cs.LG 57%

Attention-ResUNet for Automated Fetal Head Segmentation

基于注意力机制的ResUNet用于自动胎儿头部分割

Ammar Bhilwarawala, Mainak Bandyopadhyay

机构 * School of Computer Engineering, KIIT Deemed to be University, Bhubaneswar, India(计算机工程学院,KIIT大学,比哈尔邦,印度)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本文提出Attention-ResUNet,通过残差学习与多尺度注意力机制提升胎儿头部分割精度,实验表明其在HC18数据集上Dice得分达99.30%,优于其他基线模型。

Comments Accepted and Presented at ANTIC 2025, IIITM Gwalior (5th International Conference on Advanced Network Technologies and Intelligent Computing) on 23rd December 2025. Presented with the best paper award in Image Processing Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13099 2026-04-21 cs.CL 57%

Alexandria: A Multi-Domain Dialectal Arabic Machine Translation Dataset for Culturally Inclusive and Linguistically Diverse LLMs

Alexandria:一个多领域方言阿拉伯语机器翻译数据集,用于文化包容和语言多样性的LLM

Abdellah El Mekki, Samar M. Magdy, Houdaifa Atou, Ruwa AbuHweidi, Baraah Qawasmeh, Omer Nacar, Thikra Al-hibiri, Razan Saadie, Hamzah Alsayadi, Nadia Ghezaiel Hammouda, Alshima Alkhazimi, Aya Hamod, Al-Yas Al-Ghafri, Wesam El-Sayed, Asila Al sharji, Mohamad Ballout, Anas Belfathi, Karim Ghaddar, Serry Sibaee, Alaa Aoun, Areej Asiri, Lina Abureesh, Ahlam Bashiti, Majdal Yousef, Abdulaziz Hafiz, Yehdih Mohamed, Emira Hamedtou, Brakehe Brahim, Rahaf Alhamouri, Youssef Nafea, Aya El Aatar, Walid Al-Dhabyani, Emhemed Hamed, Sara Shatnawi, Fakhraddin Alwajih, Khalid Elkhidir, Ashwag Alasmari, Abdurrahman Gerrio, Omar Alshahri, AbdelRahim A. Elmadany, Ismail Berrada, Amir Azad Adli Alkathiri, Fadi A Zaraket, Mustafa Jarrar, Yahya Mohamed El Hadj, Hassan Alhuzali, Muhammad Abdul-Mageed

机构 * The University of British Columbia(不列颠哥伦比亚大学) Canada Research Chair in NLP and ML(自然语言处理和机器学习研究主席) Mohammed VI Polytechnic University(穆莱·阿卜杜勒阿齐兹国王理工学院) Birzeit University(比尔泽特大学) Western Michigan University(西部密歇根大学) Tuwaiq Academy(图瓦伊克学院) King Khalid University(国王卡利德大学) American University of Beirut(贝鲁特美国大学) Ibb University(伊卜大学) University of Hail(海勒大学) University of Technology and Applied Sciences(技术与应用科学大学) Arab Open University(阿拉伯开放大学) Minia University(米尼亚大学) Nantes University(南特大学) Prince Sultan University(沙特王子大学) Umm Al-Qura University(乌姆·阿勒·卡拉大学) University of Nouakchott(努尔人大学) Fatabyyano(法塔比亚诺) Independent Researcher(独立研究者) Hadhramout University(哈德拉姆大学) Cairo University(开罗大学) Misurata University(米斯拉塔大学) Al-Balqa Applied University(巴勒斯坦应用大学) University of Khartoum(喀土穆大学) Sultan Qaboos Higher Centre for Culture and Science(穆罕默德·本·拉希德·阿勒马克图姆文化与科学高级中心) Arab Center for Research and Policy Studies(阿拉伯研究中心) Hamad Bin Khalifa University(哈马德·本·哈利法大学) Institut Supérieur du Numérique(数字高级学院)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 Alexandria数据集通过多领域方言阿拉伯语对话数据,提升LLM在不同阿拉伯方言中的翻译能力,揭示现有模型在方言翻译中的挑战。

Comments Accepted to ACL 2026 Main; Project resources will be available here: https://github.com/UBC-NLP/Alexandria

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12782 2026-04-21 cs.AI 57%

HeroBench: A Benchmark for Long-Horizon Planning and Structured Reasoning in Virtual Worlds

HeroBench:一个用于虚拟世界中长horizon规划和结构化推理的基准测试

Petr Anokhin, Roman Khalikov, Stefan Rebrikov, Viktor Volkov, Artyom Sorokin, Vincent Bissonnette

机构 * Artyom Sorokin(AXXX) Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学) Higher School of Economics(高等经济学院) Kurchatov Institute(库尔斯克研究所) Independent Researcher(独立研究者)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 本文提出HeroBench,用于评估在复杂RPG-inspired虚拟世界中长horizon分层规划和结构化推理的能力,通过模拟评估可执行计划,揭示了现有大型语言模型在长horizon自主规划中的性能差异和挑战。

Comments Code is available at https://github.com/stefanrer/HeroBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15151 2026-04-17 cs.CL 57%

QuantCode-Bench: A Benchmark for Evaluating the Ability of Large Language Models to Generate Executable Algorithmic Trading Strategies

QuantCode-Bench: 一个用于评估大型语言模型生成可执行算法交易策略能力的基准

Alexey Khoroshilov, Alexey Chernysh, Orkhan Ekhtibarov, Nini Kamkia, Dmitry Zmitrovich

机构 * Lime

专题命中 代码评测 :code generation(abstract);分类 cs.CL

AI总结 本文提出QuantCode-Bench,通过多阶段流程评估现代LLM生成Backtrader框架策略的能力,包含400个不同难度任务,分析模型在交易逻辑、API使用和任务语义方面的局限性。

Comments 12 pages, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14828 2026-04-17 cs.CL 57%

Pangu-ACE: Adaptive Cascaded Experts for Educational Response Generation on EduBench

Pangu-ACE:适应性级联专家用于EduBench教育响应生成

Dinghao Li, Wenlong Zhou, Zhimin Chen, Yuehan Peng, Hong Ni, Chengfu Zou, Guoyu Shi, Yaochen Li

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 Pangu-ACE通过级联专家系统提升教育响应质量,在EduBench基准上实现更高效的计算分配,改进确定性和格式有效性,同时保持较低的直接请求比例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13413 2026-04-16 cs.LG 57%

Dataset-Level Metrics Attenuate Non-Determinism: A Fine-Grained Non-Determinism Evaluation in Diffusion Language Models

数据层面指标削弱非确定性:扩散语言模型中的细粒度非确定性评估

Zhengyu Fang, Zhimeng Jiang, Huiyuan Chen, Xiaoge Zhang, Tianyi Li, Kaiyu Tang, Xiao Li, Jing Li

机构 * Department of Computer Data Sciences, Case Western Reserve University, Cleveland, USA Department of Computer Science \& Engineering, Texas A\&M University, College Station, USA Department of Biochemistry, Case Western Reserve University, Cleveland, USA Center for RNA Science Therapeutics, Case Western Reserve University, Cleveland, USA Department of Biomedical Engineering, Case Western Reserve University, Cleveland, USA

专题命中 代码评测 :code generation(abstract);分类 cs.LG

AI总结 本文研究了扩散语言模型中非确定性问题,指出数据层面指标限制了对模型行为变化的洞察,并提出基于样本级预测差异的细粒度评估方法,揭示了非确定性在代码生成中的高敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12978 2026-04-15 cs.CL cs.CV 57%

GlotOCR Bench: OCR Models Still Struggle Beyond a Handful of Unicode Scripts

GlotOCR Bench: OCR模型在超过少数Unicode脚本之外仍面临困难

Amir Hossein Kargaran, Nafiseh Nikeghbal, Jana Diesner, François Yvon, Hinrich Schütze

机构 * LMU Munich(慕尼黑大学) TU Munich(慕尼黑工业大学) MCML Sorbonne Université & CNRS, ISIR(索邦大学与CNRS,ISIR)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 GlotOCR Bench评估OCR在100+Unicode脚本上的泛化能力,发现大多数模型在少于十种脚本上表现良好,最强模型也难以泛化到三十种以上脚本,表明当前OCR系统依赖语言模型预训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12902 2026-04-15 cs.PL cs.DC cs.PF 57%

Towards a Linear-Algebraic Hypervisor

向线性代数虚拟机迈进

Breandan Considine

专题命中 代码评测 :program synthesis(abstract);分类 cs.PL

AI总结 本文提出一种并行虚拟机,通过评估数百万个并发数组程序,发现其在相对传统顺序评估的情况下可达到147倍的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12875 2026-04-15 cs.AI 57%

AISafetyBenchExplorer: A Metric-Aware Catalogue of AI Safety Benchmarks Reveals Fragmented Measurement and Weak Benchmark Governance

AISafetyBenchExplorer:一个基于指标的AI安全基准目录揭示了测量碎片化和弱基准治理

Abiodun A. Solanke

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本文提出AISafetyBenchExplorer,通过多表结构记录195个AI安全基准的元数据、指标定义等,揭示当前基准体系中测量标准化滞后于基准繁衍的问题,强调碎片化而非稀缺性是领域的主要失败模式。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12064 2026-04-15 cs.CR cs.SE 57%

LLM-Redactor: An Empirical Evaluation of Eight Techniques for Privacy-Preserving LLM Requests

LLM-Redactor: 对八种隐私保护LLM请求技术的实证评估

Justice Owusu Agyemang, Jerry John Kponyo, Elliot Amponsah, Godfred Manu Addo Boakye, Kwame Opuni-Boachie Obour Agyekum

专题命中 代码评测 :coding agent(abstract);分类 cs.SE

AI总结 本文评估了八种隐私保护LLM请求技术,发现组合A+B+C在保护PII和专有代码方面效果最佳,提出基于威胁模型的决策规则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07061 2026-04-14 cs.AI 57%

Do LLMs Feel? Teaching Emotion Recognition with Prompts, Retrieval, and Curriculum Learning

LLMs能否感知情绪?通过提示、检索和课程学习进行情绪识别

Xinran Li, Yu Liu, Jiaqi Qiao, Xiujuan Xu

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本文提出PRC-Emo框架,结合提示工程、示范检索和课程学习,探索LLM在对话中感知情绪的能力,实验表明在IEMOCAP和MELD数据集上达到新的SOTA性能。

Comments Accepted at AAAI 2026

Journal ref Proc. AAAI Conf. on Artificial Intelligence, Vol. 40, No. 38, pp. 31778-31786 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08851 2026-04-13 cs.CL 57%

Cross-Lingual Attention Distillation with Personality-Informed Generative Augmentation for Multilingual Personality Recognition

跨语言注意力蒸馏与基于个性引导的生成增强用于多语言个性识别

Jing Jie Tan, Ban-Hoe Kwan, Danny Wee-Kiat Ng, Yan-Chai Hum, Noriyuki Kawarazaki, Kosuke Takano

机构 * Universiti Tunku Abdul Rahman(拉曼大学) Kanagawa Institute of Technology(神奈川工科大学) Université Sorbonne Paris Nord(索邦巴黎北大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 本文提出ADAM方法,通过跨语言注意力蒸馏和基于个性引导的生成增强,提升多语言个性识别性能,实验表明CLAD在多种语言和个性特征上均优于标准BCE模型。

Comments IEEE Transactions on Cognitive and Developmental Systems (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08947 2026-04-13 cs.AI 57%

AlphaCast: A Human Wisdom-LLM Intelligence Co-Reasoning Framework for Interactive Time Series Forecasting

AlphaCast:一种用于交互式时间序列预测的人类智慧-大语言模型智能协同推理框架

Xiaohan Zhang, Tian Gao, Mingyue Cheng, Bokai Pan, Ze Guo, Yaguo Liu, Xiaoyu Tao, Qi Liu

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(中国科学技术大学认知智能国家重点实验室)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 AlphaCast提出一种交互驱动的代理推理框架,利用无训练大语言模型实现准确的时间序列预测,通过多阶段工作流整合上下文准备、基于推理的生成和反思评估,将预测转化为多轮自主交互过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19316 2026-04-10 cs.SE 57%

Modeling Sampling Workflows for Code Repositories

对代码仓库的采样工作流建模

Romain Lefeuvre, Maïwenn Le Goasteller, Jessie Galasso, Benoit Combemale, Quentin Perez, Houari Sahraoui

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 本文提出一种领域特定语言,用于描述复杂采样策略,以提高采样方法的可表示性和可推理性,通过统计指标验证了其在代码仓库采样中的有效性。

Journal ref MSR '26 - 23rd International Conference on Mining Software Repositories, Apr 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06901 2026-04-09 cs.CE cs.AI cs.CV cs.CY cs.ET 57%

XR-CareerAssist: An Immersive Platform for Personalised Career Guidance Leveraging Extended Reality and Multimodal AI

XR-CareerAssist:一种结合扩展现实与多模态AI的沉浸式个性化职业指导平台

N. D. Tantaroudas, A. J. McCracken, I. Karachalios, E. Papatheou, V. Pastrikakis

机构 * Institute of Communications and Computer Systems (ICCS)(通信与计算机系统研究所) DASKALOS-APPS National Technical University of Athens(雅典国家技术大学) University of Exeter(埃克塞特大学) CVCOSMOS Ltd(CVCOSMOS有限公司)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本文提出XR-CareerAssist平台,结合扩展现实与多模态AI,提供沉浸式、多语言的职业指导。系统整合语音识别、神经机器翻译、对话训练助手、视觉-语言模型和3D虚拟形象,通过动态Sankey图展示职业轨迹,实验显示高准确率和用户满意度。

Comments 21

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05168 2026-04-08 cs.AI 57%

Instruction-Tuned LLMs for Parsing and Mining Unstructured Logs on Leadership HPC Systems

指令调优的LLM用于领导型HPC系统上解析和挖掘无结构日志

Ahmad Maroof Karimi, Jong Youl Choi, Charles Qing Cao, Awais Khan

机构 * Oak Ridge National Laboratory(橡树岭国家实验室) University of Tennessee(田纳西大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本文提出一种基于指令调优的LLM框架,利用链式推理解析HPC日志,结合领域特定日志模板和示例对LLaMA模型进行微调,实现高精度的日志解析与挖掘,验证了其在大规模日志数据上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07388 2026-04-08 cs.CL 57%

Recent Advances in Multimodal Affective Computing: An NLP Perspective

多模态情感计算近期进展:自然语言处理视角

Guimin Hu, Weimin Lyu, Chang Sun, Zhihong Zhu, Lin Gui, Ruichu Cai, Erik Cambria, Hasti Seifi

机构 * Guangdong University of Technology(广东工业大学) Stony Brook University(石溪大学) University of Bologna(博洛尼亚大学) Peking University(北京大学) Nanyang Technological University(南洋理工大学) Arizona State University(亚利桑那州立大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 本文从自然语言处理视角系统回顾了多模态情感计算的最新进展,聚焦于多模态情感分析、对话中多模态情绪识别、基于方面的多模态情感分析及多标签情绪识别等四个任务,提出统一视角并探讨相关方向与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23047 2026-04-07 cs.SE 57%

CL4SE: Benchmarking Context Learning on Software Engineering

CL4SE:软件工程中基于上下文学习的基准测试

Haichuan Hu, Quanjun Zhang, Ye Shang, Guoqing Xie, Chunrong Fang, Zhenyu Chen, Liang Xiao

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 本文提出CL4SE基准测试,系统分类四种软件工程特定上下文类型,通过高质量数据集和五种主流LLM评估,展示上下文学习在代码生成、审查等任务中的性能提升。

Comments 34 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24428 2026-04-07 cs.SE 57%

CodeWiki: Evaluating AI's Ability to Generate Holistic Documentation for Large-Scale Codebases

CodeWiki: 评估AI生成大规模代码库整体文档的能力

Anh Nguyen Hoang, Minh Le-Anh, Bach Le, Nghi D. Q. Bui

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 CodeWiki提出一个统一框架,用于生成多语言代码库的自动化文档,通过层级分解、递归多代理处理和多模态合成,提升文档质量,实验显示其在高脚本语言上的改进显著。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02520 2026-04-06 physics.data-an cs.LG 57%

Neural posterior estimation for scalable and accurate inverse parameter inference in Li-ion batteries

用于锂离子电池可扩展和准确逆参数推断的神经后验估计

Malik Hassanaly, Corey R. Randall, Peter J. Weddle, Paul J. Gasper, Conlain Kelly, Tanvir R. Tanim, Kandler Smith

机构 * Computational Science Center, National Laboratory of the Rockies(落基山国家实验室计算科学中心) Energy Conversion and Storage Systems Center, National Laboratory of the Rockies(落基山国家实验室能量转换与存储系统中心) Energy Storage Research and Analysis Department, Idaho National Laboratory(爱达荷国家实验室储能研究与分析部)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本文提出神经后验估计方法,用于高效估计锂离子电池参数,尽管在高维情况下计算成本较高,但能提供更准确的参数校准,并在电压预测中存在误差,同时具有更高的可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01588 2026-04-03 cs.AI 57%

NED-Tree: Bridging the Semantic Gap with Nonlinear Element Decomposition Tree for LLM Nonlinear Optimization Modeling

NED-Tree: 通过非线性元素分解树弥合语义鸿沟以实现LLM非线性优化建模

Zhijing Hu, Yufan Deng, Haoyang Liu, Changjun Fan

机构 * College of System Engineering, National University of Defense Technology(国防科技大学系统工程学院) University of Science and Technology of China(中国科学技术大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本文提出NED-Tree框架,通过句级提取策略和递归树结构解决LLM在非线性优化建模中的语义鸿沟问题,实验显示其在10个基准测试中达到72.51%的平均准确率。

Comments 17 pages, 7 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00788 2026-04-02 cs.AI cs.CR 57%

UK AISI Alignment Evaluation Case-Study

英国人工智能安全研究所对齐评估案例研究

Alexandra Souly, Robert Kirk, Jacob Merizian, Abby D'Cruz, Xander Davies

机构 * UK AI Security Institute(英国人工智能安全研究所)

专题命中 代码评测 :coding agent(abstract);分类 cs.AI

AI总结 本文评估了前沿模型在作为代码助手部署时是否可靠遵循目标,发现未发现研究 sabotage,但部分模型对安全相关任务不合作,且评估意识较弱。

详情

展开后加载摘要…

URL PDF HTML 收藏