arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1740 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 1740 篇

2501.04306 2025-01-09 cs.CL cs.DL 57%

LLM4SR: A Survey on Large Language Models for Scientific Research

Ziming Luo, Zonglin Yang, Zexin Xu, Wei Yang, Xinya Du

专题命中 代码评测 :repository(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04604 2025-01-09 cs.AI 57%

ARC Prize 2024: Technical Report

Francois Chollet, Mike Knoop, Gregory Kamradt, Bryan Landers

专题命中 代码评测 :program synthesis(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20787 2025-01-07 cs.CR cs.AI 57%

SecBench: A Comprehensive Multi-Dimensional Benchmarking Dataset for LLMs in Cybersecurity

Pengfei Jing, Mengyun Tang, Xiaorong Shi, Xing Zheng, Sen Nie, Shi Wu, Yong Yang, Xiapu Luo

专题命中 代码评测 :code generation(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.21156 2024-12-31 cs.LG 57%

Unified dimensionality reduction techniques in chronic liver disease detection

Anand Karna, Naina Khan, Rahul Rauniyar, Prashant Giridhar Shambharkar

专题命中 代码评测 :repository(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15054 2024-12-20 cs.CV cs.AI cs.SD eess.AS 57%

GIRAFE: Glottal Imaging Dataset for Advanced Segmentation, Analysis, and Facilitative Playbacks Evaluation

G. Andrade-Miranda, K. Chatzipapas, J. D. Arias-Londoño, J. I. Godino-Llorente

专题命中 代码评测 :repository(abstract);分类 cs.AI

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11990 2024-12-17 cs.CL 57%

ExecRepoBench: Multi-level Executable Code Completion Evaluation

Jian Yang, Jiajun Zhang, Jiaxi Yang, Ke Jin, Lei Zhang, Qiyao Peng, Ken Deng, Yibo Miao, Tianyu Liu, Zeyu Cui, Binyuan Hui, Junyang Lin

专题命中 代码评测 :repository(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11912 2024-12-17 cs.CL 57%

CharacterBench: Benchmarking Character Customization of Large Language Models

Jinfeng Zhou, Yongkang Huang, Bosi Wen, Guanqun Bi, Yuxuan Chen, Pei Ke, Zhuang Chen, Xiyao Xiao, Libiao Peng, Kuntian Tang, Rongsheng Zhang, Le Zhang, Tangjie Lv, Zhipeng Hu, Hongning Wang, Minlie Huang

专题命中 代码评测 :repository(abstract);分类 cs.CL

Comments AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11328 2024-12-17 cs.SE 57%

Zero-Shot Prompting Approaches for LLM-based Graphical User Interface Generation

Kristian Kolthoff, Felix Kretzer, Lennart Fiebig, Christian Bartelt, Alexander Maedche, Simone Paolo Ponzetto

专题命中 代码评测 :repository(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09259 2024-12-10 cs.CV cs.CL 57%

Jailbreak Attacks and Defenses against Multimodal Generative Models: A Survey

Xuannan Liu, Xing Cui, Peipei Li, Zekun Li, Huaibo Huang, Shuhan Xia, Miaoxuan Zhang, Yueying Zou, Ran He

专题命中 代码评测 :repository(abstract);分类 cs.CL

Comments ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05137 2024-12-09 cs.AI 57%

Can Large Language Models Serve as Effective Classifiers for Hierarchical Multi-Label Classification of Scientific Documents at Industrial Scale?

Seyed Amin Tabatabaei, Sarah Fancher, Michael Parsons, Arian Askari

专题命中 代码评测 :repository(abstract);分类 cs.AI

Comments This paper has been accepted at COLING 2025 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18001 2024-12-06 cs.AI 57%

Benchmarking Foundation Models on Exceptional Cases: Dataset Creation and Validation

Suho Kang, Jungyang Park, Joonseo Ha, SoMin Kim, JinHyeong Kim, Subeen Park, Kyungwoo Song

专题命中 代码评测 :repository(abstract);分类 cs.AI

Comments EMNLP 2024 Workshop Genbench(https://genbench.org/workshop_programme/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03563 2024-12-05 cs.CL cs.CY 57%

From Individual to Society: A Survey on Social Simulation Driven by Large Language Model-based Agents

Xinyi Mou, Xuanwen Ding, Qi He, Liang Wang, Jingcong Liang, Xinnong Zhang, Libo Sun, Jiayu Lin, Jie Zhou, Xuanjing Huang, Zhongyu Wei

专题命中 代码评测 :repository(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.04508 2024-11-25 cs.SE 57%

Improving Code Search with Hard Negative Sampling Based on Fine-tuning

Hande Dong, Jiayi Lin, Yanlin Wang, Yichong Leng, Jiawei Chen, Yutao Xie

专题命中 代码评测 :code model(abstract);分类 cs.SE

Comments Accepted by APSEC 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10954 2024-11-19 cs.CL 57%

Dialectal Toxicity Detection: Evaluating LLM-as-a-Judge Consistency Across Language Varieties

Fahim Faisal, Md Mushfiqur Rahman, Antonios Anastasopoulos

专题命中 代码评测 :repository(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03022 2024-11-06 cs.CR cs.AI 57%

Flashy Backdoor: Real-world Environment Backdoor Attack on SNNs with DVS Cameras

Roberto Riaño, Gorka Abad, Stjepan Picek, Aitor Urbieta

专题命中 代码评测 :repository(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01318 2024-11-04 cs.CR cs.LG 57%

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Patrick Chao, Edoardo Debenedetti, Alexander Robey, Maksym Andriushchenko, Francesco Croce, Vikash Sehwag, Edgar Dobriban, Nicolas Flammarion, George J. Pappas, Florian Tramer, Hamed Hassani, Eric Wong

专题命中 代码评测 :repository(abstract);分类 cs.LG

Comments The camera-ready version of JailbreakBench v1.0 (accepted at NeurIPS 2024 Datasets and Benchmarks Track): more attack artifacts, more test-time defenses, a more accurate jailbreak judge (Llama-3-70B with a custom prompt), a larger dataset of human preferences for selecting a jailbreak judge (300 examples), an over-refusal evaluation dataset, a semantic refusal judge based on Llama-3-8B

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02961 2024-11-04 cs.SE 57%

GitBug-Java: A Reproducible Benchmark of Recent Java Bugs

André Silva, Nuno Saavedra, Martin Monperrus

专题命中 代码评测 :program repair(abstract);分类 cs.SE

Comments Accepted to MSR '24

Journal ref Proceedings of Mining Software Repositories Conference (MSR), 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06954 2024-10-29 cs.LG math.OC 57%

Distributional MIPLIB: a Multi-Domain Library for Advancing ML-Guided MILP Methods

Weimin Huang, Taoan Huang, Aaron M Ferber, Bistra Dilkina

专题命中 代码评测 :repository(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18792 2024-10-28 cs.CY cs.CL 57%

An LLM Agent for Automatic Geospatial Data Analysis

Yuxing Chen, Weijie Wang, Sylvain Lobry, Camille Kurtz

专题命中 代码评测 :code generation(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17736 2024-10-24 cs.CL 57%

MojoBench: Language Modeling and Benchmarks for Mojo

Nishat Raihan, Joanna C. S. Santos, Marcos Zampieri

专题命中 代码评测 :code generation(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20755 2024-10-22 cs.CL 57%

Improving code-mixed hate detection by native sample mixing: A case study for Hindi-English code-mixed scenario

Debajyoti Mazumder, Aakash Kumar, Jasabanta Patro

专题命中 代码评测 :repository(abstract);分类 cs.CL

Comments Generated from XeLaTeX

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10934 2024-10-18 cs.AI 57%

Agent-as-a-Judge: Evaluate Agents with Agents

Mingchen Zhuge, Changsheng Zhao, Dylan Ashley, Wenyi Wang, Dmitrii Khizbullin, Yunyang Xiong, Zechun Liu, Ernie Chang, Raghuraman Krishnamoorthi, Yuandong Tian, Yangyang Shi, Vikas Chandra, Jürgen Schmidhuber

专题命中 代码评测 :code generation(abstract);分类 cs.AI

Comments The project can be found at https://github.com/metauto-ai/agent-as-a-judge. The dataset is released at https://huggingface.co/DEVAI-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.15181 2024-10-18 cs.LG 57%

A Review and Evaluation of Elastic Distance Functions for Time Series Clustering

Chris Holder, Matthew Middlehurst, Anthony Bagnall

专题命中 代码评测 :repository(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09600 2024-10-16 cs.LG cs.CY 57%

The Fragility of Fairness: Causal Sensitivity Analysis for Fair Machine Learning

Jake Fawkes, Nic Fishman, Mel Andrews, Zachary C. Lipton

专题命中 代码评测 :repository(abstract);分类 cs.LG

Comments Published at Neurips 2024 in the Dataset and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05780 2024-10-10 q-bio.QM cs.LG stat.AP 57%

GlucoBench: Curated List of Continuous Glucose Monitoring Datasets with Prediction Benchmarks

Renat Sergazinov, Elizabeth Chun, Valeriya Rogovchenko, Nathaniel Fernandes, Nicholas Kasman, Irina Gaynanova

专题命中 代码评测 :repository(abstract);分类 cs.LG

Comments The Twelfth International Conference on Learning Representations. 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01086 2024-10-03 stat.ML cs.LG 57%

An Introduction to Deep Survival Analysis Models for Predicting Time-to-Event Outcomes

George H. Chen

专题命中 代码评测 :repository(abstract);分类 cs.LG

Comments Code is available at https://github.com/georgehc/survival-intro

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17703 2024-09-27 cs.LG 57%

PGN: The RNN's New Successor is Effective for Long-Range Time Series Forecasting

Yuxin Jia, Youfang Lin, Jing Yu, Shuo Wang, Tianhao Liu, Huaiyu Wan

专题命中 代码评测 :repository(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17255 2024-09-27 cs.CL 57%

MPCODER: Multi-user Personalized Code Generator with Explicit and Implicit Style Representation Learning

Zhenlong Dai, Chang Yao, WenKang Han, Ying Yuan, Zhipeng Gao, Jingyuan Chen

专题命中 代码评测 :code generation(abstract);分类 cs.CL

Comments Accepted by ACL 2024, Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17157 2024-09-27 cs.HC cs.AI cs.CY 57%

Confident Teacher, Confident Student? A Novel User Study Design for Investigating the Didactic Potential of Explanations and their Impact on Uncertainty

Teodor Chiaburu, Frank Haußer, Felix Bießmann

专题命中 代码评测 :repository(abstract);分类 cs.AI

Comments 15 pages, 5 figures, 1 table, presented at ECML 2024, AIMLAI Workshop, Vilnius

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16388 2024-09-26 cs.SE 57%

Self-Elicitation of Requirements with Automated GUI Prototyping

Kristian Kolthoff, Christian Bartelt, Simone Paolo Ponzetto, Kurt Schneider

专题命中 代码评测 :repository(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏