arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 78 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 78 篇

2605.17986 2026-06-18 cs.CR cs.AI 版本更新 57%

LivePI: More Realistic Benchmarking of Agents Against Indirect Prompt Injection

LivePI:更真实的智能体对抗间接提示注入基准测试

Lei Zhao, Abhay Bhaskar, Edgar Dobriban

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 提出LivePI基准,覆盖7种输入表面、12种攻击/渲染家族和5种恶意目标,在真实虚拟机环境中评估多个AI智能体,发现攻击成功率10.7%-29.6%,并验证了两层防御的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09059 2026-06-11 cs.SE 版本更新 57%

Evaluating LLM-Generated Code: A Benchmark and Developer Study

评估大语言模型生成的代码:一个基准和开发者研究

Joanna Szych, Anne Schwerk

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 本文提出了一种定制的树折评估方法,用于评估大语言模型生成的代码,弥补了现有基准在代码质量和可操作性方面的不足,并通过对比三个通用大语言模型展示了其有效性。

Comments Accepted for publication at EASE '26/EQUISA workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01153 2026-07-30 cs.CL cs.AI cs.SE 版本更新 56%

Adversarial Pragmatics for AI Safety Evaluation: A Diagnostic Framework and Seed Benchmark for Language-Mediated Control

面向AI安全评估的对抗语用学:指令冲突、嵌入命令与策略模糊性基准

Brett Reynolds

机构 * Humber Polytechnic(汉博理工学院) University of Toronto(多伦多大学)

专题命中 代码评测 :分类 cs.SE、cs.CL、cs.AI;repository(comments)

AI总结 提出对抗语用学基准和标注协议,通过语言学控制的分类法评估模型在指令冲突、嵌入命令等场景下的行为,为安全评估提供实证和方法论工具。

Comments 32-page main paper plus 13-page supplement; 6 figures and 17 tables total; code and data artifact available at the linked repository

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22473 2026-06-09 cs.CL cs.AI cs.LG 版本更新 56%

Component Ablation for Efficient Hybrid Language Model Architectures: Performance, Resilience, and Compression Implications

组件消融用于高效混合语言模型架构:性能、鲁棒性和压缩影响

Hector Borobia, Elies Seguí-Mas, Guillermina Tormo-Carbó

机构 * Doctoral Program in Computer Science, University of Valencia(瓦伦西亚大学计算机科学博士项目)

专题命中 代码评测 :分类 cs.CL、cs.AI、cs.LG;repository(comments)

AI总结 本文通过组件消融研究混合语言模型,发现注意力机制与替代序列处理路径对性能有显著影响,揭示了模型鲁棒性与压缩优化的关键因素。

Comments 25 pages, 7 figures, 6 tables; revised title, abstract, figures, and data/code repository URL

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17787 2026-08-21 cs.IR 版本更新 50%

Beyond Uniform Token Training: A Multi-Target Framework for Learning Token-Weighted Objectives in Generative Recommenders

基于课程学习的生成推荐系统中的标记加权多目标学习

Wei-Ning Chiu, Song-Duo Ma, Han-Jay Shu, Chuan-Ju Wang, Pu-Jen Cheng

专题命中 代码评测 :repository(abstract)

AI总结 本文提出基于课程学习的生成推荐系统中的标记加权多目标学习方法,通过两种信息增益策略提升推荐性能,实验表明其在不同语义ID构造下表现优异。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14660 2026-08-17 quant-ph 版本更新 50%

Heuristic and Optimal Synthesis of CNOT and Clifford Circuits

CNOT与Clifford电路的启发式及最优综合

Mark Webster, Stergios Koutsioumpas, Dan E Browne

专题命中 代码评测 :repository(abstract)

AI总结 本研究针对CNOT与Clifford电路,提出最优、A*及贪心三类综合算法,可最小化两量子比特门数量或电路深度,经基准测试性能优于现有方法,相关算法已在GitHub仓库开源。

Comments Accepted in Quantum, 6 Aug 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21947 2026-08-12 physics.comp-ph physics.atom-ph 版本更新 50%

AMELI: Angular Matrix Elements of Lanthanide Ions

AMELI: 镧系离子的角矩阵元

Reinhard Caspary

专题命中 代码评测 :repository(abstract)

AI总结 提出基于Slater行列式基和Racah分类的通用框架,计算f^N组态中任意球张量算符的角矩阵元,并构建开源数据库AMELI,以精确算术消除浮点误差,替代传统半经验计算表格。

Comments v2: Abstract, introduction and conclusion rewritten to clarify the novelty and intention of this work. Added Wybourne crystal field Hamiltonians in Section IV G. Improved phase synchronization in Section V B. New Section IX "Application Examples" v3: Minor errors and typographic flaws corrected

Journal ref J. Chem. Phys. 165, 064308 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14633 2026-08-11 cs.CV 版本更新 50%

VIGIL: Tackling Hallucination Detection in Image Recontextualization

VIGIL:应对图像再上下文化中的幻觉检测

Joanna Wojciechowicz, Maria Łubniewska, Jakub Antczak, Justyna Baczyńska, Wojciech Gromski, Wojciech Kozłowski, Maciej Zieba

机构 * Wroclaw University of Science and Technology(沃拉茨拉夫大学科学与技术学院)

专题命中 代码评测 :repository(abstract)

AI总结 VIGIL通过细粒度分类填补多模态模型图像再上下文化中幻觉检测的空白,提出多阶段检测流程并公开资源促进透明度。

Comments 19 pages, 8 figures, 7 tables. Code and data are available at: https://github.com/mlubneuskaya/vigil and https://huggingface.co/datasets/joannaww/VIGIL

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08729 2026-07-30 cs.CV 版本更新 50%

WaspMOT: A Benchmark for Long-Term Multi-Object Tracking of Trichogramma Wasps

WaspMOT:赤眼蜂长期多目标跟踪基准

Tomasz Stanczyk, Yuan Gao, Hardik Agarwal, Seongro Yoon, Tiantao Zhang, Vincent Calcagno, Francois Bremond

机构 * Inria(法国国家信息与自动化技术研究院) INRAE Institut Sophia Agrobiotech(法国国家农业生物技术研究院) Université Côte d'Azur(蔚蓝海岸大学) Indian Institute of Technology Delhi(德里印度理工学院) Institute of Plant Protection, Chinese Academy of Agricultural Sciences(中国农业科学院植物保护研究所)

专题命中 代码评测 :repository(abstract)

AI总结 研究针对多目标跟踪在长期身份保持评估不足的问题,引入WaspMOT基准,通过对赤眼蜂长时间跟踪构建数据集,评估五种检测跟踪方法,发现都有轨迹碎片化问题,简单拼接基线可提升性能,揭示了现有方法局限。

Journal ref AVSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11665 2026-07-29 cs.RO 版本更新 50%

Nautilus: From One Prompt to Plug-and-Play Robot Learning

Nautilus:从一个提示到即插即用的机器人学习

Yufeng Jin, Jianfei Guo, Xiaogang Jia, Yu Deng, Zechu Li, Han Liu, Weiran Liao, Vignesh Prasad, Mathias Franzius, Gerhard Neumann, Georgia Chalvatzaki

机构 * TU Darmstadt(图宾根大学) KIT(卡尔斯鲁厄理工学院) FZI(弗劳恩霍夫研究所) Robotics Institute Germany(德国机器人研究所) Honda Research Institute Europe(本田欧洲研究院)

专题命中 代码评测 :coding agent(abstract)

AI总结 Nautilus通过单个提示生成可复现、评估、微调和部署的机器人学习工作流程,提供即插即用的代理技能集和统一接口,减少跨家族验证的工程负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08789 2026-07-29 cs.CR 版本更新 50%

Never compromise with vulnerabilities: a comprehensive survey on AI governance

绝不向漏洞妥协:人工智能治理综合调查

Yuchu Jiang, Jian Zhao, Yuchen Yuan, Tianle Zhang, Yao Huang, Yanghao Zhang, Yan Wang, Yanshu Li, Xizhong Guo, Yusheng Zhao, Huilin Zhou, Jun Zhang, Zhi Zhang, Xiaojian Lin, Yixiu Zou, Haoxuan Ma, Yuhu Shang, Yuzhi Hu, Keshu Cai, Ruochen Zhang, Boyuan Chen, Yilan Gao, Ziheng Jiao, Yi Qin, Shuangjun Du, Xiao Tong, Zhekun Liu, Yu Chen, Xuankun Rong, Rui Wang, Yejie Zheng, Zhaoxin Fan, Murat Sensoy, Hongyuan Zhang, Pan Zhou, Lei Jin, Hao Zhao, Xu Yang, Jiaojiao Zhao, Jianshu Li, Joey Tianyi Zhou, Zhi-Qi Cheng, Longtao Huang, Zhiyi Liu, Zheng Zhu, Jianan Li, Gang Wang, Qi Li, Xu-Yao Zhang, Yaodong Yang, Mang Ye, Wenqi Ren, Zhaofeng He, Hang Su, Rongrong Ni, Liping Jing, Xingxing Wei, Junliang Xing, Massimo Alioto, Shengmei Shen, Petia Radeva, Dacheng Tao, Ya-Qin Zhang, Shuicheng Yan, Xuelong Li

专题命中 代码评测 :repository(abstract)

AI总结 针对人工智能发展带来的技术漏洞及社会风险,提出整合技术与社会维度的框架,围绕三个支柱构建,通过系统回顾识别核心挑战,给出综合研究议程,为开发可靠且符合伦理的人工智能系统提供指导。

Comments 26 pages, 3 figures, accepted by SCIS2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27745 2026-07-16 cs.CV 版本更新 50%

Panoramic Scene Understanding: A Survey from Distortion-Aware Engineering to Sphere-Native Modeling

全景场景分析:从畸变感知工程到球面原生基础建模的综述

Qinfeng Zhu, Lei Fan

机构 * University of Liverpool(利物浦大学) Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 代码评测 :repository(abstract)

AI总结 本文综述全景场景分析从投影适应、畸变感知工程到球面原生建模的演进,指出当前方法无法同时实现严格球面等变性和重用预训练基础模型权重,并揭示评估协议中的五个系统性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08164 2026-07-14 cs.CV 版本更新 50%

Continual Test-Time Adaptation in Computer Vision: Methods, Benchmarks, and Future Directions

计算机视觉中的持续测试时间适应:方法、基准和未来方向

Sarthak Kumar Maharana, Shambhavi Mishra, Yunbei Zhang, Shuaicheng Niu, Taki Hasan Rafi, Jihun Hamm, Marco Pedersoli, Jose Dolz, Yunhui Guo

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) LIVIA ETS Montreal, ILLS International Laboratory on Learning Systems (ILLS)(蒙特利尔LIVIA ETS,学习系统国际实验室(ILLS)) Tulane University(路易斯安那州立大学) Nanyang Technological University(南洋理工大学) Hanyang University(翰阳大学)

专题命中 代码评测 :repository(abstract)

AI总结 本文针对计算机视觉中训练与测试数据分布不同的问题,定义CTTA问题,分析持续域转移模式,提出分层分类法将现有方法分为三类,回顾代表性方法并展示实验结果,讨论局限性与新兴方向,为持续测试时间适应研究提供路线图。

Comments TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12995 2026-07-08 math.CO cs.DS 版本更新 50%

Extending Exact Integrality Gap Computations for the Metric TSP

扩展度量TSP的子游走松弛整数规划间隙计算

William Cook, Stefan Hougardy, Moritz Petrich

专题命中 代码评测 :repository(abstract)

AI总结 本文通过扩展子游走松弛的整数规划间隙验证,发现n=11和n=12时极端点列表不完整,并将极端点枚举扩展到14个顶点,为4/3猜想提供支持。

Comments We extended the enumeration to n=15 in the general case

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07685 2026-06-29 cs.CC math.DS 版本更新 50%

Expansive homeomorphisms on complexity quasi-metric spaces

复杂度准度量空间上的扩展同胚

Yaé U. Gaba

专题命中 代码评测 :repository(abstract)

AI总结 本文研究复杂度准度量空间上的扩展同胚理论,证明缩放变换在该空间上扩张当且仅当α≠1,并将轨道分离与经典时间层级定理联系起来。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15149 2026-06-18 cs.CE cs.NA math.NA 版本更新 50%

SoliDualSPHysics: An extension of DualSPHysics for solid mechanics with hyperelasticity, plasticity, and fracture

SoliDualSPHysics:一种用于固体力学的DualSPHysics扩展,支持超弹性、塑性及断裂

Mohammad Naqib Rahimi, George Moutsanidis

专题命中 代码评测 :repository(abstract)

AI总结 本文提出SoliDualSPHysics,一种基于SPH的开源软件,扩展DualSPHysics以模拟超弹性、有限应变塑性及脆性断裂行为,采用总拉格朗日格式,支持动态加载下的裂纹萌生与扩展,验证了其准确性和可扩展性。

Journal ref Computer Physics Communications 327 (2026) 110257

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09977 2026-06-16 cs.CV 版本更新 50%

A Survey on 3D Gaussian Splatting Applications: Segmentation, Editing, and Generation

3D高斯泼溅应用综述:分割、编辑与生成

Shuting He, Peilin Ji, Yitong Yang, Changshuo Wang, Jiayi Ji, Yinglin Wang, Henghui Ding

机构 * Shanghai University of Finance and Economics(上海财经大学) University College London(伦敦大学学院) Xiamen University(厦门大学) Fudan University(复旦大学)

专题命中 代码评测 :repository(abstract)

AI总结 综述3D高斯泼溅在分割、编辑和生成三大任务中的应用,总结代表性方法、监督策略和学习范式,并分析公共基准上的比较结果。

Comments IEEE TPAMI, GitHub Repo: https://github.com/heshuting555/Awesome-3DGS-Applications

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04661 2026-06-11 astro-ph.CO astro-ph.IM 版本更新 50%

unimpeded: A Public Grid of Nested Sampling Chains for Cosmological Model Comparison and Tension Analysis

unimpeded: 用于宇宙学模型比较和张力分析的公共嵌套采样链网格

Dily Duan Yi Ong, Will Handley

专题命中 代码评测 :repository(abstract)

AI总结 发布公共Python库unimpeded,提供预计算嵌套采样和MCMC链,对8个宇宙学模型和39个数据集进行系统分析,发现ΛCDM模型最受青睐,并量化了DES与Planck、SH0ES与Planck之间的显著张力。

Comments 49 pages, 13 figures. Version 3: Revised in response to the JCAP editor's report. Added Section 3.2.12 on the treatment of nuisance parameters in the evidence and tension calculations. Results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏