arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-09-01 至 2026-09-01 共收录 12 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 12 篇

2608.29995 2026-09-01 cs.CL cs.AI 新提交 62%

Generating Clinical Vignettes that Preserve Cognitive Formulations

生成保留认知构想的临床案例 vignettes

Amit Oren, Nimrod Hertz-Palmor, Dean Ariel, Guy Laban

机构 * Ben-Gurion University of the Negev(内盖夫本-古里安大学) University of Cambridge(剑桥大学) Clalit Health Services(克拉利特医疗服务机构) Tel Aviv University(特拉维夫大学) School of Brain Sciences and Cognition, Ben-Gurion University of the Negev(内盖夫本-古里安大学脑科学与认知学院) Azrieli National Center for Autism and Neurodevelopment Research(阿兹里利国家自闭症与神经发育研究中心)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出基于理论的 FORMA 框架,将认知模型编译为图来生成符合临床结构的创伤后应激障碍案例 vignettes,经评估其质量高且人口统计学差异小,可作为合成临床文本生成的可审计规范。

Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026. Code and data: https://github.com/Amit-Oren/FORMA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28641 2026-09-01 cs.CL cs.AI 新提交 62%

Terminal-Bench-LILT: Multilingual Agentic Coding Benchmark Grounded in Language, Region, and Culture

Terminal-Bench-LILT:基于语言、区域与文化的多语言智能体编码基准

Yunsu Kim, Kaden Uhlig, Ashwin Purohit, Milind Agarwal, Patrick Simianer, Anil Arslan, Kiarash Mokhtari, Thomas Zenkel, Johannes Mosig, Gabriel Bretschner, Shamik Bose, Joern Wuebker, John DeNero

机构 * LILT, Inc.(LILT公司)

专题命中 代码评测 :coding agent(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Terminal-Bench-LILT多语言编码基准,含10种语言300个任务,评估6个前沿模型发现其通过率仅63.1%,凸显多语言编码能力是未被充分探索的维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23213 2026-09-01 cs.CL cs.AI 版本更新 62%

Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process

评分、推理与选择最佳!通过同行评审过程进行大型语言模型的集成

Zhijun Chen, Zeyu Ji, Qianren Mao, Hao Wu, Jinhuan Song, Junhang Cheng, Bangjie Qin, Zhuoran Li, Jingzheng Li, Kai Sun, Zizhe Wang, Yikun Ban, Zhu Sun, Xiangyang Ji, Hailong Sun, Xiao Huang

机构 * Beihang University, Beijing, China(北京航空航天大学) Zhongguancun Laboratory, Beijing, China(中关村实验室) Beijing University of Posts and Telecommunications(北京邮电大学) Hong Kong University of Science and Technology(香港科学与技术大学) Xi'an Jiaotong University, Xi'an, China(西安交通大学) Tsinghua University, Beijing, China(清华大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LLM-PeerReview方法,通过同行评审机制集成多个大型语言模型,提升响应质量。实验显示其在多个数据集上优于Smoothie-Global,适用于事实性问答、数学推理等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31075 2026-09-01 cs.AI 新提交 57%

Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence

超越人类监督扩展大型推理模型:通往超级智能的路径

Zhiqin Yang, Jingwen Fu, Yuhan Liu, Hengyu Liu, Yonggang Zhang, Kainan Cao, Zizhuo Zhang, Chenxin Li, Ruibin Yuan, Jiahao Pan, Jiankai Sun, Zhenyuan Zhang, Yibo Li, Yunlong Lin, Jing Xiong, Sida Lin, Bo Han, Wei Xue, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Zhongguancun Academy(中关村学院) Xi’an Jiaotong University(西安交通大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) Hong Kong Baptist University(香港浸会大学) Hunyuan Tencent(腾讯混元) National University of Singapore(新加坡国立大学) Xiamen University(厦门大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本文研究人类监督逐步退出时大型推理模型(LRMs)的扩展路径,提出五级阶梯框架,分析自主化带来的风险,围绕策略能力等开展评估,为开发通往超级智能的自我维持学习系统提供结构化方案。

Comments 72pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28802 2026-09-01 cs.CV cs.AI 新提交 57%

A Large-scale Evaluation of Text-guided Models for Facial Editing

文本引导的人脸编辑模型的大规模评估

Rahul Nair, Saurav Pandit, Hannah Kerner

机构 * Arizona State University(亚利桑那州立大学) Prelight Inc(普雷莱特公司)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本研究对6种文本引导模型开展首次大规模人脸编辑评估,构建含169个属性的Face-Edit-Attributes数据集,发现多数模型头发配饰编辑表现好但姿态编辑差,存在过度编辑及针对深色皮肤男性和老年面孔的偏差。

Comments ACM Multimedia (ACMMM) 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25992 2026-09-01 cs.AI cs.MA 版本更新 57%

ProgRouter: Online Progress-Guided Orchestration for Multi-Agent LLM Workflows under Quality-Cost Tradeoffs

ProgRouter:面向质量-成本权衡的多智能体大语言模型工作流的在线进度引导编排

Songyuan Li, Ahmed M. Abdelmoniem, Shiqiang Wang

机构 * Aston University(阿斯顿大学) Queen Mary University of London(伦敦玛丽女王大学) University of Exeter(埃克塞特大学)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 ProgRouter是一种在线进度引导路由框架,通过多视图任务进度评分器等机制,在多智能体LLM工作流中平衡任务质量与时间、成本预算,在多类任务数据集上较基线降低运营成本且保持性能。

Comments Accepted in Findings of the Association for Computational Linguistics: EMNLP 2026. Index Terms: Collaborative agentic workflows, LLM agent orchestration, Quality-cost trade-off, Task progress prediction, Online decision-making

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20406 2026-09-01 cs.LG stat.AP 版本更新 57%

Machine Learning and ARIMA Model Averaging for Adaptive Public Health Forecasting: Comparative Evaluation and an Ontario COVID-19 Case Study

机器学习与ARIMA模型平均法用于自适应公共卫生预测:比较评估及安大略省COVID-19案例研究

Yushu Zou, Ye Li, Johra Moosa, Martin Grunnill, Samir N. Patel, Venkata R. Duvvuri

机构 * Public Health Ontario(安大略省公共卫生局) Dalla Lana School of Public Health, University of Toronto(多伦多大学达拉·拉纳公共卫生学院) University of Toronto(多伦多大学) York University(约克大学)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本研究评估ARIMA、随机森林、XGBoost模型,提出MLAMA集成方法,基于安大略省COVID-19数据验证其预测性能更优,支持按操作条件选择预测模型。

Comments This paper has been withdrawn by the author due to organizational policy

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13671 2026-09-01 cs.MA cs.AI 版本更新 57%

MAS-on-the-Fly: In-Context Structural Adaptation of LLM-Based Multi-Agent Systems

MAS-on-the-Fly: 在测试时动态适应基于大语言模型的多智能体系统

Guangyi Liu, Haojun Lin, Huan Zeng, Heng Wang, Quanming Yao

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Ant Group(蚂蚁集团)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 MASFly通过动态适应机制在测试时优化多智能体系统,利用检索增强和经验引导机制提升任务适应性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17648 2026-09-01 cs.CL 版本更新 57%

Simulstream: Open-Source Toolkit for Evaluation and Demonstration of Streaming Speech-to-Text Translation Systems

Simulstream:用于评估和演示流式语音到文本翻译系统的开源工具包

Marco Gaido, Sara Papi, Mauro Cettolo, Matteo Negri, Luisa Bentivogli

机构 * Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 研究流式语音到文本翻译在评估上的问题,提出开源框架simulstream,支持长语音的增量和重新翻译解码,能进行质量和延迟评估及实时可视化比较,填补了相关统一解决方案的空白。

Comments Accepted to EMNLP demo 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29955 2026-09-01 cs.HC 新提交 50%

A Cyber-Physical Machine Tool Framework with a Real-Time Machining Process Digital Twin

具备实时加工过程数字孪生的信息物理机床框架

Khalil Chakal, Tero Kaarlela, Jose Outeiro, Carlos Andrade

专题命中 代码评测 :repository(abstract)

AI总结 该研究提出一种分层数字孪生框架,扩展现有信息物理机床框架,集成多类数据实现机床与加工过程同步,经实验验证性能达标,为AI辅助加工应用奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28877 2026-09-01 physics.optics cs.MA 新提交 50%

HALO: A Physics-Aware LLM Agent Framework for Nanophotonic Design

HALO:用于纳米光子设计的物理感知大语言模型智能体框架

Yubo Zhang, Jinlin Xiang, Zijun Zhao, Yang Zhao, Eli Shlizerman, Arka Majumdar

专题命中 代码评测 :coding agent(abstract)

AI总结 该研究提出HALO框架及52任务基准HALO-Bench,对比三类规划器配置,发现固定结构化工作流效率最高,自主编码成功率更高但故障更多,复用失败轨迹可减少迭代与令牌使用,明确了科学智能体的相关权衡。

Comments 9 pages, 3 figures, 5 charts

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09882 2026-09-01 quant-ph cs.DC cs.PF 版本更新 50%

Benchmarking Zero-Setup Quantum Circuit Simulators

零设置量子电路模拟器的基准测试

Arul Rhik Mazumder, Hovnatan Karapetyan, Mohammed Zuhair Mullath, Rudy H. Tanin, Hrant Gharibyan, Hayk Tepanyan

专题命中 代码评测 :repository(abstract)

AI总结 该研究对GPU加速的MPS和PPS量子模拟方法进行基准测试,比较多个工具,发现MPS中GPU运行时随键维度次二次缩放,PPS中GPU在特定基准测试下加速显著且能达高精度,还提供模拟器特征描述及代码配置仓库。

Comments 12 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏