arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 3048 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 3048 篇

2608.19447 2026-08-21 cs.LG 新提交 70%

Quantifying Event Impacts on Time Series via Multiscale Contrastive Learning

基于多尺度对比学习量化事件对时间序列的影响

Yiming Sun, Shengyu Chen, Zhengzhang Chen, Haoyu Wang, Xiaowei Jia, Haifeng Chen

机构 * Rutgers University(罗格斯大学) NEC Laboratories America(美国NEC实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出多分辨率框架EventTime,结合多维度信息与动态对比目标,在自主构建的SECURE数据集上,实现了对网络安全事件后短期金融异常损失的更精准估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19297 2026-08-21 cs.LG 新提交 70%

Holtercare-Bench: A Multimodal Benchmark for Evaluating Long-Term Dynamic ECG Analysis

Holtercare-Bench:用于评估长期动态心电图分析的多模态基准

Yihan Xie, Hanwen Cui, Runze Ye, Juekai Lin, Haoyang Wang, Jinhao Mao, Bo Zhang, Wenqiao Zhang, Xiaogang Guo, Jun Xiao, Lei Zhang

机构 * Zhejiang University(浙江大学) Beijing Institute of Technology(北京理工大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究针对现有多模态大语言模型在长期动态心电图分析中的不足,构建了含22980个问答对的Holtercare-23K数据集及Holtercare-Bench基准,评估发现零样本模型处理超长病理序列性能差,微调后提升显著,为长期医疗多模态大语言模型提供基础基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19002 2026-08-20 cs.AI 新提交 70%

A Theory of Post-hoc Debate Judgement

事后辩论评判理论

Xiang Yin, Adam Dejl, Antonio Rago, Lihu Chen, Francesca Toni

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出适用于智能体辩论场景的事后辩论评判理论,探究两种评判方法的属性满足情况,发现辩论语义是辩论驱动型AI原则性评判者的理想候选。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18740 2026-08-20 cs.AI 新提交 70%

A Multi-Agent Platform for Automated Enterprise Analytics and Insight Generation

用于自动化企业分析与洞察生成的多智能体平台

Manoj N M, Vijayakrishna S, Manjunath Srinivas, Rohit Pahan

机构 * Rakuten India Enterprise Private Limited(乐天印度企业私人有限公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出基于CrewAI的多智能体框架,含五个专业智能体,经300个测试用例验证,功能准确率95.3%,较单智能体基线提升显著,可用于自动化企业分析与洞察生成。

Journal ref In Proceedings of the 14th International Conference on Computer and Communications Management (ICCCM '26), July 24-26, 2026, Tokyo, Japan. ACM, New York, NY, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18726 2026-08-20 cs.CL 新提交 70%

Execution-grounded evaluation reveals hidden failures in language-model calculations for environmental science

基于执行的评估揭示语言模型在环境科学计算中的隐藏失败

Maohao Ran, Chendong Ma, Yanting Zhang, Dailing Jiang, Yusen Huang, Meng Gao, Jun Song

机构 * Department of Geography, Hong Kong(香港地理系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究构建了环境科学计算基准AtmosCoder-Bench,发现现有评估未观测计算过程,多项选择格式会虚高准确率,模型多因未一致应用公式失败,前沿模型仍需专家监督。

Comments 29 pages, 4 figures, 2 tables, plus supplementary materials. Maohao Ran and Chendong Ma contributed equally. Corresponding author: Jun Song (junsong@hkbu.edu.hk). Code: https://github.com/acodercat/AtmosCoder-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18719 2026-08-20 cs.AI 新提交 70%

Competence, Not Accuracy: A Diagnostic for Reference-Free Judge Gates in Skill Optimization

能力而非准确率:技能优化中无参考评判门的诊断方法

Chenle Chen, Yangbo Wei, Chao Yao, Shaoqiang Lu, Junhong Qian, Chen Wu, Lei He

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Shanghai Jiao Tong University(上海交通大学) Arizona State University(亚利桑那州立大学) Eastern Institute of Technology(东方理工学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出技能优化中无参考评判门的预部署诊断方法,发现评判器能力需超1/k才具可用性,其基准准确率高估关键能力,可预测门控错误。

Comments 9 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18586 2026-08-20 cs.CV cs.AI 新提交 70%

OmniHandwritingOCR: A Diagnostic Benchmark for Evaluating Multimodal LLMs in Handwritten OCR Scenarios

OmniHandwritingOCR:用于评估多模态大语言模型在手写OCR场景中表现的诊断基准

Zinuo Guo, Min Zhang, Bo Jiang

机构 * East China Normal University(华东师范大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究推出OmniHandwritingOCR手写OCR诊断基准,评估13个多模态模型,发现其在复杂公式上表现差且存在幻觉,为诊断模型失效模式提供测试平台。

Comments CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18579 2026-08-20 cs.CV cs.AI 新提交 70%

MR-IQA-2: Faithful Image Quality Reflection via Fine-Grained Credit Assignment

MR-IQA-2:通过细粒度信用分配实现真实的图像质量反映

Yuan li, Youyuan Lin, Chenhui Chu, Shin'ya Nishida

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对现有盲图像质量评估(IQA)中推理真实性不足的问题,提出MR-IQA-2框架,通过解耦推理与评分的细粒度信用分配,在IQA基准上实现了与人类评分的竞争性对齐,还能提供更丰富的视觉理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18072 2026-08-19 cs.CL 新提交 70%

Multi-Agent AI System for Radiology Report Structuring and Quality Assurance with Independent Radiologist Evaluation

用于放射科报告结构化与质量保证的多智能体AI系统:独立放射科医师评估

Iryna Hartsock, Cesar Lam, Christopher Otteni, Aliya Qayyum, Robert Gatenby, Cyrillo Araujo, Ghulam Rasool

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究开发了一款本地部署的多智能体AI系统,可实现放射科报告结构化与质量保证,经独立放射科医师评估,该系统表现良好,或有助于放射科报告标准化。

Comments 14 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17836 2026-08-19 cs.LG 新提交 70%

Leveraging Association Context Retrieval in Knowledge Edit- ing to Build White-Box Attacks on LLMs

利用知识编辑中的关联上下文检索构建针对大语言模型(LLMs)的白盒攻击

Roman Maksimov, Vladimir Aletov, Vladimir Solodkin, Dmitry Bylinkin, Daniil Medyakov, Aleksandr Beznosikov

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究针对LLMs,提出结合关联上下文检索的知识编辑白盒攻击,提升攻击有效性且不严重损害模型整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17809 2026-08-19 cs.CL 新提交 70%

Whether LLMs Can Navigate Beliefs and Facts Depends on How You Phrase It

大型语言模型(LLMs)能否处理信念与事实取决于表述方式

Quang Minh Nguyen, Luis Frentzen Salim

机构 * KAIST(韩国科学技术院) National Taiwan University of Science and Technology(台湾科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对10个LLMs,发现其处理信念与事实的缺陷程度取决于表达信念的动词,源于任务混淆,一条指令可扭转该失败,解码时抑制注意力仅能部分恢复准确率。

Comments In submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17659 2026-08-19 cs.CR cs.AI 新提交 70%

MobileWorldSafety: Benchmarking GUI Agent Safety Against Environmental Injection Attacks in Android Apps

MobileWorldSafety:针对安卓应用中环境注入攻击的GUI智能体安全基准

Sujin Chen, Lijun Li, Tianyi Du, Jing Shao

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究推出MobileWorldSafety基准,基于142个真实安卓应用风险任务评估6种GUI智能体,发现其对环境注入攻击的成功率达40.4%-66.9%,为相关研究奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17597 2026-08-19 cs.CR cs.AI 新提交 70%

HarnessRisk: A Lifecycle-Oriented Benchmark for Agent Harness Safety

HarnessRisk:面向生命周期的智能体管控安全基准

Yajing Bai, Jinhao Duan, Jie Peng, Xianfeng Wu, Sijia Liu, Song Wang, Tianlong Chen

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究提出面向生命周期的智能体管控安全基准HarnessRisk,含128个沙箱案例,评估多模型与管控配置的安全表现,发现管控配置阶段最易受攻击,明确风险识别未必带来安全行动,凸显多维度评估智能体安全的必要性。

Comments Project Page: https://baiyajing.github.io/harness-risk/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17468 2026-08-19 cs.AI 新提交 70%

SAGE: Self-Evolving Storyboard Skills via Attribution-Guided Rule Evolution

SAGE:基于归因引导规则演化的自演进分镜脚本技能

Maolin Ran, Xiaoyang Lu, Jiaqi Liu, Jian Wang, Weiwen Liu, Jianghao Lin, Yong Yu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) CreativeFitting(创意拟合)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对分镜脚本制作的工业瓶颈,提出SAGE框架,通过归因引导规则演化实现导演知识的自演进,在测试中表现接近专业导演,部署后大幅提升制作效率,还发布了首个相关公开数据集PROSE

Comments 11 pages, 9 figures, 4 tables. Dataset available at https://github.com/creDreams/PROSE

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17319 2026-08-19 cs.AI 新提交 70%

Wuying-Browser-Agent: Real-World Centric Fundamental Long-Horizon Browser Agents

Wuying-Browser-Agent:以真实场景为中心的基础长时程浏览器智能体

AIMAE Team, Tianxiang Chen, Yan Cheng, Zhangye Han, Xiaowei Li, Chang Liu, Cheng Liu, Zhongqiang Ma, Long Peng, Xiaobing Tu, Yinggui Wang, Hongliang Wei, Chen Wu, Daiping Xin, Kunyu Zhou, Pengyang Zhou, Peiyuan Chen, Ziyuan Chen, Yutao Deng, Chunyu Dong, Xiangyu Fu, Yicheng Feng, Ruian He, Haochen Li, Miancan Liu, Zhengqin Liu, Wei Peng, Jinkui Ren, Haoyu Tan, Dong Xiao, Rongkun Xue, Shujian Yang, Xianhang Ye, Ziqi Yuan, Ziyang Yu, Linghan Zhang, Xiantao Zhang, Xuanpu Zhao, Yinan Zhao, Zhenghui Zhao, Bin Zhu, Likai Zou

机构 * Alibaba Cloud(阿里云) End-User Intelligent Computing BU(终端用户智能计算业务部) AI Model Application & Engineering Team(AI模型应用与工程团队)

专题命中 评测与基准 :SFT(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出Wuying-Browser-Agent统一框架,通过多层面技术对齐解决浏览器智能体实际部署问题,在多项基准取得最优成绩,且具备通用智能体迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17218 2026-08-19 cs.CL 新提交 70%

The Plot Thins: Uniformity and Linearity in Literary Summaries

情节淡化:文学摘要中的一致性与线性性

Rebecca M. M. Hicke, Sil Hamilton, David Mimno, Ross Deans Kristensen-McLachlan

机构 * Cornell University(康奈尔大学) Aarhus University(奥胡斯大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究构建小说摘要与原作章节映射数据集,测量摘要线性性与一致性,明确文学作品与摘要的情节表达差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16039 2026-08-18 eess.IV cs.AI cs.CV 新提交 70%

Decoupling Parcellation from Classification: Systematic Benchmark of Fast Brain Segmentation Methods for Alzheimer's Disease Detection

将脑部分区与分类解耦:阿尔茨海默病检测的快速脑分割方法的系统基准测试

Jiadao Zou, Hongyu Guo, Wei Xi

专题命中 评测与基准 :foundation model(abstract);prompting(abstract);分类 cs.AI

AI总结 该研究将脑部分区与分类解耦,在OASIS-1数据集上对SynthSeg+等快速深度学习分区方法开展系统基准测试,评估多种体积策略与分类范式,以量化其对AD检测的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16577 2026-08-18 cs.CL 新提交 70%

BabelSteering: Multilingual Safety Alignment via English Steering Vectors

BabelSteering:通过英文引导向量实现多语言安全对齐

Emma V. Stein, Dominik Meier, Terry Ruas, Jan Philip Wahle, Bela Gipp

机构 * University of Göttingen(哥廷根大学) German State Police NRW(北莱茵-威斯特伐利亚州德国警察)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出BabelSteering激活引导方法,利用英语安全监督的拒绝方向实现多语言安全对齐,可提升多语言有害请求拒绝率且任务效用损失极小,还引入多语言翻译评估流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16513 2026-08-18 cs.CV cs.AI 新提交 70%

MLLM-Guided Semantic Correction for Text-to-Video Generation

基于多模态大语言模型(MLLM)的文本到视频生成语义修正

Junhao Chen, Zheqi Lv, Keting Yin, Shengyu Zhang, Zhou Zhao, Feiyang Chen, Xinyu Duan, Baoxing Huai, Fei Wu

机构 * Zhejiang University(浙江大学) Huawei Cloud Computing Technology Co., Ltd.(华为云计算技术有限公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出一种无需训练的MLLM引导文本到视频生成语义修正框架,通过两个关键模块在生成中修正语义偏差,提升了生成内容的语义对齐度等性能,经多基准实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16402 2026-08-18 cs.AI 新提交 70%

A Policy Algebra for Trust-Preserving Agentic AI Execution

用于信任保留的智能体AI执行的策略代数

Bhaskar Tripathi, Anurag Kumar, Ramendra Kumar, Bhavesh Gadhe

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种策略代数,用于定义智能体AI执行的可靠范围,可干预94.8%的策略违规事件,保留86.9%的任务完成率,为构建可靠智能体提供支持。

Comments 7 figures, 10 tables, and 5 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16394 2026-08-18 cs.AI cs.IR 新提交 70%

Think Inside the Chunk: RegulaRAG for Regulation-Compliant Scenario Generation using LLMs: A Case Study of UN Regulation No. 152

在块内思考:使用大语言模型生成符合法规的场景的RegulaRAG——以联合国第152号法规为例

Vahid Zolfaghari, Nenad Petrovic, AndrÉ Schamschurko, Alois Knoll

机构 * Technical University of Munich(慕尼黑工业大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对LLMs难以结合冗长分层标准的问题,提出RegulaRAG流水线,经实验其在UN R152数据集上元分数最高且鲁棒性强,优于基线系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16276 2026-08-18 cs.HC cs.CL 新提交 70%

PolyDebate: A Game-Orchestrated Multimodal System for Debate Skills Practice and Evaluation

PolyDebate:一种用于辩论技能练习与评估的游戏编排多模态系统

Jianing Yin, Weng Pan Kuan, Xiaoyun Liu, Zhiyuan Wen, Yuxuan Li, Milos Stojmenovic, Jiannong Cao

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 PolyDebate是一款游戏化多模态辩论练习评估系统,含Unity 3D游戏与网页版本,经四项研究验证,可结合AI对手、多模态评估与结构化反馈助力学习者提升辩论技能。

Comments 10 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16249 2026-08-18 cs.LG 新提交 70%

SAUL: Sharpness-Aware Augmented-Lagrangian Unlearning

SAUL:感知锐度的增广拉格朗日模型遗忘算法

Jaewan Choi, Junyoung Yang, Sangdon Park

机构 * POSTECH(浦项科技大学) Computer Science and Engineering, POSTECH(浦项科技大学计算机科学与工程学院) Graduate School of Artificial Intelligence, POSTECH(浦项科技大学人工智能研究生院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出SAUL算法,将模型遗忘建模为显式约束的受约束最小化问题,通过增广拉格朗日控制器等实现更优遗忘-效用权衡,即插即用修改器可提升基线模型遗忘后效用。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16187 2026-08-18 cs.CR cs.AI cs.SE 新提交 70%

Securing AI-Generated Code: A Just-in-Time Vulnerability Detection and Remediation Pipeline

保护AI生成代码:一种即时漏洞检测与修复流水线

Mikhail Surikov

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出一种自动化安全评估流水线,可检测、修复AI生成代码的漏洞,在Claude的4种模型上评估发现,P2配置表现优于P1,Sonnet 4.6的修复效果最佳,且流水线有效性与初稿安全性不同。

Comments 7 pages, 8 tables, 2 figures. Georgia Institute of Technology Master's final practicum project. Code: https://github.com/Droidsurikov/securing-ai-generated-code

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16050 2026-08-18 cs.IR cs.DB cs.LG 新提交 70%

Structured Prediction for Scalable Spreadsheet Table Understanding: From Cell Types to Table Ranges (Extended Version)

面向可扩展电子表格表格理解的结构化预测:从单元格类型到表格范围(扩展版)

Antoine Gauquier, Ioana Manolescu, Pierre Senellart

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 该研究针对电子表格理解的单元格类型分类与表格检测任务,提出结合CRF-LightGBM的两阶段流水线,在公开基准StatSheets上实现了与先进模型相当的性能,且计算资源需求更低。

Comments Extended version of a paper published at CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16011 2026-08-18 cs.CL cs.CV 新提交 70%

ReRef-3D: A Benchmark for Spatial Referring Expression-Guided 3D Scene Rearrangement

ReRef-3D:空间指代表达引导的3D场景重排基准

Mary Lynn Martin, Yifei Zhang, Martha Palmer, Maria Leonor Pacheco

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究提出ReRef-3D基准,针对3D场景语言引导放置任务,经微调的LLaVA-3D等模型在该基准上验证了关系满足度优于物理有效性等结论。

Comments 18 pages, 4 figures. Submitted to ACL Rolling Review (ARR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15888 2026-08-18 cs.AI cs.CR 新提交 70%

Bounded Agents: Delegation Security for Multi-Agent AI Systems

有界智能体:多智能体AI系统的委托安全

Xabier Muruaga

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对多智能体AI系统的委托安全问题,提出智能体委托链(APC)架构,经实验可有效阻止提示注入攻击,降低数据窃取、破坏及操纵风险,授权延迟低且效用损失可控。

Comments 14 pages, 4 figures, 18 tables. Code and data: https://github.com/xmuruaga/bounded-agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15851 2026-08-18 cs.IR cs.CL 新提交 70%

Dense Expands, Sparse Anchors: Channel-Asymmetric Query Expansion for Hybrid Retrieval

密集扩展,稀疏锚点:用于混合检索的通道非对称查询扩展

Chunran Zhang

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本研究提出DESA通道非对称查询扩展方法,在7个BEIR数据集上提升检索指标,同时降低访问深度,为生成段落的通道特定整合及检索效果与访问深度的联合评估提供支撑。

Comments 13 pages, 4 figures. Code and artifacts: https://github.com/ln-one/dense-expands-sparse-anchors

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15579 2026-08-18 cs.SE cs.AI cs.ET cs.PL 新提交 70%

Kozuchi Agent: A Language-Agnostic Open-Weight Agent for Software Repair

Kozuchi智能体:一款与语言无关的开源权重软件修复智能体

Mehdi Bahrami, Kosaku Kimura, Satoshi Munakata, Satoshi Nakashima, Yu Ishikawa, Kosuke Maeda, Nao Soma, Kenichi Kobayashi, Keisuke Miyazaki, Keizo Kato, Shigeki Fukuta, Tatsuo Kumano, Nobutaka Imamura, Kevin Musgrave, Shahbaz Abdul Khader, Kwun Ho Ngan, Joe Townsend, Fayas Asharindavida, Matthieu Parizy, Akira Sakai, Yuma Ichikawa, Yang Zhao, Michiaki Takizawa, Taku Fukui, Hiroki Ohtsuji, Wei-Peng Chen, Hiromichi Kobashi

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出Kozuchi智能体,一款与语言无关的开源权重软件修复智能体,结合CI评估流水线,在SWE-bench等基准上取得优异性能,降低操作接触点,为软件修复提供新方案。

Comments 13 pages, 4 figures. Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE '26), Industry Showcase track, Munich, Germany, October 12-16, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15255 2026-08-18 cs.AI 新提交 70%

Towards Standardized Evaluation in Automated Domain Modeling: Introducing a Benchmark

面向自动化领域建模的标准化评估:引入一个基准

Vasiliy Seibert

机构 * Institute for Software and Systems Engineering, TU Clausthal(克劳斯塔尔工业大学软件与系统工程研究所)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文针对自动化领域建模缺乏标准化基准的问题,引入整合两类数据集的基准,评估多种建模方法,为该领域研究提供可复用的研究成果。

详情

展开后加载摘要…

URL PDF HTML 收藏