arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32096 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32096 篇

2608.08512 2026-08-11 cs.AI 新提交 88%

Time Present and Time Past: Benchmarking Large Language Models on Temporally Evolving Document Understanding

当下与过往时间:针对时间演进的文档理解的大语言模型基准测试

Mahbub E Sobhani, Md. Faiyaz Abdullah Sayeedi, Fahmid Hasan Chowdhury, Md Adnan Arefeen, Farig Sadeque, Md. Faizul Bari, Swakkhar Shatabda

机构 * BRAC University(BRAC大学) United International University(联合国际大学) North South University(北南大学) Spectrum Software & Consulting Ltd.(斯佩克特软件咨询有限公司)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究针对时间演进的文档理解构建了TIDE基准,评估9种LLMs在版本解析任务上的表现,发现模型在检测错误版本时表现较差,倾向于选择参数化答案而非权威文本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07543 2026-08-11 cs.CV cs.AI 新提交 88%

Performance of large language models in the optical diagnosis of colorectal polyps

大型语言模型在结直肠息肉光学诊断中的性能

Joshua C. Vences, William T. Tran, Nikko Gimpaya, Catharine M. Walsh, Rishad J. Khan, Robert Bechara, Asher C. Wiggins, Celine N. Rousan, Kaitlyn V. G. L. Morgado, Angie Ibrahim, Kevin H. M. Kuo, Daniel von Renteln, Alexander Hann, Dennis L. Shung, Michael A. Scaffidi, Charles Ménard, Joshua Landy, Samir C. Grover

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究评估Claude Opus 4等5款大型语言模型对结直肠息肉的光学诊断性能,发现其区分息肉亚型的准确率接近专家共识,但灵敏度与特异度未达ESGE标准,需进一步研究方可临床应用。

Comments 22 pages, 1 figure, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23341 2026-08-11 cs.CR cs.AI 版本更新 88%

Evaluating Jailbreaking Vulnerabilities in LLMs Deployed as Assistants for Smart Grid Operations: A Benchmark Against NERC Standards

评估部署于智能电网操作中的LLM jailbreaking漏洞:与NERC标准的基准测试

Taha Hammadia, Lucas Rea, Ahmad Mohammad Saber, Amr Youssef, Deepa Kundur

机构 * ECE Department, University of Toronto(多伦多大学电子工程系) CIISE, Concordia University(麦吉尔大学CIISE)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文评估了智能电网操作中部署LLM的jailbreaking漏洞,通过与NERC标准的基准测试,发现DeepInception方法攻击成功率最高,Claude 3.5 Haiku完全免疫,Gemini 2.0 Flash-Lite最易受攻击。

Comments \c{opyright} 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16406 2026-08-11 cs.CR cs.CL 版本更新 88%

Retrieval-Augmented Defense: Adaptive and Controllable Jailbreak Prevention for Large Language Models

检索增强防御:针对大语言模型的自适应且可控制的越狱防范

Guangyu Yang, Jinghong Chen, Jingbiao Mei, Weizhe Lin, Bill Byrne

机构 * Department of Engineering University of Cambridge(工程系剑桥大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 针对大语言模型越狱攻击的挑战,提出检索增强防御(RAD)框架,在StrongREJECT数据集上验证其可降低强力越狱攻击有效性,同时平衡安全性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06861 2026-08-10 cs.AI 新提交 88%

Gated-BEPO: Confidence-Gated Bellman Credit Assignment for Large Language Model Agents

Gated-BEPO:用于大语言模型智能体的置信门控贝尔曼信用分配

Hongxi Yan, Ziyue Huang, Shichao Fan, Qingjie Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究针对大语言模型智能体长视域训练的信用分配问题,提出Gated-BEPO方法,通过经验rollout图推导步骤级信用并结合置信门自适应融合回合与步骤级信用,在多任务基准上取得性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04703 2026-08-06 cs.CL 新提交 88%

IslamicTurathBench: A Multi-Task, Multi-Discipline Benchmark for Evaluating Large Language Models on the Islamic Scholarly Tradition (turath)

IslamicTurathBench:用于评估大型语言模型在伊斯兰学术传统(turath)上性能的多任务、多学科基准

Shahd Gaben, Heba Sbahi, Samer Rashwani, Abdessalam Bouchekif, Mutaz Al-Khatib, Emad Mohamed, Somaya Eltanbouly, Mohammed Ghaly

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 该研究推出用于评估大型语言模型伊斯兰学术性能的多任务基准 ISTB,含3465个问答条目,支持多维度可复现评估,填补了该领域高质量标注资源的空白。

Comments Includes supplementary materials. Submitted to the Journal of Scientific Data. Data and code are publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04244 2026-08-06 cs.CV cs.CL 新提交 88%

SIGNPOST-Bench: Benchmarking Text-Vision Conflict Resolution in Multimodal Large Language Models

SIGNPOST-Bench:评估多模态大语言模型文本-视觉冲突解决能力的基准

Sirun Li, Minghao Liu, Ling Dai, Yong Li, Haoxin Lyu, Junting Zhou, Fan Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究推出SIGNPOST-Bench基准,通过包含5111个反事实组的25555个图像变体,评估20个多模态大语言模型的文本-视觉冲突解决能力,发现对抗文本会显著提升定位误差,且模型对冲突文本的鲁棒性无法由干净输入的定位性能完全预测。

Comments 27 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02684 2026-08-06 q-bio.QM cs.AI 版本更新 88%

A Blind Spot in Alignment: Quantifying Biosecurity Risks in Large Language Models

对齐机制中的盲区:量化大语言模型的生物安全风险

Shu Quan, Tianfang Hao, Sitong Fang, He Geng, Jiayi Zhou, Boyuan Chen, Kaile Wang, Donghai Hong, Juntao Dai, Yaodong Yang, Jiaming Ji

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究针对大语言模型生物安全评估盲区,构建SPIKE-Bench评估框架,发现多数模型易生成毒素序列,提出BioSafe-Guard分类器降低功能风险并开源相关资源。

Comments Accepted to COLM 2026. 40 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03532 2026-08-05 cs.CL 新提交 88%

Cross-Lingual Bias in Large Language Models: A Comparative Analysis of English and Swahili

大语言模型中的跨语言偏见:英语与斯瓦希里语的对比分析

Ruolei Zhang, Teddy Njuguna, Yue Feng

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究通过对比GPT-5.2与Gemini 2.5 Flash在英语和斯瓦希里语上的9类人口统计偏见表现,发现偏见会转变而非转移,仅英语偏见审计无法覆盖多语言部署需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03358 2026-08-05 cs.CL cs.CV 新提交 88%

ArtECulture: Benchmarking Culture-Conditioned Visual Emotion Understanding in Multimodal Large Language Models

ArtECulture:评测多模态大语言模型中的文化条件视觉情感理解

Xiaolin Chen, Xuemeng Song, Wenhao Shi, Xianjing Han, Mong-Li Lee, Wynne Hsu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 针对现有视觉情感理解方法忽略文化差异的问题,提出ArtECulture基准与检索增强型文化条件情感理解框架,评估多模态大语言模型在该任务上的表现并验证框架的提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02520 2026-08-04 cs.CL 新提交 88%

MedPRESS: A Multi-turn Benchmark for Patient-Pressure-Induced Medical Sycophancy in LLMs

MedPRESS:面向大语言模型中患者压力诱导型医疗谄媚行为的多轮基准测试

Saman Sarker Joy, Niloy Farhan

机构 * Universiti Malaya(马来亚大学) BRAC University(BRAC大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 MedPRESS是衡量大语言模型患者压力诱导型医疗谄媚行为的多轮基准,含600个五轮医学对话,评估20类LLM发现其易在压力下不安全附和,反谄媚提示仅部分改善,凸显医疗LLM需抗对话压力的缺口。

Comments 27 pages, 10 figures. Both authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02397 2026-08-04 cs.SD cs.AI 新提交 88%

Can Foundation Models Hear What Made That Sound? A Tiered Benchmark of Audio-Language Models and Traditional Classifiers for Closed-Set Sound Source Identification

基础模型能否识别声音的来源?针对闭集声源识别的音频-语言模型与传统分类器的分层基准测试

Sajjad Abdoli, Ghassan Al-Sumaidaee, Ahmad ElShiekh, Ahmed Rashad

机构 * Perle(珀尔)

专题命中 评测与基准 :language model(title);foundation model(title);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究构建涵盖11种音频分类方法的分层基准,在2242个音频片段的闭集声源识别任务中评估性能,发现Gemini-3.1-Pro-Preview表现最优,还分析了Gemini模型的思维链特性并给出方法选择指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27964 2026-08-04 cs.SE cs.AI 版本更新 88%

Specification-Guided Synthesis of Deadlock-Free Communication Protocol Refinements with Large Language Models

基于大语言模型的、由规范引导的无死锁通信协议精化合成

Yang Li, Ping Hou, Nobuko Yoshida

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 该研究提出Syntropy框架,结合多方会话类型规范与大语言模型合成无死锁通信协议精化,经评估其有效性达95.6%-99.5%,可生成多样且语法正确的协议精化方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05938 2026-08-04 cs.AI 版本更新 88%

ICU-Bench:Benchmarking Continual Unlearning in Multimodal Large Language Models

ICU-Bench: 多模态大语言模型持续反学习基准测试

Yuhang Wang, Wenjie Mei, Junkai Zhang, Guangyu He, Zhenxing Niu, Haichang Gao

机构 * School of Computer Science and Technology(计算机科学与技术学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出ICU-Bench,用于评估多模态大语言模型在持续隐私删除中的性能,包含1000个敏感资料和9500张图像,引入新指标分析遗忘效果与稳定性,揭示现有方法在持续场景下的局限。

Comments 21 pages, 11 figures, and 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28318 2026-07-31 cs.AI 新提交 88%

PathView-Bench: Can Multimodal Large Language Models Achieve Fine-grained Multiscale Understanding of Pathology Images?

PathView-Bench:多模态大语言模型能否实现病理图像的细粒度多尺度理解?

Zongyi Chen, Yu Liang, Jie Lin, Liansheng Wang

机构 * National Institute for Data Science in Health and Medicine, Xiamen University(厦门大学健康与医学数据科学国家研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究针对现有病理多模态基准的不足,推出PathVU基准,评估发现主流MLLMs在多尺度病理图像细粒度视觉任务上存在显著局限,为相关模型的开发评估提供了可复现基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28086 2026-07-31 cs.AI 新提交 88%

Distilling Answer Set Programming Theories from Large Language Models

从大型语言模型中提炼答案集编程理论

Nelson Higuera Ruiz, Markus Hofmarcher, Claudiu Leoveanu-Condrei

机构 * ExtensityAI

专题命中 评测与基准 :large language model(title);language model(title);LLM(summary_cn);分类 cs.AI

AI总结 该研究针对从头编写ASP理论困难的问题,采用神经符号方法测试9种模型从LLM提炼ASP理论的能力,在VQA基准上验证了前沿模型的性能,并发布了相关资源。

Comments Accepted at NeSy 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24273 2026-07-28 cs.CL 新提交 88%

INS-ActBench: A Comprehensive Benchmark for Assessing Professional Actuarial Capability of Large Language Models

INS-ActBench:一个用于评估大语言模型专业精算能力的综合基准

Changyu Chen, Chenwei Lin, Xian Xu

机构 * Fudan University(复旦大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 介绍INS-ActBench这一综合基准评估大语言模型专业精算能力,含12050个问答对及三个子集,通过实验揭示前沿大语言模型在不同方面的能力表现,为精算大语言模型开发提供可重复基础。

Comments 18 pages, including appendices; 11 figures and 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11586 2026-07-28 cs.CL cs.CY 88%

Survey Response Generation: Generating Closed-Ended Survey Responses In-Silico with Large Language Models

调查回应生成:利用大语言模型生成闭合式调查回应

Georg Ahnert, Anna-Carolina Haensch, Barbara Plank, Markus Strohmaier

机构 * University of Mannheim(曼海姆大学) LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) University of Maryland, College Park(马里兰大学学院公园分校) GESIS Cologne(科隆社会研究所) CSH Vienna(维也纳认知科学研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文研究了不同调查回应生成方法对模拟调查回应的影响,发现受限生成方法效果最佳,推理输出不总能提升对齐度。

Journal ref ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17052 2026-07-28 cs.CL 版本更新 88%

PReSS: An Automated Black-Box Framework for Evaluating Political Stance Stability in LLMs

PReSS:通过论证压力评估LLM中政治立场稳定性的黑盒框架

Shariar Kabir, Kevin Esterling, Yue Dong

机构 * Bangladesh University of Engineering and Technology(孟加拉工程科技大学) University of California Riverside(加州大学河滨分校)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PReSS通过评估LLM在不同话题下的立场稳定性,揭示了模型政治立场的动态变化,为理解和干预政治敏感行为提供新视角。

Comments 13 pages, 8 figures

Journal ref In Proceedings of the 3rd Workshop on Natural Language Processing for Political Sciences (PoliticalNLP 2026) @ LREC 2026 (pp. 234-247)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20499 2026-07-24 cs.AI cs.SE 新提交 88%

ExecuGraph: A Multi-Agent, Execution-Grounded Framework for Reliable Backend Code Synthesis with Large Language Models

ExecuGraph:一种用于通过大语言模型进行可靠后端代码合成的多智能体、基于执行的框架

Sai Deekshith Lekkala, Jothi Prabha Appadurai, Rohith Reddy Bellibatlu, Manpreet Singh

机构 * Department of Computer Science and Engineering (AI & ML), Kakatiya Institute of Technology and Science(卡凯蒂亚理工学院计算机科学与工程系(人工智能与机器学习)) Department of Computer Science and Engineering, Kakatiya Institute of Technology and Science(卡凯蒂亚理工学院计算机科学与工程系) Boston University(波士顿大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究针对大语言模型后端代码合成可靠性问题,提出ExecuGraph多智能体框架,将执行验证置于核心,通过六个智能体和有向工作流协调,在多数据集评估中对比单智能体基线,验证方法有效性且能控制测量各因素贡献。

Comments Submitted to Data Science and Management

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19834 2026-07-23 cs.CL 新提交 88%

D2VBench: Benchmarking Large Language Models with Value Dilemmas in Daily Scenarios

D2VBench:在日常场景中使用价值困境对大语言模型进行基准测试

Siyi Hao, Yidi Cao, Linhao Yu, Yuqi Ren, Deyi Xiong

机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院TJUNLP实验室) The International Joint Institute of Tianjin University(天津大学国际联合研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 针对大语言模型输出价值含义评估问题,提出D2VBench基准,通过多阶段协作构建含10000个日常困境实例的数据集,采用混合评估范式,对八个主流模型全面评估,结果显示该基准可靠性和鲁棒性高,能反映模型价值一致性。

Comments 22 pages,11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18066 2026-07-21 cs.CL 新提交 88%

Pancasila-Dilemmas: Evaluating Large Language Models on Indonesian Human Value Dilemmas Grounded in Pancasila

潘查希拉困境:基于潘查希拉对印度尼西亚人类价值困境的大语言模型评估

Supryadi, Irfan, Julianti, Darren Keanly Martin, Jayvin Fernando, Yuqi Ren, Deyi Xiong

机构 * Universitas Universal(印尼环球大学) Beijing Language and Culture University(北京语言大学) Tianjin University(天津大学) School of Artificial Intelligence, Tianjin University(天津大学人工智能学院) School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究基于印尼新闻构建潘查希拉困境数据集,含1834个按潘查希拉五价值观分类的问题,用于评估大语言模型价值对齐。通过母语人士校对及公民回答,评估50个模型,发现各模型在宗教和团结困境案例中表现差,凸显印尼价值观捕捉差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17745 2026-07-21 cs.AI 新提交 88%

WuYu-EnvLE-Bench: A Benchmark for Evaluating Large Language Models in Environmental Law Enforcement

吴语-环境执法基准:评估大语言模型在环境执法中的基准

Ziliang Yang, Yi Zhang, Kaijun Lin, Jiachao Ke, Haihong Xu, Zongguo Wen

机构 * School of Environment, Tsinghua University(清华大学环境学院) College of Economics and Management, Beijing University of Technology(北京工业大学经济与管理学院) State Key Laboratory of Iron and Steel Industry Environmental Protection, School of Environment, Tsinghua University(清华大学环境学院钢铁工业环境保护国家重点实验室) Appraisal Center for Environmental Engineering, Ministry of Ecology and Environment(生态环境部环境工程评估中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 该研究针对大语言模型在环境执法中生成可追溯决策能力不明的问题,构建吴语-环境执法基准,含多任务多子领域实例,用AES和IEI评估模型,发现其在部分任务表现不佳,强调证据与规则感知的执法推理需求。

Comments 98 pages, 45 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16609 2026-07-21 cs.CV cs.CL 新提交 88%

Can Multimodal Large Language Models Understand OCT?

多模态大语言模型能理解光学相干断层扫描(OCT)吗?

Baochen Fu, Wenzhi Deng, Baihao Jin, Yang Li, Zihan Nie, Kailin Jiang, Yuntao Du, Weiye Song

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究探讨多模态大语言模型能否理解OCT,引入OCT - Bench基准,包含多维度细粒度任务,基于多个数据集构建大量选择题,评估20个代表性模型,发现当前模型理解OCT能力不足,为评估模型和推动OCT理解提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21961 2026-07-21 cs.CL 版本更新 88%

PapersPlease: A Benchmark for Evaluating Motivational Values of Large Language Models Based on ERG Theory

《请出示文件:基于ERG理论评估大语言模型动机价值的基准》

Junho Myung, Yeon Su Park, Sunwoo Kim, Shin Yoo, Alice Oh

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 该研究引入PapersPlease基准,由3700个基于ERG理论的道德困境组成,让LLMs充当移民检查员决策。分析六个LLMs发现决策模式及隐含偏好,评估还显示其对社会身份叙述的反应因动机需求和身份线索而异。

Comments Accepted to GEM2 Workshop: Generation, Evaluation & Metrics - ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15396 2026-07-20 cs.CL 88%

Attribution, Citation, and Quotation: A Survey of Evidence-based Text Generation with Large Language Models

归因、引用与引述:基于大语言模型的证据导向文本生成综述

Tobias Schreieder, Tim Schopf, Michael Färber

机构 * TU Dresden & ScaDS.AI Dresden/Leipzig(德累斯顿技术大学及ScaDS.AI德累斯顿/莱比锡)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文综述了基于大语言模型的证据导向文本生成,分析了134篇论文,提出统一的分类体系,探讨了引用、归因和引述三种方法,并指出未来研究方向和挑战。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11890 2026-07-15 cs.CY cs.AI 新提交 88%

So Many Opinions, So Many LLMs: Comparing Large Language Models to Traditional Machine Learning for Open- Ended Survey Analysis

众多观点,众多大语言模型:将大语言模型与传统机器学习用于开放式调查分析的比较

Abdullah Akinde, Mariam Akinde, Rasheedat Emiola, Ahmed Akinsola

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究对比多种大语言模型与传统机器学习用于开放式调查分析,在情感分析和主题分类等任务中评估性能,发现LLMs分类准确性更高,但在预测理由及应用类别边界上差异大,凸显了使用LLMs进行定性分析时的权衡并给出实用建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15222 2026-07-15 cs.SE cs.CL cs.PL 版本更新 88%

PerfCodeBench: Benchmarking LLMs for System-Level High-Performance Code Optimization

PerfCodeBench:用于系统级高性能代码优化的LLM基准测试

Huihao Jing, Wenbin Hu, Shaojin Chen, Haochen Shi, Hanyu Yang, Sirui Zhang, Haoran Li, Yangqiu Song

机构 * HKUST(香港科技大学) NYU(纽约大学) SWUPL(西南大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出PerfCodeBench,用于评估LLM在系统级高性能代码优化中的能力,发现模型生成代码与专家优化代码存在显著差距,尤其在并行和GPU任务中表现更差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03195 2026-07-09 cs.AI cs.SE 版本更新 88%

Terminus-4B: Can a Smaller Model Replace Frontier LLMs at Agentic Execution Tasks?

Terminus-4B:一个较小的模型能否在智能体执行任务中取代前沿大语言模型?

Spandan Garg, Vikram Nitin, Yufan Huang

机构 * Microsoft USA(微软公司)

专题命中 评测与基准 :SLM(abstract,abstract_cn);SFT(abstract,abstract_cn);LLM(abstract);language model(abstract)

AI总结 研究智能体终端执行任务中较小模型能否取代前沿大语言模型。提出经监督微调及强化学习训练的Terminus-4B模型,评估发现其能减少主智能体令牌使用量约30%,不影响性能,还缩小与前沿模型差距甚至超越其性能。

Comments The current article involves some product IP issues and needs to be withdrawn and re-approved

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21160 2026-07-09 stat.ML cs.LG stat.ME 版本更新 88%

Fast segmentation of watermarked texts from large language models through an epidemic change-point framework

通过流行变化点框架对大语言模型中的水印文本进行快速分割

Soham Bonnerjee, Subhrajyoty Roy, Sayar Karmakar

机构 * University of Chicago(芝加哥大学) Washington University in St. Louis(圣路易斯华盛顿大学) University of Florida(佛罗里达大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 针对大语言模型水印文本分割问题,利用流行变化点视角提出WISER算法,建立检测多水印片段的理论结果,通过数值实验表明其在计算速度和准确性上优于基线方法,是水印定位的有效工具。

Comments 68 pages

详情

展开后加载摘要…

URL PDF HTML 收藏