arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32411 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32411 篇

2602.05088 2026-07-09 cs.AI 版本更新 86%

AI Chatbot Suicide Risk Detection and Response: Human Validation Study of the Open-Source VERA-MH Safety Evaluation

人工智能聊天机器人自杀风险检测与应对:开源VERA-MH安全评估的人工验证研究

Kate H. Bentley, Luca Belli, Adam M. Chekroud, Emily J. Ward, Emily R. Dworkin, Emily Van Ark, Kelly M. Johnston, Will Alexander, Millard Brown, Matt Hawrilenko

机构 * Spring Health Harvard Medical School(哈佛医学院) UC Berkeley(加州大学伯克利分校) Yale University(耶鲁大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对人工智能聊天机器人用于心理支持时的安全性评估问题,以VERA-MH为基准,模拟用户与聊天机器人对话,通过持牌临床医生和基于LLM的评估器评级,验证了VERA-MH在检测自杀风险方面的可靠性,为后续研究指明方向。

Journal ref JMIR AI. 2026;5

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23826 2026-07-08 cs.CV cs.CL 版本更新 86%

Decomposing Queries into Tool Calls for Long-Video Keyframe Retrieval

将查询分解为工具调用以进行长视频关键帧检索

Michal Shlapentokh-Rothman, Prachi Garg, Yu-Xiong Wang, Derek Hoiem

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出ToolMerge方法,通过LLM规划器将查询分解为工具调用并使用布尔运算符合并排名,实现长视频关键帧检索,在字幕检索任务上优于其他方法5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03162 2026-07-07 cs.AI cs.HC 新提交 86%

APeB: Benchmarking Personalization Ability of Large Language Model Agents

APeB:大型语言模型智能体个性化能力基准测试

Garry Yang, Zizhe Chen, Xinru Chen, Yongqiang Chen, Jianxiang Wang, Deyu Zou, Linyi Ding, Jialiang Wu, Yunzhong He, Yu Gong, James Cheng, Huaixiao Tou

机构 * The Chinese University of Hong Kong(香港中文大学) ByteDance(字节跳动)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

AI总结 研究大型语言模型智能体在处理原始、未明确查询时的个性化问题,通过引入个性化产品搜索测试平台构建基准测试,评估发现模型处理明确查询较好,但早期查询有困难,简单方法能提升性能。

Comments NA

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11098 2026-07-07 cs.SD cs.CL 版本更新 86%

VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents

VCB Bench:用于音频基础大语言模型对话代理的评估基准

Jiliang Hu, Wenfu Wang, Zuchao Li, Chenxing Li, Yiyang Zhao, Hanzhao Li, Liqiang Zhang, Meng Yu, Dong Yu

机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) Tencent AI Lab(腾讯AI实验室)

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL

AI总结 针对现有音频语言模型基准局限,提出VCB Bench,基于真实人类语音构建,从指令跟随、知识理解、鲁棒性三个角度评估,揭示性能差距并指明改进方向,提供评估框架。

Comments 25 pages, 9 figures, accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00627 2026-07-02 cs.AI 新提交 86%

AGI Maze as a Benchmark Framework for World-Modeling Agents

AGI Maze:作为世界建模智能体的基准框架

Alexey Potapov

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出AGI Maze框架,通过部分可观测网格迷宫任务评估LLM构建世界状态表示的能力,发现标准LLM在推理时无法内部表示迷宫,即使借助工作记忆也难以可靠求解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31310 2026-07-01 cs.CL cs.MM 新提交 86%

LOPA: Enhancing Spoken Language Assessment via Latent Ordinal Prototype Alignment

LOPA:通过潜在序数原型对齐增强口语评估

Hong-Yun Lin, Fu-An Chao, Bi-Cheng Yan, Berlin Chen

机构 * National Taiwan Normal University(国立台湾师范大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出LOPA正则化器,在潜在空间施加序数几何先验,结合SALR自适应提取Whisper编码器多层表示,以0.361 RMSE媲美十亿参数系统,无需LLM微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22723 2026-07-01 cs.CL 新提交 86%

BLUEX v2: Benchmarking LLMs on Open-Ended Questions from Brazilian University Entrance Exams

BLUEX v2: 对巴西大学入学考试开放性问题的大语言模型基准测试

João Guilherme Alves Santos, Giovana Kerche Bonás, Thiago Laitz, Thales Sales Almeida, Helio Pedrini

机构 * UNICAMP(坎皮纳斯州立大学) Tropic AI Maritaca AI

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对葡萄牙语开放性问题评估的不足,提出BLUEX v2基准,包含巴西两所顶尖大学第二阶段入学考试的395道题,采用LLM-as-a-judge评估21个模型,发现数学推理和图像理解是最难的能力维度。

Comments 15 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30556 2026-06-30 cs.CL 86%

Poller: Are LLMs Suitable for Evaluating the Poetry Understanding Task?

Poller: 大型语言模型是否适合评估诗歌理解任务?

Shanshan Wang, Derek F. Wong, Jingming Yao, Lidia S. Chao

机构 * NLP CT Lab, Department of Computer and Information Science, University of Macau(计算机与信息科学系,澳门大学CT实验室) Department of Portuguese, Faculty of Arts and Humanities, University of Macau(人文学院葡萄牙语系,澳门大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出Poller方法,让LLM扮演诗人角色模拟人类评价,在八个维度上评估诗歌理解,相比基线方法将修辞技巧和陌生化评价误差分别降低94.55%和89.53%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30291 2026-06-30 cs.AI 86%

PromptGNN-sim: Deep Fusion and Alignment of GNN and LLMs for Text-Attributed Graph Learning

PromptGNN-sim:GNN与LLM的深度融合与对齐用于文本属性图学习

Zhifei Hu, Alexandra I. Cristea

机构 * Durham University(杜伦大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 提出PromptGNN-sim框架,通过双向结构-语义融合、图注意力网络与LLM协同,解决文本属性图中模态交互浅层化问题,在跨任务、跨数据集和稀疏扰动下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29534 2026-06-30 cs.CL eess.AS 86%

Preference-ASR: A Preference-Aware Test Set for Benchmarking ASR in the Era of Speech LLMs

Preference-ASR:面向语音LLM时代的偏好感知ASR基准测试集

Nithin Rao Koluguri, Sasha Meister, Nikolay Karpov, Piotr Zelasko, Desh Raj, Jagadeesh Balam, Boris Ginsburg

机构 * NVIDIA, USA(NVIDIA美国公司)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.CL

AI总结 针对现有ASR基准无法评估模型遵循用户输出风格偏好的问题,提出Preference-ASR测试集,通过两阶段LLM辅助流程构建,涵盖归一化、实体、不流畅和大小写四类偏好指令,揭示传统评估忽略的质量差异。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27959 2026-06-29 cs.CL 新提交 86%

An Empirical Analysis of Factual Errors in Human-Written Text and its Application

人类撰写文本中事实错误的实证分析及其应用

Kazuma Iwamoto, Kazumasa Omura, Shotaro Ishihara

机构 * Nikkei Inc.(日本产经公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过分析报纸文章修正,提炼人类事实错误分类,并评估LLM在合成和真实数据上的检测能力,发现GPT-5.4仅达52% F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.05201 2026-06-29 cs.AI cs.HC econ.GN q-fin.EC 版本更新 86%

"Generate" the Future of Work through AI: Empirical Evidence from Online Labor Markets

通过AI“生成”工作的未来:来自在线劳动力市场的实证证据

Jin Liu, Xingchen Xu, Xi Nan, Yongjun Li, Yong Tan

机构 * School of Management, University of Science and Technology of China(中国科学技术大学管理学院) Michael G. Foster School of Business, University of Washington(华盛顿大学迈克尔·G·福斯特商学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 利用在线平台数据,发现LLM生成式AI导致与核心功能匹配的子市场需求和供给下降,但供给减少较小,加剧竞争,尤其在编程密集型领域,因ChatGPT降低编程门槛促使高技能自由职业者转入。

Comments 102 pages, 17 figures, 39 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22889 2026-06-23 cs.LG 新提交 86%

Physiology-Aware CNN and Zero-Shot Multimodal LLMs for ECG Image Classification: A Comparative Study

生理感知CNN与零样本多模态大语言模型在心电图图像分类中的比较研究

Khalil Ahammad, Derek Abbott, Mohsen Dorraki

机构 * School of Computer Science and Information Technology, Adelaide University(阿德莱德大学计算机科学与信息学院) Australian Institute for Machine Learning (AIML)(澳大利亚机器学习研究所) Pi MedTech(Pi医疗科技) School of Electrical and Electronic Engineering, Adelaide University(阿德莱德大学电子与电气工程学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究比较了零样本多模态大语言模型和生理感知CNN在正常/异常心电图图像分类中的表现,发现CNN模型稳定且准确,而LLM分类接近随机。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20564 2026-06-23 cs.NI cs.AI cs.ET 新提交 86%

A Reproducible Semantic Benchmark for Multivendor DSM-to-CLI Translation

可复现的多厂商DSM到CLI语义基准测试

Jerônimo Menezes, Leonardo Bitzki, Diego Kreutz, Gefte Almeida, Marcio Pohlmann, Rodrigo Mansilha

机构 * Federal University of Rio Grande do Sul (UFRGS)(里约格朗德杜斯·鲁伊斯联邦大学) AI Horizon Labs(AI地平线实验室) PPGES -- Federal University of Pampa (UNIPAMPA)(PGEs -- 皮亚蒙特联邦大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对网络意图翻译中语义正确性缺乏基准的问题,提出可复现的DSM-to-CLI语义基准,涵盖5种云LLM、3个厂商、5个用例,发现语义质量与可靠性正交,厂商效应主导,重复运行离散度预测投票不稳定。

Comments 10 pages, including 8 tables and 3 figures, submitted to Workshop on Artificial Intelligence in Networks and Communications (WIARC at SBRC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07955 2026-06-23 cs.CL 版本更新 86%

Expert Preference-based Evaluation of Automated Related Work Generation

基于专家偏好的自动相关工作生成评估

Furkan Şahinuç, Subhabrata Dutta, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab) Department of Computer Science and Hessian Center for AI (hessian.AI) Technical University of Darmstadt(乌普萨拉知识处理实验室(UKP实验室)计算机科学系海斯赛人工智能中心(hessian.AI)达姆施塔特技术大学) Konrad Zuse School of Excellence in Learning and Intelligent Systems (ELIZA)(克诺尔兹塞学校卓越学习和智能系统(ELIZA))

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出GREP多轮评估框架,结合经典标准与专家偏好,通过细粒度分解和对比示例提升LLM评估相关工作质量的能力,与人类专家评估高度相关。

Comments Project page: https://ukplab.github.io/arxiv2025-expert-eval-rw/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05162 2026-06-23 cs.CL 版本更新 86%

Mind the Gap... or Not? How Translation Errors and Evaluation Details Skew Multilingual Results

注意差距...还是不注意?翻译错误和评估细节如何扭曲多语言结果

Jan-Thorsten Peter, David Vilar, Tobias Domhan, Dan Malkin, Markus Freitag

机构 * Google(谷歌)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文以数学领域为例,研究LLM在多语言上的性能差距,发现数据翻译错误和答案提取不一致导致虚假差距,提出半自动质量保证方法和建议,修正后差距基本消失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20517 2026-06-19 cs.AI cs.PL 新提交 86%

Multi-LCB: Extending LiveCodeBench to Multiple Programming Languages

Multi-LCB: 将 LiveCodeBench 扩展到多种编程语言

Maria Ivanova, Pavel Zadorozhny, Rodion Levichev, Ivan Petrov, Adamenko Pavel, Ivan Lopatin, Alexey Kutalev, Dmitrii Babaev

机构 * GigaCode Yandex School of Data Analysis, Applied AI Institute(Yandex数据分析学院,应用人工智能研究所)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出 Multi-LCB 基准,将 LiveCodeBench 的 Python 任务扩展到 12 种编程语言,评估 LLM 跨语言代码生成能力,发现 Python 过拟合和语言特定污染等问题。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16941 2026-06-19 eess.AS cs.CL cs.SD 版本更新 86%

The Voice Behind the Words: Quantifying Intersectional Bias in SpeechLLMs

言语背后的声音:量化语音大语言模型中的交叉偏见

Shree Harsha Bokkahalli Satish, Christoph Minixhofer, Maria Teleki, James Caverlee, Ondřej Klejch, Peter Bell, Gustav Eje Henter, Éva Székely

机构 * 1 Department of Speech, Music Hearing, KTH Royal Institute of Technology, Sweden 2 Centre for Speech Technology Research, University of Edinburgh, UK 3 Texas A\&M University, USA

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过2880次受控交互,评估三种语音大语言模型在六种英语口音和两种性别呈现中的口音与性别交叉偏见,发现东欧口音(尤其女性)获得更低有用性评分,且人类评估者比LLM评判更敏感。

Comments 5 pages, 3 figures, 1 table, Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18471 2026-06-18 cs.CL 新提交 86%

Possible or Definite? A Benchmark for Evaluating Diagnostic Uncertainty Preservation in Clinical Text

可能还是确定?评估临床文本中诊断不确定性保留的基准

Hongbo Du, Zixin Lu, Jiaming Qu

机构 * Trine University(特里尼大学) University of Michigan(密歇根大学) Amazon(亚马逊)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 构建包含9184个不确定性标注的基准,评估LLM在临床文本中保留诊断不确定性的能力,发现LLM保留原始不确定性线索不足一半,且难以区分相邻级别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18166 2026-06-17 cs.CR cs.LG 新提交 86%

Evaluating Open-Source LLMs for Multi-Label ATT&CK Technique Classification on CTI Reports

评估开源大语言模型在CTI报告上的多标签ATT&CK技术分类

Ahmed Ryan, Saad Sakib Noor, Md Erfan, Shaswata Mitra, Sudip Mittal, Md Rayhanur Rahman

机构 * The University of Dhaka(达卡大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对开源LLM在复杂非结构化CTI报告上的ATT&CK分类性能未被评估的问题,构建了2076句人工标注数据集,评估7个开源LLM,最高F1为0.22,表明当前模型不足以用于生产。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18068 2026-06-17 cs.AI 新提交 86%

Agentic AI-based Framework for Mitigating Premature Diagnostic Handoff and Silent Hallucination in Healthcare Applications

基于Agentic AI的框架:缓解医疗应用中的过早诊断交接和无声幻觉

Divyansh Srivastava, Shreya Ghosh, Anshul Verma, Rajkumar Buyya

机构 * Distributed Systems (qCLOUDS) Lab, School of Computing Information Systems, The University of Melbourne, Australia 2Department of Computer Science Engineering, School of Electrical Computer Sciences (SECS), Indian Institute of Technology Bhubaneswar, India 3Department of Computer Science Banaras Hindu University, Varanasi, India

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出多智能体框架,通过确定性编排约束和两个安全机制(神经符号状态跟踪门和语义熵不确定性量化门)解决LLM在医疗对话中的过早诊断交接和无声幻觉问题,诊断精度提升11.3个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17197 2026-06-17 cs.SE cs.AI 新提交 86%

Cluster-Aware Dual-Level Test Specification Generation for Large-Scale Automotive Software Requirements

面向大规模汽车软件需求的集群感知双层测试规格生成

Hazem Ayman, Menna Sedik, Kareem Mostafa, Mahmoud Soliman, Samer Saber, Ibrahim Habib

机构 * CairoMotive Cairo, Egypt(开罗动力埃及)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种“先聚类后总结”流水线,通过嵌入、降维、聚类、多级摘要和双层测试生成,解决大规模需求下LLM处理依赖缺失和上下文窗口限制问题,提升集成测试覆盖率并高效扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01359 2026-06-17 cs.CR cs.AI 版本更新 86%

Breaking the Code: Security Assessment of AI Code Agents Through Systematic Jailbreaking Attacks

破解代码:通过系统性越狱攻击对AI代码代理进行安全评估

Shoumik Saha, Jifan Chen, Sam Mayers, Sanjay Krishna Gouda, Zijian Wang, Varun Kumar

机构 * University of Maryland – College Park(马里兰大学-College Park) AWS AI Labs(AWS人工智能实验室) Meta Superintelligence Labs(Meta超智能实验室)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出JAWS-Bench基准测试,通过三级工作区评估代码LLM代理的越狱风险,发现代理化使攻击成功率提升1.6倍,并揭示可执行攻击代码的高比例。

Comments 22 pages, 18 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15123 2026-06-16 cs.CR cs.LG 新提交 86%

Data-Centric Benchmarking of Exploit Generation in LLMs: Understanding the Impact of Fine-Tuning

数据为中心的LLM漏洞利用生成基准测试:理解微调的影响

Yiwei Chen, Lichi Li, Kai Cheung, Vinny Parla, Ganesh Sundaram

机构 * Cisco Systems, Inc.(思科系统公司) Michigan State University(密歇根州立大学)

专题命中 评测与基准 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 采用数据驱动方法,构建高质量数据集并设计评估框架,对17个大语言模型进行零样本漏洞利用生成能力基准测试,发现8B开源模型经微调后性能提升超42.5%,接近部分商业模型。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15037 2026-06-16 cs.CL cs.CV 新提交 86%

ReportQA: QA-Based Radiology Report Evaluation

ReportQA: 基于问答的放射学报告评估

Yiming Shi, Shaoshuai Yang, Xi Chen, Haolin Li, Hengyu Zhang, Che Jiang, Kaiwen Wang, Xun Zhu, Dong Xie, Fei Wang, Dejing Dou, Miao Li, Ji Wu

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) College of AI, Tsinghua University(清华大学人工智能学院) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心) Beijing Electronic Digital & Intelligence(北京电子数字与智能)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出ReportQA框架,利用知识树和LLM从报告中提取结构化信息生成QA对,以问答准确率作为评估指标,比现有指标更符合放射科医生判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05859 2026-06-16 cs.AI 版本更新 86%

When Do We Need LLMs? A Diagnostic for Language-Driven Bandits

何时需要大语言模型?语言驱动型老虎机的诊断方法

Uljad Berdica, Fernando Acero, Anton Ipsen, Parisa Zehtabi, Michael Cashmore, Manuela Veloso

机构 * University of Cambridge(剑桥大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出LLMP-UCB算法从LLM中获取不确定性估计,实验表明轻量数值老虎机在文本嵌入上匹配或超越LLM方案且成本更低,并给出基于臂嵌入的几何诊断指导何时使用LLM。

Comments The Reinforcement Learning Conference, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12639 2026-06-16 cs.CL 86%

CLASE: A Hybrid Method for Chinese Legalese Stylistic Evaluation

CLASE:一种中文法律文本风格评估的混合方法

Yiran Rex Ma, Yuxiao Ye, Huiyuan Xie

机构 * Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CLASE混合方法,通过结合语言特征和经验指导的LLM评估,提升法律文本风格质量,实验表明其比传统方法更符合人类判断。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14368 2026-06-16 cs.CR cs.CL 版本更新 86%

From ASR to ASP: Evaluating Prompt Attack Vulnerabilities Against Open-Source LLMs

从ASR到ASP:评估针对开源大语言模型的提示攻击漏洞

Jiawen Wang, Pritha Gupta, Ivan Habernal, Eyke Hüllermeier, Xiaoxue Gao, Nancy F. Chen

机构 * LMU Munich(慕尼黑莱茵恩大学) RUB Bochum(波恩鲁姆大学) MCML A*STAR(新加坡科技研究局)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出攻击成功概率(ASP)指标,评估14个开源和3个闭源LLM对提示注入攻击的脆弱性,发现催眠攻击可达约90% ASP,忽略前缀攻击可突破所有开源模型。

Comments 8 pages, 2 figures, EMNLP 2026 under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14361 2026-06-15 cs.LG cs.DB 新提交 86%

SemPiper: Interactive Code Synthesis for Semantic Operators in Machine Learning Pipelines

SemPiper:机器学习流水线中语义算子的交互式代码合成

Olga Ovcharenko, Luciano Duarte, Sebastian Schelter

机构 * BIFOLD & TU Berlin(BIFOLD 与柏林工业大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出SemPipes编程模型,通过声明式语义算子和LLM合成专用实现,结合Python代码,实现可控、可优化的ML流水线开发。

Comments Accepted at VLDB 2026 (Demonstrations track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14119 2026-06-15 cs.AI 新提交 86%

FactoryLLM: A Safe and Open-Source AI Playground for Evaluating LLMs in Smart Factories

FactoryLLM:用于评估智能工厂中大语言模型的安全开源AI实验场

Yash Pulse, Yong-Bin Kang, Abhik Banerjee, Abdur Forkan, Prem Prakash Jayaraman

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出FactoryLLM,一个安全开源的AI实验场,通过多机器文档分析评估基于RAG的大语言模型,采用RAGAS和NVIDIA LLM-as-a-Judge双评估机制,案例验证了跨机器文档推理的有效性。

Comments 6 pages, 3 figures, IEEE INDIN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏