arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32034 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32034 篇

2606.24610 2026-06-24 cs.CL 新提交 92%

Same Lesson, Different Story: Cross-Lingual Reconstruction of Cultural Narratives in Large Language Models

同一教训,不同故事:大型语言模型中文化叙事的跨语言重构

Jory Alshaalan, Haya Albaker, Abeer Aldayel, Aljawharah Alabdullatif, Rehab Alahmadi

机构 * College of Computer and Information Sciences(计算机与信息科学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);prompting(abstract)

AI总结 本研究通过跨语言谚语集和四种LLM生成叙事,评估模型在跨语言条件下是否保留文化意义,发现跨语言提示基本保留语义但改变叙事结构,且模型间存在强收敛。

Comments This paper is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24408 2026-06-24 cs.LG 新提交 92%

Natural Identifiers for Privacy and Data Audits in Large Language Models

大型语言模型中用于隐私和数据审计的自然标识符

Lorenzo Rossi, Bartłomiej Marek, Franziska Boenisch, Adam Dziedzic

机构 * CISPA Helmholtz Center for Information Security(CISPA 欧洲信息安全中心)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 提出自然标识符(NIDs)解决LLM隐私审计难题,无需重训练即可进行事后差分隐私审计和数据集推断。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22382 2026-06-23 eess.IV cs.AI cs.CV 新提交 92%

Large Language Model-Assisted Cleaning of Report-Derived Labels in a Large-Scale Chest CT Dataset

大型胸部CT数据集中基于大语言模型的报告衍生标签清洗

Yosuke Yamagishi, Atsushi Takamatsu, Mototsugu Sato, Tomohiro Kikuchi, Shouhei Hanaoka, Takeharu Yoshikawa, Osamu Abe

机构 * Division of Radiology and Biomedical Engineering, Graduate School of Medicine, The University of Tokyo(放射医学与生物医学工程系,东京大学医学研究生院) Department of Computational Diagnostic Radiology and Preventive Medicine, The University of Tokyo Hospital(计算诊断放射学与预防医学系,东京大学医院) Department of Radiology, Kanazawa University Hospital(金泽大学医院放射科) Faculty of Medicine, The University of Tokyo(东京大学医学系) Department of Radiology, School of Medicine, Jichi Medical University(立命馆大学医学系放射科) Department of Radiology, The University of Tokyo Hospital(东京大学医院放射科)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究利用大语言模型(GPT-5.4)清洗CT-RATE数据集中的标签-报告不一致性,通过放射科医生裁决验证,发现LLM辅助清洗能有效识别临床相关错误,并提升数据集质量。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16987 2026-06-16 cs.AI 新提交 92%

Consensus-based Agentic Large Language Model Framework for Harmonized Tariff Schedule Code Classification

基于共识的智能体大语言模型框架用于协调制度海关编码分类

Truong Thanh Hung Nguyen, Khanh Van Quynh Nguyen, Hoang-Loc Cao, Tri Duong, Phuc Ho, Van Pham, Loc Nguyen, Hung Cao

机构 * Analytics Everywhere Lab, University of New Brunswick(新不伦瑞克大学无处不在分析实验室) University of Economics Ho Chi Minh City(胡志明市经济大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出一种多智能体LLM框架,通过信息检索、语义检索、证据推理、共识验证和分层投票等方法,解决加拿大10位HTS编码分类难题,在3300条数据上验证了证据驱动和人工参与的必要性。

Comments Accepted at the 3rd International Conference of Resilience by Technology and Design (RTD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11672 2026-06-11 cs.CR cs.AI 新提交 92%

Can Open-Source LLM Agents Replace Static Application Security Testing Tools? An Empirical Assessment

开源LLM代理能否取代静态应用安全测试工具?一项实证评估

Derek Yohn, Luke Flancher, Mirajul Islam, Khaled Slhoub

机构 * College of Engineering and Science, Florida Institute of Technology(工程学院与科学学院,佛罗里达理工学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract,comments);language model(abstract,comments);分类 cs.AI

AI总结 评估基于开源LLM的代理在静态应用安全测试中的性能,与SAST工具Bandit对比,发现当前不适合实际应用。

Comments Keywords: Agentic AI, Cybersecurity, Large Language Models, Static Application Security Testing, Model performance evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06910 2026-06-11 cs.CL 版本更新 92%

Language Shapes Mental Health Evaluations in Large Language Models

语言塑造大型语言模型中的心理健康评估

Jiayi Xu, Xiyang Hu

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Arizona State University(亚利桑那州立大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究多语言LLM在心理健康评估中是否因语言不同而产生系统性偏差,发现中文提示比英文提示导致更高的污名相关评分和更保守的抑郁严重度判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08071 2026-06-09 cs.CL 新提交 92%

SurgiQ: A Large-Scale Multi-Domain Benchmark for Evaluating Surgical Understanding in Large Language Models

SurgiQ: 用于评估大语言模型手术理解的大规模多领域基准

Ayah Al-Naji, Edoardo Fazzari, Saif Alkindi, Hamdan Alhadhrami, Preslav Nakov, Cesare Stefanini

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出SurgiQ基准,包含13,055道多选题,覆盖六个外科领域和四种题型,用于评估LLM的手术推理能力。实验显示最佳模型准确率仅68.1%,通用模型优于多数生物医学模型,表明当前医学专业化未能充分覆盖手术知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01015 2026-06-02 cs.RO cs.AI cs.NI cs.SY eess.SY 92%

AI-IoT-Robotics Integration: Survey of Frameworks, Emerging Trends, and the Path Toward Connected Robotics

AI-IoT-机器人集成:框架、新兴趋势及迈向互联机器人的路径综述

Ranulfo Bezerra, Satoshi Tadokoro, Kazunori Ohno

机构 * Tohoku University(东大大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);SLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文综述了人工智能、物联网和机器人三者融合的现状,提出了模块化系统架构,并强调了小语言模型(SLM)和大型语言模型(LLM)在分布式认知与自主决策中的作用,为下一代互联机器人和物理AI生态系统提供了概念和技术路线图。

Comments 15 pages, 3 figures, 3 tables. Published in IEEE Internet of Things Journal

Journal ref IEEE Internet of Things Journal, vol. 13, no. 10, pp. 20398-20412, 15 May15, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30394 2026-06-01 cs.SE cs.AI 92%

CodeGolf Bench: A Multi-Language Benchmark for Evaluating Concise Code Generation Capabilities of Large Language Models

CodeGolf Bench:评估大型语言模型简洁代码生成能力的多语言基准

Vedant Padwal

机构 * Independent(独立)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出CodeGolf Bench基准,基于代码高尔夫竞赛,在60种编程语言中评估LLM生成简洁高效代码的能力,实验表明推理模型显著优于非推理模型。

Comments 12 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29791 2026-05-29 cs.CL 92%

ActTraitBench: Quantifying the Knowledge-Decision Gap in Large Language Models via Human-Grounded Behavioral Validation

ActTraitBench: 通过人类行为验证量化大型语言模型中的知识-决策差距

Yutong Yang, Chenxi Miao, Weikang Li, Yunfang Wu

机构 * Peking University(北京大学) Baidu Inc(百度公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出ActTraitBench框架,基于人类数据建立心理测量方面与行为范式的一一映射,并通过分位数映射校准LLM评分分布,揭示LLM在自我报告与行为决策之间的知识-决策差距,并引入CoCA干预来缓解该差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29667 2026-05-29 cs.CL 92%

Beyond English and Evasion: A Human-Annotated Multi-Domain Benchmark for High-Stakes LLM Safety Evaluation in Chinese

超越英语与规避:用于高风险LLM中文安全评估的人工标注多领域基准

Wajdi Zaghouani, Kholoud K. Aldous, Yicheng Gao

机构 * Northwestern University in Qatar(卡塔尔西北大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract,journal_ref);language model(abstract,journal_ref);分类 cs.CL

AI总结 针对LLM在中文环境下安全系统失效的问题,构建了包含1,897个对抗性提示的人工标注基准ChiSafe-PAS,覆盖四个高风险领域,并提供完整标注以评估模型安全对齐。

Journal ref Proceedings of The fourth international workshop on the role of resources in the age of large language models RESOURCEFUL-2026 at LREC 2026, Palma de Mallorca, Spain, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25510 2026-05-27 cs.CL 92%

The Age of Curiosity Meets the Age of AI: Benchmarking Child Safety in Large Language Models

好奇心时代遇上AI时代:大型语言模型中的儿童安全基准测试

Samee Arif, Angana Borah, Rada Mihalcea

机构 * University of Michigan(密歇根大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 针对7-11岁儿童使用LLM的安全性问题,提出基于发展心理学的KIDBench基准,通过隐式线索和显式年龄指令提升安全性,并开发了儿童安全评估器KIDGuardLlama和响应模型KIDLlama。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23651 2026-05-27 cs.CL 92%

How Human-Like Are Large Language Models? A Register-Aware Linguistic Evaluation Framework

大型语言模型有多像人类?一个语域感知的语言评估框架

Björn Nieth, Marianna Gracheva, Michaela Mahlberg, Bjoern Eskofier, Emmanuelle Salin

机构 * Department Artificial Intelligence in Biomedical Engineering (AIBE)(人工智能生物医学工程系) Department of Digital Humanities and Social Studies (DHSS)(数字人文与社会科学系) University of Birmingham(伯明翰大学) Chair of AI-supported Therapy Decisions(人工智能支持治疗决策教授职位) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Institute of AI for Health, Helmholtz Zentrum München(健康人工智能研究所,海德堡中心慕尼黑)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出一个基于语域感知的评估框架,通过比较人类参考语料库与LLM生成文本的词汇语法特征分布(使用最大均值差异和Biber的67个特征),发现LLM偏离人类基线,且最接近人类的模型取决于语域而非模型大小。

Comments 8.5 pages (main) + 31 pages appendix, 29 figures, 10 tables. Code and data: https://github.com/BjoernNieth/Register_Aware_LLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07085 2026-05-27 cs.HC cs.AI cs.CY 92%

The AI Cognitive Trojan Horse: How Large Language Models May Bypass Human Epistemic Vigilance

AI认知特洛伊木马:大型语言模型如何绕过人类认知警觉

Andrew D. Maynard

机构 * School for the Future of Innovation in Society, Arizona State University(未来创新社会研究所,亚利桑那州立大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出“认知特洛伊木马”假说,认为LLM通过优化产生的“诚实非信号”特征(流畅性、帮助性、表面无私)可能绕过人类进化出的认知警觉机制,导致用户高估其可信度。

Comments 16 pages, 20 references. v2: Added brief discussion situating "honest signals" terminology in evolutionary biology (Sec. 3), with two added citations (Zahavi 1975; Maynard Smith & Harper 2003). No changes to argument or conclusions

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24765 2026-05-26 cs.CR cs.LG 92%

CyberMaskQA: A Privacy-Aware Benchmark for Evaluating Large Language Models in Cybersecurity Question Answering

CyberMaskQA: 一个用于评估大语言模型在网络安全问答中隐私意识的基准

Matilda Gaddi, Jin Noh, Onat Gungor, Tajana Rosing

机构 * Department of Computer Science and Engineering(计算机科学与工程系) University of California, San Diego (UCSD)(加州大学圣地亚哥分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 针对现有基准缺乏隐私保护评估的问题,提出CyberMaskQA基准,通过结合人工场景与LLM语义扩展生成带隐私标签的数据集,以评估模型在网络安全问答中的推理与隐私保护能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23019 2026-05-25 cs.LG 92%

PACE: Two-Timescale Self-Evolution for Small Language Model Agents

PACE:小型语言模型代理的双时间尺度自我进化

Chen Ling, Pei Chen, Albert Guan, Jiaming Qu, Shayan Ali Akbar, Madhu Gopinathan, Erwin Cornejo

机构 * Amazon(亚马逊)

专题命中 评测与基准 :SLM(summary_cn,abstract);language model(title,abstract);small language model(title,abstract);分类 cs.LG

AI总结 提出PACE框架,通过双时间尺度协调低风险提示优化与高风险控制逻辑更新,使冻结的小型语言模型在无需权重更新或依赖前沿模型的情况下实现自主自我进化,在12个骨干-基准组合上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21773 2026-05-22 cs.CR cs.LG 92%

HIDBench: Benchmarking Large Language Models for Host-Based Intrusion Detection

HIDBench: 用于基于主机入侵检测的大型语言模型评估

Danyu Sun, Jinghuai Zhang, Yuan Tian, Zhou Li

机构 * University of California, Irvine(加州大学洛杉矶分校) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出HIDBench基准测试,用于评估大型语言模型在支持基于主机的入侵检测系统(HIDS)中的能力,揭示了LLM在复杂系统日志数据中的性能差异和敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23531 2026-05-21 cs.CL 92%

Large Language Models Unpack Complex Political Opinions through Target-Stance Extraction

大型语言模型通过目标-立场提取解构复杂的政治观点

Özgür Togay, Javier Garcia-Bernardo, Florian Kunneman, Anastasia Giachanou

机构 * Department of Methodology and Statistics, Utrecht University(方法论与统计学系,乌特雷赫特大学) Department of Languages, Literature and Communication, Utrecht University(语言、文学与传播系,乌特雷赫特大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);prompting(abstract)

AI总结 本文研究了大型语言模型是否能通过目标-立场提取任务解构复杂政治观点,通过构建包含138个不同政治目标的Reddit帖子数据集,评估了多种LLM在零样本、少样本和上下文增强提示策略下的表现,结果显示最佳模型表现接近高度训练的人类标注者,证明了LLM在最小监督下的复杂政治观点提取能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19229 2026-05-20 cs.AI 92%

Can Large Language Models Revolutionize Survey Research? Experiments with Disaster Preparedness Responses

大型语言模型能否革新调查研究?与灾害准备响应的实验

Yan Wang, Ziyi Guo, Christopher McCarty

机构 * Dept. of Urban and Regional Planning & Florida Institute for Built Environment Resilience, University of Florida(城市与区域规划系及佛罗里达环境韧性研究所,佛罗里达大学) College of Liberal Arts and Sciences, Bureau of Economic and Business Research, University of Florida(文理学院及经济与商业研究局,佛罗里达大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文探讨了大型语言模型在调查研究中的应用,通过实验验证了其在灾害准备响应中的有效性,提出了一个五阶段框架,涵盖问卷设计、样本选择、试点测试、缺失数据填补和事后分析,并介绍了基于保护动机理论的协同出现知识图谱和七种LLM配置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06718 2026-05-15 cs.CR cs.AI 92%

GhostCite: A Large-Scale Analysis of Citation Validity in the Age of Large Language Models

GhostCite: 对大规模语言模型时代引用有效性的大规模分析

Zuyao Xu, Yuqi Qiu, Lu Sun, Fasheng Miao, Fubin Wu, Xiang Li, Xinyi Wang, Haozhe Lu, Zhengze Zhang, Yuxin Hu, Jialu Li, Luo Jin, Feng Zhang, Rui Luo, Xinran Liu, Yingxian Li, Jiaji Liu

机构 * Nankai University(南开大学) Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究通过三个实验分析LLM时代引用有效性,发现13个模型在引用生成任务中存在14.23%-94.93%的伪造引用率,2025年无效引用率上升80.9%,并揭示87.2%的研究人员使用AI工具,76.7%的审稿人未彻底检查参考文献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10176 2026-05-12 cs.CR cs.AI 92%

When Prompts Become Payloads: A Framework for Mitigating SQL Injection Attacks in Large Language Model-Driven Applications

当提示成为载荷:一种缓解大型语言模型驱动应用中SQL注入攻击的框架

Farzad Nourmohammadzadeh Motlagh, Mehrdad Hajizadeh, Mehryar Majd, Pejman Najafi, Feng Cheng, Christoph Meinel

机构 * Hasso Plattner Institute, University of Potsdam, Germany(波茨坦大学霍斯曼-普拉特研究所, 德国) Chemnitz University of Technology, Chemnitz, Germany(Chemnitz技术大学, Chemnitz, 德国)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出一种多层安全框架,通过提示清洗、威胁检测和签名控制层缓解LLM介导的SQL注入攻击,实验表明其在检测精度和误报率方面表现优异。

Comments 11 pages

Journal ref ICAART 2026, 18th Int. Conf. on Agents and Artificial Intelligence, pp. 1380-1390, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24361 2026-04-28 cs.CL 92%

Culture-Aware Machine Translation in Large Language Models: Benchmarking and Investigation

具有文化意识的大型语言模型机器翻译:基准测试与调查

Zekun Yuan, Yangfan Ye, Xiaocheng Feng, Baohang Li, Qichen Hong, Yunfei Lu, Dandan Tu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出CanMT数据集和评估框架,系统评估多种LLM在不同翻译策略下的表现,揭示模型在文化翻译中的性能差异及策略影响,指出文化特定项的翻译难度差异及评估可靠性问题。

Comments 26pages,25 figures ACL2026 main conference, long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24156 2026-04-28 cs.GT cs.AI 92%

Strategic Bidding in 6G Spectrum Auctions with Large Language Models

在6G频谱拍卖中使用大语言模型进行战略投标

Ismail Lotfi, Ali Ghrayeb

机构 * College of Science and Engineering, Hamad Bin Khalifa University(哈马德·本·卡西姆大学科学与工程学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文研究了在车载网络中使用大语言模型作为投标代理进行6G频谱拍卖,探讨了LLM在预算约束下的投标策略及其对拍卖机制的影响。

Comments Accepted at IEEE Transactions on Vehicular Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15313 2026-04-24 cs.CL 92%

Capabilities and Evaluation Biases of Large Language Models in Classical Chinese Poetry Generation: A Case Study on Tang Poetry

大型语言模型在古典汉语诗歌生成中的能力与评估偏差:以唐诗为例

Bolei Ma, Yina Yao, Anna-Carolina Haensch

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) University of Maryland, College Park(马里兰大学College Park分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文通过三步评估框架,分析了六个先进LLM在唐诗生成中的表现,揭示了LLM在模仿统计模式时对机器生成诗歌的系统性高估问题,强调了需要混合人类-模型验证框架的重要性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00585 2026-04-23 cs.CY cs.AI 92%

Fairness Testing of Large Language Models in Role-Playing

大型语言模型在角色扮演中的公平性测试

Xinyue Li, Zhenpeng Chen, Jie M. Zhang, Ying Xiao, Tianlin Li, Weisong Sun, Yang Liu, Yiling Lou, Xuanzhe Liu

机构 * Peking University(北京大学) Tsinghua University(清华大学) King's College London(伦敦国王学院) Nanyang Technological University(南洋理工大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文通过生成33000个角色特定问题,评估10种先进LLM在角色扮演场景中的公平性,发现107580次偏见响应,揭示角色扮演中偏见的普遍性。

Comments Accepted by ACM International Conference on the Foundations of Software Engineering (FSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08145 2026-04-22 cs.CL 92%

Mitigating Judgment Preference Bias in Large Language Models through Group-Based Polling

通过基于群体的轮询缓解大语言模型中的判断偏好偏差

Shuliang Liu, Zhipeng Xu, Zhenghao Liu, Yukun Yan, Minghe Yu, Yu Gu, Chong Chen, Huiyuan Xie, Ge Yu

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院,中国沈阳) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系,中国北京) Software College, Northeastern University, Shenyang, China(东北大学软件学院,中国沈阳) Huawei, China(华为,中国)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出Genii框架,通过多智能体协作优化缓解LLM判断偏好偏差,无需人工标注数据,提升评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05523 2026-04-21 cs.AI 92%

Market-Bench: Benchmarking Large Language Models on Economic and Trade Competition

Market-Bench: 在经济与贸易竞争中评估大语言模型

Yushuo Zheng, Huiyu Duan, Zicheng Zhang, Yucheng Zhu, Xiongkuo Min, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出Market-Bench,通过经济贸易竞争评估大语言模型在经济相关任务中的能力,发现LLM在竞争中表现差异显著,只有少数能持续获利。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16560 2026-04-21 cs.SE cs.AI cs.ET 92%

SpecPylot: Python Specification Generation using Large Language Models

SpecPylot:利用大语言模型进行Python规范生成

Ragib Shahariar Ayon, Shibbir Ahmed

机构 * Texas State University(德克萨斯州立大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 SpecPylot利用大语言模型生成Python程序的可执行规范,通过交叉hair符号执行验证,生成合同并支持覆盖率驱动的pytest stubs,但受限于符号探索的界限和LLM行为差异。

Comments Accepted in 34th ACM Joint European Software Engineering Conference and Symposium on the Foundations of Software Engineering (FSE Companion 26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15151 2026-04-17 cs.CL 92%

QuantCode-Bench: A Benchmark for Evaluating the Ability of Large Language Models to Generate Executable Algorithmic Trading Strategies

QuantCode-Bench: 一个用于评估大型语言模型生成可执行算法交易策略能力的基准

Alexey Khoroshilov, Alexey Chernysh, Orkhan Ekhtibarov, Nini Kamkia, Dmitry Zmitrovich

机构 * Lime

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出QuantCode-Bench,通过多阶段流程评估现代LLM生成Backtrader框架策略的能力,包含400个不同难度任务,分析模型在交易逻辑、API使用和任务语义方面的局限性。

Comments 12 pages, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04578 2026-04-17 cs.CL 92%

LexGenius: An Expert-Level Benchmark for Large Language Models in Legal General Intelligence

LexGenius:一种大型语言模型在法律通用智能方面的专家级基准

Wenjin Liu, Haoran Luo, Xin Feng, Xiang Ji, Lijuan Zhou, Rui Mao, Jiapu Wang, Shirui Pan, Erik Cambria

机构 * Hainan University(海南大学) Nanyang Technological University(南洋理工大学) Nanjing University of Science and Technology(南京理工大学) Griffith University(格里菲斯大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出LexGenius,一个涵盖七个维度、十一项任务和二十项能力的中文法律基准,用于评估大型语言模型的法律通用智能,发现LLM在法律智能能力上存在显著差异,甚至优于人类法律专业人士。

详情

展开后加载摘要…

URL PDF HTML 收藏