arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2848 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2848 篇

2606.18051 2026-06-17 cs.CL 新提交 87%

Compositional Skill Routing for LLM Agents: Decompose, Retrieve, and Compose

面向LLM智能体的组合技能路由:分解、检索与组合

Xueping Gao

机构 * Alibaba Cloud(阿里云)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出SkillWeaver框架,通过迭代技能感知分解(SAD)将复杂查询分解为原子子任务,检索对应技能并组合为可执行计划,在CompSkillBench上验证了分解质量是主要瓶颈,SAD将分解准确率提升32.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17546 2026-06-17 cs.AI 新提交 87%

SEAGym: An Evaluation Environment for Self-Evolving LLM Agents

SEAGym: 自我进化LLM智能体的评估环境

Congjie Zheng, Chuanyi Xue, Bin Liang, Jun Yang, Changshui Zhang

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Beijing National Research Center for Information Science and Technology (BNRist), Tsinghua University(北京信息科学与技术国家研究中心(BNRist),清华大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出SEAGym评估环境,通过训练、验证、测试、重放和成本记录多维度衡量智能体框架更新,揭示更新是否带来可复用改进、过拟合、成本增加或旧行为退化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17114 2026-06-17 cs.CR cs.AI 新提交 87%

An Evaluation of Data Leakage Risks in Tool-Using LLM Agents in Realistic Scenarios

现实场景中工具使用LLM代理的数据泄露风险评估

Hankyul Baek, Jaewon Noh, Sang Seo, Yongsu Kim, Gabriel Waikin Loh Matienzo, Young Il Kim, Ee Wei Seah, Akriti Vij

机构 * Korea AI Safety Institute(韩国人工智能安全研究所) Singapore AI Safety Institute(新加坡人工智能安全研究所)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 评估了12个非对抗性任务中AI代理的数据泄露风险,发现所有代理均存在数据安全意识不足、信息过度访问等问题,表明操作数据泄露是独立于对抗性窃取的一阶安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16173 2026-06-16 cs.AI 新提交 87%

TimeVista: Exploring and Exploiting Vision-Language Models as Judges for Time Series Forecasting

TimeVista:探索和利用视觉语言模型作为时间序列预测的评判者

Zhi Chen, Yuxuan Wang, Jialong Wu, Yong Liu, Haoran Zhang, Xingjian Su, Jianmin Wang, Mingsheng Long

机构 * School of Software, BNRist, Tsinghua University(清华大学软件学院、北京信息科学与技术国家研究中心)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);foundation model(abstract);分类 cs.AI

AI总结 提出TimeVista框架,利用视觉语言模型(VLM)作为时间序列预测的评判者,通过微观和宏观判断结合上下文信息评估预测质量,实验表明VLM比传统指标更符合人类偏好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11675 2026-06-11 cs.AI 新提交 87%

Lung-R1: A Knowledge Graph-Guided LLM for Pulmonary Diagnostic Reasoning

Lung-R1:知识图谱引导的肺部诊断推理大语言模型

Haoyang Zeng, Yuanxi Fu, Rongzhen Li, Yuming Yang, Xiao Sun, Jingwang Huang, Gujie Shao, Guohui Xiang, Quan Lu, Dongfan Ye, Xuetao Chen, Jiang Zhong, Kaiwen Wei, Zhi Xu

机构 * School of Computer Science, Chongqing University(重庆大学计算机学院) AI Research Institution, Mashang Financial Institution(马上金融人工智能研究院) Department of Information, Third Military Medical University(陆军军医大学信息系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出LungKG知识图谱和Lung-R1模型,通过KG约束的推理链构建和强化学习,解决肺部知识到病例诊断的差距,在EMR诊断任务上达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10400 2026-06-10 cs.CL cs.CV 新提交 87%

Do Vision-Language Models See or Guess? Measuring and Reducing Textual-Prior Reliance with a Phrasing-Controlled Benchmark

视觉语言模型是看见还是猜测?通过措辞控制基准衡量和减少文本先验依赖

Pratham Singla, Shivank Garg, Vihan Singh, Paras Chopra

机构 * Lossfunk Indian Institute of Technology Roorkee(印度理工学院罗尔基分校) Raeth AI

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);post-training(abstract);分类 cs.CL

AI总结 本文构建了540张图像的基准,通过为同一图像生成四种措辞变体,衡量视觉语言模型对文本先验的依赖,发现所有模型在最难变体上性能下降,开放模型下降最严重,并通过无图像消融等分析证实了真正的图像依赖。

Comments 17 pages, 7 figures, Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10359 2026-06-10 cs.AI 新提交 87%

ReflectiChain: Epistemic Grounding in LLM-Driven World Models for Supply Chain Resilience

ReflectiChain: 面向供应链韧性的LLM驱动世界模型中的认知基础

Jia Luo

机构 * School of Foreign Languages, Huazhong University of Science

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ReflectiChain框架,通过生成式供应链世界模型和双环学习分离认知不确定性与偶然不确定性,在半导体基准上提升推理一致性33.0%,并在对抗冲击下保持82.3%可操作性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10314 2026-06-10 cs.AI 新提交 87%

Mobility Anomaly Generation using LLM-Driven Behavior with Kinematic Constraints

基于大语言模型驱动行为与运动约束的移动异常生成

Yueyang Liu, Joon-Seok Kim, Andreas Züfle

机构 * Emory University, Atlanta, USA(埃默里大学,亚特兰大,美国)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出端到端生成框架,结合大语言模型注入语义异常与地图约束路由重建,合成带标注的真实轨迹异常数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08904 2026-06-09 cs.AI 新提交 87%

Order Matters: Unveiling the Hidden Impact of Macro Placement Sequences via Proxy-Guided LLM Evolution

顺序至关重要:通过代理引导的LLM进化揭示宏放置序列的隐藏影响

Shibing Mo, Jing Liu, Jianchu Xu, Ruilin Wu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出OrderPlace框架,利用代理引导的大语言模型进化自动发现宏放置顺序策略,在ISPD 2005基准上相比现有方法线长减少14.08%-34.04%。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08092 2026-06-09 cs.CL 新提交 87%

When Languages Disagree: Self-Evolving Multilingual LLM Judges

当语言不一致时:自我进化的多语言LLM评判者

Xiyan Fu, Wei Lu

机构 * Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出SEMJ方法,利用多语言评判中的跨语言不一致性进行迭代自我反思与重新评估,在多个基准上优于投票和反思基线,提升准确性和跨语言一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22949 2026-07-28 cs.IR 新提交 87%

Beyond Exact Match: How Evaluation Methodology Dominates Model Choice in LLM-Based Product Attribute Extraction

超越精确匹配:评估方法如何在基于大语言模型的产品属性提取中主导模型选择

Ayush Dwivedi, Ashvi Soni

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究基于大语言模型的产品属性提取中评估方法的影响,通过在MAVE基准上对比两种模型的四种提示策略,用精确和模糊匹配评估预测并审计标签,发现评估方法产生的方差远超模型和提示策略选择,且基准有一定噪声率,得出评估方法和数据质量主导模型选择等结论。

Comments 9 pages, 3 figures, 8 tables. Preprint under review. Code available at https://github.com/a-dwivedi/llm-product-attribute-extraction

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21095 2026-08-24 cs.SE cs.AI cs.CL cs.CR cs.IR 新提交 87%

Trustworthy RAG: An Evaluation Agent for Detecting Misinformation and Knowledge Poisoning in Generative AI Systems

可信检索增强生成:用于检测生成式人工智能系统中错误信息和知识投毒的评估智能体

Balkrishna Giri, Md Toufique Hasan, Jussi Rasku, Muhammad Waseem, Pekka Abrahamsson

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究针对RAG系统的安全-可靠性鸿沟,提出结合NLI验证、五信号投毒检测器及可信指数的评估智能体,在TruthfulQA等数据集上实现高检测性能,可阻止RAG系统的不安全指令注入。

Comments 7 pages, 1 figure. Accepted for publication in the Main Research Track of the Twenty-First International Conference on Software Engineering Advances (ICSEA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18289 2026-08-20 cs.AI cs.CR cs.IR cs.LG 新提交 87%

Evaluating Structured Information Extraction with Open Models in a High Risk Public Sector Application

在高风险公共部门应用中使用开源模型评估结构化信息提取

Elias Schubert, Felix Bießmann

机构 * Berlin University of Applied Sciences(柏林应用科学大学) Einstein Center Digital Future(爱因斯坦数字未来中心)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对欧盟AI法案高风险公共部门应用场景,构建基准评估开源OCR、LLM、VLM在学生申请处理任务的性能,发现零样本下多数模型表现差,输入结构保留是关键因素。

Comments Accepted at Workshop on Systems Over Models: What Actually Works in Industry (SOMI-2026) at ECML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17810 2026-08-19 cs.CL cs.AI cs.HC 新提交 87%

Interpretable Humans, Alien LLMs: Expert Analysis of Latent Structures in Assessment Responses

可解释的人类,陌生的大语言模型:对评估响应中潜在结构的专家分析

Alona Strugatski, Licol Zeinfeld, Jason Cooper, Shelley Rap, Gil Schwarts, Giora Alexandron

机构 * Weizmann Institute of Science(魏茨曼科学研究所)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究结合探索性因子分析与学科专家盲审,发现6个LLMs的评估响应潜在因子与人类认知结构的可解释性存在显著差异,多数LLM因子无法被人类专家解读,揭示其机制与人类推理不同。

Comments Accepted for publication at AIME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09930 2026-08-11 cs.SD cs.AI cs.CL 新提交 87%

Beyond Naturalness: Probing Automated Text-To-Speech Evaluators on Linguistically Grounded Dimensions

超越自然性:基于语言维度探究自动文本转语音评估器

Oluwanifemi Bamgbose, Simon Rosen, Jash Shah, Lindsay Devon Brin, Hoang H Nguyen, Anke Koelzer, Rachel Hansen, Tara Bogavelli, Fanny Riols

机构 * ServiceNow(ServiceNow公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究构建了首个TTS维度级元评估基准,测试发现MOS预测器聚焦声学信号质量,Audio-LLM评估器检测能力具选择性且依赖提示,两类方法均难捕捉语言结构化语音错误,相关资源已公开。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05889 2026-08-07 cs.DL cs.AI cs.CL cs.CY 新提交 87%

The em-dash em-beds in Congress: A population-level rise in em-dash frequency in U.S. congressional press releases at the dawn of the large-language-model era, 2021-2025

长破折号嵌入国会:大语言模型时代初期(2021-2025)美国国会新闻稿中长破折号频率的全人口水平上升

Przemysław Czuma

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究分析2021-2025年美国国会新闻稿,发现无空格长破折号频率在2025年翻倍,证实LLM辅助写作的扩散,长破折号可作为全人口水平的相关标记。

Comments Preregistered study (OSF: 10.17605/OSF.IO/U5NEY); deviations from the registered plan, including a formal validation-gate breach, are disclosed in Section 4.6. Companion study: arXiv:2606.29540. 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04519 2026-08-06 cs.AI cs.CL 新提交 87%

Leak-Resistant Unlearning: A New Benchmark for Evaluating Multi-Hop Reasoning Consistency and Recovery Robustness

防泄露遗忘:评估多跳推理一致性与恢复鲁棒性的新基准

Haoting Qian, Qingjie Zhang, Zhicong Huang, Cheng Hong, Han Qiu

机构 * Tsinghua University(清华大学) Ant Group(蚂蚁集团)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出新基准unlearning评估LLM遗忘的鲁棒性,实验发现现有遗忘方法易受多跳推理路径和恢复攻击影响,还探究了遗忘质量、鲁棒性与模型效用的权衡。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29539 2026-08-03 cs.CL cs.AI 新提交 87%

ARB: A Matched Authorship-Rewriting Benchmark Dataset for AI-Text Detector Evaluation

ARB:用于AI文本检测器评估的匹配作者改写基准数据集

Gaetano Perrone, Simon Pietro Romano

机构 * University of Napoli Federico II(那不勒斯费德里科二世大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出用于AI文本检测器评估的ARB基准数据集,对比五种检测器在传统基准与人类被LLM改写场景下的性能,发现传统基准测得的性能无法迁移至改写人类文本场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28631 2026-08-03 cs.AI cs.CL 新提交 87%

Can AI Evaluate AI Scientists? A Benchmarking Study of Autonomous Research Generation Systems Using Automated Multi-Model Review

AI能否评估AI科学家?基于自动化多模型评审的自主研究生成系统基准研究

Vaibhava Lakshmi Ravideshik, Mayank Kejriwal

机构 * Technion(以色列理工学院) Sakana AI FARS

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对AI科学家系统的评估难题,提出基于多模型LLM的自动化评审基准,发现FARS基准论文表现最优,Gemini与Claude评估一致性强,GPT-5.4标准不同,建立了首个定量基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27595 2026-07-31 cs.CL cs.AI cs.DL 新提交 87%

Beyond Similarity: Grounded Agentic Extraction and Expert-Adjudicated Evaluation of Intertextuality in Classical Chinese Histories

超越相似性:中国古典史书互文性的智能体式提取与专家裁决评估

Zhaoji Wang, Wanyu Si, Jun Wang

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究将细粒度互文性提取设为LLM智能体任务,构建专家裁决的古典史书互文基准,验证12种LLM性能,扩展至二十四史揭示引文的总体稳定与个案漂移规律并发布相关资源。

Comments 9 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26791 2026-07-30 cs.CR cs.AI cs.CL 新提交 87%

SecRespond: Benchmarking AI Agents for Real-World Post-Compromise Incident Response

SecRespond:面向真实入侵后事件响应的AI智能体基准测试集

Lehan Wang, Boli Chen, Ruixue Ding, Pengjun Xie, Jinwei Huang, Zhendong Liu, Shuo Wang, Tao Lei, Xin Ouyang, Xiaomeng Li

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究人员推出首个入侵后事件响应AI智能体基准测试集SecRespond,评估23种前沿LLM在10个靶场的表现,发现现有智能体难以及时发现隐蔽入侵并制定全面修复计划,存在根本瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26066 2026-07-30 cs.CL cs.AI cs.DL 新提交 87%

Do Methods Support the Claims? Intra-Paper Verification for Peer Review

方法是否支持其主张?用于同行评审的论文内部验证

Ranjitha Shivaprasad Ballakuraya, Arash Mahyari, Ashok Srinivasan

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对现有 LLM 评审系统忽视论文内部主张与方法学证据不匹配的问题,提出 intra-paper claim verification 框架,经实验验证其生成的评审意见与人类评审关注点高度契合。

Comments 9 pages, 8 figures. Source code, prompts, evaluation materials, and supporting data available at https://github.com/Ranjitha2493/intra-paper-claim-method-verification

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20465 2026-07-24 cs.LG cs.CL 新提交 87%

DataPrep-Bench: Benchmarking LLMs as Training Data Preparators

数据准备基准:评估作为训练数据准备者的大语言模型

Hao Liang, Qifeng Cai, Yibo Lin, Jianzhuo Du, Qifeng Xia, Sizhe Qiu, Linzhuang Sun, Meiyi Qiang, Zhaoyang Han, Xiaochen Ma, Bohan Zeng, Ruichuan An, Conghui He, Wentao Zhang

机构 * Peking University(北京大学) Institute for Advanced Algorithms Research(先进算法研究院) OriginHub Technology(源创科技)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究LLMs作为训练数据准备者的表现,引入DataPrep - Bench统一基准,涵盖数据构建与质量评估,在多领域和模型上评估,发布相关智能体和评估器,为衡量LLM驱动数据准备能力提供框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19355 2026-07-23 cs.AI cs.CL cs.CY 新提交 87%

Information Discernment in Large Language Models

大语言模型中的信息辨别

Joshua Ashkinaze, Laura Kurek, Alina Faisal, Tongyuan Miao, Mariam Joseph, Ceren Budak, Eric Gilbert

机构 * University of Michigan(密歇根大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型在与外部知识源结合时的信息辨别问题,提出Learn2Discern框架及基准,通过用户研究和大量模型试验发现模型在来源和真相辨别上存在问题,识别出简单干预措施,发布数据集和调查作为测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13602 2026-07-16 cs.CL cs.LG stat.ML 新提交 87%

Analogical Deep Research: Retrieving and Integrating Historical Analogies for Foresight Analysis

类比深度研究:检索和整合历史类比以进行前瞻性分析

Yongqiang Chen, Guangyi Chen, Yuewen Sun, Kun Zhang

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究提出类比深度研究(ADR)任务及ADR-bench,发现LLM智能体找类比能力差。基于理论分析提出ADR原则,构建因果类比研究者(CANA)框架,提升历史类比生成效果,超越现有智能体,案例研究证实其利用历史类比的有效性。

Comments Ongoing project

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13189 2026-07-16 cs.CL cs.AI 新提交 87%

RAGthoven at SemEval-2026 Task 1: A Multi-Stage Pipeline Walks Into a Benchmark and Barely Clears the Bar

RAGthoven参加SemEval-2026任务1:一个多阶段管道进入基准测试且勉强达标

Marek Šuppa, Viktória Ondrejová, Lucia Ganajová, Gregor Karetka, Daniel Skala

机构 * Comenius University in Bratislava(布拉迪斯拉发的夸美纽斯大学) Cisco Systems(思科系统公司) Zaitra s.r.o.(扎伊特拉有限公司) NaiveNeuron(天真神经元)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 介绍用于SemEval-2026任务1子任务A的RAGthoven系统,它将幽默文本生成分解为多阶段LLM管道,经多次实验优化,最终配置用RAG增强规划器,还评估两种智能变体,虽工具调用预算增加,但在英语样本上未超非智能管道,在三种语言中与基线并列第一,显示语言相关回报递减。

Comments SemEval-2026 Task 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11363 2026-07-14 cs.CL cs.AI 新提交 87%

Beyond Sally-Anne: Evaluating Theory of Mind in LLMs using Epistemic Schelling Points

超越莎莉-安妮任务:使用认知谢林点评估大语言模型中的心理理论

Roberta Rocca, Sami Boukortt, Geoff Keeling, Winnie Street

机构 * Paradigms of Intelligence Team(智能范式团队)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究旨在解决大语言模型心理理论评估问题,引入认知不对称谢林任务,通过要求模型在不同认知透明度下收敛于语义谢林点来评估其功能性ToM能力,发现能力差距及协调失败原因,指出社会推理和认知跟踪是瓶颈,为LLM评估与发展提供目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02235 2026-07-03 cs.CL cs.AI 新提交 87%

Challenges and Recommendations for LLMs-as-a-Judge in Multilingual Settings and Low-Resource Languages

多语言环境和低资源语言中LLM-as-a-Judge的挑战与建议

A. Seza Doğruöz, Xixian Liao, Verena Blaschke, Jakob Prange, Senyu Li, David Ifeoluwa Adelani

机构 * LT3, IDLab, Universiteit Gent, Barcelona Supercomputing Center, LMU Munich & Munich Center for Machine Learning, German Center for Addiction Research in Childhood and Adolescence, University Medical Center Hamburg-Eppendorf, Mila - Quebec AI Institute, McGill University, Canada CIFAR AI Chair(LT3、IDLab、根特大学、巴塞罗那超级计算中心、慕尼黑莱茵河大学及慕尼黑机器学习中心、德国成年期成瘾研究中心、汉堡埃彭多夫大学医学中心、魁北克人工智能研究所、麦吉尔大学、加拿大 CIFAR 人工智能主席)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.CL、cs.AI

AI总结 本文分析ACL论文中LLM-as-a-Judge在多语言和低资源语言评估中的应用,发现仅有33篇相关论文,存在评估结果不一致、过度信任LLM判断及依赖单一模型等问题,并提出改进建议。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28050 2026-06-29 cs.CL cs.AI 新提交 87%

Can LLMs Judge Better Than They Generate? Evaluating Task Asymmetry, Mechanistic Interpretability and Transferability for In-Context QA

LLM能否比生成更好地判断?探究上下文问答中的任务不对称性、机制可解释性与可迁移性

Sambaran Bandyopadhyay

机构 * Adobe Research(Adobe研究院)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.CL、cs.AI

AI总结 本研究在受控上下文问答中测试LLM自我评估是否比生成更容易,发现评估并非普遍更易,注意力分析显示评估对上下文关注更少,微调实验证实不对称性非训练伪影,挑战了自我评估管线的核心假设。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25530 2026-06-25 cs.SE cs.AI cs.CL 新提交 87%

Evaluating LLMs on Real-World Software Performance Optimization

评估大语言模型在真实软件性能优化中的表现

Ezgi Sarıkayak, Wenchao Gu, Hesham Ghonim, Chunyang Chen

机构 * Siemens AG(西门子公司) Technical University of Munich(慕尼黑技术大学) Heilbronn, Germany(德国海德堡) Munich, Germany(德国慕尼黑)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对现有基准过度简化性能优化的问题,提出基于102个专家优化的仓库级基准SWE-Pro,评估LLM在运行时、峰值内存和时间加权内存使用上的表现,发现LLM优化效果显著弱于专家。

详情

展开后加载摘要…

URL PDF HTML 收藏