arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32208 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32208 篇

2606.07834 2026-06-09 cs.SE cs.AI cs.CL cs.MA 新提交 90%

Cherry-pick Override: Unsafe Directional Commitment in LLM Judges under Mixed Evidence

Cherry-pick Override:混合证据下LLM法官的不安全方向性承诺

Haoran Xu

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 针对混合证据场景,发现LLM法官会错误地返回方向性裁决(SUPPORTS/REFUTES)而非授权非方向性裁决(CONFLICTING),定义为Cherry-pick Override(CCO);通过诊断协议和干预实验,提出外部承诺控制层分离裁决生成与授权。

Comments 12 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24660 2026-06-09 cs.IR cs.AI cs.LG 版本更新 90%

How Many Tools Should an LLM Agent See? A Chance-Corrected Answer

LLM 智能体应看到多少工具?一种机会校正的答案

Vyzantinos Repantis, Ameya Gawde, Harshvardhan Singh, Joey Blackwell

机构 * II Meta Platforms(Meta平台)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 针对 LLM 智能体工具选择中候选列表长度优化问题,提出基于机会校正的 Bits-over-Random (BoR) 指标,并将其转化为强化学习奖励,实现每查询自适应深度选择,在保持覆盖率的同时显著减少展示工具数量并提升下游工具选择准确率。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27011 2026-06-08 cs.LG cs.AI 版本更新 90%

Automatic Causal Fairness Analysis with LLM-Generated Reporting

基于LLM生成报告的自适应因果公平性分析

Alessia Berarducci, Eric Rossetto, Alessandro Antonucci, Marco Zaffalon

机构 * Istituto Dalle Molle di Studi sull’Intelligenza Artificiale (IDSIA), USI-SUPSI(日内瓦人工智能研究所(IDSIA)、USI-SUPSI)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出FairMind原型,利用标准公平模型进行因果公平分析,通过反事实查询计算因果效应,并借助LLM零样本生成公平性报告,优于直接LLM分析。

Comments 23 pages, 6 figures, 3 tables, LaTeX; added missing proof for Proposition 3, typos corrected, updated example 1 to have positive values for the Sankey

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14637 2026-06-08 cs.CV cs.AI cs.CL cs.HC 90%

Forest-Chat: Adapting Vision-Language Agents for Interactive Forest Change Analysis

Forest-Chat: 为交互式森林变化分析适应视觉-语言代理

James Brock, Ce Zhang, Nantheera Anantrasirichai

机构 * School of Computer Science, University of Bristol(布里斯托尔大学计算机科学学院) School of Geographical Sciences, University of Bristol(布里斯托尔大学地理科学学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);language agent(title);large language model(abstract);language model(abstract)

AI总结 本文提出Forest-Chat,一种基于LLM的森林变化分析代理,通过多任务处理实现自然语言查询,提升森林变化检测与语义解释的准确性与可解释性。

Comments 28 pages, 9 figures, 12 tables, Submitted to Ecological Informatics

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05563 2026-06-05 cs.AI cs.CL 90%

SoCRATES: Towards Reliable Automated Evaluation of Proactive LLM Mediation across Domains and Socio-cognitive Variations

SoCRATES:跨领域和社会认知变异的前瞻性LLM调解的可靠自动化评估

Taewon Yun, Hyeonseong Park, Jeonghwan Choi, Hayoon Park, Yeeun Choi, Hwanjun Song

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出SoCRATES基准,通过多领域真实冲突场景和五维社会认知适应轴评估LLM调解员,使用主题定位评估器实现0.82的人类专家一致性,发现最强模型仅缩小约三分之一的未调解共识差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05384 2026-06-05 cs.AI cs.CL 90%

Stability vs. Manipulability: Evaluating Robustness Under Post-Decision Interaction in LLM Judges

稳定性与可操纵性:评估LLM裁判在决策后交互下的鲁棒性

Srimonti Dutta, Akshata Kishore Moharir

机构 * WAI USA Research Labs(WAI美国研究实验室)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 研究LLM作为裁判在决策后交互中的可操纵性,发现虽然重复中性评估下高度稳定,但针对性挑战可显著逆转判决,并提出评估鲁棒性分数(ERS)量化交互鲁棒性。

Comments Accepted at ACL 2026 GEM (Generation, Evaluation and Metrics) Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02837 2026-06-03 cs.CL cs.AI 90%

Fixing FOLIO and MALLS: Verified Annotations and an LLM-assisted Framework to Focus Human Relabeling

修复FOLIO和MALLS:经过验证的标注和基于LLM的框架以聚焦人工重新标注

Andrea Brunello, Cristian Curaba, Luca Geatti, Michele Mignani, Angelo Montanari, Nicola Saccomanno

机构 * University of Udine(乌迪大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 通过人工检查发现FOLIO和MALLS数据集中存在大量形式化错误,提出基于LLM的框架引导人工审核,显著减少所需审核量并提高数据集准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24202 2026-06-02 cs.AI cs.LG 90%

When Does Multi-Agent RL Improve LLM Workflows? Workflow, Scale, and Policy-Sharing Tradeoffs

多智能体强化学习何时能改进LLM工作流?工作流、规模与策略共享的权衡

Yifan Zeng, Yiran Wu, Yaolun Zhang, Wentian Zhao, Kun Wan, Qingyun Wu, Huazheng Wang

机构 * Oregon State University(俄勒冈州立大学) Pennsylvania State University(宾夕法尼亚州立大学) Adobe Inc.(Adobe公司) AG2AI, Inc.(AG2AI公司)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 研究多智能体LLM工作流中端到端强化学习训练的效果,发现改进依赖于工作流、任务和规模,策略共享不提供统一稳定性而是重新分配失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17110 2026-06-02 cs.AI cs.LG 90%

Capturing LLM Capabilities via Evidence-Calibrated Query Clustering

通过证据校准的查询聚类捕捉LLM能力

Fangzhou Wu, Sandeep Silwal, Qiuyi Zhang

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Elorian AI

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出ECC算法,利用有限后验模型比较校准先验语义嵌入,通过Bradley-Terry模型参数化能力轮廓,联合学习灵活的能力感知聚类结构,显著提升LLM能力排序质量。

Comments 45 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30315 2026-05-29 cs.CL cs.LG 90%

Resolution Diagnostics for Paired LLM Evaluation

配对LLM评估的分辨率诊断

Anany Kotawala

机构 * Princeton University(普林斯顿大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 针对公开LLM排行榜中配对排名未达到常规配对检验分辨率目标的问题,提出基于假设检验的配对评估框架,并引入分辨率比q=N/N*作为主要诊断指标,揭示了常用非配对Cohen-h-plus-(1-rho)捷径在接近比较区域存在约两倍的偏差。

Comments 16 pages, 7 figures, 12 tables. Accepted to the ICML 2026 Workshop on Hypothesis Testing, Seoul, South Korea, 2026. Copyright 2026 by the author(s)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29963 2026-05-29 cs.CR cs.AI cs.LG 90%

Honeyval: A Comprehensive Evaluation Framework for LLM-powered HTTP Honeypots

Honeyval: 基于LLM的HTTP蜜罐综合评估框架

Mark Vero, Fabian Kaczmarczyck, Ivan Petrov, Ilia Shumailov, Jamie Hayes, Niels Heinen, Tianqi Fan, Luca Invernizzi, Martin Vechev

机构 * ETH Zurich(苏黎世联邦理工学院) Google(谷歌) Google DeepMind(谷歌DeepMind) AI Sequrity Company(AI安全公司) Independent(独立)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出Honeyval评估框架,通过16个后端应用、AI攻击代理、控制任务和可验证利用目标,系统评估LLM驱动的HTTP蜜罐,发现其相比规则基线能显著延长攻击交互、降低被前沿模型检测率,且保持成本优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26156 2026-05-29 cs.CR cs.AI cs.LG 90%

Turning Bias into Bugs: Bandit-Guided Style Manipulation Attacks on LLM Judges

将偏见转化为漏洞:基于Bandit引导的LLM裁判风格操纵攻击

Xianglin Yang, Bryan Hooi, Gelei Deng, Tianwei Zhang, Jin Song Dong

机构 * School of Computing, National University of Singapore, Singapore(新加坡国立大学计算机学院) Nanyang Technological University, Singapore(南洋理工大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出BITE黑盒对抗框架,将风格编辑选择建模为上下文Bandit问题,通过LinUCB策略自适应选择编辑以误导LLM裁判并人为提高评分,攻击成功率超65%。

Comments Accepted to the Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14584 2026-05-29 cs.LG cs.AI 90%

ReflexGrad: Within-Episode Failure Recovery in LLM Agents via Progress-Gated Dual-Process Routing

ReflexGrad: 基于进度门控双过程路由的LLM智能体片段内故障恢复

Ankush Kadu, Aswanth Krishnan

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出ReflexGrad双过程架构,通过进度门控路由在无演示条件下实现LLM智能体片段内故障恢复,显著提升任务成功率。

Comments 18 pages, 4 figures, 10 tables. Accepted at ICML 2026 FoGen Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27373 2026-05-28 cs.AI cs.CL cs.CY 90%

Identifying and Understanding Human Values in Text: A Tailorable LLM-based Architecture

识别和理解文本中的人类价值观:一种可定制的基于LLM的架构

Eduardo de la Cruz Fernández, Marcelo Karanik, Sascha Ossowski

机构 * Universidad Politécnica de Madrid(马德里理工大学) CETINIA, Universidad Rey Juan Carlos(CETINIA,雷伊·胡安·卡洛斯大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一种基于大型语言模型的可定制架构,通过三个模块(规范生成、文本标注、强度评估)检测文本中人类价值观的强度,避免依赖特定价值理论或复杂提示工程,实验表明具有良好检测性能。

Comments 8 pages, 1 figure. Published in Proceedings of the 18th International Conference on Agents and Artificial Intelligence (ICAART 2026), Volume 5

Journal ref Proc. ICAART 2026, Vol. 5, SciTePress, 2026, pp. 4096-4103

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18859 2026-05-25 cs.LG cs.AI 90%

TwinRouterBench: Fast Static and Live Dynamic Evaluation for Realistic Agentic LLM Routing

TwinRouterBench:面向现实智能体LLM路由的快速静态与实时动态评估

Pei Yang, Wanyi Chen, Tongyun Yang, Pengbin Feng, Jiarong Xing, Wentao Guo, Yuhang Yao, Yuhang Han, Hanchen Li, Xu Wang, Zeyu Wang, Jie Xiao, Anjie Yang, Liang Tian, Lynn Ai, Eric Yang, Tianyu Shi

机构 * Gradient Soochow University(苏州大学) Independent Researcher(独立研究者) University of Southern California(南加州大学) Rice University(Rice大学) Carnegie Mellon University(卡内基梅隆大学) Shanghai Jiao Tong University(上海交通大学) University of California, Berkeley(加州大学伯克利分校) University of the Chinese Academy of Sciences(中国科学院大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出TwinRouterBench基准,通过静态轨迹级前缀和动态智能体执行两轨,实现无需在线LLM评判的步骤级路由评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22608 2026-05-22 cs.CL cs.AI 90%

Agentic CLEAR: Automating Multi-Level Evaluation of LLM Agents

Agentic CLEAR: 自动化多层级评估LLM代理

Asaf Yehudai, Lilach Eden, Michal Shmueli-Scheuer

机构 * IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本研究提出Agentic CLEAR框架,通过多层级细粒度分析实现LLM代理的自动化评估,提供高质量的数据驱动反馈并预测任务成功率。

Comments ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27355 2026-05-22 cs.AI cs.CL cs.SE 90%

LLM Readiness Harness: Evaluation, Observability, and CI Gates for LLM/RAG Applications

LLM Readiness Harness: 评估、可观测性和持续集成门禁用于LLM/RAG应用

Alexandre Cristovão Maiorano

机构 * Lumytics

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文提出了一种LLM和RAG应用的准备性框架,通过自动化基准测试、OpenTelemetry可观测性和持续集成质量门禁,将评估转化为部署决策流程,并通过帕累托前沿计算场景加权的准备度分数,展示了在票务路由工作流和BEIR接地任务上的评估结果。

Comments 19 pages, 4 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18882 2026-05-20 cs.LG cs.AI 90%

To Call or Not to Call: Diagnosing Intrinsic Over-Calling Bias in LLM Agents

叫还是不叫:诊断LLM代理中的内在过度调用偏差

Wei Shi, Ziheng Peng, Sihang Li, Xiting Wang, Xiang Wang, Mengnan Du, Na Zou

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Renmin University of China(中国人民大学) The Chinese University of Hong Kong Shenzhen(香港中文大学(深圳)) University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文研究了LLM代理中过度调用现象,提出内在偏差假说,通过稀疏自编码器恢复行为对齐的特征基,减少到带符号激活边距,并估计偏移量,从而修正过度调用问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17000 2026-05-19 cs.LG cs.AI 90%

BoLT: A Benchmark to Democratize Black-box Optimization Research for Expensive LLM Tasks

BoLT:一个民主化黑盒优化研究的基准,用于昂贵的LLM任务

Ruth Wan Theng Chew, Zhiliang Chen, Apivich Hemachandra, Bryan Kian Hsiang Low

机构 * National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出BoLT基准,旨在通过提供真实LLM优化问题,促进黑盒优化方法在昂贵的大型语言模型任务中的研究和评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16207 2026-05-18 cs.AI cs.CL 90%

Confirming Correct, Missing the Rest: LLM Tutoring Agents Struggle Where Feedback Matters Most

确认正确,遗漏其余:LLM辅导代理在反馈最关键的地方表现不佳

Tahreem Yasir, Wenbo Li, Sam Gilson, Sutapa Dey Tithi, Xiaoyi Tian, Tiffany Barnes

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文研究了LLM在逻辑推理中的辅导性能,发现其在区分最优解、次优解和错误解方面存在系统性偏差,影响适应性教学效果。

Comments 22 pages, 20 fgures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16143 2026-05-18 cs.AI cs.CL 90%

Look Before You Leap: Autonomous Exploration for LLM Agents

先看再跳:面向LLM代理的自主探索

Ziang Ye, Wentao Shi, Yuxin Liu, Yu Wang, Zhengzhou Cai, Yaorui Shi, Qi Gu, Xunliang Cai, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) Meituan(美团)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出自主探索能力,通过探索检查点覆盖率指标,改进LLM代理在陌生环境中的适应性,采用探索与执行交替训练策略,提升任务执行的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17915 2026-05-18 cs.CL cs.AI 90%

IndicSafe: A Benchmark for Evaluating Multilingual LLM Safety in South Asia

IndicSafe:评估南亚多语言大语言模型安全性的基准

Priyaranjan Pattnayak, Sanchari Chowdhuri

机构 * Oracle America Inc.(Oracle美洲公司)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出IndicSafe基准,评估12种南亚语言中LLM的安全性,发现跨语言一致性仅12.8%,安全率波动超17%,揭示多语言LLM安全泛化缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15384 2026-05-18 cs.LG cs.AI 90%

Is One Score Enough? Rethinking the Evaluation of Sequentially Evolving LLM Memory

一个评分够吗?重新思考序列演进LLM记忆的评估

Songwei Dong, Zihan Chen, Chengshuai Shi, Peng Wang, Jundong Li, Cong Shen

机构 * University of Virginia(弗吉尼亚大学) Princeton University(普林斯顿大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SeqMem-Eval框架,通过评估记忆状态的演变、泛化、经验巩固和信息保留,揭示传统指标无法捕捉的记忆质量差异。

Comments 29 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19923 2026-05-18 cs.CL cs.AI 90%

Structure-BiEval: A Self-Supervised, Dual-Track Framework for Decoupling Structure and Content in LLM Evaluation for Web Information Systems

Structure-BiEval: 一种自监督、双轨框架,用于解耦Web信息系统中LLM评估的结构与内容

Boxiang Zhao, Qince Li, Zhonghao Wang, Zelin Cao, Yi Wang, Peng Cheng, Bo Lin

机构 * Tele-Communication Technology Bureau, Xinhua News Agency(新华通讯社电信技术局)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Structure-BiEval框架,通过确定性中间表示解耦结构与内容,利用内容语义准确性和归一化树编辑距离评估Web数据工程中的LLM结构 fidelity,发现不同模型在Web数据格式化中表现差异显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14744 2026-05-15 cs.CL cs.AI cs.CY 90%

Mechanical Enforcement for LLM Governance:Evidence of Governance-Task Decoupling in Financial Decision Systems

针对LLM治理的机械执行:在金融决策系统中治理-任务解耦的证据

José Manuel de la Chica Rodríguez, Carlos Martí-González

机构 * Santander AI Lab(Santander AI实验室)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出五种治理指标,用于评估政策在决策理由层面的合规性,并在合成银行领域比较纯文本治理与机械执行的效果,发现机械执行能显著提升决策信息内容和任务准确性,表明治理与任务评估是两个独立的维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14543 2026-05-15 cs.LG cs.AI 90%

RxEval: A Prescription-Level Benchmark for Evaluating LLM Medication Recommendation

RxEval: 一个处方级基准,用于评估LLM药物推荐

Shuhao Chen, Weisen Jiang, Changmiao Wang, Xiaoqing Wu, Xuanren Shi, Yu Zhang, James T. Kwok

机构 * The Hong Kong University of Science and Technology(香港科技大学) Southern University of Science and Technology(南方科技大学) The Chinese University of Hong Kong(香港中文大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学深圳校区) Shenzhen University General Hospital(深圳大学人民医院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 RxEval通过多选题评估LLM处方能力,包含1547个问题,涵盖584名患者、18种诊断类别和969种药物,测试16个LLM显示其挑战性和区分性,F1值从45.18到77.10,最佳精确匹配仅46.10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10805 2026-05-12 cs.AI cs.CL stat.ML 90%

Reasoning Is Not Free: Robust Adaptive Cost-Efficient Routing for LLM-as-a-Judge

推理并非免费:面向LLM-as-a-Judge的鲁棒自适应成本高效路由

Wenbo Zhang, Lijinghua Zhang, Liner Xiang, Hengrui Cai

机构 * Department of Statistics, University of California, Irvine, USA(加州大学伊维特分校统计学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过对比推理与非推理法官,发现推理在结构验证任务中提升准确性,但成本高。提出RACER方法,通过分布鲁棒优化动态选择推理或非推理法官,实现成本效率的最优平衡。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21362 2026-05-12 cs.AI cs.CL 90%

AdaRubric: Task-Adaptive Rubrics for Reliable LLM Agent Evaluation and Reward Learning

AdaRubric:面向可靠LLM代理评估和奖励学习的任务自适应评分标准

Liang Ding

机构 * The University of Sydney(悉尼大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 AdaRubric通过自适应生成任务特定评分标准,结合置信度加权评分和密集奖励信号,提升LLM代理评估的准确性与可靠性,实验表明其在多个基准测试中表现优异。

Comments KnowFM @ ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08448 2026-05-12 cs.AI cs.CL 90%

LLM-guided Semi-Supervised Approaches for Social Media Crisis Data Classification

基于大语言模型的半监督方法用于社交媒体危机数据分类

Jacob Ativo, Bharaneeshwar Balasubramaniyam, Anh Tran, Khushboo Gupta, Hongmin Li, Doina Caragea, Cornelia Caragea

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大语言模型引导的半监督学习在社交媒体危机数据分类中的应用,比较了VerifyMatch和LLM引导的协同训练方法,发现LLM引导的协同训练在低资源环境下表现优异,同时验证了知识迁移的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06047 2026-05-12 cs.AI cs.CL 90%

DSGBench: A Diverse Strategic Game Benchmark for Evaluating LLM-based Agents in Complex Decision-Making Environments

DSGBench:一种多样化的战略游戏基准,用于评估基于大语言模型的代理在复杂决策环境中的能力

Wenjie Tang, Yuan Zhou, Erqiang Xu, Keyan Cheng, Minne Li, Liquan Xiao

机构 * College of Computer, National University of Defense Technology(国防科技大学计算机学院) Intelligent Game and Decision Lab (IGDL)(智能博弈与决策实验室)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DSGBench通过六个复杂战略游戏评估LLM代理在复杂决策环境中的能力,采用细粒度评分系统和自动决策追踪机制,揭示不同LLM模型的优劣与系统限制。

Comments 43 pages, 5 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏