arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11785 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2848 篇

2607.20436 2026-07-24 cs.CL cs.AI cs.SE 新提交 76%

Routing Subspaces: Auditing Evaluation-to-Deployment Mismatch in Fine-Tuned Language Models

路由子空间:审计微调语言模型中评估到部署的不匹配

Phongsakon Mark Konrad, Toygar Tanyel, Serkan Ayvaz

机构 * Centre for Industrial Software, University of Southern Denmark(南丹麦大学工业软件中心) ProMake(宝迈可)

专题命中 评测与基准 :language model(title);分类 cs.CL、cs.AI

AI总结 研究微调语言模型评估到部署的不匹配问题,提出在路径修补告知的中深度窗口拟合配对激活对比并修改结果坐标的方法,在多个模型实例中缩小了差距,还指出单坐标审计的局限性,此审计用于诊断微调检查点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16122 2026-07-20 cs.AI cs.LG 新提交 76%

CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data

CRAFT:聚类评分标准以诊断大型语言模型的能力短板并生成针对性的微调数据

Vipul Gupta, Zihao Wang, Razvan-Gabriel Dumitru, MohammadHossein Rezaei, Aakash Sabharwal, Yunzhong He

机构 * Scale AI(Scale人工智能公司)

专题命中 评测与基准 :LLM(title);分类 cs.AI、cs.LG

AI总结 研究针对评估应指导模型改进及提供训练数据的问题,提出CRAFT方法,将评分标准评估数据集转化为模型能力短板诊断,通过聚类能力描述、评估模型节点等生成微调数据,实验表明该方法能更精准诊断模型弱点并提升性能。

Comments 18 pages, 3 Tables, 2 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26437 2026-06-26 cs.CL cs.AI 新提交 76%

ConflictScore: Identifying and Measuring How Language Models Handle Conflicting Evidence

ConflictScore: 识别和衡量语言模型如何处理冲突证据

Siyi Liu, Aaron Halfaker, Dan Roth, Patrick Xia

专题命中 评测与基准 :language model(title);分类 cs.CL、cs.AI

AI总结 提出ConflictScore指标,通过将回答分解为原子声明并与证据文档对比,量化模型对冲突证据的识别程度,实验表明该指标能有效检测过度自信声明并提升真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14820 2026-06-16 cs.SD cs.AI cs.CL eess.AS 新提交 76%

Spectro-Temporal Interference Confounds Phase Encoding in Spatial Audio Foundation Models

频谱-时间干扰混淆空间音频基础模型中的相位编码

Yuxuan Chen, Haoyuan Yu, Peize He

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Jilin University(吉林大学) Hunan University(湖南大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 评测与基准 :foundation model(title);分类 cs.CL、cs.AI

AI总结 提出基于双耳掩蔽级差的心理声学基准,评估空间自监督音频模型对微秒级耳间相位精细结构的编码能力,发现通用双耳SSL模型依赖频谱-时间干扰纹理而非真实相位计算。

Comments Accepted to INTERSPEECH 2026; 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16643 2026-08-18 cs.CL cs.AI cs.LG 新提交 75%

Toward Better Assessment of LLMs' Performance in Clinical Error Detection

面向更好评估大型语言模型(LLMs)在临床错误检测中的性能

Yifan Zhang, Rahmatollah Beheshti

机构 * University of Delaware(特拉华大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对LLMs临床错误检测评估的不足,通过多语言多模型实验发现多数LLMs配对判别能力差,提出用配对评估补充聚合指标的改进方案。

Comments Accepted at Machine Learning for Healthcare (MLHC) 2026; to appear in Proceedings of Machine Learning Research (PMLR), Vol. 340

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15073 2026-08-18 cs.CE 新提交 75%

BOCoDe: Engineering-Centered Benchmarking for Bayesian Optimization

BOCoDe:面向工程设计的贝叶斯优化基准测试

Rosen Ting-Ying Yu, Christophe Hatterer, Advaith Narayanan, Cyril Picard, Faez Ahmed

专题命中 评测与基准 :LLM(abstract,abstract_cn);foundation model(abstract)

AI总结 该研究针对贝叶斯优化的基准测试与工程设计场景不匹配的问题,推出开源BOCoDe基准集,含307个黑盒优化问题,评估31种算法,发现标准基准排名无法迁移至工程任务,为BO方法开发提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14808 2026-08-18 cs.AI cs.CL cs.LG 新提交 75%

Do LLMs Know What to Ask and When? Evaluating Multi-Turn Information Seeking

大型语言模型(LLMs)知道该问什么以及何时提问吗?评估多轮信息获取能力

Yepeng Huang, Jiawen Zhang, Michelle Dai, Xiaorui Su, Shanghua Gao, Zi Wang, Marinka Zitnik

机构 * Harvard University(哈佛大学) Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究构建MT-InfoSeek评估套件,从提问内容、时机及信息影响三方面评估LLMs的多轮信息获取能力,发现其存在低估信息需求等缺陷,且该能力未被现有评估覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14089 2026-08-17 cs.AI cs.CL cs.CR cs.LG 新提交 75%

Regime-Conditional Verification: Correctness Estimation for Adapting and Monitoring Safety Classifiers

条件 regime 验证:安全分类器适配与监控的正确性估计

Thiago Sandoval, Ufuk Topcu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出 Regime-Conditional Verification(RCV),通过轻量级封装器适配安全分类器,在不重新训练的情况下提升策略遵守度,可检测分布偏移并仅在必要时微调,在多分类器、数据集及部署场景中表现优异。

Comments 16 pages including technical appendix, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12654 2026-08-14 cs.AI cs.CL cs.LG 新提交 75%

SteerBench-Work: A Benchmark for Agent Steering at Action Boundaries

SteerBench-Work:动作边界处智能体决策的基准测试

Oguz Serdar, Cuneyt Mertayak

机构 * AgentDock

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究推出职场智能体动作边界决策基准SteerBench-Work,发现模型在该任务中存在过度拒绝的显著偏差,且通用能力与引导校准并不等同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11669 2026-08-13 cs.LG cs.AI cs.CL 新提交 75%

Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL

规则丢弃(Rubric Dropout):缓解以规则为奖励的强化学习中奖励黑客行为的简单方法

Minglai Yang, Xinyu Guo, Utkarsh Tyagi, Mian Zhang, Razvan Dumitru, Sunjie Hou, Yunzhong He, Daniel Yue Zhang, Ying Liu

机构 * Scale AI University of Arizona(亚利桑那大学) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对以规则为奖励的强化学习中的奖励黑客行为,提出Rubric Dropout方法,在医学和科学规则上训练Qwen3-8B,可提升分布外基准的黄金评判分数、降低黑客指标,30-50%丢弃比例效果最优。

Comments 18 pages, 7 figures, 4 tables. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11219 2026-08-13 cs.AI cs.CL cs.LG 新提交 75%

From Monolithic to Modular: Segment-level Automatic Prompt Optimization

从整体到模块:片段级自动提示优化

Nikita Kulin, Viktor Zhuravlev, Artur Khairullin, Sergey Muravyov, Ilya Makarov, Daniil Sukhorukov, Ekaterina Averkova

机构 * ITMO University(伊蒂莫大学) HSE(高等经济大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对自动提示优化易顾此失彼的问题,提出片段级APO方法SAPO,将提示拆分后针对性优化,在多数据集和模型上取得优于基线的平均得分。

Comments Accepted at the IJCAI-ECAI 2026 Workshop on Robustifying Generative AI for Reliable, Safe, and Human-Centric Systems (RobustifAI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11074 2026-08-12 cs.CV 新提交 75%

CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering

CapProbe:通过全场景密集问答评估详细图像描述

Mouxiao Huang, Qiangyu Yan, Borui Jiang, Han Shu

机构 * Huawei Technologies(华为技术有限公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 CapProbe是用于评估VLMs生成的详细图像描述的全场景密集问答基准,通过区域对齐的事实核查,揭示了13个VLMs的覆盖差距、能力-效率权衡及遗漏的失败模式,相关资源将很快发布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07411 2026-08-10 cs.AI cs.CL cs.IR cs.LG 新提交 75%

GeoBenchLLM: A Comprehensive Benchmark for Evaluating LLMs on Geo-Related Tasks

GeoBenchLLM:评估大语言模型地理相关任务的综合基准

Rodrigo Ferreira Rodrigues, Karim Radouane, Jose G Moreno, Lynda Tamine

机构 * University of Toulouse(图卢兹大学) IRIT(信息与电信科学研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出GeoBenchLLM综合基准,选取12个地理相关公开数据集评估LLMs的地理空间与时间理解能力,发现推理能力与模型规模对性能影响显著,基准可公开获取。

Comments Accepted at CIKM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06362 2026-08-07 cs.GT cs.AI cs.CL cs.LG cs.MA 新提交 75%

AV-AIVAT: 74x Cheaper Agent Evaluation with Certified Anytime-Valid Stopping in Imperfect-Information Games

AV-AIVAT:在非完全信息博弈中具备可验证的任意时间有效停止机制,成本降低74倍的智能体评估方法

Boning Li, Yu Chen, Longbo Huang

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 AV-AIVAT将AIVAT与置信序列结合,在非完全信息博弈中实现任意时间有效停止,成本降低74倍,可高效评估智能体并向第三方提供可审计的验证依据。

Comments 34 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03047 2026-08-05 cs.CV cs.MM 新提交 75%

AIDE: Automated Instruction via Distilled Expertise for Reference-Free Motor Skill Coaching

AIDE:基于提炼专业知识的自动化指令,用于无参考的运动技能指导

Yoshiki Ito

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 研究针对运动技能指导中专业教练稀缺的问题,提出AIDE框架,仅训练阶段用专业参考、推理阶段仅用学习者姿态生成反馈,在ExpertAF数据集上性能优于无参考基线,与需双阶段专业演示的方法相当。

Comments Accepted to ACM Multimedia 2026. 12 pages (including supplementary material), 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00785 2026-08-04 cs.MA 新提交 75%

HIERA: Hierarchical Multi-Agent Relevance Assessment for Content Discovery Systems

HIERA:面向内容发现系统的分层多智能体相关性评估框架

Pritom Saha Akash, Phanideep Gampa, Chao Shen, Ying Chen, Sheikh Muhammad Sarwar

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 该研究针对内容发现系统人工标注的问题,提出分层多智能体相关性评估框架HIERA,通过四个专用智能体的分层协调,在五个数据集上较11个基线方法取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00371 2026-08-04 cs.CV 新提交 75%

Decoding Children's Gait Behavior

儿童步态行为解码

Yifan Shen, Boyi Li, Meihuan Huang, Yuanzhe Liu, Xu Cao, Jinyang Jin, Zhengyuan Li, Anglin Liu, Junho Kim, Jingyuan Zhu, Lan Fangzhou, Jianguo Cao, Jintai Chen, Ismini Lourentzou, James Matthew Rehg

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) PediaMed AI Shenzhen Children’s Hospital(深圳市儿童医院) Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 针对儿童步态分析的临床需求,本文构建含110名受试者的1100余条高帧率视频数据集,指出现有先进模型难以解析其临床细节,提出统一端到端框架并建立自动化儿童步态评估基线。

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28039 2026-07-31 cs.CV 新提交 75%

TongueReenact: Geometry-Anchored Tongue Synthesis for Face Reenactment

TongueReenact:几何锚定的人脸重演舌部合成

MD Wahiduzzaman Khan, Mingshan Jia, Xiaolin Zhang, En Yu, Kaska Musial-Gabrys

机构 * University of Technology Sydney(悉尼科技大学) Shandong University of Science and Technology(山东科技大学)

专题命中 评测与基准 :foundation model(summary_cn,abstract_cn)

AI总结 本文提出首个跨身份舌部动态迁移框架,结合 foundation model 辅助的自举流水线与空间约束潜在掩码扩散模型,在舌部指标上较基线提升超两倍,且 VLM 评估证实其感知优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27232 2026-07-31 cs.CL cs.AI cs.CY cs.LG 新提交 75%

Sympathetic Framing: Evaluating AI Alignment across Sociodemographic Groups

共情框架:跨社会人口统计群体评估AI对齐

Haran Shani-Narkiss, Michael Fire, Oren Tsur

机构 * University College London(伦敦大学学院) Ben Gurion University of the Negev(内盖夫本古里安大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究评估7款LLMs对新闻标题情感框架的理解与人类的对齐度,发现不同模型相关性差异大,领先模型总体对齐但存在人口统计组差异,凸显AI对齐的非普遍性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26024 2026-07-29 cs.HC cs.SD eess.AS 新提交 75%

LLM4OSC: Profile-Bound Natural Language Control with Deterministic Validation for Open Sound Control

LLM4OSC:用于开放声音控制的具有确定性验证的配置文件约束自然语言控制

Yuan-Yi Fan

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究针对开放声音控制中语言模型的问题,提出LLM4OSC本地优先架构,通过人工审核配置文件等方式进行验证等操作,在特定配置文件测试中后端表现良好,主张将提议-验证-发送和错误发送率作为关键指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22118 2026-07-27 cs.HC 新提交 75%

An AI-Driven Virtual Patient for Breaking Bad News: An Expert Formative Study on Facial Expression Intensity

用于传达坏消息的人工智能驱动虚拟患者:面部表情强度的专家形成性研究

Steffen Hauck, Theresa Schell, Sophie Jörg, Jens Grubert

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究探讨大语言模型驱动的虚拟患者情感表达设计难题,提出结合大语言模型对话与实时面部动画的框架,通过对七位医学专家评估,发现专家通过多渠道评估情感真实感,为未来医学培训模拟器提出需同步多模态管道的路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21652 2026-07-27 cs.SE 新提交 75%

Vibe Coding in Software Development: A Multivocal Literature Review

软件开发中的氛围编码:多视角文献综述

Shahbaz Siddeeq, Muhammad Waseem, Kai-Kristian Kemell, Mika Saari, Jussi Rasku, Pekka Abrahamsson

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 该研究对2022年至2025年10月的文献进行多视角综述,探讨软件开发中氛围编码实践。通过分析47篇文献发现其是迭代流程,开发者工作转变,短期生产力有提升,不同应用场景证据强弱有别,此为整合两类文献的首次综述并提出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20087 2026-07-23 cs.CV 新提交 75%

Development of an automated, reliable, and clinically meaningful artificial intelligence (AI) tool for diagnosing cardiac disease from conventional cardiovascular magnetic resonance (CMR) images

开发一种用于从传统心血管磁共振(CMR)图像中诊断心脏病的自动化、可靠且具有临床意义的人工智能(AI)工具

Sina Amirrajab, Volker Vehof, Michael Bietenbeck, Nuriye Akyol, Redouane Bouras, Khuraman Isgandarova, Alexandru Zlibut, Philipp Stalling, Ali Yilmaz

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 研究旨在开发用于CMR图像心脏病诊断的AI工具,通过整合开源LLMs和预处理多模态数据,对三种视觉基础模型两阶段微调,在独立测试集上有高诊断性能,集成策略进一步提升准确性和鲁棒性,代码和模型权重公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17353 2026-07-21 cs.CR 新提交 75%

Measuring and Evaluating the Performance of Generative AI Models for Scam Detection

测量和评估用于诈骗检测的生成式人工智能模型的性能

Cem Topcuoglu, Seyed Ali Akhavani, Harel Berger, Sadia Afroz, Michalis Pachilakis, Vibhor Sehgal, Leyla Bilge, Engin Kirda

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究大语言模型在无特定任务微调下检测诈骗的能力,通过策划发布独特基准数据集,评估九个不同模型,发现较大模型性能优,有效提示可提升小模型性能,且LLMs泛化能力强,还发布了数据集和评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16203 2026-07-21 cs.LG cs.AI cs.CL 新提交 75%

DocOCR-Eval: A Correction-Based Framework for OCR Tool Selection Without Ground Truth

DocOCR-Eval:一种无需真实标签的基于校正的OCR工具选择框架

Zihan Xu, Puzhen Wu, Lawrence Chun Man Lau, Wei Liu, Sirui Li, Yifan Peng, Yihao Ding

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对文档解析中OCR工具选择难题,尤其是标签稀缺情况,提出无标注评估框架DocOCR-Eval。它采用三阶段校正和排序策略,通过跨多个MLLM聚合改善与基于标注排名的对齐,能在现实有限标签设置中实现可靠OCR工具选择并提供实用指导。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13987 2026-07-16 cs.CR 新提交 75%

Agent Skill Security: Threat Models, Attacks, Defenses, and Evaluation

智能体技能安全:威胁模型、攻击、防御与评估

Sanket Badhe, Priyanka Tiwari

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究智能体可复用技能安全,提出SkillSec-Eval框架,刻画技能生命周期并开发威胁分类法,通过对327个真实技能实证评估,发现多阶段有漏洞,强调需进行生命周期感知安全分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13035 2026-07-16 cs.CL cs.AI cs.LG cs.SE 新提交 75%

FixItFlow: Automated Troubleshooting Guide Generation from Cloud Incidents

FixItFlow:从云事件中自动生成故障排除指南

Srihari Unnikrishnan, Jaskaran Singh Walia, Drishti Goel, Supriyo Ghosh

机构 * Microsoft Research(微软研究院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Inception

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对云事件手动创建故障排除指南的问题,提出FixItFlow系统,利用大语言模型从历史事件数据生成指南,能提取诊断模式、合成结构化指南并严格验证,经评估可提升事件响应,减轻团队文档负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12290 2026-07-15 eess.AS cs.AI cs.CL cs.LG cs.SD 新提交 75%

The Sound of Absence: Audio-Language Embedding Models Struggle with Negation

缺失之音:音频-语言嵌入模型在处理否定时存在困难

Chun-Yi Kuan, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taiwan(国家台湾大学通讯工程研究所) Artificial Intelligence Center of Research Excellence (AI-CoRE), National Taiwan University, Taiwan(国家台湾大学人工智能卓越研究中心)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究音频-语言嵌入模型在处理否定时的问题,引入NegEval-Audio框架将数据集转换为否定感知任务,发现模型在否定情况下性能大幅下降,肯定偏差是缺陷,需明确否定感知训练目标。

Comments Manuscript in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11354 2026-07-14 cs.IR 新提交 75%

User Preference Induction with LLMs for Offline Top-N Recommendation Evaluation

基于大语言模型的用户偏好归纳用于离线 Top-N 推荐评估

David Otero, Javier Parapar

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究针对离线 Top-N 推荐评估依赖不完整相关性信息的问题,提出基于大语言模型的框架,通过归纳用户偏好及判断候选项目相关性来扩展判断,提升评估稳健性并减轻流行度敏感失真。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10738 2026-07-14 cs.LG cs.AI cs.CL 新提交 75%

To Answer or to Abstain: Mitigating Search-Agent Hallucinations via Abstention-Aware Reinforcement Learning

回答还是弃权:通过弃权感知强化学习减轻搜索代理幻觉

Fengji Zhang, Tianyu Fan, Yuxiang Zheng, Xinyao Niu, Chengen Huang, Jacky Keung, Bei Chen

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对大语言模型训练范式易加剧搜索代理幻觉的问题,提出弃权感知强化学习(AWA-RL),利用模型能力动态塑造弃权奖励,并引入RA-F1指标,实验表明该方法有效提升了搜索代理的性能和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏