arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-21 至 2026-01-21 共收录 543 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 145 篇

2601.13649 2026-01-21 cs.CL cs.AI 86%

Fairness or Fluency? An Investigation into Language Bias of Pairwise LLM-as-a-Judge

公平性还是流畅性?对配对LLM-as-a-judge语言偏见的调查

Xiaolin Zhou, Zheng Luo, Yicheng Gao, Qixuan Chen, Xiyang Hu, Yue Zhao, Ruishan Liu

机构 * University of Southern California(南加州大学) Arizona State University(亚利桑那州立大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLM-as-a-judge在配对任务中的语言偏见,发现不同语言在性能和偏好上有显著差异,且语言偏见不能仅由困惑度解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13537 2026-01-21 cs.CL cs.AI 86%

When Wording Steers the Evaluation: Framing Bias in LLM judges

当用词引导评估:在LLM评估中框架偏见的影响

Yerin Hwang, Dongryeol Lee, Taegwan Kang, Minwoo Lee, Kyomin Jung

机构 * IPAI, Seoul National University(IPAI,首尔国立大学) Dept. of ECE, Seoul National University(电子工程系,首尔国立大学) LG AI Research(LG人工智能研究) SNU-LG AI Research Center(SNU-LG人工智能研究中心)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示了LLM评估中框架偏见的影响,通过设计对称提示展示框架如何扭曲模型判断,强调需建立框架意识的评估协议。

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01553 2026-01-21 cs.AI cs.CL 86%

MedQA-CS: Objective Structured Clinical Examination (OSCE)-Style Benchmark for Evaluating LLM Clinical Skills

MedQA-CS: 用于评估大语言模型临床技能的Objective Structured Clinical Examination (OSCE)风格基准

Zonghai Yao, Zihao Zhang, Chaolong Tang, Xingyu Bian, Youxia Zhao, Zhichao Yang, Junda Wang, Huixue Zhou, Won Seok Jang, Feiyun Ouyang, Hong Yu

机构 * University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校) Emory University(埃默里大学) University of Minnesota(明尼苏达大学) University of Massachusetts, Lowell(马萨诸塞大学洛厄尔分校) UMass Chan Medical School(UMass Chan医学学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MedQA-CS是一种基于OSCE风格的基准,用于评估大语言模型的临床技能,通过模拟医学学生和评估者任务,提供更全面的评估方法。

Comments To appear in proceedings of the Main Conference of the European Chapter of the Association for Computational Linguistics (EACL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11920 2026-01-21 cs.CL cs.AI 86%

Enhancing LLM-Based Data Annotation with Error Decomposition

通过错误分解增强基于LLM的数据标注

Zhen Xu, Vedant Khatri, Yijun Dai, Xiner Liu, Siyan Li, Xuanming Zhang, Renzhe Yu

机构 * Columbia University(哥伦比亚大学) University of California, Irvine(加州大学尔湾分校) University of Pennsylvania(宾夕法尼亚大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过错误分解增强基于LLM的数据标注,提出诊断评估范式以区分任务固有模糊性与模型不准确,提升标注质量评估的准确性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11903 2026-01-21 cs.AI 86%

AEMA: Verifiable Evaluation Framework for Trustworthy and Controlled Agentic LLM Systems

AEMA:可验证评估框架用于可信和受控的代理LLM系统

YenTing Lee, Keerthi Koneru, Zahra Moslemi, Sheethal Kumar, Ramesh Radhakrishnan

机构 * University of California, San Diego(加州大学圣地亚哥分校) Center for Advanced AI, Accenture(Accenture高级人工智能中心) University of California, Irvine(加州大学伊拉斯姆斯分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AEMA提出了一种可验证的评估框架,用于评估基于LLM的多代理系统,通过人类监督实现稳定、可追溯的自动化评估。

Comments Workshop on W51: How Can We Trust and Control Agentic AI? Toward Alignment, Robustness, and Verifiability in Autonomous LLM Agents at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13658 2026-01-21 cs.CL 85%

Beyond Known Facts: Generating Unseen Temporal Knowledge to Address Data Contamination in LLM Evaluation

超越已知事实:生成未见的时间知识以应对LLM评估中的数据污染

Arthur Amalvy, Hen-Hsen Huang

机构 * Institute of Information Science, Academia Sinica(中国科学院信息研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出通过生成未来未见的时间事实来构建无污染的评估数据集,以提升LLM在时间知识图谱提取任务中的评估准确性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13655 2026-01-21 cs.SE cs.AI cs.DC 85%

Why Does the LLM Stop Computing: An Empirical Study of User-Reported Failures in Open-Source LLMs

为何大语言模型停止计算:对开源大语言模型用户报告失败的实证研究

Guangba Yu, Zirui Wang, Yujie Huang, Renyi Zhong, Yuedong Zhong, Yilun Wang, Michael R. Lyu

机构 * The Chinese University of HongKong(香港中文大学) Sun Yat-sen University(中山大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究通过分析开源LLM的705个失败案例,揭示了部署堆栈的系统脆弱性,并提出提升LLM可靠性的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13581 2026-01-21 cs.AI 85%

SCRIPTMIND: Crime Script Inference and Cognitive Evaluation for LLM-based Social Engineering Scam Detection System

SCRIPTMIND:基于LLM的社会工程诈骗检测系统的犯罪脚本推断与认知评估

Heedou Kim, Changsik Kim, Sanghwa Shin, Jaewoo Kang

机构 * Korea University(韩国大学) Korean National Police Agency(韩国国家警察局) Inje University(仁荷大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ScriptMind通过结合自动化推理与人类认知,提升LLM在社会工程诈骗检测中的准确性与用户认知意识

Comments This paper has been accepted to the EACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07902 2026-01-21 cs.CL 85%

Tailored Emotional LLM-Supporter: Enhancing Cultural Sensitivity

定制情感LLM支持者:增强文化敏感性

Chen Cecilia Liu, Hiba Arnaout, Nils Kovačić, Dana Atzil-Slonim, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab) Department of Computer Science and Hessian Center for AI (hessian.AI) Technische Universität Darmstadt(通用知识处理实验室(UKP实验室)计算机科学系和海斯曼人工智能中心(hessian.AI)德意志联邦人家电大学) Department of Psychology, Bar-Ilan University(心理学系,巴伊兰大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CultureCare数据集,通过四种适应策略提升LLMs的文化敏感性,并展示其在临床培训中的应用潜力。

Comments Joint first authors; EACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23473 2026-01-21 cs.AI 85%

EVOREFUSE: Evolutionary Prompt Optimization for Evaluation and Mitigation of LLM Over-Refusal to Pseudo-Malicious Instructions

EVOREFUSE: 进化提示优化用于评估和缓解大语言模型对伪恶意指令的过度拒绝

Xiaorui Wu, Fei Li, Xiaofeng Mao, Xin Zhang, Li Zheng, Yuxiang Peng, Chong Teng, Donghong Ji, Zhuang Li

机构 * Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University(航天信息安全部门、教育部、武汉大学计算机科学与工程学院) Ant Group(蚂蚁集团) Ant International(蚂蚁国际) School of Computing Technologies, Royal Melbourne Institute of Technology(皇家墨尔本理工学院计算机技术学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 EVOREFUSE通过进化算法生成多样化伪恶意指令,提升LLM对恶意指令的拒绝触发率并减少过度拒绝

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12951 2026-01-21 cs.SE cs.AI 85%

Beyond Accuracy: Characterizing Code Comprehension Capabilities in (Large) Language Models

超越准确性:在(大)语言模型中表征代码理解能力

Felix Mächtle, Jan-Niclas Serr, Nils Loose, Thomas Eisenbarth

机构 * ITS, University of Luebeck(ITS,吕贝克大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI

AI总结 本文研究了大语言模型在代码理解能力上的表现,发现其与传统人类度量标准相关性低,而影子模型能捕捉更复杂的模式,强调需改进基准方法以更准确评估模型能力。

Comments Published in the Proceedings of DeepTest 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12744 2026-01-21 cs.AI cs.NI cs.SE 85%

Vision Language Models for Optimization-Driven Intent Processing in Autonomous Networks

面向自主网络的基于视觉语言模型的优化驱动意图处理

Tasnim Ahmed, Yifan Zhu, Salimur Choudhury

机构 * School of Computing, Queen's University, Ontario, Canada(计算学院,女王大学,安大略,加拿大)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出IntentOpt基准测试,评估不同视觉语言模型在生成网络优化代码中的性能,发现视觉参数提取和程序化思维提示显著降低执行成功率,开源模型表现低于闭源模型。

Comments Accepted for presentation at The IEEE International Conference on Communications (ICC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16272 2026-01-21 cs.SE cs.AI 85%

Beyond Blind Spots: Analytic Hints for Mitigating LLM-Based Evaluation Pitfalls

超越盲区:用于缓解基于LLM评估缺陷的分析提示

Ora Nova Fandina, Eitan Farchi, Shmulik Froimovich, Raviv Gal, Wesam Ibraheem, Rami Katan, Alice Podolsky

机构 * Ora Nova Fandina(奥拉诺瓦·法丁纳) Eitan Farchi(埃itan·法奇) Shmulik Froimovich(什mulik·弗罗伊米奇) Raviv Gal(拉维夫·加尔) Wesam Ibraheem(韦萨姆·伊布拉希姆) Rami Katan(拉米·卡坦) Alice Podolsky(艾丽斯·波德洛斯基)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种分析提示方法,通过结合LLM和分析检查器,提高代码评估的可靠性,减少LLM的盲区。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11783 2026-01-21 cs.SE cs.CL 85%

The Stability Trap: Evaluating the Reliability of LLM-Based Instruction Adherence Auditing

稳定性陷阱:评估基于大语言模型的指令遵循审计的可靠性

Murtuza N. Shergadwala

机构 * Workday Inc.(Workday公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过引入有界指令分解框架,揭示了基于大语言模型的指令遵循审计中判决稳定性与推理稳定性之间的矛盾,提出需严格限定自动化评估协议以提升可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11643 2026-01-21 cs.CY cs.AI 85%

Syllabic Agglutinative Tokenizations for Indonesian LLM: A Study from Gasing Literacy Learning System

基于音节粘合的印尼语LLM分词方法:来自Gasing识字学习系统的研究

H. Situngkir, A. B. Lumbantobing, Y. Surya

机构 * Bandung Fe Institute(巴杜安费学院) Fe Institute & AI Research Center IT Del(费学院及IT德尔人工智能研究中心) AI Research Center IT Del(IT德尔人工智能研究中心)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于音节的印尼语分词方法,结合教学与计算优化,提升分词效率与语言模型性能。

Comments 12 pages, 1 figures

Journal ref BFI Working Paper Series 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05080 2026-01-21 cs.CL 85%

An Architectural Advantage of The Instruction-Tuned LLM in Containing The Readability-Accuracy Tension in Text Simplification

指令调优LLM在文本简化中缓解可读性-准确性张力的优势

P. Bilha Githinji, Aikaterini Meilliou, Zeming Liang, Lian Zhang, Peiwu Qin

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过比较指令调优和推理增强的LLM,发现指令调优在文本简化中能更有效平衡可读性与准确性,提升话语忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01412 2026-01-21 cs.CL 85%

Bias Association Discovery Framework for Open-Ended LLM Generations

面向开放型大语言模型生成的偏见关联发现框架

Jinhao Pan, Chahat Raj, Ziwei Zhu

机构 * Jinhao Pan Chahat Raj Ziwei Zhu

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出BADF框架,用于从开放型LLM生成中发现和分析人口身份与描述性概念的偏见关联。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01436 2026-01-21 cs.HC cs.AI 85%

Challenges & Opportunities with LLM-Assisted Visualization Retargeting

基于大语言模型的可视化重定向挑战与机遇

Luke S. Snyder, Chenglong Wang, Steven M. Drucker

机构 * University of Washington(华盛顿大学) Microsoft Research(微软研究院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了大语言模型在可视化重定向中的应用挑战与机遇,通过对比两种方法评估LLM在代码生成和适应中的性能及局限性。

Comments 5 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19076 2026-01-21 cs.IR 85%

LLM-Evaluation Tropes: Perspectives on the Validity of LLM-Evaluations

LLM评估的陈词滥调:对LLM评估有效性的视角

Laura Dietz, Oleg Zendel, Peter Bailey, Charles Clarke, Ellese Cotterill, Jeff Dalton, Faegheh Hasibi, Mark Sanderson, Nick Craswell

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文探讨了LLM评估在信息检索系统中的有效性问题,指出其可能带来的偏见和自我强化风险,并提出测试和协作框架以规范LLM在评估中的使用。

Journal ref In Proceedings of the 2025 International ACM SIGIR Conference on Innovative Concepts and Theories in Information Retrieval (ICTIR). Association for Computing Machinery, New York, NY, USA, 218-229

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17156 2026-01-21 cs.IR 85%

LLM-based relevance assessment still can't replace human relevance assessment

基于大语言模型的相关性评估仍无法替代人类相关性评估

Charles L. A. Clarke, Laura Dietz

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文批判性地评估了LLM在信息检索中的相关性评估能力,指出其在实际和理论层面的局限性,强调无法完全替代人类评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07968 2026-01-21 cs.CR 85%

From Defender to Devil? Unintended Risk Interactions Induced by LLM Defenses

从守护者到魔鬼?由LLM防御引发的意外风险交互

Xiangtao Meng, Tianshuo Cong, Li Wang, Wenyu Chen, Zheng Li, Shanqing Guo, Xiaoyun Wang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出CrossRiskEval框架,系统研究LLM防御在安全、公平性与隐私间的相互影响,揭示防御措施对其他风险的非随机交互机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03706 2026-01-21 cs.ET 85%

LLM-enhanced Air Quality Monitoring Interface via Model Context Protocol

基于模型上下文协议的LLM增强空气质量监测接口

Yu-Erh Pan, Ayesha Siddika Nipu

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出基于模型上下文协议的LLM增强空气质量监测接口,通过整合实时传感器数据与对话接口,提升环境监测的准确性和用户友好性。

Comments Accepted at 7th International Symposium on Advanced Electrical and Communication Technologies (ISAECT), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12645 2026-01-21 cs.IR 85%

Diagnostic-Guided Dynamic Profile Optimization for LLM-based User Simulators in Sequential Recommendation

基于诊断的动态用户画像优化用于基于大语言模型的用户模拟器在序列推荐中的应用

Hongyang Liu, Zhu Sun, Tianjun Wei, Yan Wang, Jiajie Zhu, Xinghua Qu

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出DGDPO框架,通过动态优化提升基于LLM的用户模拟器在序列推荐中的保真度,实现用户画像与推荐策略的双向进化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10671 2026-01-21 cs.CV cs.AI 83%

Image-to-Video Transfer Learning based on Image-Language Foundation Models: A Comprehensive Survey

基于图像-语言基础模型的图像到视频迁移学习:全面综述

Jinxuan Li, Chaolei Tan, Haoxuan Chen, Jianxin Ma, Jian-Fang Hu, Jianhuang Lai, Wei-Shi Zheng

机构 * School of Computer Science and Engineering, Sun Yat-sen University(计算机科学与工程学院,中山大学)

专题命中 评测与基准 :foundation model(title,abstract);language model(abstract);分类 cs.AI

AI总结 本文综述了基于图像-语言基础模型的图像到视频迁移学习,系统分类了现有技术并分析了其在视频-文本任务中的应用与挑战。

Comments Updated version, github repository is available at https://github.com/YuriPreisdent/awesome-image-to-video-transfer

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12256 2026-01-21 cs.AI 83%

Improving Large Molecular Language Model via Relation-aware Multimodal Collaboration

通过关系感知的多模态协作改进大型分子语言模型

Jinyoung Park, Minseong Bae, Jeehye Na, Hyunwoo J. Kim

机构 * Korea University(韩国大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 CoLLaMo通过关系感知的多模态协作机制提升分子语言模型的泛化能力,优化分子模态整合并改进评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11655 2026-01-21 cs.SE cs.CL 83%

Advances and Frontiers of LLM-based Issue Resolution in Software Engineering: A Comprehensive Survey

大语言模型在软件工程中的问题解决进展与前沿:一项全面的调查

Caihua Li, Lianghong Guo, Yanlin Wang, Daya Guo, Wei Tao, Zhenyu Shan, Mingwei Liu, Jiachi Chen, Haoyu Song, Duyu Tang, Hongyu Zhang, Zibin Zheng

机构 * Sun Yat-sen University(中山大学) Hangzhou Normal University(杭州师范大学) Zhejiang University(浙江大学) Huawei Technologies Co, Ltd(华为技术有限公司) Chongqing University(重庆大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文全面调查了大语言模型在软件工程中问题解决的进展与前沿,分析了数据构建、方法和技术挑战,并提供了开源资源。

Comments 26 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12452 2026-01-21 cs.CL cs.CY cs.DL cs.IR 83%

Missing vs. Unused Knowledge Hypothesis for Language Model Bottlenecks in Patent Understanding

专利理解中语言模型瓶颈的缺失与未使用知识假设

Siyang Wu, Honglin Bao, Nadav Kunievsky, James A. Evans

机构 * University of Chicago(芝加哥大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本研究提出缺失与未使用知识假设,揭示语言模型在专利理解中因无法有效利用现有知识而存在的瓶颈问题。

Comments We open-source our patent dataset at https://huggingface.co/datasets/UchiKlab/patent_understanding

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12927 2026-01-21 cs.SE 82%

A Benchmark for Language Models in Real-World System Building

面向现实世界系统构建的语言模型基准

Weilin Jin, Chenyu Zhao, Zeshun Huang, Chaoyun Zhang, Qingwei Lin, Chetan Bansal, Saravan Rajmohan, Shenglin Zhang, Yongqian Sun, Dan Pei, Yifan Wu, Tong Jia, Ying Li, Zhonghai Wu, Minghua Ma

专题命中 评测与基准 :language model(title,abstract);large language model(abstract)

AI总结 本文提出一个面向现实世界系统构建的语言模型基准,用于评估跨不同架构和语言的软件包构建修复能力,揭示了该领域仍需进一步改进的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05484 2026-01-21 cs.CY 82%

Evaluating LLM Safety Across Child Development Stages: A Simulated Agent Approach

评估大语言模型在儿童发展阶段的安全性:一种模拟代理方法

Abhejay Murali, Saleh Afroogh, Kevin Chen, David Atkinson, Amit Dhurandhar, Junfeng Jiao

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出ChildSafe基准,通过模拟不同儿童发展阶段的认知变化,评估大语言模型在面对认知多样性时的安全性与对齐鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07478 2026-01-21 cs.CL 81%

Enhancing Agentic RL with Progressive Reward Shaping and Value-based Sampling Policy Optimization

通过渐进奖励塑造与基于价值的采样策略优化增强代理强化学习

Jianghao Su, Xia Zeng, Luhui Liu, Chao Luo, Ye Chen, Zhuoran Zhuang

机构 * Xi’an Jiaotong University(西安交通大学) Fliggy Alibaba(阿里飞猪)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出PRS和VSPO技术,通过渐进奖励塑造和基于价值的采样策略优化,提升代理强化学习在复杂推理任务中的性能与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏