arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing

共收录 10304
2605.07925 2026-05-11 cs.CL

How Value Induction Reshapes LLM Behaviour

价值观诱导如何重塑大语言模型行为

Arnav Arora, Natalie Schluter, Katherine Metcalf, Maartje ter Hoeve

机构 * University of Copenhagen(哥本哈根大学) Apple(苹果公司)

AI总结 研究探讨价值观诱导对大语言模型行为的影响,发现诱导价值观会引发其他相关或对立价值观的表达,提升安全性,但增加拟人化语言使用,导致模型更易产生验证性和趋炎附势倾向。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07613 2026-05-11 cs.CL

Intent-Driven Semantic ID Generation for Grounded Conversational News Recommendation

基于意图的语义ID生成用于 grounded 对话新闻推荐

Hongyang Su, Beibei Kong, Lei Cheng, Chengxiang Zhuo, Zang Li, Chenyun Yu

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Platform and Content Group, Tencent(腾讯平台与内容部)

AI总结 本文提出意图驱动的语义ID生成方法,通过多任务对齐和GPT-4链式推理蒸馏,实现意图到层级SID前缀的映射,提升新闻推荐的 grounded 性和冷启动用户推荐效果。

Comments Accepted at ACL 2026 Industry Track (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07606 2026-05-11 cs.CL cs.AI

Nürnberg NLP at PsyDefDetect: Multi-Axis Voter Ensembles for Psychological Defence Mechanism Classification

Nürnberg NLP在PsyDefDetect中的多轴投票集成:心理防御机制分类

Philipp Steigerwald, Eric Rudolph, Jens Albrecht

机构 * Technische Hochschule Nürnberg(纽伦堡技术大学)

AI总结 本文提出多轴投票集成方法,通过类粒度、训练方法和基模型三个维度提升心理防御机制分类效果,系统在隐藏测试集上达到0.420的F1分数,排名第一。

Comments Accepted at the BioNLP 2026 PsyDefDetect Shared Task @ ACL 2026 (1st place, 21 registered teams)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23032 2026-05-11 cs.CL cs.AI cs.LG

Is Chain-of-Thought Really Not Explainability? Chain-of-Thought Can Be Faithful without Hint Verbalization

链式推理真的不可解释性吗?链式推理可以在不提示 verbalization 的情况下保持忠实

Kerem Zaman, Shashank Srivastava

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 本文挑战了链式推理的忠实性定义,指出基于提示注入的偏差特征指标过于狭隘,通过新指标显示推理预算影响提示 verbalization,并通过因果中介分析证明非 verbalized 提示可通过链式推理影响预测,呼吁更广泛的可解释性工具。

Comments Accepted to ACL 2026. 23 pages, 29 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07250 2026-05-11 cs.CV cs.AI

Hard to Read, Easy to Jailbreak: How Visual Degradation Bypasses MLLM Safety Alignment

难以阅读,却容易被破解:视觉退化如何绕过大语言模型的安全对齐

Zhixue Song, Boyan Han, Yiwei Wang, Chi Zhang

机构 * AGI Lab, Westlake University, China(西lake大学AGI实验室,中国) University of California, Merced, USA(加州大学默塞德分校,美国)

AI总结 研究发现视觉退化会削弱大语言模型的安全防御,提出结构化认知卸载策略以缓解风险。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07248 2026-05-11 cs.CL cs.LG

PaT: Planning-after-Trial for Efficient Test-Time Code Generation

PaT:在试后进行规划以实现高效的测试时间代码生成

Youngsik Yoon, Sungjae Lee, Seockbean Song, Siwei Wang, Wei Chen, Jungseul Ok

机构 * Department of Computer Science and Engineering, POSTECH, South Korea(韩国POSTECH计算机科学与工程系) Graduate School of Artificial Intelligence, POSTECH, South Korea(韩国POSTECH人工智能研究生院) Microsoft Research Asia, Beijing, China(中国北京微软亚洲研究院)

AI总结 本文提出PaT方法,通过在试后规划来提高测试时间代码生成的效率,采用异构模型配置在多个基准和模型家族中显著提升了成本性能帕累托前沿。

Comments Accepted to ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07201 2026-05-11 cs.CL cs.AI cs.LG

PSK@EEUCA 2026: Fine-Tuning Large Language Models with Synthetic Data Augmentation for Multi-Class Toxicity Detection in Gaming Chat

PSK@EEUCA 2026: 通过合成数据增强微调大语言模型用于游戏聊天中的多类毒性检测

Srikar Kashyap Pulipaka

机构 * Independent Researcher(独立研究员)

AI总结 本文提出通过合成数据增强微调大语言模型,用于游戏聊天中的多类毒性检测,实验结果显示在测试集上达到0.6234的F1-macro分数,发现验证性能高反而导致测试转移差的'验证陷阱'现象。

Comments Accepted to the EEUCA workshop at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07172 2026-05-11 cs.CL

Topology-Enhanced Alignment for Large Language Models: Trajectory Topology Loss and Topological Preference Optimization

基于拓扑的大型语言模型对齐:轨迹拓扑损失与拓扑偏好优化

Yurui Pan, Ke Xu, Bo Peng

机构 * School of Computing and Intelligent Innovation, Fudan University(复旦大学计算与智能创新学院) School of Economics and Management, Tongji University(同济大学经济与管理学院) College of Information Technology, Shanghai Ocean University(上海海洋大学信息学院)

AI总结 本文提出基于拓扑的对齐框架,通过轨迹拓扑损失和拓扑偏好优化提升大型语言模型的对齐性能,实验表明其在自动偏好指标和LLM判断评估中优于传统方法。

Comments Accepted to ACL 2026. 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06886 2026-05-11 cs.CL

TajPersLexon: A Tajik-Persian Lexical Resource and Hybrid Model for Cross-Script Low-Resource NLP

TajPersLexon:一种塔吉克-波斯语词汇资源和混合模型用于跨脚本低资源NLP

Mullosharaf K. Arabov

机构 * Institute of Computational Mathematics and Information Technologies(计算数学与信息科技学院)

AI总结 本文提出TajPersLexon,一个包含40112词对的塔吉克-波斯语平行词汇资源,通过混合模型在低资源环境下实现跨脚本词检索与对齐,取得96.4%准确率。

Comments Published in The Proceedings of the First Workshop on NLP and LLMs for the Iranian Language Family (SilkRoadNLP 2026), pages 29-37, Rabat, Morocco. Association for Computational Linguistics

Journal ref Proceedings of the First Workshop on NLP and LLMs for the Iranian Language Family (SilkRoadNLP 2026), pages 29-37

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06716 2026-05-11 cs.AI cs.CL

From Storage to Experience: A Survey on the Evolution of LLM Agent Memory Mechanisms

从存储到经验:LLM代理记忆机制演化的综述

Jinghao Luo, Yuchen Tian, Chuxue Cao, Ziyang Luo, Hongzhan Lin, Kaixin Li, Chuyi Kong, Ruichao Yang, Jing Ma

机构 * Hong Kong Baptist University(香港 Baptist 大学) South China Normal University(南方中国师范大学) Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) University of Science and Technology Beijing(北京科技大学)

AI总结 本文综述了LLM代理记忆机制的发展,提出三阶段框架,分析长程一致性、动态环境挑战和持续学习目标,探讨前瞻性探索与跨轨迹抽象等前沿机制,为下一代LLM代理设计提供指导。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11121 2026-05-11 cs.CL

BITS Pilani at SemEval-2026 Task 9: Structured Supervised Fine-Tuning with DPO Refinement for Polarization Detection

BITS Pilani 在 SemEval-2026 任务 9:基于 DPO 细调的结构化监督微调用于极化检测

Atharva Gupta, Dhruv Kumar, Yash Sinha

机构 * Birla Institute of Technology and Science, Pilani, India(比拉理工学院和科学学院,瓦拉纳西,印度)

AI总结 本文提出结合结构化监督微调与 DPO 细调的方法,用于社交媒体文本中的极化检测,通过 LoRA 微调 Qwen 2.5-7B-Instruct 并利用自动偏好对减少误判,最终在英文测试集上达到 0.7664 的 Macro-F1 分数。

Comments Accepted to the 20th International Workshop on Semantic Evaluation (SemEval-2026), to be held in conjunction with ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11162 2026-05-11 cs.CL

Retrieval Heads are Dynamic

检索头是动态的

Yuping Lin, Zitao Li, Yue Xing, Pengfei He, Yingqian Cui, Yaliang Li, Bolin Ding, Jingren Zhou, Jiliang Tang

机构 * Michigan State University(密歇根州立大学) Zoom Communications(Zoom公司) Tongyi Lab, Alibaba Group(阿里云实验室)

AI总结 本文从动态视角研究LLM中的检索头,揭示其时间动态性、不可替代性及与隐藏状态的关联,通过实验验证动态检索头在生成任务中的优势。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02805 2026-05-11 cs.CL cs.AI

MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End Reinforcement Learning

MemSearcher:通过端到端强化学习训练LLM进行推理、搜索和管理内存

Qianhao Yuan, Jie Lou, Zichao Li, Jiawei Chen, Yaojie Lu, Hongyu Lin, Le Sun, Debing Zhang, Xianpei Han

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences, Beijing, China(中国科学院软件研究所信息处理实验室,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) Xiaohongshu Inc(小红书公司)

AI总结 MemSearcher通过端到端强化学习训练LLM进行推理、搜索和内存管理,通过维护紧凑的记忆在多轮交互中保持上下文长度稳定,优于基于历史拼接的基线方法。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07926 2026-05-11 cs.CL

Comprehensiveness Metrics for Automatic Evaluation of Factual Recall in Text Generation

全面性指标用于文本生成中事实回忆的自动评估

Adam Dejl, James Barry, Alessandra Pascale, Javier Carnerero Cano

机构 * Department of Computing, Imperial College London(伦敦帝国学院计算机系) IBM Research(IBM研究院)

AI总结 本文提出三种自动评估指标以评估大语言模型生成文本的全面性,发现端到端方法在效果上优于复杂指标,但牺牲了鲁棒性和可解释性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05085 2026-05-11 cs.CL cs.SD eess.AS

S2S-Arena: Evaluating Paralinguistic Instruction Following in Speech-to-Speech Models

S2S-Arena:评估语音到语音模型的副语言指令遵循

Feng Jiang, Zhiyu Lin, Yiyang Liu, Liumeng Xue, Fan Bu, Yuhao Du, Xiangying Chen, Benyou Wang, Haizhou Li

机构 * Artificial Intelligence Research Institute, Shenzhen University of Advanced Technology(深圳先进技术研究院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Nanjing University(南京大学) Shenzhen Loop Area Institute(深圳河套学院) CentraleSupélec, Université Paris-Saclay(巴黎萨克雷大学CentraleSupélec分校) National University of Singapore(新加坡国立大学)

AI总结 S2S-Arena通过四级交互协议和双阶段数据构建流程,评估语音模型在语义理解和副语言表达上的能力,揭示了现有系统在复杂副语言需求下的性能差距。

Comments Accepted by ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06276 2026-05-08 cs.CL cs.AI

Linear Semantic Segmentation for Low-Resource Spoken Dialects

低资源口语方言的语义分割

Kirill Chirkunov, Younes Samih, Abed Alhakim Freihat, Hanan Aldarmaki

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎姆贝克·本·扎耶德人工智能大学) IBM Research AI(IBM人工智能研究院)

AI总结 本文提出一个多领域基准测试,用于评估阿拉伯语口语方言的语义分割,发现标准模型在低资源口语上表现不佳,并提出新的模型提升分割性能。

Comments ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06157 2026-05-08 cs.CL cs.AI cs.CV

HNC: Leveraging Hard Negative Captions towards Models with Fine-Grained Visual-Linguistic Comprehension Capabilities

HNC:利用硬负样本提升具有细粒度视觉-语言理解能力的模型

Esra Dönmez, Pascal Tilli, Hsiu-Yu Yang, Thang Vu, Carina Silberer

机构 * Institute for Natural Language Processing, University of Stuttgart(自然语言处理研究所,斯图加特大学)

AI总结 本文提出HNC数据集,通过自动创建硬负样本提升图像-文本匹配模型的细粒度跨模态理解能力,并提供人工创建的测试集评估模型在复杂跨模态匹配任务中的表现。

Journal ref Association for Computational Linguistics (2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05963 2026-05-08 cs.AI cs.CL

TheraAgent: Self-Improving Therapeutic Agent for Precise and Comprehensive Treatment Planning

TheraAgent:自我改进的治疗剂用于精准且全面的治疗计划

Junkai Li, Yunghwei Lai, Tianyi Zhu, Zheng Long Lee, Weizhi Ma, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学,北京,中国) Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(人工智能产业研究院(AIR),清华大学,北京,中国) School of Computing, National University of Singapore, Singapore(计算学院,新加坡国立大学,新加坡)

AI总结 TheraAgent通过迭代生成-判断-改进流程提升治疗计划的精准度和完整性,实验显示其在HealthBench上表现优异,专家评估中胜率高达86%。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05955 2026-05-08 cs.CL cs.CV

TableVista: Benchmarking Multimodal Table Reasoning under Visual and Structural Complexity

TableVista:在视觉和结构复杂性下多模态表格推理的基准测试

Zheyuan Yang, Liqiang Shang, Junjie Chen, Xun Yang, Chenglong Xu, Bo Yuan, Chenyuan Jiao, Yaoru Sun, Yilun Zhao

机构 * Tongji University(同济大学) University of Bristol(布里斯托大学) Tianjin University(天津大学) Yale University(耶鲁大学)

AI总结 TableVista包含3000个高质量表格推理问题,通过多风格渲染和转换流程生成30000个多模态样本,评估29种基础模型在不同复杂性下的表现,揭示结构复杂性和视觉整合对推理一致性的影响。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00199 2026-05-08 cs.CL cs.AI cs.IR cs.LG

RSAT: Structured Attribution Makes Small Language Models Faithful Table Reasoners

RSAT:结构化归因使小型语言模型成为可信表格推理器

Jugal Gajjar, Kamalasankari Subramaniakuppusamy

机构 * Department of Computer Science, The George Washington University, USA(计算机科学系,乔治·华盛顿大学,美国)

AI总结 RSAT通过结构化归因提升小型语言模型的表格推理可信度,采用SFT和GRPO阶段训练,显著提高推理忠实度并确保引用有效性。

Comments 8 pages, 8 tables, 9 figures, and a 3-page Appendix. Accepted at the SURGeLLM Workshop at ACL 2026 and will be included in the proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18823 2026-05-08 cs.CL

EvalSense: A Framework for Domain-Specific LLM (Meta-)Evaluation

EvalSense:一种用于领域特定LLM(元)评估的框架

Adam Dejl, Jonathan Pearson

机构 * Imperial College London(伦敦帝国学院) NHS England Transformation Directorate(英格兰国家健康服务转型 Directorate)

AI总结 本文提出EvalSense框架,用于构建领域特定的LLM评估套件,通过交互式指南和元评估工具提高评估方法的可靠性与灵活性。

Comments Accepted to EACL 2026 System Demonstrations

Journal ref Proceedings of the 19th Conference of the European Chapter of the Association for Computational Linguistics (Volume 3: System Demonstrations), 480-491. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14724 2026-05-08 cs.CV cs.AI cs.CL

HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding

HERMES: KV缓存作为分层内存用于高效视频流理解

Haowei Zhang, Shudong Yang, Jinlan Fu, See-Kiong Ng, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) National University of Singapore(新加坡国立大学)

AI总结 HERMES提出一种无需训练的架构,通过将KV缓存视为分层内存框架,实现视频流的实时准确理解,提升处理速度并降低内存消耗。

Comments Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02339 2026-05-08 cs.CL cs.AI

Evaluating Uncertainty Quantification Methods in Argumentative Large Language Models

评估论证大语言模型中的不确定性量化方法

Kevin Zhou, Adam Dejl, Gabriel Freedman, Lihu Chen, Antonio Rago, Francesca Toni

机构 * Imperial College London(帝国理工学院伦敦分校) King’s College London(伦敦国王学院)

AI总结 本文评估了在论证大语言模型中不同不确定性量化方法在声明验证任务中的性能,发现直接提示法效果优于复杂方法。

Comments Accepted at EMNLP Findings 2025

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, 21700-21711. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06313 2026-05-08 cs.IR cs.AI cs.CL

Beyond Chunking: Discourse-Aware Hierarchical Retrieval for Long Document Question Answering

超越分块:面向长文档问答的篇章意识层次检索

Huiyao Chen, Yi Yang, Yinghui Li, Meishan Zhang, Baotian Hu, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology (Shenzhen)(计算与智能研究院,哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute (SLAI)(深圳环形区研究院(SLAI))

AI总结 本文提出一种篇章意识层次检索框架,利用修辞结构理论处理长文档问答,通过 discourse parsing 和 LLM 增强实现结构与语义信息的融合,实验表明在多种语言和文档类型上均取得显著提升。

Comments 21 pages, 9 figures. Accepted at ACL 2026 Main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19918 2026-05-08 cs.AI cs.LG

Meta-Reasoner: Dynamic Guidance for Optimized Inference-time Reasoning in Large Language Models

Meta-Reasoner:用于大型语言模型推理时间优化的动态指导

Yuan Sui, Yufei He, Tri Cao, Simeng Han, Yulin Chen, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学) Yale University(耶鲁大学)

AI总结 本文提出Meta-Reasoner框架,通过动态调整推理策略提升大语言模型的推理效率,实验显示在数学和科学任务中准确率提升9-12%,推理时间减少28-35%。

Comments Accepted by ACL'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05818 2026-05-08 cs.CR cs.AI cs.CL

LeakDojo: Decoding the Leakage Threats of RAG Systems

LeakDojo:解码RAG系统的泄漏威胁

Maosen Zhang, Jianshuo Dong, Boting Lu, Wenyue Li, Xiaoping Zhang, Tianwei Zhang, Han Qiu

机构 * Tsinghua University, China(清华大学, 中国) Ant International, China(蚂蚁集团, 中国) Nanyang Technological University, Singapore(南洋理工大学, 新加坡)

AI总结 LeakDojo通过可控评估揭示RAG系统泄漏风险,发现查询生成和对抗指令独立影响泄漏,且指令能力越强泄漏风险越高,RAG可信度提升可能增加泄漏风险。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05777 2026-05-08 cs.CL

Estimating the Black-box LLM Uncertainty with Distribution-Aligned Adversarial Distillation

通过分布对齐对抗蒸馏估计黑盒大语言模型的不确定性

Huizi Cui, Huan Ma, Qilin Wang, Yuhang Gao, Changqing Zhang

机构 * School of Computer Science and Technology, Tianjin University, China(天津大学计算机科学与技术学院) School of Future Technology, Tianjin University, China(天津大学未来技术学院) Georgia Tech Shenzhen Institute, Tianjin University, China(Georgia Tech深圳研究院) School of Artificial Intelligence, Tianjin University, China(天津大学人工智能学院)

AI总结 本文提出DisAAD方法,通过生成-判别架构引导轻量级代理模型学习黑盒LLM的输出分布高质量区域,从而有效估计其不确定性。实验表明,即使代理模型仅占目标LLM大小的1%,也能实现可靠的不确定性量化。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05758 2026-05-08 cs.CL

BioTool: A Comprehensive Tool-Calling Dataset for Enhancing Biomedical Capabilities of Large Language Models

BioTool: 一个全面的工具调用数据集,用于增强大语言模型的生物医学能力

Xin Gao, Ruiyi Zhang, Meixi Du, Peijia Qin, Pengtao Xie

机构 * UC San Diego(圣迭戈大学) MBZUAI(马克斯·普朗克智能系统研究所)

AI总结 BioTool通过整合生物医学领域常用工具及高质量查询-API调对,提升大语言模型在生物医学任务中的工具调用能力,实验表明其在生物医学领域表现优于现有商业模型。

Comments Published at ACL 2026; Code and data available at https://github.com/gxx27/BioTool

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04066 2026-05-08 cs.CL cs.ET cs.LG

Adapt to Thrive! Adaptive Power-Mean Policy Optimization for Improved LLM Reasoning

适应与繁荣!面向改进大语言模型推理的自适应幂均策略优化

Yiming Huang, Zhenbo Shi, Shuzheng Gao, Cuiyun Gao, Peiyi Han, Chuanyi Liu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出自适应幂均策略优化方法,通过引入幂均目标和反馈自适应裁剪,提升大语言模型的推理性能,实验显示其在多个任务中表现优于现有方法。

Comments Accepted to ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04065 2026-05-08 cs.CL cs.ET cs.LG

Free Energy-Driven Reinforcement Learning with Adaptive Advantage Shaping for Unsupervised Reasoning in LLMs

基于自发自由能的强化学习与自适应优势塑造的无监督推理在大语言模型中的应用

Yiming Huang, Zhenbo Shi, Xin-Cheng Wen, Jichuan Zeng, Cuiyun Gao, Peiyi Han, Chuanyi Liu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出FREIA算法,通过自发自由能奖励和自适应优势塑造提升大语言模型的无监督推理能力,在三个任务中表现优异。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏