Backtracking When It Strays: Mitigating Dual Exposure Biases in LLM Reasoning Distillation
在偏离时回溯:缓解大语言模型推理蒸馏中的双重暴露偏差
Bing Wang, Shaotian Yan, Chen Shen, kaiyuan liu, Sinan Fan, Ximing Li, Rui Miao, Xiaosong Yuan, Zhanming Shen, Jieping Ye
机构
*
College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院)
;
Key Laboratory of Symbolic Computation and Knowledge Engineering, MoE, Jilin University(吉林大学符号计算与知识工程重点实验室)
;
Tongyi Lab, Alibaba Group(阿里集团通义实验室)
;
College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
;
School of Artificial Intelligence, Jilin University(吉林大学人工智能学院)
专题命中
推理与问题求解
:LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
Helping Customers in Distress: An LLM-powered Agent that Converses, Probes, and Routes
帮助陷入困境的客户:一个基于LLM的代理,能够对话、探测和分流
Alankar Atreya, Stefan Sylvius Wanger, Devesh Batra, Robert Hankache, Cristovao Iglesias, Patrick Sinclair, Giulio Pelosio, Michael McMillan, Greig A. Cowan, Raad Khraishi
专题命中
推理与问题求解
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
机构
*
Nanjing University(南京大学)
;
The Hong Kong Polytechnic University(香港理工大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
Semantic-Space Exploration and Exploitation in RLVR for LLM Reasoning
在RLVR中对LLM推理进行语义空间探索与利用
Fanding Huang, Guanbo Huang, Xiao Fan, Yi He, Xiao Liang, Xiao Chen, Qinting Jiang, Faisal Nadeem Khan, Jingyan Jiang, Zhi Wang
机构
*
Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)
;
University of California, Los Angeles(加州大学洛杉矶分校)
;
Shenzhen Technology University(深圳技术大学)
CommentsThe paper is withdrawn for further clarification of the alignment between the proposed knowledge transfer framework and its implementation, and for refinement of the transfer span definition and experimental evaluation design