arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Baidu(百度)

2026-05-28 至 2026-05-28 共收录 3
2605.28713 2026-05-28 cs.AI

Thinking as Compression: Your Reasoning Model is Secretly a Context Compressor

思维即压缩:你的推理模型其实是一个上下文压缩器

Guoxin Ma, Yibing Liu, Chengzhengxu Li, Yu Liang, Yan Wang, Yueyang Zhang, Kecheng Chen, Zhaohan Zhang, Zhiyuan Sun, Daiting Shi

机构 * Baidu Inc.(百度公司) Xi’an Jiaotong University(西安交通大学) City University of Hong Kong(香港城市大学) Queen Mary University of London(伦敦玛丽女王大学)

AI总结 本文提出思维即压缩(TaC)范式,利用推理模型自身的思维痕迹作为压缩上下文,并通过奖励驱动优化(TaC-C)实现可控压缩,在长上下文QA任务上显著优于现有方法。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28014 2026-05-28 cs.CL cs.LG

ROSD: Reflective On-Policy Self-Distillation for Language Model Reasoning across Domains

ROSD: 面向跨领域语言模型推理的反思式同策略自蒸馏

Ziqi Zhao, Xinyu Ma, Liu Yang, Yujie Feng, Daiting Shi, Jingzhou He, Xin Xin, Zhaochun Ren, Xiao-Ming Wu

机构 * The Hong Kong Polytechnic University(香港理工大学) Baidu Inc.(百度公司) Shandong University(山东大学) Leiden University(莱顿大学)

AI总结 提出反思式同策略自蒸馏(ROSD)框架,通过反思引导的错误定位蒸馏将参考解模仿转为针对性推理修正,提升领域内推理和跨领域泛化能力。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27846 2026-05-28 cs.AI

EAPO: Entropy-Driven Adaptive Positive-Negative Sample Weighting for Policy Optimization in Open-Ended QA

EAPO: 面向开放问答的基于熵驱动的自适应正负样本加权策略优化

Yunsheng Zeng, Gen Li, Yuwei Miao, Xiandong Li, Yujin Wang, Siyu Chen, Luning Wang, Yunhao Qiao, Junfeng Wang, Jianwei Lv, Bo Yuan

机构 * Baidu Inc(百度公司)

AI总结 针对开放问答中强化学习固定权重的问题,提出基于熵驱动的自适应策略优化方法EAPO,通过动态调整正负样本权重平衡探索与稳定性,在医学问答数据集上显著提升多样性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏