arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Chinese Academy of Sciences(中国科学院大学)

2026-01-12 至 2026-01-12 共收录 4
2601.05693 2026-01-12 cs.AI

Circular Reasoning: Understanding Self-Reinforcing Loops in Large Reasoning Models

循环推理:理解大推理模型中的自增强循环

Zenghao Duan, Liang Pang, Zihao Wei, Wenbin Duan, Yuxin Tian, Shicheng Xu, Jingcheng Deng, Zhiyi Yin, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) People’s Public Security University of China(中国人民公安大学)

AI总结 本文提出LoopBench数据集和CUSUM算法,用于识别和预测大型推理模型中的自增强循环问题,揭示循环推理的机理并提升模型稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04992 2026-01-12 cs.CL

Learning from Mistakes: Negative Reasoning Samples Enhance Out-of-Domain Generalization

从错误中学习:负推理样本增强领域外泛化

Xueyun Tian, Minghua Ma, Bingbing Xu, Nuoyan Lyu, Wei Li, Heng Dong, Zheng Chu, Yuanzhuo Wang, Huawei Shen

机构 * CAS Key Laboratory of AI Safety, Institute of Computing Technology, CAS, Beijing, China(中国科学院人工智能安全重点实验室,计算技术研究所,中国科学院,北京,中国) Harbin Institute of Technology, Harbin, China(哈尔滨工业大学,哈尔滨,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) Tsinghua University, Beijing, China(清华大学,北京,中国)

AI总结 通过引入负例推理样本,GLOW方法有效提升了大语言模型在领域外任务中的泛化能力,通过调节损失下降和提升策略熵来减少过拟合并促进探索。

Comments Code and data are available at https://github.com/Eureka-Maggie/GLOW

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21541 2026-01-12 cs.CV

Video Generation Models Are Good Latent Reward Models

视频生成模型是良好的潜在奖励模型

Xiaoyue Mi, Wenqing Yu, Jiesong Lian, Shibo Jie, Ruizhe Zhong, Zijun Liu, Guozhen Zhang, Zixiang Zhou, Zhiyong Xu, Yuan Zhou, Qinglin Lu, Fan Tang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯文元) Huazhong University of Science and Technology(华中科技大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Nanjing University(南京大学)

AI总结 本文提出PRFL框架,利用预训练视频生成模型在噪声潜在空间中进行奖励建模,实现高效去噪和降低训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03505 2026-01-12 cs.LG cs.AI

Dynamic and Adaptive Feature Generation with LLM

动态和自适应特征生成与大语言模型

Xinhao Zhang, Jinghan Zhang, Banafsheh Rekabdar, Yuanchun Zhou, Pengfei Wang, Kunpeng Liu

机构 * Portland State University(波特兰州立大学) Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of Chinese Academy of Sciences, Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出利用大语言模型和特征生成提示,实现动态和自适应的特征生成方法,以提高特征生成的可解释性、适用性和灵活性。

Comments Accepted by IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏