GPG: A Simple and Strong Reinforcement Learning Baseline for Model Reasoning
GPG:一种简单而强大的用于模型推理的强化学习基线
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 GPG提出了一种简化且高效的强化学习方法,通过直接优化原始目标并消除冗余组件,实现了在多种任务中优于传统方法的性能。
Comments Accepted to ICLR2026
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
GPG:一种简单而强大的用于模型推理的强化学习基线
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 GPG提出了一种简化且高效的强化学习方法,通过直接优化原始目标并消除冗余组件,实现了在多种任务中优于传统方法的性能。
Comments Accepted to ICLR2026
Socratic-Geo:通过多智能体交互实现合成数据生成与几何推理
机构 * AI DATA, Alibaba Group Holding Limited(阿里数据,阿里巴巴集团控股有限公司) ; EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) ; Shanghai University of Finance(上海财经大学) ; Wuhan University(武汉大学)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI
AI总结 Socratic-Geo通过多智能体交互实现合成数据生成与几何推理,利用教师代理和求解代理动态耦合数据合成与模型学习,提升图像生成和推理能力。
Comments 18pages
基于图增强推理的烟草害虫和疾病管理
机构 * School of Information Science and Engineering(信息科学与工程学院) ; Chongqing Jiaotong University(重庆交通大学)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出一种基于图增强推理的框架,通过整合领域知识图谱,提升烟草害虫和疾病管理的推理能力和推荐准确性。
Rank-and-Reason: 多智能体协作加速零样本蛋白质突变预测
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院) ; Southern University of Science(南方大学(科学)) ; East China University of Science and Technology(东中国科学与技术大学)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 Rank-and-Reason通过多智能体协作提升零样本蛋白质突变预测的准确性与效率,显著提高湿实验验证的成功率。
Comments 22 pages, 5 figures, 15 tables
KVzap:快速、自适应和忠实的KV缓存修剪
机构 * NVIDIA(英伟达)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 KVzap通过快速且自适应的KV缓存修剪方法,在保持高精度的同时实现显著的缓存压缩,适用于长上下文和推理任务。
单调性作为提升语言模型鲁棒性的架构偏倚
机构 * Department of Computer Science, University of Colorado Boulder, Boulder, CO, USA(计算机科学系,科罗拉多大学波尔德分校,波尔德,科罗拉多州,美国)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究通过在Transformer模型中引入单调性约束,提升语言模型对对抗攻击的鲁棒性,同时保持预训练性能。
Comments 12 pages, 1 figure
Kimi K2:开放代理智能
机构 * Kimi Team(Kimi 团队)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 Kimi K2是一款开源大语言模型,通过混合专家架构和MuonClip优化器实现先进代理能力,表现优于现有非思考模型。
Comments tech report of Kimi K2, with minor updates
UniGeM: 通过几何探索与挖掘统一数据混合与选择
机构 * Politecnico di Torino(托斯大学) ; Ant Group(蚂蚁集团) ; Renmin University of China(中国人民大学) ; Institute of Microelectronics of the CAS(中国科学院微电子研究所)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 UniGeM通过几何探索与挖掘统一数据混合与选择,提升大语言模型的数据效率和推理性能
全滑动图像分析的多尺度线性时间编码器
机构 * Department of Electrical and Computer Engineering, University of Houston(电子与计算机工程系,休斯顿大学) ; Department of Information Science Technology, University of Houston(信息科学与技术系,休斯顿大学) ; Department of Neurology, College of Medicine, University of Florida(神经病学系,医学学院,佛罗里达大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 MARBLE是一种基于Mamba的多尺度线性时间编码器,通过并行处理和线性时间建模,实现高效且可扩展的全滑动图像分析。
Comments Accepted to ISBI 2026, 4 pages with 2 figures
测试时递归思考:无需外部反馈的自我提升
机构 * Microsoft Research(微软研究院)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 本文提出 TRT 框架,使 LLM 在无需外部反馈的情况下实现自我提升,开源模型在 AIME-25/24 上达到 100% 准确率,闭源模型在 LiveCodeBench 最难问题上提升 10.4-14.8 个百分点。
UniFGVC: 一种通用无训练少样本细粒度视觉分类方法通过属性感知多模态检索
机构 * School of Traffic and Transportation, Beijing Jiaotong University(交通与运输学院,北京交通大学) ; Foundation Modal Research Center, Institute of Automation, Chinese Academy of Sciences(基础模态研究中心,自动化研究所) ; Queen Mary School Hainan, Beijing University of Posts and Telecommunications(海南女王学院,北京邮电大学) ; Department of Computer Science, NUS School of Computing(计算机科学系,国立大学计算机学院)
专题命中 其他推理 :chain-of-thought(abstract);分类 cs.AI
AI总结 UniFGVC通过属性感知多模态检索方法,实现无训练少样本细粒度视觉分类,优于现有方法。
TRACE: 基于解剖变化解释的时序放射学用于 grounded X-ray 报告生成
机构 * The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)
专题命中 其他推理 :reasoning(abstract)
AI总结 TRACE 是首个结合时序比较、变化分类和空间定位的模型,通过边界框坐标实现对胸片变化的自然语言描述,提升放射学报告生成的准确性与可靠性。