Discovery and Reinforcement of Tool-Integrated Reasoning Chains via Rollout Trees
发现与强化工具集成推理链 via 滚出树
专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
AI总结 DART通过强化学习框架在长链推理中自发使用工具,无需人工标注,有效提升工具集成推理性能。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
发现与强化工具集成推理链 via 滚出树
专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
AI总结 DART通过强化学习框架在长链推理中自发使用工具,无需人工标注,有效提升工具集成推理性能。
解释是否能在大型推理模型中泛化?
专题命中 其他推理 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI
AI总结 研究探讨了大型推理模型生成的解释是否能泛化,发现CoT解释能提高模型间一致性,并提出基于句子的融合策略提升一致性。
基于语义和token熵的高效强化学习用于LLM推理
机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学) ; China Mobile NineVerse Artificial Intelligence Technology (Beijing) Co., Ltd.(中国移动九章人工智能技术(北京)有限公司) ; Institute of Artificial Intelligence, NineVerse, Beijing(九章人工智能研究院,北京)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出基于语义和token熵的高效强化学习框架,通过优化数据组织和算法设计缓解熵崩溃,提升大语言模型的推理能力。
FAQ: 通过家庭感知量化减少量化误差
机构 * Alibaba Cloud Computing(阿里云计算)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 FAQ通过家庭感知量化方法生成高保真校准数据,有效减少量化误差,实验表明其在多个模型系列中将准确性损失降低28.5%。
FlashLabs Chroma 1.0: 一种实时端到端语音对话模型及个性化语音克隆
机构 * FlashLabs
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 FlashLabs Chroma 1.0是一种实时端到端语音对话模型,通过交错调度实现低延迟和高保真个性化语音克隆,提升了说话人相似性并保持对话能力。
完整性防护:一个用于伦理AI使用和评估中的作者透明度的系统
机构 * Arizona State University(亚利桑那州立大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 Integrity Shield通过在文档层嵌入水印,防止大型语言模型回答受保护的考试,同时保持外观不变,并在多个考试中实现了高阻止率和检测可靠性。
用于材料设计的强化微调
机构 * Beijing National Laboratory for Condensed Matter Physics(北京凝聚态物理国家实验室) ; School of Physical Sciences, University of Chinese Academy of Sciences, Beijing 100190, China(中国科学院大学物理科学学院) ; Songshan Lake Materials Laboratory, Dongguan, Guangdong 523808, China(松山湖材料实验室)
专题命中 其他推理 :reasoning(abstract);分类 cs.LG
AI总结 本研究通过强化微调提升材料生成模型的性能,实现基于属性的材料设计与检索,发现具有矛盾材料属性的新型晶体。
Comments 10 pages, 7 figures
Journal ref Phys. Rev. B 113, 024106 (2026)
大规模无线基础模型:更强且更大
专题命中 其他推理 :reasoning(abstract)
AI总结 本文提出大规模无线基础模型(LWFMs),通过无线约束下的新框架赋能物理层,结合现有通用模型和新模型构建,提升无线通信的泛化能力和鲁棒性。