arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-21 至 2026-01-21 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 8 篇

2512.24574 2026-01-21 cs.CL cs.AI cs.LG 87%

Understanding and Steering the Cognitive Behaviors of Reasoning Models at Test-Time

在测试时理解并引导推理模型的认知行为

Zhenyu Zhang, Xiaoxia Wu, Zhongzhu Zhou, Qingyang Wu, Yineng Zhang, Pragaash Ponnusamy, Harikaran Subbaraj, Jue Wang, Shuaiwen Leon Song, Ben Athiwaratkun

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Together AI University of Sydney(悉尼大学)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CREST通过引导推理模型的认知行为,提高推理准确性和效率,减少计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01562 2026-01-21 cs.AI 83%

Logics-STEM: Empowering LLM Reasoning via Failure-Driven Post-Training and Document Knowledge Enhancement

Logics-STEM: 通过故障驱动的微调和文档知识增强赋能大语言模型推理

Mingyu Xu, Cheng Fang, Keyue Jiang, Yuqian Zheng, Yanghua Xiao, Baojian Zhou, Qifang Zhao, Suhang Zheng, Xiuwen Zhu, Jiyang Tang, Yongchi Zhao, Yijia Luo, Zhiqi Bai, Yuchi Xu, Wenbo Su, Wei Wang, Bing Zhao, Lin Qu, Xiaoxiao Xu

机构 * Alibaba Group(阿里巴巴集团) Shanghai Key Laboratory of Data Science, Fudan University(上海数据科学国家重点实验室,复旦大学) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of Data Science, Fudan University(复旦大学数据科学学院)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 Logics-STEM通过故障驱动微调和文档知识增强,提升大语言模型在STEM领域的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12748 2026-01-21 cs.CL 70%

Towards Robust Process Reward Modeling via Noise-aware Learning

通过噪声感知学习实现鲁棒的过程奖励建模

Bin Xie, Bingbing Xu, Xueyun Tian, Yilin Chen, Huawei Shen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院)

专题命中 测试时计算 :reasoning(abstract);self-correction(abstract);分类 cs.CL

AI总结 本文提出噪声感知迭代训练框架,通过两阶段方法缓解噪声监督问题,提升过程奖励模型的步骤正确性判别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07478 2026-01-21 cs.CL 57%

Enhancing Agentic RL with Progressive Reward Shaping and Value-based Sampling Policy Optimization

通过渐进奖励塑造与基于价值的采样策略优化增强代理强化学习

Jianghao Su, Xia Zeng, Luhui Liu, Chao Luo, Ye Chen, Zhuoran Zhuang

机构 * Xi’an Jiaotong University(西安交通大学) Fliggy Alibaba(阿里飞猪)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文提出PRS和VSPO技术,通过渐进奖励塑造和基于价值的采样策略优化,提升代理强化学习在复杂推理任务中的性能与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12812 2026-01-21 cs.CL 57%

Do Clinical Question Answering Systems Really Need Specialised Medical Fine Tuning?

临床问答系统真的需要专门的医学微调吗?

Sushant Kumar Ray, Gautam Siddharth Kashyap, Sahil Tripathi, Nipun Joshi, Vijay Govindarajan, Rafiq Ali, Jiechao Gao, Usman Naseem

机构 * University of Delhi(德里大学) Jamia Hamdard(贾迈亚哈马尔德大学) Cornell University(康奈尔大学) Expedia Group(Expedia集团) DSEU-Okhla Center for SDGC(SDGC中心) Stanford University(斯坦福大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 MEDASSESS-X通过推理时对齐技术,无需领域微调即可提升临床问答系统性能,解决专门化谬误问题。

Comments Accepted at EACL 2026 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16899 2026-01-21 cs.CL cs.CV 57%

Multimodal RewardBench 2: Evaluating Omni Reward Models for Interleaved Text and Image

多模态奖励基准2:评估多模态奖励模型用于交错文本和图像

Yushi Hu, Reyhane Askari-Hemmat, Melissa Hall, Emily Dinan, Luke Zettlemoyer, Marjan Ghazvininejad

机构 * FAIR at Meta Superintelligence Labs(Meta超智能实验室的FAIR)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 多模态奖励基准2评估多模态奖励模型在交错文本和图像任务中的性能,通过专家标注数据和先进模型对比,揭示了不同模型在多模态理解与生成任务中的准确率差异。

Comments Code and data available at https://github.com/facebookresearch/MMRB2

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13015 2026-01-21 cs.SE 50%

MeltRTL: Multi-Expert LLMs with Inference-time Intervention for RTL Code Generation

MeltRTL: 多专家LLMs结合推理时干预用于RTL代码生成

Nowfel Mashnoor, Mohammad Akyash, Hadi Kamali, Kimia Azar

专题命中 测试时计算 :reasoning(abstract)

AI总结 MeltRTL通过多专家注意力和推理时干预提升LLM生成RTL代码的准确性和效率,实现96%的可综合性和60%的功能正确性,无需微调模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04726 2026-01-21 cs.IR 50%

Hard Negative Sampling via Large Language Models for Recommendation

通过大型语言模型进行推荐系统中的困难负样本采样

Chu Zhao, Enneng Yang, Yuting Liu, Jianzhe Zhao, Guibing Guo

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文提出HNLMRec,利用大型语言模型生成语义相关的困难负样本,以提升推荐系统的性能和泛化能力。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏