arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-27 至 2026-01-27 共收录 4 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 4 篇

2510.04182 2026-01-27 cs.CL cs.AI 86%

Thinking on the Fly: Test-Time Reasoning Enhancement via Latent Thought Policy Optimization

飞行中的思考:通过潜在思维策略优化提升测试时推理

Wengao Ye, Yan Liang, Lianlei Shan

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 LTPO通过在测试时优化潜在思维向量,提升LLM在复杂推理任务中的鲁棒性和准确性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17223 2026-01-27 cs.CL cs.AI 84%

Beyond Outcome Verification: Verifiable Process Reward Models for Structured Reasoning

超越结果验证:用于结构化推理的可验证过程奖励模型

Massimiliano Pronesti, Anya Belz, Yufang Hou

机构 * IBM Research Europe - Ireland(IBM欧洲研究院-爱尔兰) Dublin City University(都柏林城市大学) IT:U Interdisciplinary Transformation University Austria(IT:U跨学科转型大学奥地利)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出可验证过程奖励模型,用于提升结构化推理的连贯性和准确性,实验显示其在医学证据评估中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18730 2026-01-27 cs.CL cs.LG 81%

Reflect: Transparent Principle-Guided Reasoning for Constitutional Alignment at Scale

Reflect: 为大规模宪法对齐的透明原则引导推理

Henry Bell, Caroline Zhang, Mohammed Mobasserul Haque, Dhaval Potdar, Samia Zaman, Brandon Fain

机构 * Duke University(杜克大学) Independent Researcher(独立研究者)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 Reflect通过透明推理框架在不需训练数据的情况下提升大语言模型对多样原则的对齐能力,增强安全性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17212 2026-01-27 cs.CL 57%

DF-RAG: Query-Aware Diversity for Retrieval-Augmented Generation

DF-RAG:基于查询的多样性检索增强生成

Saadat Hasan Khan, Spencer Hong, Jingyu Wu, Kevin Lybarger, Youbing Yin, Erin Babinsky, Daben Liu

机构 * George Mason University(乔治·马歇尔大学) Capital One

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 DF-RAG通过在检索阶段引入多样性,提升复杂推理问答任务的F1性能,相比传统RAG提升了4-10个百分点,并接近Oracle上限的91.3%

Comments Accepted to Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏