arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-04 至 2026-02-04 共收录 14 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 14 篇

2602.03630 2026-02-04 cs.AI 83%

Can LLMs Do Rocket Science? Exploring the Limits of Complex Reasoning with GTOC 12

大语言模型能做火箭科学吗?通过GTOC 12探索复杂推理的极限

Iñaki del Campo, Pablo Cuervo, Victor Rodriguez-Fernandez, Roberto Armellin, Jack Yarndley

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 本研究通过GTOC 12竞赛评估大语言模型在复杂轨道优化任务中的表现,发现其在战略规划上能力显著提升,但在实际执行中存在物理一致性等关键问题。

Comments Extended version of the paper presented at AIAA SciTech 2026 Forum. Includes futher experiments, corrections and new appendix

Journal ref Proceedings of the AIAA SciTech 2026 Forum, January 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00642 2026-02-04 cs.CL 83%

LegalOne: A Family of Foundation Models for Reliable Legal Reasoning

LegalOne:一种用于可靠法律推理的基础模型家族

Haitao Li, Yifan Chen, Shuo Miao, Qian Dong, Jia Chen, Yiran Hu, Junjie Chen, Minghao Qin, Yueyue Wu, Yujia Zhou, Qingyao Ai, Yiqun Liu, Cheng Luo, Quan Zhou, Ya Zhang, Jikun Hu

机构 * Department of Computer Science, Tsinghua University(清华大学计算机科学系) Quancheng Laboratory(清华云城实验室) University of Waterloo, Canada(加拿大滑铁卢大学) China University of Political Science and Law(中国政法大学) MegaTech.AI Inc(MegaTech.AI公司)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract);分类 cs.CL

AI总结 LegalOne通过三阶段流程提升法律推理能力,结合领域适应、代理推理蒸馏和课程强化学习,在法律任务中取得超越通用LLMs的性能。

Comments 25 pages, v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02313 2026-02-04 cs.AI cs.CL cs.LG 82%

Interpreting and Controlling LLM Reasoning through Integrated Policy Gradient

通过集成策略梯度解释和控制大语言模型的推理

Changming Li, Kaixing Zhang, Haoyun Xu, Yingdong Shi, Zheng Zhang, Kaitao Song, Kan Ren

机构 * Independent Researcher(独立研究者) ShanghaiTech University(上海科技大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出集成策略梯度框架,通过反向传播复合结果信号,实现对大语言模型推理行为的精确解释与控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03485 2026-02-04 cs.CL cs.AI cs.LG 82%

Self-Verification Dilemma: Experience-Driven Suppression of Overused Checking in LLM Reasoning

自我验证困境:经验驱动的过度验证抑制在大语言模型推理中

Quanyu Long, Kai Jie Jiang, Jianda Chen, Xu Guo, Leilei Gan, Wenya Wang

机构 * Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种经验驱动的测试时框架,通过抑制过度的自我验证步骤,减少大语言模型推理中的token使用,同时保持或提升准确性。

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03279 2026-02-04 cs.AI cs.LG 81%

Agentic Proposing: Enhancing Large Language Model Reasoning via Compositional Skill Synthesis

代理提案:通过组合技能合成增强大语言模型推理

Zhengbo Jiao, Shaobo Wang, Zifan Zhang, Xuan Ren, Wei Wang, Bing Zhao, Hu Wei, Linfeng Zhang

机构 * AI DATA, Alibaba Group Holding Limited(阿里数据,阿里巴巴集团控股有限公司) EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) Shanghai University of Finance(上海财经大学) Wuhan University(武汉大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 Agentic Proposing通过组合技能合成生成高质量训练数据,使大语言模型在数学、编程和科学领域实现更高效的推理和泛化能力。

Comments 23page4

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03578 2026-02-04 cs.CL cs.AI 62%

Use Graph When It Needs: Efficiently and Adaptively Integrating Retrieval-Augmented Generation with Graphs

在需要时使用图:高效且适应性地整合检索增强生成与图

Su Dong, Qinggang Zhang, Yilin Xiao, Shengyuan Chen, Chuang Zhou, Xiao Huang

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EA-GraphRAG框架,通过动态整合RAG和GraphRAG,根据查询复杂度灵活选择检索策略,提升处理混合场景的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03569 2026-02-04 cs.AI cs.LG 62%

EHRWorld: A Patient-Centric Medical World Model for Long-Horizon Clinical Trajectories

EHRWorld: 一个以患者为中心的医疗世界模型用于长周期临床轨迹

Linjie Mu, Zhongzhen Huang, Yannian Gu, Shengqian Qin, Shaoting Zhang, Xiaofan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 EHRWorld通过因果序列范式训练,有效解决长周期临床模拟中的误差累积问题,提升医疗世界模型的稳定性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02598 2026-02-04 physics.soc-ph cs.AI cs.CL cs.CY cs.MA 62%

Social Catalysts, Not Moral Agents: The Illusion of Alignment in LLM Societies

社交催化剂,而非道德主体:LLM社会中的对齐幻觉

Yueqing Hu, Yixuan Jiang, Zehua Jiang, Xiao Wen, Tianhong Wang

机构 * Institute of Neuroscience, Chinese Academy of Sciences(中国科学院神经科学研究所) School of Philosophy, Anhui University(安徽大学哲学学院) Department of Psychology and Behavioral Sciences, Zhejiang University(浙江大学心理学与行为科学系) Mental Health Education Center, North China Electric Power University(华北电力大学心理健康教育中心)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨了锚定智能体在促进合作中的作用,发现其效果源于战略合规而非真实价值对齐,揭示了人工社会中行为修改与真实价值对齐之间的差距。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04601 2026-02-04 cs.LG cs.CL 62%

Natural Language Actor-Critic: Scalable Off-Policy Learning in Language Space

自然语言行为-批评者:在语言空间中可扩展的非策略学习

Joey Hong, Kang Liu, Zhan Ling, Jiecao Chen, Sergey Levine

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出NLAC算法,利用生成式LLM批评者生成自然语言反馈,实现更高效稳定的LLM智能体训练。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22926 2026-02-04 cs.LG 57%

Simple Denoising Diffusion Language Models

简单去噪扩散语言模型

Huaisheng Zhu, Zhengyu Chen, Shijie Zhou, Zhihui Xie, Yige Yuan, Shiqi Chen, Zhimeng Guo, Siyuan Xu, Hangfan Zhang, Vasant Honavar, Teng Xiao

机构 * Penn State University(宾夕法尼亚州立大学) University at Buffalo(布法罗大学) University of Washington(华盛顿大学) The University of Hong Kong(香港大学) City University of Hong Kong(城市大学) Alibaba Group(阿里巴巴集团) Allen Institute for AI (AI2)(人工智能研究所(AI2))

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.LG

AI总结 本文提出了一种简化且改进的去噪损失公式,用于均匀状态扩散模型,以提高训练稳定性与效率,并在大规模模型上展示了良好的扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22975 2026-02-04 cs.AI 57%

Golden Goose: A Simple Trick to Synthesize Unlimited RLVR Tasks from Unverifiable Internet Text

金 Goose:从不可验证的互联网文本中合成无限 RLVR 任务的简单技巧

Ximing Lu, David Acuna, Jaehun Jung, Jian Hu, Di Zhang, Shizhe Diao, Yunheng Zou, Shaokun Zhang, Brandon Cui, Mingjie Liu, Hyunwoo Kim, Prithviraj Ammanabrolu, Jan Kautz, Yi Dong, Yejin Choi

机构 * NVIDIA(NVIDIA公司) University of Washington(华盛顿大学) University of California San Diego(圣地亚哥大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 Golden Goose 通过从不可验证的互联网文本中合成无限 RLVR 任务,提升大型语言模型在复杂推理和网络安全领域的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09241 2026-02-04 cs.CL 57%

When to Trust: A Causality-Aware Calibration Framework for Accurate Knowledge Graph Retrieval-Augmented Generation

何时信任:一种因果意识校准框架用于准确的知识图谱检索增强生成

Jing Ren, Bowen Li, Ziqi Xu, Xikun Zhang, Haytham Fayek, Xiaodong Li

机构 * RMIT University(皇家墨尔本理工大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 Ca2KG通过整合反事实提示和重新评分机制,提升KG-RAG在高风险领域的可靠性与准确性。

Comments Accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02280 2026-02-04 cs.CV cs.CL 57%

SAIL-RL: Guiding MLLMs in When and How to Think via Dual-Reward RL Tuning

SAIL-RL: 通过双奖励强化学习调优引导MLLM在何时以及如何思考

Fangxun Shu, Yongjie Ye, Yue Liao, Zijian Kang, Weijie Yin, Jiacong Wang, Xiao Liang, Shuicheng Yan, Chao Feng

机构 * National University of Singapore(新加坡国立大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 SAIL-RL通过双奖励强化学习调优,提升多模态大语言模型的推理能力和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12960 2026-02-04 cs.MA 50%

ENGRAM: Effective, Lightweight Memory Orchestration for Conversational Agents

ENGRAM: 有效的、轻量级的内存编排用于对话代理

Daivik Patel, Shrenik Patel

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 ENGRAM通过轻量级内存编排实现对话代理的长周期一致性,利用类型化内存和密集检索在多个基准测试中取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏