arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-06 至 2026-01-06 共收录 108 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 7 篇

2601.01714 2026-01-06 cs.LG cs.CL 81%

Entropy-Aligned Decoding of LMs for Better Writing and Reasoning

基于熵对齐的语言模型解码以提升写作与推理能力

Kareem Ahmed, Sameer Singh

机构 * Department of Computer Science University of California, Irvine(计算机科学系加州大学伊维特分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 EPIC通过将未来轨迹的熵纳入语言模型解码,提升写作与推理能力,生成更多样且忠实的内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06065 2026-01-06 cs.AI cs.CL 73%

ScRPO: From Errors to Insights

ScRPO:从错误到洞察

Lianrui Li, Dakuan Lu, Jiawei Shao, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI)(人工智能研究院(TeleAI))

专题命中 数学推理 :reasoning(abstract);self-correction(abstract);分类 cs.CL、cs.AI

AI总结 ScRPO通过自我反思和错误纠正机制,提升大语言模型的数学推理能力,在多个基准测试中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20578 2026-01-06 cs.CL 70%

Can LLMs Predict Their Own Failures? Self-Awareness via Internal Circuits

LLMs能否预测自身失败?通过内部电路实现自感知

Amirhosein Ghasemabadi, Di Niu

机构 * University of Alberta(阿尔伯塔大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL

AI总结 Gnosis通过分析LLM内部状态实现自我验证,有效提升生成过程的准确性和校准性,无需外部监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01931 2026-01-06 cs.LG cs.AI 62%

DéjàQ: Open-Ended Evolution of Diverse, Learnable and Verifiable Problems

DéjàQ:开放性进化多样化、可学习且可验证的问题

Willem Röpke, Samuel Coward, Andrei Lupu, Thomas Foster, Tim Rocktäschel, Jakob Foerster

机构 * Willem Röpke AI Lab, Vrije Universiteit Brussel Belgium(维尔姆·罗普克人工智能实验室,布鲁塞尔自由大学) FLAIR, University of Oxford United Kingdom(FLAIR,牛津大学) University College London United Kingdom(伦敦大学学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 DéjàQ通过大语言模型驱动的突变策略动态进化多样化数学问题,提升模型的可学习性和推理能力,开源代码支持其应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00942 2026-01-06 cs.LG cs.CL 62%

Reliability Under Randomness: An Empirical Analysis of Sparse and Dense Language Models Across Decoding Temperatures

可靠性与随机性:在解码温度下对稀疏和密集语言模型的实证分析

Kabir Grover

机构 * Kabir Grover(独立研究者)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了稀疏和密集语言模型在不同解码温度下的可靠性,发现指令微调比架构稀疏性对稳定性影响更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00874 2026-01-06 cs.LG cs.AI physics.comp-ph 62%

LLMize: A Framework for Large Language Model-Based Numerical Optimization

LLMize: 一种基于大语言模型的数值优化框架

M. Rizki Oktavian

机构 * Blue Wave AI Labs(蓝波人工智能实验室) School of Nuclear Engineering, Purdue University(核工程学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 LLMize是一种基于大语言模型的数值优化框架,通过自然语言描述注入约束和领域知识,适用于复杂领域特定任务的优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00885 2026-01-06 cs.AI 57%

Counterfactual Self-Questioning for Stable Policy Optimization in Language Models

反事实自问法用于语言模型中的稳定策略优化

Mandar Parab

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 反事实自问法通过内部生成的监督提升语言模型的推理准确性和训练稳定性,实现自我改进。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 2 篇

2510.06478 2026-01-06 cs.LG cs.AI 62%

Anytime-Valid Answer Sufficiency Certificates for LLM Generation via Sequential Information Lift

通过顺序信息提升实现LLM生成的任何时间有效性答案充分性证书

Sanjeda Akter, Ibne Farabi Shihab, Anuj Sharma

机构 * Department of Computer Science, Iowa State University(计算机科学系,爱荷华州立大学) Department of Civil, Construction & Environmental Engineering, Iowa State University(土木、建设与环境工程系,爱荷华州立大学)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 通过顺序信息提升实现LLM生成的任何时间有效性答案充分性证书,利用经验动态形式提升方法,在减少生成长度的同时保持delta级误差控制,并通过轻量级正确性门提升端任务正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00816 2026-01-06 cs.AI cs.CR cs.LG 62%

MathLedger: A Verifiable Learning Substrate with Ledger-Attested Feedback

MathLedger: 一种具有账本证明反馈的可验证学习基础

Ismail Ahmad Abdullah

机构 * CNU(中国矿业大学)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 MathLedger通过整合形式验证、密码学证明和学习动态,提供一种可验证学习的基础,实现可审计的机器认知系统。

Comments 14 pages, 1 figure, 2 tables, 2 appendices with full proofs. Documents v0.9.4-pilot-audit-hardened audit surface with fail-closed governance, canonical JSON hashing, and artifact classification. Phase I infrastructure validation; no capability claims

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 10 篇

2601.01868 2026-01-06 cs.CL 86%

DermoGPT: Open Weights and Open Data for Morphology-Grounded Dermatological Reasoning MLLMs

DermoGPT: 开放权重和开放数据用于基于形态的皮肤病学推理大语言模型

Jinghan Ru, Siyuan Yan, Yuguo Yin, Yuexian Zou, Zongyuan Ge

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学) Faculty of Information Technology, Monash University(信息科技学院,莫纳什大学)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title);分类 cs.CL

AI总结 DermoGPT通过开放权重和数据提升皮肤病学推理的MLLM性能,实现与专家诊断流程的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02043 2026-01-06 cs.AI cs.CL 81%

Simulated Reasoning is Reasoning

模拟推理是推理

Hendrik Kempt, Alon Lavie

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了基础模型如何通过模仿思考过程实现推理,挑战了传统符号推理的必要性,并反思了推理模型的安全性和规范性问题。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01490 2026-01-06 cs.CL cs.AI 81%

Distortion Instead of Hallucination: The Effect of Reasoning Under Strict Constraints

扭曲而非虚构:在严格约束下推理的影响

Junichiro Niimi

机构 * Meijo University(名古屋大学) RIKEN(日本研究机构) AIP(Advanced Institute for Propulsion)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 在严格约束下,推理模型通过扭曲事实来减少约束违反,但牺牲了输出的真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15401 2026-01-06 cs.CL cs.AI 81%

Problem-Solving Logic Guided Curriculum In-Context Learning for LLMs Complex Reasoning

基于问题解决逻辑的课程化上下文学习用于LLM复杂推理

Xuetao Ma, Wenbin Jiang, Hua Huang

机构 * School of Artificial Intelligence, Beijing Normal University(人工智能学院,北京师范大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出基于问题解决逻辑的课程化上下文学习方法,通过分析问题解决逻辑选择和排序示例,提升LLM复杂推理能力。

Comments 19 pages, 6 figures, ACL 2025 findings, camera-ready version

Journal ref Findings of the Association for Computational Linguistics: ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01544 2026-01-06 cs.AI 79%

Causal Consistency Regularization: Training Verifiably Sensitive Reasoning in Large Language Models

因果一致性正则化:在大型语言模型中训练可验证的敏感推理

Sanjeda Akter, Ibne Farabi Shihab, Anuj Sharma

机构 * Department of Computer Science, Iowa State University(计算机科学系,爱荷华州立大学) Department of Civil, Construction & Environmental Engineering, Iowa State University(土木、建筑与环境工程系,爱荷华州立大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 CSR通过强制因果一致性提升大语言模型的推理忠实性,实现更可靠的结构化领域推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01875 2026-01-06 cs.AI q-bio.QM 79%

Toward Auditable Neuro-Symbolic Reasoning in Pathology: SQL as an Explicit Trace of Evidence

迈向病理学中的可审计神经符号推理:SQL作为证据的显式轨迹

Kewen Cao, Jianxu Chen, Yongbing Zhang, Ye Zhang, Hongxiao Wang

机构 * Capital Normal University, Beijing, China(首都师范大学) Leibniz-Institut für Analytische Wissenschaften-ISAS, Dortmund, Germany(莱比锡分析科学研究所-ISAS) Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳校区)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出一种基于SQL的神经符号推理框架,通过可执行的SQL轨迹实现病理分析的可审计性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02021 2026-01-06 cs.NI 67%

AgentVNE: LLM-Augmented Graph Reinforcement Learning for Affinity-Aware Multi-Agent Placement in Edge Agentic AI

AgentVNE: 基于大语言模型的图强化学习用于面向亲和力的多智能体部署

Runze Zheng, Yuqing Zheng, Zhengyi Cheng, Long Luo, Haoxiang Luo, Gang Sun, Hongfang Yu, Dusit Niyato

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract)

AI总结 AgentVNE通过结合大语言模型与图强化学习,解决边缘智能体部署中的动态资源分配与亲和力约束问题,提升服务效率与响应速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01298 2026-01-06 cs.LG cs.AI cs.AR cs.DC cs.MA 62%

Warp-Cortex: An Asynchronous, Memory-Efficient Architecture for Million-Agent Cognitive Scaling on Consumer Hardware

Warp-Cortex: 一种异步、内存高效的用于百万智能体认知扩展的消费级硬件架构

Jorge L. Ruiz Williams

机构 * Warp Research(Warp研究)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Warp-Cortex通过异步架构和内存优化技术,实现百万智能体在消费级硬件上的高效认知扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02008 2026-01-06 cs.AI cs.CV 57%

XAI-MeD: Explainable Knowledge Guided Neuro-Symbolic Framework for Domain Generalization and Rare Class Detection in Medical Imaging

XAI-MeD: 可解释知识引导的神经符号框架用于医学影像中的领域泛化和稀有类别检测

Midhat Urooj, Ayan Banerjee, Sandeep Gupta

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 XAI-MeD通过整合临床知识的神经符号框架,提升医学影像中领域泛化和稀有类别检测的性能,实现更鲁棒和可解释的多模态医学AI。

Comments Accepted at AAAI Bridge Program 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01101 2026-01-06 cs.CY 50%

An Agentic Software Framework for Data Governance under DPDP

基于DPDP的数据治理代理软件框架

Apurva Kulkarni, Chandrashekar Ramanathan

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出基于DPDP的数据治理代理框架,通过协作代理和动态政策执行实现透明、合规的数据治理。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 18 篇

2601.01624 2026-01-06 cs.CL 79%

How Does Prefix Matter in Reasoning Model Tuning?

前缀在推理模型微调中起什么作用?

Raj Vardhan Tomar, Preslav Nakov, Yuxia Wang

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫莫德·本·扎耶德人工智能大学) Indian Institute of Technology Delhi(印度德里理工学院) INSAIT

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究探讨前缀在推理模型微调中的作用,发现其能提升安全性和推理性能,但对事实性和编程任务效果有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00978 2026-01-06 cs.RO 78%

From Perception to Symbolic Task Planning: Vision-Language Guided Human-Robot Collaborative Structured Assembly

从感知到符号任务规划:基于视觉语言的引导人机协作结构装配

Yanyi Chen, Min Deng

机构 * Department of Civil, Environmental, and Construction Engineering, Texas Tech University(土木、环境与建设工程系,德克萨斯理工大学)

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出基于视觉语言模型的人机协作结构装配框架,通过感知到符号态和人感知规划模块提升动态环境下的态估计和任务规划鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12869 2026-01-06 cs.CE cs.CL 70%

ERA-IT: Aligning Semantic Models with Revealed Economic Preference for Real-Time and Explainable Patent Valuation

ERA-IT:通过揭示的经济偏好对齐语义模型以实现实时和可解释的专利估值

Yongmin Yoo, Seungwoo Kim, Jingjiang Liu

机构 * School of Computing(计算学院) Macquarie University(麦考瑞大学) School of Computer Science(计算机科学学院) University of Technology Sydney(悉尼技术大学) School of Management(管理学院) Zhejiang University(浙江大学)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 ERA-IT通过揭示的经济偏好对齐语义模型,实现实时且可解释的专利估值,提升预测准确性并增强决策透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06240 2026-01-06 cs.RO cs.AI 70%

Affordance-Guided Coarse-to-Fine Exploration for Base Placement in Open-Vocabulary Mobile Manipulation

基于 affordance 的粗到细探索用于开放词汇移动操控中的基座放置

Tzu-Jung Lin, Jia-Fong Yeh, Hung-Ting Su, Chung-Yi Lin, Yi-Ting Chen, Winston H. Hsu

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出了一种基于 affordance 的粗到细探索方法,通过结合视觉语言模型的语义理解和几何可行性,提升开放词汇移动操控中基座放置的成功率。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16760 2026-01-06 cs.RO 67%

Vision-Language-Action Models for Autonomous Driving: Past, Present, and Future

面向自动驾驶的视觉-语言-动作模型:过去、现在与未来

Tianshuai Hu, Xiaolu Liu, Song Wang, Yiyao Zhu, Ao Liang, Lingdong Kong, Guoyang Zhao, Zeying Gong, Jun Cen, Zhiyu Huang, Xiaoshuai Hao, Linfeng Li, Hang Song, Xiangtai Li, Jun Ma, Shaojie Shen, Jianke Zhu, Dacheng Tao, Ziwei Liu, Junwei Liang

机构 * HKUST(香港科技大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) HKUST(GZ)(香港科技大学(广州)) DAMO Academy, Alibaba(阿里巴巴达摩院) University of California, Los Angeles(加州大学洛杉矶分校) Xiaomi EV(小米电动车) Xi'an Jiaotong University(西安交通大学) Nanyang Technological University, Singapore(新加坡南洋理工大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文探讨了自动驾驶中视觉-语言-动作模型的发展历程,提出两种主要范式并分析其挑战与未来方向。

Comments Survey; 47 pages, 7 figures, 9 tables; GitHub Repo at https://github.com/worldbench/awesome-vla-for-ad

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10304 2026-01-06 cs.LG cs.AI cs.CL 67%

Sample-Efficient Online Learning in LM Agents via Hindsight Trajectory Rewriting

通过回顾轨迹重写实现LM代理的样本高效在线学习

Michael Y. Hu, Benjamin Van Durme, Jacob Andreas, Harsh Jhamtani

机构 * New York University(纽约大学) Microsoft(微软)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ECHO通过回顾轨迹重写提升LM代理的样本效率,有效利用过去经验以更快适应新环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22458 2026-01-06 cs.CL cs.AI 62%

Evaluating LLM-based Agents for Multi-Turn Conversations: A Survey

评估基于大语言模型的代理在多轮对话中的性能:一项调查

Shengyue Guan, Jindong Wang, Jiang Bian, Bin Zhu, Jian-guang Lou, Haoyi Xiong

机构 * Microsoft(微软)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于PRISMA框架的系统方法,用于评估多轮对话中基于LLM的代理,通过两个分类系统定义评估内容和方法,涵盖任务完成、响应质量等关键维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01816 2026-01-06 cs.AI 57%

Admissibility Alignment

可接受性对齐

Chris Duffey

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出MAP-AI架构,通过蒙特卡洛方法评估决策策略的可接受性,实现AI对齐的动态决策理论属性。

Comments 24 pages, 2 figures, 2 tables.. Decision-theoretic alignment under uncertainty

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01798 2026-01-06 cs.CV cs.AI 57%

VerLM: Explaining Face Verification Using Natural Language

通过自然语言解释面部验证

Syed Abdul Hannan, Hazim Bukhari, Thomas Cantalapiedra, Eman Ansar, Massa Baali, Rita Singh, Bhiksha Raj

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种视觉-语言模型用于面部验证,通过自然语言解释决策过程,提升验证的透明度和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01687 2026-01-06 cs.CV cs.AI 57%

FALCON: Few-Shot Adversarial Learning for Cross-Domain Medical Image Segmentation

FALCON:跨域少样本对抗学习用于医学图像分割

Abdur R. Fayjie, Pankhi Kashyap, Jutika Borah, Patrick Vandewalle

机构 * KU Leuven(卢森堡大学) IIT-Bombay(印度理工学院-孟买) Tezpur University(泰浦大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 FALCON通过跨域少样本对抗学习实现高精度医学图像分割,以更少的数据和计算开销获得更优的边界精度和分割性能。

Comments 20 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00818 2026-01-06 cs.AI 57%

Agentic AI for Autonomous, Explainable, and Real-Time Credit Risk Decision-Making

代理AI用于自主、可解释和实时的信用风险决策制定

Chandra Sekhar Kubam

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出代理AI框架,通过多代理系统实现自主、可解释和实时的信用风险决策,提升决策效率并应对监管与技术挑战。

Comments 8 pages

Journal ref INTELLIGENT SYSTEMS AND APPLICATIONS IN ENGINEERING, vol 12 No23, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏