arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-22 至 2025-12-22 共收录 50 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 2 篇

2512.17079 2025-12-22 cs.LG cs.AI 86%

Can Large Reasoning Models Improve Accuracy on Mathematical Tasks Using Flawed Thinking?

大推理模型能否通过错误推理提升数学任务的准确性?

Saraswathy Amjith, Mihika Dusad, Neha Muramalla, Shweta Shah

机构 * MIT(麻省理工学院)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过训练模型处理故意错误推理轨迹,提升其在数学任务中的错误恢复能力,同时保持准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17636 2025-12-22 cs.LG cs.AI 62%

Trust-Region Adaptive Policy Optimization

信任区域自适应策略优化

Mingyu Su, Jian Guan, Yuxian Gu, Minlie Huang, Hongning Wang

机构 * The Conversational AI (CoAI) Group, Tsinghua University(清华大学对话式人工智能(CoAI)小组)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 TRAPO通过结合SFT和RL的训练流程,提升大语言模型的推理能力,实现更稳定的训练和更高效的探索。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 1 篇

2512.17260 2025-12-22 cs.CL 57%

Seed-Prover 1.5: Mastering Undergraduate-Level Theorem Proving via Learning from Experience

Seed-Prover 1.5:通过经验学习掌握本科生级定理证明

Jiangjie Chen, Wenxiang Chen, Jiacheng Du, Jinyi Hu, Zhicheng Jiang, Allan Jie, Xiaoran Jin, Xing Jin, Chenggang Li, Wenlei Shi, Zhihong Wang, Mingxuan Wang, Chenrui Wei, Shufa Wei, Huajian Xin, Fan Yang, Weihao Gao, Zheng Yuan, Tianyang Zhan, Zeyu Zheng, Tianxi Zhou, Thomas Hanwen Zhu

机构 * ByteDance(字节跳动)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

AI总结 Seed-Prover 1.5通过经验学习在形式定理证明中实现高效性能,解决大量本科生及更高难度的数学问题。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 5 篇

2512.17227 2025-12-22 cs.CV 87%

Learning When to Look: A Disentangled Curriculum for Strategic Perception in Multimodal Reasoning

学习何时观察:一种解耦的课程学习框架,用于多模态推理中的战略感知

Siqi Yang, Zilve Gao, Haibo Qiu, Fanfan Liu, Peng Shi, Zhixiong Zeng, Qingmin Liao, Lin Ma

机构 * Meituan(美团) Tsinghua University(清华大学)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);logical reasoning(abstract)

AI总结 本文提出了一种解耦课程学习框架,通过分阶段训练提升多模态推理中的抽象推理与战略视觉感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17062 2025-12-22 cs.RO 82%

Lang2Manip: A Tool for LLM-Based Symbolic-to-Geometric Planning for Manipulation

Lang2Manip: 一种基于LLM的符号到几何规划工具用于操作

Muhayy Ud Din, Jan Rosell, Waseem Akram, Irfan Hussain

机构 * Khalifa University Center for Autonomous Robotic Systems (KUCARS)(卡利法大学自主机器人系统中心) Khalifa University(卡利法大学) Institute of Industrial and Control Engineering (IOC)(工业与控制工程研究所) Universitat Politècnica de Catalunya(加泰罗尼亚理工大学)

专题命中 逻辑推理 :planning(title,abstract);reasoning(abstract)

AI总结 Lang2Manip通过结合LLM和Kautham框架,实现通用的符号到几何操作规划,适用于多种机器人和任务。

Comments Submitted to ICARA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17213 2025-12-22 cs.CV cs.LG 70%

CheXPO-v2: Preference Optimization for Chest X-ray VLMs with Knowledge Graph Consistency

CheXPO-v2:基于知识图谱一致性的胸片视觉-语言模型偏好优化

Xiao Liang, Yuxuan An, Di Wang, Jiawei Hu, Zhicheng Jiao, Bin Jing, Quan Wang

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Warren Alpert Medical School of Brown University(布朗大学沃伦·阿尔珀特医学学院) School of Biomedical Engineering, Capital Medical University(首都医科大学生物医学工程学院)

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 CheXPO-v2通过知识图谱一致性奖励机制,提升胸片VLMs的临床可靠性与数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17308 2025-12-22 cs.AI cs.CL 62%

Large Language Models as Pokémon Battle Agents: Strategic Play and Content Generation

大型语言模型作为宝可梦战斗代理:战略玩法与内容生成

Daksh Jain, Aarya Jain, Ashutosh Desai, Avyakt Verma, Ishan Bhanuka, Pratik Narang, Dhruv Kumar

机构 * Birla Institute of Technology and Science, Pilani, India(比拉理工学院和科学学院,比兰)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大型语言模型在宝可梦战斗中的战略决策能力及内容生成能力,展示了其作为动态游戏对手和设计者的潜力。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17194 2025-12-22 cs.AI 57%

MMRAG-RFT: Two-stage Reinforcement Fine-tuning for Explainable Multi-modal Retrieval-augmented Generation

MMRAG-RFT: 两阶段强化微调用于可解释的多模态检索增强生成

Shengwei Zhao, Jingwen Yao, Sitong Wei, Linhai Xu, Yuying Liu, Dong Zhang, Zhiqiang Tian, Shaoyi Du

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 MMRAG-RFT通过两阶段强化微调提升多模态检索增强生成的可解释性,实现更清晰的推理逻辑和更优的生成效果。

Comments This paper was accepted to AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 8 篇

2505.14886 2025-12-22 cs.CL 79%

Strategic Planning and Rationalizing on Trees Make LLMs Better Debaters

树状规划与理性化使大语言模型成为更好的辩论者

Danqing Wang, Zhuorui Ye, Xinran Zhao, Fei Fang, Lei Li

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划推理 :planning(title);reasoning(abstract);分类 cs.CL

AI总结 TreeDebater通过引入树状结构提升辩论策略,实现辩论说服力和胜率的显著提升。

Comments 9 main pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03790 2025-12-22 cs.CL cs.LG stat.ML 73%

Sample, Don't Search: Rethinking Test-Time Alignment for Language Models

样本,而非搜索:重新思考语言模型的测试时间对齐

Gonçalo Faria, Noah A. Smith

机构 * University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究院)

专题命中 规划推理 :reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.LG

AI总结 QAlign通过增加测试时间计算量,改进语言模型输出对齐,优于现有方法如best-of-n和多数投票。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10321 2025-12-22 cs.LG stat.ML 70%

Towards Human-Guided, Data-Centric LLM Co-Pilots

面向人类指导、数据导向的LLM协同助手

Evgeny Saveliev, Jiashuo Liu, Nabeel Seedat, Anders Boyd, Mihaela van der Schaar

机构 * University of Cambridge(剑桥大学) Tsinghua University(清华大学) Amsterdam University Medical Centers(阿姆斯特丹大学医学中心)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 CliMB-DC是一种结合人类指导和数据导向工具的LLM协同助手框架,旨在提升领域专家在复杂数据处理中的能力。

Comments Saveliev, Liu & Seedat contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15068 2025-12-22 cs.LG cs.AI cs.CL 67%

The Semantic Illusion: Certified Limits of Embedding-Based Hallucination Detection in RAG Systems

语义幻觉:基于嵌入的幻觉检测在RAG系统中的认证极限

Debu Sinha

机构 * Independent Researcher(独立研究者)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示了基于嵌入的幻觉检测在RAG系统中存在语义幻觉问题,通过符合预测方法发现真实幻觉检测的挑战,证明需通过推理而非表面语义解决。

Comments 12 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17267 2025-12-22 cs.CL cs.AI 62%

AutoMetrics: Approximate Human Judgements with Automatically Generated Evaluators

AutoMetrics: 通过自动生成评估器进行近似人类判断

Michael J. Ryan, Yanzhe Zhang, Amol Salunkhe, Yi Chu, Di Xu, Diyi Yang

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 AutoMetrics通过自动生成评估器,在低数据条件下提升与人类评分的相关性,提高Kendall相关性达33.4%,并提供可解释的自动指标工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17488 2025-12-22 cs.CV cs.LG 57%

TwinSegNet: A Digital Twin-Enabled Federated Learning Framework for Brain Tumor Analysis

TwinSegNet: 一种基于数字孪生的联邦学习框架用于脑肿瘤分析

Almustapha A. Wakili, Adamu Hussaini, Abubakar A. Musa, Woosub Jung, Wei Yu

机构 * Department of Computer Science and Information Sciences, Towson University, USA(塔森大学计算机科学与信息科学系)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 TwinSegNet通过整合混合ViT-UNet模型与个性化数字孪生,实现了隐私保护的联邦学习框架,用于准确且实时的脑肿瘤分割。

Comments IEEE Virtual Conference on Communications. 4-6 November 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17250 2025-12-22 cs.AI 57%

Accelerating Multi-modal LLM Gaming Performance via Input Prediction and Mishit Correction

通过输入预测和误位修正加速多模态大语言模型游戏性能

Ziyang Lin, Zixuan Sun, Sanhorn Chen, Xiaoyang Chen, Roy Zhao

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 通过输入预测和误位修正方法,显著降低多模态大语言模型游戏性能的推理延迟,提升整体控制效果。

Comments UIUC 25 Fall CS 498

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17735 2025-12-22 q-bio.NC 50%

Gravity Prior and Temporal Horizon Shape Interceptive Behavior under Active Inference

引力先验与时间地平线塑造主动推断下的拦截行为

Marta Russo, Antonella Maselli, Federico Maggiore, Giovanni Pezzulo

专题命中 规划推理 :planning(abstract)

AI总结 本研究探讨了重力先验和时间地平线对主动推断中拦截行为的影响,发现结合重力和更长预测地平线的策略在准确性与轨迹平滑度上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 1 篇

2511.22685 2025-12-22 cs.RO 50%

Deadlock-Free Hybrid RL-MAPF Framework for Zero-Shot Multi-Robot Navigation

无死锁的混合式RL-MAPF框架用于零样本多机器人导航

Haoyi Wang, Licheng Luo, Yiannis Kantaros, Bruno Sinopoli, Mingyu Cai

机构 * Department of Mechanical Engineering University of California Riverside CA USA(加州大学河滨分校机械工程系) Department of Electrical and Systems Engineering Washington University in St. Louis MO USA(华盛顿大学圣路易斯分校电气与系统工程系)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出一种无死锁的混合RL-MAPF框架,通过整合反应性RL导航与按需MAPF干预,实现零样本多机器人导航的鲁棒性能。

Comments 18 pages (including appendix), 3 figures. Project page (videos, animations, additional resources): https://wanghaoyi518.github.io/rl-mapf-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 测试时计算 3 篇

2512.17206 2025-12-22 cs.CV 82%

Reasoning Palette: Modulating Reasoning via Latent Contextualization for Controllable Exploration for (V)LMs

推理调色板:通过潜在上下文化调节推理以实现可控探索用于(V)LMs

Rujiao Long, Yang Li, Xingyao Zhang, Weixun Wang, Tianqianjin Lin, Xi Zhao, Yuchi Xu, Wenbo Su, Junchi Yan, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 测试时计算 :reasoning(title,abstract);planning(abstract)

AI总结 Reasoning Palette通过引入潜在变量调节模型推理策略,提升可控探索和持续学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10501 2025-12-22 cs.AI cs.LG 81%

PASS: Probabilistic Agentic Supernet Sampling for Interpretable and Adaptive Chest X-Ray Reasoning

基于概率代理超网采样的可解释和自适应胸片推理系统

Yushi Feng, Junye Du, Yingying Hong, Qifan Wang, Lequan Yu

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 PASS通过概率代理超网采样实现可解释、自适应和多模态的胸片推理,提升医疗AI的安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22376 2025-12-22 cs.LG cs.AI cs.CL 67%

OptScale: Probabilistic Optimality for Inference-time Scaling

OptScale: 推断时间缩放的概率最优性

Youkang Wang, Jian Wang, Rubing Chen, Xiao-Yong Wei

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 OptScale通过概率框架和动态样本决策,提升LLMs推理性能并减少采样开销。

Comments Accepted by AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 复杂问题求解 5 篇

2512.16970 2025-12-22 cs.AI cs.CL cs.LG cs.MA 75%

PAACE: A Plan-Aware Automated Agent Context Engineering Framework

PAACE:一种计划感知的自动代理上下文工程框架

Kamer Ali Yuksel

机构 * Kamer Ali Yuksel(独立研究者)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PAACE通过计划感知的上下文工程框架提升LLM代理的准确性并减少上下文负载,实现高效多步骤任务处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06813 2025-12-22 cs.AI cs.MA cs.SI 70%

Richelieu: Self-Evolving LLM-Based Agents for AI Diplomacy

Richelieu: 基于大语言模型的自进化AI外交代理

Zhenyu Guan, Xiangyu Kong, Fangwei Zhong, Yizhou Wang

机构 * Institute for Artificial Intelligence(人工智能研究院) Computer School(计算机学院) School of Artificial Intelligence(人工智能学院) Center on Frontiers of Computing Studies(计算前沿研究中心) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) Nat’l Eng. Research Center of Visual Technology(视觉技术国家工程研究中心) State Key Lab of General Artificial Intelligence(通用人工智能国家重点实验室) BIGAI

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 Richelieu通过整合战略规划、目标导向谈判和自我进化能力,开发出能执行复杂多代理任务的AI外交代理。

Journal ref NuerIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25123 2025-12-22 cs.AI cs.CL 62%

From $f(x)$ and $g(x)$ to $f(g(x))$: LLMs Learn New Skills in RL by Composing Old Ones

从f(x)和g(x)到f(g(x)):通过组合已有技能,LLMs在强化学习中学习新技能

Lifan Yuan, Weize Chen, Yuchen Zhang, Ganqu Cui, Hanbin Wang, Ziming You, Ning Ding, Zhiyuan Liu, Maosong Sun, Hao Peng

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过强化学习使LLMs组合已有技能学习新能力,揭示强化学习在提升模型复杂任务处理能力中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15877 2025-12-22 cs.LG cs.AR cs.CL 62%

Basis Selection: Low-Rank Decomposition of Pretrained Large Language Models for Target Applications

基底选择:为特定应用预训练大语言模型的低秩分解

Yang Li, Daniel Agyei Asante, Changsheng Zhao, Ernie Chang, Yangyang Shi, Vikas Chandra

机构 * Iowa State University(爱荷华州立大学) Meta

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种针对特定应用的LLM低秩分解方法,通过识别并去除冗余部分,有效压缩模型大小并保持性能。

Comments Transactions on Machine Learning Research (TMLR), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20494 2025-12-22 cs.LG cs.MM 57%

Multimodal Representation Learning and Fusion

多模态表示学习与融合

Qihang Jin, Enze Ge, Yuhang Xie, Hongying Luo, Junhao Song, Ziqian Bi, Chia Xin Liang, Jibin Guan, Joe Yeong, Xinyuan Song, Junfeng Hao

机构 * AI Agent Lab, Vokram Group, United Kingdom(AI代理实验室,Vokram集团,英国) University of Bologna, Italy(博洛尼亚大学,意大利) University of Minnesota, United States(明尼苏达大学,美国) Singapore General Hospital, Singapore(新加坡中央医院,新加坡) Emory University, United States(埃默里大学,美国)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 多模态学习通过融合多种数据模态提升AI系统的理解和决策能力,旨在解决数据格式差异、输入缺失及对抗攻击等问题,推动计算机视觉、自然语言处理等领域的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 推理评测 18 篇

2510.16442 2025-12-22 cs.CV cs.AI 83%

EDVD-LLaMA: Explainable Deepfake Video Detection via Multimodal Large Language Model Reasoning

EDVD-LLaMA: 通过多模态大语言模型推理进行可解释的深度伪造视频检测

Haoran Sun, Chen Cai, Huiping Zhuang, Kong Aik Lee, Lap-Pui Chau, Yi Wang

机构 * Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(电子与电气工程系,香港理工大学) School of Electrical and Electronic Engineering, Nanyang Technological University(电子与电气工程学院,南洋理工大学) Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(智能工程学院,华南理工大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 EDVD-LLaMA通过多模态大语言模型推理实现深度伪造视频检测的可解释性,结合时空特征提取和细粒度推理机制,提升检测准确性与解释可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17901 2025-12-22 cs.AI cs.CL 81%

When Reasoning Meets Its Laws

当推理遇见其定律

Junyu Zhang, Yifan Sun, Tianang Leng, Jingyan Shen, Liu Ziyin, Paul Pu Liang, Huan Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Massachusetts Institute of Technology(麻省理工学院) University of Pennsylvania(宾夕法尼亚大学) New York University(纽约大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出推理定律(LoRe)框架,通过单调性和组合性属性评估推理模型,开发微调方法提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17532 2025-12-22 cs.CV cs.AI 79%

Robust-R1: Degradation-Aware Reasoning for Robust Visual Understanding

Robust-R1: 为鲁棒视觉理解的退化感知推理

Jiaqi Tang, Jianmin Chen, Wei Wei, Xiaogang Xu, Runtao Liu, Xiangyu Wu, Qipeng Xie, Jiafei Wu, Lei Zhang, Qifeng Chen

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 Robust-R1通过结构化推理链显式建模视觉退化,提升多模态大语言模型在现实世界退化下的鲁棒性与抗干扰能力。

Comments Accepted by AAAI2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17255 2025-12-22 q-bio.NC cs.AI 79%

From Priors to Predictions: Explaining and Visualizing Human Reasoning in a Graph Neural Network Framework

从先验到预测:在图神经网络框架中解释和可视化人类推理

Quan Do, Caroline Ahn, Leah Bakst, Michael Pascale, Joseph T. McGuire, Chantal E. Stern, Michael E. Hasselmo

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出基于图神经网络的框架,通过显式先验建模人类推理中的归纳偏置,揭示个体差异及泛化依赖的结构和内部处理机制。

Comments 44 pages, 7 figures, 3 suppl figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17559 2025-12-22 cs.AI 70%

Towards Explainable Conversational AI for Early Diagnosis with Large Language Models

迈向具有大语言模型的可解释对话AI用于早期诊断

Maliha Tabassum, M Shamim Kaiser

机构 * Department of Information and Communication Technology(信息与通信技术系) Bangladesh University of Professionals(孟加拉专业大学) Institute of Information Technology(信息技术研究所) Jahangirnagar University(贾汗吉尔纳瓦德大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本研究提出基于大语言模型的可解释对话AI,用于提高早期诊断的透明性和互动性,实验显示其在诊断准确性上优于传统机器学习模型。

详情

展开后加载摘要…

URL PDF HTML 收藏