arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-15 至 2025-12-15 共收录 53 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 4 篇

2510.16309 2025-12-15 cs.AI 88%

MedRule-KG: A Knowledge-Graph--Steered Scaffold for Mathematical Reasoning with a Lightweight Verifier

MedRule-KG:一种由知识图谱引导的轻量级验证器支持的数学推理框架

Crystal Su

专题命中 数学推理 :reasoning(title,abstract);verifier(title,abstract);分类 cs.AI

AI总结 MedRule-KG通过结合知识图谱和轻量级验证器,提升数学推理的准确性和规则一致性。

Comments This paper is withdrawn due to issues with attribution and citation accuracy

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12963 2025-12-15 cs.AI 85%

MedRule-KG: A Knowledge-Graph--Steered Scaffold for Reliable Mathematical and Biomedical Reasoning

MedRule-KG: 一种基于知识图谱的可靠数学和生物医学推理框架

Crystal Su

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);verifier(abstract);分类 cs.AI

AI总结 MedRule-KG通过知识图谱框架和轻量验证器,提升科学推理和药物发现的可靠性与准确性。

Comments This paper is withdrawn due to issues with attribution and citation accuracy

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00900 2025-12-15 cs.AI cs.CL 81%

From Next-Token to Mathematics: The Learning Dynamics of Mathematical Reasoning in Language Models

从单个词到数学:语言模型中数学推理学习动态

Shubhra Mishra, Gabriel Poesia, Noah D. Goodman

机构 * Department of Computer Science 1 and Psychology 2(计算机科学系和心理学系) Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究分析了语言模型在预训练和后训练过程中数学推理能力的发展,揭示了数学技能学习顺序与课程设计的相关性,并探讨了指令微调对不同数学技能的影响。

Comments Accepted to COLM 2025. Dataset and code: https://github.com/gpoesia/mathcamps/

Journal ref Conference on Language Modeling (COLM), Montreal, Canada, October 7-10, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05943 2025-12-15 cs.AI 79%

TRACE: A Framework for Analyzing and Enhancing Stepwise Reasoning in Vision-Language Models

TRACE:一种用于分析和增强视觉-语言模型逐步推理的框架

Shima Imani, Seungwhan Moon, Lambert Mathias, Lu Zhang, Babak Damavandi

机构 * Meta Reality Lab(Meta现实实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 TRACE通过辅助推理集和一致性评估,提升视觉-语言模型的推理透明性和错误检测能力,促进模型改进和优化。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 逻辑推理 5 篇

2512.10978 2025-12-15 q-bio.NC cs.AI 85%

Cognitive Mirrors: Exploring the Diverse Functional Roles of Attention Heads in LLM Reasoning

认知镜像:探索大语言模型推理中注意力头的多样化功能角色

Xueqi Ma, Jun Wang, Yanbei Jiang, Sarah Monazam Erfani, Tongliang Liu, James Bailey

机构 * The University of Melbourne(墨尔本大学) The University of Sydney(悉尼大学) Amazon(亚马逊公司)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 本文提出认知镜像框架,通过CogQA数据集分析LLM中注意力头的功能专业化,揭示其在推理任务中的关键作用。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11620 2025-12-15 cs.RO cs.SY eess.SY 67%

Architecting Large Action Models for Human-in-the-Loop Intelligent Robots

为具有人类在环的智能机器人构建大型动作模型

Kanisorn Sangchai, Methasit Boonpun, Withawin Kraipetchara, Paulo Garcia

专题命中 逻辑推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出通过整合符号方法与现成模型构建可验证的神经符号智能机器人动作模型,以提升可靠性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11421 2025-12-15 cs.AI 57%

Towards Trustworthy Multi-Turn LLM Agents via Behavioral Guidance

通过行为指导实现可信的多轮大语言模型代理

Gonca Gürsun

机构 * Gonca Gürsun(独立研究者)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种框架,通过行为指导使大语言模型代理在多轮任务中实现可靠和可验证的行为。

Comments Accepted to AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26898 2025-12-15 cs.LG 57%

Integrating Ontologies with Large Language Models for Enhanced Control Systems in Chemical Engineering

将本体与大语言模型结合以增强化工工程中的控制系统

Crystal Su, Kuai Yu, Jingrui Zhang, Mingyuan Shao, Daniel Bauer

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出结合本体的LLM框架,用于增强化工工程控制系统,通过结构化知识与生成推理结合,提升过程控制和安全分析的可解释性和可靠性。

Comments This paper is withdrawn due to issues with attribution and citation accuracy

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11275 2025-12-15 cs.RO 50%

Towards Logic-Aware Manipulation: A Knowledge Primitive for VLM-Based Assistants in Smart Manufacturing

面向逻辑感知的操控:一种用于智能制造中基于VLM助手的知识原语

Suchang Chen, Daqiang Guo

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 逻辑推理 :planning(abstract)

AI总结 本文提出了一种面向智能制造的基于VLM助手的知识原语,通过定义对象为中心的操控-逻辑模式,实现了在制造单元中执行复杂操控任务的逻辑感知和高效规划。

Comments 8 pages, 2 figures, submitted to the 2026 IFAC World Congress

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 规划推理 9 篇

2512.11271 2025-12-15 cs.AI 83%

TriFlow: A Progressive Multi-Agent Framework for Intelligent Trip Planning

TriFlow:一种渐进式多智能体框架用于智能行程规划

Yuxing Chen, Basem Suleiman, Qifan Chen

机构 * The University of Sydney(悉尼大学) University of New South Wales(新南威尔士大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 TriFlow通过检索、规划和治理三阶段流程,实现了在严格约束下高效生成个性化行程的智能规划框架。

Comments 4 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11143 2025-12-15 cs.CR 82%

Automated Penetration Testing with LLM Agents and Classical Planning

基于LLM代理和经典规划的自动化渗透测试

Lingzhi Wang, Xinyi Shi, Ziyu Li, Yi Jiang, Shiyu Tan, Yuhao Jiang, Junjie Cheng, Wenyuan Chen, Xiangmin Shen, Zhenyuan LI, Yan Chen

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 本文提出CHECKMATE框架,结合增强的经典规划与LLM代理,提升渗透测试能力、稳定性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10313 2025-12-15 cs.AI cs.CY 79%

EpiPlanAgent: Agentic Automated Epidemic Response Planning

EpiPlanAgent:基于代理的自动化疫情响应规划

Kangkun Mao, Fang Xu, Jinru Ding, Yidong Jiang, Yujun Yao, Yirong Chen, Junming Liu, Xiaoqin Wu, Qian Wu, Xiaoyan Huang, Jie Xu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Center For Disease Control and Prevention(上海市疾病预防控制中心)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 EpiPlanAgent利用大语言模型和多代理框架,实现自动化疫情响应规划,显著提升计划完整性并减少开发时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11096 2025-12-15 cs.HC 78%

Your plan may succeed, but what about failure? Investigating how people use ChatGPT for long-term life task planning

你的计划可能成功,但失败呢?探究人们如何利用ChatGPT进行长期生活任务规划

Ben Wang, Jiqun Liu

专题命中 规划推理 :planning(title,abstract)

AI总结 研究探讨人们如何利用ChatGPT进行长期生活任务规划,发现AI在结构化目标和生成想法方面有帮助,但输出缺乏个性化和适应性,需用户主动调整。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11464 2025-12-15 cs.CV cs.AI cs.LG 73%

Exploring MLLM-Diffusion Information Transfer with MetaCanvas

探索MLLM-扩散信息传输与MetaCanvas

Han Lin, Xichen Pan, Ziqi Huang, Ji Hou, Jialiang Wang, Weifeng Chen, Zecheng He, Felix Juefei-Xu, Junzhe Sun, Zhipeng Fan, Ali Thabet, Mohit Bansal, Chu Wang

机构 * Meta Superintelligence Labs(Meta 超智能实验室) New York University(纽约大学) Nanyang Technological University(南洋理工大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 MetaCanvas通过使MLLMs在潜在空间中推理和规划,提升多模态生成的精确度和结构化控制。

Comments Project page: https://metacanvas.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07020 2025-12-15 cs.RO cs.AI cs.LG 73%

Driving Through Uncertainty: Risk-Averse Control with LLM Commonsense for Autonomous Driving under Perception Deficits

在不确定性中驾驶:利用大语言模型常识实现风险厌恶控制以应对自动驾驶中的感知缺陷

Yuting Hu, Chenhui Xu, Ruiyang Qin, Dancheng Liu, Amir Nassereldine, Yiyu Shi, Jinjun Xiong

机构 * University at Buffalo(布法罗大学) University of Notre Dame(诺特尔大学)

专题命中 规划推理 :planning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LLM-RCO框架,利用大语言模型整合人类驾驶常识,以提升自动驾驶在感知缺陷下的风险规避与适应性控制能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03343 2025-12-15 cs.CL cs.AI 62%

Idea-Gated Transformers: Enforcing Semantic Coherence via Differentiable Vocabulary Pruning

Idea-Gated Transformers: 通过可微分词汇修剪强制语义一致性

Darshan Fofadiya

机构 * Darshan Fofadiya(独立研究者)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 Idea-Gated Transformers通过可微分词汇修剪机制,实现语义一致性,提升语言模型的领域保留能力与生成可控性。

Comments Code available at https://github.com/DarshanFofadiya/idea-gated-transformers/tree/main

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15447 2025-12-15 cs.AI cs.LG 62%

From Bits to Boardrooms: A Cutting-Edge Multi-Agent LLM Framework for Business Excellence

从比特到董事会:一种面向企业卓越的多智能体大语言模型框架

Zihao Wang, Junming Zhang

机构 * College of Artificial Intelligence and Automation(人工智能与自动化学院) Hohai University(河海大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 BusiAgent是一种基于多智能体框架的LLM,通过整合CTMDP、熵度量和Stackelberg博弈等创新技术,提升企业决策的效率与质量。

Comments Accepted by ECAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10971 2025-12-15 q-fin.CP cs.CE 50%

AI-Trader: Benchmarking Autonomous Agents in Real-Time Financial Markets

AI-Trader: 评估实时金融市场中的自主代理

Tianyu Fan, Yuhao Yang, Yangqin Jiang, Yifei Zhang, Yuxuan Chen, Chao Huang

专题命中 规划推理 :reasoning(abstract)

AI总结 AI-Trader通过实时评估LLM在金融市场的表现,揭示了自主代理在风险控制和流动性中的关键局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视觉空间推理 4 篇

2507.02925 2025-12-15 cs.LG cs.CL q-bio.BM 62%

Large Language Model Agent for Modular Task Execution in Drug Discovery

用于药物发现模块化任务执行的大型语言模型代理

Janghoon Ock, Radheesh Sharma Meda, Srivathsan Badrinarayanan, Neha S. Aluru, Achuth Chandrasekhar, Amir Barati Farimani

机构 * Department of Chemical Engineering, Carnegie Mellon University(化学工程系,卡内基梅隆大学) Department of Material Science and Engineering, Carnegie Mellon University(材料科学与工程系,卡内基梅隆大学) Department of Mechanical Engineering, Carnegie Mellon University(机械工程系,卡内基梅隆大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种基于大型语言模型的模块化框架,用于药物发现中的任务执行,通过自动化分子生成和属性预测提升药物筛选效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10501 2025-12-15 cs.AI 57%

Zero-shot 3D Map Generation with LLM Agents: A Dual-Agent Architecture for Procedural Content Generation

无监督3D地图生成与LLM代理:一种双代理架构用于程序化内容生成

Lim Chien Her, Ming Yan, Yunshu Bai, Ruihao Li, Hao Zhang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种双代理架构,利用LLM代理实现无监督3D地图生成,通过迭代推理优化参数配置,提升PCG指令遵循能力。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11490 2025-12-15 cs.CV cs.IR 50%

VLM2GeoVec: Toward Universal Multimodal Embeddings for Remote Sensing

VLM2GeoVec:迈向通用遥感多模态嵌入

Emanuel Sánchez Aimar, Gulnaz Zhambulova, Fahad Shahbaz Khan, Yonghao Xu, Michael Felsberg

机构 * Linköping University(_linköping大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 VLM2GeoVec通过单编码器对比学习实现遥感多模态嵌入,统一可扩展检索与区域推理,提升遥感场景分析的连贯性。

Comments 21 pages, 7 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21451 2025-12-15 cs.CV 50%

MM-SeR: Multimodal Self-Refinement for Lightweight Image Captioning

MM-SeR: 多模态自反思用于轻量级图像描述

Junha Song, Yongsik Jo, So Yeon Min, Quanting Xie, Taehwan Kim, Yonatan Bisk, Jaegul Choo

机构 * KAIST(韩国科学技术院) UNIST(全南国立大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 MM-SeR通过轻量级多模态自反思框架,在减少计算成本的同时,实现了与大规模模型相当的图像描述性能,并扩展到长距离视频问答任务。

Comments Project page: https://sites.google.com/view/junha/mm-ser

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 测试时计算 3 篇

2502.18581 2025-12-15 cs.CL cs.AI cs.LG 75%

Scalable Best-of-N Selection for Large Language Models via Self-Certainty

通过自我确定性实现大规模语言模型的可扩展最佳-N选择

Zhewei Kang, Xuandong Zhao, Dawn Song

机构 * UC Berkeley(伯克利大学)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出自我确定性方法,通过利用LLM输出的概率分布,高效提升大规模语言模型的推理能力,适用于多种推理任务和开放性生成场景。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11718 2025-12-15 cs.CL 57%

Speculative Decoding Speed-of-Light: Optimal Lower Bounds via Branching Random Walks

投机解码速度光速:通过分支随机游走建立最优下界

Sergey Pankratov, Dan Alistarh

机构 * ISTA Red Hat AI(红帽AI)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 通过分支随机游走分析,研究确定了投机解码算法的最优运行时间下界,并通过实验验证了理论结果的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07299 2025-12-15 cs.CV 50%

VADER: Towards Causal Video Anomaly Understanding with Relation-Aware Large Language Models

VADER:基于关系感知大型语言模型的因果视频异常理解

Ying Cheng, Yu-Ho Lin, Min-Hung Chen, Fu-En Yang, Shang-Hong Lai

机构 * National Tsing Hua University(清华大学) NVIDIA

专题命中 测试时计算 :reasoning(abstract)

AI总结 VADER通过整合关系感知的大型语言模型与视频关键帧特征,提升视频异常的因果理解与解释能力。

Comments Accepted to WACV 2026. Project page available at: https://vader-vau.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 复杂问题求解 8 篇

2512.11558 2025-12-15 cs.CV cs.AI cs.CL 81%

DentalGPT: Incentivizing Multimodal Complex Reasoning in Dentistry

DentalGPT: 促进牙科多模态复杂推理的激励机制

Zhenyang Cai, Jiaming Zhang, Junjie Zhao, Ziyi Zeng, Yanchao Li, Jingyi Liang, Junying Chen, Yunjin Yang, Jiajun You, Shuzhi Deng, Tongfei Wang, Wanting Chen, Chunxiu Hao, Ruiqi Xie, Zhenwei Wen, Xiangyi Feng, Zou Ting, Jin Zou Lin, Jianquan Li, Guangjun Yu, Liangyi Chen, Junwen Wang, Shan Jiang, Benyou Wang

机构 * Shenzhen Stomatology Hospital (Pingshan) of Southern Medical University(南方医科大学深圳口腔医院(平山)) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) State Key Laboratory of Membrane Biology, Beijing Key Laboratory of Cardiometabolic Molecular Medicine, Institute of Molecular Medicine, National Biomedical Imaging Center, School of Future Technology, Peking University(北京大学膜生物学国家重点实验室、北京心代谢分子医学重点实验室、分子医学研究院、国家生物医学成像中心、未来技术学院) Freedom AI Division of Applied Oral Sciences & Community Dental Care Faculty of Dentistry, The University of Hong Kong(香港大学牙科学院应用口腔科学与社区牙科护理系) Beijing Institute of Collaborative Innovation(北京协同创新研究院) National Health Data Institute, Shenzhen(深圳国家健康数据研究院) Shenzhen Loop Area Institute(深圳河套学院) Shenzhen Institute of Big Data(深圳大数据研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 DentalGPT通过高质量数据和强化学习提升牙科多模态推理能力,实现优于现有模型的诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11463 2025-12-15 cs.AI 79%

Motif-2-12.7B-Reasoning: A Practitioner's Guide to RL Training Recipes

Motif-2-12.7B-Reasoning: 一个实践者在强化学习训练配方中的指南

Junghwan Lim, Sungmin Lee, Dongseok Kim, Taehyun Kim, Eunhwan Park, Jeesoo Lee, Jeongdoo Lee, Junhyeok Lee, Wai Ting Cheung, Dahye Choi, Minsu Ha, Jaeheui Her, Jaeyeon Huh, Hanbin Jung, Changjin Kang, Beomgyu Kim, Minjae Kim, Taewhan Kim, Youngrok Kim, Hyukjin Kweon, Haesol Lee, Kungyu Lee, Dongpin Oh, Yeongjae Park, Bokki Ryu, Dongjoo Weon

机构 * Motif Technologies(Motif技术公司)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 Motif-2-12.7B-Reasoning通过综合训练配方,在复杂推理和长上下文理解中实现性能媲美更大参数模型,提供开源模型和可扩展的推理能力蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11109 2025-12-15 cs.LG 79%

Limits and Gains of Test-Time Scaling in Vision-Language Reasoning

视觉语言推理中测试时扩展的极限与收益

Mohammadjavad Ahmadpour, Amirmahdi Meighani, Payam Taebi, Omid Ghahroodi, Amirmohammad Izadi, Mahdieh Soleymani Baghshah

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 研究探讨了测试时扩展在视觉语言推理中的效果,发现其在不同任务和模型上表现不一,需根据具体需求定制策略。

Comments Mohammadjavad Ahmadpour and Amirmadhi Meighani contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11167 2025-12-15 cs.CV cs.AI 74%

Image Tiling for High-Resolution Reasoning: Balancing Local Detail with Global Context

图像分块用于高分辨率推理:在局部细节与全局上下文之间取得平衡

Anatole Jacquin de Margerie, Alexis Roger, Irina Rish

专题命中 复杂问题求解 :reasoning(title);分类 cs.AI

AI总结 本文通过图像分块技术实现高分辨率图像理解,验证了局部细节恢复的有效性,并探讨了全局上下文对模型性能的影响。

Comments Accepted in AAAI 2025 Workshop on Reproducible AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05103 2025-12-15 cs.LG cs.AI cs.CL cs.CV 67%

TV2TV: A Unified Framework for Interleaved Language and Video Generation

TV2TV:一种用于交错语言和视频生成的统一框架

Xiaochuang Han, Youssef Emad, Melissa Hall, John Nguyen, Karthik Padthe, Liam Robbins, Amir Bar, Delong Chen, Michal Drozdzal, Maha Elbayad, Yushi Hu, Shang-Wen Li, Sreya Dutta Roy, Jakob Verbeek, XuDong Wang, Marjan Ghazvininejad, Luke Zettlemoyer, Emily Dinan

机构 * Meta FAIR

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TV2TV通过统一框架实现语言与视频生成的交错过程,提升视频生成的视觉质量和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏