arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-30 至 2025-12-30 共收录 87 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 6 篇

2512.22774 2025-12-30 cs.LG cs.CV 79%

Schrodinger AI: A Unified Spectral-Dynamical Framework for Classification, Reasoning, and Operator-Based Generalization

薛定谔AI:一种用于分类、推理和基于算子的泛化统一频谱-动态框架

Truong Son Nguyen

机构 * Arizona State University(亚利桑那州立大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 薛定谔AI通过统一频谱-动态框架实现分类、推理和基于算子的泛化,提供稳健的泛化能力与可解释的语义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14973 2025-12-30 cs.CL cs.AI cs.LG 67%

Attention Is All You Need for KV Cache in Diffusion LLMs

注意力是扩散大语言模型中KV缓存的所有需求

Quan Nguyen-Tri, Mukul Ranjan, Zhiqiang Shen

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Elastic-Cache方法,通过适应性缓存更新提升扩散LLM的解码效率和生成质量。

Comments Code at: https://github.com/VILA-Lab/Elastic-Cache

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22492 2025-12-30 cs.DC cs.AI cs.LG 62%

Role-Based Fault Tolerance System for LLM RL Post-Training

基于角色的LLM强化学习后训练容错系统

Zhenqian Chen, Baoquan Zhong, Xiang Li, Qing Dai, Xinkui Zhao, Miao Ye, Ren Cheng, Lufei Zhang, Jianwei Yin

机构 * Zhejiang University(浙江大学) State Key Laboratory of Mathematical Engineering and Advanced Computing(数学工程与先进计算国家重点实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 RobustRL通过基于角色的故障隔离技术,有效提升LLM强化学习后训练的容错性能,实现训练时间比率提升80%以上。

Comments 16 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22309 2025-12-30 cs.LG cs.AI 62%

LLMBoost: Make Large Language Models Stronger with Boosting

LLMBoost: 通过提升使大型语言模型更强

Zehao Chen, Tianxiang Ai, Yifei Li, Gongxun Li, Yuyang Wei, Wang Zhou, Guanghui Li, Bin Yu, Zhijun Chen, Hailong Sun, Fuzhen Zhuang, Jianxin Li, Deqing Wang, Yikun Ban

机构 * Beihang University(北航大学) China Telecom eSurfing Cloud(中国电信云)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 LLMBoost通过引入跨模型注意力机制、链式训练范式和近似并行推理范式,提升大型语言模型的性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22944 2025-12-30 cs.LG 57%

Multiple Token Divergence: Measuring and Steering In-Context Computation Density

多令牌分歧:测量和引导上下文计算密度

Vincent Herrmann, Eric Alcaide, Michael Wand, Jürgen Schmidhuber

机构 * The Swiss AI Lab IDSIA/USI/SUPSI(瑞士人工智能实验室IDSIA/USI/SUPSI) King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹大学科学与技术)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 多令牌分歧通过测量语言模型的计算努力,提供了一种轻量级工具,用于分析和引导生成文本的计算动态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18841 2025-12-30 cs.CL 57%

MDToC: Metacognitive Dynamic Tree of Concepts for Boosting Mathematical Problem-Solving of Large Language Models

MDToC:元认知动态概念树用于提升大语言模型的数学问题解决能力

Tung Duong Ta, Tim Oates, Thien Van Luong, Huan Vu, Tien Cuong Nguyen

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校) National Economics University(国家经济大学) VNPT AI

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 MDToC通过构建概念树和多数投票机制,提升大语言模型在数学问题解决中的准确性与验证能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 2 篇

2512.12620 2025-12-30 cs.CL cs.AI 81%

Understanding Syllogistic Reasoning in LLMs from Formal and Natural Language Perspectives

从形式和自然语言角度理解大语言模型中的三段论推理

Aheli Poddar, Saptarshi Sahoo, Sujata Ghosh

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文从形式和自然语言角度研究大语言模型的三段论推理能力,通过测试14种模型的符号推理和自然语言理解,探讨大语言模型是否正向形式化推理机制发展。

Comments 9 pages, 4 figures, 5 tables. Accepted at AAAI 2026 Bridge Program on Logic & AI. Code available at https://github.com/XAheli/Logic-in-LLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22892 2025-12-30 stat.AP 50%

Counterfactual Harm: A Counter-argument

反事实伤害:一种反论点

Amit N. Sawant, Mats J. Stensrud

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文指出基于反事实的伤害定义在多治疗选项场景下会产生不一致性,提出基于预期效用的干预定义以确保治疗排名的传递性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 6 篇

2512.23515 2025-12-30 q-fin.TR cs.AI cs.CE cs.LG 81%

Alpha-R1: Alpha Screening with LLM Reasoning via Reinforcement Learning

Alpha-R1:通过强化学习实现基于LLM的Alpha筛选

Zuoyou Jiang, Li Zhao, Rui Sun, Ruohan Sun, Zhongjian Li, Jing Li, Daxin Jiang, Zuo Bai, Cheng Hua

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 Alpha-R1通过强化学习实现基于LLM的上下文感知alpha筛选,提升非平稳市场中的投资策略性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23222 2025-12-30 cs.CV cs.MM 67%

Bridging Your Imagination with Audio-Video Generation via a Unified Director

通过统一导演模型实现想象力与音频视频生成的连接

Jiaxu Zhang, Tianshu Hu, Yuan Zhang, Zenan Li, Linjie Luo, Guosheng Lin, Xin Chen

机构 * Nanyang Technological University(南洋理工大学)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract)

AI总结 UniMAGE通过统一导演模型整合脚本起草与关键帧生成,提升非专业人士制作多镜头电影的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22336 2025-12-30 cs.AI cs.CL 62%

Agent2World: Learning to Generate Symbolic World Models via Adaptive Multi-Agent Feedback

Agent2World: 通过自适应多智能体反馈学习生成符号世界模型

Mengkang Hu, Bowei Xia, Yuran Wu, Ailing Yu, Yude Zou, Qiguang Chen, Shijian Wang, Jiarui Jin, Kexin Li, Wenxiang Jiao, Yuan Lu, Ping Luo

机构 * The University of Hong Kong(香港大学) Xiaohongshu Inc.(小红书公司) UESTC(电子科技大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 逻辑推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 Agent2World通过自适应多智能体反馈学习生成符号世界模型,提升推理和微调性能,实现30.95%的相对提升。

Comments 48 pages, 15 tables, 7 figures, Project page: https://agent2world.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22258 2025-12-30 cs.AI cs.LG cs.LO cs.SC 62%

Logic Sketch Prompting (LSP): A Deterministic and Interpretable Prompting Method

逻辑草图提示(LSP):一种确定性和可解释的提示方法

Satvik Tripathi

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 逻辑草图提示(LSP)通过引入类型变量、确定性条件评估器和规则验证器,提升了大语言模型在需要严格规则遵守、确定性和可审计性任务中的性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17923 2025-12-30 q-fin.ST cs.AI cs.LG 62%

Inferring Latent Market Forces: Evaluating LLM Detection of Gamma Exposure Patterns via Obfuscation Testing

推断潜在市场力量:通过混淆测试评估大语言模型检测伽马暴露模式的能力

Christopher Regan, Ying Xie

机构 * Department of Computer Science Kennesaw State University Marietta, GA, Cobb(计算机科学系 凯尼恩州立大学 马里埃塔, 乔治亚州, 理查兹) Department of Information Technology Professor of Information Technology Kennesaw State University Marietta, GA(信息科技系 信息科技教授 凯尼恩州立大学 马里埃塔, 乔治亚州)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过混淆测试验证大语言模型能否通过因果推理识别结构性市场模式,发现其在无偏提示下检测伽马暴露模式的准确率为71.5%,展示了LLMs在金融机制识别方面的潜力。

Comments 10 pages, 8 figures. Accepted at IEEE Big Data 2025. Extended journal version in preparation. ISBN: 979-8-3315-9447-3/25. Page numbers: 7226-7235

Journal ref 2025 IEEE International Conference on Big Data (Big Data)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23366 2025-12-30 cs.DB cs.AI 57%

AGRO-SQL: Agentic Group-Relative Optimization with High-Fidelity Data Synthesis

AGRO-SQL:基于高保真数据合成的群体相对优化

Cehua Yang, Dongyu Xiao, Junming Lin, Yuyang Song, Hanxu Yan, Shawn Guo, Wei Zhang, Jian Yang, Mingjie Tang, Bryan Dai

机构 * Sichuan University(四川大学) IQuest Research(IQuest研究院) Beihang University(北航大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 AGRO-SQL通过高保真数据合成和群体相对策略优化,提升文本到SQL系统的推理能力与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 17 篇

2512.23167 2025-12-30 cs.AI cs.LG cs.MA 88%

SPIRAL: Symbolic LLM Planning via Grounded and Reflective Search

SPIRAL:通过 grounded 和 reflective 搜索实现符号 LLM 规划

Yifan Zhang, Giridhar Ganapavarapu, Srideepika Jayaraman, Bhavna Agrawal, Dhaval Patel, Achille Fokoue

机构 * IBM T.J. Watson Research Center(IBM TJ沃森研究中心)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);chain-of-thought(abstract);self-correction(abstract)

AI总结 SPIRAL 通过 grounded 和 reflective 搜索实现更稳健高效的 LLM 规划

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14404 2025-12-30 cs.CV 87%

ViC-Bench: Benchmarking Visual-Interleaved Chain-of-Thought Capability in MLLMs with Free-Style Intermediate State Representations

ViC-Bench: 用自由式中间状态表示法对多模态大语言模型的视觉交错链式思维能力进行基准测试

Xuecheng Wu, Jiaxing Liu, Danlei Huang, Yifan Wang, Yunyun Shi, Kedi Chen, Junxiao Xue, Yang Liu, Chunlin Chen, Hairong Dong, Dingkang Yang

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) Meituan Inc.(美团公司) Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) Research Center for Space Computing System, Zhejiang Lab(浙江实验室空间计算系统研究中心) College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) School of Robotics and Automation, Nanjing University(南京大学机器人与自动化学院) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院)

专题命中 规划推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);planning(abstract)

AI总结 ViC-Bench 通过自由式中间状态表示法,系统评估多模态大语言模型的视觉交错链式思维能力,涵盖四个任务并提出新评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22536 2025-12-30 cs.CV cs.AI 83%

CoAgent: Collaborative Planning and Consistency Agent for Coherent Video Generation

CoAgent:协作规划与一致性代理用于连贯视频生成

Qinglin Zeng, Kaitong Cai, Ruiqi Chen, Qinhan Lv, Keze Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 规划推理 :planning(title);reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 CoAgent通过协作框架提升视频生成的连贯性与一致性,采用计划-合成-验证流程优化长视频的叙事质量与视觉一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.13461 2025-12-30 cs.LG cs.AI cs.CV cs.NE q-bio.NC 81%

Active Predictive Coding: A Unified Neural Framework for Learning Hierarchical World Models for Perception and Planning

主动预测编码:一种统一的神经框架,用于学习感知与规划的分层世界模型

Rajesh P. N. Rao, Dimitrios C. Gklezakos, Vishwas Sathish

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出主动预测编码框架,通过分层世界模型解决人工智能中感知与规划的两大核心问题。

Comments 15 pages, 10 figures, 2 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03427 2025-12-30 cs.AI 79%

TPTU: Large Language Model-based AI Agents for Task Planning and Tool Usage

TPTU:基于大型语言模型的AI代理用于任务规划和工具使用

Jingqing Ruan, Yihong Chen, Bin Zhang, Zhiwei Xu, Tianpeng Bao, Guoqing Du, Shiwei Shi, Hangyu Mao, Ziyue Li, Xingyu Zeng, Rui Zhao

机构 * University of Chinese Academy of Sciences(中国科学院大学) SenseTime Research(商汤科技研究院) HKUST(香港科技大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出基于大型语言模型的AI代理框架,设计两种代理类型以提升任务规划和工具使用能力,并通过实验验证其在复杂任务中的有效性。

Comments Accepted in NeurIPS-2023 Workshop on Foundation Models for Decision Making

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20981 2025-12-30 cs.CV cs.CL cs.RO 79%

RefAV: Towards Planning-Centric Scenario Mining

RefAV:面向规划导向的场景挖掘

Cainan Davidson, Deva Ramanan, Neehar Peri

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL

AI总结 RefAV通过视觉-语言模型改进场景挖掘,解决自动驾驶中复杂多智能体交互的定位问题。

Comments Project Page: https://cainand.github.io/RefAV/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22883 2025-12-30 cs.CR cs.AI 70%

Agentic AI for Cyber Resilience: A New Security Paradigm and Its System-Theoretic Foundations

面向网络韧性的代理AI:一种新的安全范式及其系统理论基础

Tao Li, Quanyan Zhu

机构 * Department of Systems Engineering, City University of Hong Kong(香港城市大学系统工程系) Department of Electrical and Computer Engineering, New York University(纽约大学电气与计算机工程系)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出基于代理AI的网络韧性新范式,通过系统理论框架设计自主工作流,利用博弈论实现网络防御与攻击的动态平衡,提升系统在攻击下的持续适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20368 2025-12-30 cs.AI 70%

AI-SearchPlanner: Modular Agentic Search via Pareto-Optimal Multi-Objective Reinforcement Learning

AI-SearchPlanner: 通过帕累托最优多目标强化学习实现模块化代理搜索

Lang Mei, Zhihan Yang, Xiaohan Yu, Huanyao Zhang, Chong Chen

机构 * Huawei Cloud BU, China(华为云业务部,中国) School of Computer Science, Peking University(北京大学计算机学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 AI-SearchPlanner通过帕累托最优多目标强化学习提升冻结QA模型的搜索规划性能,实现模块化代理搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23372 2025-12-30 cs.HC 67%

A Design Space for Intelligent Agents in Mixed-Initiative Visual Analytics

混合倡议式可视化分析中智能代理的设计空间

Tobias Stähle, Matthijs Jansen op de Haar, Sophia Boyer, Rita Sevastjanova, Arpit Narechania, Mennatallah El-Assady

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出了一种混合倡议式可视化分析中智能代理的设计空间框架,通过系统回顾90个系统,提出了六个维度来表征代理能力,并为未来研究提供了方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12018 2025-12-30 cs.CL cs.AI cs.LG 67%

Atom of Thoughts for Markov LLM Test-Time Scaling

思想原子用于马尔可夫LLM测试时间扩展

Fengwei Teng, Quan Shi, Zhaoyang Yu, Jiayi Zhang, Yuyu Luo, Chenglin Wu, Zhijiang Guo

机构 * HKUST(GZ)(香港科技大学(广州)) DeepWisdom(DeepWisdom公司) Renmin University of China(中国人民大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出思想原子(\our),通过马尔可夫链结构与树搜索等技术结合,实现高效推理,提升LLM测试时间扩展性能。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22768 2025-12-30 cs.LG cs.AI stat.ML 62%

Understanding the Mechanisms of Fast Hyperparameter Transfer

理解快速超参数转移的机制

Nikhil Ghosh, Denny Wu, Alberto Bietti

机构 * Flatiron Institute(Flatiron研究所)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了深度学习中快速超参数转移的机制,通过理论分析和实验验证,揭示了转移策略在不同问题结构下的有效性及计算效率。

Comments 43 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23217 2025-12-30 cs.AI 57%

TCEval: Using Thermal Comfort to Assess Cognitive and Perceptual Abilities of AI

TCEval:利用热舒适性评估人工智能的认知与感知能力

Jingming Li

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 TCEval通过热舒适性场景评估AI的跨模态推理、因果关联和适应性决策能力,揭示当前LLM在热舒适性领域存在基础推理能力但缺乏精确因果理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20491 2025-12-30 cs.CL 57%

Step-DeepResearch Technical Report

Step-DeepResearch 技术报告

Chen Hu, Haikuo Du, Heng Wang, Lin Lin, Mingrui Chen, Peng Liu, Ruihang Miao, Tianchi Yue, Wang You, Wei Ji, Wei Yuan, Wenjin Deng, Xiaojian Yuan, Xiaoyun Zhang, Xiangyu Liu, Xikai Liu, Yanming Xu, Yicheng Cao, Yifei Zhang, Yongyao Wang, Yubo Shu, Yurong Zhang, Yuxiang Zhang, Zheng Gong, Zhichao Chang, Binyan Li, Dan Ma, Furong Jia, Hongyuan Wang, Jiayu Liu, Jing Bai, Junlan Liu, Manjiao Liu, Na Wang, Qiuping Wu, Qinxin Du, Shiwei Li, Wen Sun, Yifeng Gong, Yonglin Chen, Yuling Zhao, Yuxuan Lin, Ziqi Ren, Zixuan Wang, Aihu Zhang, Brian Li, Buyun Ma, Kang An, Li Xie, Mingliang Li, Pan Li, Shidong Yang, Xi Chen, Xiaojia Liu, Yuchu Luo, Yuan Song, YuanHao Ding, Yuanwei Liang, Zexi Li, Zhaoning Zhang, Zixin Zhang, Binxing Jiao, Daxin Jiang, Jiansheng Chen, Jing Li, Xiangyu Zhang, Yibo Zhu

机构 * Step-DeepResearch

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 Step-DeepResearch通过原子能力数据合成策略和渐进式训练路径,实现低成本高效率的深度研究代理,实验表明其在Scale AI Research Rubrics和ADR-Bench上的表现优于同类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22435 2025-12-30 cs.AR cs.LG 57%

AnalogSAGE: Self-evolving Analog Design Multi-Agents with Stratified Memory and Grounded Experience

AnalogSAGE: 带分层记忆和基础经验的自进化模拟设计多智能体

Zining Wang, Jian Gao, Weimin Fu, Xiaolong Guo, Xuan Zhang

机构 * Northeastern University(东北大学) Kansas State University(堪萨斯州立大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 AnalogSAGE通过分层记忆和基础经验提升模拟设计自动化可靠性与自主性

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22408 2025-12-30 cs.RO cs.AI 57%

A Unified AI, Embedded, Simulation, and Mechanical Design Approach to an Autonomous Delivery Robot

一种整合人工智能、嵌入式系统、仿真和机械设计的自主配送机器人方法

Amro Gamar, Ahmed Abduljalil, Alargam Mohammed, Ali Elhenidy, Abeer Tawakol

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出了一种整合人工智能、嵌入式系统、仿真和机械设计的自主配送机器人方法,通过异构计算架构和优化设计实现了高可靠性和实时控制能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23319 2025-12-30 cs.DB 50%

Flexible Keyword-Aware Top-$k$ Route Search

灵活的关键词感知Top-k路线搜索

Ziqiang Yu, Xiaohui Yu, Yueting Chen, Wei Liu, Anbang Song, Bolong Zheng

专题命中 规划推理 :planning(abstract)

AI总结 本文提出关键词感知top-k路线查询,通过探索与边界范式高效处理路线规划,满足用户对POI访问顺序、旅行预算和评分的多样化需求。

详情

展开后加载摘要…

URL PDF HTML 收藏