arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-14 至 2026-01-14 共收录 78 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3 篇

2601.08808 2026-01-14 cs.CL cs.AI cs.LG 88%

Multiplex Thinking: Reasoning via Token-wise Branch-and-Merge

多路思考:通过令牌级分支-合并进行推理

Yao Tang, Li Dong, Yaru Hao, Qingxiu Dong, Furu Wei, Jiatao Gu

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);math reasoning(abstract)

AI总结 多路思考是一种通过令牌级分支-合并机制实现软推理的新方法,能自适应地在离散和连续之间切换,从而在数学推理任务中优于传统CoT和RL基线。

Comments 21 pages. Code available at https://github.com/GMLR-Penn/Multiplex-Thinking

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07898 2026-01-14 cs.LG cs.AI 62%

Large Language Models and Algorithm Execution: Application to an Arithmetic Function

大语言模型与算法执行:应用于一个算术函数

Farah Ben Slama, Frédéric Armetta

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LLM-DAL模型,通过专门训练提升大语言模型执行算法的能力,应用于算术函数的推理与泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21005 2026-01-14 cs.AI cs.IR 57%

ICPO: Intrinsic Confidence-Driven Group Relative Preference Optimization for Efficient Reinforcement Learning

ICPO:内在置信度驱动的群体相对偏好优化用于高效强化学习

Jinpeng Wang, Chao Li, Ting Ye, Mengyuan Zhang, Wei Liu, Jian Luan

机构 * MiLM Plus, Xiaomi Inc.(小米公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 ICPO通过内在置信度驱动的群体相对偏好优化,提升大型语言模型的推理能力,有效解决粗粒度奖励和奖励噪声问题,增强高质量响应的相对优势。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 逻辑推理 9 篇

2601.08412 2026-01-14 cs.AI 83%

Hybrid Distillation with CoT Guidance for Edge-Drone Control Code Generation

混合指导的蒸馏用于边缘-无人机控制代码生成

Yizhan Feng, Hichem Snoussi, Yuhang Wang, Jing Teng, Abel Cherouat, Tian Wang

专题命中 逻辑推理 :CoT(title);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出混合指导的蒸馏方法,通过知识蒸馏、思维链指导和监督微调,提升UAV多SDK控制任务的代码生成效率与准确性。

Comments 2nd International Conference on Drones and Unmanned Systems (DAUS' 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08440 2026-01-14 cs.CV 78%

Incentivizing Cardiologist-Like Reasoning in MLLMs for Interpretable Echocardiographic Diagnosis

激励MLLMs实现类似心内科医生的推理以实现可解释的超声心动图诊断

Yi Qin, Lehan Wang, Chenxu Zhao, Alex P. W. Lee, Xiaomeng Li

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 本文提出CRT和CardiacMind,通过引入心内科医生的思维模式,提升MLLMs在超声心动图诊断中的推理能力,实现48%的诊断性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08169 2026-01-14 cs.CL cs.LG 73%

Relational Knowledge Distillation Using Fine-tuned Function Vectors

基于微调函数向量的关系知识蒸馏

Andrea Kang, Yingnian Wu, Hongjing Lu

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.LG

AI总结 通过微调函数向量提升关系知识表示,增强语言模型的类比推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04727 2026-01-14 cs.AI cs.LG 73%

Sequential Enumeration in Large Language Models

大语言模型中的序列枚举

Kuinan Hou, Marco Zorzi, Alberto Testolin

机构 * University of Padova(帕多瓦大学)

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了大语言模型在序列枚举任务中的能力,发现其在被提示时可部署计数程序,但无法自发进行计数,揭示了神经方法与符号方法在组合泛化上的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08045 2026-01-14 cs.SE cs.HC 67%

Cognitive Biases in LLM-Assisted Software Development

大语言模型辅助软件开发中的认知偏差

Xinyi Zhou, Zeinadsadat Saghi, Sadra Sabouri, Rahul Pandita, Mollie McGuire, Souti Chattopadhyay

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract)

AI总结 本文研究了大语言模型辅助软件开发中的认知偏差,通过混合方法分析发现LLM相关行动更易产生新型偏差,并提出15种偏差类别及缓解建议。

Comments 13 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06745 2026-01-14 cs.CV cs.AI 57%

Symbolic Rule Extraction from Attention-Guided Sparse Representations in Vision Transformers

从注意力引导的稀疏表示中提取符号规则

Parth Padalkar, Gopal Gupta

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出从视觉转换器中提取可执行逻辑程序的方法,通过稀疏概念层和逻辑程序生成算法提升模型的可解释性和可验证性。

Journal ref Theory and Practice of Logic Programming 25 (2025) 722-738

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08742 2026-01-14 cs.CL 57%

Inferring Latent Intentions: Attributional Natural Language Inference in LLM Agents

推断潜在意图:在LLM代理中进行归因性自然语言推理

Xin Quan, Jiafeng Xiong, Marco Valentino, André Freitas

机构 * University of Manchester(曼彻斯特大学) University of Sheffield(谢菲尔德大学) Idiap Research Institute(Idiap研究 institute) National Biomarker Centre, CRUK-MI, University of Manchester(国家生物标志物中心,CRUK-MI,曼彻斯特大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出归因性NLI框架,通过文本游戏实验展示其在多智能体环境中提升LLM推理能力的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07964 2026-01-14 cs.AI 57%

Executable Ontologies in Game Development: From Algorithmic Control to Semantic World Modeling

可执行本体在游戏开发中的应用:从算法控制到语义世界建模

Alexander Boldachev

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 本文提出利用可执行本体实现游戏开发中的语义世界建模,通过数据流条件实现任务中断,解决传统AI架构中的语义-过程鸿沟。

Comments 25 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19804 2026-01-14 cs.CL 57%

Compliance-to-Code: Enhancing Financial Compliance Checking via Code Generation

合规至代码:通过代码生成增强财务合规检查

Siyuan Li, Jian Chen, Rui Yao, Xuming Hu, Peilin Zhou, Weihua Qiu, Simin Zhang, Chucheng Dong, Zhiyao Li, Qipeng Xie, Zixuan Yuan

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Sun Yat-Sen University(孙中山大学) University of California, Riverside(加州大学河滨分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 Compliance-to-Code通过构建大规模中文金融监管数据集,提升金融合规检查的自动化水平,采用代码生成技术实现法规结构化和合规逻辑验证。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 规划推理 17 篇

2601.08468 2026-01-14 cs.CL cs.AI cs.LG 85%

JudgeRLVR: Judge First, Generate Second for Efficient Reasoning

JudgeRLVR: 先判后生成以实现高效推理

Jiangshan Duo, Hanyu Li, Hailin Zhang, Yudong Wang, Sujian Li, Liang Zhao

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) CFCS, School of Computer Science, Peking University(计算机学院,北京大学) LLM-Core Xiaomi(小智LLM核心)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 JudgeRLVR通过先判后生成的双阶段方法,提升大型语言模型在数学领域内的推理效率与准确性。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08308 2026-01-14 cs.CL 83%

AgriAgent: Contract-Driven Planning and Capability-Aware Tool Orchestration in Real-World Agriculture

AgriAgent:面向现实农业的合同驱动规划与能力感知工具编排

Bo Yang, Yu Zhang, Yunkui Chen, Lanfei Feng, Xiao Xu, Nueraili Aierken, Shijian Li

机构 * State Key Laboratory of Brain–Machine Intelligence(脑机智能国家重点实验室) College of Computer Science and Technology, Zhejiang University(计算机科学与技术学院,浙江大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL

AI总结 AgriAgent通过合同驱动规划和能力感知工具编排,提升现实农业中复杂任务的执行成功率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20665 2026-01-14 cs.CV 82%

DriveRX: A Vision-Language Reasoning Model for Cross-Task Autonomous Driving

DriveRX:一种用于跨任务自动驾驶的视觉-语言推理模型

Muxi Diao, Lele Yang, Hongbo Yin, Zhexu Wang, Yejie Wang, Daxin Tian, Kongming Liang, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Zhongguancun Academy(中关村学院) Beihang University(北航)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract)

AI总结 DriveRX是一种用于自动驾驶的视觉-语言推理模型,通过结构化推理提升多阶段决策能力,并在复杂驾驶条件下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08185 2026-01-14 cond-mat.mtrl-sci cs.AI cs.LG cs.MA physics.comp-ph 81%

Autonomous Materials Exploration by Integrating Automated Phase Identification and AI-Assisted Human Reasoning

通过整合自动化相识别和AI辅助的人类推理实现自主材料探索

Ming-Chiang Chang, Maximilian Amsler, Duncan R. Sutherland, Sebastian Ament, Katie R. Gann, Lan Zhou, Louisa M. Smieska, Arthur R. Woll, John M. Gregoire, Carla P. Gomes, R. Bruce van Dover, Michael O. Thompson

机构 * Department of Materials Science and Engineering, Cornell University, Ithaca, NY 14853, United States(材料科学与工程系,康奈尔大学,Ithaca, NY 14853, United States) Department of Computer Science, Cornell University, Ithaca, NY 14853, United States(计算机科学系,康奈尔大学,Ithaca, NY 14853, United States) Joint Center for Artificial Photosynthesis, California Institute of Technology, Pasadena, CA 91125(人工光合作研究中心,加州理工学院,Pasadena, CA 91125) Cornell High Energy Synchrotron Source, Cornell University, Ithaca, NY 14850, United States(康奈尔高能同步辐射源,康奈尔大学,Ithaca, NY 14850, United States)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 通过整合自动化相识别和AI辅助的人类推理,实现自主材料探索,提升材料合成效率和发现新材料的能力。

Comments Main manuscript: 21 pages(including references), 6 figures. Supplementary Information: 12 pages, 9 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02962 2026-01-14 cs.CL cs.AI cs.IR 81%

RAG-R1: Incentivizing the Search and Reasoning Capabilities of LLMs through Multi-query Parallelism

RAG-R1:通过多查询并行性激励大语言模型的搜索与推理能力

Zhiwen Tan, Jiaming Huang, Qintong Wu, Hongxuan Zhang, Chenyi Zhuang, Jinjie Gu

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 RAG-R1通过多查询并行性提升大语言模型的搜索与推理能力,实验显示其在问答基准中性能优于基线方法,推理效率提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08621 2026-01-14 cs.CL 79%

GraphSearch: Agentic Search-Augmented Reasoning for Zero-Shot Graph Learning

GraphSearch: 基于代理的搜索增强推理用于零样本图学习

Jiajin Liu, Yuanfu Sun, Dongzhe Fan, Qiaoyu Tan

机构 * Department of Computer Science, New York University (Shanghai)(计算机科学系,纽约大学(上海))

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 GraphSearch通过图感知查询规划器和检索器实现零样本图学习,无需任务特定微调,提升图结构推理效率。

Comments 16 pages, 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17108 2026-01-14 cs.AI 79%

Structured Debate Improves Corporate Credit Reasoning in Financial AI

结构化辩论提升金融AI中的企业信用推理

Yoonjin Lee, Munhee Kim, Hanbi Choi, Juhyeon Park, Seungho Lyoo, Woojin Park

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 结构化辩论系统在金融AI中通过提升企业信用推理的严谨性和实用性,展示了更深入的分析能力,尽管计算时间较长。

Comments 18 pages, 4 figures, 2 algorithms, 2 tables, 4 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12992 2026-01-14 cs.RO cs.CL cs.CV cs.MA 79%

UNCAP: Uncertainty-Guided Neurosymbolic Planning Using Natural Language Communication for Cooperative Autonomous Vehicles

UNCAP:基于自然语言通信的不确定性引导神经符号规划

Neel P. Bhatt, Po-han Li, Kushagra Gupta, Rohan Siva, Daniel Milan, Alexander T. Hogue, Sandeep P. Chinchali, David Fridovich-Keil, Zhangyang Wang, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL

AI总结 UNCAP通过自然语言通信和不确定性引导方法,提升多车辆协同自动驾驶系统的可扩展性和安全性。

Journal ref AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08259 2026-01-14 cs.NI 67%

Unleashing Tool Engineering and Intelligence for Agentic AI in Next-Generation Communication Networks

释放工具工程与智能以推动下一代通信网络中的智能体AI

Yinqiu Liu, Ruichen Zhang, Dusit Niyato, Abbas Jamalipour, Trung Q. Duong, Dong In Kim

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出通过工具工程和智能提升下一代通信网络中的智能体AI,展示工具智能在无人飞行器轨迹规划中的应用,并提供6G时代的智能体构建路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13257 2026-01-14 cs.AI cs.CV cs.LG 62%

Explaning with trees: interpreting CNNs using hierarchies

用树解释:用层次结构解释CNN

Caroline Mazini Rodrigues, Nicolas Boutry, Laurent Najman

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出xAiTrees框架,通过层次分割技术为CNN提供忠实且可解释的解释,提升xAI的可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08773 2026-01-14 cs.SE cs.AI 57%

Reliable Graph-RAG for Codebases: AST-Derived Graphs vs LLM-Extracted Knowledge Graphs

可靠的代码库图-RAG:基于AST的图与LLM提取的知识图谱

Manideep Reddy Chinthareddy

机构 * Software Engineer, Centerville, USA(美国辛斯维尔软件工程师)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文比较了基于AST的图谱和LLM提取的知识图谱在代码库中的检索性能,发现确定性AST图谱在索引成本和多跳推理方面更具优势。

Comments 46 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08078 2026-01-14 cs.CV cs.CE cs.CL 57%

Exploiting DINOv3-Based Self-Supervised Features for Robust Few-Shot Medical Image Segmentation

利用基于DINOv3的自监督特征进行鲁棒的小样本医学图像分割

Guoping Xu, Jayaram K. Udupa, Weiguo Lu, You Zhang

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 本文提出DINO-AugSeg框架,利用DINOv3特征结合小波域增强和上下文融合,提升小样本医学图像分割的鲁棒性。

Comments 36 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03683 2026-01-14 cs.LG cs.NE 57%

Rethinking Recurrent Neural Networks for Time Series Forecasting: A Reinforced Recurrent Encoder with Prediction-Oriented Proximal Policy Optimization

重新思考用于时间序列预测的循环神经网络:一种面向预测的强化编码器

Xin Lai, Shiming Deng, Lu Yu, Yumin Lai, Shenghao Qiao, Xinze Zhang

机构 * School of Management, Huazhong University of Science and Technology(华中科技大学管理学院) Center for Applied Mathematics, École des Ponts ParisTech(巴黎高等理工学院应用数学中心) School of Mechanical Engineering, Dalian Jiaotong University(大连交通大学机械工程学院) School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出RRE-PPO4Pred方法,通过强化编码器和改进的PPO算法提升时间序列预测的准确性和模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08517 2026-01-14 cs.CV 50%

Closed-Loop LLM Discovery of Non-Standard Channel Priors in Vision Models

闭环大语言模型在视觉模型中发现非标准通道先验

Tolgay Atinc Uzun, Dmitry Ignatov, Radu Timofte

机构 * Computer Vision Lab, CAIDAS \& IFI, University of W\"urzburg, Germany

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出利用大语言模型进行视觉模型通道配置优化,通过生成大量架构数据训练LLM学习通道配置与性能关系,实验表明该方法在CIFAR-100上显著提升准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08436 2026-01-14 eess.SP 50%

Effective outdoor pathloss prediction: A multi-layer segmentation approach with weighting map

有效户外路径损耗预测:一种多层分割方法与加权地图

Yuan Gao, Tao Wen, Wenjing Xie, Jianbo Du, Yong Zeng, Dusit Niyato, Shugong Xu

专题命中 规划推理 :planning(abstract)

AI总结 本文提出一种基于 ResNet 的多层分割方法与加权地图,用于有效预测户外路径损耗,实验表明其在精度和计算效率上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08214 2026-01-14 eess.SY cs.SY 50%

Hybrid Centralized Distributed Control for Lifelong MAPF over Wireless Connections

混合集中式分布式控制用于无线连接下的终身MAPF

Jinghao Cao, Wanchun Liu, Yonghui Li, Branka Vucetic

专题命中 规划推理 :planning(abstract)

AI总结 本文提出了一种混合集中式-分布式控制方案,用于解决无线连接下的终身MAPF问题,通过集中式云策略和机载GRU策略相结合,提高通信效率和路径规划安全性。

Comments 11pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08178 2026-01-14 cs.HC 50%

The Impact of AI Generated Content on Decision Making for Topics Requiring Expertise

人工智能生成内容对需要专业知识的决策影响

Shangqian Li, Tianwa Chen, Gianluca Demartini

专题命中 规划推理 :reasoning(abstract)

AI总结 本研究探讨了AI生成内容在需要专业知识的决策中对用户观点变化的影响,发现领域专业知识不足的用户更倾向于依赖已有结论而非改变观点。

Comments 2 figures, pre-print (not yet being produced) version for HEBT

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视觉空间推理 5 篇

2601.08665 2026-01-14 cs.RO cs.CV 87%

VLingNav: Embodied Navigation with Adaptive Reasoning and Visual-Assisted Linguistic Memory

VLingNav:基于适应性推理和视觉辅助语言记忆的具身导航

Shaoan Wang, Yuanfei Luo, Xingyu Chen, Aocheng Luo, Dongyue Li, Chang Liu, Sheng Chen, Yangang Zhang, Junzhi Yu

机构 * Peking University(北京大学) Zhongguancun Academy(中关村学院)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)

AI总结 VLingNav通过引入适应性推理和视觉辅助语言记忆,实现了复杂具身导航任务中的高效导航与泛化能力。

Comments Project page: https://wsakobe.github.io/VLingNav-web/

详情

展开后加载摘要…

URL PDF HTML 收藏