arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-29 至 2026-01-29 共收录 74 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 5 篇

2601.20467 2026-01-29 cs.AI cs.CL 90%

CtrlCoT: Dual-Granularity Chain-of-Thought Compression for Controllable Reasoning

CtrlCoT:用于可控推理的双粒度推理链压缩

Zhenxuan Fan, Jie Cao, Yang Dai, Zheqi Lv, Wenqiao Zhang, Zhongle Xie, Peng LU, Beng Chin Ooi

机构 * Zhejiang University(浙江大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 CtrlCoT通过双粒度方法实现高效可控推理,结合语义抽象与标记级删除,提升推理效率和可靠性。

Comments 16 pages, 9 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19920 2026-01-29 cs.LG cs.AI 73%

Mitigating LLM Hallucination via Behaviorally Calibrated Reinforcement Learning

通过行为校准强化学习缓解大语言模型幻觉

Jiayun Wu, Jiashuo Liu, Zhiyuan Zeng, Tianyang Zhan, Tianle Cai, Wenhao Huang

机构 * Carnegie Mellon University(卡内基梅隆大学) Fudan University(复旦大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过行为校准强化学习提升大语言模型的不确定性量化能力,使其在数学推理和事实问答任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13332 2026-01-29 cs.CL 70%

The Imitation Game: Turing Machine Imitator is Length Generalizable Reasoner

模仿游戏:图灵机模仿器是长度可推广的推理机

Zhouqi Hua, Wenwei Zhang, Chengqi Lyu, Yuzhe Gu, Songyang Gao, Kuikun Liu, Dahua Lin, Kai Chen

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)

专题命中 数学推理 :reasoning(abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出TAIL方法,通过合成图灵机执行过程的链式思维数据,提升LLM的长度泛化能力,超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20861 2026-01-29 cs.LG cs.AI cs.CL 67%

Evolutionary Strategies lead to Catastrophic Forgetting in LLMs

进化策略导致大语言模型中的灾难性遗忘

Immanuel Abdi, Akshat Gupta, Micah Mok, Alexander Lu, Nicholas Lee, Gopala Anumanchipalli

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 进化策略在大语言模型训练中导致灾难性遗忘,尽管性能接近GRPO,但持续学习能力受限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09785 2026-01-29 cs.AI 57%

AI Annotation Orchestration: Evaluating LLM verifiers to Improve the Quality of LLM Annotations in Learning Analytics

AI标注协调:评估LLM验证器以提高学习分析中LLM标注的质量

Bakhtawar Ahtisham, Kirk Vanacore, Jinsook Lee, Zhuqian Zhou, Doug Pietrzak, Rene F. Kizilcec

专题命中 数学推理 :verifier(abstract);分类 cs.AI

AI总结 本文通过评估LLM验证器提升学习分析中标注质量,提出灵活的协调框架和实证比较方法,展示验证在提高标注可靠性中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 2 篇

2601.18944 2026-01-29 cs.AI cs.PL cs.SE 57%

Neural Theorem Proving for Verification Conditions: A Real-World Benchmark

为验证条件进行神经定理证明:一个现实世界的基准测试

Qiyuan Xu, Xiaokun Luan, Renxi Wang, Joshua Ong Jun Leang, Peixin Wang, Haonan Li, Wenda Li, Conrad Watt

机构 * Nanyang Technological University(南洋理工大学) Peking University(北京大学) MBZUAI Imperial College London(帝国理工学院) East China Normal University(华东师范大学) University of Edinburgh(爱丁堡大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出NTP4VC,首个现实世界多语言基准测试,评估LLMs在自动验证条件证明中的表现,揭示程序验证中的挑战与未来研究方向。

Comments Accepted in ICLR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20764 2026-01-29 cs.DC cs.MA 50%

Agentic Fog: A Policy-driven Framework for Distributed Intelligence in Fog Computing

代理雾:一种基于策略的雾计算分布式智能框架

Saeed Akbar, Muhammad Waqas, Rahmat Ullah

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出了一种基于策略的雾计算框架,通过将雾节点建模为自主代理并利用势博弈理论,实现了动态环境下的高效资源管理和稳定系统收敛。

Comments 09 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 4 篇

2601.20784 2026-01-29 cs.AI cs.AR 89%

REASON: Accelerating Probabilistic Logical Reasoning for Scalable Neuro-Symbolic Intelligence

REASON: 加速概率逻辑推理以实现可扩展的神经符号智能

Zishen Wan, Che-Kai Liu, Jiayi Qian, Hanchen Yang, Arijit Raychowdhury, Tushar Krishna

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 REASON通过统一图表示和自适应剪枝技术,实现概率逻辑推理的加速,提升神经符号AI的效率与可扩展性。

Comments 16 pages, 13 figures, 5 tables, 2026 IEEE International Symposium on High-Performance Computer Architecture (HPCA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20604 2026-01-29 cs.AI 88%

Dialogical Reasoning Across AI Architectures: A Multi-Model Framework for Testing AI Alignment Strategies

跨AI架构的对话推理:一种多模型框架用于测试AI对齐策略

Gray Cox

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.AI

AI总结 本文提出一种多模型框架,通过对话推理测试AI对齐策略,展示不同AI模型在处理复杂对齐框架时的表现及新兴见解。

Comments 23 pages, 5 tables, 5 appendices. Code and data: https://github.com/jgraycox-coa/vcw-multi-ai-dialogue

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14957 2026-01-29 cs.CV 78%

Neuro Symbolic Knowledge Reasoning for Procedural Video Question Answering

用于过程视频问答的神经符号知识推理

Basura Fernando, Thanh-Son Nguyen, Hong Yang, Tzeh Yuan Neoh, Hao Zhang, Ee Yeo Keat

机构 * Centre for Frontier AI Research, A*STAR, Singapore(前沿人工智能研究所以(A*STAR)) Institute of High-Performance Computing, A*STAR, Singapore(高性能计算研究所(A*STAR)) College of Computing and Data Science, NTU, Singapore(计算与数据科学学院(NTU))

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 本文提出KML框架,通过神经符号方法提升过程视频问答的推理能力,结合知识图谱实现可解释的多步骤推理。

Comments This paper is under review at IEEE Transactions on Neural Networks and Learning Systems. Personal use is permitted, but republication/redistribution requires IEEE permission

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19968 2026-01-29 cs.CR 50%

What is the AGI in Offensive Security ?

进攻性安全中的AGI是什么?

Youngwoong Cho

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文探讨进攻性安全中的AGI,提出将任务归结为符号语言操作,并通过状态机和符号代理模型分析交互编码问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 17 篇

2601.20856 2026-01-29 cs.AI 88%

SokoBench: Evaluating Long-Horizon Planning and Reasoning in Large Language Models

SokoBench:评估大型语言模型的长周期规划与推理能力

Sebastiano Monti, Carlo Nicolini, Gianni Pellegrini, Jacopo Staiano, Bruno Lepri

机构 * Ipazia SpA(Ipazia公司) University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯瑟尔基金会)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI

AI总结 SokoBench通过简化俄罗斯方块谜题评估大型语言模型的长周期规划与推理能力,揭示了其在复杂任务中的性能限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20014 2026-01-29 cs.AI 88%

Teaching LLMs to Ask: Self-Querying Category-Theoretic Planning for Under-Specified Reasoning

教大语言模型提问:面向不充分推理的自查询范畴规划

Shuhui Qu

机构 * Stanford University(斯坦福大学)

专题命中 规划推理 :planning(title,abstract);reasoning(title);verifier(abstract);分类 cs.AI

AI总结 SQ-BCP通过自查询和桥梁假设解决不充分推理问题,显著降低资源违规率并保持高质量计划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20194 2026-01-29 cs.HC 85%

An Autonomous Agent Framework for Feature-Label Extraction from Device Dialogues and Automatic Multi-Dimensional Device Hosting Planning Based on Large Language Models

基于大语言模型的自主代理框架:用于设备对话中特征-标签提取与自动多维设备托管规划

Huichao Men, Yizhen Hu, Yu Gao, Xiaofeng Mou, Yi Xu, Xinhua Xiao

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出AirAgent框架,利用大语言模型实现家庭空气系统的自主管理,通过双层协作架构提升空气质量和用户体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09332 2026-01-29 cs.RO cs.AI cs.CL cs.CV 84%

OmniEVA: Embodied Versatile Planner via Task-Adaptive 3D-Grounded and Embodiment-aware Reasoning

OmniEVA:通过任务自适应3D grounded和 embodiment-aware推理实现具身 versatile规划

Yuecheng Liu, Dafeng Chi, Shiguang Wu, Zhanguang Zhang, Yuzheng Zhuang, Bowen Yang, He Zhu, Lingfeng Zhang, Pengwei Xie, David Gamaliel Arcos Bravo, Yingxue Zhang, Jianye Hao, Xingyue Quan

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 OmniEVA通过任务自适应3D grounding和具身aware推理,解决具身系统中几何适应性和具身约束的限制,实现先进的具身推理和任务规划。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20696 2026-01-29 cs.AI cs.LG 81%

Enterprise Resource Planning Using Multi-type Transformers in Ferro-Titanium Industry

钢铁行业中的多类型变压器用于企业资源计划

Samira Yazdanpourmoghadam, Mahan Balal Pour, Vahid Partovi Nia

机构 * Department of Mathematics and Industrial Engineering(数学与工业工程系) Polytechnique Montreal(蒙特利尔理工学院) Department of Mechanical, Industrial and Aerospace Engineering(机械、工业和航空航天工程系) Concordia University(Concordia大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用多类型变压器解决钢铁行业中的企业资源计划问题,展示其在作业车间调度和背包问题上的高效性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20676 2026-01-29 cs.CL 79%

Efficient Multimodal Planning Agent for Visual Question-Answering

高效的多模态规划代理用于视觉问答

Zhuo Chen, Xinyu Geng, Xinyu Wang, Yong Jiang, Zhen Zhang, Pengjun Xie, Kewei Tu

机构 * ShanghaiTech University(上海科技大学) Alibaba Tongyi Lab(阿里云通义实验室)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL

AI总结 本文提出了一种高效的多模态规划代理,通过动态分解mRAG流程,提升视觉问答任务的效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20021 2026-01-29 cs.AI 79%

Fuzzy Categorical Planning: Autonomous Goal Satisfaction with Graded Semantic Constraints

模糊分类规划:具有分级语义约束的自主目标满足

Shuhui Qu

机构 * Stanford University(斯坦福大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 FCP通过引入模糊度量和Lukasiewicz t-范数提升自然语言规划中模糊约束的处理能力,有效应对多步骤计划中的质量退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20737 2026-01-29 cs.HC 78%

A Human-Centred AI System for Multi-Actor Planning and Collaboration in Family Learning

面向家庭学习多主体规划与协作的人机协同AI系统

Si Chen, Jingyi Xie, Yao Li, Ya-Fang Lin, He Zhang, Ge Wang, Gaojian Huang, Rui Yu, Ronald Anthony Metoyer, Ting Hua, Nitesh Chawla

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出ParPal系统,通过分解学习目标并分配任务给照顾者,提升家庭学习中的协作效率,揭示当前LLM在教育知识和现实约束处理上的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20380 2026-01-29 cs.AI 70%

OmegaUse: Building a General-Purpose GUI Agent for Autonomous Task Execution

OmegaUse:构建一个通用的 GUI 代理以实现自主任务执行

Le Zhang, Yixiong Xiao, Xinjiang Lu, Jingjia Cao, Yusai Zhao, Jingbo Zhou, Lang An, Zikan Feng, Wanxiang Sha, Yu Shi, Congxi Xiao, Jian Xiong, Yankai Zhang, Hua Wu, Haifeng Wang

机构 * Baidu Frontier Research Department(百度前沿研究部)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 OmegaUse 是一种通用 GUI 代理模型,通过高质量数据和解耦训练方法实现跨平台自主任务执行,展现卓越的 GUI 任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20206 2026-01-29 cs.AI 70%

Towards Intelligent Urban Park Development Monitoring: LLM Agents for Multi-Modal Information Fusion and Analysis

面向智能城市公园发展监测:LLM代理用于多模态信息融合与分析

Zixuan Xiao, Chunguang Hu, Jun Ma

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本研究提出基于LLM的多模态代理框架,用于提升城市公园发展监测中多模态数据的融合与分析能力,解决传统方法在高级分析和灵活适应性方面的不足。

Journal ref IEEE International Geoscience and Remote Sensing Symposium (IGARSS) 2025, Aug 3-8 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20833 2026-01-29 cs.CE 67%

Idea2Story: An Automated Pipeline for Transforming Research Concepts into Complete Scientific Narratives

Idea2Story: 一种将研究概念转化为完整科学叙述的自动化流程

Tengyue Xu, Zhuoyang Qian, Gaoge Liu, Li Ling, Zhentao Zhang, Biao Wu, Shuo Zhang, Ke Lu, Wei Shi, Ziqi Wang, Zheng Feng, Yan Luo, Shu Xu, Yongjin Chen, Zhibo Feng, Zhuo Chen, Bruce Yuan, Harry Wang, Kris Chen

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 Idea2Story通过离线知识构建实现自主科学发现,提升研究效率与可靠性。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20439 2026-01-29 cs.CL 57%

PEARL: Plan Exploration and Adaptive Reinforcement Learning for Multihop Tool Use

PEARL:多跳工具使用中的计划探索与自适应强化学习

Qihao Wang, Mingzhe Lu, Jiayue Wu, Yue Hu, Yanbing Liu

机构 * Institute of Information Engineering, China(信息工程研究所,中国) School of Cyber Security, University of Chinese Academy of Sciences, China(中国科学院大学网络安全学院,中国)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 PEARL通过两阶段方法提升LLM在多跳工具使用中的规划与执行能力,实现ToolHop 56.5%的成功率。

Comments Accepted to PRICAI25

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19112 2026-01-29 eess.IV cs.CV cs.LG 57%

Random forest-based out-of-distribution detection for robust lung cancer segmentation

基于随机森林的分布外检测用于鲁棒肺癌分割

Aneesh Rangnekar, Harini Veeraraghavan

机构 * MSKCC

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出RF-Deep方法,利用预训练变换器编码器的深度特征,通过随机森林检测分布外数据,提升肺癌分割的鲁棒性。

Comments Accepted at SPIE Medical Imaging 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17753 2026-01-29 cs.LG 57%

CCDSReFormer: Traffic Flow Prediction with a Criss-Crossed Dual-Stream Enhanced Rectified Transformer Model

CCDSReFormer:基于交叉双流增强修正变换器模型的交通流预测

Zhiqi Shao, Michael G. H. Bell, Ze Wang, D. Glenn Geers, Xusheng Yao, Junbin Gao

机构 * Business Analytics Discipline, The University of Sydney(悉尼大学商业分析学科) Institute of Transport and Logistics, The University of Sydney(悉尼大学交通运输与物流研究所) College of Management and Economics, Tianjin University(天津大学管理学院)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 CCDSReFormer通过引入三个创新模块,有效提升交通流预测的准确性和效率,实现对空间和时间信息的融合处理。

Comments 18 pages

Journal ref Communications in Transportation Research 5 (2025): 100189

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20184 2026-01-29 cs.CR cs.DC 50%

Securing AI Agents in Cyber-Physical Systems: A Survey of Environmental Interactions, Deepfake Threats, and Defenses

在物理信息系统中保障AI代理:环境交互、深度伪造威胁及防御的综述

Mohsen Hatami, Van Tuan Pham, Hozefa Lakadawala, Yu Chen

专题命中 规划推理 :reasoning(abstract)

AI总结 本文综述了物理信息系统中AI代理的安全威胁,重点分析了环境交互、深度伪造攻击及MCP漏洞,并提出基于SENTINEL框架的防御策略与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19388 2026-01-29 cs.RO 50%

Judgelight: Trajectory-Level Post-Optimization for Multi-Agent Path Finding via Closed-Subwalk Collapsing

Judgelight: 多智能体路径寻找中的轨迹级后优化 via 关闭子轨迹压缩

Yimin Tang, Sven Koenig, Erdem Bıyık

机构 * University of Southern California(南加州大学) University of California Irvine(加州大学尔湾分校)

专题命中 规划推理 :planning(abstract)

AI总结 Judgelight通过压缩智能体轨迹中的闭合子轨迹,提高多智能体路径寻找的轨迹质量,减少20%的解决方案成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19851 2026-01-29 cs.RO 50%

Where Did I Leave My Glasses? Open-Vocabulary Semantic Exploration in Real-World Semi-Static Environments

我放哪里了我的眼镜?在现实世界半静态环境中进行开放式词汇语义探索

Benjamin Bogenberger, Oliver Harrison, Orrin Dahanaggamaarachchi, Lukas Brunke, Jingxing Qian, Siqi Zhou, Angela P. Schoellig

专题命中 规划推理 :reasoning(abstract)

AI总结 本研究提出了一种适用于半静态环境的开放式词汇语义探索系统,通过概率模型和大语言模型推理实现高效对象导航和地图维护。

Journal ref IEEE RA-L, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 3 篇

2601.18631 2026-01-29 cs.AI cs.CL cs.CV cs.MA 81%

AdaReasoner: Dynamic Tool Orchestration for Iterative Visual Reasoning

AdaReasoner: 多步骤视觉推理中的动态工具协调

Mingyang Song, Haoyu Sun, Jiawei Gu, Linjie Li, Luxin Xu, Ranjay Krishna, Yu Cheng

机构 * Fudan University(复旦大学) Tongji University(同济大学) National University of Singapore(新加坡国立大学) University of Washington(华盛顿大学) University of Electronic Science and Technology of China(电子科技大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 AdaReasoner通过动态工具协调提升多模态模型的视觉推理能力,实现工具自适应和泛化,超越现有系统性能。

Comments 28 pages, 10 figures and 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20304 2026-01-29 cs.CV cs.AI 57%

Structure-constrained Language-informed Diffusion Model for Unpaired Low-dose Computed Tomography Angiography Reconstruction

结构约束的语言引导扩散模型用于无配对低剂量计算机断层扫描血管造影重建

Genyuan Zhang, Zihao Wang, Zhifan Gao, Lei Xu, Zhen Zhou, Haijun Yu, Jianjia Zhang, Xiujian Liu, Weiwei Zhang, Shaoyu Wang, Huazhu Fu, Fenglin Liu, Weiwen Wu

机构 * Key Lab of Optoelectronic Technology and Systems and Engineering Research Center of Industrial Computed Tomography Nondestructive Testing, Ministry of Education, Chongqing University(光电技术与系统国家重点实验室和工业计算机断层非破坏检测工程研究中心,教育部,重庆大学) School of Biomedical Engineering, Sun Yat-sen University(中山大学生物医学工程学院) Department of Radiology, Beijing Anzhen Hospital, Capital Medical University(北京安贞医院放射科,首都医科大学) School of Information Engineering, Nanchang, Jiangxi(信息工程学院,南昌,江西) Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR)(高性能计算研究所(IHPC),科技研究局(A*STAR))

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出结构约束的语言引导扩散模型,通过整合结构协同和空间智能,提升低剂量CT血管造影重建的准确性与对比度。

详情

展开后加载摘要…

URL PDF HTML 收藏