arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-07 至 2026-01-07 共收录 75 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 7 篇

2512.24297 2026-01-07 cs.CL 83%

Figure It Out: Improve the Frontier of Reasoning with Executable Visual States

图中找出:通过可执行的视觉状态提升推理边界

Meiqi Chen, Fandong Meng, Jie Zhou

机构 * WeChat AI, Tencent Inc(腾讯公司)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 FIGR通过可执行的视觉构建提升复杂推理能力,优于文本-only基线,在数学基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12366 2026-01-07 cs.LG cs.AI 81%

DisCO: Reinforcing Large Reasoning Models with Discriminative Constrained Optimization

DisCO:通过判别约束优化强化大推理模型

Gang Li, Ming Lin, Tomer Galanti, Zhengzhong Tu, Tianbao Yang

机构 * Texas A&M University(德克萨斯A&M大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 DisCO通过判别约束优化方法,有效解决大推理模型中的难度偏差和熵不稳定性,显著提升数学推理能力。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02397 2026-01-07 cs.AI 79%

OThink-R1: Intrinsic Fast/Slow Thinking Mode Switching for Over-Reasoning Mitigation

OThink-R1: 内在快速/缓慢思考模式切换以抑制过度推理

Shengjia Zhang, Junjie Wu, Jiawei Chen, Changwang Zhang, Zhe Li, Xingyu Lou, Wangchunshu Zhou, Sheng Zhou, Can Wang, Jun Wang

机构 * Zhejiang University(浙江大学) OPPO Research Institute(OPPO研究院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 OThink-R1通过整合快速和缓慢思考模式,实现自动模式切换,从而在减少token使用的同时保持高准确性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22234 2026-01-07 cs.LG cs.AI 62%

DiRL: An Efficient Post-Training Framework for Diffusion Language Models

DiRL:一种高效的扩散语言模型后训练框架

Ying Zhu, Jiaxin Wan, Xiaoran Liu, Siyang He, Qiqi Wang, Xu Guo, Tianyi Liang, Zengfeng Huang, Ziwei He, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) OpenMoss Team(OpenMoss团队)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 DiRL是一种高效的扩散语言模型后训练框架,通过整合FlexAttention加速的分块训练与LMDeploy优化的推理,实现了高效的两阶段后训练,提升了在复杂推理任务如数学中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03017 2026-01-07 cs.CL 57%

MMFormalizer: Multimodal Autoformalization in the Wild

MMFormalizer: 多模态自动形式化

Jing Xiong, Qi Han, Yunta Hsieh, Hui Shen, Huajian Xin, Chaofan Tao, Chenyang Zhao, Hengyuan Zhang, Taiqiang Wu, Zhen Zhang, Haochen Wang, Zhongwei Wan, Lingpeng Kong, Ngai Wong

机构 * The University of Hong Kong(香港大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) University of Edinburgh(爱丁堡大学) University of California, Santa Barbara(加州大学圣巴巴拉分校) Ohio State University(俄亥俄州立大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 MMFormalizer通过整合适应性定位与现实世界数学物理领域实体,实现多模态自动形式化,首次处理经典力学、相对论、量子力学和热力学等复杂领域。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02569 2026-01-07 cs.CL 57%

LoRA-Drop: Temporal LoRA Decoding for Efficient LLM Inference

LoRA-Drop:用于高效LLM推理的时序LoRA解码

Hossein Rajabzadeh, Maryam Dialameh, Chul B. Park, Il-Min Kim, Hyock Ju Kwon

机构 * University of Waterloo(滑铁卢大学) University of Toronto(多伦多大学) Queen’s University(皇后大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 LoRA-Drop通过时序计算计划和低秩LoRA校正,实现高效LLM推理,提升解码速度2.6倍并减少45-55%的KV缓存占用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13102 2026-01-07 cs.AI 57%

Socratic Students: Teaching Language Models to Learn by Asking Questions

苏格拉底学生:教语言模型通过提问学习

Rajeev Bhatt Ambati, Tianyi Niu, Aashu Singh, Shlok Mishra, Snigdha Chaturvedi, Shashank Srivastava

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Meta

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ODQS框架,通过任务结果训练语言模型提问技能,提升交互推理的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 3 篇

2601.02814 2026-01-07 cs.AI 57%

Causal-Enhanced AI Agents for Medical Research Screening

因果增强的医疗研究筛查AI代理

Duc Ngo, Arya Rahgoza

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种因果图增强的AI代理,用于医疗研究筛选,通过显式因果推理和双层知识图谱提升系统综述的准确性和可解释性。

Comments for submission to The 39th Canadian Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13961 2026-01-07 cs.RO 50%

FICO: Finite-Horizon Closed-Loop Factorization for Unified Multi-Agent Path Finding

FICO:有限时间闭环因子分解用于统一多智能体路径寻找

Jiarui Li, Alessandro Zanardi, Federico Pecora, Runyu Zhang, Gioele Zardini

专题命中 代码与定理证明 :planning(abstract)

AI总结 FICO通过系统级建模和闭环设计,实现了多智能体路径寻找问题的高效解决,显著提升了计算效率和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02377 2026-01-07 cs.RO 50%

Trust in LLM-controlled Robotics: a Survey of Security Threats, Defenses and Challenges

对LLM控制的机器人信任:安全威胁、防御和挑战的综述

Xinyu Huang, Shyam Karthick V B, Taozhao Chen, Mitch Bryson, Thomas Chaffey, Huaming Chen, Kim-Kwang Raymond Choo, Ian R. Manchester

机构 * School of Electrical and Computer Engineering, The University of Sydney(悉尼大学电气与计算机工程学院) Australian Centre for Robotics and School of Aerospace, Mechanical and Mechatronic Engineering, The University of Sydney(悉尼大学机器人中心及航空航天、机械与机电工程学院) Department of Information Systems and Cybersecurity, University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校信息系统与网络安全系) School of Engineering and Natural Sciences, University of Iceland(冰岛大学工程与自然科学学院)

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文综述了LLM控制机器人面临的安全威胁和防御策略,强调了具身系统中恶意输出的物理风险,并提出了安全规范和多LLM监督等防御方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 4 篇

2504.02624 2026-01-07 cs.HC 67%

EgoLog: Ego-Centric Fine-Grained Daily Log with Ubiquitous Wearables

EgoLog:基于普及式可穿戴设备的以自我为中心的细粒度日常日志

Lixing He, Bufang Yang, Di Duan, Zhenyu Yan, Guoliang Xing

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract)

AI总结 EgoLog通过融合音频与IMU数据及LLM推理,实现了基于普及式可穿戴设备的细粒度日常日志识别,提升了场景和活动识别的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02433 2026-01-07 cs.LG 57%

Physical Transformer

物理变换器

Tao Xu, Zhixin Hu, Li Luo, Momiao Xiong

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 物理变换器结合几何表示和物理动态,通过层次化结构提升推理稳定性与长周期准确性,推动物理基础的AI发展。

Comments 38 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02779 2026-01-07 eess.SY cs.SY 50%

Hierarchical Preemptive Holistic Collaborative Systems for Embodied Multi-Agent Systems: Framework, Hybrid Stability, and Scalability Analysis

分层抢先整体协作系统用于具身多智能体系统:框架、混合稳定性与可扩展性分析

Ting Peng

专题命中 逻辑推理 :planning(abstract)

AI总结 本文提出分层抢先整体协作框架,通过分解全局协调问题提升具身多智能体系统的安全性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02378 2026-01-07 cs.RO 50%

Modeling the Mental World for Embodied AI: A Comprehensive Review

构建具身AI的内心世界:全面综述

Biyuan Liu, Daigang Xu, Lei Jiang, Wenjun Guo, Ping Chen

机构 * ZTE Corporation(中兴通讯公司)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文综述了具身AI中内心世界模型的研究,构建了理论框架,定义了关键组件,并分析了两种核心理论思维推理范式,以促进人机协作发展。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 14 篇

2512.03025 2026-01-07 cs.IR cs.AI cs.CL cs.LG 80%

LORE: A Large Generative Model for Search Relevance

LORE:一种大规模生成模型用于搜索相关性

Chenji Lu, Zhuo Chen, Hui Zhao, Zhiyuan Zeng, Gang Zhao, Junjie Ren, Ruicong Xu, Haoran Li, Songyan Liu, Pengjie Wang, Jian Xu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LORE提出了一种基于大规模生成模型的搜索相关性框架,通过两阶段训练和分层部署策略提升搜索效果,为垂直领域提供方法参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19500 2026-01-07 cs.RO cs.LG 79%

RobotDiffuse: Diffusion-Based Motion Planning for Redundant Manipulators with the ROP Obstacle Avoidance Dataset

RobotDiffuse: 基于扩散模型的冗余机械臂运动规划与ROP障碍避让数据集

Xudong Mou, Xiaohan Zhang, Tiejun Wang, Tianyu Wo, Cangbai Xu, Ningbo Gu, Rui Wang, Xudong Liu

机构 * School of Computer Science and Engineering, Beihang University, Beijing, China(北京航空航天大学计算机科学与工程学院) School of Software, Beihang University, Beijing, China(北京航空航天大学软件学院) Hangzhou Innovation Institute, Beihang University, Hangzhou, China(北京航空航天大学杭州创新研究院)

专题命中 规划推理 :planning(title,abstract);分类 cs.LG

AI总结 RobotDiffuse通过扩散模型实现冗余机械臂运动规划,结合物理约束与点云编码器,并发布ROP数据集提升障碍避让性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02714 2026-01-07 cs.AI cs.CL 79%

Time-Scaling Is What Agents Need Now

现在智能体需要时间扩展

Zhi Liu, Guangzhi Wang

机构 * CareerInternational Research Team(CareerInternational研究团队)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出时间扩展概念,旨在通过扩展时间路径提升智能体的深度推理和问题解决能力,无需增加静态参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01448 2026-01-07 cs.IR 78%

LiCoMemory: Lightweight and Cognitive Agentic Memory for Efficient Long-Term Reasoning

LiCoMemory: 轻量级和认知代理记忆用于高效的长期推理

Zhengjun Huang, Zhoujin Tian, Qintian Guo, Fangyuan Zhang, Yingli Zhou, Di Jiang, Zeying Xie, Xiaofang Zhou

专题命中 规划推理 :reasoning(title,abstract)

AI总结 LiCoMemory通过轻量级分层图和时间感知检索提升长期对话推理效率和准确性

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02752 2026-01-07 cs.CL 70%

EComStage: Stage-wise and Orientation-specific Benchmarking for Large Language Models in E-commerce

EComStage:面向电商大语言模型的分阶段和方向特定基准测试

Kaiyan Zhao, Zijie Meng, Zheyong Xie, Jin Duan, Yao Hu, Zuozhu Liu, Shaosheng Cao

机构 * The University of Tokyo(东京大学) Zhejiang University(浙江大学) Xiaohongshu Inc.(小红书公司)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 EComStage提出一个分阶段和方向特定的电商大语言模型基准测试,评估LLM在感知、规划和行动阶段的表现,揭示不同规模和类型的模型在电商场景中的优势与不足。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02749 2026-01-07 cs.AI 70%

The Path Ahead for Agentic AI: Challenges and Opportunities

代理AI的未来之路:挑战与机遇

Nadia Sibai, Yara Ahmed, Serry Sibaee, Sawsan AlHalawani, Adel Ammar, Wadii Boulila

机构 * Robotics and Internet-of-Things (RIOTU) Lab, Prince Sultan University, Riyadh, Saudi Arabia(机器人与物联网(RIOTU)实验室,普森大学,利雅得,沙特阿拉伯)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文探讨了代理AI从被动生成到自主行动的转变,分析了其技术挑战与核心方法,并提出了实现自主行为的关键研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23564 2026-01-07 cs.AI cs.CL cs.LG 67%

ReCode: Unify Plan and Action for Universal Granularity Control

ReCode:统一计划与行动以实现通用粒度控制

Zhaoyang Yu, Jiayi Zhang, Huixue Su, Yufan Zhao, Yifan Wu, Mingyi Deng, Jinyu Xiang, Yizhang Lin, Lingxiao Tang, Yuyu Luo, Bang Liu, Chenglin Wu

机构 * DeepWisdom The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Renmin University of China(中国人民大学) Zhejiang University(浙江大学) Université de Montréal & Mila(蒙特利尔大学及Mila)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ReCode通过递归代码生成统一规划与行动,实现通用粒度控制,提升智能体在不同决策粒度上的灵活性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02574 2026-01-07 cs.CL cs.AI 62%

Fact-Checking with Large Language Models via Probabilistic Certainty and Consistency

通过概率确定性与一致性进行大型语言模型的事实核查

Haoran Wang, Maryam Khalid, Qiong Wu, Jian Gao, Cheng Cao

机构 * Emory University(埃默里大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 PCC通过概率确定性与一致性框架,自适应决定LLM是否依赖内部知识或启动检索,以提升事实核查的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03098 2026-01-07 cs.LG cs.NE 57%

From Muscle to Text with MyoText: sEMG to Text via Finger Classification and Transformer-Based Decoding

从肌肉到文本:MyoText:通过手指分类和基于Transformer的解码实现sEMG到文本

Meghna Roy Chowdhury, Shreyas Sen, Yi Ding

机构 * Purdue University(普渡大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 MyoText通过手指分类和Transformer解码实现sEMG到文本的高效转换,提升无键盘打字的准确性和可行性。

Comments 25 pages, 11 tables, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02915 2026-01-07 cs.LG 57%

ChemBART: A Pre-trained BART Model Assisting Organic Chemistry Analysis

ChemBART:一种用于有机化学分析的预训练BART模型

Kenan Li, Yijian Zhang, Jin Wang, Haipeng Gan, Zeying Sun, Xiaoguang Lei, Hao Dong

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 ChemBART是一种基于SMILES的预训练模型,通过反应导向的预训练解决多种化学任务,提升合成规划效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04980 2026-01-07 cs.LG cs.SY eess.SY 57%

Agentic AI for Intent-Based Industrial Automation

基于意图的工业自动化代理AI

Marcos Lima Romero, Ricardo Suyama

机构 * Center for Engineering, Modeling(工程、建模中心) Applied Social Sciences Federal University of ABC - UFABC(应用社会科学联邦大学-UFABC)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出基于意图的工业自动化代理AI框架,通过自然语言表达目标并分解为可执行组件,实现人本、可持续的自动化系统。

Comments Preprint - Submitted to 16th IEEE/IAS International Conference on Industry Applications - INDUSCON 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23659 2026-01-07 cs.CL 57%

Less is more: Probabilistic reduction is best explained by small-scale predictability measures

少即是多:概率性缩减最好由小规模可预测性度量解释

Cassandra L. Jacobs, Andrés Buxó-Lugo, Anna K. Taylor, Marie Leopold-Hooke

机构 * Department of Linguistics, University at Buffalo(语言学系,布法罗大学) Department of Psychology, University at Buffalo(心理学系,布法罗大学) Department of Computer Science and Engineering, University at Buffalo(计算机科学与工程系,布法罗大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 本文探讨了语言模型概率与认知现象关系中所需上下文量,证明n-gram表示可作为认知规划的单位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03070 2026-01-07 cs.RO 50%

HEXAR: a Hierarchical Explainability Architecture for Robots

HEXAR:机器人中的分层可解释性架构

Tamlin Love, Ferran Gebellí, Pradip Pramanick, Antonio Andriella, Guillem Alenyà, Anais Garrell, Raquel Ros, Silvia Rossi

机构 * Institut de Robòtica i Informàtica Industrial (CSIC-UPC)(机器人与信息工业研究所(CSIC-UPC)) PAL Robotics(PAL机器人技术公司) University of Naples Federico II(那不勒斯费德里科二世大学) Artificial Intelligence Research Institute (IIIA-CSIC)(人工智能研究所(IIIA-CSIC))

专题命中 规划推理 :reasoning(abstract)

AI总结 HEXAR通过分层可解释性架构提升机器人系统的透明度和可解释性,有效提高根因识别和运行效率。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02389 2026-01-07 cs.NI 50%

Generative AI for Networking

生成式人工智能用于网络

Faisal Zaman, Ouns Bouachir, Moayad Aloqaily, Ismaeel Al Ridhawi

专题命中 规划推理 :planning(abstract)

AI总结 本文探讨生成式人工智能在提升网络性能和实现自适应网络中的作用,并展示利用transformers自注意力机制进行长期流量预测的案例。

Comments Accepted in IEEE AIMS-FLLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 3 篇

2512.24851 2026-01-07 cs.CV cs.RO 75%

VLN-MME: Diagnosing MLLMs as Language-guided Visual Navigation agents

VLN-MME: 诊断MLLMs作为语言引导的视觉导航代理

Xunyi Zhao, Gengze Zhou, Qi Wu

机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所) Adelaide University(阿德莱德大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 VLN-MME通过统一评估框架揭示MLLMs在具身导航任务中的局限性,发现其3D空间推理能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02382 2026-01-07 cs.NI cs.AI cs.IR cs.LG 73%

How to Discover Knowledge for FutureG: Contextual RAG and LLM Prompting for O-RAN

如何为未来G发现知识:面向O-RAN的上下文RAG和LLM提示

Nathan Conger, Nathan Scollar, Kemal Davaslioglu, Yalin E. Sagduyu, Sastry Kompella

专题命中 视觉空间推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 本文提出上下文RAG方法,通过引导文档检索和上下文增强LLM性能,提升ORAN领域问答的准确性和效率,同时保持低运行时间和碳排放。

详情

展开后加载摘要…

URL PDF HTML 收藏