arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-02 至 2025-12-02 共收录 13 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 13 篇

2512.01848 2025-12-02 cs.CL 85%

Beyond SFT: Reinforcement Learning for Safer Large Reasoning Models with Better Reasoning Ability

超越SFT:通过强化学习构建更安全且推理能力更强的大推理模型

Jinghan Jia, Nathalie Baracaldo, Sijia Liu

机构 * Michigan State University(密歇根州立大学) IBM Research(IBM研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出通过强化学习提升大推理模型的安全性和推理能力,克服了传统监督微调的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00305 2025-12-02 cs.AI 85%

ChartPoint: Guiding MLLMs with Grounding Reflection for Chart Reasoning

ChartPoint: 通过 grounding 反射引导 MLLMs 进行图表推理

Zhengzhuo Xu, SiNan Du, Yiyan Qi, SiwenLu, Chengjin Xu, Chun Yuan, Jian Guo

机构 * Tsinghua University(清华大学) International Digital Economy Academy(国际数字经济学院) Beihang University(北航) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 ChartPoint通过引入 grounding 反射机制,提升 MLLMs 在图表推理中的表现,开发了两个指令微调模型,在多个图表基准上取得显著提升。

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02203 2025-12-02 cs.AI 83%

GraphIC: A Graph-Based In-Context Example Retrieval Model for Multi-Step Reasoning

GraphIC: 一种基于图的上下文示例检索模型用于多步推理

Jiale Fu, Yaqing Wang, Simeng Han, Jiaming Fan, Xu Yang

专题命中 复杂问题求解 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

AI总结 GraphIC是一种基于图的上下文示例检索模型,通过推理意识的表示和专门相似性度量提升LLM在多步推理中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00729 2025-12-02 cs.AI cs.CL 81%

Probing the "Psyche'' of Large Reasoning Models: Understanding Through a Human Lens

探查大型推理模型的“心理”:通过人类视角理解

Yuxiang Chen, Zuohan Wu, Ziwei Wang, Xiangning Yu, Xujia Li, Linyi Yang, Mengyue Yang, Jun Wang, Lei Chen

机构 * University College London London United Kingdom The Hong Kong University of Science Tianjin University Tianjin China Southern University of Science University of Bristol Bristol United Kingdom University College London AI Lab, the Yangtze River Delta, China Tianjin University University of Bristol

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过引入分类体系和CAPO框架,从人类视角深入分析大型推理模型,揭示其推理过程中的不足,并提出改进方向。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03805 2025-12-02 cs.CL cs.AI 81%

Beyond Token Length: Step Pruner for Efficient and Accurate Reasoning in Large Language Models

超越标记长度:用于大语言模型高效准确推理的步剪枝

Canhui Wu, Qiong Cao, Chang Li, Zhenfang Wang, Chao Xue, Yuwei Fan, Wei Xi, Xiaodong He

机构 * Xi’an Jiaotong University(西安交通大学) JD Future Academy(京东未来学院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出步剪枝框架,通过强化学习优化大语言模型的推理效率与准确性,显著减少响应长度并在多个基准测试中取得最佳性能。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22625 2025-12-02 cs.CV 78%

ReasonEdit: Towards Reasoning-Enhanced Image Editing Models

ReasonEdit: 向推理增强的图像编辑模型迈进

Fukun Yin, Shiyu Liu, Yucheng Han, Zhibo Wang, Peng Xing, Rui Wang, Wei Cheng, Yingming Wang, Aojie Li, Zixin Yin, Pengtao Chen, Xiangyu Zhang, Daxin Jiang, Xianfang Zeng, Gang Yu

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 ReasonEdit通过引入思考和反思机制,提升图像编辑模型的推理能力,实现更准确的编辑效果。

Comments code: https://github.com/stepfun-ai/Step1X-Edit

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17442 2025-12-02 cs.CL cs.AI 73%

Confident RAG: Enhancing the Performance of LLMs for Mathematics Question Answering through Multi-Embedding and Confidence Scoring

Confident RAG: 通过多嵌入和置信度评分提升LLM在数学问题回答中的性能

Shiting Chen, Zijian Zhao, Jinsong Chen

机构 * Faculty of Education, The University of Hong Kong(香港大学教育学院) Department of Civil and Environmental Engineering, The Hong Kong University of Science and Technology(香港科学与技术大学土木与环境工程系)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 Confident RAG通过多嵌入和置信度评分提升LLM在数学问题回答中的性能,实验表明其在准确率上比普通LLMs和RAG分别提升10%和5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00838 2025-12-02 cs.RO cs.SY eess.SY 71%

A Novel MDP Decomposition Framework for Scalable UAV Mission Planning in Complex and Uncertain Environments

一种用于复杂和不确定环境中的可扩展无人机任务规划的新MDP分解框架

Md Muzakkir Quamar, Ali Nasir, Sami ELFerik

机构 * Control and Instrumentation Department(控制与仪器部门) Interdisciplinary Research Center for Intelligent Manufacturing and Robotics(智能制造与机器人交叉研究中心) Interdisciplinary Research Center for Smart Mobility and Logistics(智能移动与物流交叉研究中心)

专题命中 复杂问题求解 :planning(title)

AI总结 本文提出了一种新的MDP分解框架,用于在复杂和不确定环境中实现无人机任务规划的可扩展性和容错性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00582 2025-12-02 cs.CV 67%

SatireDecoder: Visual Cascaded Decoupling for Enhancing Satirical Image Comprehension

SatireDecoder: 视觉级联解耦以增强讽刺图像理解

Yue Jiang, Haiwei Xue, Minghao Han, Mingcheng Li, Xiaolu Hou, Dingkang Yang, Lihua Zhang, Xu Zheng

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract)

AI总结 SatireDecoder通过视觉级联解耦和不确定性分析策略,提升讽刺图像理解的准确性和语义层次。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00504 2025-12-02 cs.CL cs.AI 62%

G-KV: Decoding-Time KV Cache Eviction with Global Attention

G-KV:基于全局注意力的解码时间KV缓存淘汰

Mengqi Liao, Lu Wang, Chaoyun Zhang, Zekai Shen, Xiaowei Mao, Si Qin, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang, Huaiyu Wan

机构 * School of Computer Science and Technology, Beijing Jiaotong University(计算机科学与技术学院,北京交通大学) MicroSoft(微软) Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence(北京交通数据挖掘与具身智能重点实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 G-KV通过结合局部和历史注意力分数的全局评分机制,改进KV缓存淘汰,提升大语言模型的推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01775 2025-12-02 cs.LG 57%

How Does RL Post-training Induce Skill Composition? A Case Study on Countdown

强化学习后训练如何诱导技能组合?一个倒计时案例研究

Simon Park, Simran Kaur, Sanjeev Arora

机构 * Princeton Language and Intelligence (PLI), Princeton University(普林斯顿语言与智能研究所(PLI)、普林斯顿大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 本研究通过倒计时任务分析强化学习后训练如何诱导技能组合,揭示了模型在不同树结构上的学习顺序和泛化能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10695 2025-12-02 cs.CL 57%

"As Eastern Powers, I will veto." : An Investigation of Nation-level Bias of Large Language Models in International Relations

作为东方国家,我将 veto。:对大型语言模型在国际关系领域国家层面偏见的调查

Jonghyeon Choi, Yeonjun Choi, Hyun-chul Kim, Beakcheol Jang

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文研究了大型语言模型在国际关系领域中的国家层面偏见,提出了一种去偏框架以减少偏见并提升性能。

Comments 21 pages, 4 figures. This is the extended version of the paper accepted at AAAI 2026, which includes all technical appendices and additional experimental details

Journal ref AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22544 2025-12-02 cs.CV 50%

HyCoVAD: A Hybrid SSL-LLM Model for Complex Video Anomaly Detection

HyCoVAD:一种用于复杂视频异常检测的混合SSL-LLM模型

Mohammad Mahdi Hemmatyar, Mahdi Jafari, Mohammad Amin Yousefi, Mohammad Reza Nemati, Mobin Azadani, Hamid Reza Rastad, Amirmohammad Akbari

机构 * Department of Computer(计算机系) Sharif University of Technology(谢赫·伊斯兰技术大学) School of Electrical and Computer Engineering(电气与计算机工程学院) University of Tehran(德黑兰大学) School of Computer Engineering(计算机工程学院) Iran University of Science and Technology(伊朗科学技术大学)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 HyCoVAD通过结合SSL与LLM,有效提升复杂视频异常检测的准确率与效率。

Comments 25 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏