arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-30 至 2025-12-30 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 12 篇

2512.22631 2025-12-30 cs.CL 89%

Evaluating GRPO and DPO for Faithful Chain-of-Thought Reasoning in LLMs

评估GRPO和DPO在LLM中的忠实链式推理能力

Hadi Mohammadi, Tamas Kozak, Anastasia Giachanou

机构 * Utrecht University, Department of Information and Computing Sciences(乌特勒支大学信息与计算科学系)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL

AI总结 本文评估GRPO和DPO在提升LLM链式推理忠实性方面的性能,发现GRPO在大模型中表现更优,有助于开发更透明可信的推理方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22627 2025-12-30 cs.CL 85%

Chain-of-thought Reviewing and Correction for Time Series Question Answering

时间序列问题回答的链式思考审查与修正

Chen Su, Yuanhe Tian, Yan Song

机构 * University of Science and Technology of China(中国科学技术大学) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)

专题命中 复杂问题求解 :chain-of-thought(title);reasoning(abstract);CoT(abstract);self-correction(abstract)

AI总结 T3LLM通过引入显式修正机制,利用三个LLM协作实现时间序列问题回答的多步骤推理与自我修正,从而在多个基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23356 2025-12-30 cs.CL 79%

A Stepwise-Enhanced Reasoning Framework for Large Language Models Based on External Subgraph Generation

基于外部子图生成的大型语言模型逐步增强推理框架

Xin Zhang, Yang Cao, Baoxing Wu, Xinyi Chen, Kai Song, Siying Li

机构 * School of Information Science and Engineering, Chongqing Jiaotong University(重庆交通大学信息科学与工程学院) School of Computer Science and Technology, Chongqing University of Posts and Telecommunications(重庆邮电大学计算机科学与技术学院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 SGR通过外部子图生成提升LLM的推理能力,通过多步骤推理和整合路径生成最终答案,实验表明其优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22315 2025-12-30 cs.CV cs.AI 79%

VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning

VideoZoomer: 用于长视频推理的强化学习时序聚焦

Yang Ding, Yizhen Zhang, Xin Lai, Ruihang Chu, Yujiu Yang

机构 * Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 VideoZoomer通过强化学习实现动态时序聚焦,提升长视频推理性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23511 2025-12-30 cs.SE cs.FL 78%

Beyond Correctness: Exposing LLM-generated Logical Flaws in Reasoning via Multi-step Automated Theorem Proving

超越正确性:通过多步骤自动定理证明暴露LLM生成的推理中的逻辑错误

Xinyi Zheng, Ningke Li, Xiaokun Luan, Kailong Wang, Ling Shi, Meng Sun, Haoyu Wang

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 MATP通过多步骤自动定理证明系统性验证LLM推理,揭示其逻辑错误并提升推理可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05822 2025-12-30 cs.CV 78%

Video Event Reasoning and Prediction by Fusing World Knowledge from LLMs with Vision Foundation Models

通过融合来自LLM的世界知识与视觉基础模型进行视频事件推理与预测

L'ea Dubois, Klaus Schmidt, Chengyu Wang, Ji-Hoon Park, Lin Wang, Santiago Munoz

机构 * INRIA(法国国家信息与自动化研究所) Max Planck Institute for Intelligent Systems(人工智能研究所) San Francisco State University(旧金山州立大学) Seoul AI Institute (SAII)(首尔人工智能研究所) Vision & Robotics Center, Tsinghua University(清华大学视觉与机器人中心) Polytechnic University of Madrid(马德里理工大学)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 本文提出融合视觉基础模型与LLM的世界知识,以提升视频事件推理与预测能力,实现从简单识别到高级认知理解的突破。

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22568 2025-12-30 cs.AI physics.bio-ph q-bio.NC 77%

Lessons from Neuroscience for AI: How integrating Actions, Compositional Structure and Episodic Memory could enable Safe, Interpretable and Human-Like AI

从神经科学中汲取教训:如何通过整合动作、组合结构和事件记忆来实现安全、可解释和类人的人工智能

Rajesh P. N. Rao, Vishwas Sathish, Linxing Preston Jiang, Matthew Bryan, Prashant Rangarajan

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 通过整合动作、组合结构和事件记忆,改进基础模型以实现安全、可解释和类人的人工智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23568 2025-12-30 cs.CV 75%

ThinkGen: Generalized Thinking for Visual Generation

ThinkGen: 用于视觉生成的通用思考

Siyu Jiao, Yiheng Lin, Yujie Zhong, Qi She, Wei Zhou, Xiaohan Lan, Zilong Huang, Fei Yu, Yingchen Yu, Yunqing Zhao, Yao Zhao, Yunchao Wei

机构 * Beijing Jiaotong University(北京交通大学) Bytedance Home(字节跳动)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 ThinkGen通过结合预训练的大语言模型和扩散变换器,提出了一种基于思考的视觉生成框架,实现了在多种生成任务中的高效推理和高质量图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22650 2025-12-30 cs.LG cs.AI cs.CL 67%

Scaling Unverifiable Rewards: A Case Study on Visual Insights

扩展不可验证的奖励:视觉洞察的案例研究

Shuyu Gan, James Mooney, Pan Hao, Renxiang Wang, Mingyi Hong, Qianwen Wang, Dongyeop Kang

机构 * University of Minnesota(明尼苏达大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Selective TTS框架,通过多阶段流程优化提升视觉洞察质量,实现计算预算固定下的性能提升。

Comments 32 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23485 2025-12-30 cs.LG cs.AI 62%

FRoD: Full-Rank Efficient Fine-Tuning with Rotational Degrees for Fast Convergence

FRoD:全秩高效微调与旋转自由度以实现快速收敛

Guoan Wan, Tianyu Chen, Fangzheng Feng, Haoyi Zhou, Runhua Xu

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 FRoD通过结合层次联合分解与旋转自由度,实现高效全秩微调,提升收敛速度和鲁棒性,同时在多个基准测试中保持与全模型微调相当的准确性。

Comments The 40th Annual AAAI Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22931 2025-12-30 cs.AI cs.LG 62%

Geometric Structural Knowledge Graph Foundation Model

几何结构知识图谱基础模型

Ling Xin, Mojtaba Nayyeri, Zahra Makki Nayeri, Steffen Staab

机构 * University of Stuttgart(斯图加特大学) University of Southampton(南安普顿大学) Shahrood University of Technology(沙霍尔德大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Gamma通过引入多头几何注意力机制,提升知识图谱推理的表达能力,优于现有方法Ultra,在零样本归纳链接预测中表现更优。

Comments Submitted to IEEE TPAMI, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09614 2025-12-30 cs.CV cs.CL 57%

RAVEL: Rare Concept Generation and Editing via Graph-driven Relational Guidance

RAVEL:通过图驱动的关系引导进行罕见概念生成与编辑

Kavana Venkatesh, Yusuf Dalva, Ismini Lourentzou, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工大学) UIUC(伊利诺伊大学香槟分校)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL

AI总结 RAVEL通过图驱动的关系引导方法,提升罕见概念生成与编辑的可控性和可解释性,适用于长尾领域。

Comments Project Page: https://ravel-diffusion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏