arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-11-25 至 2025-11-25 共收录 17 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 17 篇

2411.16353 2025-11-25 cs.CL cs.AI 86%

Lessons from Studying Two-Hop Latent Reasoning

从双跳潜在推理研究中获得的启示

Mikita Balesni, Tomek Korbak, Owain Evans

机构 * Apollo Research(Apollo研究机构) UK AI Security Institute(英国人工智能安全研究所) UC Berkeley(加州大学伯克利分校) TruthfulAI

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 研究通过双跳问答任务揭示LLM潜在推理能力,发现模型在合成事实组合上表现不足,但能处理混合事实场景,强调避免误判推理能力的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10353 2025-11-25 cs.CV 85%

Motion-R1: Enhancing Motion Generation with Decomposed Chain-of-Thought and RL Binding

Motion-R1: 通过分解的链式推理与RL绑定增强运动生成

Runqi Ouyang, Haoyun Li, Zhenyuan Zhang, Xiaofeng Wang, Zeyu Zhang, Zheng Zhu, Guan Huang, Sirui Han, Xingang Wang

机构 * GigaAI CASIA HKUST(香港科技大学)

专题命中 复杂问题求解 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract)

AI总结 Motion-R1通过结合分解的链式推理与强化学习,提升运动生成的质量和可解释性,实现多项指标的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18864 2025-11-25 cs.CL 83%

Think Before You Prune: Selective Self-Generated Calibration for Pruning Large Reasoning Models

在剪枝前思考:为剪枝大型推理模型的自生成校准

Yang Xiang, Yixin Ji, Juntao Li, Min Zhang

机构 * Soochow University(苏州大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出了一种选择性自生成推理数据策略,通过自生成的校准数据提升大型推理模型剪枝后的推理能力,实验结果显示性能提升10%-13%。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16660 2025-11-25 cs.AI 79%

Cognitive Foundations for Reasoning and Their Manifestation in LLMs

认知基础与推理及其在大语言模型中的体现

Priyanka Kargupta, Shuyue Stella Li, Haocheng Wang, Jinu Lee, Shan Chen, Orevaoghene Ahia, Dean Light, Thomas L. Griffiths, Max Kleiman-Weiner, Jiawei Han, Asli Celikyilmaz, Yulia Tsvetkov

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Washington(华盛顿大学) Princeton University(普林斯顿大学) Harvard University(哈佛大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文通过分析LLMs推理机制,揭示其在复杂问题上的表现优于简单变体,提出基于认知科学的28项元素分类,并开发测试时推理指导方法,提升复杂问题性能达66.7%。

Comments 40 pages, 4 tables, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12509 2025-11-25 cs.AI 79%

Graph of Verification: Structured Verification of LLM Reasoning with Directed Acyclic Graphs

验证图:基于有向无环图的结构化LLM推理验证

Jiwei Fang, Bin Zhang, Changwei Wang, Jin Wan, Zhiwei Xu

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出验证图(GoV),通过灵活的节点块架构实现适应性多粒度验证,有效解决LLM推理验证中的精度与鲁棒性平衡问题。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17923 2025-11-25 cs.CL cs.AI 79%

Towards Efficient LLM-aware Heterogeneous Graph Learning

面向高效LLM-aware异构图学习

Wenda Li, Tongya Zheng, Shunyu Liu, Yu Wang, Kaixuan Chen, Hanyang Yuan, Bingde Hu, Zujie Ren, Mingli Song, Gang Chen

机构 * State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) Zhejiang Lab(浙江实验室) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Zhejiang Provincial Engineering Research Center for Real-Time SmartTech in Urban Security Governance, School of Computer and Computing Science, Hangzhou City University(浙江省实时智能城市安全治理工程技术研究中心,杭州城市大学计算机与计算科学学院) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security, Hangzhou, Zhejiang, China(杭州高新技术区(滨江)区块链与数据安全研究院,杭州,浙江,中国) Nanyang Technological University(南洋理工大学) Bangsun Technology(邦sun科技)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ELLA框架,通过LLM-aware关系分词器和层次关系图变压器,高效解决异构图中复杂关系语义建模和任务间语义间隙问题,实现性能与效率的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13737 2025-11-25 cs.CR 78%

ExtendAttack: Attacking Servers of LRMs via Extending Reasoning

通过扩展推理攻击LRMs的服务器

Zhenhao Zhu, Yue Liu, Zhiwei Xu, Yingwei Ma, Hongcheng Gao, Nuo Chen, Yanpei Guo, Wenjie Qu, Huiying Xu, Zifeng Kang, Xinzhong Zhu, Jiaheng Zhang

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 ExtendAttack通过扩展推理过程恶意占用LRMs服务器资源,显著增加响应长度和延迟,同时保持查询含义和回答准确性。

Comments Accepted to AAAI 2026. This arXiv version corresponds to the camera-ready manuscript and includes expanded appendices. Please cite the AAAI 2026 version when available

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06567 2025-11-25 cs.LG cs.AI 73%

Human Cognition Inspired RAG with Knowledge Graph for Complex Problem Solving

受人类认知启发的基于知识图谱的RAG用于复杂问题解决

Yao Cheng, Yibo Zhao, Jiapeng Zhu, Yao Liu, Xing Sun, Xiang Li

专题命中 复杂问题求解 :reasoning(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 CogGRAG是一种受人类认知启发的基于图的RAG框架,通过树状思维图结构实现复杂问题分解、知识检索与推理,提升知识图谱问答的准确性和可靠性。

Comments The paper has been accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17854 2025-11-25 cs.CL cs.AI cs.CY cs.HC cs.MA 62%

A superpersuasive autonomous policy debating system

一种超级有说服力的自主辩论系统

Allen Roush, Devin Gonier, John Hines, Judah Goldfeder, Philippe Martin Wyder, Sanjay Basu, Ravid Shwartz Ziv

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL、cs.AI

AI总结 DeepDebater是一种能够自主参与并赢得完整政策辩论的AI系统,通过多智能体协作生成高质量论证并战胜人类对手。

Comments Accepted to CLIP workshop at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04427 2025-11-25 cs.AI cs.CL 62%

Plugging Schema Graph into Multi-Table QA: A Human-Guided Framework for Reducing LLM Reliance

将模式图嵌入多表问答:一种减少大语言模型依赖的人工引导框架

Xixi Wang, Miguel Costa, Jordanka Kovaceva, Shuai Wang, Francisco C. Pereira

机构 * Chalmers University of Technology(查尔姆斯理工大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于图的框架,利用人工整理的关系知识减少对大语言模型的依赖,有效解决多表问答中复杂表格模式链接的问题。

Comments Accepted to EMNLP 2025 findings

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20840 2025-11-25 cs.RO cs.AI cs.MM 57%

Learning Primitive Embodied World Models: Towards Scalable Robotic Learning

学习原始具身世界模型:迈向可扩展的机器人学习

Qiao Sun, Liujia Yang, Wei Tang, Wei Huang, Kaixin Xu, Yongchao Chen, Mingyu Liu, Jiange Yang, Haoyi Zhu, Yating Wang, Tong He, Yilun Chen, Xili Dai, Nanyang Ye, Qinying Gu

机构 * Shanghai AI Lab(上海人工智能实验室) Fudan(复旦大学) SJTU(上海交通大学) NJUST(南京理工大学) THU(清华大学) Harvard(哈佛大学) ZJU(浙江大学) NJU(南京大学) USTC(中国科学技术大学) Tongji(同济大学) HKUST (GZ)(香港科技大学(广州))

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出原始具身世界模型(PEWM)以解决具身数据稀疏和高维问题,通过短视界视频生成实现细粒度对齐、降低学习复杂度并提高数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23715 2025-11-25 cs.CL 57%

Don't Take the Premise for Granted: Evaluating the Premise Critique Ability of Large Language Models

不要轻信前提:评估大语言模型的前提批判能力

Jinzhe Li, Gengxu Li, Yi Chang, Yuan Wu

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(知识驱动人机智能工程研究中心,教育部,中国) International Center of Future Science, Jilin University(未来科学国际中心,吉林大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出前提批判基准,评估大语言模型在面对错误前提时的批判能力,揭示其在推理与前提批判上的差异及改进需求。

Comments EMNLP 2025 Findings camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17927 2025-11-25 cs.CV cs.AI 57%

PA-FAS: Towards Interpretable and Generalizable Multimodal Face Anti-Spoofing via Path-Augmented Reinforcement Learning

PA-FAS: 向可解释和通用的多模态人脸反伪装迈进:通过路径增强强化学习

Yingjie Ma, Xun Lin, Yong Xu, Weicheng Xie, Zitong Yu

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 PA-FAS通过路径增强强化学习提升多模态人脸反伪装的可解释性和泛化能力。

Comments Accepted by AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18534 2025-11-25 cs.CV 50%

HiFi-MambaV2: Hierarchical Shared-Routed MoE for High-Fidelity MRI Reconstruction

HiFi-MambaV2:分层共享路由MoE用于高保真MRI重建

Pengcheng Fang, Hongli Chen, Guangzhen Yao, Jian Shi, Fangfang Tang, Xiaohao Cai, Shanshan Shan, Feng Liu

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 HiFi-MambaV2通过分层共享路由MoE和频率一致拉普拉斯金字塔,实现高保真MRI重建,优于多种基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11255 2025-11-25 cs.IR 50%

Align$^3$GR: Unified Multi-Level Alignment for LLM-based Generative Recommendation

Align$^3$GR: 基于大语言模型的生成推荐系统统一多级对齐

Wencai Ye, Mingjie Sun, Shuhang Chen, Wenjin Wu, Peng Jiang

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 Align$^3$GR通过统一多级对齐方法,提升大语言模型在生成推荐系统中的性能,实验显示在Recall@10和NDCG@10指标上均取得显著提升。

Comments Accepted by AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26213 2025-11-25 cs.CV 50%

OmniDocLayout: Towards Diverse Document Layout Generation via Coarse-to-Fine LLM Learning

OmniDocLayout: 通过粗到细的LLM学习实现多样化的文档布局生成

Hengrui Kang, Zhuangcheng Gu, Zhiyuan Zhao, Zichen Wen, Bin Wang, Weijia Li, Conghui He

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Sun Yat-sen University(中山大学)

专题命中 复杂问题求解 :planning(abstract)

AI总结 OmniDocLayout通过粗到细的LLM学习方法,生成多样化文档布局,解决现有布局生成中多样性和复杂性不足的问题。

Comments TL;DR: With the proposed OmniDocLayout-1M dataset and the LLM-based coarse-to-fine learning strategy, we enable diverse and complex document layout generation that achieves both strong condition consistency and adherence to fundamental aesthetic principles

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18001 2025-11-25 cs.SE 50%

Enhancing Automated Program Repair via Faulty Token Localization and Quality-Aware Patch Refinement

通过故障性令牌定位和质量感知补丁细化增强自动程序修复

Jiaolong Kong, Xiaofei Xie, Yiheng Xiong, Yuekun Wang, Jian Wang

专题命中 复杂问题求解 :chain-of-thought(abstract)

AI总结 TokenRepair通过内部反思定位潜在故障令牌并结合质量感知的外部反馈,提升自动程序修复的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏