arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-11-25 至 2025-11-25 共收录 126 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 29 篇

2511.18296 2025-11-25 cs.AI 79%

Deep Learning Decision Support System for Open-Pit Mining Optimisation: GPU-Accelerated Planning Under Geological Uncertainty

基于深度学习的露天矿优化决策支持系统:在地质不确定性下的GPU加速规划

Iman Rahimi

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本研究提出了一种基于深度学习的决策支持系统,利用变分自编码器和混合元启发式算法,在地质不确定性下实现GPU加速的露天矿优化规划。

Comments 67 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18393 2025-11-25 cs.CL 77%

Towards Robust and Fair Next Visit Diagnosis Prediction under Noisy Clinical Notes with Large Language Models

基于大型语言模型的噪声临床笔记下的稳健与公平下次就诊诊断预测

Heejoon Koo

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出基于大型语言模型的稳健与公平下次就诊诊断预测方法,通过标签缩减和分层推理策略提升预测鲁棒性和公平性。

Comments Accepted by the Association for the Advancement of Artificial Intelligence (AAAI) 2026 1st Workshop on Safe, Ethical, Certified, Uncertainty-aware, Robust, and Explainable AI for Health (SECURE-AI4H)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18743 2025-11-25 cs.CL cs.AI 73%

RhinoInsight: Improving Deep Research through Control Mechanisms for Model Behavior and Context

RhinoInsight: 通过模型行为和上下文的控制机制提升深度研究

Yu Lei, Shuzheng Si, Wei Wang, Yifei Wu, Gang Chen, Fanchao Qi, Maosong Sun

机构 * DeepLang AI Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Jiaotong University(北京交通大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 RhinoInsight通过引入可验证检查表和证据审计两种控制机制,提升深度研究任务的鲁棒性和可追溯性,同时保持在深度搜索任务中的竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18270 2025-11-25 cs.RO 67%

Skypilot: Fine-Tuning LLM with Physical Grounding for AAV Coverage Search

Skypilot: 通过物理现实 grounding 提升 LLM 在 AAV 覆盖搜索中的微调

Zhongkai Chen, Yihao Sun, Chao Yan, Han Zhou, Xiaojia Xiang, Jie Jiang

机构 * College of Intelligence Science and Technology, National University of Defense Technology(智能科学与技术学院,国防科技大学) College of Automation Engineering, Nanjing University of Aeronautics and Astronautics(自动化工程学院,南京航空航天大学) China Academy of Launch Vehicle Technology(中国运载火箭技术研究院)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 Skypilot通过结合MCTS和物理感知奖励函数,提升LLM在AAV覆盖搜索中的微调效果,实现高效且高质量的决策与路径规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18262 2025-11-25 cs.CV 67%

MammothModa2: A Unified AR-Diffusion Framework for Multimodal Understanding and Generation

MammothModa2: 一种用于多模态理解和生成的统一AR-扩散框架

Tao Shen, Xin Wan, Taicai Chen, Rui Zhang, Junwen Pan, Dawei Lu, Fanding Lei, Zhilin Lu, Yunfei Yang, Chen Cheng, Qi She, Chang Liu, Zhenbang Sun

机构 * ByteDance(字节跳动)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 MammothModa2通过统一的AR-扩散框架实现多模态理解和生成,结合自回归语义规划与扩散生成,取得文本到图像和指令编辑的优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18653 2025-11-25 cs.CR cs.AI cs.LG 62%

FHE-Agent: Automating CKKS Configuration for Practical Encrypted Inference via an LLM-Guided Agentic Framework

FHE-Agent:通过LLM引导的代理框架自动化CKKS配置以实现实用的加密推断

Nuo Xu, Zhaoting Gong, Ran Ran, Jinwei Tang, Wujie Wen, Caiwen Ding

机构 * University of Minnesota -- Twin Cities(明尼苏达大学-双城分校) North Carolina State University(北卡罗来纳州立大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 FHE-Agent通过LLM引导的代理框架自动化CKKS配置,提升加密推断的精度与效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18084 2025-11-25 cs.LG cs.AI 62%

The Alignment Paradox of Medical Large Language Models in Infertility Care: Decoupling Algorithmic Improvement from Clinical Decision-making Quality

医学大语言模型在不孕症护理中的对齐悖论:解耦算法改进与临床决策质量

Dou Liu, Ying Long, Sophia Zuoqiu, Kaipeng Xie, Runze Yang, Di Liu, Kang Li, Yiting Lin, Hanyi Liu, Rong Yin, Tian Tang

机构 * Department of Obstetrics and Gynecology, West China Second University Hospital(妇产科部门,西昌第二大学医院) Reproductive Medical Center, Department of Obstetrics and Gynecology, West China Second University Hospital(生殖医学中心,妇产科部门,西昌第二大学医院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究发现,尽管GRPO在算法准确性上表现最佳,但临床医生更偏好SFT模型,因其推理更清晰且治疗可行性更高,揭示了算法改进与临床信任之间的对齐悖论。

Comments 22 pages 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03265 2025-11-25 cs.LG cs.AI 62%

MindCraft: How Concept Trees Take Shape In Deep Models

MindCraft: 深度模型中概念树如何形成

Bowei Tian, Yexiao He, Wanghao Ye, Ziyao Wang, Meng Liu, Ang Li

机构 * University of Maryland, College Park(马里兰大学 College Park 分校)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 MindCraft通过概念树框架揭示深度模型中概念的层次结构和分离过程,为可解释AI提供新的分析方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18165 2025-11-25 cs.SE cs.AI 61%

Towards a General Framework for HTN Modeling with LLMs

迈向基于LLM的HTN建模通用框架

Israel Puerta-Merino, Carlos Núñez-Molina, Pablo Mesejo, Juan Fernández-Olivares

专题命中 规划推理 :planning(abstract,comments);分类 cs.AI

AI总结 本文提出L2HP框架,用于改进LLM在分层规划建模中的能力,通过实验发现分层规划的建模难度显著高于自动规划。

Comments 10 pages, 5 figures, to be published in the Workshop on Planning in the Era of LLMs ( LM4Plan - https://llmforplanning.github.io ) and the Workshop on Hierarchical Planning ( HPlan - https://icaps25.icaps-conference.org/program/workshops/hplan/ ), both in the International Conference on Automated Planning and Scheduling (ICAPS) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19083 2025-11-25 cs.CL 57%

A Multi-Agent LLM Framework for Multi-Domain Low-Resource In-Context NER via Knowledge Retrieval, Disambiguation and Reflective Analysis

面向多领域低资源情境命名实体识别的多智能体LLM框架:通过知识检索、消歧和反思分析

Wenxuan Mu, Jinzhong Ning, Di Zhao, Yijia Zhang

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 KDR-Agent通过知识检索、消歧和反思分析,提升多领域低资源情境下命名实体识别的性能

Comments This paper has been accepted by AAAI 2026 (Main Technical Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18619 2025-11-25 cs.CL 57%

Prompt Optimization as a State-Space Search Problem

提示优化作为状态空间搜索问题

Maanas Taneja

机构 * University of Minnesota(明尼苏达大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 将提示优化视为状态空间搜索问题,通过束搜索和随机游走算法改进提示性能,验证了优化作为搜索问题的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23518 2025-11-25 cs.AI 57%

TRAP: Targeted Redirecting of Agentic Preferences

TRAP:面向目标的代理偏好重定向

Hangoo Kang, Jehyeok Yeon, Gagandeep Singh

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 TRAP通过语义引导的跨模态操纵,诱导代理AI系统产生一致的选择偏见,揭示了语义层面的安全漏洞。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15524 2025-11-25 cs.AI cs.IR econ.EM stat.AP 57%

The Challenge of Using LLMs to Simulate Human Behavior: A Causal Inference Perspective

使用大型语言模型模拟人类行为的挑战:因果推断视角

George Gui, Olivier Toubia

机构 * Columbia Business School(哥伦比亚商学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文从因果推断视角探讨了使用LLM模拟人类行为的挑战,指出模糊提示策略导致混淆问题,并提出通过去盲化策略提升模型性能和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17678 2025-11-25 cs.CY cs.AI cs.HC 57%

Chatbots to strengthen democracy: An interdisciplinary seminar to train identifying argumentation techniques of science denial

聊天机器人强化民主:跨学科研讨会训练识别科学否认论技巧

Ingo Siegert, Jan Nehring, Aranxa Márquez Ampudia, Matthias Busch, Stefan Hillmann

机构 * Mobile Dialog Systems, Otto-von-Guericke-University Magdeburg, Germany(移动对话系统,马格德堡奥托·冯·格里克大学) German Research Centre for Artificial Intelligence, Berlin(德国人工智能研究中心) Usability Lab, TU Berlin, Germany(可用性实验室,柏林技术大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出通过跨学科研讨会训练学生利用AI聊天机器人识别科学否认论技巧,以提高公众对虚假信息的抵抗力。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17627 2025-11-25 q-bio.PE cs.LG 57%

An Ecologically-Informed Deep Learning Framework for Interpretable and Validatable Habitat Mapping

一种基于生态学的深度学习框架用于可解释和可验证的栖息地制图

Iván Felipe Benavides-Martínez, Cristiam Victoriano Portilla-Cabrera, Katherine E. Mills, Claire Enterline, José Garcés-Vargas, Andrew J. Allyn, Auroop R Ganguly

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出ECOSAIC框架,通过可解释的潜在表示实现底栖生境的自动分类,揭示16种生境并展示其环境与物种需求的生态关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19033 2025-11-25 cs.CV 50%

ReEXplore: Improving MLLMs for Embodied Exploration with Contextualized Retrospective Experience Replay

ReEXplore: 通过上下文化回顾经验回放提升具身探索的MLLMs

Gengyuan Zhang, Mingcong Ding, Jingpei Wu, Ruotong Liao, Volker Tresp

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) TU Munich(慕尼黑技术大学)

专题命中 规划推理 :reasoning(abstract)

AI总结 ReEXplore通过回顾经验回放和分层前沿选择,提升MLLMs在具身探索中的效率和性能。

Comments 8 main pages plus 13 pages Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18114 2025-11-25 cs.CR 50%

ASTRA: Agentic Steerability and Risk Assessment Framework

ASTRA:代理可引导性与风险评估框架

Itay Hazan, Yael Mathov, Guy Shtar, Ron Bitton, Itsik Mantin

专题命中 规划推理 :planning(abstract)

AI总结 ASTRA框架通过模拟多种AI代理并测试其对新型攻击的防御能力,评估LLM在构建安全代理中的有效性,推动更安全的AI系统发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17730 2025-11-25 eess.SY cs.SY 50%

Safety and Risk Pathways in Cooperative Generative Multi-Agent Systems: A Telecom Perspective

合作生成多智能体系统的安全性和风险路径:电信视角

Zeinab Nezami, Shehr Bano, Abdelaziz Salama, Maryam Hafeez, Syed Ali Raza Zaidi

专题命中 规划推理 :planning(abstract)

AI总结 本文从电信视角探讨生成多智能体系统中的安全性和风险路径,提出模块化安全评估框架,揭示智能体多样性对系统稳定性的影响,并展示通过模拟验证的改进与持续存在的漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 7 篇

2511.18450 2025-11-25 cs.AI 79%

ORIGAMISPACE: Benchmarking Multimodal LLMs in Multi-Step Spatial Reasoning with Mathematical Constraints

ORIGAMISPACE:基于数学约束的多模态大语言模型多步空间推理基准测试

Rui Xu, Dakuan Lu, Zicheng Zhao, Xiaoyu Tan, Xintao Wang, Siyu Yuan, Jiangjie Chen, Yinghui Xu

机构 * Fudan University(复旦大学) SII INF Technology(INF技术)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 ORIGAMISPACE通过折纸任务评估多模态大语言模型在多步空间推理和数学约束处理中的能力,提出四个评估任务并探索强化学习训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03596 2025-11-25 cs.CV 78%

ControlThinker: Unveiling Latent Semantics for Controllable Image Generation through Visual Reasoning

ControlThinker: 通过视觉推理揭示潜在语义以实现可控图像生成

Feng Han, Yang Jiao, Shaoxiang Chen, Junhao Xu, Jingjing Chen, Yu-Gang Jiang

机构 * Shanghai Key Lab of Intell. Info. Processing, School of CS, Fudan University(上海智能信息处理关键实验室,复旦大学计算机学院) Shanghai Collaborative Innovation Center on Intelligent Visual Computing(上海智能视觉计算协同创新中心) MiniMax

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 ControlThinker通过视觉推理挖掘潜在语义,提升可控图像生成的语义一致性和视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18874 2025-11-25 cs.AI cs.CV cs.LG cs.MA cs.RO cs.SI 62%

GContextFormer: A global context-aware hybrid multi-head attention approach with scaled additive aggregation for multimodal trajectory prediction

GContextFormer: 一种基于全局上下文的混合多头注意力方法,通过缩放加法聚合实现多模态轨迹预测

Yuzhi Chen, Yuanchang Xie, Lei Zhao, Pan Liu, Yajie Zou, Chen Wang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 GContextFormer通过全局上下文感知的混合多头注意力和缩放加法聚合,实现无地图依赖的多模态轨迹预测,提升鲁棒性和预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12609 2025-11-25 cs.CL cs.AI cs.CV 62%

Uni-MoE-2.0-Omni: Scaling Language-Centric Omnimodal Large Model with Advanced MoE, Training and Data

Uni-MoE-2.0-Omni: 通过先进MoE、训练和数据扩展语言导向的多模态大模型

Yunxin Li, Xinyu Chen, Shenyuan Jiang, Haoyuan Shi, Zhenyu Liu, Xuanyu Zhang, Nanhao Deng, Zhenran Xu, Yicheng Ma, Meishan Zhang, Baotian Hu, Min Zhang

机构 * Research Institute of Computing and Intelligence(计算与智能研究 institute) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Uni-MoE-2.0-Omni通过先进MoE、训练和数据技术,实现了语言导向的多模态大模型,展现出在多模态理解、推理和生成任务中的卓越性能。

Comments 47 pages,10 Figures, Project Website: https://idealistxy.github.io/Uni-MoE-v2.github.io/ Codes: https://github.com/HITsz-TMG/Uni-MoE

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18422 2025-11-25 cs.CV cs.LG 57%

NeuroVascU-Net: A Unified Multi-Scale and Cross-Domain Adaptive Feature Fusion U-Net for Precise 3D Segmentation of Brain Vessels in Contrast-Enhanced T1 MRI

NeuroVascU-Net:一种统一的多尺度和跨域自适应特征融合U-Net,用于精确的对比增强T1 MRI脑血管三维分割

Mohammad Jafari Vayeghan, Niloufar Delfan, Mehdi Tale Masouleh, Mansour Parvaresh Rizi, Behzad Moshiri

机构 * School of Electrical and Computer Engineering, College of Engineering, University of Tehran(电信工程学院,工程学院,德黑兰大学) Department of EECS, Lassonde School of Engineering, York University(电子工程系,拉索nde工程学院,约克大学) Department of Neurosurgery, School of Medicine, Iran University of Medical Sciences(神经外科系,医学院,伊朗医学科学大学) Department of Electrical and Computer Engineering, University of Waterloo(电子工程系,滑铁库大学)

专题命中 视觉空间推理 :planning(abstract);分类 cs.LG

AI总结 NeuroVascU-Net通过多尺度和跨域自适应特征融合模块,实现高精度脑血管分割,适用于临床标准T1CE MRI,提升神经外科手术规划的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17664 2025-11-25 cs.LG cs.CV cs.CY 57%

CubeletWorld: A New Abstraction for Scalable 3D Modeling

CubeletWorld: 一种可扩展3D建模的新抽象

Azlaan Mustafa Samad, Hoang H. Nguyen, Lukas Berg, Henrik Müller, Yuan Xue, Daniel Kudenko, Zahra Ahmadi

机构 * L3S Research Center(L3S研究所以) Leibniz University Hannover(汉诺威莱布尼茨大学) University of Tennessee at Chattanooga(田纳西大学查塔努加分校) PLRI Medical Informatics Institute(医学信息学研究所) Hannover Medical School(汉诺威医学院)

专题命中 视觉空间推理 :planning(abstract);分类 cs.LG

AI总结 CubeletWorld通过离散3D网格空间单元实现可扩展的城市建模,提升隐私保护和跨区域通用性。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02162 2025-11-25 cs.RO cs.AI cs.HC 57%

Text to Robotic Assembly of Multi Component Objects using 3D Generative AI and Vision Language Models

通过3D生成AI和视觉语言模型实现多组件物体的文本到机器人组装

Alexander Htet Kyaw, Richa Gupta, Dhruv Shah, Anoop Sinha, Kory Mathewson, Stefanie Pender, Sachin Chitta, Yotto Koga, Faez Ahmed, Lawrence Sass, Randall Davis

机构 * Massachusetts Institute of Technology (MIT)(麻省理工学院) MIT(麻省理工学院) Google DeepMind(谷歌DeepMind) Google, Paradigms of Intelligence(谷歌、范式智能) Autodesk Research(Autodesk研究) MIT Mechanical Engineering(麻省理工学院机械工程系) MIT Architecture(麻省理工学院建筑系) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出利用3D生成AI和视觉语言模型实现多组件物体的文本到机器人组装,通过多模态推理分解生成网格并优化组件分配。

Comments Accepted to NeurIPS 2025, Conference on Neural Information Processing Systems, Creative AI Track

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 1 篇

2511.15986 2025-11-25 cs.CV cs.CY cs.LG 61%

Fairness in Multi-modal Medical Diagnosis with Demonstration Selection

多模态医学诊断中的公平性与演示选择

Dawei Li, Zijian Gu, Peng Wang, Chuhan Song, Zhen Tan, Mohan Zhang, Tianlong Chen, Yu Tian, Song Wang

机构 * Arizona State University(亚利桑那州立大学) University of Rochester(罗切斯特大学) University of Virginia(弗吉尼亚大学) UCL(伦敦大学学院) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Central Florida(佛罗里达中央大学)

专题命中 测试时计算 :reasoning(abstract,comments);分类 cs.LG

AI总结 本文提出FADS方法,通过基于聚类的采样提升多模态医学影像诊断的公平性,减少性别、种族和族裔相关差异,同时保持高准确性。

Comments 10 pages (including 2 pages of references), 4 figures. This work explores fairness in multi-modal medical image reasoning using in-context learning

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 复杂问题求解 17 篇

2411.16353 2025-11-25 cs.CL cs.AI 86%

Lessons from Studying Two-Hop Latent Reasoning

从双跳潜在推理研究中获得的启示

Mikita Balesni, Tomek Korbak, Owain Evans

机构 * Apollo Research(Apollo研究机构) UK AI Security Institute(英国人工智能安全研究所) UC Berkeley(加州大学伯克利分校) TruthfulAI

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 研究通过双跳问答任务揭示LLM潜在推理能力,发现模型在合成事实组合上表现不足,但能处理混合事实场景,强调避免误判推理能力的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10353 2025-11-25 cs.CV 85%

Motion-R1: Enhancing Motion Generation with Decomposed Chain-of-Thought and RL Binding

Motion-R1: 通过分解的链式推理与RL绑定增强运动生成

Runqi Ouyang, Haoyun Li, Zhenyuan Zhang, Xiaofeng Wang, Zeyu Zhang, Zheng Zhu, Guan Huang, Sirui Han, Xingang Wang

机构 * GigaAI CASIA HKUST(香港科技大学)

专题命中 复杂问题求解 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract)

AI总结 Motion-R1通过结合分解的链式推理与强化学习,提升运动生成的质量和可解释性,实现多项指标的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18864 2025-11-25 cs.CL 83%

Think Before You Prune: Selective Self-Generated Calibration for Pruning Large Reasoning Models

在剪枝前思考:为剪枝大型推理模型的自生成校准

Yang Xiang, Yixin Ji, Juntao Li, Min Zhang

机构 * Soochow University(苏州大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出了一种选择性自生成推理数据策略,通过自生成的校准数据提升大型推理模型剪枝后的推理能力,实验结果显示性能提升10%-13%。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16660 2025-11-25 cs.AI 79%

Cognitive Foundations for Reasoning and Their Manifestation in LLMs

认知基础与推理及其在大语言模型中的体现

Priyanka Kargupta, Shuyue Stella Li, Haocheng Wang, Jinu Lee, Shan Chen, Orevaoghene Ahia, Dean Light, Thomas L. Griffiths, Max Kleiman-Weiner, Jiawei Han, Asli Celikyilmaz, Yulia Tsvetkov

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Washington(华盛顿大学) Princeton University(普林斯顿大学) Harvard University(哈佛大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文通过分析LLMs推理机制,揭示其在复杂问题上的表现优于简单变体,提出基于认知科学的28项元素分类,并开发测试时推理指导方法,提升复杂问题性能达66.7%。

Comments 40 pages, 4 tables, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏