arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-11-21 至 2025-11-21 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 10 篇

2511.07979 2025-11-21 cs.AI 88%

Benchmarking Multi-Step Legal Reasoning and Analyzing Chain-of-Thought Effects in Large Language Models

对多步骤法律推理进行基准测试并分析思维链效应在大型语言模型中的表现

Wenhan Yu, Xinbo Lin, Lanxin Ni, Jinhua Cheng, Lei Sha

机构 * School of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能学院) KoGuan School of Law, Shanghai Jiao Tong University, Shanghai, China(上海交通大学KoGuan法学院) School of Criminal Law, China University of Political Science and Law, Beijing, China(中国政法大学刑事法律学院)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.AI

AI总结 本文提出MSLR数据集,用于评估大型语言模型在多步骤法律推理中的表现,并通过实验展示自主生成的思维链提示提升了推理质量。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19753 2025-11-21 cs.CL 83%

CoTKR: Chain-of-Thought Enhanced Knowledge Rewriting for Complex Knowledge Graph Question Answering

CoTKR: 基于链式推理的增强型知识重写用于复杂知识图谱问答

Yike Wu, Yi Huang, Nan Hu, Yuncheng Hua, Guilin Qi, Jiaoyan Chen, Jeff Z. Pan

机构 * Southeast University(东南大学) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University) Ministry of Education(新一代人工智能技术及其交叉应用国家重点实验室) China Mobile Research Institute(中国移动研究院) Monash University(墨尔本大学) University of Manchester(曼彻斯特大学) University of Edinburgh(爱丁堡大学)

专题命中 复杂问题求解 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.CL

AI总结 CoTKR通过链式推理增强知识重写方法,提升复杂知识图谱问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16331 2025-11-21 cs.CL 79%

Incorporating Self-Rewriting into Large Language Model Reasoning Reinforcement

将自我修正纳入大语言模型推理强化

Jiashu Yao, Heyan Huang, Shuang Zeng, Chuwei Luo, WangJie You, Jie Tang, Qingsong Liu, Yuhang Guo, Yangyang Kang

机构 * ByteDance China(字节跳动中国)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究提出自我修正框架,通过重写推理文本提升大语言模型的内部推理质量,实验表明其在准确性与推理长度权衡上优于现有方法。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16043 2025-11-21 cs.LG 79%

Agent0: Unleashing Self-Evolving Agents from Zero Data via Tool-Integrated Reasoning

Agent0: 通过工具集成推理从零数据中释放自进化代理

Peng Xia, Kaide Zeng, Jiaqi Liu, Can Qin, Fang Wu, Yiyang Zhou, Caiming Xiong, Huaxiu Yao

机构 * Stanford University(斯坦福大学) Salesforce Research(Salesforce研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 Agent0通过多步骤共进化和工具集成,在无需外部数据的情况下自主提升代理性能,显著增强推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16077 2025-11-21 cs.CV 78%

VideoSeg-R1:Reasoning Video Object Segmentation via Reinforcement Learning

VideoSeg-R1: 通过强化学习进行视频对象分割的推理

Zishan Xu, Yifu Guo, Yuquan Lu, Fengyu Yang, Junxin Li

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 VideoSeg-R1通过引入强化学习,首次实现了视频对象分割的推理任务,采用解耦架构和显式推理链提升效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15661 2025-11-21 cs.CV cs.AI cs.CL cs.LG 67%

VisPlay: Self-Evolving Vision-Language Models from Images

VisPlay: 从图像中自我进化视觉-语言模型

Yicheng He, Chengsong Huang, Zongxia Li, Jiaxin Huang, Yonghui Yang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Washington University in St. Louis(华盛顿大学圣路易斯分校) University of Maryland(马里兰大学) National University of Singapore(新加坡国立大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 VisPlay通过自我进化强化学习框架,利用未标注图像数据提升视觉-语言模型的推理能力,实现多模态智能的可扩展发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10819 2025-11-21 cs.AI cs.LG 62%

PoE-World: Compositional World Modeling with Products of Programmatic Experts

PoE-World: 通过程序专家的乘积进行组合世界建模

Wasu Top Piriyakulkij, Yichao Liang, Hao Tang, Adrian Weller, Marta Kryven, Kevin Ellis

机构 * Cornell University(康奈尔大学) University of Cambridge(剑桥大学) The Alan Turing Institute(艾伦·图灵研究所) Dalhousie University(达尔豪斯大学)

专题命中 复杂问题求解 :planning(abstract);分类 cs.AI、cs.LG

AI总结 PoE-World通过程序专家的乘积有效建模复杂非网格世界领域,利用LLMs学习世界模型并实现高效泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16283 2025-11-21 cs.AI 57%

MuISQA: Multi-Intent Retrieval-Augmented Generation for Scientific Question Answering

MuISQA: 多意图检索增强生成用于科学问答

Zhiyuan Li, Haisheng Yu, Guangchuan Guo, Nan Zhou, Jiajun Zhang

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 MuISQA提出一种多意图检索增强生成框架,通过意图感知检索和RRF融合提升科学问答任务的证据覆盖和检索准确性。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15921 2025-11-21 cs.AI 57%

Thinking, Faithful and Stable: Mitigating Hallucinations in LLMs

思考、忠实与稳定:减轻大语言模型幻觉的方法

Chelsea Zou, Yiheng Yao, Basant Khalil

机构 * Stanford University(斯坦福大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出一种通过强化学习策略减少大语言模型幻觉的方法,通过置信度对齐和熵激增信号提升推理的连贯性和准确性。

Comments Originally released June 5, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15752 2025-11-21 cs.AI cs.MA 57%

Build AI Assistants using Large Language Models and Agents to Enhance the Engineering Education of Biomechanics

利用大型语言模型和智能体构建AI助教以增强生物力学工程教育

Hanzhi Yan, Qin Lu, Xianqiao Wang, Xiaoming Zhai, Tianming Liu, He Li

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出利用RAG和MAS提升LLM在生物力学教育中的表现,通过双模块框架增强教学效果。

详情

展开后加载摘要…

URL PDF HTML 收藏