arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-09 至 2025-12-09 共收录 17 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 17 篇

2512.01485 2025-12-09 cs.AI cs.LG 86%

Multi-Path Collaborative Reasoning via Reinforcement Learning

基于强化学习的多路径协作推理

Jindi Lv, Yuhao Zhou, Zheng Zhu, Xiaofeng Wang, Guan Huang, Jiancheng Lv

机构 * Sichuan University(四川大学) GigaAI Tsinghua University(清华大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 本文提出M3PO框架,通过多路径协作机制提升大语言模型的推理能力,实现更可靠和高效的多步推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07783 2025-12-09 cs.CL 79%

On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models

在预训练、中训练和强化学习对推理语言模型的相互作用中

Charlie Zhang, Graham Neubig, Xiang Yue

机构 * Carnegie Mellon University, Language Technologies Institute(卡内基梅隆大学,语言技术研究所)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 研究探讨了预训练、中训练和强化学习在推理语言模型中的相互作用,发现RL需预训练留有余地才能提升能力,中训练提升性能,过程级奖励提高推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06859 2025-12-09 cs.AI 79%

JT-DA: Enhancing Data Analysis with Tool-Integrated Table Reasoning Large Language Models

JT-DA:利用工具集成的表格推理大语言模型提升数据分析

Ce Chi, Xing Wang, Zhendong Wang, Xiaofan Liu, Ce Li, Zhiyan Song, Chen Zhao, Kexin Yang, Boshen Shi, Jingjing Yang, Chao Deng, Junlan Feng

机构 * Jiutian Research, China Mobile, Beijing, China(钧天研究,中国移动,北京)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 JT-DA-8B通过工具集成的表格推理方法,提升复杂表格分析任务的性能和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06835 2025-12-09 cs.AI 79%

Decouple to Generalize: Context-First Self-Evolving Learning for Data-Scarce Vision-Language Reasoning

解耦以泛化:面向数据稀缺的视觉语言推理的上下文优先自进化学习

Tingyu Li, Zheng Sun, Jingxuan Wei, Siyuan Li, Conghui He, Lijun Wu, Cheng Tan

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai JiaoTong University(上海交通大学) University of Chinese Academy of Sciences(中国科学院大学) Zhejiang University(浙江大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 DoGe通过双解耦框架,引导模型优先从上下文学习以提升数据稀缺下的视觉语言推理能力,提出两阶段RL方法和演进课程学习流水线,有效解决传统方法的奖励黑客问题。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07109 2025-12-09 cs.AI cs.CL cs.LG 78%

A Neural Affinity Framework for Abstract Reasoning: Diagnosing the Compositional Gap in Transformer Architectures via Procedural Task Taxonomy

一种神经亲和框架用于抽象推理:通过程序性任务分类诊断Transformer架构中的组合性缺口

Miguel Ingram, Arthur Joseph Merritt

专题命中 复杂问题求解 :reasoning(title);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种神经亲和框架,通过程序性任务分类诊断Transformer架构中的组合性缺口,揭示了任务与Transformer模型之间的神经亲和力差异。

Comments 62 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07141 2025-12-09 cs.CV cs.CL 70%

Think-Reflect-Revise: A Policy-Guided Reflective Framework for Safety Alignment in Large Vision Language Models

思考-反思-修订:一种基于策略的反思框架,用于大型视觉语言模型的安全对齐

Fenghua Weng, Chaochao Lu, Xia Hu, Wenqi Shao, Wenjie Wang

机构 * Shanghaitech University(上海科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.CL

AI总结 TRR通过策略引导的反思框架提升大型视觉语言模型的安全对齐,显著提高安全响应率至87.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06266 2025-12-09 cs.CL 70%

Nanbeige4-3B Technical Report: Exploring the Frontier of Small Language Models

Nanbeige4-3B 技术报告:探索小型语言模型的前沿

Chen Yang, Guangyue Peng, Jiaying Zhu, Ran Le, Ruixiang Feng, Tao Zhang, Wei Ruan, Xiaoqi Liu, Xiaoxue Cheng, Xiyun Xu, Yang Song, Yanzipeng Gao, Yiming Jia, Yun Xing, Yuntao Wen, Zekai Wang, Zhenwei An, Zhicong Sun, Zongchao Chen

机构 * Nanbeige LLM Lab(纳布吉LLM实验室)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 Nanbeige4-3B通过FG-WSD调度器、DPD蒸馏和强化学习技术,实现了小型语言模型在性能和扩展定律上的突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01132 2025-12-09 cs.LG cs.AI cs.CL 67%

A Practitioner's Guide to Multi-turn Agentic Reinforcement Learning

多轮代理强化学习实践指南

Ruiyi Wang, Prithviraj Ammanabrolu

机构 * University of California, San Diego(加州大学圣地亚哥分校) NVIDIA(英伟达)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出多轮代理强化学习的训练方法,通过分析环境、奖励和策略三个支柱,总结出训练LLM代理的实践指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06327 2025-12-09 physics.flu-dyn physics.comp-ph 67%

OpenFOAMGPT: a RAG-Augmented LLM Agent for OpenFOAM-Based Computational Fluid Dynamics

OpenFOAMGPT:一种基于检索增强生成的LLM代理,用于基于OpenFOAM的计算流体力学

Sandeep Pandey, Ran Xu, Wenkang Wang, Xu Chu

专题命中 复杂问题求解 :chain-of-thought(abstract);CoT(abstract)

AI总结 OpenFOAMGPT是一种基于检索增强生成的LLM代理,用于优化OpenFOAM的CFD模拟,通过高效处理复杂任务提升工程应用效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23045 2025-12-09 cs.AI cs.CL cs.SE 62%

Kimi-Dev: Agentless Training as Skill Prior for SWE-Agents

Kimi-Dev:无代理训练作为SWE-代理的技能先验

Zonghan Yang, Shengjie Wang, Kelin Fu, Wenyang He, Weimin Xiong, Yibo Liu, Yibo Miao, Bofei Gao, Yejie Wang, Yingwei Ma, Yanhao Li, Yue Liu, Zhenxing Hu, Kaitai Zhang, Shuyi Wang, Huarong Chen, Flood Sung, Yang Liu, Yang Gao, Zhilin Yang, Tianyu Liu

机构 * Moonshot AI THU(清华大学) PKU(北京大学) UCAS(中国科学技术大学) BUPT(北京邮电大学) NUS(新加坡国立大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Kimi-Dev通过无代理训练生成技能先验,使SWE-代理在SWE-bench Verified上取得60.4%的优异成绩,并通过额外SFT适应达到48.6%的pass@1,与Claude 3.5 Sonnet相当。

Comments 68 pages. GitHub repo at https://github.com/MoonshotAI/Kimi-Dev

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06350 2025-12-09 cs.CY cs.AI cs.CL 62%

Why They Disagree: Decoding Differences in Opinions about AI Risk on the Lex Fridman Podcast

为何他们意见分歧:解码对人工智能风险意见差异的Lex Fridman播客讨论

Nghi Truong, Phanish Puranam, Özgecan Koçak

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过分析Lex Fridman播客中关于人工智能风险的分歧,揭示了不同观点在定义、事实和因果前提上的差异,提出使用LLMs解析文本数据以识别关键争议点的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06196 2025-12-09 cs.AI cs.CL 62%

ARCANE: A Multi-Agent Framework for Interpretable and Configurable Alignment

ARCANE:一种多智能体框架,用于可解释和可配置的对齐

Charlie Masters, Marta Grześkiewicz, Stefano V. Albrecht

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ARCANE是一种多智能体框架,通过动态规则生成实现可解释和可配置的对齐,适用于复杂长期任务。

Comments Accepted to the AAAI 2026 LLAMAS Workshop (Large Language Model Agents for Multi-Agent Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14683 2025-12-09 cs.SE cs.AI 57%

Unified Software Engineering Agent as AI Software Engineer

统一软件工程代理作为AI软件工程师

Leonhard Applis, Yuntong Zhang, Shanchao Liang, Nan Jiang, Lin Tan, Abhik Roychoudhury

机构 * National University of Singapore(新加坡国立大学) Purdue University(普渡大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出统一软件工程代理USEagent,旨在通过协调多种能力提升软件开发效率,通过USEbench验证其效果,发现其在复杂任务中表现优于现有代理。

Comments Leonhard Applis and Yuntong Zhang contributed equally to this work. To appear in ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06555 2025-12-09 cs.CR cs.AI cs.CY 57%

BEACON: A Unified Behavioral-Tactical Framework for Explainable Cybercrime Analysis with Large Language Models

BEACON:一种结合大语言模型的可解释性网络犯罪分析统一行为-战术框架

Arush Sachdeva, Rajendraprasad Saravanan, Gargi Sarkar, Kavita Vemuri, Sandeep Kumar Shukla

机构 * International Institute of Information Technology Hyderabad(国际信息研究所海得拉巴)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 BEACON通过整合行为心理学与网络犯罪战术生命周期,利用大语言模型实现网络犯罪的可解释性分析,提升分类准确率和推理质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23730 2025-12-09 cs.CL 57%

Evaluating Long-Term Memory for Long-Context Question Answering

评估长期记忆以实现长上下文问答

Alessandra Terranova, Björn Ross, Alexandra Birch

机构 * School of Informatics, The University of Edinburgh(信息学院,爱丁堡大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文评估了增强记忆方法在长上下文问答任务中的效果,发现通过RAG和事件记忆可显著减少令牌使用并保持准确性。

Comments Accepted as a poster at Metacognition in Generative AI EurIPS workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16001 2025-12-09 cs.AI q-bio.NC 57%

Artificial Human Intelligence: The role of Humans in the Development of Next Generation AI

人工人类智能:人类在下一代AI发展中的作用

Suayb S. Arslan

机构 * Department of Computer Engineering, Boğaziçi University(计算机工程系,博兹达奇大学) Department of Brain and Cognitive Sciences, Massachusetts Institute of Technology (MIT)(脑与认知科学系,麻省理工学院(MIT))

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了人类在下一代AI发展中的关键作用,分析了人类与人工智能的互动,提出以人类为中心的发展方向,并强调伦理、责任和稳健智能系统的重要性。

Comments 19 pages, 8 figures, 2 tables, accepted to IEEE Transactions on Emerging Topics in Computational Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06328 2025-12-09 cs.CV 50%

ReCAD: Reinforcement Learning Enhanced Parametric CAD Model Generation with Vision-Language Models

ReCAD: 基于强化学习的参数化CAD模型生成增强框架

Jiahao Li, Yusheng Luo, Yunzhong Lou, Xiangdong Zhou

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 ReCAD通过强化学习增强参数化CAD模型生成,利用预训练模型生成高精度CAD模型,显著提升几何精度和语义保真度。

Comments Accepted as an Oral presentation at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏