arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 19037 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 19037 篇

2503.22732 2026-01-06 cs.LG cs.CL 79%

Reasoning Beyond Limits: Advances and Open Problems for LLMs

超越极限的推理:大型语言模型的进展与开放问题

Mohamed Amine Ferrag, Norbert Tihanyi, Merouane Debbah

机构 * United Arab Emirates University(阿拉伯联合酋长国大学) Technology Innovation Institute(技术创新研究所) Eötvös Loránd University(厄特沃什·洛朗大学) Khalifa University of Science(谢赫扎耶德科学技术大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了大型语言模型在推理能力上的最新进展,分析了多种模型的创新与性能提升,并指出了未来在多步骤推理、鲁棒性、提示平衡及工具整合等方面的研究挑战。

Comments The paper is published ICT Express Volume 11, Issue 6, December 2025, Pages 1054-1096

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23328 2026-01-05 cs.AI cs.CL cs.CV 79%

CubeBench: Diagnosing Interactive, Long-Horizon Spatial Reasoning Under Partial Observations

CubeBench: 在部分观察下诊断交互式、长周期空间推理

Huan-ang Gao, Zikang Zhang, Tianwei Luo, Kaisen Yang, Xinzhe Juan, Jiahao Qiu, Tianxing Chen, Bingxiang He, Hao Zhao, Hao Zhou, Shilong Liu, Mengdi Wang

机构 * THU(清华大学) Princeton(普林斯顿大学) SJTU & UMich(上海交通大学 & 密歇根大学) HKU(香港大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 CubeBench通过魔方基准评估LLM在部分观察下的空间推理和长周期任务能力,揭示LLM在长期规划中的根本缺陷。

Comments Webpage: https://cubebench.c7w.tech/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18262 2025-12-30 cs.RO cs.AI cs.CV cs.HC cs.LG 79%

ReSemAct: Advancing Fine-Grained Robotic Manipulation via Semantic Structuring and Affordance Refinement

ReSemAct:通过语义结构化和效用细化推进细粒度机器人操作

Chenyu Su, Weiwei Shang, Chen Qian, Fei Zhang, Shuang Cong

机构 * Department of Automation, University of Science and Technology of China(自动化系,中国科学技术大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 ReSemAct 通过语义结构化和效用细化方法,在细粒度机器人操作中实现更精确的效用目标生成与动态环境适应。

Comments Code and videos: https://github.com/scy-v/ReSemAct and https://resemact.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21723 2025-12-29 cs.RO cs.AI cs.LG 79%

HELP: Hierarchical Embodied Language Planner for Household Tasks

家庭任务的分层具身语言规划器HELP

Alexandr V. Korchemnyi, Anatoly O. Onishchenko, Eva A. Bakaeva, Alexey K. Kovalev, Aleksandr I. Panov

机构 * MIRAI Cognitive AI Systems Lab(认知人工智能系统实验室)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 HELP通过分层结构的LLM智能体解决家庭任务中的复杂规划问题,结合自然语言处理与具身智能,实现高效任务执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19864 2025-12-29 cs.CL cs.AI 79%

HARMON-E: Hierarchical Agentic Reasoning for Multimodal Oncology Notes to Extract Structured Data

HARMON-E:多模态肿瘤病历的分层代理推理以提取结构化数据

Shashi Kant Gupta, Arijeet Pramanik, Jerrin John Thomas, Regina Schwind, Lauren Wiener, Avi Raju, Jeremy Kornbluth, Yanshan Wang, Zhaohui Su, Hrituraj Singh

机构 * Triomics University of Pittsburgh(匹兹堡大学) Ontada

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 HARMON-E通过分层代理推理框架,实现对多模态肿瘤病历的结构化数据提取,达到高精度和大规模应用。

Comments 39 Pages, Supplementary Included

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20312 2025-12-29 cs.LG cs.AI 79%

TableGPT-R1: Advancing Tabular Reasoning Through Reinforcement Learning

TableGPT-R1: 通过强化学习推进表格推理

Saisai Yang, Qingyi Huang, Jing Yuan, Liangyu Zha, Kai Tang, Yuhang Yang, Ning Wang, Yucheng Wei, Liyao Li, Wentao Ye, Hao Chen, Tao Zhang, Junlin Zhou, Haobo Wang, Gang Chen, Junbo Zhao

机构 * Zhejiang University Institute of Computing Innovation(浙江大学计算创新研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.AI、cs.LG

AI总结 TableGPT-R1通过强化学习框架提升表格推理能力,整合数据工程、奖励系统和多阶段训练框架,实现复杂表格任务的先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17266 2025-12-24 cs.CL cs.AI 79%

Select2Reason: Efficient Instruction-Tuning Data Selection for Long-CoT Reasoning

Select2Reason: 为长链推理实现高效的指令微调数据选择

Cehao Yang, Xueyuan Lin, Xiaojun Wu, Chengjin Xu, Xuhui Jiang, Honghao Liu, Hui Xiong, Jian Guo

机构 * DataArc Tech Ltd.(DataArc科技有限公司) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) IDEA Research, International Digital Economy Academy(IDEA研究所,国际数字经济学院) Hithink RoyalFlush Information Network Co., Ltd(Hithink RoyalFlush信息网络有限公司)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Select2Reason通过高效数据选择提升长链推理性能,实验证明其在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17912 2025-12-23 cs.CL cs.AI 79%

Graph-O1 : Monte Carlo Tree Search with Reinforcement Learning for Text-Attributed Graph Reasoning

Graph-O1:基于强化学习的蒙特卡洛树搜索用于文本属性图推理

Lihui Liu

机构 * Wayne State University(韦恩州立大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Graph-O1通过整合蒙特卡洛树搜索与强化学习,实现文本属性图的分步交互推理,提升问答任务的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14918 2025-12-23 cs.CL cs.LG stat.ML 79%

Reliable Decision Support with LLMs: A Framework for Evaluating Consistency in Binary Text Classification Applications

利用LLM实现可靠决策支持:一种评估二元文本分类应用一致性的框架

Fadel M. Megahed, Ying-Ju Chen, L. Allision Jones-Farmer, Younghwa Lee, Jiawei Brooke Wang, Inez M. Zwetsloot

机构 * Farmer School of Business, Miami University, Oxford, OH 45056, USA(迈阿密大学法默商学院) College of Arts and Sciences, University of Dayton, Dayton, OH 45469, USA(Dayton大学文理学院) Amsterdam Business School, University of Amsterdam, Amsterdam, The Netherlands(阿姆斯特丹大学阿姆斯特丹商学院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种评估LLM在二元文本分类中一致性的框架,通过实验验证了不同模型在金融新闻分类中的性能,并提供了系统化的LLM选择和可靠性评估方法。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17079 2025-12-22 cs.LG cs.AI 79%

Can Large Reasoning Models Improve Accuracy on Mathematical Tasks Using Flawed Thinking?

大推理模型能否通过错误推理提升数学任务的准确性?

Saraswathy Amjith, Mihika Dusad, Neha Muramalla, Shweta Shah

机构 * MIT(麻省理工学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过训练模型处理故意错误推理轨迹,提升其在数学任务中的错误恢复能力,同时保持准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10422 2025-12-18 cs.CL cs.AI 79%

Cooperative Retrieval-Augmented Generation for Question Answering: Mutual Information Exchange and Ranking by Contrasting Layers

协作检索增强生成用于问答:通过对比层进行互信息交换和排序

Youmin Ko, Sungjong Seo, Hyunjoon Kim

机构 * Department of Artificial Intelligence, Hanyang University(人工智能学院,翰阳大学) Department of Data Science, Hanyang University(数据科学学院,翰阳大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 CoopRAG通过协作检索与生成机制,提升问答任务中检索与生成的准确性。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10400 2025-12-17 cs.MA cs.AI cs.CL 79%

Rethinking the Reliability of Multi-agent System: A Perspective from Byzantine Fault Tolerance

重新思考多智能体系统可靠性:从拜占庭容错的角度出发

Lifan Zheng, Jiawei Chen, Qinghong Yin, Jingyuan Zhang, Xinyi Zeng, Yu Tian

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文从拜占庭容错角度研究基于大语言模型的智能体可靠性,提出CP-WBFT机制提升多智能体系统稳定性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17904 2025-12-16 cs.CR cs.AI cs.CL 79%

BreakFun: Jailbreaking LLMs via Schema Exploitation

BreakFun: 通过模式利用对LLM进行劫持

Amirkia Rafiei Oskooei, Mehmet S. Aktas

机构 * Department of Computer Engineering, Yildiz Technical University(计算机工程系,伊兹密尔技术大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 BreakFun通过利用LLM对结构模式的遵守能力,揭示了其在劫持攻击中的脆弱性,并提出对抗性提示解构作为缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10019 2025-12-16 cs.CL cs.AI 79%

Decoupling Understanding from Reasoning via Problem Space Mapping for Small-Scale Model Reasoning

通过问题空间映射解耦理解与推理以提升小型模型推理能力

Li Wang, Changhao Zhang, Zengqi Xiu, Kai Lu, Xin Yu, Kui Zhang, Wenjun Wu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);small language model(abstract);分类 cs.CL、cs.AI

AI总结 DURIT通过问题空间映射解耦理解和推理,提升小型模型在数学和逻辑推理任务中的性能和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11277 2025-12-15 cs.CL cs.LG 79%

When Actions Teach You to Think: Reasoning-Action Synergy via Reinforcement Learning in Conversational Agents

当行动教你思考:通过强化学习在对话代理中实现推理-行动协同

Mrinal Rawat, Arkajyoti Chakraborty, Neha Gupta, Roberto Pieraccini

机构 * Uniphore

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.LG

AI总结 通过强化学习实现对话代理中推理与行动的协同,提升模型推理质量和工具调用精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10121 2025-12-12 cs.CL cs.AI cs.CY q-fin.GN 79%

Workflow is All You Need: Escaping the "Statistical Smoothing Trap" via High-Entropy Information Foraging and Adversarial Pacing

流程即一切:通过高熵信息觅食和对抗性节奏控制摆脱'统计平滑陷阱

Zhongjie Jiang

机构 * Zhongjie Jiang(江宗杰)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出DeepNews框架,通过高熵信息觅食和对抗性节奏控制,解决LLMs在长文本生成中的幻觉、逻辑一致性和个性化表达难题,实验显示其在金融报道中表现优异。

Comments 22 pages, 8 figures. Includes an ecological validity blind test where the Agentic Workflow achieved a 25% acceptance rate in top-tier media, decisively outperforming the SOTA Zero-shot baseline (0%). Features the DNFO-v5 ontology

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09199 2025-12-11 cs.LG cs.AI cs.PF 79%

LLMs for Analog Circuit Design Continuum (ACDC)

用于模拟电路设计连续体的大型语言模型(ACDC)

Yasaman Esfandiari, Jocelyn Rego, Austin Meyer, Jonathan Gallagher, Mia Levy

机构 * HRL Laboratories(HRL实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了大型语言模型在模拟电路设计中的适用性与一致性,探讨了不同数据表示对模型行为的影响,并揭示了LLMs在工程任务中的可靠性挑战与潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24125 2025-12-11 cs.LG cs.AI 79%

The Impossibility of Inverse Permutation Learning in Transformer Models

Transformer模型中反排列学习的不可能性

Rohan Alur, Chris Hays, Manish Raghavan, Devavrat Shah

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 Transformer模型中反排列学习的不可能性,通过解码器-only架构的表达能力限制,提出通过添加空白标记实现可行的替代方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08659 2025-12-10 cs.CL cs.LG 79%

An Agentic AI System for Multi-Framework Communication Coding

多框架通信编码的代理AI系统

Bohao Yang, Rui Yang, Joshua M. Biro, Haoyuan Wang, Jessica L. Handley, Brianna Richardson, Sophia Bessias, Nicoleta Economou-Zavlanos, Armando D. Bedoya, Monica Agrawal, Michael M. Zavlanos, Anand Chowdhury, Raj M. Ratwani, Kai Sun, Kathryn I. Pollak, Michael J. Pencina, Chuan Hong

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出MOSAIC系统,通过多代理架构实现多框架临床沟通编码,达到高F1得分,尤其在患者行为识别上表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10240 2025-12-10 cs.AI cs.CL 79%

ProgRAG: Hallucination-Resistant Progressive Retrieval and Reasoning over Knowledge Graphs

ProgRAG: 一种抗幻觉的逐步检索和知识图谱推理框架

Minbae Park, Hyemin Yang, Jeonghyun Kim, Kunsoo Park, Hyunjoon Kim

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 ProgRAG通过分解复杂问题并逐步扩展推理路径,提升知识图谱问答的可靠性和推理质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02405 2025-12-03 cs.CV cs.AI cs.LG 79%

WISE: Weighted Iterative Society-of-Experts for Robust Multimodal Multi-Agent Debate

WISE: 加权迭代专家社会用于鲁棒多模态多智能体辩论

Anoop Cherian, River Doyle, Eyal Ben-Dov, Suhas Lohit, Kuan-Chuan Peng

机构 * Mitsubishi Electric Research Labs(三菱电机研究实验室) Cambridge Rindge and Latin School(剑桥林恩和拉丁学校)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出WISE框架,通过多模态多智能体辩论提升视觉语言推理任务的准确性,实验显示在多个数据集上提升了2-7%的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11373 2025-12-02 cs.CL cs.AI 79%

Reliable Reasoning Beyond Natural Language

超越自然语言的可靠推理

Nasim Borazjanizadeh, Steven T. Piantadosi

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出神经符号推理方法,通过整合Prolog引擎,解决LLMs在非线性推理任务中的不足,提升推理能力和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00729 2025-12-02 cs.AI cs.CL 79%

Probing the "Psyche'' of Large Reasoning Models: Understanding Through a Human Lens

探查大型推理模型的“心理”:通过人类视角理解

Yuxiang Chen, Zuohan Wu, Ziwei Wang, Xiangning Yu, Xujia Li, Linyi Yang, Mengyue Yang, Jun Wang, Lei Chen

机构 * University College London London United Kingdom The Hong Kong University of Science Tianjin University Tianjin China Southern University of Science University of Bristol Bristol United Kingdom University College London AI Lab, the Yangtze River Delta, China Tianjin University University of Bristol

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 本文通过引入分类体系和CAPO框架,从人类视角深入分析大型推理模型,揭示其推理过程中的不足,并提出改进方向。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15809 2025-12-02 cs.CL cs.AI cs.DB 79%

Chain-of-Query: Unleashing the Power of LLMs in SQL-Aided Table Understanding via Multi-Agent Collaboration

链式查询:通过多智能体协作释放LLM在SQL辅助表格理解中的潜力

Songyuan Sui, Hongyi Liu, Serena Liu, Li Li, Soo-Hyun Choi, Rui Chen, Xia Hu

机构 * Rice University(里士大学) Samsung Electronics America(三星电子美国分公司) Warner Bros. Discovery(华纳兄弟发现)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 链式查询通过多智能体协作提升SQL辅助表格理解的准确性与有效性

Comments AACL 2025 Main Conference (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22570 2025-12-01 cs.AI cs.CL 79%

DeepSeekMath-V2: Towards Self-Verifiable Mathematical Reasoning

DeepSeekMath-V2:迈向自我验证的数学推理

Zhihong Shao, Yuxiang Luo, Chengda Lu, Z. Z. Ren, Jiewen Hu, Tian Ye, Zhibin Gou, Shirong Ma, Xiaokang Zhang

机构 * DeepSeek-AI

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DeepSeekMath-V2通过自我验证机制提升数学推理能力,实现定理证明的高准确率和严谨性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21928 2025-12-01 cs.LG cs.AI 79%

Prompted Policy Search: Reinforcement Learning through Linguistic and Numerical Reasoning in LLMs

提示策略搜索:通过语言和数值推理在大语言模型中进行强化学习

Yifan Zhou, Sachin Grover, Mohamed El Mistiri, Kamalesh Kalirathnam, Pratyush Kerhalkar, Swaroop Mishra, Neelesh Kumar, Sanket Gaurav, Oya Aran, Heni Ben Amor

机构 * Interactive Robotics Lab, Arizona State University(亚利桑那州立大学交互机器人实验室) Research & Development, Procter & Gamble(普罗cter与 gamble 研究与发展)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 ProPS通过结合语言和数值推理,在大语言模型中实现高效的强化学习,展示了在多个任务中超越传统算法的性能。

Comments In The Thirty-ninth Annual Conference on Neural Information Processing Systems

Journal ref Advances in Neural Information Processing Systems (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13380 2025-11-27 cs.CL cs.IR cs.LG 79%

The Structure-Content Trade-off in Knowledge Graph Retrieval

知识图谱检索中的结构与内容权衡

Valentin Six, Evan Dufraisse, Gaël de Chalendar

机构 * Université Paris-Saclay - CEA Palaiseau - France(巴黎-萨克雷大学-CEA帕莱索-法国)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了知识图谱检索中结构与内容的权衡,通过混合检索函数发现平衡两者可提升LLM的推理效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02890 2025-11-27 cs.CL cs.AI 79%

Reasoning Transfer for an Extremely Low-Resource and Endangered Language: Bridging Languages Through Sample-Efficient Language Understanding

为极低资源和濒危语言进行推理迁移:通过高效样本的语言理解连接语言

Khanh-Tung Tran, Barry O'Sullivan, Hoang D. Nguyen

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出英语引导的Co T训练方法,通过监督微调提升极低资源语言的推理能力,并发布首个爱尔兰语数学任务基准测试,展示多语言推理的可行路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03151 2025-11-26 cs.CL cs.LG 79%

Why Reasoning Matters? A Survey of Advancements in Multimodal Reasoning (v1)

为何推理重要?多模态推理的进展综述(v1)

Jing Bi, Susan Liang, Xiaofei Zhou, Pinxin Liu, Junjia Guo, Yunlong Tang, Luchuan Song, Chao Huang, Ali Vosoughi, Guangyu Sun, Jinxi He, Jiarui Wu, Shu Yang, Daoan Zhang, Chen Chen, Lianggong Bruce Wen, Zhang Liu, Jiebo Luo, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) University of Central Florida(中央佛罗里达大学) Corning Inc.(康宁公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 本文综述了多模态推理的进展,探讨了推理在多模态任务中的挑战与优化方法,为未来研究提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07154 2025-11-26 cs.LG cs.AI 79%

Rethinking Fine-Tuning when Scaling Test-Time Compute: Limiting Confidence Improves Mathematical Reasoning

重新思考扩展测试时间计算时的微调:限制置信度可提升数学推理

Feng Chen, Allan Raventos, Nan Cheng, Surya Ganguli, Shaul Druckmann

机构 * Stanford University(斯坦福大学) University of Michigan(密歇根大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 通过限制模型置信度改进数学推理,研究发现传统交叉熵损失与测试时间策略pass@N存在不一致,提出改进的训练损失以提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏