arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18971 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18971 篇

2512.15662 2026-03-19 cs.AI 83%

Stepwise Think-Critique: A Unified Framework for Robust and Interpretable LLM Reasoning

逐步思考-批判:一种用于鲁棒且可解释的大语言模型推理的统一框架

Jiaqi Xu, Cuiling Lan, Xuejin Chen, Yan Lu

机构 * University of Science and Technology of China(中国科学技术大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出STC框架,通过在推理与自我批判间交替进行,提升大语言模型的鲁棒性和可解释性,实验显示其在数学推理任务中表现出色。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00479 2026-03-19 cs.AI 83%

Aligning Probabilistic Beliefs under Informative Missingness: LLM Steerability in Clinical Reasoning

在信息缺失下对概率信念进行对齐:临床推理中的LLM可引导性

Yuta Kobayashi, Vincent Jeanselme, Shalmali Joshi

机构 * Department of Biomedical Informatics(生物医学信息学系)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究LLM能否利用信息性缺失进行预测推理,通过分析三种提示方法发现,尽管结构引导和上下文学习可提升概率对齐,但需精心干预才能利用信息性缺失。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13243 2026-03-17 cs.AI 83%

Think First, Diffuse Fast: Improving Diffusion Language Model Reasoning via Autoregressive Plan Conditioning

先思后推:通过自回归计划条件改进扩散语言模型推理

Earl J St Sauver

机构 * Independent Researcher(独立研究者)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 本文提出计划条件方法,通过在扩散模型提示前添加自回归生成的计划,提升多步推理能力,实验表明在GSM8K和HumanEval上分别提升11.6和12.8个百分点,证明了协调问题假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11266 2026-03-13 cs.AI 83%

The Unlearning Mirage: A Dynamic Framework for Evaluating LLM Unlearning

消除幻觉:一种动态框架用于评估大语言模型的消除

Raj Sanjay Shah, Jing Huang, Keerthiram Murugesan, Nathalie Baracaldo, Diyi Yang

机构 * Georgia Institute of Technology(佐治亚理工学院) Stanford University(斯坦福大学) IBM Research(IBM研究院)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种动态框架,用于评估大语言模型消除方法的鲁棒性,通过复杂结构查询揭示消除技术在多跳设置中的脆弱性,并提供可扩展的评估方法。

Comments Published at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10640 2026-03-12 cs.CL 83%

Making Bielik LLM Reason (Better): A Field Report

使Bielik LLM推理能力更优:一份领域报告

Adam Trybus, Bartosz Bartnicki, Remigiusz Kinas

机构 * Institute of Philosophy Jagiellonian University(杰洛尼亚大学哲学学院) Bielik.ai (Speakleash Foundation)(Bielik.ai(Speakleash基金会))

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文旨在通过评估和提升Bielik的推理能力,使其在快速变化的AI领域保持竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10357 2026-03-12 cs.NI cs.AI 83%

Utility Function is All You Need: LLM-based Congestion Control

效用函数就是一切:基于LLM的拥塞控制

Neta Rozen-Schiff, Liron Schiff, Stefan Schmid

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出GenCC框架,利用LLM生成代码能力设计拥塞控制效用函数,实验表明其在不同场景下可提升拥塞控制协议性能37%-142%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09215 2026-03-11 cs.CL eess.AS 83%

SPAR-K: Scheduled Periodic Alternating Early Exit for Spoken Language Models

SPAR-K:调度周期性交替早退用于语音语言模型

Hsiao-Ying Huang, Cheng-Han Chiang, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学)

专题命中 推理与问题求解 :language model(title,abstract);SLM(abstract);分类 cs.CL

AI总结 SPAR-K通过调度周期性交替早退机制,提升语音语言模型的推理效率,同时保持感知质量,减少解码深度并优化性能。

Comments 6 pages, 1 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08230 2026-03-10 cs.SD cs.AI eess.AS 83%

Disentangling Reasoning in Large Audio-Language Models for Ambiguous Emotion Prediction

解构大音频-语言模型中的推理能力以实现模糊情绪预测

Xiaofeng Yu, Jiaheng Dong, Jean Honorio, Abhirup Ghosh, Hong Jia, Ting Dang

机构 * University of Auckland, New Zealand(奥克兰大学) The University of Melbourne, Australia(墨尔本大学) University of Birmingham, United Kingdom(伯明翰大学)

专题命中 推理与问题求解 :language model(title,abstract);SFT(abstract);分类 cs.AI

AI总结 本文提出了一种新的方法,通过将模糊情绪识别转化为分布推理问题,提升大音频-语言模型在模糊情绪预测中的推理能力。

Comments The paper was submitted to Interspeech for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07197 2026-03-10 cs.AI 83%

$\textbf{Re}^{2}$: Unlocking LLM Reasoning via Reinforcement Learning with Re-solving

Re²:通过强化学习与重解解锁LLM推理

Pinzheng Wang, Shuli Xu, Juntao Li, Yu Luo, Dong Li, Jianye Hao, Min Zhang

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Re²通过强化学习与重解方法,使LLM能够灵活放弃无效推理路径并重新开始,从而提升推理性能和测试效率。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08105 2026-03-09 cs.CL 83%

MERLIN: Multi-Stage Curriculum Alignment for Multilingual Encoder-LLM Integration in Cross-Lingual Reasoning

MERLIN:多阶段课程对齐用于多语言编码器-大语言模型集成的跨语言推理

Kosei Uemura, David Guzmán, Quang Phuoc Nguyen, Jesujoba Oluwadara Alabi, En-shiun Annie Lee, David Ifeoluwa Adelani

机构 * University of Toronto(多伦多大学) Mila-Quebec AI Institute, McGill University(魁北克AI研究所,麦吉尔大学) OntarioTech University(安大略技术大学) Saarland University(萨尔兰州立大学) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MERLIN通过多阶段课程对齐方法提升多语言编码器-大语言模型在跨语言推理中的性能,特别是在低资源语言上表现突出。

Comments Accepted to EACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07181 2026-03-05 cs.RO cs.AI cs.CV 83%

TIGeR: Tool-Integrated Geometric Reasoning in Vision-Language Models for Robotics

TIGeR: 视觉-语言模型中集成工具的几何推理

Yi Han, Enshen Zhou, Shanyu Rong, Jingkun An, Pengwei Wang, Zhongyuan Wang, Cheng Chi, Lu Sheng, Shanghang Zhang

机构 * Beihang University(北洋大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理国家重点实验室)

专题命中 推理与问题求解 :language model(title,abstract);SFT(abstract);分类 cs.AI

AI总结 TIGeR通过集成工具实现视觉-语言模型的几何推理,提升机器人操作的精确度。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03590 2026-03-05 cs.MA cs.AI 83%

Social Norm Reasoning in Multimodal Language Models: An Evaluation

多模态语言模型中的社会规范推理:一项评估

Oishik Chowdhury, Anushka Debnath, Bastin Tony Roy Savarimuthu

机构 * School of Computing, University of Otago, New Zealand(奥塔哥大学计算机学院)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 本文评估了多模态大语言模型在社会规范推理中的能力,发现GPT-4o在文本和图像模态中表现最佳,但所有模型在处理复杂规范时仍有困难。

Comments to be published in ICAART 2026 post proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05233 2026-03-03 cs.AI 83%

Electric Vehicle User Charging Behavior Analysis Integrating Psychological and Environmental Factors: A Statistical-Driven LLM based Agent Approach

电动汽车用户充电行为分析:整合心理和环境因素:一种基于统计驱动的LLM代理方法

Chuanlin Zhang, Junkang Feng, Chenggang Cui, Pengfeng Lin, Hui Chen, Yan Xu, A. M. Y. M. Ghias, Qianguang Ma, Pei Zhang

机构 * School of Electrical Engineering, Shanghai Jiaotong University(上海交通大学电气工程学院) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) Psychological Consultation Center, East China University of Political Science and Law(中国政法大学政治学与法律系心理咨询中心) School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种基于统计驱动LLM的代理方法,整合心理和环境因素分析电动汽车用户充电行为,揭示行为异质性及决策影响因素。

Comments Accepted for publication in CSEE Journal of Power and Energy Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22465 2026-03-02 cs.AI 83%

ConstraintBench: Benchmarking LLM Constraint Reasoning on Direct Optimization

ConstraintBench: 对直接优化的LLM约束推理进行基准测试

Joseph Tso, Preston Schmittou, Quan Huynh, Jibran Hutchins

机构 * Haladir Research Team(Haladir研究团队)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ConstraintBench评估LLM在约束优化任务中的直接推理能力,发现可行性是主要瓶颈,最佳模型仅达65%可行性,但可行解接近最优解。

Comments Preprint. 10 pages, 1 figure, 6 tables. Benchmark and evaluation code will be publicly released

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23193 2026-02-27 cs.AI 83%

ESAA: Event Sourcing for Autonomous Agents in LLM-Based Software Engineering

基于大语言模型的自主代理的事件溯源:ESAA

Elzo Brito dos Santos Filho

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ESAA架构通过事件溯源技术提升自主代理在软件工程中的状态管理和任务执行能力,支持多代理并发调度和异构LLM的协同工作。

Comments 13 pages, 1 figure, 4 tables. Includes 5 technical appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19128 2026-02-27 cs.AI 83%

K-Search: LLM Kernel Generation via Co-Evolving Intrinsic World Model

K-Search: 通过共进化内在世界模型生成LLM内核

Shiyi Cao, Ziming Mao, Joseph E. Gonzalez, Ion Stoica

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 K-Search通过共进化内在世界模型生成LLM内核,显著优于现有进化搜索方法,实现高效内核优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21887 2026-02-26 cs.CL 83%

ExpLang: Improved Exploration and Exploitation in LLM Reasoning with On-Policy Thinking Language Selection

ExpLang: 通过在线策略思考语言选择改进大语言模型推理中的探索与利用

Changjiang Gao, Zixian Huang, Kaichen Yang, Jiajun Chen, Jixing Li, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, Jiangsu, China(新型软件技术国家重点实验室,南京大学,江苏,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) Department of Linguistics and Translation, City University of Hong Kong, Hong Kong, China(语言学与翻译系,香港城市大学,香港,中国) School of Mathematical Sciences, Dalian University of Technology, Liaoning, China(数学科学学院,大连理工大学,辽宁,中国)

专题命中 推理与问题求解 :LLM(title,abstract);post-training(abstract);分类 cs.CL

AI总结 ExpLang通过在线策略思考语言选择改进大语言模型推理中的探索与利用,实现多语言优势提升

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07667 2026-02-26 cs.AI 83%

1-2-3 Check: Enhancing Contextual Privacy in LLM via Multi-Agent Reasoning

1-2-3 Check: 通过多智能体推理增强LLM的上下文隐私

Wenkai Li, Liwen Sun, Zhenxiang Guan, Xuhui Zhou, Maarten Sap

机构 * Language Technologies Institute Carnegie Mellon University(语言技术研究所卡内基梅隆大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过多智能体推理,有效减少LLM中的私有信息泄露,提升上下文隐私保护效果。

Comments Accepted at the International Association for AI Safety and Ethics AI (IASEAI) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20966 2026-02-25 cs.CL 83%

Blackbird Language Matrices: A Framework to Investigate the Linguistic Competence of Language Models

黑鸟语言矩阵:一种研究语言模型语言能力的框架

Paola Merlo, Chunyang Jiang, Giuseppe Samo, Vivi Nastase

机构 * Idiap Research Institute(Idiap研究机构) University of Geneva(日内瓦大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 黑鸟语言矩阵通过结构化数据集研究语言模型的语言能力与系统性模式识别

Comments Under review, 46 pages, 5 tables, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26314 2026-02-25 cs.CL 83%

Latent Thinking Optimization: Your Latent Reasoning Language Model Secretly Encodes Reward Signals in Its Latent Thoughts

潜在思维优化:你的潜在推理语言模型秘密在潜在思维中编码了奖励信号

Hanwen Du, Yuxin Dong, Xia Ning

机构 * Department of Computer Science and Engineering, The Ohio State University, USA(计算机科学与工程系,俄亥俄州立大学) Department of Biomedical Informatics, The Ohio State University, USA(生物医学信息学系,俄亥俄州立大学) Translational Data Analytics Institute, The Ohio State University, USA(转化数据分析研究所,俄亥俄州立大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文提出LTO方法,通过潜在奖励模型优化LLMs的潜在推理过程,提升推理效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20408 2026-02-25 cs.CY cs.AI cs.HC 83%

Examining and Addressing Barriers to Diversity in LLM-Generated Ideas

检验和解决大语言模型生成想法中的多样性障碍

Yuting Deng, Melanie Brucks, Olivier Toubia

机构 * Deng, Brucks, and Toubia(邓, 布鲁克斯和托比亚)

专题命中 推理与问题求解 :LLM(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本文研究了LLM生成想法的多样性问题,通过四种研究发现,通过链式推理提示和普通人物提示可分别减少固定现象和改善知识分区,从而提升想法多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15077 2026-02-24 cs.LG cs.DB 83%

Think2SQL: Reinforce LLM Reasoning Capabilities for Text2SQL

Think2SQL: 通过可验证奖励强化学习增强大语言模型的推理能力以实现文本到SQL

Simone Papicchio, Simone Rossi, Luca Cagliero, Paolo Papotti

机构 * Politecnico di Torino(托斯卡纳理工学院) EURECOM

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出Think2SQL方法,通过可验证奖励强化学习增强大语言模型的推理能力,提升文本到SQL任务的性能。

Comments 26 pages, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02410 2026-02-17 cs.LG 83%

OpenTSLM: Time-Series Language Models for Reasoning over Multivariate Medical Text- and Time-Series Data

OpenTSLM:用于多变量医学文本和时间序列数据推理的时间序列语言模型

Patrick Langer, Thomas Kaar, Max Rosenblattl, Maxwell A. Xu, Winnie Chow, Martin Maritsch, Robert Jakob, Ning Wang, Juncheng Liu, Aradhana Verma, Brian Han, Daniel Seung Kim, Henry Chubb, Scott Ceresnak, Aydin Zahedivash, Alexander Tarlochan Singh Sandhu, Fatima Rodriguez, Daniel McDuff, Elgar Fleisch, Oliver Aalami, Filipe Barata, Paul Schmiedmayer

机构 * Stanford Mussallem Center for Biodesign(斯坦福 Mussallem 生物设计中心) Centre for Digital Health Interventions(数字健康干预中心) Agentic Systems Lab(代理系统实验室) National University of Singapore(新加坡国立大学) Microsoft(微软) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google Research(谷歌研究) Stanford University(斯坦福大学) Amazon(亚马逊) Division of Cardiovascular Medicine(心血管医学部) Division of Cardiology(心内科部) Pediatric Cardiology(儿童心内科) University of Washington(华盛顿大学)

专题命中 推理与问题求解 :language model(title,abstract);prompting(abstract);分类 cs.LG

AI总结 OpenTSLM通过整合时间序列作为原生模态,提升对多变量医学文本和时间序列数据的推理能力,其模型在多个任务中均优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16730 2026-02-17 cs.CR cs.AI 83%

RapidPen: Fully Automated IP-to-Shell Penetration Testing with LLM-based Agents

RapidPen: 基于大语言模型的完全自动化IP到Shell渗透测试框架

Sho Nakatani

机构 * SecDevLab Inc(SecDevLab公司)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 RapidPen基于大语言模型实现完全自动化IP到Shell渗透测试,通过任务规划与反馈循环高效发现并利用漏洞,降低安全测试成本与门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25889 2026-02-16 cs.CV cs.CL 83%

Multimodal LLM With Hierarchical Mixture-of-Experts for VQA on 3D Brain MRI

多模态大语言模型与分层混合专家用于3D脑部MRI的视觉问答

Arvind Murari Vepa, Yannan Yu, Jingru Gan, Anthony Cuturrufo, Michael F. Romano, Weikai Li, Fabien Scalzo, Wei Wang, Yizhou Sun

机构 * UCLA Computer Science(UCLA计算机科学系) UCSF Radiology(UCSF放射学) UCLA Medicine(UCLA医学)

专题命中 推理与问题求解 :LLM(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 本研究提出了一种多模态大语言模型mpLLM,用于3D脑部MRI的视觉问答,通过分层混合专家架构提升肿瘤描述的临床可解释性,并在多个数据集上优于现有基线模型。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12159 2026-02-13 cs.RO cs.AI 83%

3DGSNav: Enhancing Vision-Language Model Reasoning for Object Navigation via Active 3D Gaussian Splatting

3DGSNav: 通过主动3D高斯散射增强视觉-语言模型的物体导航

Wancai Zheng, Hao Chen, Xianlong Lu, Linlin Ou, Xinyi Yu

机构 * Zhejiang University of Technology, Hangzhou, China(浙江工业大学,杭州,中国) Zhejiang University, Hangzhou, China(浙江大学,杭州,中国)

专题命中 推理与问题求解 :language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 3DGSNav通过主动3D高斯散射提升视觉-语言模型的物体导航能力,结合结构化视觉提示和链式推理,实现高效且可靠的导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11964 2026-02-13 cs.AI 83%

Gaia2: Benchmarking LLM Agents on Dynamic and Asynchronous Environments

Gaia2:在动态和异步环境中评估大语言模型代理的基准测试

Romain Froger, Pierre Andrews, Matteo Bettini, Amar Budhiraja, Ricardo Silveira Cabral, Virginie Do, Emilien Garreau, Jean-Baptiste Gaya, Hugo Laurençon, Maxime Lecanu, Kunal Malkan, Dheeraj Mekala, Pierre Ménard, Gerard Moreno-Torres Bertran, Ulyana Piterbarg, Mikhail Plekhanov, Mathieu Rita, Andrey Rusakov, Vladislav Vorotilov, Mengjue Wang, Ian Yu, Amine Benhalloum, Grégoire Mialon, Thomas Scialom

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Gaia2通过动态和异步环境评估大语言模型代理,揭示了推理、效率和鲁棒性之间的权衡,为代理系统的发展提供灵活的基础设施。

Comments Accepted as Oral at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08554 2026-02-12 cs.LG stat.ML 83%

Improving Reasoning for Diffusion Language Models via Group Diffusion Policy Optimization

通过群体扩散策略优化提升扩散语言模型的推理能力

Kevin Rojas, Jiahe Lin, Kashif Rasul, Anderson Schneider, Yuriy Nevmyvaka, Molei Tao, Wei Deng

机构 * Georgia Institute of Technology(佐治亚理工学院) ML Research, Morgan Stanley(摩根士丹利机器学习研究部)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 本文提出GDPO算法,通过减少ELBO估计的方差提升扩散语言模型的推理能力,实验证明其在多个基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09000 2026-02-10 cs.AI 83%

iGRPO: Self-Feedback-Driven LLM Reasoning

iGRPO:基于自我反馈的LLM推理

Ali Hatamizadeh, Shrimai Prabhumoye, Igor Gitman, Ximing Lu, Seungju Han, Wei Ping, Yejin Choi, Jan Kautz

机构 * NVIDIA(英伟达)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 iGRPO通过动态自我条件和两阶段优化,提升LLM在数学推理任务中的表现,实现更准确和一致的解决方案。

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08693 2026-02-10 cs.LG 83%

Reasoning aligns language models to human cognition

推理使语言模型对齐人类认知

Gonçalo Guiomar, Elia Torre, Pehuen Moure, Victoria Shavina, Mario Giulianelli, Shih-Chii Liu, Valerio Mante

机构 * ETH AI Center, Zürich, Switzerland ETH Zürich, Switzerland Institute for Neuroinformatics, University of Zürich \& ETH Zürich, Switzerland University College London, London, United Kingdom

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 本研究通过主动概率推理任务揭示语言模型与人类在不确定性决策中的差异,发现延长推理能显著提升推理性能,但对信息获取影响有限。

Comments 38 pages, 4 main figures, multiple appendix figures

详情

展开后加载摘要…

URL PDF HTML 收藏