arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18998 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18998 篇

2607.11696 2026-07-14 cs.AI 新提交 81%

Think Through a Bottleneck: Hourglass Reasoning for Rigorous Induction

突破瓶颈:用于严格归纳的沙漏推理

Huan Zhu

机构 * Peking University(北京大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究针对大语言模型少样本归纳推理能力不足的问题,提出沙漏推理方法,通过在推理阶段强制实现严格上下文隔离,构建符号编码器 - 解码器。实验表明该方法在多基准测试中显著提升准确率,证实收益源于阶段隔离和初始归纳质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08700 2026-07-10 cs.CL 新提交 81%

Do You Need a Frontier Model as a Citation Verifier? Benchmarking Rubric LLMs for Deep-Research Source Attribution

深度研究源归因的基准测试:评估用于验证引用的前沿模型

Ethan Leung, Elias Lumer, Corey Feld, Austin Huber, Vamse Kumar Subbiah, Kevin Paul

机构 * Commercial Technology and Innovation Office, PricewaterhouseCoopers, U.S.(普华永道商业技术与创新办公室)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 研究深度研究系统中引用质量校准问题,用现成LLM对1248个评分决策与黄金标准标签对比,发现较便宜模型有竞争力,校准模型是用引用评分作奖励信号的前提,校准不须最昂贵模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23440 2026-07-10 cs.CL cs.IR 版本更新 81%

Truncated Step-Level Sampling with Process Rewards for Retrieval-Augmented Reasoning

截断步骤级采样与过程奖励用于检索增强推理

Chris Samarinas, Haw-Shiuan Chang, Hamed Zamani

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出SLATE方法,通过截断步骤级采样和密集过程奖励解决检索增强推理中的信用分配问题,实验表明其在多跳任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14948 2026-07-08 cs.SE cs.AI 新提交 81%

Beyond Correctness: Enhancing Architectural Reasoning in Code LLMs via Scalable Labeling with Agentic Judgment

超越正确性:通过可扩展的智能体判断标注增强代码大模型的架构推理能力

Kirill Vasilevski, Ximing Dong, Benjamin Rombaut, Milad Soltany, Ruochen Deng, Jiahuei Lin, Arthur Leung, Dayi Lin, Boyuan Chen, Shaowei Wang, Ahmed E. Hassan

机构 * Centre for Software Excellence, Huawei Canada(华为加拿大软件卓越中心) Department of Computer Science, University of Manitoba, Canada(曼尼托巴大学计算机科学系) School of Computing, Queen’s University, Canada(皇后大学计算科学学院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对代码大模型缺乏架构理解的问题,提出智能体判断流水线,利用强LLM作为专家架构评估的代理,通过两个判断器(ACJ和AQJ)实现可扩展标注,微调模型在SWE-bench上提升高达540%,并展现跨语言泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11404 2026-07-07 cs.AI 版本更新 81%

Attributing Emergence in Million-Agent Systems

对百万智能体系统涌现的归因

Ling Tang, Jilin Mei, Qian Chen, Qihan Ren, Linfeng Zhang, Quanshi Zhang, Jing Shao, Xia Hu, Dongrui Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Tongji University(同济大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种归因方法,用于在百万级智能体系统中归因宏观现象,该方法在速度和理论基础上均优于现有方法,并证明了全规模归因对非线性宏观指标的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22730 2026-07-07 cs.CL cs.CY 版本更新 81%

How Utilitarian Are OpenAI's Models Really? Replicating and Reinterpreting Pfeffer, Krügel, and Uhl (2025)

OpenAI模型真的那么功利主义吗?复制并重新解读Pfeffer、Krügel和Uhl(2025)

Johannes Himmelreich

机构 * OpenAI

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 研究通过复制和扩展实验,发现OpenAI模型在不同提示下表现出功利主义倾向,但存在提示偏差影响结果,强调需多提示测试以验证LLM道德推理的可靠性。

Comments 20 pages, 3 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17864 2026-07-07 cs.LG 版本更新 81%

Equivalence of Context and Parameter Updates in Modern Transformer Blocks

现代Transformer模块中上下文与参数更新的等价性

Adrian Goldwaser, Michael Munn, Javier Gonzalvo, Benoit Dherin

机构 * University of Cambridge, UK(英国剑桥大学) Google Research(谷歌研究)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究将基础理论扩展到现代大语言模型多样架构,先为Gemma风格模块给出解析解,后推广结果并引入框架,证明特定条件下MLP模块可实现完美隐式权重补丁,有助于理解模型转换提示为有效权重的方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20692 2026-07-07 cs.SE cs.AI cs.FL 版本更新 81%

Neurosymbolic Characterization for Reliable Access Control Policy Analysis

探索大型语言模型用于访问控制策略合成与摘要

Adarsh Vatsa, Bethel Hall, William Eiers

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究LLM在访问控制策略自动生成中的有效性,发现非推理LLM仅45.8%生成等价策略,推理LLM达93.7%,并提出基于语义的请求摘要方法辅助策略分析。

Comments Accepted to ISSRE 2026. Major revision and retitling of arXiv:2510.20692v1. Refocuses the paper on reliable neurosymbolic access-control policy analysis; updates the PolicySummarizer method, multi-cloud evaluation, and user-study results. 13 pages, 6 figures. Corrected arXiv title metadata to match the accepted ISSRE version. No substantive content changes from the previous version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01465 2026-07-03 cs.AI 新提交 81%

Beyond Next-Token Prediction: An RLVR Proof of Concept for Tool-Use Agents on Atlassian Workflows

超越下一个词预测:Atlassian工作流中工具使用代理的RLVR概念验证

Karthikeya Aditya Vissa, Sankalp Mane, Ananya Mantravadi, Harshit Rajgarhia, Abhishek Mukherji

机构 * Centific

专题命中 推理与问题求解 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对企业SaaS工作流中LLM因目标不匹配导致的静默失败,提出在目标环境中直接应用可验证奖励强化学习(RLVR),在五个合成Jira/Confluence环境中训练Qwen模型,将平均奖励从0.35-0.92提升至0.95-1.00。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31191 2026-07-03 cs.LG 新提交 81%

ISM:Self-Improving Strategy Memory for Continual Mathematical Reasoning

ISM:面向持续数学推理的自我改进策略记忆

Prakhar Dixit, Tim Oates

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 提出智能模式记忆(ISM),一种自我演进的记忆增强系统,通过从成功和失败案例中学习并维护策略模式库,在不更新模型参数的情况下提升冻结LLM在持续学习中的数学推理能力。

Comments 3rd AI for Math Workshop at ICML 2026 Forty-Third International Conference on Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17965 2026-07-03 cs.SE cs.AI 版本更新 81%

BLAgent: Agentic RAG for File-Level Bug Localization

BLAgent: 一种面向文件级Bug定位的代理RAG

Md Afif Al Mamun, Gias Uddin

机构 * University of Calgary(卡尔加里大学) York University(约克大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出BLAgent,一种新型代理RAG框架,用于文件级Bug定位,通过结合代码结构感知的仓库编码、双视角查询转换和两阶段代理重排序,提高了Bug定位的准确性和效率。

Comments Accepted for publication in ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11689 2026-07-02 cs.AI 版本更新 81%

Explicit Logic Channel for Validation and Enhancement of MLLMs on Zero-Shot Tasks

显式逻辑通道用于验证和增强用于零样本任务的前沿多模态大语言模型

Mei Chee Leong, Ying Gu, Hui Li Tan, Liyuan Li, Nancy Chen

机构 * Institute for Infocomm Research (I$^2$R)(信息通信研究所) Agency for Science, Technology and Research (A*STAR)(科技研究局) Singapore(新加坡)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出显式逻辑通道用于验证和增强多模态大语言模型在零样本任务中的性能,通过显式逻辑推理提高模型的可解释性和可信度。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04988 2026-07-02 cs.MA cs.AI 版本更新 81%

When AI Agents Compete for Jobs: Strategic Capabilities and Economic Dynamics of AI Labour Markets

当AI代理竞争工作岗位:AI劳动力市场的战略能力与经济动态

Christopher Chiu, Simpson Zhang, Mihaela van der Schaar

机构 * DAMTP, University of Cambridge(剑桥大学应用数学与理论物理系)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AI-Work模拟平台,研究AI代理在劳动力市场中的竞争行为,发现元认知、竞争意识和长期战略规划能力使代理获得更高利润和市场份额。

Comments Accepted at ICML 2026, Code available at https://github.com/chy-chiu/ai-work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30987 2026-07-01 cs.CL econ.GN q-fin.EC 新提交 81%

Measuring Judgment Quality in Natural-Language Explanations: Evidence from Forecasting Tournaments

自然语言解释中的判断质量测量:来自预测锦标赛的证据

Christopher W. Karvetski, Sheldon S. Huang, Simas Kučinskas, Nadja Flechner, Jingyu Hu, Philip Tetlock, Ezra Karger

机构 * Forecasting Research Institute(预测研究所) Good Judgment Inc(Good Judgment公司) University of Toronto(多伦多大学) Vector Institute for Artificial Intelligence(向量人工智能研究所) Stanford University(斯坦福大学) School of Arts and Sciences & Wharton, University of Pennsylvania(宾夕法尼亚大学文理学院与沃顿商学院) Federal Reserve Bank of Chicago(芝加哥联邦储备银行) Federal Reserve System(联邦储备系统)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出解释质量标记(EQMs),用大语言模型评分60种理论驱动的推理模式,在超过55,000个预测-理由对中预测准确性,优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20055 2026-07-01 cs.RO cs.AI cs.CV 版本更新 81%

CoReLIN: Constraint-based Reasoning for Zero-shot Lifelong Interactive Navigation

CoReLIN: 基于约束推理的零样本终身交互式导航

Apoorva Vashisth, Manav Kulshrestha, Pranav Bakshi, Damon Conover, Guillaume Sartoretti, Aniket Bera

机构 * Purdue University(普渡大学) Indian Institute of Technology, Kharagpur(印度理工学院卡哈拉格普尔分校) DEVCOM Army Research Lab(DEVCOM陆军研究实验室) National University of Singapore(新加坡国立大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出CoReLIN框架,利用LLM和场景图推理,在终身交互式导航中通过移动物体开辟路径并完成任务,显著提升长期效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18492 2026-07-01 cs.AI 81%

Formally Solving Answer-Construction Problems in Lean

在 Lean 中形式化求解答案构造问题

Jialiang Sun, Yuzhi Tang, Ao Li, Chris J. Maddison, Kuldeep S. Meel

机构 * University of Toronto(多伦多大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出 Enumerate-Conjecture-Prove (ECP) 框架,结合通用大语言模型和证明器大语言模型,在 Lean 中端到端地构造答案并生成形式化证明,解决数学竞赛中的答案构造问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01273 2026-07-01 cs.AI 版本更新 81%

Disentangling Reasoning Logic to Resolve Explicit Knowledge Conflicts

解耦推理逻辑以解决显式知识冲突

Xianda Zheng, Zijian Huang, Meng-Fen Chiang, Jiamou Liu, Yuan Fang, Michael Witbrock, Kaiqi Zhao

机构 * School of Computer Science, University of Auckland(奥克兰大学计算机科学学院) Department of Electronics and Electrical Engineering, National Yang Ming Chiao Tung University(国立阳明交通大学电子与电机工程学系) School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算与信息系统学院) Shenzhen Key Laboratory of Internet Information Collaboration, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)深圳市互联网信息协同重点实验室)

专题命中 推理与问题求解 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出KCR框架,通过将冲突上下文解耦为推理轨迹并利用强化学习优化逻辑一致性,有效解决LLM中的显式知识冲突,7B模型性能超越GPT-4o等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29799 2026-06-30 cs.AI 81%

The CRISTAL Method: Neurosymbolic analysis from AI-synthesized world models

CRISTAL方法:来自AI合成世界模型的神经符号分析

Rafael Kaufmann, Felix Neubürger, Michael Walters, Thomas Kopinski, Dimitrije Marković

机构 * GAIA Lab(GAIA实验室) South Westphalia University of Applied Sciences(西南弗里西亚应用科学大学) Technical University Dresden(德累斯顿技术大学) Primordia Co.(Primordia公司)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出CRISTAL神经符号框架,通过贝叶斯推理、主动学习和持续学习自动化复杂分析,在合成股票分类任务中仅用5个样本和5秒达到贝叶斯最优精度,远超LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28733 2026-06-30 cs.AI 81%

Agentic Abstention: Do Agents Know When to Stop Instead of Act?

Agentic Abstention: 智能体知道何时停止而非行动吗?

Han Luo, Bingbing Wen, Lucy Lu Wang

机构 * University of Leeds(利兹大学) Southwest Jiaotong University(西南交通大学) University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究LLM智能体在不确定环境下何时应停止行动的问题,提出Agentic Abstention概念,通过实验分析不同模型和框架的弃权行为,并引入CONVOLVE方法提升及时弃权率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02003 2026-06-30 cs.CL cs.HC 81%

HoT: Highlighted Chain of Thought for Referencing Supporting Facts from Inputs

HoT: 用于从输入中引用支持事实的高亮推理链

Tin Nguyen, Logan Bolton, Mohammad Reza Taesiri, Trung Bui, Anh Totti Nguyen

机构 * Auburn University(亚伯拉罕大学) University of Alberta(阿尔伯塔大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出HoT技术,通过XML标签高亮输入中的关键事实,减少LLM的幻觉问题,提升22项任务的准确性,并帮助人类更高效地验证结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27397 2026-06-29 cs.MA cs.AI cs.GT 新提交 81%

SidConArena: An Environment Evaluating Agents in Open-Ended,Positive-Sum Bargaining Game

SidConArena:一个在开放、正和博弈中评估智能体的环境

Yeqi Feng, Yuxin Chen, Tianxing He

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出SidConArena基准框架,通过三阶段部分可观测随机博弈评估LLM智能体在开放、正和谈判中的经济决策能力,发现前沿模型虽表现更好但仍存在资源误估、谈判被动和长期规划不足。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21233 2026-06-29 cs.AI 版本更新 81%

Just Ask: Curious Code Agents Reveal System Prompts in Frontier LLMs

Just Ask: 好奇的代码代理揭示前沿大语言模型中的系统提示

Xiang Zheng, Yutao Wu, Hanxun Huang, Yige Li, Xingjun Ma, Bo Li, Yu-Gang Jiang, Cong Wang

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出JustAsk框架,利用代码代理的自主交互能力,通过在线探索策略自动提取大语言模型的隐藏系统提示,揭示了系统提示作为新兴安全漏洞。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27359 2026-06-26 stat.ML cs.LG 新提交 81%

When are likely answers right? On Sequence Probability and Correctness in LLMs

何时可能答案正确?关于LLM中的序列概率与正确性

Johannes Zenn, Jonas Geiping

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ELLIS Institute Tübingen(图宾根ELLIS研究所) AI Center Tübingen(图宾根人工智能中心) University of Tübingen(图宾根大学) IMPRS-IS(图宾根马克斯·普朗克研究所)

专题命中 推理与问题求解 :LLM(title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究大型语言模型中序列概率与正确性的关系,发现序列概率在固定数据集内预测正确性有效,但通过改变解码方法或超参数提高概率并不稳定提升准确率,且对同一提示的多次响应中概率不是正确性的良好指标。

Comments 38 pages, including 10 pages of main text and 28 pages of appendix, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26797 2026-06-26 cs.LG 新提交 81%

Reasoning Quality Emerges Early: Data Curation for Reasoning Models

推理质量早期涌现:推理模型的数据策展

Hongyi Henry Jin, Wenhan Yang, Meysam Ghaffari, Carlos Morato, Baharan Mirzasoleiman

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出仅利用初始推理token即可识别多样且具挑战性的推理样本,通过扰动检查点评估前100个token的损失检测难题,并证明前1k token的损失模式可预测梯度相似性,在Qwen2.5-7B和Llama3.1-8B上验证,性能提升达1.7%,token效率提升91%。

Comments Accepted by ICML 2026 (Poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24889 2026-06-25 cs.CL cs.SD 新提交 81%

Graph-Based Phonetic Error Correction of Noisy ASR

基于图的噪声ASR语音错误纠正

Pratik Rakesh Singh, Mohammadi Zaki, Aneesh Mukkamala, Pankaj Wasnik

机构 * Sony Research India(索尼印度研究院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出G-SPIN框架,结合图神经网络构建音近候选集,并用掩码语言模型和指令调优大语言模型进行上下文重排序,以纠正ASR中结构化的音近错误。

Comments Accepted at ACL Industry Track 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22110 2026-06-23 cs.SE cs.AI cs.HC 新提交 81%

TraceView: Interactive Visualization of Agentic Program Repair Trajectories

TraceView: 智能体程序修复轨迹的交互式可视化

Amirali Sajadi, Tu Nguyen, Kimmie Huynh, Esteban Parra, Preetha Chatterjee

机构 * Belmont University(贝尔蒙特大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出TraceView工具,通过交互式可视化和语义关系标注,帮助开发者诊断LLM-based自动程序修复代理的失败原因,支持轨迹扫描与理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21836 2026-06-23 cs.AR cs.AI 新提交 81%

AgentDSE: Reasoning-Augmented Architectural Design Space Exploration

AgentDSE:推理增强的架构设计空间探索

Chenyu Wang, Jiahe Caroline Shi, David Kong, Duane S. Boning, Zishen Wan, Yilun Du, Vijay Janapa Reddi

机构 * Harvard University(哈佛大学) Massachusetts Institute of Technology(麻省理工学院) Columbia University(哥伦比亚大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出AgentDSE,利用大语言模型编码代理自动进行架构推理,在DNN加速器映射、软硬件协同设计和CPU缓存层次优化中,以少两个数量级的评估次数达到竞争或更优的设计质量。

Comments Accepted to the Machine Learning for Architecture and Systems Workshop (MLArchSys), co-located with ISCA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08999 2026-06-23 cs.CL 版本更新 81%

Learning When to Sample: Confidence-Aware Selective Sampling for Efficient Chain-of-Thought Reasoning

学习何时采样:面向高效链式思维推理的置信度感知选择性采样

Juming Xiong, Kevin Guo, Congning Ni, Weixin Liu, Chao Yan, Katherine Brown, Avinash Baidya, Xiang Gao, Bradley Malin, Zhijun Yin

机构 * Vanderbilt University(范德比尔特大学) Vanderbilt University Medical Center(范德比尔特大学医学中心) Intuit AI Research(Intuit AI研究院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出置信度感知选择性采样框架,通过分析单条推理轨迹自适应决定是否触发多路径采样,在保持性能的同时显著降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19315 2026-06-18 cs.LG 新提交 81%

Diffusion-Proof: Recipe for Formal Theorem Proving Beyond Auto-Regressive Generation

Diffusion-Proof:超越自回归生成的正式定理证明配方

Ruida Wang, Rui Pan, Pengcheng Wang, Shizhe Diao, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) NVIDIA(英伟达)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出Diffusion-Proof框架,首次将扩散语言模型应用于形式定理证明,通过全证明生成和局部校正方法,在ProofNet和MiniF2F上分别提升1.61%和6.14%,并解决了一个DeepSeek-Prover-V2-7B无法解决的IMO问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18624 2026-06-18 cs.CL 新提交 81%

PragReST: Self-Reinforcing Counterfactual Reasoning for Pragmatic Language Understanding

PragReST:用于语用语言理解的自我强化反事实推理

Jihyung Park, Minchao Huang, Leqi Liu, Elias Stengel-Eskin

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出PragReST框架,通过自监督构建语用问答数据、生成反事实推理轨迹,结合监督微调和强化学习提升大语言模型的语用推理能力,在四个基准上显著优于基线模型。

Comments First two authors contributed equally. Code and models: https://github.com/jihyung803/PragReST

详情

展开后加载摘要…

URL PDF HTML 收藏