arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45515 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3258 篇

2602.16793 2026-06-16 cs.LG 版本更新 70%

Escaping the Cognitive Well: Efficient Competition Math with Off-the-Shelf Models

逃离认知陷阱:使用现成模型高效解决竞赛数学问题

Xingyu Dang, Rohit Agarwal, Rodrigo Porto, Anirudh Goyal, Liam H Fowl, Sanjeev Arora

机构 * Princeton University(普林斯顿大学) Princeton Language and Intelligence(普林斯顿语言与智能)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.LG

AI总结 提出一种推理流水线,利用现成模型以极低成本在IMO风格数学问题上达到最佳性能,通过猜想提取和上下文分离解决求解器-评分器流水线中的认知陷阱问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25450 2026-06-12 cs.AI 版本更新 70%

Cross-Model Disagreement as a Label-Free Correctness Signal

跨模型分歧作为无标签正确性信号

Matt Gorbett, Suman Jana

机构 * Independent Researcher(独立研究者) Department of Computer Science Columbia University(计算机科学系哥伦比亚大学)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 提出跨模型分歧作为无标签正确性指标,通过验证模型对生成模型答案的困惑度或熵来检测错误,无需训练或标签,在多个基准上优于模型内不确定性方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21563 2026-06-12 cs.AI 版本更新 70%

Counterfactual Credit Policy Optimization for Multi-Agent Collaboration

多智能体协作的反事实信用策略优化

Zhongyi Li, Wan Tian, Jinju Chen, Huiming Zhang, Yang Liu, Yikun Ban, Fuzhen Zhuang

机构 * Beihang University(北航) Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 针对多智能体大语言模型协作中信用分配难题,提出CCPO框架,通过反事实信用估计和验证器锚定的自评估两种分配器,将团队奖励转化为个体学习信号,提升数学推理任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25158 2026-06-05 cs.AI 70%

Trace2Skill: Distill Trajectory-Local Lessons into Transferable Agent Skills

Trace2Skill: 将轨迹局部经验转化为可迁移的代理技能

Jingwei Ni, Yihao Liu, Xinpeng Liu, Yutao Sun, Mengyu Zhou, Pengyu Cheng, Dexin Wang, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang

机构 * ETH Zürich University of Zurich(苏黎世联邦理工学院) Peking University(北京大学) Zhejiang University(浙江大学) Qwen Large Model Application Team, Alibaba(阿里巴巴文心一言应用团队)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI

AI总结 本文提出Trace2Skill框架,通过归纳推理将广泛执行轨迹整合为统一的技能目录,有效提升代理技能的可迁移性和实用性,适用于多种领域。

Comments Work in Progress. May version add more experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11214 2026-06-04 cs.CL 70%

T$^\star$: Progressive Block Scaling for Masked Diffusion Language Models Through Trajectory Aware Reinforcement Learning

T$^\star$:通过轨迹感知强化学习实现掩码扩散语言模型的渐进块缩放

Hanchen Xia, Baoyou Chen, Yutang Ge, Guojiang Zhao, Siyu Zhu

机构 * Shanghai Academy of AI for Science(上海人工智能科学研究院) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) School of Mathematical Sciences(数学科学学院) Shanghai Jiao Tong University(上海交通大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL

AI总结 提出T$^\star$方法,利用基于TraceRL的训练课程,在掩码扩散语言模型中渐进增大块大小,实现高并行解码且性能损失极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05633 2026-06-04 cs.CL 70%

GIFT: Games as Informal Training for Generalizable LLMs

GIFT:游戏作为通用型LLM的非正式训练

Nuoyan Lyu, Bingbing Xu, Xueyun Tian, Weihao Meng, Yige Yuan, Yang Zhang, Zhiyong Huang, Tat-Seng Chua, Huawei Shen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) University of Washington(华盛顿大学) National University of Singapore(新加坡国立大学)

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 提出将游戏作为非正式训练环境,结合协调子任务训练(CST)方法,提升LLM在抽象推理、规划、创造力等通用能力上的泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03144 2026-06-03 cs.AI 70%

GTBench: A Curriculum-Grounded Benchmark for Evaluating LLMs as Mathematical Research Assistants in Graph Theory

GTBench:一个基于课程体系的基准,用于评估大语言模型作为图论数学研究助手的能力

Noujoud Nader, Ibrahem Aljabea, Patrick Diehl, Deepti Gupta

机构 * Louisiana State University(路易斯安那州立大学) Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室) Texas A&M-Central Texas(德克萨斯大学阿姆斯特朗中央分校)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出GTBench基准,通过三个难度递增的图论问题组(本科定义、算法推理、研究生证明)评估大语言模型的数学推理能力,发现GPT-5表现最佳,其他模型随难度下降显著,并揭示了人类与自动评估者之间的系统性分歧。

Comments 19 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01828 2026-06-02 cs.MA cs.AI 70%

Dynamic Trust-Aware Sparse Communication Topology for LLM-Based Multi-Agent Consensus

基于动态信任感知的稀疏通信拓扑用于基于LLM的多智能体共识

Wanshuang Gou, Zihan Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 提出DySCo动态稀疏共识机制,通过信任感知的边选择降低通信开销并保持共识质量。

Comments 11 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00172 2026-06-02 cs.AI 70%

CAST: Non-Privileged Clipped Asymmetric Self-Teaching with Advantage Flipping for GRPO

CAST:用于GRPO的非特权裁剪非对称自教学与优势翻转

Yang Li, Gongle Xue, Yijia Guo, Yuheng Yuan, Liwen Hu, Lei Ma

机构 * School of Software and Microelectronics, Peking University, Beijing(北京大学软件与微电子学院) School of Artificial Intelligence, Peking University, Beijing(北京大学人工智能学院) School of Computer Science, Peking University, Beijing(北京大学计算机科学学院) School of Future Technology, Peking University, Beijing(北京大学未来技术学院)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 提出CAST方法,通过无答案的自教师模型和双向局部优势符号翻转,解决GRPO中奖励稀疏和组相对优势消失的问题,提升数学推理性能。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09907 2026-06-02 cs.AI cs.MA 70%

RADAR: Redundancy-Aware Diffusion for Multi-Agent Communication Structure Generation

RADAR:面向多智能体通信结构生成的冗余感知扩散方法

Zhen Zhang, Wanjing Zhou, Juncheng Li, Hao Fei, Jun Wen, Wei Ji

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出一种基于条件离散图扩散模型的冗余感知生成框架RADAR,通过逐步生成通信拓扑并利用图有效尺寸引导,在六项基准上实现更高准确率、更低令牌消耗和更强鲁棒性。

Comments Accepted by ICML 2026 (fix typos)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29648 2026-05-29 cs.CL 70%

Verifiable Rewards Beyond Math and Code: Lightweight Corpus-Grounded Process Supervision for Factual Question Answering

超越数学与代码的可验证奖励:面向事实问答的轻量级语料库基础过程监督

Shicheng Fan, Haochang Hao, Dehai Min, Weihao Liu, Philip S. Yu, Lu Cheng

机构 * University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL

AI总结 提出CorVer,一种基于语料库共现统计的轻量级过程奖励方法,通过句子级信用分配和令牌级优势映射,在多个模型和基准上显著提升事实问答准确性且训练速度更快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28003 2026-05-28 cs.CL 70%

ResearchMath-14K: Scaling Research-Level Mathematics via Agents

ResearchMath-14K: 通过智能体扩展研究级数学

Guijin Son, Seungyeop Yi, Minju Gwak, Hyunwoo Ko, Wongi Jang, Youngjae Yu

机构 * Seoul National University(首尔国立大学) OneLineAI Yonsei University(延世大学)

专题命中 数学推理 :reasoning(abstract,abstract_cn);分类 cs.CL

AI总结 本文通过多智能体流程从学术来源构建了最大的研究级数学问题数据集ResearchMath-14K(14,056个问题),并生成220K教师轨迹,经智能体过滤后微调Qwen3模型(4B-30B)平均提升9.2个点,表明过滤后的开放问题尝试即使没有完全正确的推理轨迹也能提供有效监督。

Comments Work in progress. Dataset available at: https://huggingface.co/datasets/amphora/ResearchMath-14k

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23914 2026-05-26 cs.DC cs.AI cs.MA 70%

VineLM: Trie-Based Fine-Grained Control for Agentic Workflows

VineLM: 基于Trie的细粒度控制用于智能体工作流

Nikos Pagonas, Matthew Lou, Tianyi Peng, Dan Rubenstein, Kostis Kaffes

机构 * Columbia University(哥伦比亚大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI

AI总结 提出VineLM工作流管理器,通过Trie结构动态选择每个阶段调用的模型,在请求级目标下优化成本-延迟-准确率边界,稀疏分析减少离线分析成本98-99.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17734 2026-05-19 cs.AI 70%

Harnessing LLM Agents with Skill Programs

通过技能程序 harnessing LLM agents

Hongjun Liu, Yifei Ming, Shafiq Joty, Chen Zhao

机构 * New York University(纽约大学) Salesforce AI Research(Salesforce人工智能研究)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI

AI总结 本文提出 HASP 框架,通过将技能转化为可执行程序函数(PFs)来提升 LLM agent 在复杂任务中的表现,其核心方法是通过 PFs 在失败状态时介入并修正行动,主要贡献是通过模块化设计实现推理、训练和自改进的多场景应用。

Comments 40 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08504 2026-05-14 cs.CL 70%

A Single Layer to Explain Them All:Understanding Massive Activations in Large Language Models

一层解释所有:理解大语言模型中大规模激活现象

Zeru Shi, Zhenting Wang, Fan Yang, Qifan Wang, Ruixiang Tang

机构 * Rutgers University(罗格斯大学) Wake Forest University(威克森林大学) Meta AI

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL

AI总结 研究大语言模型中大规模激活的起源,发现ME层是大规模激活首次出现的层,并提出方法减少大规模激活的刚性,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11731 2026-04-30 cs.CL 70%

Thinking with Drafting: Optical Decompression via Logical Reconstruction

用草图思考:通过逻辑重建实现光学解压

Jingxuan Wei, Honghao He, Caijun Jia, Siyuan Li, Zheng Sun, Yuhang Xu, Yuanyuan Lin, Linzhuang Sun, Yuchen Wu, Bihui Yu, Xiangxiang Zhang, Cheng Tan

机构 * Shenyang Institute of Computing Technology, Chinese Academy of Sciences(中国科学院沈阳计算技术研究所) University of Chinese Academy of Sciences 3 ByteDance 4 Westlake University(中国科学院大学 3 字节跳动 4 西湖大学) Key Laboratory of Computing Power Network(计算功率网络重点实验室) Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(信息安全,教育部,山东计算机科学中心(济南国家超级计算中心),齐鲁工业大学(山东省科学院))

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL

AI总结 本文提出通过逻辑重建实现光学解压,引入TwD方法,利用领域特定语言作为中间表示,以生成可执行代码的视觉证明,建立视觉生成与逻辑验证的闭环系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25419 2026-04-29 cs.AI 70%

JURY-RL: Votes Propose, Proofs Dispose for Label-Free RLVR

JURY-RL: 选票提议,证明判定用于无标签的RLVR

Xinjie Chen, Biao Fu, Jing Wu, Guoxin Chen, Xinggao Liu, Dayiheng Liu, Minpeng Liao

机构 * Zhejiang University, Hangzhou, China(浙江大学,杭州,中国) Tongyi Lab, Alibaba Group, Hangzhou, China(通义实验室,阿里巴巴集团,杭州,中国)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 JURY-RL提出一种无标签RLVR框架,通过模型回放提议候选答案,形式验证器判定是否可获正奖,从而稳定训练并提升数学推理性能。

Comments Preprint. 32 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12373 2026-04-28 cs.CL 70%

Masked by Consensus: Disentangling Privileged Knowledge in LLM Correctness

被共识掩盖:在LLM正确性中解构特权知识

Tomer Ashuach, Shai Gretz, Yoav Katz, Yonatan Belinkov, Liat Ein-Dor

机构 * Technion – Israel Institute of Technology(技术学院–以色列理工学院) IBM Research(IBM研究院) Kempner Institute, Harvard University(哈弗大学凯普纳研究所)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL

AI总结 研究探讨大语言模型是否具备类似人类的内部状态评估正确性知识,通过自代表和外部模型对比发现,在分歧子集上,自代表在事实任务中表现更优,但数学推理中无优势。

Comments Accepted to ACL 2026 (Main Conference). 8 pages, 16 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04695 2026-04-28 cs.LG 70%

TRINITY: An Evolved LLM Coordinator

TRINITY:一个进化的人工智能语言模型协调器

Jinglue Xu, Qi Sun, Peter Schwendeman, Stefan Nielsen, Edoardo Cetin, Yujin Tang

机构 * Sakana AI University of Michigan(密歇根大学) Institute of Science Tokyo(东京科学研究所)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.LG

AI总结 TRINITY通过轻量级协调器高效分配角色,提升多轮查询处理能力,在多个任务中超越单一模型和现有方法,实现卓越性能。

Comments To appear at the 14th International Conference on Learning Representation (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19087 2026-04-22 cs.AI 70%

OLLM: Options-based Large Language Models

OLLM:基于选项的大型语言模型

Shashank Sharma, Janina Hoffmann, Vinay Namboodiri

机构 * Department of Computer Science(计算机科学系) University of Bath(巴斯大学) Department of Psychology(心理学系)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI

AI总结 OLLM通过引入学习选项提升语言模型的生成可控性与鲁棒性,利用低维选项空间实现更高效的奖励优化,减少常见对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16917 2026-04-21 cs.CL 70%

x1: Learning to Think Adaptively Across Languages and Cultures

x1: 在多种语言和文化中学习适应性思考

Yangfan Ye, Xiaocheng Feng, Xiachong Feng, Yichong Huang, Zekun Yuan, Lei Huang, Weitao Ma, Qichen Hong, Yunfei Lu, Dandan Tu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) The University of Hong Kong(香港大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL

AI总结 x1通过在实例层面选择有利语言进行推理,提升多语言数学推理和文化相关任务的性能,挑战了单纯扩大模型规模的假设。

Comments Findings of ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13371 2026-04-16 cs.CL 70%

Empirical Evidence of Complexity-Induced Limits in Large Language Models on Finite Discrete State-Space Problems with Explicit Validity Constraints

大语言模型在有限离散状态空间问题中复杂性诱导限制的实证证据

Md. Fahad Ullah Utsho, Mohd. Ruhul Ameen, Akif Islam, Md. Golam Rashed, Dipankar Das

机构 * Department of Information and Communication Engineering, University of Rajshahi, Bangladesh(拉贾沙希大学信息与通信工程系,孟加拉国) College of Engineering and Computer Sciences, Marshall University, Huntington, WV, USA(马歇尔大学工程与计算机科学学院,美国,亨廷顿,西弗吉尼亚) Department of Computer Science and Engineering, University of Rajshahi, Bangladesh(拉贾沙希大学计算机科学与工程系,孟加拉国)

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 本文通过构建九个经典推理任务,系统评估大推理模型在逐渐增加的复杂性下的鲁棒性,发现模型在低复杂度时表现良好,但超过特定阈值后显著退化,提出推理崩溃现象。

Comments 45 pages, 36 figures, 7 tables, Journal Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06298 2026-04-09 cs.LG 70%

Limits of Difficulty Scaling: Hard Samples Yield Diminishing Returns in GRPO-Tuned SLMs

难度扩展的极限:在GRPO调优的SLMs中困难样本产生递减回报

Suraj Yadav, Siddharth Yadav, Parth Goyal

机构 * IIIT Delhi(德里印度理工学院)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.LG

AI总结 本文研究了在资源受限条件下,GRPO与LoRA应用于SLMs进行数学推理时,难度增加对准确率的影响,发现高难度样本的提升效果递减。

Comments Accepted at ICLR Workshop 2026 ICBINB

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04131 2026-04-07 cs.AI 70%

Profile-Then-Reason: Bounded Semantic Complexity for Tool-Augmented Language Agents

Profile-Then-Reason: 用于工具增强语言代理的有界语义复杂度

Paulo Akira F. Enabe

机构 * Escola Politénica University of São Paulo(圣保罗大学理工学院)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出Profile-Then-Reason框架,通过预设工作流和验证机制减少语言模型调用次数,提升工具增强推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28052 2026-03-31 cs.AI 70%

Meta-Harness: End-to-End Optimization of Model Harnesses

Meta-Harness:端到端优化模型Harness

Yoonho Lee, Roshen Nair, Qizheng Zhang, Kangwook Lee, Omar Khattab, Chelsea Finn

机构 * Stanford(斯坦福大学) KRAFTON MIT(麻省理工学院)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI

AI总结 本文提出Meta-Harness,通过自动搜索优化模型Harness代码,提升文本分类、数学推理和编程任务性能,减少上下文token使用量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22206 2026-03-24 cs.LG 70%

Chimera: Latency- and Performance-Aware Multi-agent Serving for Heterogeneous LLMs

Chimera:面向异构大语言模型的延迟与性能感知多智能体服务

Kangqi Ni, Wenyue Hua, Xiaoxiang Shi, Jiang Guo, Shiyu Chang, Tianlong Chen

机构 * University of North Carolina, Chapel Hill(北卡罗来纳大学教堂山分校) Microsoft(微软) Carnegie Mellon University(卡内基梅隆大学) Amazon(亚马逊) University of California, Santa Barbara(加州大学圣芭芭拉分校)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.LG

AI总结 Chimera通过语义路由和预测调度优化多智能体工作流服务,提升端到端延迟与任务性能,减少1.2-2.4倍延迟并提高8.0-9.5个百分点性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21475 2026-03-24 cs.AI 70%

Unified-MAS: Universally Generating Domain-Specific Nodes for Empowering Automatic Multi-Agent Systems

统一-MAS:通用领域节点生成以增强自动多智能体系统

Hehai Lin, Yu Yan, Zixuan Wang, Bo Xu, Sudong Wang, Weiquan Huang, Ruochen Zhao, Minzhi Li, Chengwei Qin

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) Institute for Infocomm Research (I 2 R), A*STAR(信息通信研究院(I2R),A*STAR)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出统一-MAS,通过离线节点合成解耦细粒度节点实现与拓扑编排,提升多智能体系统在知识密集型领域的性能与成本效益。

Comments Code is available at https://github.com/linhh29/Unified-MAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02833 2026-03-24 cs.LG 70%

TIC-GRPO: Provable and Efficient Optimization for Reinforcement Learning from Human Feedback

TIC-GRPO:基于人类反馈的强化学习优化的可证明和高效方法

Lei Pang, Jun Luo, Ruinan Jin

机构 * Peking University, Beijing, China(北京大学) The Ohio State University, Columbus, USA(俄亥俄州立大学) Shugu Yuntai Technology Co., Ltd.(舒guard云泰科技有限公司)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.LG

AI总结 本文提出TIC-GRPO算法,通过改进重要性采样方法,提升GRPO在人类反馈强化学习中的性能与收敛速度。

Comments 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08916 2026-03-23 cs.CL 70%

HalluClean: A Unified Framework to Combat Hallucinations in LLMs

HalluClean:一种用于对抗大语言模型幻觉的统一框架

Yaxin Zhao, Yu Zhang

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 HalluClean通过规划、执行和修订三阶段推理增强方法,有效检测并修正LLM生成文本中的幻觉,提升事实一致性并优于基线方法。

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(42), 36092-36100 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10357 2026-03-12 cs.NI cs.AI 70%

Utility Function is All You Need: LLM-based Congestion Control

效用函数就是一切:基于LLM的拥塞控制

Neta Rozen-Schiff, Liron Schiff, Stefan Schmid

专题命中 数学推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出GenCC框架,利用LLM生成代码能力设计拥塞控制效用函数,实验表明其在不同场景下可提升拥塞控制协议性能37%-142%。

详情

展开后加载摘要…

URL PDF HTML 收藏