arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-09-01 至 2026-09-01 共收录 32 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 32 篇

2608.28600 2026-09-01 cs.AI 新提交 94%

SHAPE of Chain-of-Thought in Math Reasoning

数学推理中思维链的SHAPE

Jonghyun Song, Sangjun Song, Minjae Oh, Haesung Pyun, Sungsik Lee, Yohan Jo

专题命中 数学推理 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(title,abstract);math reasoning(title,abstract)

AI总结 本研究提出用于分析LLM思维链轨迹的\texttt{SHAPE}框架,发现数学启发式比传统CoT特征更能解释答案正确性,基于此的后训练可提升LLM数学推理准确率。

Comments accepted to The 3rd AI for Math Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01695 2026-09-01 cs.AI cs.LG 版本更新 86%

Beyond Dense States: Sparse Transcoders as Causally Testable Operators for LLM Latent Reasoning

超越密集状态:将稀疏转码器提升为活跃运算符以进行潜在推理

Yadong Wang, Haodong Chen, Yu Tian, Chuanxing Geng, Dong Liang, Xiang Chen

机构 * College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院) MIIT Key Laboratory of Pattern Analysis and Machine Intelligence(信息产业部模式分析与机器智能重点实验室) Institute for AI, Tsinghua University, Beijing, China(清华大学人工智能研究院)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract_cn);分类 cs.AI、cs.LG

AI总结 LSTR通过将稀疏转码器提升为活跃运算符,实现更可控和可解释的潜在推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29956 2026-09-01 cs.CL 新提交 85%

Detecting Hidden Chain-of-Thought in Large Language Models with Linguistic, Behavioral, and Mechanistic Indicators

基于语言、行为和机制指标检测大语言模型中的隐藏思维链

Armaan Singh, Ryan Trinh Le, Jasmine Kaur, Abdullah Sultan, Edward Lue Chee Lip, Kiran Nijjer, Adnan Ahmed, Vasu Sharma

机构 * Stanford University(斯坦福大学) York University(约克大学) Facebook(脸书)

专题命中 数学推理 :chain-of-thought(title);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL

AI总结 本研究提出HCDS指标,通过语言、行为和机制信号检测大语言模型的隐藏思维链,在GSM8K上验证了Qwen3-4B变体存在类潜在推理行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22629 2026-09-01 cs.AI cs.CL 版本更新 84%

Masked Distillation: Internalizing the Chain-of-Thought in Language Models

掩码蒸馏:将思维链内化到语言模型中

Durgesh Kalwar, Vardhan Palod, Subbarao Kambhampati

机构 * SCAI, Arizona State University(亚利桑那州立大学计算与增强智能学院)

专题命中 数学推理 :chain-of-thought(title);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 研究能否将大型推理模型中间步骤计算内化到语言模型参数中,提出掩码蒸馏框架,在自我蒸馏和双模型设置中实例化,并改变中间令牌支架长度,通过实验在GSM8K和Countdown推理领域进行评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28791 2026-09-01 cs.CL cs.AI 版本更新 84%

Skill-Conditioned Gated Self-Distillation for LLM Reasoning

技能条件门控自蒸馏用于大语言模型推理

Jiazhen Huang, Xiao Chen, Xiao Luo, Yong Dai, Senkang Hu, Yuzhi Zhao

机构 * Tsinghua University(清华大学) Fudan University(复旦大学) City University of Hong Kong(香港城市大学) Huazhong University of Science and Technology(华中科技大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 数学推理 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 提出技能条件门控自蒸馏(SGSD),通过从经验技能库中检索技能-错误对构建多教师池,并利用验证器验证教师极性,以鲁棒门控目标蒸馏信息性师生差异,在弱先验信息假设下提升数学推理性能。

Comments Accepted by EMNLP 2026 Findings. Code is available at this https URL (https://github.com/walawalagoose/SGSD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23213 2026-09-01 cs.CL cs.AI 版本更新 84%

Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process

评分、推理与选择最佳!通过同行评审过程进行大型语言模型的集成

Zhijun Chen, Zeyu Ji, Qianren Mao, Hao Wu, Jinhuan Song, Junhang Cheng, Bangjie Qin, Zhuoran Li, Jingzheng Li, Kai Sun, Zizhe Wang, Yikun Ban, Zhu Sun, Xiangyang Ji, Hailong Sun, Xiao Huang

机构 * Beihang University, Beijing, China(北京航空航天大学) Zhongguancun Laboratory, Beijing, China(中关村实验室) Beijing University of Posts and Telecommunications(北京邮电大学) Hong Kong University of Science and Technology(香港科学与技术大学) Xi'an Jiaotong University, Xi'an, China(西安交通大学) Tsinghua University, Beijing, China(清华大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LLM-PeerReview方法,通过同行评审机制集成多个大型语言模型,提升响应质量。实验显示其在多个数据集上优于Smoothie-Global,适用于事实性问答、数学推理等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20624 2026-09-01 cs.AI cs.CL cs.LG stat.ML 版本更新 82%

In LLM Reasoning, there is Irrationality on top of Value Misalignment

在LLM推理中,价值对齐之上存在非理性

Kejiang Qian, Fengxiang He

机构 * University of Edinburgh(爱丁堡大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出理性价值风险概念,形式化LLM在推理中即使价值对齐也可能无法最大化对齐价值的问题,并通过实验验证该风险普遍存在且无法被对齐消除。

Comments Published in the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP) as a Main Conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30462 2026-09-01 cs.CL cs.AI 新提交 81%

Enhancing Low-Resource Language Reasoning via High-Resource Language Feature Transfer

通过高资源语言特征迁移提升低资源语言推理能力

Minju Song, Hyeon Hwang, Junhyun Lee, Jaewoo Kang

机构 * Korea University(高丽大学) Hankuk University of Foreign Studies(韩国外国语大学) Noah’s Farm(诺亚农场) AIGEN Sciences(AIGEN科学公司)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究提出跨语言特征迁移机制框架,通过分离高资源语言的任务推理特征注入低资源语言,以提升低资源语言的推理能力,将部分跨语言推理差距归因于机制引出失败。

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23181 2026-09-01 cs.AI cs.CL 版本更新 81%

DART: Draft-Agreement Routing for Training-Free Adaptive Thinking Budgets in Hybrid Reasoning Models

DART: 用于混合推理模型中免训练自适应思考预算的草案一致路由

Jungseob Lee, Seongtae Hong, Seungjun Lee, Jaehyung Seo, Junyoung Son, Sugyeong Eo, Chanjun Park, Hyeongju Park, Hyeonseok Moon, Heuiseok Lim

机构 * Korea University(高丽大学) dot(42dot) Konkuk University(建国大学) Yonsei University(延世大学) Soongsil University(崇实大学) Kumoh National Institute of Technology(金乌国立技术学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出免训练路由框架DART,通过采样两个廉价无思考草案,当草案一致时直接回答,不一致时根据草案熵预测思考预算,在保持或提升准确率的同时大幅减少思考令牌使用。

Comments 16 pages, 4 figures, 17 tables. Accepted to EMNLP 2026 (Findings). Code: this https URL (https://github.com/js-lee-AI/DART)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29971 2026-09-01 cs.LG 版本更新 79%

NeuReasoner: Theory-grounded Mapping of Reasoning Elicitation Boundaries

NeuReasoner: 理论驱动的推理激发边界映射

Aydin Javadov, Shyngys Aitkazinov, Tobias Hoesli, Florian von Wangenheim, Bjoern Schuller, Joseph Ollier

机构 * ETH Zürich(苏黎世联邦理工学院) Imperial College London(伦敦帝国理工学院) Technical University of Munich(慕尼黑技术大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 提出理论驱动的NeuReasoner框架,通过神经透镜与认知透镜结合,在无需外部工具下激发大模型推理能力,在数学、编码及认知任务上匹配或超越后训练思维模式,并发现风险决策等边界。

Comments Published at COLM 2026 Workshop on Agent Behavior

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07742 2026-09-01 cs.CV 版本更新 78%

BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning

BRUCE:面向科学视觉-语言推理的污染升级下鲁棒性基准测试

Saim Rehman, Muhammad Shafique

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校)

专题命中 数学推理 :reasoning(title,abstract)

AI总结 该研究提出BRUCE基准测试框架,通过RCI与T-RCI指标分析VLMs在科学视觉-语言推理任务中随污染升级的鲁棒性退化,实现可解释的失败分析。

Comments Submitted to IEEE Access for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03244 2026-09-01 cs.LG cs.AI cs.CL 版本更新 75%

ScalePRM: Training Process Reward Models by Scaling Verification Compute Without Ground Truth

SPARK:基于过程的奖励机制用于无参考强化学习

Salman Rahman, Sruthi Gorantla, Arpit Gupta, Swastik Roy, Nanyun Peng, Yang Liu

机构 * Amazon AGI(亚马逊人工智能实验室) UCLA(大学)

专题命中 数学推理 :reasoning(abstract);CoT(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 SPARK提出一种无参考强化学习框架,通过生成和验证模型提升过程奖励模型性能,在数学推理任务中取得优于真实参考的方法的成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30841 2026-09-01 cs.AI cs.CL 新提交 73%

HSRM: Hidden-State Reward Models for Test-Time Verification

HSRM:用于测试时验证的隐藏状态奖励模型

Xianzhi Li, Xiaodan Zhu

机构 * Ingenuity Labs Research Institute(Ingenuity Labs 研究院)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出轻量型隐藏状态奖励模型HSRM,复用生成器内部表征验证数学推理候选解,在四个基准中多数场景性能优于55M参数纯文本验证器,仅需约2M参数,实现高效验证。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19197 2026-09-01 cs.CL cs.AI 版本更新 73%

SPADE: Self-Play in Adaptive Synthetic Executable Environments

SPADE:自适应合成可执行环境中的自博弈

Bo Liu, Simon Yu, Yiding Jiang, Ao Qu, Andrew Zhao, Zichen Liu, Junsu Kim, Zijian Zhou, Seungone Kim, Tongzheng Ren, Mickel Liu, Hanfei Yu, Zhaorun Chen, Weiyan Shi, Paul Pu Liang, Luke Zettlemoyer, Yejin Choi, Natasha Jaques

机构 * University of Washington(华盛顿大学) Stanford University(斯坦福大学) Northeastern University(东北大学) Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院) National University of Singapore(新加坡国立大学) Seoul National University(首尔大学) Stevens Institute of Technology(史蒂文斯理工学院) University of Chicago(芝加哥大学)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 SPADE是一种双角色自博弈强化学习框架,让单个LLM同时担任环境设计者与推理智能体,在多类基准上显著提升了语言智能体的性能,推动了开放式自我改进。

Comments Work in progress. Project page: this https URL (https://spade-rl.github.io); Code: this https URL (https://github.com/spade-rl/spade)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29109 2026-09-01 cs.CL 新提交 70%

Recognition-Refusal Misalignment in LLMs: Why Models Answer Structurally Unanswerable Questions

大语言模型中的识别-拒绝错位:为何模型会回答结构上无法解答的问题

Yucheng Du, Xiyang Hu

机构 * University of Southern California(南加州大学) Arizona State University(亚利桑那州立大学)

专题命中 数学推理 :CoT(abstract,abstract_cn);分类 cs.CL

AI总结 该研究发现大语言模型会回答结构上无法解答的问题是因识别到不可行性的信号与安全拒绝通路未对齐,而非缺失识别能力。

Comments Accepted to EMNLP 2026 Main Conference. 29 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20372 2026-09-01 cs.CL 版本更新 70%

Notes to Self: Can LLMs Benefit from Experiential Abstractions?

给自己的笔记:大语言模型能从经验抽象中受益吗?

Chang Liu, Xinyu Li, Artur Dubrawski

机构 * Auton Lab, Carnegie Mellon University(卡内基梅隆大学自动实验室)

专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

AI总结 研究大语言模型能否从经验抽象中受益,通过从其在MATH训练集的痕迹提取抽象存入可检索库,探索推理时检索和强化学习两种使用模式,发现能提高模型在数学和逻辑推理基准上的性能,且框架可转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25201 2026-09-01 cs.CL cs.CY 版本更新 70%

SafeMath: Inference-time Safety improves Math Accuracy

SafeMath: 在推理过程中提升安全性以提高数学准确性

Sagnik Basu, Subhrajit Mitra, Aman Juneja, Somnath Banerjee, Rima Hazra, Animesh Mukherjee

机构 * Indian Institute of Technology Kharagpur(印度理工学院克勒格布尔分校) Cisco Systems(思科系统公司) National University of Singapore(新加坡国立大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL

AI总结 本文研究了有害数学问题对LLM的影响,提出SafeMath技术在保障安全的同时提升数学推理能力。

Comments Accepted in EMNLP Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21475 2026-09-01 cs.AI 版本更新 70%

Unified-MAS: Universally Generating Domain-Specific Nodes for Empowering Automatic Multi-Agent Systems

统一-MAS:通用领域节点生成以增强自动多智能体系统

Hehai Lin, Yu Yan, Zixuan Wang, Bo Xu, Sudong Wang, Weiquan Huang, Ruochen Zhao, Minzhi Li, Chengwei Qin

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) Institute for Infocomm Research (I 2 R), A*STAR(信息通信研究院(I2R),A*STAR)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出统一-MAS,通过离线节点合成解耦细粒度节点实现与拓扑编排,提升多智能体系统在知识密集型领域的性能与成本效益。

Comments Code is available at this https URL (https://github.com/linhh29/Unified-MAS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12165 2026-09-01 cs.CL 版本更新 70%

QAQ: Bidirectional Semantic Coherence for Selecting High-Quality Synthetic Code Instructions

QAQ:双向语义一致性用于选择高质量的合成代码指令

Jiayin Lei, Ming Ma, Yunxi Duan, Chenxi Li, Tianming Yang

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL

AI总结 本文提出QAQ框架,通过双向语义一致性评估合成数据质量,利用反向互信息量化答案对查询的信息增益,实验表明选择25%数据可达到全数据训练效果,提升数据筛选效率。

Comments 14 pages, 5 figures. EMNLP 2026 (Main track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24949 2026-09-01 cs.LG cs.AI cs.CL 版本更新 67%

Demystifying Reinforcement Learning Post-Training of Language Models

揭秘语言模型的强化学习后训练

Donovan Clay, Saket Gollapudi, Sankar Harilal, Min Jang, Jacob Morrison, Sewoong Oh, Natasha Jaques

机构 * University of Washington(华盛顿大学) Allen Institute for AI(艾伦人工智能研究所)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究拆解语言模型的RL后训练算法,探究各因素对其结果的影响,为NLP领域人员提供RL后训练的入门指南。

Comments Link to website: this https URL (https://minjang10.github.io/demystifying-rl-finetuning-web) Link to code: this https URL (https://github.com/sankarh-1/demystifying-rl-finetuning)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03447 2026-09-01 cs.LG cs.AI 版本更新 62%

Approximate Speculative Decoding

近似投机解码

Yuannuo Feng, Zegang Peng, Yuxin Xie, Yubing Ye, Yizhe Chen, Wenshuai Yao, Wenyong Zhou, Wang Kang

专题命中 数学推理 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出无需训练的Approximate Speculative Decoding(ASD),通过带预算的最长前缀选择优化投机解码,提升了生成吞吐量与验证器接受率,且无需新草稿模型或微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19313 2026-09-01 cs.LG cs.AI 版本更新 62%

Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information

脱离上下文的广义信赖域策略优化算法:利用特权信息学习解决难题

Priyank Agrawal, Ankur Samanta, Shervin Ghasemlou, Boris Vidolov, Jalaj Bhandari, Kavosh Asadi, Daniel Jiang, Aditya Modi

机构 * Meta AI Columbia University(哥伦比亚大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究利用特权信息解决强化学习难题,提出脱离上下文的广义信赖域策略优化算法(OC - GRPO),通过引导展开和重要性校正目标避免训练不匹配,在标准数学推理基准上比普通GRPO有显著提升且成本低。

Comments 24 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29089 2026-09-01 cs.LG cs.AI cs.CV 版本更新 62%

OISD: On-Policy Internal Self-Distillation of Language Models

OISD: 语言模型在策略内部自蒸馏

Xinyu Liu, Darryl Cherian Jacob, Yang Zhou, Jindong Wang, Pan He

机构 * Auburn University(阿肯色大学) William & Mary(威廉与玛丽学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出OISD框架,通过将最终层的预测信号蒸馏到中间层,结合logit对齐和注意力对齐,提升推理能力,在数学推理任务上显著优于基线。

Comments Findings of the Association for Computational Linguistics: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09076 2026-09-01 cs.MA cs.AI cs.LG 版本更新 62%

Robust Multi-Agent LLMs under Byzantine Faults

在拜占庭故障下鲁棒的多智能体大语言模型

Haejoon Lee, Vincent-Daniel Yun, Dimitra Panagou, Sai Praneeth Karimireddy

机构 * Department of Robotics, University of Michigan, Ann Arbor, USA(密歇根大学机器人系,安娜堡,美国) Thomas Lord Department of Computer Science, University of Southern California, USA(南加州大学计算机科学托马斯·劳德系,美国)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Self-Anchored Consensus算法,通过去中心化迭代过滤和优化协议提升多智能体系统在拜占庭故障下的鲁棒性,实验表明其在数学和常识推理任务中表现优异。

Comments EMNLP 2026 Main Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05863 2026-09-01 cs.LG cs.CL cs.RO 版本更新 62%

Constrained Group Relative Policy Optimization

带约束的群体相对策略优化

Roger Girgis, Rodrigue de Schaetzen, Luke Rowe, Azalée Robitaille, Christopher Pal, Liam Paull

机构 * Mila - Quebec AI Institute(魁北克AI研究所) CIFAR AI Chair(CIFAR人工智能主席)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出带约束的GRPO,通过拉格朗日松弛解决受约束策略优化问题,实验验证其在网格世界和机器人任务中的有效性。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06022 2026-09-01 cs.CL cs.AI 版本更新 62%

AdaFuse: Adaptive Ensemble Decoding with Test-Time Scaling for LLMs

AdaFuse: 用于大语言模型的自适应集成解码与测试时缩放

Chengming Cui, Tianxin Wei, Ziyi Chen, Ruizhong Qiu, Zhichen Zeng, Zhining Liu, Xuying Ning, Duo Zhou, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 AdaFuse通过自适应集成解码与测试时缩放,提升大语言模型在多种任务上的生成性能。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30922 2026-09-01 cs.AI 新提交 57%

CARVE: Verified Expansion for Variable-Length Generation in Diffusion Language Models

CARVE:扩散语言模型中变长生成的验证式扩展

Wail Bouhedja, Amr Mohamed, Guokan Shang

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) Sorbonne Université(索邦大学) Ecole Polytechnique(巴黎综合理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出无需重训的 CARVE 算法,解决扩散语言模型固定长度生成的缺陷,通过验证式扩展实现变长生成,在代码生成与数学推理基准中提升性能并降低推理成本。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30463 2026-09-01 cs.CL 新提交 57%

More Capable, Less Faithful: A Multilingual Analysis of Mathematical (Un)Solvability Detection in LLMs

能力更强,忠实度更低:大语言模型中数学(不)可解性检测的多语言分析

Maria-Eleni Zoumpoulidi, Nikolaos Xiros, Georgios Paraskevopoulos

机构 * Institute for Language and Speech Processing, Athena Research Center(语言与语音处理研究所,雅典娜研究中心)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 该研究构建了法语、希腊语版ReliableMath多语言基准,训练多语言探针分析LLMs的可解性检测能力,发现可解性信念具语言通用性,高资源语言的可解性检测忠实度更低。

Comments 10 pages, 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30192 2026-09-01 cs.AI cs.CE 新提交 57%

FaVOR: LLM-Based Agentic Framework for Factor Mining via Empirical Validation

FaVOR:基于大语言模型的智能体框架,用于通过实证验证挖掘因子

Hyeonjin Kim, Minseok Kim, Seunghyeon Jung, Sujin Pyo, Huisu Jang, Woojin Lee

机构 * Dongguk University-Seoul(东国大学首尔校区) Seoul National University(首尔大学) Soongsil University(崇实大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 FaVOR是围绕假设证据的LLM智能体框架,通过三阶段一致性循环挖掘因子,在中证500、标普500上优于基准,可生成可解释、鲁棒的经济信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29748 2026-09-01 cs.CL 新提交 57%

ReTrace: Rejected-Trajectory Conditioning for Speculative Decoding

ReTrace:用于投机解码的拒绝轨迹条件方法

Luxi Lin, Zhanpeng Zeng, Shuang Peng, Songwei Liu, Rongrong Ji

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出ReTrace方法,针对投机解码中被拒绝后缀的有效信息,通过跨轮条件保留优化拒绝后缀,无需额外计算即可提升Qwen3模型在多任务上的解码效率,且可与现有方法结合。

详情

展开后加载摘要…

URL PDF HTML 收藏