arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-28 至 2026-08-28 共收录 13 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 13 篇

2608.26126 2026-08-28 cs.CL cs.IT 新提交 84%

TelecomGPT-R1: A Unified Open-Source Reasoner for the Telecom Stack

TelecomGPT-R1:面向电信栈的统一开源推理器

Bohao Wang, Chenwei Wu, Haoyu Li, Hang Zou, Yu Tian, Lina Bariah, Li Wei, Chongwen Huang, Yongliang Shen, Zhaoyang Zhang, Merouane Debbah

专题命中 测试时计算 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);verifier(abstract)

AI总结 该研究发布开源电信推理器TelecomGPT-R1-9B,通过两阶段后训练方案优化,在公开电信基准中表现优于同类开源模型,性能接近闭源前沿推理器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27351 2026-08-28 cs.LG 新提交 83%

Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO

理解用于大语言模型推理的进化策略:比GRPO更广泛的推理覆盖范围

Yunpeng Ba, Zhi Zheng, Yue Xie, Jiaqing Li, Xialiang Tong, Tao Zhong, Mingxuan Yuan, Zhichao Lu, Xuyang Wu, Zhenkun Wang

机构 * Southern University of Science and Technology(南方科技大学) National University of Singapore(新加坡国立大学) Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海)) Huawei Noah’s Ark Lab(华为诺亚方舟实验室) City University of Hong Kong(香港城市大学)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.LG

AI总结 本文研究用于LLM推理的进化策略(ES),发现ES比GRPO有更广泛的推理覆盖范围,开发了结合两者优势的GRPO-ES策略,还揭示了ES的功能稀疏性等特性,确立其为独特的推理后训练范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26787 2026-08-28 cs.MM 新提交 82%

Self-Reflective Multi-modal Reasoning for Short-Video Fake News Detection

用于短视频假新闻检测的自反思多模态推理

Pinjie Xu, Yuzhou Yang, Zhikai Tan, Qichao Ying, Zaiyang Yu, Ce Li, Zhenxing Qian

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 针对短视频假新闻检测的挑战,提出SRM-FND框架,通过自反思多模态推理及相关机制,在FakeSV和FakeTT数据集上实现优于强基线的检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03605 2026-08-28 cs.CL 版本更新 79%

AEScorer: An Agentic Evidence-Grounded Framework for Graded Factuality Verification

DiVA: 基于代理-判别验证器的细粒度事实性验证

Hui Huang, Muyun Yang, Yuki Arase

机构 * Harbin Institute of Technology(哈尔滨工业大学) Institute of Science Tokyo(东京科学研究所)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.CL

AI总结 DiVA通过结合生成模型和判别模型的能力,提出了一种细粒度事实性验证方法,并构建了FGVeriBench基准,有效提升了事实性验证的精度和适用性。

Comments Accepted by Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26432 2026-08-28 cs.SD cs.AI cs.CL 新提交 62%

SpeechGym: An Audio-Native Gym for Training Voice Agents via Reinforcement Learning

SpeechGym:一种用于通过强化学习训练语音智能体的原生音频 Gym

Jiajun Fan, Jingyuan Li, Prashanth Gurunath Shivakumar, Jia-Hong Huang, Qi Luo, M. Maruf, Ivan Bulyko, Ge Liu, Roger Ren

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon AGI Foundations(亚马逊AGI基础研究部)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对语音智能体训练中梯度无法流动、难以强化学习的问题,提出原生音频环境 SpeechGym,用每轮过程奖励解决稀疏性问题,使开放权重模型在语音基准上任务成功率翻倍且排名提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26161 2026-08-28 cs.CL cs.AI 新提交 62%

Mutual Debiasing via Dual-Seed Comparison for Probabilistic Sampling in Large Language Models

基于双种子比较的互去偏方法用于大语言模型的概率采样

Zihao Guo, Hongtao Lv, Chaoli Zhang, Laiguo Yin, Lei Liu, Yonghui Xu, Lizhen Cui

机构 * School of Software, Shandong University(山东大学软件学院) School of Computer Science and Technology, Zhejiang Normal University(浙江师范大学计算机科学与技术学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对大语言模型概率采样的系统性偏差问题,提出双种子比较(DSC)协议,通过两个独立种子中和偏差,在多数评估设置中性能优于现有方法,还可适配多项选择问题生成等任务以提升分布控制能力。

Comments 28 pages, 4 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27455 2026-08-28 cs.CL 新提交 57%

CritICL: Inference-Time Weak-to-Strong Generalization from Small Language Model Failure Modes

CritICL:基于小语言模型失败模式的推理时弱到强泛化

Yufan Wu, Yinghui He, Zhengyi Hu, Lang Wei, Ruichen Li, Qifan Yang, Ting Zhu

机构 * The Ohio State University(俄亥俄州立大学) Princeton University(普林斯顿大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 CritICL是一种新型推理时框架,利用小语言模型的结构化失败模式,通过两种变体提升推理性能,效率优于标准上下文学习和测试时缩放方法。

Comments this https URL (https://github.com/umwyf/CRITICL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27141 2026-08-28 cs.CR cs.AI 新提交 57%

Safety Does Not Compose: Non-Decaying Loop State for Autonomous LLM Agents

安全性无法组合:自主大型语言模型智能体的非衰减循环状态

Chenhao Wu, Haoxuan Jia, Yang Liu, Yingguang Yang, Yuhan Lin, Chongyang Zhang, Hao Zheng, Yulin Huang, Jianshen Zhang, Yongzhi Qi, Shang Luo, Kefu Xu, Jifeng Zhu, Bin Chong

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 该研究发现自主LLM智能体的轨迹级安全保障存在组合性缺陷,提出非衰减循环安全状态的LoopHarness方案,可限制未授权不可逆操作数量,通过Agent-SafetyBench等评估验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26735 2026-08-28 cs.CL 新提交 57%

Preserving General Capabilities during Domain Specialization with Uncertainty-Calibrated MOPD

通过不确定性校准的MOPD在领域专业化过程中保留通用能力

Ziyuan Liu, Jiao Ou, Jian Liang, Ruiming Tang, Cheng Luo

机构 * Kuaishou Technology(快手科技)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 该研究针对大语言模型领域专业化时通用能力下降的问题,提出不确定性校准的MOPD方法,在角色扮演和医疗领域实验中提升通用能力且保持垂直领域性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26357 2026-08-28 cs.CL 新提交 57%

Cross-lingual Representation Learning via Centroid Intervention Fusion

基于质心干预融合的跨语言表示学习

Wei Sun, Marie-Francine Moens

机构 * KU Leuven(鲁汶大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文针对大语言模型跨语言性能不均的问题,提出CIF框架整合多语言干预投影,在四类基准测试中提升了跨语言性能,尤其优化了低资源语言表现。

Comments EMNLP 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26556 2026-08-28 cond-mat.dis-nn cond-mat.stat-mech cs.LG 新提交 57%

Dynamical phase selection controls compute scaling in looped transformers

动力学相位选择控制循环Transformer的计算缩放

Gunn Kim

专题命中 测试时计算 :test-time compute(abstract);分类 cs.LG

AI总结 该研究针对循环Transformer,发现架构与准确率相同的网络因初始化不同呈现不同动力学相位,分岔机制决定测试时计算缩放,fold与Neimark–Sacker相位的缩放规律存在差异,表明测试计算由训练解的动力学相位决定。

Comments 5 pages and 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08357 2026-08-28 cs.CL 版本更新 57%

Forward-Free Diffusion Language Models with BPTT-Free Looped Refinement

无前向过程的扩散语言模型

Haotian Sun, Rushi Qiang, Yuqian Zheng, Bo Dai

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 提出FReDA,一种无需人工设计前向过程的扩散语言模型,通过递归分布细化利用模型生成草稿作为隐式中间状态,在推理和编码任务上超越更大模型,并实现1.5-1.8倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21884 2026-08-28 cs.SE 版本更新 50%

Loop Engineering: Building Blocks, Adoption, and Impact

循环工程:构建模块、采用情况及影响

Jai Lal Lulla, Vahram Nersesyan, Seyedmoein Mohsenimofidi, Christoph Treude, Sebastian Baltes

专题命中 测试时计算 :verifier(abstract)

AI总结 本文对新兴循环工程领域开展探索性研究,分析其构建模块、开源项目采用情况,挖掘36710个仓库发现217个存在自主智能体循环,并规划了智能体自主层级的对照研究。

Comments 10 pages, 2 tables, under review

详情

展开后加载摘要…

URL PDF HTML 收藏