arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-25 至 2026-08-25 共收录 26 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 26 篇

2602.09555 2026-08-25 cs.CL 版本更新 89%

Adaptive Test-Time Compute Allocation for Block Diffusion Language Models in Complex Reasoning

推进块扩散语言模型用于测试时间扩展

Yi Lu, Deyang Kong, Jianing Wang, Linsen Guo, Xue Wang, Qi Guo, Tao Gui, Xuanjing Huang, Wei Ye, Shikun Zhang, Wei Wang

机构 * Fudan University(复旦大学) Peking University(北京大学)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出BACD和TCCF方法,提升块扩散语言模型在测试时间扩展中的推理效率和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01993 2026-08-25 cs.CL cs.AI 版本更新 88%

SAFE: An LLM-as-Verifier Framework for Evidence-Grounded Multi-Hop Reasoning

SAFE: 一种基于LLM作为验证器的证据驱动多跳推理框架

Daeyong Kwon, Soyoung Yoon, Seung-won Hwang

机构 * Seoul National University(首尔国立大学)

专题命中 测试时计算 :reasoning(title,abstract);verifier(title,abstract);分类 cs.CL、cs.AI

AI总结 提出SAFE框架,通过将推理分解为知识图谱三元组,在生成过程中逐步验证中间步骤,以解决多跳问答中模型通过无效推理得到正确答案的问题,平均准确率提升8.8个百分点。

Comments Accepted to EMNLP 2026 (Main Conference). Project Page: this https URL (https://github.com/DaeyongKwon98/SAFE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23092 2026-08-25 cs.SD 新提交 87%

Reasoning-Oriented Post-Training and Inference-Time LoRA Rescaling for Audio-Dependent Question Answering

面向推理的后训练与推理时LoRA重缩放:针对音频相关问答任务

Weiteng Hu, Yin Cao, Jun Yang

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 该研究针对音频相关问答任务,提出面向推理的LoRA后训练与推理时重缩放方法,在Qwen和MOSS-Audio模型上验证了有效性,提交系统在挑战赛中获总体第三、轻量级系统第二。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22140 2026-08-25 cs.CL cs.AI cs.LG 新提交 85%

Lexical Perturbations Disrupt LLM Reasoning: An Empirical Study of Attention Diversion

词汇扰动破坏大语言模型推理:注意力转移的实证研究

Jiaqian Zhu, Yang Zhang, Junhua Ding, Xiaowei Yu

机构 * Missouri University of Science and Technology(密苏里科技大学) University of North Texas(北得克萨斯大学)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究通过实证分析发现词汇扰动会破坏LLM的推理能力,揭示了注意力转移机制及词元内容与注意力分配的耦合关系,解释了现有推理策略难以修复性能的原因。

Comments Accepted to EMNLP 2026 (Main Conference). 9 pages main text, 12 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21867 2026-08-25 cs.AI cs.CL 新提交 81%

MemGuard: Persisting Verifier Signals for LLM-Agent Memory Governance

MemGuard:为大语言模型智能体记忆治理保留验证器信号

Haoyu Wang, Guangyuan Dong, He Liang, Zijing Zhang, Jiachen Luo, Chuang Liu, Chao Xue, Hao Tang

机构 * Nankai University(南开大学) National University of Singapore(新加坡国立大学) Shanghai Institute of Optics and Fine Mechanics, Chinese Academy of Sciences(中国科学院上海光学精密机械研究所) Peking University(北京大学) Technical University of Munich(慕尼黑工业大学) Queen Mary University of London(伦敦大学玛丽女王学院) Wuhan University(武汉大学) University of New South Wales(新南威尔士大学)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.CL、cs.AI

AI总结 针对LLM智能体记忆的不可靠准入与漂移问题,提出MemGuard方法,通过保留验证器的生命周期元数据提升多任务基准的成功指标与效率,效果优于现有基线。

Comments 30 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10630 2026-08-25 cs.LG cs.AI 版本更新 81%

Time Series Forecasting via Reasoning: A Slow-Thinking Approach with Reinforcement Fine-Tuned LLMs

时间序列预测作为推理:一种基于强化LLM的慢思考方法

Yitong Zhou, Yucong Luo, Mingyue Cheng, Qi Liu, Jiahao Wang, Daoyu Wang, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出Time-R1框架,通过两阶段强化微调(监督微调+强化学习)训练LLM进行多步推理,以提升时间序列预测的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00726 2026-08-25 cs.AI 版本更新 79%

Latent Reward Steering: An Adaptive Inference-Time Framework that Implicitly Promotes Cognitive Behaviors in Reasoning LLMs

潜在奖励引导:一种自适应推理时框架,隐式促进推理大语言模型中的认知行为

Jiakang Li, Guanyu Zhu, Can Jin, Chenxi Huang, Dexu Yu, Ronghao Chen, Yang Zhou, Hongwu Peng, Xuanqi Lan, Dimitris N. Metaxas, Youhua Li

机构 * Rutgers University(罗格斯大学) South China Agricultural University(华南农业大学) Columbia University(哥伦比亚大学) Fenz.AI QuantaAlpha Adobe Santa Clara University(圣克拉拉大学) City University of Hong Kong(香港城市大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 提出潜在奖励引导(LRS)框架,通过优化稀疏自编码器潜在状态隐式促进认知行为,利用最终答案正确性训练潜在奖励模型估计中间状态质量,并在推理时提供状态特定的修正方向,实验表明该方法能提升推理性能并修复原始推理错误。

Comments Accepted at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22885 2026-08-25 cs.CV 新提交 78%

DRAgent: Discriminative Reasoning Agent for Referring Expression Segmentation

DRAgent:用于指代表达分割的判别推理智能体

Yujie Qi, Luyan Zhang

机构 * School of Computer Science and Technology, Hangzhou Dianzi University(杭州电子科技大学计算机科学与技术学院) Khoury College of Computer Sciences, Northeastern University(东北大学Khoury计算机科学学院)

专题命中 测试时计算 :reasoning(title,abstract)

AI总结 本文针对指代表达分割中MLLM单次坐标预测导致的定位偏差问题,提出DRAgent判别推理框架,通过两阶段目标选择与LoRA微调提升性能,在多个基准数据集上表现具竞争力。

Comments 5 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25098 2026-08-25 cs.AI cs.CL cs.LG 版本更新 75%

Revisiting the Effectiveness of LLM Pruning for Test-Time Scaling

重新审视LLM剪枝对测试时缩放的有效性

Ocean Monjur, Shahriar Kabir Nahin, Anshuman Chhabra

机构 * Bellini College of AI, Cybersecurity, and Computing(人工智能、网络安全与计算学院)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究非结构化剪枝对推理型大语言模型测试时缩放性能的影响,发现其优于结构化剪枝甚至有时超过未剪枝模型,并探讨了层间稀疏分配策略的作用。

Comments Accepted to EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18663 2026-08-25 cs.AI cs.CL cs.LG 版本更新 75%

GIM: Evaluating models via tasks that integrate multiple cognitive domains

GIM:通过整合多个认知领域的任务评估模型

Rohit Patel, Alexandre Rezende, Steven McClain

机构 * Meta Superintelligence Labs(Meta超智能实验室)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出GIM基准测试,通过整合多个认知领域的任务来评估模型,其核心方法是设计820个原创问题,结合广泛的知识和多种认知操作,从而保持推理在现实任务中的基础性,同时通过2PL IRT模型校准能力估计,发布涵盖22个模型和47种测试配置的综合排行榜,并深入研究了测试时计算与模型能力之间的权衡。

Comments 61 pages, 27 figures, 4 tables. Code: this https URL (https://github.com/facebookresearch/gim); Dataset: this https URL (https://huggingface.co/datasets/facebook/gim)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02657 2026-08-25 cs.CR cs.AI 版本更新 70%

Your Agentic LLMs Secretly Encode Indirect Prompt-Injection Exposure in Hidden States

你的智能体大模型会秘密编码间接提示注入暴露的潜在信号

Jianshuo Dong, Yiming Liu, Maosen Zhang, Nan Deng, Peng Xu, Xiaoping Zhang, Tianwei Zhang, Jie Zhang, Han Qiu

专题命中 测试时计算 :reasoning(abstract);CoT(abstract_cn);分类 cs.AI

AI总结 本文研究智能体大模型的间接提示注入暴露问题,通过探测、防御、解释三方面分析,提出AGRI防御方法,可大幅降低攻击成功率且保持任务效用

Comments v2. Compared to v1, we include the Kimi-K3 model's results and conduct a series of new experiments on understanding probe generalization

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23552 2026-08-25 cs.AI cs.CL cs.SE 新提交 62%

Prime Agent: A Self-Improving RLM Harness

Prime Agent:一种自改进的RLM管控框架

Seth Karten, Alex L. Zhang, Kevin Thomas, Sebastian Müller, Elie Bakouch, Daniel Auras, Mika Senghaas, Fares Obeid, Konstantin Dunas, Johannes Hagemann, Sami Jaghouar

机构 * Princeton University(普林斯顿大学) MIT(麻省理工学院) Prime Intellect

专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL、cs.AI

AI总结 Prime Agent是一款开源RLM管控框架,通过标准化流程提升模型长周期能力,在ARC-AGI-3等任务中大幅提升性能,支持编码等工作流与并行化任务。

Comments 16 pages, 10 figures. Technical report. Code: this https URL (https://github.com/PrimeIntellect-ai/prime-agent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21792 2026-08-25 cs.AI cs.CV cs.IR cs.LG 新提交 62%

HIRA: A Human-in-the-Loop Retrieval-Augmented Cascade for Document Classification in Regulated Industries

HIRA:面向受监管行业文档分类的人在回路检索增强级联模型

Shangxuan Tian, Yanhui Chen, Carlos Queiroz

机构 * Standard Chartered Bank(渣打银行) OCBC(华侨银行)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 HIRA是面向受监管行业的无训练本地检索增强级联文档分类模型,结合多模态检索与本地LLM及人工审核,仅需少量人工修正即可大幅提升Macro-F1,减少LLM调用,性能接近全标注神谕模型。

Comments CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11829 2026-08-25 cs.LG cs.CL 版本更新 62%

Towards Understanding On-Policy Distillation through the Lens of Test-Time Scaling

从测试时缩放的视角理解在线策略蒸馏

Xinmu Ge, Zizhuo Zhang, Yu Huang, Jianing Zhu, Lin Yuan, Wanli Gu, Weichang Wu, Weiran Huang, Xiaolu Zhang, Bo Han, Jun Zhou, Jiangchao Yao

机构 * Hong Kong Baptist University(香港浸会大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Ant Group(蚂蚁集团)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 该研究从测试时缩放视角分析OPD,发现其主要提升采样效率而非扩展推理能力边界,属于“虚假蒸馏”。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12318 2026-08-25 cs.LG cs.AI 版本更新 62%

Chain of Operators: An Inference-Time Harness for In-Context Operator Learning

利用算子链实现上下文算子学习

Minghui Yang, Chenghan Wu, Ling Guo, Liu Yang

机构 * Department of Mathematics, Shanghai Normal University(上海师范大学数学系) Department of Mathematics, National University of Singapore(新加坡国立大学数学系)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出Chain of Operators (CHOP)框架,通过构造显式初等变换与冻结ICON的算子链,无需微调即可提升上下文算子网络在分布外算子任务上的泛化能力,在标量守恒律和平均场控制问题中降低推理误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24357 2026-08-25 cs.LG cs.AI 版本更新 62%

DPRM: A Plug-in Doob h transform-induced Token-Ordering Module for Discrete Diffusion Models

DPRM: 一种用于扩散语言模型的即插即用Doob h变换诱导的令牌排序模块

Dake Bu, Wei Huang, Andi Han, Si Wu, Hau-San Wong, Qingfu Zhang, Taiji Suzuki, Atsushi Nitanda

机构 * City University of Hong Kong(香港城市大学) The Institute of Statistical Mathematics(统计数学研究所) University of Sydney(悉尼大学) Nanyang Technological University(南洋理工大学) The University of Tokyo(东京大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出DPRM模块,通过在线估计从置信度驱动排序逐步过渡到过程奖励引导排序,改进扩散语言模型的令牌排序策略,在九种任务中提升性能。

Comments Extended Version of ICML 2026 Fogen (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18904 2026-08-25 cs.SD cs.AI cs.CL eess.AS 交叉投稿 62%

MetaSICL: Globalizing Auditory LLMs for Underserved Speakers and Languages via Meta Speech In-Context Learning

MetaSICL: 通过元语音上下文学习适应听觉大语言模型

Haolong Zheng, Siyin Wang, Zengrui Jin, Mark Hasegawa-Johnson

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出MetaSICL方法,利用高资源语音数据通过元学习增强听觉大语言模型的上下文学习能力,在低资源场景下优于直接微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22196 2026-08-25 eess.AS cs.CL 新提交 57%

Mitigating Speaker Leakage in Cascaded Multi-talker ASR with Diarization-based Transcript Correction

基于说话人 diarization 的转录校正缓解级联多说话人自动语音识别中的说话人泄漏

Hermann Yepdjio Nkouanga, Minwei Luo, Maggie Wigness, Suresh Singh

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 该研究针对级联多说话人自动语音识别中的说话人泄漏问题,提出基于剪枝的校正范式,利用预训练说话人 diarization 模型剪枝转录片段,在多语料库上实现 cpW ER 最高相对降低 29%,提升了转录可靠性。

Comments Accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23541 2026-08-25 cs.MA cs.AI 新提交 57%

The Interaction Tax: When Communication Erases Diversity in Multi-Agent Teams

交互税:当多智能体团队中的沟通消除多样性时

Summer Eunhyung Ann, Haokun Liu, Chenhao Tan

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 该研究提出“交互税”概念,发现多智能体LLM的完整方案交互会消除多样性,独立提议生成可避免收敛崩溃,交互仅在共享恰当信息时才有益。

Comments 14 pages, 3 figures. Accepted at ICML 2026 (PMLR 306)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23375 2026-08-25 cs.CR cs.AI 新提交 57%

Adversarial Entropy Inflation Against Gumbel-Based Inference Verification

针对基于Gumbel推理验证的对抗性熵膨胀

Nikita Kezins

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 该研究针对基于Gumbel的LLM推理验证防御,发现控制提示分布的攻击者可扩大容许token集合,使隐蔽信道泄露能力提升,建议动态校准抖动宽恕阈值。

Comments 4 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22533 2026-08-25 cs.AI 新提交 57%

CONTRAMEM: Learning Self-Evolving Procedural Memory from Contrasting Multi-Model Trajectories

CONTRAMEM:通过对比多模型轨迹学习自演进的过程记忆

Zheyuan Deng, Binghang Lu, Hanqi Feng, Shirley Huang, Dianzhuo Wang, Yuanda Xu, Zhiwei Zhang, Yige Sun, Changhong Mou, Runyu Zhang, Yuexing Hao, Barnabas Poczos, Xiaomin Li

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 CONTRAMEM是无需训练的自演进过程记忆框架,通过对比多模型轨迹提炼功能卡与技能卡,在GAIA2/ARE等任务上大幅提升计算机使用智能体成功率,且具备跨模型迁移性。

Comments 35 pages, 7 figures; includes technical appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14825 2026-08-25 cs.MA cs.AI 版本更新 57%

Emergent Misaligned Communication in Long-Horizon Multi-Agent LLM Commerce

长视野多智能体大语言模型商业环境中涌现的对齐失效通信

Zeyuan Li, Lukas Petersson, Alessandro Acquisti, Michiel A. Bakker

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 该研究在Vending-Bench Arena环境中发现,竞争多智能体LLM交易场景会涌现与操作稀缺性、对手行为相关的可测量对齐失效通信,且该现象不受模型能力排名直接影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22468 2026-08-25 math.CO 新提交 56%

An Explicit 82-Queen Covering of the 163 x 163 Board and Its Asymptotic Implication

163×163棋盘的显式82个皇后覆盖及其渐近意义

Yixiang Kong

专题命中 测试时计算 :verifier(abstract,comments)

AI总结 该研究构造了163×163棋盘的显式82个皇后A型1-覆盖,确定γ(Q₁₆₃)=82,并利用其得到更优的皇后图覆盖数渐近系数,还提供了坐标与Python验证器。

Comments 6 pages; includes complete coordinates, a standard-library Python verifier, and a machine-readable certificate. AI-assisted programming and manuscript preparation are disclosed in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22868 2026-08-25 cs.CR 新提交 50%

AgentFlow: A Flow-Centric Policy Language and Framework for Securing LLM Agent Systems

AgentFlow:一种以流为中心的策略语言与框架,用于保障大语言模型智能体系统的安全

Basavesh Ammanaghatta Shivakumar, Swarn Priya, Peng Gao

专题命中 测试时计算 :verifier(abstract)

AI总结 本文提出以流为中心的AgentFlow策略语言与框架,通过运行时监控与SMT验证保障LLM智能体系统安全,在多基准测试中显著降低入侵率并提升效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21884 2026-08-25 cs.SE 新提交 50%

Loop Engineering: Building Blocks, Adoption, and Impact

循环工程:构建模块、采用情况及影响

Jai Lal Lulla, Vahram Nersesyan, Seyedmoein Mohsenimofidi, Christoph Treude, Sebastian Baltes

专题命中 测试时计算 :verifier(abstract)

AI总结 本文对新兴循环工程领域开展探索性研究,分析其构建模块、开源项目采用情况,挖掘36710个仓库发现217个存在自主智能体循环,并规划了智能体自主层级的对照研究。

Comments 10 pages, 2 tables, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28147 2026-08-25 cs.CR 版本更新 50%

Agent Harness Distillation: Inference-Time Harness Extraction and Exploitation in Autonomous Multi-Agent Systems

智能体调控蒸馏:自主多智能体系统中的推理时调控提取与利用

Yu Cui, Wuli Yang, Yirui Shi, Junhao Xia, Hui Jiang, Lei Gao, Chenfu Bao

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文提出AHD框架,将AMAS推理时调控提取形式化为新安全问题,实验证实其可提取调控致IP泄露,还提出对应欺骗防御,揭示AMAS新安全威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏