arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 273 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 273 篇

2608.00215 2026-08-04 cs.AI 新提交 57%

Personalizing Large Language Model Agents with Small Policy Models

用小型策略模型个性化大型语言模型智能体

Dian Jin, Zhi Zhang, Huichao Li, Yihe Pan, Rundong Huang, Doudou Zhou

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出轻量级策略层FABLE,通过在线学习用户执行策略实现LLM智能体个性化,在多类评估中改进偏好敏感行为且保持端到端任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00017 2026-08-04 cs.AI cs.CE 新提交 57%

Memory Reward Inflation in Self-Improving LLM Agents

自改进大语言模型智能体中的记忆奖励膨胀

Mohammad Asadolahi, Amir Amini, Samira Talebi, Amirfarhad Farhadi, Azadeh Zamanifar

机构 * University Of North Texas(北得克萨斯大学) Edge Hill University(边山大学) University of Cincinnati(辛辛那提大学) Iran University of Science and Technology(伊朗科技大学) Islamic Azad University(伊斯兰阿扎德大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 该研究发现自改进大语言模型智能体存在记忆奖励膨胀的“回声差距”问题,提出误差独立性假设(EIA),并通过LUCID算法在BIRD文本到SQL基准上提升了执行准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29032 2026-08-03 cs.MA cs.CL 新提交 57%

TransMem: Transforming Hidden States into Memory for Large Language Models

TransMem:将隐藏状态转换为大语言模型的记忆

Haodong Lei, Junming Liu, Yirong Chen, Pinlong Cai, Botian Shi, Ding Wang, Hongsong Wang

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 针对长上下文LLM智能体的历史信息未充分利用问题,提出轻量级记忆模块TransMem,结合证据条件自蒸馏,在多基准测试中显著提升性能。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28990 2026-08-03 cs.AI 新提交 57%

Scaling Scientific Discovery Environments for Turn-Level Agentic RL

面向回合级智能体强化学习的科学发现环境扩展

Yucheng Xu, Keyi Zhang, Yuyang Yu, Min Zhang, Shiyuan Meng, Pei Chu, Zhongying Tu

机构 * Shanghai AI Lab(上海人工智能实验室)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本文提出可扩展框架SciDisco,结合SciThèque与DiscoPO,训练出的SciDisco-14B在假设驱动的科学数据分析基准上实现了当前最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28890 2026-08-03 cs.HC cs.AI 新提交 57%

Agreement Is Not Quality: Blind Expert Verification of Human and LLM Qualitative Coding When Human Consensus Is Not Ground Truth

一致性并非质量:当人类共识并非真值时,对人类与大语言模型定性编码的盲专家验证

Alex Liu, Lief Esbenshade, Michael Xiao, Victor Tian, Zachary Zhang, Kevin He, Min Sun

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 该研究发现以人类共识为标准的一致性评估无法准确衡量LLM定性编码质量,盲专家验证显示部分LLM编码优于人类,提出了可迁移的验证协议与编码分工框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27733 2026-07-31 cs.AI 新提交 57%

VeriSkill: A Self-Evolution Framework for Program Verification Skills

VeriSkill:一种用于程序验证技能的自进化框架

Changguo Jia, Tianqi Zhao, Zhiyou Xiao, Weiming Zhang, Minghui Zhou

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本文提出专为程序验证设计的自进化框架VeriSkill,可将验证失败归因于技能缺陷并迭代优化技能,实验显示其在多种场景下均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27578 2026-07-31 cs.AI 新提交 57%

What makes prompts a graph: necessary and sufficient conditions for prompt graph engineering

提示词为何构成图:提示词图工程的充要条件

Sandeco Macedo

机构 * Federal Institute of Goiás(戈亚斯联邦学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本研究通过文献分析构建了将提示词视为图节点的定义,提出提示词图工程的四个条件及操作化测试,明确其边界并应用于六个系统,为相关实践提供可操作定义与共享术语。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27269 2026-07-31 cs.LG 新提交 57%

Beyond KV Reconstruction: Functional Reconstruction for MLA Draft Models in Speculative Decoding

超越KV重建:推测解码中MLA草稿模型的功能重建

Weiye Shi, Fanxu Meng, Muhan Zhang

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

AI总结 针对推测解码中MHA/GQA转MLA导致草稿令牌接受率降低的问题,提出功能重建方法优化转换后的MLA注意力模块,在多数任务中提升了草稿令牌接受率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26819 2026-07-30 cs.SE cs.AI 新提交 57%

A First Look at Coding Agents' Compliance with AI Contribution Rules in Open-Source Communities

初探编码智能体在开源社区中对AI贡献规则的合规性

Wenhao Yang, Runzhi He, Minghui Zhou

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本研究构建RepoComplianceBench基准测试编码智能体对开源社区AI贡献规则的合规性,发现当前智能体几乎不主动检索规则,仅在提示等辅助下实现披露与验证,但始终不执行AI禁令。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24300 2026-07-28 cs.CL cs.MA 新提交 57%

Self-Authored Verification Is Unreliable in Heuristic Self-Improving Agents

在启发式自我改进智能体中自我编写的验证不可靠

Diandian Guo, Cong Cao, Fangfang Yuan, Yingqi Wang, Yueshan Wang, Dakui Wang

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 研究启发式自我改进智能体中自我编写验证不可靠的问题,引入密封外部接受循环(SEAL)方法,通过实验发现该问题在启发式学习中常现,自我验证失败按能力分层,SEAL性能优于无保护基线。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23273 2026-07-28 cs.IR cs.AI cs.ET 新提交 57%

Statistically Supported LLM Ingredient and Recipe Data Collection in Computational Nutrition

计算营养中统计支持的大语言模型成分与食谱数据收集

James Izzard, Hassan Eshkiki, Fabio Caraffini

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 研究针对计算营养中成分数据问题,提出结合统计估计、不变性检查和网络获取的大语言模型管道。通过该管道可获取精确数据,在参考集上实现高匹配度并大幅降低误差,将大语言模型辅助数据库构建变为可控流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22602 2026-07-28 cs.AI 新提交 57%

DeepLook: Deeper Thinking with Lookahead

DeepLook:通过前瞻进行更深入思考

Tingxin Yang, Zefeng Wang, Mengyue Wang, Xingcheng Zhou, Yunpu Ma

机构 * Technical University of Munich(慕尼黑工业大学) LMU Munich(慕尼黑大学) MCML, LMU, MemAgents Lab(慕尼黑大学机器学习中心、记忆代理实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 研究旨在改进大语言模型推理,提出无需训练的DeepLook框架,通过将前瞻计算集中在不确定性瓶颈处,聚合令牌级置信度为段级信号并排序投票。在四个数学基准测试中,该方法改变准确率与令牌成本的帕累托前沿,提升准确率并减少令牌生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22556 2026-07-28 cs.AI 新提交 57%

MIITA: Memory-Induced Inference-Time Adaptation for Continual Learning with Small Language Models

MIITA:用于小语言模型持续学习的内存诱导推理时间自适应

Dong Li, Yanchi Liu, Xujiang Zhao, Wei Cheng, Zhengzhang Chen, Xintao Wu, Zhong Chen, Chen Zhao, Haifeng Chen

机构 * Baylor University(贝勒大学) NEC Laboratories America(美国 NEC 实验室) University of Arkansas(阿肯色大学) Southern Illinois University(南伊利诺伊大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 针对小语言模型持续学习中参数更新致灾难性遗忘及内存不足问题,提出MIITA框架,它通过存储校正方向原型并在推理时检索应用,结合理论分析,在多种设置实验中提升性能并减轻遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20852 2026-07-24 cs.AI 新提交 57%

Code Monitor Red Teaming for Public-Test-Passing Code

用于通过公开测试的代码的代码监控红队

Junchi Liao, Jiawen Deng, Fuji Ren

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 研究公开测试通过后代码隐藏错误监控问题,引入代码监控红队协议并实例化为代码监控基准。通过大量实验发现弱验证器虽能改进但仍易漏错,对抗性压力影响验证效果,GLM - 5.1验证器缩小部分差距,揭示了验证器故障与证据限制的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20527 2026-07-24 cs.AI 新提交 57%

Evaluating and Guarding Citation Faithfulness in Agentic Scientific Synthesis

评估和保障智能科学合成中的引用忠实性

Taewan Goo, Junsik Kim, Kyulhee Han, GwonYul Jo, Jong-Soo Kim, Tae-Hyung Kim

机构 * Seoul National University(首尔国立大学) BioNexus(生物 Nexus)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 研究智能语言模型系统引用答案检查的可靠性问题,提出黄金锚定评估协议和可部署防护措施,能验证验证者、测量重新归因,为无支撑引用设限,经多模型和管道验证后作为单GPU工具包发布。

Comments 20 pages, 5 figures. Includes supplementary material (Appendices S1-S6). Open single-GPU reproducibility kit included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20506 2026-07-24 cs.AI 新提交 57%

Optimizing Hypergraph-Based RAG: Toward Better Fact Extraction and Chunk Retrieval

优化基于超图的RAG:迈向更好的事实提取和块检索

Houda Khrouf, Pedro Fillastre, Sebastiao Correia

机构 * Qlik(思略特)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 研究旨在优化基于超图的RAG,以解决事实提取和块检索问题。方法是采用自一致性提示改进提取,运用个性化PageRank算法增强块检索,贡献在于提升了相关任务的性能。

Comments APIA 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20481 2026-07-24 cs.AI 新提交 57%

Routing Without Training: Controllable-Ratio LLM Offloading via Reliability Gating

无需训练的路由:通过可靠性门控实现可控比例的大语言模型卸载

Evan Chen, Shiqiang Wang, Kevin S Chan, Su Wang, Christopher Brinton

机构 * Purdue University(普渡大学) University of Exeter(埃克塞特大学) Army Research Laboratory(陆军研究实验室) Princeton University(普林斯顿大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 研究在资源受限下本地-云端协作部署大语言模型的问题,提出无需训练的CARGO路由框架,通过提示多样化采样等方法估计一致性并控制不确定性,在多任务和模型上表现出色,证明可从本地模型内在行为实现有效协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20439 2026-07-24 cs.CL 新提交 57%

AsymVerify at SemEval-2026 Task 6: Asymmetric Confidence-Gated Verification for Political Evasion Detection

SemEval-2026任务6中的AsymVerify:用于政治逃避检测的非对称置信门控验证

Sebastien Kawada

机构 * Kaons 𝑲 ∗

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 研究针对政治逃避检测难题,提出AsymVerify系统用于SemEval-2026任务6的三元分类。核心方法是对问答对分类后对低置信预测进行非对称验证,主要贡献是取得高排名,在不同数据集上提升宏F1分数,且降低推理成本。

Comments Accepted to SemEval-2026 Task 6 (CLARITY) at ACL 2026. Team AsymVerify placed 2nd of 41 teams on the official Subtask 1 leaderboard. Task: https://konstantinosftw.github.io/CLARITY-SemEval-2026/. Code: https://github.com/kaons-research/AsymVerify-ACL. Website: https://kaons.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19653 2026-07-23 cs.SE cs.AI 新提交 57%

PerfAgent: Profiler-Guided Iterative Refinement for Repository-Level Code Optimization

PerfAgent:用于仓库级代码优化的分析器引导迭代优化

Ryan Deng, Yuanzhe Liu, Bastian Lipka, Yao Ma, Xuhao Chen, Tim Kaler, Jatin Ganhotra

机构 * Massachusetts Institute of Technology(麻省理工学院) Rensselaer Polytechnic Institute(罗切斯特理工学院) IBM(IBM公司) Michigan State University(密歇根州立大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 研究针对仓库级代码优化难题,提出PerfAgent分析器引导迭代优化方法,该方法能让编码代理找到热点并改进,在两个优化基准测试中大幅提升专家匹配补丁率,且以低成本超越基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18310 2026-07-22 physics.soc-ph cs.AI 新提交 57%

Distribution-First Population Simulation: Collapse, Calibration, and Recall in Non-WEIRD LLM Persona Modeling

分布优先的总体模拟:非怪异大语言模型角色建模中的崩溃、校准和召回

Gurkan Ozkan

机构 * Istanbul Technical University(伊斯坦布尔技术大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 研究非怪异LLM角色建模中独立代理范式的问题,提出分布优先校正方法,通过言语化采样等进行实验,发现原范式有崩溃等问题,校正方法能测量内部不一致性及校准条件。

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17715 2026-07-21 cs.CL 新提交 57%

C$^2$KV: Compressed and Composable KV Cache Reuse for Efficient LLM Inference

C$^2$KV:用于高效大语言模型推理的压缩可组合键值缓存重用

Chuheng Du, Junyi Chen, Hanlin Tang, Kan Liu, Tao Lan, Lin Qu, Chaoyue Niu, Shengzhong Liu, Guihai Chen, Fan Wu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 研究针对长上下文LLM推理成本高问题,提出C$^2$KV框架,联合优化KV提取与推理拼接,学习可组合压缩的KV缓存流形,引入轻量级边车提取器及协同训练策略,显著降低缓存成本,实现推理加速并保持生成质量。

Comments 12 pages, 9 figures, accepted by ACM SIGKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16673 2026-07-21 cs.CL 新提交 57%

SpecLA: Efficient Speculative Decoding for Linear-Attention Models

SpecLA:线性注意力模型的高效推测解码

Zhibin Wang, Xuying Han, Zhaohua Yang, Fuliang Liu, Xue Li, Rong Gu, Sheng Zhong, Chen Tian

机构 * Alibaba Group(阿里巴巴集团)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 研究针对线性注意力模型自回归解码效率低的问题,提出SpecLA推测解码运行时,通过拓扑感知内核验证、存储紧凑因子及置信度修剪等方法,在NVIDIA H100上实现了比自回归解码高达1.70倍的端到端加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16431 2026-07-21 cs.CL 新提交 57%

RIMS: Preference Optimization via Smoothed Multi-pair Aggregation for Small-Scale LLM Retrieval-Augmented Generation

RIMS:通过平滑多对聚合进行偏好优化以实现小规模语言模型检索增强生成

Pei Tian, Zihan Dong, Tianci Liu, Linjun Zhang, Haoyu Wang

机构 * Columbia University(哥伦比亚大学) Rutgers University(罗格斯大学) Purdue University(普渡大学) SUNY Albany(纽约州立大学奥尔巴尼分校)

专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.CL

AI总结 研究针对小规模语言模型检索增强生成中对噪声证据敏感的问题,提出RIMS框架,通过合成偏好数据、软聚合机制及偏好优化,实现更好性能,在多基准测试中优于现有方法

Journal ref COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16251 2026-07-21 cs.LG 新提交 57%

Learning Spatio-Temporal Foundation Models from Pure Synthetic Data

从纯合成数据中学习时空基础模型

Yutong Feng, Shiyuan Piao, Yutong Xia, Xu Liu, Wenqi Fan, Fugee Tsung, See-Kiong Ng, Yuxuan Liang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) National University of Singapore(新加坡国立大学) Hong Kong University of Science and Technology(香港科技大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 研究旨在学习时空基础模型,提出NeoST,通过在程序生成的合成系统上预训练,引入可扩展语料库、潜在空间推理架构和目标,实验证明其在多样真实世界时空系统中性能优越,有长期稳定性和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15660 2026-07-20 cs.AI 新提交 57%

ToolVerse: Unlocking Massive Environments and Long-Horizon Tasks for Agentic Reinforcement Learning

ToolVerse:为智能强化学习解锁大规模环境和长时任务

Shuaiyu Zhou, Fengpeng Yue, Zengjie Hu, Yuanzhe Shen, Chenyang Zhang, feng hong, Cao Liu, Ke Zeng

机构 * LongCat Interaction Team, Meituan(美团长猫互动团队) Peking University(北京大学) Fudan University(复旦大学) Wuhan University(武汉大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 研究针对LLM智能体在复杂环境中工具集成问题,提出ToolVerse框架。通过构建大规模训练环境、设计任务策略及提出新算法,经实验验证该框架能增强LLM长时工具使用能力,提升性能与推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12605 2026-07-15 cs.SE cs.AI 新提交 57%

Multi-Perspective Agentic Program Repair via Code Property Graphs and Temporal Execution Graphs

通过代码属性图和时间执行图进行多视角智能程序修复

Zhili Huang, Ling Xu, Hongyu Zhang

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 研究针对大语言模型在自动程序修复中的局限,提出CT-Repair框架,通过代码属性图和时间执行图表示证据,利用三阶段过滤管道及多视角智能体分析错误并生成修复策略,实验证明该方法能有效提高修复有效性。

Comments 12 pages, 5 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12422 2026-07-15 cs.AI 新提交 57%

Accepted Prefixes Are Not All You Need: A Negative Result on PEFT-Based Block-Diffusion Drafting

接受前缀并非全部所需:基于PEFT的块扩散草稿生成的负面结果

Abdurrahman Javat, Allan Kazakov

机构 * Bahçeşehir University(巴赫切希尔大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 研究基于PEFT - BD的推测性解码方法,虽有避免分词器不匹配等优点,但在Qwen3 - 0.6B实验中未实现实际加速,因草稿生成器计算不高效。结果表明成功推测性解码需草稿生成器执行成本远低于验证器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10113 2026-07-14 cs.AI 新提交 57%

Dynamic Agent Skills: A Lifecycle Survey and Taxonomy of Evolving Skill Libraries

动态智能体技能:不断演进的技能库的生命周期调查与分类法

Yubo Li

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 研究大型语言模型智能体中技能库随时间的变化,通过分类法、生命周期架构和技能记录模式等工具组织文献,合成证据分级模式,指出相关问题并提出报告标准及开放问题。

Comments Accepted by TMLR (2026.07), OpenReview Link: https://openreview.net/forum?id=cjU3YbcRr8

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09544 2026-07-13 cs.CV cs.LG 新提交 57%

The Count Is There, but Misaligned: Understanding and Correcting Counting Failures in VLMs

计数存在但未对齐:理解和纠正视觉语言模型中的计数失败

Ahmed Oumar El-Shangiti, Abzal Nurgazy, Hilal AlQuabeh, Nikolai Rozanov, Kentaro Inui

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) Imperial College London(伦敦帝国学院)

专题命中 测试时计算 :self-correction(abstract);分类 cs.LG

AI总结 研究视觉语言模型计数失败问题,通过对VLM激活进行探测训练及分析,发现其虽常编码正确计数但输出错误,提出探测器引导的自校正方法,在不更新参数时提高计数准确率,揭示内部知识与模型输出差距并提供改进工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09366 2026-07-13 cs.SE cs.AI cs.LO 新提交 57%

Diversifying to Verify: When Task-Equivalent Programs Differ in Verifiability

多样化以进行验证:当任务等效程序在可验证性上存在差异时

Shirley Yu, Ruben Martins

机构 * Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 研究任务等效程序的可验证性差异,提出基于大型语言模型的Diversify2Verify管道,通过推断契约、生成测试不同实现并修复注释来验证,构建基准测试,结果表明实现多样性有助于验证,提高了验证成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏