TransMem: Transforming Hidden States into Memory for Large Language Models
TransMem:将隐藏状态转换为大语言模型的记忆
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL
AI总结 针对长上下文LLM智能体的历史信息未充分利用问题,提出轻量级记忆模块TransMem,结合证据条件自蒸馏,在多基准测试中显著提升性能。
Comments 12 pages, 4 figures
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
TransMem:将隐藏状态转换为大语言模型的记忆
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL
AI总结 针对长上下文LLM智能体的历史信息未充分利用问题,提出轻量级记忆模块TransMem,结合证据条件自蒸馏,在多基准测试中显著提升性能。
Comments 12 pages, 4 figures
面向回合级智能体强化学习的科学发现环境扩展
机构 * Shanghai AI Lab(上海人工智能实验室)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 本文提出可扩展框架SciDisco,结合SciThèque与DiscoPO,训练出的SciDisco-14B在假设驱动的科学数据分析基准上实现了当前最优性能。
一致性并非质量:当人类共识并非真值时,对人类与大语言模型定性编码的盲专家验证
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 该研究发现以人类共识为标准的一致性评估无法准确衡量LLM定性编码质量,盲专家验证显示部分LLM编码优于人类,提出了可迁移的验证协议与编码分工框架。
Role-Agent: 通过双角色演化引导LLM智能体
机构 * University of Science and Technology of China(中国科学技术大学) ; AMAP, Alibaba Group(阿里巴巴集团高德地图)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 提出Role-Agent框架,让单个LLM同时作为智能体和环境,通过世界在智能体(WIA)和智能体在世界(AIW)两个组件实现自举协同演化,在多个基准上平均提升超过4%。
Comments 20 pages, including 12 pages of main text and 8 pages of appendix; work in progress
双维度一致性:在适应性推理时间扩展中平衡预算与质量
机构 * Xi’an Jiaotong University(西安交通大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 本文提出双维度一致性框架,通过结合置信度加权贝叶斯协议与趋势感知分层剪枝,平衡推理预算与质量,减少10倍以上token消耗并保持高精度。
VeriSkill:一种用于程序验证技能的自进化框架
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 本文提出专为程序验证设计的自进化框架VeriSkill,可将验证失败归因于技能缺陷并迭代优化技能,实验显示其在多种场景下均优于基线方法。
提示词为何构成图:提示词图工程的充要条件
机构 * Federal Institute of Goiás(戈亚斯联邦学院)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 本研究通过文献分析构建了将提示词视为图节点的定义,提出提示词图工程的四个条件及操作化测试,明确其边界并应用于六个系统,为相关实践提供可操作定义与共享术语。
超越KV重建:推测解码中MLA草稿模型的功能重建
专题命中 测试时计算 :verifier(abstract);分类 cs.LG
AI总结 针对推测解码中MHA/GQA转MLA导致草稿令牌接受率降低的问题,提出功能重建方法优化转换后的MLA注意力模块,在多数任务中提升了草稿令牌接受率。
解除触发器:通过尾风险内在几何平滑实现的插件式防御方法用于后门LLM
机构 * School of Cyber Science and Technology(网络安全科学与技术学院) ; Harbin Institute of Technology(哈尔滨工业大学) ; Peng Cheng Laboratory(鹏城实验室) ; University of Luxembourg(卢森堡大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 本文提出TIGS方法,通过在推理时进行内容感知的尾风险筛查和内在几何平滑,有效抑制后门攻击,同时保持推理稳定性和语义一致性,适用于多种架构的LLM。
初探编码智能体在开源社区中对AI贡献规则的合规性
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 本研究构建RepoComplianceBench基准测试编码智能体对开源社区AI贡献规则的合规性,发现当前智能体几乎不主动检索规则,仅在提示等辅助下实现披露与验证,但始终不执行AI禁令。
理解LoRA作为知识记忆:一项实证分析
机构 * New York University(纽约大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.LG
AI总结 本文通过系统实证研究,将低秩适配(LoRA)作为模块化知识记忆,探索其存储容量、内部化优化、多模块系统扩展及长上下文推理能力,提供LoRA记忆操作边界的实用指导。
Comments ICML 2026
在启发式自我改进智能体中自我编写的验证不可靠
专题命中 测试时计算 :verifier(abstract);分类 cs.CL
AI总结 研究启发式自我改进智能体中自我编写验证不可靠的问题,引入密封外部接受循环(SEAL)方法,通过实验发现该问题在启发式学习中常现,自我验证失败按能力分层,SEAL性能优于无保护基线。
Comments 9 pages, 6 figures
计算营养中统计支持的大语言模型成分与食谱数据收集
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 研究针对计算营养中成分数据问题,提出结合统计估计、不变性检查和网络获取的大语言模型管道。通过该管道可获取精确数据,在参考集上实现高匹配度并大幅降低误差,将大语言模型辅助数据库构建变为可控流程。
DeepLook:通过前瞻进行更深入思考
机构 * Technical University of Munich(慕尼黑工业大学) ; LMU Munich(慕尼黑大学) ; MCML, LMU, MemAgents Lab(慕尼黑大学机器学习中心、记忆代理实验室)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 研究旨在改进大语言模型推理,提出无需训练的DeepLook框架,通过将前瞻计算集中在不确定性瓶颈处,聚合令牌级置信度为段级信号并排序投票。在四个数学基准测试中,该方法改变准确率与令牌成本的帕累托前沿,提升准确率并减少令牌生成。
MIITA:用于小语言模型持续学习的内存诱导推理时间自适应
机构 * Baylor University(贝勒大学) ; NEC Laboratories America(美国 NEC 实验室) ; University of Arkansas(阿肯色大学) ; Southern Illinois University(南伊利诺伊大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 针对小语言模型持续学习中参数更新致灾难性遗忘及内存不足问题,提出MIITA框架,它通过存储校正方向原型并在推理时检索应用,结合理论分析,在多种设置实验中提升性能并减轻遗忘。
通过错误定位进行测试时缩放
机构 * Google DeepMind(谷歌DeepMind)
专题命中 测试时计算 :reasoning(abstract);分类 cs.LG
AI总结 研究针对大型语言模型复杂任务性能提升问题,提出通过错误定位进行测试时缩放(TTEL)算法,利用反馈定位错误步骤,截断轨迹并分支新一代,重用有效前缀,在多个基准测试中优于竞争基线。
Comments 10 pages, 8 figures (With appendix: 27 pages, 11 figures)
用于通过公开测试的代码的代码监控红队
机构 * University of Electronic Science and Technology of China(电子科技大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 研究公开测试通过后代码隐藏错误监控问题,引入代码监控红队协议并实例化为代码监控基准。通过大量实验发现弱验证器虽能改进但仍易漏错,对抗性压力影响验证效果,GLM - 5.1验证器缩小部分差距,揭示了验证器故障与证据限制的问题。
评估和保障智能科学合成中的引用忠实性
机构 * Seoul National University(首尔国立大学) ; BioNexus(生物 Nexus)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 研究智能语言模型系统引用答案检查的可靠性问题,提出黄金锚定评估协议和可部署防护措施,能验证验证者、测量重新归因,为无支撑引用设限,经多模型和管道验证后作为单GPU工具包发布。
Comments 20 pages, 5 figures. Includes supplementary material (Appendices S1-S6). Open single-GPU reproducibility kit included
优化基于超图的RAG:迈向更好的事实提取和块检索
机构 * Qlik(思略特)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 研究旨在优化基于超图的RAG,以解决事实提取和块检索问题。方法是采用自一致性提示改进提取,运用个性化PageRank算法增强块检索,贡献在于提升了相关任务的性能。
Comments APIA 2026 conference
无需训练的路由:通过可靠性门控实现可控比例的大语言模型卸载
机构 * Purdue University(普渡大学) ; University of Exeter(埃克塞特大学) ; Army Research Laboratory(陆军研究实验室) ; Princeton University(普林斯顿大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 研究在资源受限下本地-云端协作部署大语言模型的问题,提出无需训练的CARGO路由框架,通过提示多样化采样等方法估计一致性并控制不确定性,在多任务和模型上表现出色,证明可从本地模型内在行为实现有效协作。
SemEval-2026任务6中的AsymVerify:用于政治逃避检测的非对称置信门控验证
机构 * Kaons 𝑲 ∗
专题命中 测试时计算 :verifier(abstract);分类 cs.CL
AI总结 研究针对政治逃避检测难题,提出AsymVerify系统用于SemEval-2026任务6的三元分类。核心方法是对问答对分类后对低置信预测进行非对称验证,主要贡献是取得高排名,在不同数据集上提升宏F1分数,且降低推理成本。
Comments Accepted to SemEval-2026 Task 6 (CLARITY) at ACL 2026. Team AsymVerify placed 2nd of 41 teams on the official Subtask 1 leaderboard. Task: https://konstantinosftw.github.io/CLARITY-SemEval-2026/. Code: https://github.com/kaons-research/AsymVerify-ACL. Website: https://kaons.com/
PerfAgent:用于仓库级代码优化的分析器引导迭代优化
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Rensselaer Polytechnic Institute(罗切斯特理工学院) ; IBM(IBM公司) ; Michigan State University(密歇根州立大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 研究针对仓库级代码优化难题,提出PerfAgent分析器引导迭代优化方法,该方法能让编码代理找到热点并改进,在两个优化基准测试中大幅提升专家匹配补丁率,且以低成本超越基线。
循环代码取证:面向图像伪造检测的代理工具使用
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 本文提出ForenAgent框架,通过多轮交互使MLLM自主生成并迭代优化Python工具,提升图像伪造检测的灵活性和可解释性,构建FABench数据集进行系统训练和评估。
Comments 18 pages, 7 figures
分布优先的总体模拟:非怪异大语言模型角色建模中的崩溃、校准和召回
机构 * Istanbul Technical University(伊斯坦布尔技术大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 研究非怪异LLM角色建模中独立代理范式的问题,提出分布优先校正方法,通过言语化采样等进行实验,发现原范式有崩溃等问题,校正方法能测量内部不一致性及校准条件。
Comments 8 pages, 8 figures
C$^2$KV:用于高效大语言模型推理的压缩可组合键值缓存重用
机构 * Alibaba Group(阿里巴巴集团)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL
AI总结 研究针对长上下文LLM推理成本高问题,提出C$^2$KV框架,联合优化KV提取与推理拼接,学习可组合压缩的KV缓存流形,引入轻量级边车提取器及协同训练策略,显著降低缓存成本,实现推理加速并保持生成质量。
Comments 12 pages, 9 figures, accepted by ACM SIGKDD 2026
SpecLA:线性注意力模型的高效推测解码
机构 * Alibaba Group(阿里巴巴集团)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL
AI总结 研究针对线性注意力模型自回归解码效率低的问题,提出SpecLA推测解码运行时,通过拓扑感知内核验证、存储紧凑因子及置信度修剪等方法,在NVIDIA H100上实现了比自回归解码高达1.70倍的端到端加速。
RIMS:通过平滑多对聚合进行偏好优化以实现小规模语言模型检索增强生成
机构 * Columbia University(哥伦比亚大学) ; Rutgers University(罗格斯大学) ; Purdue University(普渡大学) ; SUNY Albany(纽约州立大学奥尔巴尼分校)
专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.CL
AI总结 研究针对小规模语言模型检索增强生成中对噪声证据敏感的问题,提出RIMS框架,通过合成偏好数据、软聚合机制及偏好优化,实现更好性能,在多基准测试中优于现有方法
Journal ref COLM 2026
从纯合成数据中学习时空基础模型
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; National University of Singapore(新加坡国立大学) ; Hong Kong University of Science and Technology(香港科技大学) ; Hong Kong Polytechnic University(香港理工大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.LG
AI总结 研究旨在学习时空基础模型,提出NeoST,通过在程序生成的合成系统上预训练,引入可扩展语料库、潜在空间推理架构和目标,实验证明其在多样真实世界时空系统中性能优越,有长期稳定性和推理效率。
ToolVerse:为智能强化学习解锁大规模环境和长时任务
机构 * LongCat Interaction Team, Meituan(美团长猫互动团队) ; Peking University(北京大学) ; Fudan University(复旦大学) ; Wuhan University(武汉大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 研究针对LLM智能体在复杂环境中工具集成问题,提出ToolVerse框架。通过构建大规模训练环境、设计任务策略及提出新算法,经实验验证该框架能增强LLM长时工具使用能力,提升性能与推理能力。
能量引导递归模型
机构 * Institute of Fundamental and Frontier Sciences, University of Electronic Science and Technology of China(电子科技大学基础与前沿研究院) ; School of Physics, University of Electronic Science and Technology of China(电子科技大学物理学院) ; Key Laboratory of Quantum Physics and Photonic Quantum Information, Ministry of Education, University of Electronic Science and Technology of China(电子科技大学量子物理与光子量子信息教育部重点实验室) ; Non-classical Information Science Basic Discipline Research Center of Sichuan Province, University of Electronic Science and Technology of China(四川省非经典信息科学基础学科研究中心)
专题命中 测试时计算 :reasoning(abstract);分类 cs.LG
AI总结 研究递归推理模型测试时扩展缺乏原则机制的问题,提出能量引导递归模型(ERM),利用霍普菲尔德能量定义选择器,与能量技术集成,在数独等问题上达最优解,优于其他模型,为有效推理提供途径。