Personalizing Large Language Model Agents with Small Policy Models
用小型策略模型个性化大型语言模型智能体
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 本研究提出轻量级策略层FABLE,通过在线学习用户执行策略实现LLM智能体个性化,在多类评估中改进偏好敏感行为且保持端到端任务性能。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
用小型策略模型个性化大型语言模型智能体
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 本研究提出轻量级策略层FABLE,通过在线学习用户执行策略实现LLM智能体个性化,在多类评估中改进偏好敏感行为且保持端到端任务性能。
自改进大语言模型智能体中的记忆奖励膨胀
机构 * University Of North Texas(北得克萨斯大学) ; Edge Hill University(边山大学) ; University of Cincinnati(辛辛那提大学) ; Iran University of Science and Technology(伊朗科技大学) ; Islamic Azad University(伊斯兰阿扎德大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 该研究发现自改进大语言模型智能体存在记忆奖励膨胀的“回声差距”问题,提出误差独立性假设(EIA),并通过LUCID算法在BIRD文本到SQL基准上提升了执行准确率。
TransMem:将隐藏状态转换为大语言模型的记忆
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL
AI总结 针对长上下文LLM智能体的历史信息未充分利用问题,提出轻量级记忆模块TransMem,结合证据条件自蒸馏,在多基准测试中显著提升性能。
Comments 12 pages, 4 figures
面向回合级智能体强化学习的科学发现环境扩展
机构 * Shanghai AI Lab(上海人工智能实验室)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 本文提出可扩展框架SciDisco,结合SciThèque与DiscoPO,训练出的SciDisco-14B在假设驱动的科学数据分析基准上实现了当前最优性能。
一致性并非质量:当人类共识并非真值时,对人类与大语言模型定性编码的盲专家验证
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 该研究发现以人类共识为标准的一致性评估无法准确衡量LLM定性编码质量,盲专家验证显示部分LLM编码优于人类,提出了可迁移的验证协议与编码分工框架。
VeriSkill:一种用于程序验证技能的自进化框架
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 本文提出专为程序验证设计的自进化框架VeriSkill,可将验证失败归因于技能缺陷并迭代优化技能,实验显示其在多种场景下均优于基线方法。
提示词为何构成图:提示词图工程的充要条件
机构 * Federal Institute of Goiás(戈亚斯联邦学院)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 本研究通过文献分析构建了将提示词视为图节点的定义,提出提示词图工程的四个条件及操作化测试,明确其边界并应用于六个系统,为相关实践提供可操作定义与共享术语。
超越KV重建:推测解码中MLA草稿模型的功能重建
专题命中 测试时计算 :verifier(abstract);分类 cs.LG
AI总结 针对推测解码中MHA/GQA转MLA导致草稿令牌接受率降低的问题,提出功能重建方法优化转换后的MLA注意力模块,在多数任务中提升了草稿令牌接受率。
初探编码智能体在开源社区中对AI贡献规则的合规性
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 本研究构建RepoComplianceBench基准测试编码智能体对开源社区AI贡献规则的合规性,发现当前智能体几乎不主动检索规则,仅在提示等辅助下实现披露与验证,但始终不执行AI禁令。
在启发式自我改进智能体中自我编写的验证不可靠
专题命中 测试时计算 :verifier(abstract);分类 cs.CL
AI总结 研究启发式自我改进智能体中自我编写验证不可靠的问题,引入密封外部接受循环(SEAL)方法,通过实验发现该问题在启发式学习中常现,自我验证失败按能力分层,SEAL性能优于无保护基线。
Comments 9 pages, 6 figures
计算营养中统计支持的大语言模型成分与食谱数据收集
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 研究针对计算营养中成分数据问题,提出结合统计估计、不变性检查和网络获取的大语言模型管道。通过该管道可获取精确数据,在参考集上实现高匹配度并大幅降低误差,将大语言模型辅助数据库构建变为可控流程。
DeepLook:通过前瞻进行更深入思考
机构 * Technical University of Munich(慕尼黑工业大学) ; LMU Munich(慕尼黑大学) ; MCML, LMU, MemAgents Lab(慕尼黑大学机器学习中心、记忆代理实验室)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 研究旨在改进大语言模型推理,提出无需训练的DeepLook框架,通过将前瞻计算集中在不确定性瓶颈处,聚合令牌级置信度为段级信号并排序投票。在四个数学基准测试中,该方法改变准确率与令牌成本的帕累托前沿,提升准确率并减少令牌生成。
MIITA:用于小语言模型持续学习的内存诱导推理时间自适应
机构 * Baylor University(贝勒大学) ; NEC Laboratories America(美国 NEC 实验室) ; University of Arkansas(阿肯色大学) ; Southern Illinois University(南伊利诺伊大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 针对小语言模型持续学习中参数更新致灾难性遗忘及内存不足问题,提出MIITA框架,它通过存储校正方向原型并在推理时检索应用,结合理论分析,在多种设置实验中提升性能并减轻遗忘。
用于通过公开测试的代码的代码监控红队
机构 * University of Electronic Science and Technology of China(电子科技大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 研究公开测试通过后代码隐藏错误监控问题,引入代码监控红队协议并实例化为代码监控基准。通过大量实验发现弱验证器虽能改进但仍易漏错,对抗性压力影响验证效果,GLM - 5.1验证器缩小部分差距,揭示了验证器故障与证据限制的问题。
评估和保障智能科学合成中的引用忠实性
机构 * Seoul National University(首尔国立大学) ; BioNexus(生物 Nexus)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 研究智能语言模型系统引用答案检查的可靠性问题,提出黄金锚定评估协议和可部署防护措施,能验证验证者、测量重新归因,为无支撑引用设限,经多模型和管道验证后作为单GPU工具包发布。
Comments 20 pages, 5 figures. Includes supplementary material (Appendices S1-S6). Open single-GPU reproducibility kit included
优化基于超图的RAG:迈向更好的事实提取和块检索
机构 * Qlik(思略特)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 研究旨在优化基于超图的RAG,以解决事实提取和块检索问题。方法是采用自一致性提示改进提取,运用个性化PageRank算法增强块检索,贡献在于提升了相关任务的性能。
Comments APIA 2026 conference
无需训练的路由:通过可靠性门控实现可控比例的大语言模型卸载
机构 * Purdue University(普渡大学) ; University of Exeter(埃克塞特大学) ; Army Research Laboratory(陆军研究实验室) ; Princeton University(普林斯顿大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 研究在资源受限下本地-云端协作部署大语言模型的问题,提出无需训练的CARGO路由框架,通过提示多样化采样等方法估计一致性并控制不确定性,在多任务和模型上表现出色,证明可从本地模型内在行为实现有效协作。
SemEval-2026任务6中的AsymVerify:用于政治逃避检测的非对称置信门控验证
机构 * Kaons 𝑲 ∗
专题命中 测试时计算 :verifier(abstract);分类 cs.CL
AI总结 研究针对政治逃避检测难题,提出AsymVerify系统用于SemEval-2026任务6的三元分类。核心方法是对问答对分类后对低置信预测进行非对称验证,主要贡献是取得高排名,在不同数据集上提升宏F1分数,且降低推理成本。
Comments Accepted to SemEval-2026 Task 6 (CLARITY) at ACL 2026. Team AsymVerify placed 2nd of 41 teams on the official Subtask 1 leaderboard. Task: https://konstantinosftw.github.io/CLARITY-SemEval-2026/. Code: https://github.com/kaons-research/AsymVerify-ACL. Website: https://kaons.com/
PerfAgent:用于仓库级代码优化的分析器引导迭代优化
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Rensselaer Polytechnic Institute(罗切斯特理工学院) ; IBM(IBM公司) ; Michigan State University(密歇根州立大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 研究针对仓库级代码优化难题,提出PerfAgent分析器引导迭代优化方法,该方法能让编码代理找到热点并改进,在两个优化基准测试中大幅提升专家匹配补丁率,且以低成本超越基线。
分布优先的总体模拟:非怪异大语言模型角色建模中的崩溃、校准和召回
机构 * Istanbul Technical University(伊斯坦布尔技术大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 研究非怪异LLM角色建模中独立代理范式的问题,提出分布优先校正方法,通过言语化采样等进行实验,发现原范式有崩溃等问题,校正方法能测量内部不一致性及校准条件。
Comments 8 pages, 8 figures
C$^2$KV:用于高效大语言模型推理的压缩可组合键值缓存重用
机构 * Alibaba Group(阿里巴巴集团)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL
AI总结 研究针对长上下文LLM推理成本高问题,提出C$^2$KV框架,联合优化KV提取与推理拼接,学习可组合压缩的KV缓存流形,引入轻量级边车提取器及协同训练策略,显著降低缓存成本,实现推理加速并保持生成质量。
Comments 12 pages, 9 figures, accepted by ACM SIGKDD 2026
SpecLA:线性注意力模型的高效推测解码
机构 * Alibaba Group(阿里巴巴集团)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL
AI总结 研究针对线性注意力模型自回归解码效率低的问题,提出SpecLA推测解码运行时,通过拓扑感知内核验证、存储紧凑因子及置信度修剪等方法,在NVIDIA H100上实现了比自回归解码高达1.70倍的端到端加速。
RIMS:通过平滑多对聚合进行偏好优化以实现小规模语言模型检索增强生成
机构 * Columbia University(哥伦比亚大学) ; Rutgers University(罗格斯大学) ; Purdue University(普渡大学) ; SUNY Albany(纽约州立大学奥尔巴尼分校)
专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.CL
AI总结 研究针对小规模语言模型检索增强生成中对噪声证据敏感的问题,提出RIMS框架,通过合成偏好数据、软聚合机制及偏好优化,实现更好性能,在多基准测试中优于现有方法
Journal ref COLM 2026
从纯合成数据中学习时空基础模型
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; National University of Singapore(新加坡国立大学) ; Hong Kong University of Science and Technology(香港科技大学) ; Hong Kong Polytechnic University(香港理工大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.LG
AI总结 研究旨在学习时空基础模型,提出NeoST,通过在程序生成的合成系统上预训练,引入可扩展语料库、潜在空间推理架构和目标,实验证明其在多样真实世界时空系统中性能优越,有长期稳定性和推理效率。
ToolVerse:为智能强化学习解锁大规模环境和长时任务
机构 * LongCat Interaction Team, Meituan(美团长猫互动团队) ; Peking University(北京大学) ; Fudan University(复旦大学) ; Wuhan University(武汉大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 研究针对LLM智能体在复杂环境中工具集成问题,提出ToolVerse框架。通过构建大规模训练环境、设计任务策略及提出新算法,经实验验证该框架能增强LLM长时工具使用能力,提升性能与推理能力。
通过代码属性图和时间执行图进行多视角智能程序修复
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 研究针对大语言模型在自动程序修复中的局限,提出CT-Repair框架,通过代码属性图和时间执行图表示证据,利用三阶段过滤管道及多视角智能体分析错误并生成修复策略,实验证明该方法能有效提高修复有效性。
Comments 12 pages, 5 figures, 10 tables
接受前缀并非全部所需:基于PEFT的块扩散草稿生成的负面结果
机构 * Bahçeşehir University(巴赫切希尔大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 研究基于PEFT - BD的推测性解码方法,虽有避免分词器不匹配等优点,但在Qwen3 - 0.6B实验中未实现实际加速,因草稿生成器计算不高效。结果表明成功推测性解码需草稿生成器执行成本远低于验证器。
动态智能体技能:不断演进的技能库的生命周期调查与分类法
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 研究大型语言模型智能体中技能库随时间的变化,通过分类法、生命周期架构和技能记录模式等工具组织文献,合成证据分级模式,指出相关问题并提出报告标准及开放问题。
Comments Accepted by TMLR (2026.07), OpenReview Link: https://openreview.net/forum?id=cjU3YbcRr8
Journal ref Transactions on Machine Learning Research, 2026
计数存在但未对齐:理解和纠正视觉语言模型中的计数失败
机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; Imperial College London(伦敦帝国学院)
专题命中 测试时计算 :self-correction(abstract);分类 cs.LG
AI总结 研究视觉语言模型计数失败问题,通过对VLM激活进行探测训练及分析,发现其虽常编码正确计数但输出错误,提出探测器引导的自校正方法,在不更新参数时提高计数准确率,揭示内部知识与模型输出差距并提供改进工具。
多样化以进行验证:当任务等效程序在可验证性上存在差异时
机构 * Stanford University(斯坦福大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 研究任务等效程序的可验证性差异,提出基于大型语言模型的Diversify2Verify管道,通过推断契约、生成测试不同实现并修复注释来验证,构建基准测试,结果表明实现多样性有助于验证,提高了验证成功率。