RefCaptioner: Multi-Reference Image-Grounded Video Captioning
RefCaptioner:多参考图像接地的视频字幕生成
专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);post-training(abstract)
AI总结 本文提出多参考图像接地的视频字幕生成新任务,构建语料库与MRVBench基准,提出RefCaptioner框架,实验证实其性能最优且生成字幕更忠实。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
RefCaptioner:多参考图像接地的视频字幕生成
专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);post-training(abstract)
AI总结 本文提出多参考图像接地的视频字幕生成新任务,构建语料库与MRVBench基准,提出RefCaptioner框架,实验证实其性能最优且生成字幕更忠实。
FinSMART:基于市场对齐强化学习的算法交易金融情感分析
机构 * Imperial College London(帝国理工学院)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 FinSMART是首个基于市场对齐强化学习的金融情感分析框架,通过市场感知数据过滤与非对称交易奖励优化情感信号,在交易回报等指标上较基线提升220%,可自适应市场动态。
ReDiPPO:用于数学推理的参考引导值校准与差异感知标记重加权
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 针对数学推理中PPO的标记级信用分配难题,ReDiPPO引入参考引导评判器并通过值估计差异重加权标记优势,提升值估计精度且优于PPO、DAPO等基线。
评估和定价AI生成响应中的广告
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 针对AI生成响应中广告评估与定价的核心挑战,该研究构建智能体模拟框架生成监督,提炼出高效评估器,实现更优的点击意图预测,还推导了最优支付规则并扩展了广告生成的训练目标。
Comments 9 pages, 2 figures
DeepResearch 智能体系统
机构 * Software Copyright Research and Development Document(软件版权研究与开发文档)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 DeepResearch 智能体系统是基于稀疏激活架构的大语言模型,通过双模式推理引擎、多工具协调等技术,在多个智能体基准测试中取得最优性能,已完全开源并支持多领域应用。
具有可验证奖励的强化学习中噪声数据是破坏性的
机构 * Siebel School of Computing and Data Science, University of Illinois Urbana Champaign, USA(计算机与数据科学学院,伊利诺伊大学厄巴纳-香槟分校)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 研究指出,现有RLVR算法无法缓解噪声影响,噪声会破坏强化学习性能,真实世界噪声导致Text2SQL任务准确率下降5-12%。
Comments 16 pages, 17 figures
Cocktail-Talker:基于Turn Action GRPO的嘈杂社交环境下多说话人对话建模
专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.CL
AI总结 本文提出Cocktail-Talker框架,结合Turn Action GRPO,通过动作令牌建模助手行为,利用Cocktail-DialogGen生成数据,实现嘈杂社交环境下的多说话人口语对话建模,推动更自然的对话系统发展。
基础模型时代的预测过程监控再审视:序列、表格与大语言模型方法的对比研究
机构 * University of Mannheim(曼海姆大学) ; SAP Signavio(思爱普 Signavio) ; Technical University of Clausthal(克劳斯塔尔工业大学)
专题命中 长上下文与记忆 :LLM(title,summary_cn);foundation model(title,abstract);large language model(abstract);language model(abstract)
AI总结 该研究对比序列、表格基础模型与LLM在PPM任务的表现,发现序列模型下一个活动预测最优,表格模型在时间任务具竞争力,LLM性能滞后且成本更高。
Comments Accepted at ECML PKDD 2026 Workshops
MIND:基于意图感知信息瓶颈的轻量且有效的LLM智能体记忆注入防御
专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI
AI总结 针对LLM智能体记忆注入攻击,提出轻量防御框架MIND,通过意图感知信息瓶颈过滤冗余信息并识别恶意记忆,在ReAct-StrategyQA上大幅降低攻击成功率且保留任务性能与效率。
Σ-Mem:面向基于大语言模型(LLM)的多智能体系统的在线可靠性记忆
专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI
AI总结 针对现有LLM多智能体系统记忆系统无法建模智能体可信度的问题,提出Σ-Mem在线可靠性记忆,基于决策后反馈更新实对称状态,在Qwen系列模型上实现自适应协调与更优性能。
理解在早期完成:大语言模型的深度分工及其在无界上下文记忆中的应用
机构 * Tsinghua University(清华大学) ; Tencent(腾讯)
专题命中 长上下文与记忆 :large language model(title);language model(title);分类 cs.CL
AI总结 该研究提出CoMem方法,利用大语言模型的深度分工构建无界上下文记忆,在RULER、LoCoMo等基准上性能优于全上下文KV-Direct,内存占用低、预填充速度快,证明长上下文记忆可沿层轴组织。
Comments 19 pages, 4 figures, 27 tables. Submitted to ACL Rolling Review
从未来回溯:基于反事实惊奇的键值缓存管理
机构 * Metacognition AI(元认知人工智能) ; Australian National University(澳大利亚国立大学) ; Adelaide University(阿德莱德大学)
专题命中 长上下文与记忆 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 该研究针对LLM的KV缓存内存占用问题,提出基于反事实惊奇的KV驱逐方案及快速单层近似方法,在基准测试中性能优于或可与现有最优方法竞争。
Comments 17 pages, 5 figures
ReToken:用一个标记改进用于视觉检索的视觉-语言模型
机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Microsoft Research(微软研究院) ; Google DeepMind(谷歌DeepMind)
专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究提出轻量级ReToken,通过选择视觉键值缓存中与查询相关的稀疏标记解决长视觉上下文的视觉检索难题,在多基准测试中提升Qwen3VL-8B等模型性能,且可在单H100运行。
Comments Code: https://github.com/avaxiao/ReToken
FORGE: 融合寄存器梯度消除以实现内存高效的大语言模型训练
机构 * Puch AI ; Singapore Institute of Technology(新加坡理工大学) ; Nanyang Technological University(南洋理工大学) ; NVIDIA(英伟达) ; IIIT-Delhi(德里印度理工学院)
专题命中 长上下文与记忆 :LLM(title);pretraining(abstract);分类 cs.LG
AI总结 提出FORGE方法,将优化器步骤融合到反向传播中,逐块在寄存器中应用,消除梯度张量,减少内存占用并加速训练,在微调和持续预训练中速度提升约1.5倍。
MemTxn:智能体记忆中源支持更新与完整状态恢复的事务边界
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型智能体持久内存错误问题,提出MemTxn治理层,通过Ordered PatchTest等组件实现可靠更新与恢复,在多个基准测试中性能优于现有方法。
长上下文Transformer中的关键注意力缩放
机构 * Department of Mathematics, Massachusetts Institute of Technology(数学系,麻省理工学院) ; Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology(电气工程与计算机科学系,麻省理工学院)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 该研究针对长上下文Transformer的注意力秩崩溃问题,通过分析简化模型确定关键缩放因子$\beta_n \backsim \text{log} n$,为YaRN和Qwen的注意力缩放提供理论依据,阐明对数缩放可维持长上下文下的稀疏内容自适应注意力。
Comments 31 pages, 2 figures
Journal ref Proceedings of the Fourteenth International Conference on Learning Representations (ICLR 2026), 2026
规模化的记忆解码器:一种预训练的参数化长期记忆
专题命中 长上下文与记忆 :language model(abstract);pretraining(abstract);分类 cs.CL
AI总结 本研究将记忆解码器扩展至69亿参数并在3000亿token上预训练,通过分布式Faiss等技术解决索引瓶颈,发现独立扩展记忆可更高效提升语言模型性能,在多基准测试中验证了其优势。
一次思考足矣:面向高分辨率视觉问答的中间层证据路由
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)
AI总结 本文针对高分辨率视觉问答提出无需训练的Thinking-Once证据路由方法,通过利用中间层留存的细粒度证据,在多个基准上提升性能并降低内存与推理时间。
Transformer 的拓扑困境
机构 * Google DeepMind(谷歌DeepMind)
专题命中 长上下文与记忆 :foundation model(abstract);分类 cs.AI、cs.LG
AI总结 本文探讨了Transformer在处理序列结构时的拓扑问题,指出其纯前馈架构限制了动态状态跟踪,提出应通过递归架构转向隐含激活动态,并介绍了连续思维Transformer架构的分类方法及未来研究方向。
S-CEReBrO:突破连续脑电图监测中的内存瓶颈
机构 * ETH Zurich(苏黎世联邦理工学院) ; Nanyang Technological University(南洋理工大学) ; University of Bologna(博洛尼亚大学)
专题命中 长上下文与记忆 :foundation model(abstract);分类 cs.LG
AI总结 该研究针对连续EEG监测中Transformer架构的内存瓶颈,提出S-CEReBrO架构,通过窗口交替注意力实现内存恒定,在EEG下游任务中性能领先且效率提升。
Comments This is the pre-rebuttal version of a paper accepted at MICCAI 2026. The camera-ready version will be posted following the embargo
VisualRouter:面向长视频理解的查询驱动视觉采样
机构 * Tongji University(同济大学) ; University of Electronic Science and Technology of China(电子科技大学)
专题命中 长上下文与记忆 :language model(abstract)
AI总结 本文提出无训练即插即用框架VisualRouter,通过将查询分为全局或局部并采用对应采样策略,提升了大型视觉语言模型的长视频理解性能,在多个基准数据集上优于均匀采样及现有无训练方法。
文本模板令牌是扩散Transformer中的隐式语义寄存器
机构 * Nanjing University(南京大学) ; Alibaba Group(阿里巴巴集团) ; Zhejiang University(浙江大学)
专题命中 长上下文与记忆 :LLM(abstract)
AI总结 研究文本到图像扩散Transformer中内部计算,引入因果可解释性框架,发现结构模板令牌充当隐式语义寄存器,据此设计剪枝规则,还揭示其生成计算组织方式,提供了DiTs内部机制的因果视图。
ARES:面向PPA和成本感知的LLM智能体RTL优化的自适应推理力度调控
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 ARES是一款面向PPA和成本感知的LLM智能体RTL优化框架,通过自适应调控推理力度,在相同成本下提升优化效果,缩小了LLM生成与手工优化单元的差距。
Comments 7 pages, 6 figures
面向基于大语言模型(LLM)的推荐系统的分层潜在推理方法
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文针对基于LLM的推荐系统提出分层潜在推理框架HiLaR,通过层感知强化优化提升推荐性能,在四个Amazon基准数据集上优于多种主流基线。
推理共识:通过加权有向无环图聚合实现大语言模型推理的结构集成
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究提出通过加权DAG聚合集成LLM推理结构的框架,在六个基准上优于多数投票基线,可提供可检查的共识推理图,还能分析不同推理视角。
在未知真相的情况下为诚实付费:LLM市场智能体的声誉惩罚机制设计
机构 * Univ. of Illinois Chicago(伊利诺伊大学芝加哥分校) ; Springbrand Inc.(春品牌公司) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Beihang University(北京航空航天大学) ; Hangzhou Innovation Institute of BUAA(北京航空航天大学杭州创新研究院) ; Microsoft(微软公司)
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI
AI总结 针对LLM智能体商家伪造属性的问题,设计无需真实情况的CARP声誉惩罚机制,搭配SPARC机制可保护消费者、提升福利,且在多模型中具有约束力。
Comments 11 pages
你会步行去洗车吗?揭示大型语言模型在常识推理中的显著性偏差
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL
AI总结 本研究构建SaliTrap基准数据集,发现主流LLMs存在显著性偏差,其常识推理失败源于知识被干扰项抑制,而非知识缺失,轻量级推理时提示可大幅缓解该问题。
小型语言模型代理实现高效高质量的知识挖掘
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; Carneigie Mellon University(卡内基梅隆大学) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 推理与问题求解 :language model(title,abstract);small language model(title);LLM(abstract_cn);large language model(abstract)
AI总结 提出Falconer框架,结合大语言模型的代理推理与轻量级代理模型,通过规划与标注实现可扩展的知识挖掘,在保持指令遵循精度的同时降低90%推理成本并加速20倍以上。
Comments Code available: https://github.com/LongfeiYun17/falconer
对人格引导对大语言模型能力影响的系统分析
机构 * School of Computer Science and Engineering, Northeastern University, Shenyang 110819, China(东北大学计算机科学与工程学院,沈阳 110819,中国) ; School of Computing and Information Systems, Singapore Management University, Singapore 178902, Singapore(新加坡管理大学计算机与信息系统学院,新加坡 178902,新加坡) ; School of Computer and Communication Engineering, Northeastern University, Qinhuangdao 066004, China(东北大学计算机与通信工程学院,秦皇岛 066004,中国)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文通过NPTI框架诱导大模型五种人格特质,发现人格引导对认知任务性能有稳定影响,且不同特质对任务表现有不同影响,提出动态人格路由策略提升性能。
Journal ref Chen, J., Wang, M., Xie, T., Feng, S., & Liu, Y. (2026). A Systematic Analysis of the Impact of Persona Steering on LLM Capabilities. Proceedings of the Annual Meeting of the Cognitive Science Society, 48
大型语言模型能否执行父订单?
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 该研究针对算法交易的父订单执行问题,提出分层框架PACE,基于深交所数据验证其性能优于现有方法,表明LLMs可辅助人类交易者执行决策。