Real-Time Trend Prediction via Continually-Aligned LLM Query Generation
通过持续对齐的LLM查询生成进行实时趋势预测
机构 * Meta Platforms(Meta平台)
专题命中 后训练与偏好优化 :LLM(title,abstract);分类 cs.AI
AI总结 RTTP通过持续对齐的LLM查询生成,在低流量搜索环境中实现实时趋势预测,显著提升尾部趋势检测精度和查询生成准确性。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
通过持续对齐的LLM查询生成进行实时趋势预测
机构 * Meta Platforms(Meta平台)
专题命中 后训练与偏好优化 :LLM(title,abstract);分类 cs.AI
AI总结 RTTP通过持续对齐的LLM查询生成,在低流量搜索环境中实现实时趋势预测,显著提升尾部趋势检测精度和查询生成准确性。
推动专家专业化以提升MoE
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Nanyang Technological University(南洋理工大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL
AI总结 本文提出正交性损失和方差损失,提升MoE模型专家专业化,显著提高性能并保持负载平衡。
Comments 33pages, 6figures(Accepted by Neurips 2025 Oral)
超越偏好:基于人类理由和价值观的学习对齐原则
机构 * Duke University(杜克大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 本文提出GCAI框架,通过结合人类理由和价值观生成AI对齐原则,提升AI治理的道德基础和一致性。
预训练价值,而非奖励:解耦的价值策略优化
机构 * School of Computer Science, Fudan University(复旦大学计算机学院) ; Microsoft(微软公司)
专题命中 后训练与偏好优化 :pretraining(abstract);RLHF(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了解耦的价值策略优化方法,通过预训练价值模型替代传统奖励模型,实现了更稳定高效的强化学习。
Comments 16 pages, 3 figures
GRAM:一种用于奖励泛化的大规模生成式奖励模型
机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) ; NiuTrans Research, Shenyang, China(NiuTrans研究) ; CAS Key Laboratory of Behavioral Science, Institute of Psychology, CAS, Beijing, China(中国科学院行为科学重点实验室) ; Meituan Inc.(美团公司)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 GRAM提出了一种生成式奖励模型,通过结合无监督和监督学习,提升奖励模型在多种任务上的泛化能力,有效改进了基线模型的性能。
Comments Accepted by ICML 2025
通过成对最大分歧竞赛评估奖励模型泛化能力
机构 * ZJU-UIUC Institute, Zhejiang University(浙江大学ZJU-UIUC研究院) ; School of Artificial Intelligence, Nanjing University of Information Science and Technology(南京信息工程大学人工智能学院) ; ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学Hangzhou全球科技创新中心) ; City University of Hong Kong(香港城市大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出PMDC方法,通过动态选择高争议测试案例评估奖励模型的泛化能力,并揭示了现有模型的系统性泛化失败问题。
Comments 17 pages, 6 figures, 2 tables
逻辑的粘度:DPO对齐中的相变与滞后效应
机构 * Department of Mathematics, Trent University, Peterborough, ON, Canada(数学系,特伦特大学,彼得伯勒,加拿大)
专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI、cs.LG
AI总结 研究发现DPO对齐中β参数的非单调性及滞后效应,揭示能力与边际的反相关性,推动能力解析评估方法的发展。
Comments 10 Pages, 5 Figures
Turn-PPO:基于PPO的回合级优势估计以提升代理语言模型中的多回合强化学习
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Amazon(亚马逊)
专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.LG
AI总结 本研究提出turn-PPO,通过回合级MDP公式化提升多回合强化学习在代理语言模型中的表现,验证其在WebShop和Sokoban数据集上的有效性。
Journal ref EACL 2026
MemoryRewardBench: 评估大型语言模型中长期记忆管理的奖励模型基准
机构 * LCM Laboratory(LCM实验室) ; China Mobile (Suzhou)(中国移动(苏州))
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
AI总结 MemoryRewardBench通过系统评估奖励模型在长序列内存管理中的表现,揭示了不同模型在长期记忆处理中的能力差异与局限性。
大型语言模型中潜在状态持续性的失效
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Renmin University of China(中国人民大学)
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 本文揭示大型语言模型在维持持久潜在状态方面的缺陷,通过三个实验展示其在概率分配、概念漂移和变量绑定上的失败,表明LLMs更倾向于反应性求解而非主动规划。
Comments 8 pages, 6 figures, 9 tables
CtrlRAG:用于大型语言模型检索增强生成的黑盒文档污染攻击
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Sun Yat-sen University(中山大学)
专题命中 长上下文与记忆 :language model(title,abstract);large language model(title);分类 cs.CL
AI总结 CtrlRAG通过注入恶意文档实现对RAG系统的黑盒攻击,提升攻击成功率并提出动态防御策略以平衡安全与性能。
RAG-GFM:通过检索增强生成克服图基础模型中的内存瓶颈
机构 * SKLCCSE, School of Computer Science and Engineering(计算机科学与工程学院) ; Beihang University(北航) ; Guangxi Normal University(广西师范大学)
专题命中 长上下文与记忆 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 RAG-GFM通过检索增强生成方法,解决图基础模型中的内存瓶颈问题,提升模型的效率和效果。
Comments Accepted by the Web Conference 2026 (Research Track)
探索针对长上下文语言模型的微调以实现上下文检索和高效的KV缓存
机构 * Sapienza University of Rome(罗马萨皮恩扎大学) ; Amazon AGI(亚马逊人工智能研究院)
专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL
AI总结 本文研究了长上下文语言模型在微调策略下的性能提升及KV缓存压缩下的鲁棒性,展示了领域内和跨领域任务中的不同表现。
Comments European Chapter of the Association for Computational Linguistics EACL 2026
U-Fold:面向用户中心任务的动态意图感知上下文折叠
机构 * Zhejiang University(浙江大学) ; Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) ; Westlake University(西湖大学)
专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 U-Fold通过动态意图感知上下文折叠方法,提升用户为中心任务中长上下文处理的效率和准确性。
超越聊天:一种LLMs作为以人为中心的支持系统框架
专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出了一种LLMs作为以人为中心的支持系统框架,旨在通过透明性、个性化等原则,提升人类在决策和幸福感方面的支持,同时应对隐私、偏见等风险。
Journal ref David C. Wyld et al. (Eds): CRYPIS, CBIoT, CAIML, NLCA, NC, WiMo, ICAIT, ICDIPV, ITCSE, 2025, pp. 271-289, 2025. CS & IT, CSCP 2025
Dep-Search: 基于持久记忆的学习依赖意识推理轨迹
机构 * Zhejiang University(浙江大学) ; Intel Corporation(英特尔公司) ; Tsinghua University(清华大学) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 Dep-Search 通过 GRPO 集成结构化推理、检索和持久记忆,提升 LLM 处理复杂多跳推理任务的能力。
Comments Dep-Search 1st version
说服令牌用于编辑大语言模型中的事实知识
机构 * Marburg University(马尔堡大学)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 本文提出说服令牌技术,通过训练特殊令牌实现高效的大语言模型事实知识编辑,无需依赖长演示,且在多个数据集和模型上表现优异。
Comments Accepted at EACL Main 2026
锯齿波前重排:增强的CuTile FlashAttention on NVIDIA GB10
机构 * University of Rochester(罗切斯特大学)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出锯齿波前重排技术,通过减少L2缓存缺失提升CuTile FlashAttention在NVIDIA GB10上的性能。
当锐化变成崩溃:可验证奖励强化学习中的采样偏差与语义耦合
机构 * School of Data Science\&Engineering, East China Normal University(数据科学与工程学院,东华大学)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 本文研究了可验证奖励强化学习中的采样偏差与语义耦合问题,提出逆成功优势校准和分布级校准方法以提升模型泛化能力。
不完美的学习者:在基于记忆的学生模拟中纳入发展轨迹
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出一种基于记忆的学生模拟框架,通过分层记忆机制和结构化知识表示,整合发展轨迹和元认知过程,以更准确地模拟学习者的知识发展和学习困难。
Comments Fixed some grammar and format issues. Added some experimental results
MemWeaver: 一种从文本交互行为构建的分层记忆用于个性化生成
机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 MemWeaver通过构建分层记忆模型,利用文本交互行为捕捉用户兴趣的时间演变和语义关系,实现深度个性化内容生成。
Comments Accepted by The Web Conference 2026 (WWW'26) 12 pages, 8 figures
基于句子嵌入的核变化点检测实现无监督文本分段
机构 * Department of Mathematics and Statistics, York University, Toronto, Canada(数学与统计学系,约克大学,多伦多,加拿大)
专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.LG
AI总结 基于句子嵌入的核变化点检测实现无监督文本分段,结合理论保证与实际效果,提升文本分割性能。
Comments arXiv admin note: substantial text overlap with arXiv:2510.03437. substantial text overlap with arXiv:2510.03437. substantial text overlap with arXiv:2510.03437. substantial text overlap with arXiv:2510.03437
理解检索增强生成中的参数化知识注入
机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) ; ICT, Chinese Academy of Sciences(中国科学院信息科技研究院) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL
AI总结 本文研究了参数化RAG中的知识注入,发现结合传统和参数化方法(PT-RAG)在性能上最佳,同时揭示了其在知识冲突和鲁棒性方面的优势。
从原子到社区:结构化和演化的代理记忆用于用户行为建模
专题命中 长上下文与记忆 :LLM(abstract)
AI总结 STEAM通过结构化和演化的代理记忆框架,提升用户行为建模的准确性与多样性。
超越数据隐私:大型语言模型的新隐私风险
机构 * Department of Computer Science, Purdue University(计算机科学系,普渡大学) ; Alibaba(阿里巴巴)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG
AI总结 本文探讨了大型语言模型在部署过程中出现的新隐私风险,并提出缓解策略以应对日益强大的LLMs带来的威胁。
Comments Published in the IEEE Data Engineering Bulletin: http://sites.computer.org/debull/A25dec/issue1.htm
知晓事实却选择捷径:理解大型语言模型如何比较实体
机构 * University of Hamburg(汉堡大学) ; Cardiff University(卡迪夫大学)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI
AI总结 研究发现大型语言模型在比较实体时更依赖数值知识,而小型模型则受启发式偏差影响,通过链式思考提示可引导模型更依赖数值特征。
Comments 34 pages, 20 figures. Accepted for EACL 2026
RotBench: 对多模态大语言模型识别图像旋转能力的评估
机构 * UNC Chapel Hill(北卡罗来纳大学夏洛特分校) ; Allen Institute for Artificial Intelligence(人工智能研究院) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI
AI总结 RotBench评估了多模态大语言模型在识别图像旋转角度方面的性能,发现大多数模型难以区分90°和270°旋转,但能识别0°和180°图像,揭示了模型空间推理能力与人类的差距。
Comments EACL 2026 Camera-Ready. Code and data: https://github.com/tianyiniu/RotBench
SeRL:基于有限数据的大型语言模型自我对抗强化学习
机构 * Zhejiang University(浙江大学) ; College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) ; Hangzhou City University(杭州城市大学) ; Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
AI总结 SeRL通过自我指令和自我奖励机制,在有限数据条件下提升大型语言模型的推理能力。
STaR:通过慢思考大语言模型实现有效的稳定表格推理
机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);SFT(abstract);分类 cs.AI
AI总结 STaR通过慢思考机制提升表格推理的有效性和稳定性,采用两阶段训练框架和不确定性量化技术,在领域内和领域外均取得优异表现。
RGFL:基于大语言模型的自动化程序修复中的推理引导故障定位
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
AI总结 RGFL通过引入分层推理模块和反事实分析,提升自动化程序修复中的文件和元素级故障定位精度,显著提高修复成功率。
Comments 23 pages, 5 figures