RecGPT-V3 Technical Report
RecGPT-V3技术报告
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)
AI总结 研究针对大规模运行RecGPT的挑战,提出RecGPT-V3这一有状态混合模态推荐系统。通过内存中心、混合模态基础模型和潜在意图推理等方法,在淘宝“猜你喜欢”推荐中取得多指标提升及资源消耗降低的成果。
Comments Technique Report
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
RecGPT-V3技术报告
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)
AI总结 研究针对大规模运行RecGPT的挑战,提出RecGPT-V3这一有状态混合模态推荐系统。通过内存中心、混合模态基础模型和潜在意图推理等方法,在淘宝“猜你喜欢”推荐中取得多指标提升及资源消耗降低的成果。
Comments Technique Report
RepLLM:迈向自动重现网络研究结果
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)
AI总结 针对计算机网络研究结果重现难题,RepLLM提出端到端多智能体框架,通过四个智能体协作及共享内存机制确保一致性,借助特定推理和调试方法解决问题,相比现有框架表现更优,能高效重现基准且减少令牌消耗。
Comments SIGCOMM'26(19 pages, 6 figures, 6 tables)
快手总结注意力技术报告
机构 * Kuaishou(快手)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究长上下文能力这一重要迭代方向,针对标准softmax注意力在长序列下时间复杂度高的问题,提出新路径,通过将历史上下文压缩为可学习总结令牌降低序列建模成本,即提出快手总结注意力机制。
Comments update related works
当距离干扰:BT损失中表示距离偏差对奖励模型的影响
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 分析BT损失中表示距离导致的梯度偏差,提出NormBT自适应归一化方案,提升奖励模型在细粒度区分上的性能。
Comments ICML 2026
收益规模塑造跨语言LLM代理的合作行为
机构 * Faculty of Information Technology, University of Science (HCMUS), Ho Chi Minh City, Vietnam(信息技术学院,科学大学(HCMUS),胡志明市,越南) ; Faculty of Computer Science and Engineering, Ho Chi Minh City University of Technology (HCMUT), Ho Chi Minh City, Vietnam(计算机科学与工程学院,胡志明市技术大学(HCMUT),胡志明市,越南) ; Vietnam National University – Ho Chi Minh City (VNU-HCM), Ho Chi Minh City, Vietnam(越南国家大学——胡志明市(VNU-HCM),胡志明市,越南) ; Luxembourg Institute of Science and Technology (LIST), Luxembourg(卢森堡科学与技术研究所(LIST),卢森堡) ; School of Computing, Engineering and Digital Technologies, Teesside University, Middlesbrough, United Kingdom(计算、工程与数字技术学院,泰赛德大学,米德尔斯布罗,英国)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过监督分类器识别重复囚徒困境中的策略,结合演化博弈论基线,发现随着收益增加,LLM反而更合作,与演化预测相反,表明对齐训练和人类推理模式的影响。
Comments 44 pages, 17 figures, 4 tables
当推理模型损害行为模拟:多智能体大语言模型谈判中的求解器-采样器不匹配
专题命中 其他推理 :reasoning(abstract,comments);分类 cs.AI、cs.LG
AI总结 研究指出推理增强模型在模拟行为时可能表现不佳,通过三个多智能体谈判环境实验发现,有界推理能产生更多样且妥协导向的轨迹,强调模拟应将模型视为采样器而非求解器。
Comments 20 pages, 2 figures. Substantially revised. Formerly titled "When Reasoning Models Hurt Behavioral Simulation: A Solver-Sampler Mismatch in Multi-Agent LLM Negotiation"
月球地质学的可验证机器解释
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本研究将地质知识推理方法嵌入多模态视觉-语言架构,构建可验证的月球地质学机器解释模型,结合开卷检索解决数值年龄定年依赖记忆先验的问题,明确自动地质推理的必要架构。
迈向轻量级可靠性:使用软提示缓解大型语言模型中的幻觉
机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) ; National Institute of Standards and Technology(国家标准与技术研究院)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 提出一种参数高效的软提示方法RCSP,通过对比学习、课程学习和KL正则化平衡事实回忆、幻觉抑制和弃权,在多个QA数据集上优于基线。
Comments 20 pages, 5 tables, 2 figures. Accepted for publication in DBSec 2026
上游决策,下游生成:定位与定价多语言MoE模型的跨语言拒绝回路
机构 * Gödel Machines(哥德尔机器) ; IIT Madras(印度马德拉斯理工学院)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对多语言MoE模型的跨语言拒绝不均衡问题,在sarvam模型中定位到由注意力对抗者约束的混合专家生成器回路,揭示其机制并量化了安全修复的成本。
Comments Accepted to the actionable Interpretability workshop at COLM 2026
AI聊天机器人中的广告:大型语言模型如何应对利益冲突分析
机构 * Princeton University(普林斯顿大学) ; University of Washington(华盛顿大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文分析了大型语言模型在面临用户与公司利益冲突时的决策问题,通过实验发现多数模型优先考虑公司利益而非用户福祉,展示了在广告推荐中潜在的风险。
Comments COLM 2026
大型语言模型在规则应用中展现出概念掌握能力的证据
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文通过两项心理学实验发现,Gemini Pro等部分LLMs在规则应用上展现类人表现,证实LLMs掌握规则概念,对法律决策与哲学探究有启示。
LlamaRec-LKG-RAG:一种用于基于大语言模型的排序的单遍可学习知识图谱-RAG框架
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出LlamaRec-LKG-RAG框架,将个性化知识图谱上下文集成到LLM推荐排序中,经ML-100K等数据集实验,在MRR等指标上较LlamaRec取得提升,为知识感知个性化推荐奠定基础。
宪法性在策略安全蒸馏
机构 * Institute of Trustworthy Embodied AI(可信具身人工智能研究院) ; Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Ant Group(蚂蚁集团) ; Zhejiang University(浙江大学) ; City University of Hong Kong(香港城市大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 针对在策略自蒸馏在安全对齐中因宪法条件导致教师分布收缩、表达能力下降的问题,提出宪法性在策略安全蒸馏(COPSD),通过交叉SFT冷启动校准教师分布,再进行宪法条件在策略蒸馏,在12个基准上实现了更优的安全-有用性权衡并降低安全税。
类人工作记忆干扰在大语言模型中
机构 * School of Psychological and Brain Sciences, Georgia Tech(佐治亚理工学院心理与脑科学学院) ; Department of Psychology, New York University(纽约大学心理学系) ; Department of Cognitive Science, Indiana University Bloomington(印第安纳大学布卢明顿分校认知科学系) ; Honda Research Institute(本田研究所) ; Center of Excellence for Computational Cognition, Georgia Tech(佐治亚理工学院计算认知卓越中心) ; Departments of Neuroscience and Psychology, The University of Texas at Austin(德克萨斯大学奥斯汀分校神经科学和心理学系)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究发现大语言模型在工作记忆任务中存在干扰限制,其表现与人类相似,且通过抑制无关信息实现有效记忆检索。
Comments Published as a conference paper at COLM 2026
Unicode文本水印方法对抗大语言模型的安全性与可检测性分析
机构 * Fraunhofer ISST(弗劳恩霍夫研究所)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文分析了Unicode文本水印方法在大语言模型下的安全性和可检测性,发现最新模型能检测水印但无法提取。
Comments Author's version of a paper, accepted and presented at the ICISSP 2026 conference
大语言模型中的社会意义:结构、规模与语用提示
机构 * Leibniz-Centre General Linguistics, Berlin, Germany(莱布尼茨普通语言学中心,柏林,德国)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文研究大语言模型在社会意义上的表现,提出两种校准指标并探讨语用理论指导的提示策略对模型校准的影响,发现提示策略能有效减少模型在规模校准上的偏差。
Journal ref Proceedings of the 15th Workshop on Cognitive Modeling and Computational Linguistics (CMCL) @ LREC 2026, pages 162-171
利用大语言模型进行预测:通过特征引导改进泛化能力
机构 * University of Chicago(芝加哥大学) ; University of Chicago, Illinois, United States(芝加哥大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文利用稀疏自编码器分析LLM内部状态,识别时间感知和前瞻偏差特征,并通过增强时间感知特征减少预测中的前瞻偏差,提升泛化能力。
大型语言模型是否受益于自身话语?
机构 * Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology(麻省理工学院电子工程与计算机科学系) ; MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) ; IBM Research(IBM研究院)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究发现,省略大型语言模型自身历史上下文可提高响应质量并减少内存消耗。
通过溯源分析保护LLM智能体免受失调影响
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出基于溯源分析的ProvenanceGuard框架,通过多阶段流水线检测工具调用前的三种失调类型,在Agent-SafetyBench和WorkBench上显著降低失调错误率并减少不必要的干预。
通过局部化架构增强AI可解释性与安全性
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 针对大型生成式AI模型可解释性差、计算成本高的问题,提出局部化机器学习架构,通过降低带宽、提高节点表达能力来提升可解释性和效率,并评估了多种硬件实现方案的适用性。
不只是RLHF:为何仅对齐不足以解决多智能体趋同
机构 * California Institute of Technology(加州理工学院) ; Evergreen Valley College(艾弗绿谷学院)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文研究了多智能体系统在模拟同伴分歧下的错误率问题,发现预训练基础模型与指令模型存在相似的替换模式,且错误率较高。通过激活修补发现错误集中在中间层,修复后可恢复大部分正确率差距。研究还指出压力抑制了清洁推理特征,而非激活新的趋同回路。
Routesplain:面向软件相关任务的可信赖且可干预的路由方法
机构 * Columbia University(哥伦比亚大学) ; Oracle AI
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 Routesplain是首个面向软件相关任务的LLM路由工具,通过提取可解释概念路由,在8项软件任务上的16种LLM中,其性能优于单个模型且不逊于黑盒基线,可提升响应质量并降低成本。
Comments Accepted to COLM 2026
ToolUniverse:一个让AI科学家开发民主化的开放平台
机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) ; Harvard College, Harvard University(哈佛大学哈佛学院) ; Massachusetts Institute of Technology(麻省理工学院) ; MIT Lincoln Laboratory(MIT林肯实验室) ; Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究学院) ; Broad Institute of MIT and Harvard(MIT与哈佛联合广谱研究所) ; Harvard Data Science Initiative(哈佛数据科学计划)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 ToolUniverse是支持从各类模型构建AI科学家的开放平台,通过AI-工具交互标准规范工具调用,已应用于大量科学工具,案例中可完成多领域端到端分析。
Comments https://aiscientist.tools
Transformer电路可实现聚类算法
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究表明Transformer电路可实现Lloyd算法等精确聚类算法,提出的k均值Transformer聚类算法泛化性强且质量优于Lloyd算法,改动后可衍生多种新型聚类算法。
通过意图意识提升带有属性的长形式问答
机构 * Allen Institute for AI(艾伦人工智能研究所) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Washington(华盛顿大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出通过增强模型意图意识来提升长报告生成质量,通过结构化标签方案提取隐含意图,改进零样本生成能力并生成高质量合成数据,实验显示在科学报告生成任务中模型性能平均提升2.9和12.3个百分点。
Comments 39 pages, 7 figures
Journal ref ICLR 2026
SFT冲突,RL共存:大语言模型多任务学习的理论与实证分析
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 该研究针对大语言模型多任务学习,通过理论与实证分析揭示SFT存在任务冲突而RL可稳定共存的机制,进而提出Parallel-RL范式以解耦多任务训练,提升效率与灵活性。
Comments Code: https://github.com/GaryStack/Parallel-RL
面向INT2 KV缓存量化的输出感知旋转
机构 * University of Southern California(南加州大学) ; Seoul National University(首尔大学) ; Inha University(仁荷大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 针对长上下文大模型KV缓存的INT2量化瓶颈,提出OptR输出感知旋转方法,通过分解误差、学习正交修正等,提升QuaRot等性能并增强长上下文检索能力,且开销可忽略。
Metis:记忆基础模型
机构 * MemTensor (Shanghai) Technology Co., Ltd.(墨芯(上海)科技有限公司) ; Renmin University of China(中国人民大学) ; National University of Singapore(新加坡国立大学) ; Shanghai Jiao Tong University(上海交通大学) ; Tongji University(同济大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 该研究提出首个记忆基础模型原型Metis,赋予基础模型原生记忆能力,通过新架构与优化目标实现,经实验验证其具备原生记忆能力并发布相关资源。
Comments 46 pages, 11 figures, 16 tables
使用大型语言模型进行创新中的创意生成
专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 该研究对比人类与GPT-4生成的大学生适用低价新产品创意,发现AI生成创意平均购买意向更高、跻身前10%的概率是人类的7倍,但新颖性较低,少样本提示效果略优于零样本。
LongCrafter:通过证据图引导的指令合成实现多样化的长上下文理解
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所认知与决策智能复杂系统重点实验室)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 针对现有长上下文理解方法的局限,提出LongCrafter框架,结合分层任务分类法与证据管道,生成多样化长上下文SFT数据,微调后的模型在多个数据集上表现优异,能有效缓解“中间迷失”问题。