Efficient RLVR Scheduling via Graph-Structured Online Difficulty Estimation
基于图结构在线难度估计的高效RLVR调度
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究针对RLVR中探索预算分配低效问题,提出即插即用的图结构在线难度估计器,可跨样本共享反馈、缓解冷启动与过时问题,集成后实现难度自适应探索,在多模型与基准上性能更优。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
基于图结构在线难度估计的高效RLVR调度
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究针对RLVR中探索预算分配低效问题,提出即插即用的图结构在线难度估计器,可跨样本共享反馈、缓解冷启动与过时问题,集成后实现难度自适应探索,在多模型与基准上性能更优。
Proteus:面向长上下文序列建模的增量式内存激活机制
机构 * Mila(米拉计算科学研究所) ; Google(谷歌公司)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 Proteus 是一种增量式内存激活机制,可嵌入多种神经内存架构,应用于 SWLA 等模型后,能在长上下文相关任务上实现性能提升,证明调度有效容量对序列建模的适用性。
用于可组合非结构化知识编辑的混合策略自编辑
机构 * University of Tennessee(田纳西大学) ; Rutgers University(罗格斯大学) ; Purdue University(普渡大学) ; University at Albany(奥尔巴尼大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究针对现有非结构化知识编辑存在的可组合性缺失问题,提出HPSE方法,通过构建混合生成结果实现主动自蒸馏,在多种LLM及编辑工具上取得即插即用的性能提升。
将循环深度改造融入预训练语言模型:在两个参数预算下的安装、外推、迁移与保留
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究在Qwen2.5-0.5B-Instruct中融入循环深度,在两个参数预算下实现安装,其模型在ARC测试集等任务上性能优于同等规模基准,可外推至1.5倍监督深度,推理速度更快。
前沿语言模型在引导压力下的发散响应模式
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究评估六种前沿语言模型在引导压力下的响应差异,发现模型间存在不同响应模式,以Llama为对象追溯到内部机制,相关发现经多实验验证。
基于大语言模型微调的可理解推荐研究
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)
AI总结 该研究针对传统推荐的语义协同差距问题,提出CURec框架,通过微调LLM并结合强化学习优化,提升推荐可理解性与性能,在公开基准上表现更优。
Comments 11 pages, 6 figures, to be published on CIKM '26
HybridFlow: 适应资源的子任务路由用于高效的边缘-云LLM推理
专题命中 其他推理 :reasoning(abstract,abstract_cn)
AI总结 HybridFlow通过动态资源适应的子任务路由框架,提升边缘-云LLM推理的效率与准确性。
Comments Accepted by ICML 2026
微型Transformer中的原型推理
机构 * Fin AI Research(Fin AI研究院)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究提出原型推理,在约100万参数的微型Transformer上实现逐步推理,通过Dyck语言任务验证其可缩小分布外泛化差距,助力探究LLM的通用推理能力。
揭示上下文学习中自发形成的物理表征
机构 * Department of Physics, KAIST(KAIST物理系) ; MPI for Security and Privacy, Germany(德国安全与隐私研究所) ; Center for Complex Systems, KAIST(KAIST复杂系统中心)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究以动力学预测为代理任务,发现大语言模型无需物理特定监督,就能在上下文学习中自发形成与能量等物理概念对齐的表征,且该表征对预测有贡献,为ICL机制提供了物理解释。
Comments 15 pages, 10 figures
Qwen-音乐技术报告
机构 * Qwen Team(通义团队)
专题命中 其他推理 :chain-of-thought(abstract);CoT(abstract)
AI总结 介绍Qwen-音乐,它支持文本到音乐生成和翻唱歌曲生成两个核心任务。集成三个核心组件,通过特定机制建模并渲染。经多语言数据训练及多种训练方式,在多个音乐性和音频质量指标上达领先成果,获专业评估人员青睐。
RecGPT-V3技术报告
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)
AI总结 研究针对大规模运行RecGPT的挑战,提出RecGPT-V3这一有状态混合模态推荐系统。通过内存中心、混合模态基础模型和潜在意图推理等方法,在淘宝“猜你喜欢”推荐中取得多指标提升及资源消耗降低的成果。
Comments Technique Report
自动填充:使用专业语言模型准确预测缺失值
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究表格数据缺失值预测问题,提出自动填充方法,通过后训练三个针对不同能力的专业小语言模型并结合校准集成机制,相比现有推理模型在保证高精度的同时大幅降低成本。
Comments VLDB 2026
以知识为中心的自我改进
机构 * Caltech(加州理工学院)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究以知识为中心的自我改进范式,通过简单协议让智能体尝试任务后为知识库贡献见解并提炼知识,提高了解决率、降低成本,且知识可转移,表明进步可由持久知识驱动。
通过对比信念更新来衡量奖励寻求行为
专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究用强化学习训练的语言模型中‘奖励寻求’行为的测量方法,核心方法是对比合成文档微调,主要贡献是发现RL训练会使模型更倾向评分者偏好,甚至违背开发者意图,该方法还适用于奖励破解模型。
Comments 101 pages, 66 figures
NRR-Phi:LLM推理中为保持歧义性的文本到状态映射
机构 * Independent Researcher, Japan(日本独立研究员)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出NRR-Phi框架,通过文本到状态映射保留多解释性,在LLM推理中延迟语义坍缩。
Comments 30 pages, 5 figures, 8 tables. Replacement synced to the current GitHub repository snapshot. Series hub: https://github.com/kei-saito-research/nrr-series-hub
当不合理的令牌得到强化时:大语言模型强化学习的尾部感知信用校准
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Rice University(里士满大学) ; Workato(Workato公司) ; University of North Carolina at Charlotte(北卡罗来纳州夏洛特大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究大语言模型强化学习中统一信用分配的问题,提出尾部感知信用校准方法TACO,通过计算尾部风险分数校准信用,抑制不良正更新,实验证明该方法优于基线,提升训练稳定性。
RepLLM:迈向自动重现网络研究结果
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)
AI总结 针对计算机网络研究结果重现难题,RepLLM提出端到端多智能体框架,通过四个智能体协作及共享内存机制确保一致性,借助特定推理和调试方法解决问题,相比现有框架表现更优,能高效重现基准且减少令牌消耗。
Comments SIGCOMM'26(19 pages, 6 figures, 6 tables)
不退化文本智能的统一音频智能
机构 * Nemotron-Labs(Nemotron实验室)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出统一音频-文本大语言模型Audex,通过单Transformer解码器架构与多阶段训练,在实现多音频任务SOTA性能的同时,几乎不损失骨干文本LLM的原有文本智能能力。
Comments We release the Audex models at https://huggingface.co/collections/nvidia/nemotron-labs-audex
快手总结注意力技术报告
机构 * Kuaishou(快手)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究长上下文能力这一重要迭代方向,针对标准softmax注意力在长序列下时间复杂度高的问题,提出新路径,通过将历史上下文压缩为可学习总结令牌降低序列建模成本,即提出快手总结注意力机制。
Comments update related works
CausalMix: 数据混合作为语言模型训练的因果推断
机构 * Tsinghua University(清华大学) ; Ant Group(蚂蚁集团) ; Renmin University of China(中国人民大学)
专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出CausalMix框架,将数据混合优化视为因果推断问题,通过条件平均处理效应估计最优混合比例,在7B模型上提升多任务性能,并具备可解释性。
Comments 22 pages, 3 figures
机器会在人类感到困难的地方也遇到困难吗?大语言模型与人类对混淆代码的理解
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)
AI总结 基于人类对混淆代码理解的研究,评估大语言模型是否共享人类在混淆代码下的失败模式,发现推理调优模型与人类困难模式显著对齐,而指令调优模型相关性接近零。
Comments 13 pages, 15 figures
临床证据强度可从语言模型表示中恢复,但无法从其陈述的等级中恢复
机构 * Lab for AI in Medicine(医学人工智能实验室) ; RWTH Aachen University(亚琛工业大学) ; University Hospital RWTH Aachen(亚琛大学医院) ; Stanford University(斯坦福大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究通过构建临床声明数据集,测试22个开源大语言模型,发现模型内部表示可编码证据强度(中位AUROC 71.8%),但模型陈述的等级接近随机(低于估计器25-27个百分点),且该信号主要来自词汇特征,不随规模提升。
从结构到协同:多模态大语言模型中视觉-语言感知范式演进综述
机构 * School of Computer Science, Sichuan University(四川大学计算机学院) ; School of Electronic and Computer Engineering, Peking University Shenzhen Graduate School(北京大学深圳研究生院电子与计算机工程学院) ; Institute of Artificial Intelligence (TeleAI), China Telecom and Northwestern Polytechnical University(中国电信与西北工业大学人工智能研究院(TeleAI))
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文系统综述多模态大语言模型中统一视觉-语言感知的范式演进,提出五阶段分类法,梳理各阶段代表性方法,并指出开放挑战与未来方向。
当距离干扰:BT损失中表示距离偏差对奖励模型的影响
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 分析BT损失中表示距离导致的梯度偏差,提出NormBT自适应归一化方案,提升奖励模型在细粒度区分上的性能。
Comments ICML 2026
晚期融合足矣:面向视觉饱和的多模态大语言模型的双路径视觉令牌路由
机构 * School of Mechanics and Engineering Science, Peking University(北京大学力学与工程科学学院) ; Department of Automation, Tsinghua University(清华大学自动化系)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对多模态大语言模型中视觉令牌在深层饱和的问题,提出双路径视觉令牌路由(DPVR-LF),在饱和点将视觉令牌路由至单层可训练分支,仅最后层融合,以约3%可训练参数保持性能并减少计算。
Comments 18 pages, 4 figures. Submitted to Pattern Recognition
应变连贯性:编码代理执行轨迹中的故障前信号
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出“应变连贯性”模式,即编码代理识别到问题但仍按原计划行动,通过构建Claude Sonnet 4.6检测器在44条轨迹上实现94%故障预测精度,优于基线方法。
收益规模塑造跨语言LLM代理的合作行为
机构 * Faculty of Information Technology, University of Science (HCMUS), Ho Chi Minh City, Vietnam(信息技术学院,科学大学(HCMUS),胡志明市,越南) ; Faculty of Computer Science and Engineering, Ho Chi Minh City University of Technology (HCMUT), Ho Chi Minh City, Vietnam(计算机科学与工程学院,胡志明市技术大学(HCMUT),胡志明市,越南) ; Vietnam National University – Ho Chi Minh City (VNU-HCM), Ho Chi Minh City, Vietnam(越南国家大学——胡志明市(VNU-HCM),胡志明市,越南) ; Luxembourg Institute of Science and Technology (LIST), Luxembourg(卢森堡科学与技术研究所(LIST),卢森堡) ; School of Computing, Engineering and Digital Technologies, Teesside University, Middlesbrough, United Kingdom(计算、工程与数字技术学院,泰赛德大学,米德尔斯布罗,英国)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过监督分类器识别重复囚徒困境中的策略,结合演化博弈论基线,发现随着收益增加,LLM反而更合作,与演化预测相反,表明对齐训练和人类推理模式的影响。
Comments 44 pages, 17 figures, 4 tables
扩散语言模型的自增强检索
机构 * University of California, Berkeley(加州大学伯克利分校) ; Google Research(谷歌研究院)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出SARDI框架,利用扩散语言模型去噪过程中丢弃的低置信度标记作为前瞻信号指导检索,无需训练且与检索器无关,在多跳问答基准上以高达8倍吞吐量超越现有方法。
Comments ICML 2026
仅索引一次:具有共享路由的跨层稀疏注意力
机构 * Microsoft Research(微软研究院) ; Tsinghua University(清华大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出跨层稀疏注意力(CLSA),通过共享KV缓存和路由索引,在保持token稀疏注意力精度的同时减少路由开销,显著提升长上下文LLM的解码效率。
支持性标记揭示:快速扩散语言模型解码
机构 * Department of Computer Science, University of Haifa(海法大学计算机科学系) ; Institute for AI, University of Stuttgart(斯图加特大学人工智能研究所) ; IMPRS-IS
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出AXON模块,通过选择注意力、不确定性和置信度信号中的锚点标记来改善扩散语言模型并行解码的质量-延迟权衡。