Tevatron Meets Megatron: Expert-Parallel LLM Reranker Training on an Academic Budget
特瓦特龙遇上巨神:学术预算下的专家并行大语言模型重排序器训练
专题命中 效率与部署 :LLM(title);分类 cs.LG
AI总结 该研究提出Tevatron 3.0,集成Megatron-Core后端实现专家并行,在学术预算下成功训练30B参数MoE重排序器,其性能优于稠密模型且推理吞吐量更高。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
特瓦特龙遇上巨神:学术预算下的专家并行大语言模型重排序器训练
专题命中 效率与部署 :LLM(title);分类 cs.LG
AI总结 该研究提出Tevatron 3.0,集成Megatron-Core后端实现专家并行,在学术预算下成功训练30B参数MoE重排序器,其性能优于稠密模型且推理吞吐量更高。
行为语法:通过微型语言模型先验和二阶时序分析检测自适应恶意软件
专题命中 效率与部署 :language model(title);分类 cs.AI
AI总结 本文提出Behavioral Grammar架构,用0.88M参数的TinyGPT学习主机行为语法,结合多模块提升检测能力,在AAA威胁下实现93%检测率,建立利于防御者的结构不对称性。
Comments 29 pages, 8 figures
谁会被提及:引用类型可预测基础语言模型的个体提及情况,而一份名册工具仅捕捉到其中的0.5%
专题命中 效率与部署 :language model(title);分类 cs.CL
AI总结 研究在买家选人的类别中,通过API调用研究语言模型提及个体情况,发现类别主导、模型有差异,引用类型可预测提及,引用量不能,还通过名册测量个体AI可见性,发现其只覆盖模型行为的一小部分且不具代表性。
Comments 28 pages, 5 figures. Data: https://doi.org/10.5281/zenodo.21612690
SIGMA: 通过自回归对比学习实现的结构不变生成分子对齐用于化学语言模型
机构 * School of Computing, University of Connecticut(康涅狄格大学计算学院) ; Institute for Artificial Intelligence, University of Georgia(佐治亚大学人工智能研究所) ; Institute of Hydrobiology, Chinese Academy of Sciences(中国科学院水生生物研究所)
专题命中 效率与部署 :language model(title);分类 cs.LG
AI总结 本文提出SIGMA方法,通过自回归对比学习解决分子序列生成中的结构不一致问题,提升生成效率与结构多样性。
Comments 9 pages, 2 figures, and 4 tables
RING:用于持续大规模知识注入的检索内化生成
机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室) ; University of Chinese Academy of Sciences(中国科学院大学) ; Xiaohongshu Inc.(小红书科技有限公司)
专题命中 效率与部署 :LLM(abstract);pretraining(abstract);分类 cs.CL、cs.AI
AI总结 RING是一种将检索内化的范式,通过三阶段训练学习参数化记忆的检索策略,在自主构建的News-2025基准上,其知识注入的准确性与效率优于或匹配现有方法。
Comments 16 pages
Slot2Text:面向高效且空间可追溯的手术多模态大语言模型的以对象为中心的视觉分词
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 Slot2Text将视觉输入转为槽潜变量,推出双模式手术MLLM,在多基准上实现高效推理,Slot2Text-Fast大幅降本,Slot2Text-Reason支持可追溯空间推理。
Comments 17 pages, 8 Figures
当重规划成为瓶颈:具身智能体的预算型重规划
专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 针对具身智能体重规划延迟超标的瓶颈问题,提出搭载E-RECAP渐进式token剪枝方法的BRACE控制器,通过预算控制循环减少token消耗、降低SLO违反率,在多平台任务中提升了重规划的实时性与成功率。
Comments 20 pages total: 9 pages main text, 3 pages references, and 8 pages appendix; 18 figures and 32 tables. Accepted at ICML 2026
用于公平强化学习的推理时策略对齐
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出乘法策略塑造框架,在不更新预训练RL策略参数的情况下,于推理时提升公平性,同时保留核心任务性能,适用于各类深度RL智能体。
Comments Accepted at the Reinforcement Learning Conference (RLC) 2026. 13 pages main + appendix, 5 figures, 6 tables
DiffusionGemma 技术报告
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本研究推出开放权重语言模型 DiffusionGemma,通过并行优化 256 个 token 块规避 AR 模型顺序解码瓶颈,经两阶段微调后实现 1500 token/秒生成速度,性能优于带推测解码的 AR 模型,还支持多模态等功能并为混合解码提供方向。
基于大型语言模型的神经环路功能推断
专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 该研究提出LLantia方法,结合连接组与文献,分层推断神经环路及细胞类型功能,以果蝇大脑为对象验证方法,为神经环路研究提供支撑。
Comments 26 pages, 7 figures
面向智能体强化学习的组内自蒸馏方法
机构 * Baidu(百度)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 该研究针对智能体强化学习中终端奖励监督粗粒度的问题,提出组内自蒸馏方法,利用策略自身已验证轨迹生成指导,细化回合级信用分配,在多环境多模型上性能优于基线且泛化性更好。
用于延迟和模型大小优化的大语言模型多目标结构化剪枝
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型在边缘计算环境部署的挑战,提出硬件感知多目标结构化剪枝框架,分两阶段优化,粗粒度移除模块,细粒度搜索最优剪枝率,实验证明能降低模型复杂度,在多方面实现良好权衡,适合边缘部署。
Comments Submitted to the ICTAI 2026 (under review)
GradientStabilizer:固定范数,而非梯度
机构 * Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系) ; Department of Mathematics and Computer Science, Eindhoven University of Technology(埃因霍温理工大学数学与计算机科学系) ; School of the Gifted Young, University of Science and Technology of China(中国科学技术大学天才青年学院) ; Department of Electrical and Computer Engineering, University of Texas at Austin(德克萨斯大学奥斯汀分校电气与计算机工程系) ; Department of Computer Science, University of Reading(阅读大学计算机科学系) ; School of Cyber Science and Technology, Sun Yat-sen University(中山大学网络科学与技术学院) ; Department of Computer Science, The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校计算机科学系) ; ELLIS Institute Tubingen(图宾根ELLIS研究所) ; Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; Tübingen AI Center, Tübingen, Germany(图宾根人工智能中心,德国图宾根) ; College of Computer Science, Chongqing University(重庆大学计算机学院)
专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 提出GradientStabilizer,一种轻量级梯度变换方法,通过统计稳定的梯度范数估计替换更新幅度,在不改变梯度方向的前提下抑制极端梯度尖峰,从而提升训练稳定性并减少发散。
Comments Accepted By ICML2026
蒸馏RGB可恢复的内容:面向仅RGB视觉-语言模型的特权3D证据
专题命中 效率与部署 :language model(title)
AI总结 本研究提出特权3D证据蒸馏框架,将训练时的3D证据转化为仅RGB视觉-语言模型的空间推理能力,使仅RGB学生模型在11项指标上均优于基线,验证了该方法的有效性。
WorldMirror:基于任意先验提示的通用三维世界重建
机构 * Zhejiang University(浙江大学) ; Chinese University of Hong Kong(香港中文大学) ; Tencent Hunyuan(腾讯混元)
专题命中 效率与部署 :prompting(title)
AI总结 本研究提出WorldMirror这一统一前馈模型,可整合多种几何先验并生成多种三维表示,在多类三维几何任务的基准测试中达到最优性能且推理效率高。
Comments Accepted to ICML 2026. Code: https://github.com/Tencent-Hunyuan/HunyuanWorld-Mirror Project page: https://3d-models.hunyuan.tencent.com/world/
MedSAM2-Anatomy:面向肌肉骨骼分割的无训练推理时优化方法
专题命中 效率与部署 :foundation model(abstract);prompting(abstract);分类 cs.LG
AI总结 MedSAM2-Anatomy是一种无训练的推理时优化框架,通过融合专家模型生成的自动解剖提示,提升冻结分割模型的髋部、肩部肌肉骨骼分割性能,无需人工提示或模型重训。
Comments Original research manuscript (13 pages, 4 figures, 2 tables). No prior publication
从链到树:用于半自回归投机解码的父条件生成方案
机构 * OPPO AI Center(OPPO人工智能中心)
专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL
AI总结 该研究针对半自回归生成器DSpark的线性生成缺陷,提出父条件生成树(PCTree),通过为每个父节点生成多分支候选序列分配验证预算,在Qwen3系列模型及9个基准上显著提升了投机解码的推理加速效果。
ET-Prune:面向文本丰富型多模态大语言模型的视觉 token 剪枝的证据感知动态预算分配
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 ET-Prune 是一种无需训练的视觉 token 剪枝框架,通过证据分配实现动态预算,在文本丰富的多模态任务中,于约一半 token 保留量下,在 OCRBench-v2、MMBench v1.1 等基准上取得优于基线的性能,实现了质量与成本的良好平衡。
Comments Code and supplementary material is at https://github.com/Labyrinth0419/ET-Prune
基于部分依赖图的高效上下文检索用于仓库级代码生成
专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 该研究针对仓库级代码生成中RAG方法的不足,提出基于部分依赖图的DyRetriever,构建DyCoder并在CoderEval、DevEval上取得显著性能提升且效率更高。
Comments Accepted by ASE 2026
PCSD:智能体强化学习中自蒸馏的持久一致性
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究针对智能体强化学习中奖励稀疏问题,提出PCSD方法,通过持久一致性推导蒸馏权重,结合GRPO优化,在ALFWorld等基准上取得优于GRPO、SDAR的性能。
重新思考基于全局码本的视频令牌压缩:一次学习,处处压缩
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究提出即插即用框架ONCE,通过离线学习全局码本实现视频令牌的高效压缩,在保持性能的同时降低推理延迟,提升了视频大语言模型的效率与通用性。
FinHardBench:大语言模型能否生成面向金融计算的延迟感知硬件?
机构 * Lehigh University(里海大学) ; University of California, San Diego(加利福尼亚大学圣迭戈分校) ; NYU Tandon School of Engineering(纽约大学坦登工程学院) ; NYU Abu Dhabi(纽约大学阿布扎比分校)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文提出面向金融FPGA设计的开源基准FinHardBench,通过三类实验评估6种大语言模型,发现其在功能正确性、系统级配置优化等方面存在差异,策略级规格变更问题仍待解决。
Comments 16 pages (10 pages main text). Published as a conference paper at COLM 2026. Code and benchmark: https://github.com/owenfucell/FinHardBench
AOSpec:用于低延迟智能体服务的动作与观测协同推测
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 AOSpec是一种动作与观测协同推测的无损框架,通过EVD和JASV技术降低智能体服务延迟,在Terminal-Bench上较基线实现显著延迟缩减,且观测模型可跨基准迁移。
CURE:面向块并行推测解码的局部不确定性修复
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对并行推测解码的长序列精度下降问题,提出预算感知动态修复树CURE,通过定位高不确定性token修复错误,在多个基准上提升平均接受长度并实现2.66-3.49倍端到端速度提升。
Comments 9 pages, 2 figures, 5 tables
Motif-Mamba:融合网络基序改进Mamba的长程序列建模模型
机构 * Center for Excellence in Brain Science and Intelligence Technology, Chinese Academy of Sciences(中国科学院脑科学与智能技术卓越创新中心)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究提出融合网络基序的结构化状态空间模型Motif-Mamba,改进Mamba的对角状态转移限制,在长序列建模任务上性能优于原Mamba,为长程序列建模提供有效结构先验。
Comments 9 pages of main text, 8 pages of appendix, 6 figures. Submitted to NeurIPS 2026
本地部署大语言模型(LLMs)的能效:消费级硬件上的初步GPU功耗定量基准测试
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文针对9款1B至7B参数的开源LLMs,在RTX 4060Ti 16GB GPU上开展能效基准测试,发现模型架构、量化策略等影响能效,gemma3:1b等模型能效最优,7B-Mistral能效最差,还需区分令牌生成模式。
通过检索增强的可靠性感知推理缓解多模态系统中的视觉幻觉
机构 * University of Massachusetts, Dartmouth(马萨诸塞大学达特茅斯分校)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出一种检索增强的可靠性感知推理框架,利用外部视觉证据库和多个可靠性指标进行决策门控,在不重训练模型的情况下减少视觉幻觉,将接受预测准确率从85.84%提升至88.88%。
Comments 29 pages, 9 figures
没有电子的证书?AI驱动电力需求影响的理论与证据
机构 * Department of Economics, Stony Brook University(石溪大学经济系) ; Department of Computer Science, Stony Brook University(石溪大学计算机科学系)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 通过博弈论模型和自然实验,研究AI数据中心使用可再生能源证书和购电协议对电网可靠性、电价和排放的影响,发现证书无法解决时序错配问题,而共置储能可有效缓解。
HypEHR:基于超几何建模的电子健康记录用于高效问答
机构 * Department of Computer Science, Stony Brook University(石英布大学计算机科学系) ; Department of Data Science, New Jersey Institute of Technology(新泽西理工学院数据科学系) ; Department of Biomedical Informatics, Stony Brook University(石英布大学生物医学信息学系)
专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 HypEHR通过超几何建模将电子健康记录中的代码、就诊和问题嵌入超几何空间,利用几何一致的交叉注意力和类型特定的指针头进行问答,预训练后在两个基准上实现高效问答。
Comments Accepted by Findings of ACL 2026
在权限中迷失:探索Microsoft 365应用生态系统
专题命中 效率与部署 :LLM(abstract,abstract_cn)
AI总结 本文对Microsoft 365应用生态系统开展隐私安全测量,爬取8000余个应用,发现权限披露不一致、过度特权访问普遍,提出的主题感知异常检测框架可识别异常应用,为管理员提供安全见解。