ABOPD: Antibody CDR Design via On-Policy Distillation
ABOPD:通过策略蒸馏进行抗体CDR设计
专题命中 效率与部署 :post-training(abstract);分类 cs.AI、cs.LG
AI总结 研究针对抗体CDR设计,提出基于策略蒸馏的ABOPD框架,利用天然几何结构监督模型去噪轨迹,提升了RAbD CDR-H3生成的结构恢复,降低均方根偏差,优于其他控制方法,为高保真蛋白质设计开辟道路。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
ABOPD:通过策略蒸馏进行抗体CDR设计
专题命中 效率与部署 :post-training(abstract);分类 cs.AI、cs.LG
AI总结 研究针对抗体CDR设计,提出基于策略蒸馏的ABOPD框架,利用天然几何结构监督模型去噪轨迹,提升了RAbD CDR-H3生成的结构恢复,降低均方根偏差,优于其他控制方法,为高保真蛋白质设计开辟道路。
TurboVec:通过码本无关量化实现企业RAG成本高效私有检索的案例研究
专题命中 效率与部署 :LLM(abstract);分类 cs.AI、cs.LG
AI总结 研究RAG系统向量检索层挑战,介绍基于TurboQuant的TurboVec开源向量索引。通过实验对比,表明TurboQuant在内存和召回率上有优势,TurboVec部署效果好,码本无关设计提升隐私性,不过存在单一数据集评估等局限。
多智能体系统何时发挥作用?信息瓶颈视角
机构 * Texas A&M University(德克萨斯A&M大学) ; Brookhaven National Laboratory(布鲁克海文国家实验室)
专题命中 效率与部署 :LLM(abstract);分类 cs.AI、cs.LG
AI总结 研究从信息瓶颈视角探讨多智能体系统(MAS)与单智能体系统(SAS)差异,指出MAS优势在有限中继时因压缩权衡产生,由参数β控制,通过实验验证,解释了有限智能体间通信何时有利有害。
STEC:开放域多跳问答中深度搜索的证据压缩
机构 * National University of Defense Technology(国防科技大学) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
专题命中 效率与部署 :LLM(abstract);分类 cs.CL、cs.AI
AI总结 研究开放域多跳问答中最终答案选择难题,提出STEC证据压缩框架从候选集选答案。通过答案级证据压缩和证据引导的答案验证机制,将选择从原始轨迹比较转为候选级证据比较,实验显示其性能最佳。
用于人工智能原生6G的联合嵌入预测架构:预测表示与开放挑战
机构 * IDCoM, University of Edinburgh(爱丁堡大学IDCoM研究所) ; KTH Royal Institute of Technology(瑞典皇家理工学院) ; SnT, University of Luxembourg(卢森堡大学SnT) ; Department of Electronic Systems, Aalborg University(奥尔堡大学电子系统系) ; School of Computer Science and Informatics, University of Liverpool(利物浦大学计算机科学与信息学院) ; Division of Electronics and Electrical Engineering, Dongguk University(东国大学电子与电气工程系) ; School of Engineering and Physical Sciences, Heriot-Watt University(赫瑞瓦特大学工程与物理科学学院) ; Department of Electrical Engineering, Chalmers University of Technology(查尔姆斯理工大学电气工程系) ; Department of Electrical and Computer Engineering, San Diego State University(圣地亚哥州立大学电气与计算机工程系)
专题命中 效率与部署 :pretraining(abstract);分类 cs.AI、cs.LG
AI总结 本文围绕用于6G智能的联合嵌入预测架构(JEPA)展开。介绍其训练机制等,通过波束管理案例说明能提升标签效率与鲁棒性,还指出在多时间尺度预测等方面存在开放挑战。
Comments 14 pages, 4 figures, 3 tables. Tutorial and review on Joint-Embedding Predictive Architecture (JEPA) for AI-native 6G. Submitted to IEEE Communications Magazine
马赫思维-4-闪技术报告
机构 * Li Auto Inc(理想汽车公司)
专题命中 效率与部署 :post-training(abstract);分类 cs.CL、cs.LG
AI总结 马赫思维-4-闪是含3B激活参数的35B参数专家混合智能体模型,通过训练后优化及可扩展交互环境提升性能。其流程含三个阶段,在多个基准测试中成绩优异,以低推理成本领先或匹配数倍激活规模模型。
分布转移下可靠长时代理上下文演化的范围验证
机构 * RedMind Research(红芯研究公司) ; National Taiwan University(国立台湾大学)
专题命中 效率与部署 :LLM(abstract);分类 cs.CL、cs.AI
AI总结 研究长时代理上下文演化在分布转移下的验证问题,提出图正则化代理上下文演化方法(GRACE),通过维护指令为类型化语义图并在局部验证更新,实验表明该方法显著提升了严格可靠性。
Comments 18 pages, 3 figs
Jet-Long:使用动态双焦点旋转位置编码的高效长上下文扩展
机构 * NVIDIA(英伟达)
专题命中 效率与部署 :pretraining(abstract);分类 cs.AI、cs.LG
AI总结 研究针对现代语言模型长上下文应用中零样本上下文扩展问题,提出Jet-Long方法,通过动态双焦点RoPE及相关技术,在推理时开销小,在多种模型和基准测试中表现优异,还能推广到其他架构且超参数弹性强。
Comments added discussion of AdaGroPE and LaMPE (Findings of ACL 2026) with clarified contribution
用于无人机机器人和双手操作的视觉语言动作(VLA)模型综述
机构 * Chef Robotics ; RovifyLab ; IT Application Research Center, Jeonbuk Regional Branch ; Department of Electrical, Computer and Software Engineering(电气与计算机软件工程系)
专题命中 效率与部署 :foundation model(abstract);分类 cs.AI、cs.LG
AI总结 综述2017 - 2026年183篇文献,围绕视觉语言动作模型在无人机机器人和双手操作方面的应用,涵盖多维度,表明双手VLA相关策略可转移至无人机系统,还确定了两领域的14个研究方向。
Comments 56 pages, 11 figures, 16 tables
动态少步长:统一动态计算与少步长蒸馏以实现高效视频生成
机构 * Zhejiang University(浙江大学) ; Westlake University(西湖大学) ; BlueImage, vivo(蓝城图像,维沃) ; Xian Jiaotong-Liverpool University(西交利物浦大学)
专题命中 效率与部署 :post-training(abstract);分类 cs.AI、cs.LG
AI总结 针对视频扩散模型计算成本高问题,提出将动态结构稀疏化融入蒸馏过程的加速框架,联合优化去噪步骤与模型稀疏性,引入相关策略和机制确保训练稳定,开发推理引擎,有效提升效率且保持生成质量。
TriRoute:用于联合自适应注意力、专家和KV缓存分配的统一学习路由
机构 * Ukrainian State University of Science and Technologies(乌克兰国立科技大学)
专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG
AI总结 研究提出TriRoute,通过一个跨轴共享的轻量级控制器联合做出注意力分辨率、专家选择和缓存位宽决策,在拉格朗日预算约束下训练,解决了朴素联合训练的问题,在计算和内存匹配时优于独立方法组合,还保留了尾部情况鲁棒性。
Comments 22 pages, 5 figures, 6 tables; preprint
ELSA3D:用于统一3D理解与生成的弹性语义锚定
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 效率与部署 :foundation model(abstract);分类 cs.AI、cs.LG
AI总结 研究统一3D基础模型文本-3D交互隐式问题,提出ELSA3D模型,通过弹性语义锚定联合构建语言和几何推理,用尺度感知八叉树令牌化器和锚定令牌表示几何,轻量级路由器使计算和推理弹性化,性能领先且减少计算量和延迟。
TurnOPD:使在线策略蒸馏具有转向意识以实现高效的长期智能体训练
机构 * Fudan University(复旦大学) ; Tencent Hunyuan(腾讯文言)
专题命中 效率与部署 :language agent(abstract);分类 cs.CL、cs.AI
AI总结 研究针对在线策略蒸馏在长期智能体任务应用不足的问题,提出TurnOPD,通过自适应展开深度预算和渐进式转向归一化损失预算两个策略,在多任务实验中实现更高验证准确率,超越普通OPD,推进了准确率-时间前沿。
对拒绝的忠实性:神经元选择器的因果审计
机构 * Lexsi Labs(Lexsi实验室)
专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.LG
AI总结 针对归因分数识别神经元行的因果有效性未经验证的问题,通过单次神经元行置零的配对审计,验证归因方法在识别冗余行、实现安全拒绝行为上的因果有效性,揭示排序稳定性不能代表因果有效性。
重新思考思维模型的在线策略自蒸馏
机构 * Princeton University(普林斯顿大学) ; Princeton Language and Intelligence(普林斯顿语言与智能实验室)
专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG
AI总结 针对思维模型自蒸馏性能退化问题,研究发现特权上下文在线策略蒸馏会降低长推理轨迹性能,揭示其作用机制,为强思维模型自蒸馏优化提供方向。
RADIO1D:用于压缩视觉建模的弹性表示
机构 * NVIDIA(英伟达)
专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG
AI总结 挑战视觉语言模型需固定基于补丁的2D视觉特征的假设,分析微调视觉编码器,基于发现引入RADIO1D,用多教师知识蒸馏等将图像压缩成1D令牌序列,有强分层总结能力,在多模态基准测试中有优势。
Comments Published as main conference paper at ICML 2026
OrbitQuant: 图像和视频扩散Transformer的数据无关量化
机构 * Cantina Labs(Cantina实验室) ; University of Southern California(南加州大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 效率与部署 :post-training(abstract);分类 cs.AI、cs.LG
AI总结 提出数据无关量化方法OrbitQuant,通过归一化旋转基和Lloyd-Max码本,无需校准数据即可对扩散Transformer的权重和激活进行低比特量化,在多个模型和模态上达到最优。
复杂文档布局的阅读顺序推断
机构 * School of Computer Science and AI, Tel Aviv University(特拉维夫大学计算机科学与人工智能学院)
专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI
AI总结 提出无训练图框架,通过因果语言模型和BERT NSP信号构建候选转移图,结合最大遗憾推理规则,解决复杂历史手稿中非矩形环绕布局的阅读顺序问题,在Glossa和OmniDocBench数据集上优于XY-cut和LayoutReader。
用英语思考,用韩语回答:多语言工具使用智能体的高效适配
机构 * Cohere ; LG CNS
专题命中 效率与部署 :pretraining(abstract);分类 cs.AI、cs.LG
AI总结 提出LuckyStar 111B混合推理模型,通过多语言监督微调、可验证奖励强化学习、语言一致性奖励和4-bit量化,高效适配多语言工具使用智能体,提升数学推理、函数调用和NL2SQL性能。
Transformer作为贝叶斯上下文实验者:平滑自适应的高效ATE估计
机构 * Laboratory for Information and Decision Systems, MIT(麻省理工学院信息与决策系统实验室)
专题命中 效率与部署 :pretraining(abstract);分类 cs.AI、cs.LG
AI总结 提出贝叶斯上下文实验者框架,利用Transformer模仿贝叶斯后验Neyman分配策略,通过注意力机制和投影梯度下降实现平滑自适应的平均处理效应高效估计。
当Transformer学习“不可能”语言时,它们学到了什么?
机构 * University of Edinburgh(爱丁堡大学)
专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI
AI总结 研究通过训练GPT-2模型于英语的“不可能”变体,发现模型在语法敏感性上仅逐渐退化,但在生成任务中显著失败,提出生成缺陷是语言不可习得性的可能解释。
Comments CoNLL 2026 (Best Paper Award). 14 pages, 3 figures
简洁是推理效率的灵魂:通过数据策展诱导VLM的简洁性
机构 * DatologyAI
专题命中 效率与部署 :pretraining(abstract);分类 cs.AI、cs.LG
AI总结 本文提出通过预训练数据策展诱导视觉语言模型输出简洁答案,从而降低推理成本,在保持精度的同时实现35倍成本优势。
Comments 36 pages, see https://datologyai.com for more information
Flexformer: 具有可学习注意力核的灵活线性Transformer
机构 * Center for Applied Statistics and School of Statistics, Renmin University of China(中国人民大学应用统计科学研究中心与统计学院)
专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG
AI总结 提出Flexformer,通过将随机傅里叶特征中的频谱频率作为可训练参数,实现数据驱动的注意力核学习,在保持线性复杂度的同时提升表达能力,并在语言建模和序列分类任务上优于基线。
无数据储备特征用于高效长时域冷启动持续学习
机构 * University of Oxford(牛津大学) ; Department of Computer Science(计算机科学系) ; Department of Engineering Sciences(工程科学系)
专题命中 效率与部署 :pretraining(abstract);分类 cs.AI、cs.LG
AI总结 提出CIRCLE方法,使用固定的双向二维储备特征和流式线性判别分析头,无需重放、预训练或骨干网络反向传播,在长任务序列中显著优于现有冷启动无样本类增量学习方法。
CAT-Q:面向LLMs的经济高效且精确的三值量化
机构 * Intel Labs China(英特尔中国实验室)
专题命中 效率与部署 :post-training(abstract);分类 cs.CL、cs.AI
AI总结 提出CAT-Q后训练量化方案,通过可学习调制和软化三值化,仅用512个校准样本即可将LLMs高效量化为三值模型,性能优于使用100B tokens训练的BitNet 1.58-bit,训练token减少约100,000倍。
Comments This work is accepted to ICML 2026 as an oral. The project page: https://github.com/IntelChina-AI/BitTern
惊喜引导的归并排序:通过自适应比较调度实现预算高效的人机协同排名
机构 * Hanyang University(汉阳大学) ; Hankuk University of Foreign Studies(韩国外国语大学)
专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG
AI总结 提出惊喜引导的归并排序(SGS)框架,利用视觉语言模型(VLM)作为问题优先级排序器,通过自适应预算分配将高模糊度比较路由给人类,在六个基准上以相同预算实现Kendall's τ×100提升6-12点。
Comments After submission, we discovered significant issues in the reference and citation information used in the manuscript. Because these issues affect the integrity of the scholarly record and require substantial revision and verification, we request withdrawal of the current submission. A corrected version may be submitted in the future after a comprehensive review
稀疏性-存储-精度权衡在简约激活字典学习中的研究
机构 * Tsinghua University, Institute of Data and Information(清华大学数据与信息研究院) ; Shenzhen Key Laboratory of Ubiquitous Data Enabling(深圳泛在数据赋能重点实验室)
专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出简约激活字典学习(PADL)的结构化生成模型解释,推导出稀疏性、存储成本与重建精度之间的权衡关系,并开发出无需手动调参的高效算法,在视觉基准上取得更优性能。
SCENIC: 语义条件边缘感知的结构化物联网命令生成神经框架
机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) ; Shenzhen Belon Technology Co., Ltd.(深圳市贝隆科技有限公司)
专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG
AI总结 提出SCENIC框架,通过小规模Transformer、三元组损失微调、剪枝量化等方法,在边缘设备上高效生成结构化IoT命令,达到高准确率并显著压缩模型。
Comments IEEEtran journal format; 3 figures, 8 tables
通道位置限制潜意识学习的可审计性
机构 * Austrian Research Institute for Artificial Intelligence(奥地利人工智能研究所) ; University of Vienna(维也纳大学)
专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG
AI总结 研究潜意识学习中隐藏特征传递的可审计性,发现通道位置决定审计有效性,并识别三种传递机制,证明审计必须匹配载体通道。
单纯形约束的稀疏装袋:集成学习中从均匀先验到稀疏后验的转变
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 效率与部署 :post-training(abstract);分类 cs.AI、cs.LG
AI总结 提出SCSB框架,通过最小化袋外损失在概率单纯形上联合优化集成剪枝与校准,引入凹二次惩罚解决L1单纯形悖论,实现高达96%的压缩并提升校准性能。
Comments 6 pages, 3 tables