Protein Fold Classification at Scale: Benchmarking and Pretraining
大规模蛋白质折叠分类:基准测试与预训练
机构 * Max Planck Institute of Biochemistry(马克斯·普朗克生物化学研究所) ; Computer Science Department, University of Stuttgart(斯图加特大学计算机科学系)
专题命中 预训练与数据 :pretraining(title);分类 cs.LG
AI总结 本文提出TEDBench,一个大规模非冗余的蛋白质折叠分类基准,通过Encyclopedia of Domains和Foldseek-clustered AlphaFold结构构建。基于此基准,作者提出Masked Invariant Autoencoders (MiAE)框架,通过高掩码率和SE(3)不变编码器实现蛋白质结构表示学习,从而在TEDBench上取得优异性能。
Comments Accepted at ICML 2026 (spotlight)