arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 139420 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12429 篇

2607.22699 2026-08-14 cs.AI cs.CL 版本更新 73%

Similarity All The Way Up: Multilingual Generalization in LLMs Relies on Language-Level Similarity Structures

一路相似:大语言模型中的多语言泛化依赖于语言层面的相似性结构

Supantho Rakshit, Adele Goldberg, Henry Conklin

机构 * Princeton University(普林斯顿大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型多语言泛化能力,通过借鉴认知科学,探究其对不同语言层次相似性结构的捕捉,发现潜在表示能恢复印欧语系语言家族树结构,且模型反映语言相似性程度与XNLI表现相关,扩展了相似性驱动泛化工作。

Comments Accepted for oral presentation at CogSci 2026 (48th Annual Meeting of the Cognitive Science Society), Rio de Janeiro. 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10605 2026-08-12 cs.LG cs.AI 新提交 73%

Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts

计算最优并非集群最优:面向稀疏混合专家模型的系统感知缩放

Soumajyoti Sarkar, Yuxin Tang, Sheng Zha

机构 * Amazon AGI Foundations(亚马逊AGI基础研究部门)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本研究开发MOSAIC框架,将稀疏MoE模型的架构与系统协同设计建模为优化问题,发现计算最优与集群最优稀疏性存在差异,主张统一架构与系统协同设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11687 2026-08-11 cs.SE cs.CL cs.LG 版本更新 73%

MetaLint: Easy-to-Hard Generalization for Code Linting

MetaLint: 代码检查的易到难泛化

Atharva Naik, Lawanya Baghel, Dhakshin Govindarajan, Darsh Agrawal, Yiqing Xie, Daniel Fried, Carolyn Rose

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 MetaLint通过元学习框架将代码检查转化为指令遵循任务,能根据自然语言规范评估代码是否符合最佳实践,实现无需重新训练的泛化能力,且在不同编程语言和场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22510 2026-08-11 cs.LG cs.AI 版本更新 73%

Shattered Compositionality: Counterintuitive Learning Dynamics of Transformers for Arithmetic

破碎的组合性:变换器在算术中的反直觉学习动态

Xingyu Zhao, Darsh Sharma, Rheeya Uppaal, Yiqiao Zhong

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Department of Computer Sciences, University of Wisconsin–Madison(威斯康星大学麦迪逊分校计算机科学系) Department of Statistics, University of Wisconsin–Madison(威斯康星大学麦迪逊分校统计学系)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究发现变换器在学习算术任务时表现出反直觉的组合性,其学习动态受训练数据相关性影响而非因果或程序性组合。

Comments 37 pages, 29 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27435 2026-08-10 cs.CL cs.AI 版本更新 73%

Improving Attributed Long-form Question Answering with Intent Awareness

通过意图意识提升带有属性的长形式问答

Xinran Zhao, Aakanksha Naik, Jay DeYoung, Joseph Chee Chang, Jena D. Hwang, Tongshuang Wu, Varsha Kishore

机构 * Allen Institute for AI(艾伦人工智能研究所) Carnegie Mellon University(卡内基梅隆大学) University of Washington(华盛顿大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过增强模型意图意识来提升长报告生成质量,通过结构化标签方案提取隐含意图,改进零样本生成能力并生成高质量合成数据,实验显示在科学报告生成任务中模型性能平均提升2.9和12.3个百分点。

Comments 39 pages, 7 figures

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06223 2026-08-07 cs.AI cs.LG 新提交 73%

TS-RAG: Retrieval Augmented Generation for Time Series Forecasting

TS-RAG:面向时间序列预测的检索增强生成

Yixiong Xiao, Congxi Xiao, Jingbo Zhou

机构 * Baidu, Inc.(百度公司)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对时间序列预测模型的局限,提出TS-RAG框架,引入参考token融合输入与检索序列信息,在多个真实预测基准上实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05624 2026-08-07 cs.AI cs.CL 新提交 73%

Measuring and Detecting Harmful AI Sycophancy

衡量与检测有害的AI奉承行为

Bohan Jiang, Dawei Li, Yasin Silva, Huan Liu

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文针对大型语言模型的有害偏好诱导立场反转奉承(PSRS),提出CAP框架收集带标签数据,探究其发生频率、检测可行性及跨模型泛化性,发现能力越强的模型PSRS率越低,并提出应对未见模型检测性能下降的初步方法。

Comments under-review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05153 2026-08-07 cs.CL cs.AI 新提交 73%

Universal Pathologies, Conditional Consequences: A Triple-Robustness Analysis of RAG for Multi-Hop Traceability

普遍存在的缺陷与有条件的后果:面向多跳可追溯性的RAG的三重鲁棒性分析

Meftun Akarsu, Burak Ozdemir

机构 * Technische Hochschule Ingolstadt(英戈尔施塔特应用技术大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究通过三重鲁棒性分析,探究了不同嵌入器、语料库、评判器下GraphRAG与向量RAG的多跳可追溯性表现,发现过度引用具架构普遍性,忠实度后果受语料库影响,提出三重鲁棒性为可信RAG架构主张的最低标准。

Comments 5 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04678 2026-08-06 cs.CL cs.LG 新提交 73%

Kathleen Writes: Autoregressive Generation and Data Scaling Without Attention

Kathleen Writes:无注意力的自回归生成与数据缩放

George Fountzoulas

机构 * Frederick University(弗雷德里克大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 该研究提出无注意力的混响模型,在字节级语言建模上优于参数匹配的Transformer,引入FORM DISTANCE衡量文本真实性,发现解码策略对生成性能的影响大于架构,且增益依赖训练语料库内的短语。

Comments Paper 3 of the Kathleen series. 11 pages, 3 figures. All experiments reproducible on a free Kaggle T4

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02961 2026-08-05 cs.LG cs.AI q-bio.GN 新提交 73%

Scaling an Autoregressive Transformer for Single-Cell Generation

为单细胞生成任务扩展自回归Transformer模型

Aleksandr Sharipov, Yusif Mukhtarov, Igor Molybog

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对单细胞基因表达向量的自监督生成任务,扩展因果Transformer模型,发现单细胞基础模型的双指数缩放定律与计算最优前沿,还探讨其微调用于扰动响应预测的可能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02807 2026-08-05 cs.CL cs.AI 新提交 73%

Learning a Vector-Symbolic Model for Socio-Cultural Tasks

学习面向社会文化任务的向量符号模型

Meera Ray, Swapnika Dulam, Christopher L. Dancy

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对社会文化结构对决策的表征问题,在ACT-R认知架构中提出带向量符号自编码器的陈述性记忆系统,结合HRR编码,通过IAT测试验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00985 2026-08-04 cs.LG cs.AI q-bio.GN 新提交 73%

Beyond Gene Reconstruction: Learning Cell Representations through Complementary Transcriptomic Views

超越基因重构:通过互补转录组视图学习细胞表示

Jiaqi Xiong, Yuntao hu, Yu Zheng, Yifei Shi, Xinyue Guo, Jiaxin Qi

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对基因重构预训练模型未直接优化全细胞表示的问题,提出含三种适配的互补转录组视图对比预训练框架,在细胞类型注释和基因调控网络推断任务中表现出竞争力。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01005 2026-08-04 cs.LG cs.AI cs.IT math.IT 新提交 73%

Hierarchical Solomonoff Induction: An Unbounded Machine Learning Model

分层所罗门诺夫归纳法:一种无界机器学习模型

Nathan Young

机构 * University of Auckland(奥克兰大学) Strong AI Lab(强人工智能实验室)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出分层所罗门诺夫归纳法(HSI),将德菲涅蒂定理应用于所罗门诺夫归纳法(SolInd),证明HSI等价于SolInd,其超额误差受生成器复杂度约束,随数据集增长收敛至0,是适用于给定数据集的无界序列预测理想模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16974 2026-08-04 cs.CL cs.AI 版本更新 73%

Leveraging Synthetic Data for Question Answering with Multilingual LLMs in the Agricultural Domain

利用合成数据结合多语言大语言模型(LLMs)处理农业领域的问答任务

Rishemjit Kaur, Arshdeep Singh Bhankhar, Jashanpreet Singh Salh, Sudhir Rajput, Vidhi, Kashish Mahendra, Bhavika Berwal, Ritesh Kumar, Surangika Ranathunga

机构 * CSIR-Central Scientific Instruments Organisation, India(印度CSIR-中央科学仪器组织) Academy of Scientific and Innovative Research (AcSIR), Ghaziabad, U.P, India(印度科学与创新研究院(AcSIR)) School of Mathematical and Computational Sciences, Massey University, New Zealand(梅西大学数学与计算科学学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对通用多语言LLMs在农业领域问答中精准性不足的问题,利用印度农业文档生成多语言合成数据集微调LLMs,显著提升了模型的事实性、相关性与农业共识性。

Comments 19 pages, 7 tables, Appendix A-Q

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27731 2026-07-31 cs.LG cs.AI math.OC 新提交 73%

Towards joint scaling laws with optimal batch size schedules

面向最优批量大小调度的联合缩放律研究

Jiaxiang Li, Zhiqi Bu, Shiyun Xu

机构 * Meta

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究从凸优化视角推导了适用于通用优化器和模型架构的损失联合表征,得到闭式最优批量大小调度与联合缩放律,其性能优于固定批量大小基线,凸显动态批量大小调度在大语言模型训练中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24791 2026-07-29 cs.IR cs.AI cs.CL 新提交 73%

From Naive RAG to Deep Agentic Retrieval: An Evolving Context Engineering Pipeline for Regulatory Compliance

从朴素检索增强生成到深度智能检索:用于合规监管的不断演进的上下文工程管道

Mishca de Costa, Muhammad Saleh Anwar, Dave Mercier, Issam Hammad

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对RAG朴素实现的局限,追溯安大略发电公司检索管道演变,历经多阶段形成PEA-CAE架构,表明上下文工程对监管语料库更具优势,深度智能检索进展反映经典思想,迭代证据获取等渐成企业问答基础。

Comments Accepted at the 2026 IEEE the 14th International Conference on Smart Energy Grid Engineering (SEGE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23242 2026-07-28 cs.CL cs.LG 新提交 73%

IndicTalk: A Large-Scale Persona-Based Multilingual Conversational Corpus for Indic Languages

IndicTalk:用于印度语言的大规模基于角色的多语言对话语料库

Sahil Deepak Gawande, Mayank Singh

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 针对印度语言高质量多语言代码混合对话资源稀缺问题,提出通过全自动管道生成IndicTalk语料库,涵盖多种印度语言变体,经多种评估表现良好,将发布该语料库支持相关人工智能开发评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21716 2026-07-27 cs.LG cs.AI math.OC stat.ML 新提交 73%

A Defense of the Quadratic Model

二次模型的辩护

Alexandru Meterez, Pranav Ajit Nair, Depen Morwani, Cengiz Pehlevan, Sham Kakade, Alex Damian

机构 * Kempner Institute at Harvard University(哈佛大学坎普纳研究所) MIT(麻省理工学院)

专题命中 预训练与数据 :LLM(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究对二次模型进行压力测试,通过泰勒展开预测优化动态,利用兰索斯求积法分析海森矩阵谱和局部稳定性,发现其在语言模型中能准确反映优化情况,或可作为预训练优化动态的理论易处理代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19771 2026-07-23 cs.LG cs.AI 新提交 73%

An Isotropy-Preserving Spectral Cap for Muon: Theory and Three Case Studies

用于μ子的各向同性保持谱帽:理论与三个案例研究

Jiachun Li

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究μ子和相关矩阵符号优化器对权重矩阵的影响,提出基于尺度不变性假设的统一框架及轻量级“谱帽”,通过三个案例研究表明谱帽可增加各向同性并防止失败,验证损失基本不变,结果为初步的。

Comments Preliminary Report; Larger scale experiments ongoing; Comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18358 2026-07-22 cs.CL cs.LG 新提交 73%

A Classifier That Teaches Itself: Self-Improving, Frozen-gate Training (SIFT) for Dynamic Document Classification

一种自学分类器:用于动态文档分类的自我改进冻结门训练(SIFT)

Bogdan Raduta, Horia Velicu, Alexandru Preda, Serban Chiricescu

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 研究针对企业文档分类难题,提出SIFT动态分类器服务,通过低成本管道、特定机制及判断反馈实现自我改进,解决标注和安全问题,介绍其架构、机制及部署示例,探讨边际标注成本趋零的经济性。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16952 2026-07-22 cs.LG cs.AI stat.AP stat.ME stat.ML 版本更新 73%

Phantoms and Disclosures: A Statistical Framework for Auditing Privacy in Synthetic Data

幻象与披露:合成数据审计的因果框架

Kareem Amin, Rudrajit Das, Alessandro Epasto, Adel Javanmard, Dennis Kraft, Mónica Ribero, Sergei Vassilvitskii

机构 * Google(谷歌) University of Southern California(南加州大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出一个可定制的实证审计框架,通过区分真实披露与幻象披露,利用统计假设检验检测合成数据中的隐私泄露,无需模型访问或参考模型,提供比先前方法更紧的隐私泄露下界。

Comments 35 pages, 10 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11849 2026-07-21 cs.CL cs.AI cs.SI 73%

Network-informed Prompt Engineering against Organized Astroturf Campaigns under Extreme Class Imbalance

在极端类别不平衡下基于网络的提示工程对抗有组织的Astroturf活动

Nikos Kanakaris, Heng Ping, Xiongye Xiao, Nesreen K. Ahmed, Luca Luceri, Emilio Ferrara, Paul Bogdan

机构 * University of Southern California(美国南加州大学) Cisco AI Research(思科人工智能研究)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于大型语言模型的Balanced RAG框架,通过提示工程和平衡检索增强生成技术,在极端类别不平衡下有效识别协调虚假信息活动。

Journal ref WWW '25: Companion Proceedings of the ACM on Web Conference 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01455 2026-07-16 cs.LG cs.AI 版本更新 73%

Token Geometry

Token几何

Kathan Shah

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 发现嵌入表和LM头的梯度几何特性,提出轻量优化器Ember,在微调、强化学习和预训练中提升帕累托前沿,仅需KB级优化器状态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11052 2026-07-14 cs.LG cs.CL 新提交 73%

Domain-Aware Scaling Laws Uncover Data Synergy

领域感知缩放定律揭示数据协同效应

Kimia Hamidieh, Lester Mackey, David Alvarez-Melis

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Microsoft Research(微软研究院) Harvard University(哈佛大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 研究语言模型预训练中的数据协同效应,利用开放权重语言模型的观测变化估计领域间协同效应,其框架提高预测精度,恢复稳定估计,经训练模型验证能正确预测性能排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10911 2026-07-14 cs.CL cs.AI cs.DB 新提交 73%

The Nuts and Bolts of Natural Language to SQL Translation: A Systematic Analysis of Model Pipeline Optimisation Approaches and their Interactions

自然语言到SQL翻译的关键要素:模型管道优化方法及其交互的系统分析

Filip Klubicka, Vasudevan Nedumpozhimana, Sneha Rautmare, Bora Caglayan, Mingxue Wang, John D. Kelleher

机构 * Huawei Ireland Research Centre(华为爱尔兰研究中心)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究NL2SQL翻译问题,通过集成NatSQL中间表示、增加预处理和微调步骤、开发重排器模型等方法,并结合SmBoP和RASAT架构进行消融及Shapley分析,揭示组件交互对结果的影响,为轻量级模型开发提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09754 2026-07-14 cs.CV cs.AI cs.LG q-bio.NC 新提交 73%

Cross-Subject Modeling for Widefield Calcium Imaging via Atlas-Aligned Spatiotemporal Tokenization

通过图谱对齐的时空令牌化实现宽场钙成像的跨主体建模

Mohammad Hosseini, Eray Erturk, Saba Hashemi, Maryam M. Shanechi

机构 * ShanechiLab(沙内奇实验室)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究针对宽场钙成像建模受限问题,提出多主体模型WiCAT,利用自监督预训练,引入图谱对齐的时空令牌化方案,能跨主体、任务和数据集迁移,实现零样本行为解码及遗漏脑区重建,优于基线模型。

Comments Published at the 43rd International Conference on Machine Learning (ICML) 2026. Code available at: https://github.com/ShanechiLab/WiCAT

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14687 2026-07-14 cs.LG cs.AI 版本更新 73%

SynthSAEBench: Evaluating Sparse Autoencoders on Scalable Realistic Synthetic Data

SynthSAEBench: 评估可扩展真实合成数据上的稀疏自编码器

David Chanin, Adrià Garriga-Alonso

机构 * University College London(伦敦大学学院) Decode Research(Decode研究)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 SynthSAEBench通过生成大规模真实合成数据,提供标准化基准模型,用于评估稀疏自编码器架构的改进和失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15138 2026-07-10 cs.CL cs.AI 版本更新 73%

Less Is More: Reducing Token Counts Without Compromising Performance

少即是多:在不影响性能的情况下减少词元数量

Gyeongje Cho, Yeonkyoung So, Sangmin Lee, Jaejin Lee

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学) Department of Computer Science, Seoul National University(计算机科学系,首尔国立大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究如何在不影响大语言模型性能的前提下减少词元数量,提出Thunder-Tok子词元分词器,先构建种子词汇表并过滤不完整候选词元,再用基于似然的词元分数修剪,实验证明该方法能有效降低词元生成率并保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05456 2026-07-08 cs.AI cs.CL q-bio.QM 新提交 73%

Prompt-to-Paper: Agentic AI System for Bioinformatics

从提示到论文:用于生物信息学的智能AI系统

Ramsha Kamran, Maheera Amjad, Zartasha Mustansar, Arsalan Shaukat, Salma Sherbaz, Muhammad U. S. Khan

机构 * School of Interdisciplinary Engineering and Sciences (SINES), National University of Sciences and Technology (NUST)(跨学科工程与科学学院(SINES),国立科技大学(NUST))

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对现有AI自动生成稿件系统的缺陷,提出Prompt-to-Paper多智能体框架。通过检索增强生成、自主编码实验及八维质量评分等创新,经质量驱动改进循环,在生物信息学案例中验证,有效提升稿件质量,成本低且获较好外部评价。

Comments NA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21876 2026-07-01 cs.LG cs.AI 新提交 73%

Protein contacts are already in the attention: a single-forward-pass alternative to the Categorical Jacobian

蛋白质接触已经存在于注意力中:分类雅可比矩阵的单次前向替代方案

Rome Thorstenson

机构 * Independent Researcher(独立研究员)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出通过选择少量注意力头(仅需10个标记蛋白质)平均即可在一次前向传播中恢复蛋白质接触,在无泄漏数据上优于分类雅可比矩阵,并发现该信号依赖于双向预训练。

Comments 28 pages, 9 figures. Code and data: https://github.com/Rome-1/plm-contact-fusion

详情

展开后加载摘要…

URL PDF HTML 收藏