arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 391 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 391 篇

2512.17351 2026-07-29 cs.CL 版本更新 85%

Physics of Language Models: Part 4.1, Architecture Design and the Magic of Canon Layers

语言模型的物理:第4.1部分,架构设计与Canon层的魔力

Zeyuan Allen-Zhu

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);post-training(abstract);分类 cs.CL

AI总结 本研究提出Canon层,通过轻量级架构组件提升语言模型的推理深度和广度,验证了其在不同架构中的有效性,并展示了其在学术预训练中的潜力。

Comments V1.1 appeared in NeurIPS 2025 main conference; V2 adds GDN experiments, tightens others for a stronger, fairer comparison, and reorganizes sections; V3 adds Result 2.1 and Section 5.2 on how Canon layers improve hierarchical feature learning, from our Jan 2026 talk

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09657 2026-07-21 cs.CV cs.AI cs.MM 版本更新 85%

Scalable Visual Pretraining for Language Intelligence

用于语言智能的可扩展视觉预训练

Yiming Zhang, Zhonghan Zhao, Wenwei Zhang, Haiteng Zhao, Tianyang Lin, Huanze Tang, Yunhua Zhou, Demin Song, Kuikun Liu, Haochen Ye, Haian Huang, Yuzhe Gu, Haijun Lv, Qipeng Guo, Bin Liu, Gaoang Wang, Kai Chen

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 研究挑战语言模型仅在文本表示上训练的假设,通过对直接利用视觉文档的无监督视觉预训练范式进行系统研究,发现其在多主干和基准上优于仅文本预训练,为可扩展语言智能提供有效途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11290 2026-07-08 cs.CL 版本更新 85%

Polyglot Teachers: Evaluating Language Models for Multilingual Synthetic Data Generation

多语言教师:评估语言模型用于多语言合成数据生成

Lester James V. Miranda, Ivan Vulić, Anna Korhonen

机构 * Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室)

专题命中 预训练与数据 :language model(title,abstract);SFT(abstract,abstract_cn);分类 cs.CL

AI总结 本文评估了多语言教师模型的有效性,通过Polyglot Score衡量数据质量和学生模型表现,发现Gemma 3和Aya Expanse在不同学生模型家族中表现优异,数据质量如提示多样性、长度和响应流畅度对教学效果影响显著。

Comments Added human evaluation experiment results. Code is in https://github.com/ljvmiranda921/polyglot-teachers

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17633 2026-06-29 cs.CL 版本更新 85%

Copy First, Translate Later: Interpreting Translation Dynamics in Multilingual Pretraining

先复制,后翻译:在多语言预训练中解读翻译动态

Felicia Körner, Maria Matveev, Florian Eichin, Gitta Kutyniok, Barbara Plank, Michael A. Hedderich

机构 * MaiNLP, Center for Information and Language Processing, LMU Munich(MaiNLP,信息与语言处理中心,慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Department of Mathematics, LMU Munich(数学系,慕尼黑大学) Department of Physics and Technology, University of Tromsø(物理与技术系,特罗姆瑟大学) DLR-German Aerospace Center(德国航空航天中心)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究通过多语言预训练模型探索语言和翻译能力的早期发展,发现模型在早期阶段通过token级复制获取基本语言能力,翻译能力分两阶段发展。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09717 2026-08-10 cs.LG cs.AI 版本更新 85%

Provable Training Data Identification for Large Language Models

大语言模型训练数据的可证明识别

Zhenlong Liu, Hao Zeng, Weiran Huang, Hongxin Wei

机构 * Department of Statistics and Data Science, Southern University of Science and Technology(统计与数据科学系,南方科技大学) Shanghai Innovation Institute(上海创新研究院) School of Computer Science, Shanghai Jiao Tong University(计算机科学学院,上海交通大学)

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.AI、cs.LG

AI总结 本文提出PTDI方法,通过集级推断实现大语言模型训练数据识别的可证明误差控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01061 2026-07-14 cs.AI cs.CL 版本更新 85%

Agentic generation of verifiable rules for deterministic, self-expanding reaction classification

用于确定性、自扩展反应分类的可验证规则的智能体生成

Daniel Armstrong, Maarten Dobbelaere, Valentas Olikauskas, Helena Avila, Octavian Susanu, Jérôme Waser, Philippe Schwaller

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院) Laboratory for Chemical Technology, Ghent University(根特大学化学技术实验室) NCCR Catalysis(瑞士国家研究能力中心催化项目)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出多智能体LLM框架,通过验证循环自动生成反应规则,将标准分类从68类扩展到14,073类,并实现97.7%的未知反应分类准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00715 2026-08-11 cs.CL cs.AI cs.LG 版本更新 85%

To Memorize or to Retrieve: Scaling the Interaction Between Pretraining and Retrieval

记忆还是检索:考虑RAG的缩放规律

Karan Singh, Michael Yu, Varun Gangal, Zhuofu Tao, Sachin Kumar, Emmy Liu, Steven Y. Feng

机构 * Stanford University(斯坦福大学) Independent Researcher(独立研究员) Patronus AI The Ohio State University(俄亥俄州立大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨了预训练知识与检索知识的平衡,提出三维缩放框架,揭示在不同模型规模和任务类型下检索的边际效用,为语言模型设计提供数据资源分配指导。

Comments Code available at https://github.com/DegenAI-Labs/RAG-Scaling-Laws

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11671 2026-08-04 cs.CR cs.AI cs.SE 版本更新 84%

Cochise: A Reference Harness for Autonomous Penetration Testing

Cochise:自主渗透测试的参考框架

Andreas Happe, Jürgen Cito

机构 * TU Wien(维也纳技术大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.AI

AI总结 Cochise提供了一个简洁的自主渗透测试框架,支持通过SSH连接LLM代理与Linux主机,并通过分离的规划-执行架构实现可控环境,同时提供重放和分析工具以支持研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12712 2026-07-16 cs.SE cs.LG 版本更新 84%

Design-Specification Tiling for ICL-based CAD Code Generation

基于ICL的CAD代码生成的Design-Specification Tiling设计

Yali Du, San-Zhuo Xi, Hui Sun, Ming Li

机构 * National Key Laboratory for Novel Software Technology, School of Artificial Intelligence, Nanjing University(新型软件技术国家实验室,人工智能学院,南京大学)

专题命中 预训练与数据 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);prompting(abstract);分类 cs.LG

AI总结 本文提出DST方法,通过量化知识充分性提升CAD代码生成质量,优于现有ICL示例选择策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10473 2026-08-14 cs.LG cs.AI 版本更新 84%

Critic-Free Pretraining for Efficient Online Reinforcement Learning Fine-Tuning

用于高效在线强化学习微调的无评判者预训练

Daoyi Li, Yixian Zhang, Wenbo Ding, Yu Wang, Chao Yu

机构 * Tsinghua University(清华大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究针对离线转在线强化学习中复用离线评判者导致的适配问题,提出无评判者预训练范式,兼容主流算法且在多任务上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06211 2026-08-11 cs.CL cs.AI eess.AS 版本更新 84%

LF${}^{2}$AR: Accounting for Layerwise Dynamics to Improve Multimodal Adaptation of Language Models

LF²AR:考虑分层动态以改进语言模型的多模态适配

Santiago Cuervo, Adel Moumen, Yanis Labrak, Sameer Khurana, Antoine Laurent, Mickael Rouvier, Phil Woodland, Ricard Marxer

机构 * Université de Toulon, Aix-Marseille Université, CNRS, LIS, France(法国图卢兹大学、马赛大学、CNRS、LIS) Department of Engineering, University of Cambridge, UK(剑桥大学工程系) Mitsubishi Electric Research Laboratories (MERL), Cambridge, MA, USA(三菱电机研究实验室(MERL)) LIA, Avignon Université, France(法国阿维尼翁大学LIA) LIUM, Le Mans Université, France(法国勒芒大学LIUM) Zenidoc, Marseille, France(法国马赛Zenidoc)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出LF²AR架构,通过分层抽象-细化动态设计适配机制,在文本转图像、语音模态上提升语言模型性能,支持1.9倍生成加速。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06122 2026-08-10 cs.LG cs.AI 版本更新 84%

Is Self-Pretraining really useful to improve diagnosis in medical Time Series?

自预训练(SPT)真的有助于改进医疗时间序列的诊断吗?

Omar Coser, Antonio Orvieto, Paolo Soda, Loredana Zollo

机构 * Università Campus Bio-Medico di Roma(罗马生物医学大学校园大学) Umeå University(于默奥大学) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ELLIS Institute Tübingen(埃利斯研究所蒂宾根分所)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究探究自预训练(SPT)对Transformer在医疗时间序列诊断任务的影响,发现SPT可提升分类准确率0-6个百分点,是无需修改架构的通用有效策略。

Comments 21 pages, 7 figures,4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06479 2026-07-27 cs.LG cs.AI 版本更新 84%

Pretraining Recurrent Networks without Recurrence

无递归预训练循环网络

Akarsh Kumar, Phillip Isola

机构 * MIT(麻省理工学院)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出监督记忆训练(SMT)方法,通过将循环神经网络训练转化为一步记忆转换标签上的监督学习,实现时间并行训练和稳定梯度路径,优于反向传播通过时间(BPTT)方法。

Comments 30 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12463 2026-07-21 cs.AI cs.CL 版本更新 84%

Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation Models

作为编码智能体基础模型中间训练的函数感知中间填充

Yubo Wang, Jiarong Liang, Yuxuan Zhang, Xuye Liu, Cong Wei, Yuyu Zhang, Ping Nie, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) University of British Columbia(英属哥伦比亚大学) NVIDIA(英伟达公司) Verdent AI(Verdent人工智能公司) Vector Institute(向量研究所)

专题命中 预训练与数据 :foundation model(title);pretraining(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 研究针对编码智能体将外部工具返回集成到推理中的问题,利用函数感知中间填充进行中间训练,在多个模型上提升了性能,并减轻了后训练对非智能体编码等基准测试的能力侵蚀。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04029 2026-07-15 cs.DB cs.AI cs.LG 版本更新 84%

PluRel: Synthetic Data unlocks Scaling Laws for Relational Foundation Models

PluRel: 合成数据解锁关系基础模型的扩展定律

Vignesh Kothapalli, Rishabh Ranjan, Valter Hudovernik, Vijay Prakash Dwivedi, Johannes Hoffart, Carlos Guestrin, Jure Leskovec

机构 * Stanford University(斯坦福大学) SAP Labs LLC(SAP实验室)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 PluRel通过合成多表关系数据库,实现了关系基础模型在扩展定律上的突破,展示了合成数据在提升模型泛化能力方面的潜力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03979 2026-07-13 cs.LG cs.AI 版本更新 84%

Language Models Need Sleep: Learning to Self-Modify and Consolidate Memories

语言模型需要睡眠:学习自我修改和巩固记忆

Ali Behrouz, Farnoosh Hashemi, Adel Javanmard, Vahab Mirrokni

机构 * Google(谷歌) Cornell University(康奈尔大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 受人类学习过程启发,提出“睡眠”范式,通过记忆巩固(知识播种)和梦境(自我改进)两阶段,使模型持续学习、将短期记忆转化为长期知识并自我提升。

Comments A version of this work has been publicly available from September 2025 on OpenReview

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00866 2026-06-25 cs.LG cs.CL 版本更新 84%

Removing Noise, not Finding Gold: Quality Filtering for Large-Scale Pretraining

去除噪声,而非寻找黄金:大规模预训练的质量过滤

Thiziri Nait Saada, Louis Bethune, Michal Klein, David Grangier, Marco Cuturi, Pierre Ablin

机构 * Work done as an intern at Apple(苹果公司实习生) University of Oxford(牛津大学) Apple(苹果公司)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文深入分析基于分类器的质量过滤(CQF)方法,发现其虽提升下游任务性能,但会隐式过滤高质量数据,且与基于合成数据的模型行为趋势不同,质疑CQF捕捉数据质量的有效性。

Comments 21 pages, 22 figures, 2 tables, accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02524 2026-06-12 cs.CL cs.FL cs.LG 版本更新 84%

Unraveling Syntax: Language Modeling and the Substructure of Grammars

解析句法:语言建模与语法的子结构

Laura Ying Schulz, Daniel Mitropolsky, Tomaso Poggio

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本文研究语言模型在上下文无关语法子结构上的学习行为,证明损失函数在顶层子语法上线性递归,并发现参数化模型并行学习子语法,子语法预训练能提升小模型性能并改善内部表征。

Comments Equal contribution by LYS and DM. Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22088 2026-06-11 cs.LG cs.AI cs.CL 版本更新 83%

Unifying Learning Dynamics and Generalization in Transformers Scaling Law

统一Transformer缩放定律中的学习动力学与泛化

Chiwun Yang

机构 * Sun Yat-sen University(中山大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过将Transformer学习动力学形式化为ODE系统并近似为核行为,严格分析了随机梯度下降训练下的泛化误差,揭示了计算资源缩放时泛化误差的指数衰减与幂律衰减的两阶段相变,并建立了紧的上下界。

Comments 87 pages, 10 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10745 2026-08-18 cs.CL 版本更新 83%

The First ChineseBabyLM Challenge: training data-efficient and cognitively plausible language models for Chinese

首个中文BabyLM挑战:训练数据高效且认知合理的中文语言模型

Siyuan Song, Zhiheng Qian, Yunhao Zhang, Linyang He, Xiaozhe Ji, Yingxin Lin, Hongao Zhu, Chongtian Shao, Chuhan Lang, Luan Li, Rui Wang, Renfen Hu, Shaonan Wang, Hai Hu

机构 * Princeton University(普林斯顿大学) Shanghai Jiao Tong University(上海交通大学) Chinese Academy of Sciences(中国科学院) Columbia University(哥伦比亚大学) Beijing Normal University(北京师范大学) Tsinghua University(清华大学) University of California San Diego(加利福尼亚大学圣地亚哥分校) The Hong Kong Polytechnic University(香港理工大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 首个中文BabyLM挑战将在2026年自然语言处理与中文计算会议举办,要求用1亿中文词元从头训练语言模型,在自然语言理解、认知对齐和汉字知识三轨道评估,不限分词器、模型架构和训练轮数。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18383 2026-08-14 cs.LG 版本更新 83%

TabH2O: A Unified Foundation Model for Tabular Prediction

TabH2O:用于表格预测的统一基础模型

Pascal Pfeiffer, Dmitry Gordeev, Mathias Müller, Laura Fink, Joan Salvà Soler, Mark Landry, Branden Murray, Marcos V. Conde, Sri Satish Ambati

机构 * H2O.ai

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出TabH2O,一种统一的基础模型,通过上下文学习在单次前向传递中实现分类和回归。该模型基于TabICL架构进行了关键改进,包括统一训练、单阶段预训练和噪声感知预训练,从而在表格数据预测任务中表现出色。

Comments Technical Report - https://tabh2o.h2oai.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05000 2026-08-07 cs.CV cs.LG cs.MM 版本更新 83%

Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes

迈向多模态预训练的物理学:知识流、模态协同、早期统一与方法指南

Junlin Han, Shengbang Tong, David Fan, Minghao Chen, Philip Torr, Filippos Kokkinos, Mike Lewis

机构 * FAIR, Meta(Meta FAIR研究院) Reality Labs, Meta(Meta Reality Labs) University of Oxford(牛津大学)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.LG

AI总结 该研究探索多模态预训练的机制,得出知识流、模态协同等四个关键见解,推导高效预训练方法,为多模态预训练的理解与扩展提供基础。

Comments Project page: https://junlinhan.github.io/projects/physics_of_mm_pretrain/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03949 2026-08-07 cs.CV cs.LG 版本更新 83%

TESSERA v2: Scaling Pixel-wise Earth Foundation Models

TESSERA v2:扩展逐像素地球基础模型

Zhengpeng Feng, Sadiq Jaffer, Ira Shokar, Jovana Knezevic, James Ball, Pedro Sousa, Mark Elvers, Madeline Lisaius, Clement Atzberger, Robin Young, Aneesh Naik, Niall Robinson, David Coomes, Anil Madhavapeddy, Srinivasan Keshav

机构 * University of Cambridge(剑桥大学) NVIDIA(英伟达) dClimate Labs(dClimate实验室)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 研究逐像素地球观测基础模型的扩展及预训练预算分配,通过大规模实验发现预训练损失难预测下游性能,给出计算分配规则,训练并蒸馏模型,其成果优于其他模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.16038 2026-07-30 cs.CL 版本更新 83%

ChineseBERT: Chinese Pretraining Enhanced by Glyph and Pinyin Information

ChineseBERT:通过字形和拼音信息增强的中文预训练模型

Zijun Sun, Xiaoya Li, Xiaofei Sun, Yuxian Meng, Guoyin Wang, Xiang Ao, Qing He, Fei Wu, Jiwei Li

机构 * Zhejiang University(浙江大学) Key Lab of Intelligent Information Processing of Chinese Academy of Sciences(中国科学院智能信息处理重点实验室)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL

AI总结 研究针对中文预训练模型忽略字形和拼音信息的问题,提出ChineseBERT,将二者纳入预训练,在大规模语料库上训练后,在多种中文NLP任务中性能显著提升,取得新SOTA,代码和模型已公开。

Comments To appear at ACL2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03773 2026-07-29 cs.CL 版本更新 83%

KletterMix: Climbing Toward High-Quality German Pretraining Data - The Full Report

KletterMix: 攀登高质量德语预训练数据

Maurice Kraus, Ruben Härle, Sebastian Sztwiertnia, Abbas Goher Khan, Mehdi Ali, Michael Fromm, Nicolas Flores-Herr, Kristian Kersting

机构 * AI & ML Group, TU Darmstadt(人工智能与机器学习小组,德累斯顿技术大学) Lab1141 Lamarr Institute(拉马尔研究所) Fraunhofer IAIS(弗劳恩霍夫人工智能研究所) hessian.AI(海斯坦.AI) German Research Center for AI (DFKI)(德国人工智能研究中心(DFKI)) Centre for Cognitive Science, TU Darmstadt(认知科学中心,德累斯顿技术大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL

AI总结 通过翻译高质量英语语料库构建德语预训练语料库KletterMix,并验证其在德语下游任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04344 2026-07-21 stat.ML cs.LG math.ST stat.TH 版本更新 83%

Perturbation is All You Need for Extrapolating Language Models

扰动是语言模型外推所需的一切

Zetai Cen, Jin Zhu, Xinwei Shen, Chengchun Shi

机构 * School of Mathematics, University of Bristol(布里斯托大学数学系) School of Mathematics, University of Birmingham(伯明翰大学数学系) Department of Statistics, University of Washington(华盛顿大学统计系) Department of Statistics, London School of Economics and Political Science(伦敦政治经济学院统计系)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 本文针对大语言模型外推问题,提出基于扰动的方法,先转换前缀为语义邻域再进行下一个token预测,构建分层模型。通过建立五个属性发展外推性理论,经合成与真实数据评估,该方法提升支持域外预测性能,为语言建模提供实用路径。

Comments 59 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16152 2026-07-21 cs.CR cs.LG 版本更新 83%

Gradient-Free Privacy Leakage in Federated Language Models through Selective Weight Tampering

通过选择性权重篡改在联邦语言模型中实现无梯度隐私泄露

Md Rafi Ur Rashid, Vishnu Asutosh Dasu, Kang Gu, Najrin Sultana, Shagufta Mehnaz

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Dartmouth College(达特茅斯学院)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 研究联邦语言模型中隐私敏感数据泄露问题,发现中间轮次模型快照及恶意参与者篡改选择性权重会加剧泄露,提出无梯度攻击方法,提升了成员推理召回率和私有数据重建率,还给出客户端防御隐私风险的技术建议。

Comments 21 pages (including bibliography and Appendix), Submitted to PETS'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02546 2026-07-03 cs.CV cs.LG 版本更新 83%

RGB-Pointmap Pretraining for Unified 3D Scene Understanding

对比语言-彩色点图预训练用于统一3D场景理解

Ye Mao, Weixun Luo, Ranran Huang, Junpeng Jing, Krystian Mikolajczyk

机构 * Imperial College London(帝国理工学院伦敦分校)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.LG

AI总结 提出UniScene3D,一种基于Transformer的编码器,通过多视图彩色点图联合建模外观和几何,并引入跨视图几何对齐和接地视图对齐,在少样本和任务特定微调中达到SOTA。

Comments 19 Pages, ECCV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10406 2026-07-01 cs.LG 版本更新 83%

Multipole Semantic Attention: A Fast Approximation of Softmax Attention for Pretraining

多极语义注意力:一种用于预训练的Softmax注意力快速近似方法

Rupert Mitchell, Kristian Kersting

机构 * TU Darmstadt(达姆施塔特工业大学) Hessian Center for AI (hessian.AI)(黑森人工智能中心)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.LG

AI总结 提出多极语义注意力(MuSe),通过对查询和键分别聚类实现查询特定的摘要,在64k上下文预训练中加速36%且保持损失不变,无需架构修改,兼容现有预训练模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16757 2026-07-01 eess.AS cs.AI 版本更新 83%

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation

重新审视音频-语言预训练以学习通用音频表示

Wei-Cheng Tseng, Xuanru Zhou, Mingyue Huo, Yiwen Shao, Hao Zhang, Dong Yu

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Zhejiang University(浙江大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Tencent AI Lab Seattle(腾讯AI实验室西雅图)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.AI

AI总结 本文通过构建大规模数据集CaptionStew并系统对比对比学习和字幕生成目标,揭示了音频-语言预训练在数据效率和可扩展性上的权衡,为通用音频表示学习提供了实证指导。

Comments ACL 2026 Main. Code available at https://github.com/AudenAI/Auden

详情

展开后加载摘要…

URL PDF HTML 收藏