Deriving Neural Scaling Laws from the statistics of natural language
从自然语言统计中推导神经缩放定律
专题命中 预训练与数据 :LLM(abstract);分类 cs.AI、cs.LG
AI总结 研究从自然语言统计推导神经缩放定律,分离出语言关键统计属性预测神经缩放指数,给出基于这些统计量的简单公式,与实验测量定律匹配。
Comments ICML 2026
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
从自然语言统计中推导神经缩放定律
专题命中 预训练与数据 :LLM(abstract);分类 cs.AI、cs.LG
AI总结 研究从自然语言统计推导神经缩放定律,分离出语言关键统计属性预测神经缩放指数,给出基于这些统计量的简单公式,与实验测量定律匹配。
Comments ICML 2026
离线到在线强化学习的三种模式
机构 * Mila – Québec AI Institute(魁北克AI研究所) ; Université de Montréal(蒙特利尔大学) ; CIFAR AI Chair(CIFAR人工智能 chair)
专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG
AI总结 研究离线到在线强化学习,基于稳定性-可塑性原理提出框架解释其经验行为不一致性,识别三种在线微调模式,经实证研究验证该框架可指导相关设计选择。
ForAug: 通过受控图像组合缓解图像分类中的偏差
机构 * RPTU University Kaiserslautern-Landau(凯泽斯劳滕-兰道大学) ; German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)
专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI、cs.LG
AI总结 提出ForAug方法,通过将训练图像分解为前景和背景并重新组合,显式控制物体位置、尺度和背景,打破前景-背景相关性,在ImageNet上提升最高6%准确率,并减少捷径学习行为。
Comments v2: DeiT, ablation vs simple copy-paste, v4: more augmentation pipelines, robustness benchmarks, mask quality analysis
通过链式再生放大成员信号
机构 * Warsaw University of Technology(华沙理工大学)
专题命中 预训练与数据 :language model(abstract);分类 cs.AI、cs.LG
AI总结 提出MADreMIA框架,利用链式再生迭代轨迹增强生成模型的成员推断和数据集推理攻击,在低误报率下提升信号强度。
FinInvest-GTCN:用于风险感知投资决策优化的可解释图-时间-因果建模
机构 * Department of Computer Science(计算机科学系)
专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.LG
AI总结 提出FinInvest-GTCN模型,结合图编码、多尺度时序融合和因果决策头,解决风投决策中的异构数据、非平稳时序和可解释性挑战,在私有数据集上RA-MSE降至2.51,模拟组合收益提升18.7%。
Comments 28 pages
面向视觉-语言场景的迭代自过滤数据选择
机构 * Mila, Université de Montréal(蒙特利尔大学Mila实验室)
专题命中 预训练与数据 :language model(abstract);分类 cs.AI、cs.LG
AI总结 提出一种自举式方法,通过迭代训练CLIP模型并自选择改进的数据混合,无需额外数据或预训练模型即可提升下游性能。
SCRUB-FL:通过遗忘后门来净化和清洗表示
机构 * Polytechnique Montréal(蒙特利尔综合理工学院) ; Khalifa University(哈利法大学)
专题命中 预训练与数据 :post-training(abstract);分类 cs.AI、cs.LG
AI总结 提出SCRUB-FL,一种两阶段后门移除方法,在训练时通过谱分析和激活聚类检测可疑样本并训练WGAN-GP捕获触发分布,收敛后利用机器遗忘合成近似触发样本并消除触发-目标关联,在CIFAR-10和GTSRB上后门攻击成功率降至3.88%,正常任务准确率超91%。
Comments 14 pages, 3 tables, 1 algorithm, 4 figures
PoLAR:分解潜在动作中的程度和模式用于机器人策略学习
机构 * Seoul National University(首尔国立大学)
专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG
AI总结 提出PoLAR方法,通过径向方向结构分解潜在动作中的程度和模式,利用时间偏移作为程度代理,在双曲空间中实现,提升下游策略性能。
Comments Project Page: https://joon-stack.github.io/PoLAR
MindAlign: 在有限数据下通过多模态嵌入对齐从fMRI信号解码内心语言
机构 * Graduate School of Humanities and Sciences Ochanomizu University(大仓山大学人文科学研究生院) ; Center for Information and Neural Networks Advanced ICT Research Institute National Institute of Information and Communications Technology(信息与神经网络中心先进信息通信研究机构信息通信技术研究所)
专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI
AI总结 提出MindAlign两阶段框架,通过神经-语义对齐将fMRI信号映射到多模态语义空间,再结合视觉上下文冻结多模态语言模型生成文本,在静默图像描述数据上优于基线,且语义-语言投影可跨被试泛化。
Comments Preprint. Under review
Morpheus: 一种面向土耳其语的形态感知神经分词器和词嵌入器
机构 * Independent Researcher(独立研究者)
专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI
AI总结 针对土耳其语粘着特性,提出Morpheus神经词素边界模型,实现无损可逆分词与结构化词嵌入,在可逆分词器中达到最低比特每字符(1.425),词素对齐F1提升至0.61,GPU内存节省约19%。
处理特征异质性:可学习图块方法
机构 * Zhejiang University(浙江大学) ; Huazhong University of Science and Technology(华中科技大学) ; Finvolution Group(信也科技集团)
专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI、cs.LG
AI总结 提出可学习图块概念,将图分解为语义单元,通过补丁编码器和聚合器实现跨域图数据的可迁移预训练,提升下游任务性能。
Comments Accepted at KDD 2025
GOT-JEPA:基于联合嵌入预测架构的通用目标跟踪与模型自适应及遮挡处理
机构 * Department of Computer Science, National Yang Ming Chiao Tung University(国家阳明交通大学计算机科学系) ; Research Center for Information Technology Innovation, Academia Sinica(中华学术院信息技术创新研究中心) ; Microsoft AI(微软人工智能)
专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG
AI总结 提出GOT-JEPA框架,通过预测跟踪模型而非图像特征来提升泛化能力,并设计OccuSolver增强遮挡感知,在七个基准上验证了有效性。
Comments Accepted by IEEE Transactions on Circuits and Systems for Video Technology (TCSVT). This research focuses on learning model adaptation for adverse and dynamic environments, as well as fine-grained occlusion perception for tracking
Journal ref IEEE Transactions on Circuits and Systems for Video Technology 2026
扩展人类与G2P监督以实现鲁棒语音转录
机构 * Koel Labs LLC
专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.LG
AI总结 研究自动语音转录中人类标注与G2P监督的扩展规律,发现当人类标注少于20-30小时时G2P有效,超过后无益甚至降低鲁棒性,而ASR预训练可显著提升性能。
Comments Accepted to Interspeech 2026
当生成器回放退化时:面向异构联邦类增量学习的投影排练编排
机构 * VinUniversity ; VNU-HCM, University of Science(胡志明市国家大学理科大学) ; Technische Universität Berlin(柏林工业大学)
专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG
AI总结 针对异构联邦类增量学习中客户端标签子集不同、任务阶段不一致导致的旧知识遗忘问题,提出投影排练编排框架PRO及增强版PRO-MAX,通过服务器端维护紧凑类级投影记忆并实现平衡伪多任务训练,在图像、文本和图基准上提升异构流下的保留与最终效用。
Comments 46 pages
FastMix: 通过梯度下降实现快速数据混合优化
机构 * University of Hong Kong(香港大学) ; Tencent(腾讯) ; Chinese University of Hong Kong(香港中文大学)
专题命中 预训练与数据 :post-training(abstract);分类 cs.AI、cs.LG
AI总结 提出FastMix框架,将数据混合选择重新表述为双层优化问题,通过联合优化混合系数和模型参数,实现高效、可扩展的数据混合发现,在预训练和后训练中均优于基线方法且大幅降低搜索成本。
Journal ref ICLR-2026
不同层,不同流形:Transformer优化中的模块级权重空间几何
机构 * School of Engineering Science, The University of Osaka(大阪大学工程科学学院)
专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG
AI总结 研究Transformer不同模块偏好不同流形几何,提出为注意力层和MLP层分别分配Stiefel和DGram约束,在GPT-2预训练中取得最佳性能。
Comments Accepted at WSS @ ICML 2026, code is available at https://github.com/kiratoyoshihara/module-wise-manifold-muon
合成住宅:数据稀缺下用于住宅建筑数据生成的多模态生成式AI管道
机构 * Lafayette University(拉法叶大学) ; Georgia State University(佐治亚州立大学)
专题命中 预训练与数据 :LLM(abstract_cn);分类 cs.AI、cs.LG
AI总结 提出一个多模态生成式AI框架,整合图像、表格和模拟组件,从公开记录和图像生成合成住宅建筑数据集,以解决建筑参数数据稀缺问题。
Comments 33 pages; 2 appendices; 6 figures; 4 tables. Code available at https://github.com/Lafayette-EshbaughSilveyra-Group/synthetic-homes
Journal ref Machine Learning with Applications, 25 (2026), 100959
Neural FOXP2——面向大型语言模型目标语言改进的语言特定神经元引导
机构 * Meta, USA(Meta, 美国) ; Apple, USA(Apple, 美国) ; Pragya Lab, BITS Pilani Goa, India(Pragya实验室,BITS Pilani Goa,印度)
专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.AI
AI总结 提出Neural FOXP2方法,通过定位语言神经元、计算引导方向和施加稀疏激活偏移,将模型默认语言从英语切换为印地语或西班牙语,实现可控的语言主导性。
噪声引导的模仿学习传输方法
机构 * University of Cambridge(剑桥大学) ; University of Oxford(牛津大学)
专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG
AI总结 针对低数据场景下的模仿学习,提出噪声引导传输(NGT)方法,通过对抗训练将模仿问题转化为最优传输问题,无需预训练或特殊架构,在极低数据量下实现强性能。
Comments Accepted at ICML 2026. Code: https://github.com/lionelblonde/ngt
FOGO:遗忘感知正交化优化器
机构 * School of Computer Science and Engineering, University of New South Wales(新南威尔士大学计算机科学与工程学院) ; Department of Data Science & AI, Monash University(莫纳什大学数据科学与人工智能系) ; DEVCOM Army Research Laboratory(DEVCOM陆军研究实验室)
专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG
AI总结 提出FOGO优化器,通过谱正交化动量更新并利用紧凑码本记忆解决梯度干扰,在类别不平衡、持续学习和大模型微调等场景中提升收敛与知识保留。
CodeAlchemy:大规模合成代码重写
机构 * MIT-IBM Watson AI Lab, IBM Research(MIT-IBM沃森人工智能实验室,IBM研究院)
专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.LG
AI总结 提出CodeAlchemy框架,通过5种策略生成超过500B token的合成代码数据,引入DevEval和TraceEval基准,3B模型在多项任务上超越10倍大小的前沿模型。
从流程图学习:用于流程图自动补全的生成式Transformer模型
机构 * University of Freiburg(弗赖堡大学)
专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.LG
AI总结 受文本自动补全启发,提出基于SFILES 2.0字符串表示和Transformer语言模型的化工流程图自动补全方法,通过预训练和微调实现交互式流程图合成辅助。
Journal ref Computers and Chemical Engineering Volume 171, March 2023, 108162
STREAM: 用于数字组织病理学图像生成的随机黎曼流匹配与各向异性解码器
机构 * DEEPNOID Inc.(DEEPNOID公司)
专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI、cs.LG
AI总结 提出STREAM框架,利用组织病理学视觉基础模型的patch-token特征作为潜在空间,通过黎曼流匹配生成高质量组织病理学图像,解决条件崩溃问题,并设计各向异性解码器提升生成质量。
Comments 27 pages, 7 figures
高速公路立交匝道流量预测的代理重建预训练
机构 * Southeast University(东南大学) ; Institute of Telecommunications and Information Sciences, China(中国电信与信息科学研究院)
专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG
AI总结 提出时空解耦自编码器(STDAE),通过跨模态重建预训练从主线数据恢复匝道流量,结合GWNet等模型提升预测精度,在真实数据集上超越13个基线。
Comments Accepted at Applied Soft Computing Journal
Journal ref Applied Soft Computing Journal 200 (2026) 115462
上下文多实例学习
机构 * Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所) ; Machine Learning Group, Technische Universität Berlin(柏林技术大学机器学习小组) ; Aignostics ; Institute of Pathology, Charité – Universitätsmedizin Berlin(柏林查理医院病理研究所) ; Max-Planck Institute for Informatics(马克斯·普朗克信息研究所) ; Department of Artificial Intelligence, Korea University(韩国大学人工智能系)
专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种基于感知器架构的上下文学习器,通过合成数据预训练,无需梯度更新即可从少量标记包中解决新的多实例学习任务,在12个基准上超越需任务特定训练的监督基线。
双重预处理 (DoPr):针对测试时性能而非验证损失的优化
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; University of Cambridge(剑桥大学) ; DeepMind(深度Mind) ; Google Research(谷歌研究)
专题命中 预训练与数据 :language model(abstract);分类 cs.AI、cs.LG
AI总结 提出双重预处理优化范式,通过结合梯度级和激活级预处理,缓解自回归语言建模等场景中训练/验证损失与下游指标不匹配的测试时反馈问题,提升测试时性能而不一定改善验证损失。
频谱探测电路:识别预训练Transformer中注意力头电路的三步法
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG
AI总结 提出一种三步法,通过频谱信号排序、任务模式筛选和组消融因果验证,无需标签即可识别预训练Transformer中执行持续内容依赖计算的注意力头电路,并在多个模型上验证了其通用性和因果必要性。
Comments 35 pages, 4 figures
多样性是否是可扩展机器人操作的全部需求?
机构 * University of Science and Technology of China(中国科学技术大学) ; Tsinghua University(清华大学) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI、cs.LG
AI总结 本文研究了数据多样性在机器人学习中的作用,发现任务多样性比单任务演示量更重要,多身体预训练数据在跨身体转移中可选,专家多样性可能对策略学习产生干扰,提出分布去偏方法提升性能。
Comments Code is available at https://github.com/OpenDriveLab/AgiBot-World
构建机器智能的物理AI层
机构 * MIT Lincoln Laboratory(麻省理工学院林肯实验室)
专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI、cs.LG
AI总结 提出基于信号处理原理的基座模型,通过射频数据训练实现跨模态迁移,无需目标域微调,以1.99M参数在15个任务上平均准确率77.7%。
Comments 102 pages, 11 Figures
视觉语言模型能预测未来状态吗?从逆动力学引导世界模型
机构 * Institute for Language, Cognition and Computation, University of Edinburgh(语言、认知与计算研究所,爱丁堡大学) ; Language Technology Lab, University of Cambridge(语言技术实验室,剑桥大学) ; NVIDIA(NVIDIA公司) ; University of Groningen(格罗宁根大学)
专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI
AI总结 本文发现视觉语言模型(VLM)难以直接进行前向动力学预测(FDP),但逆动力学预测(IDP)更容易学习,并利用IDP通过弱监督学习和推理时验证两种策略引导FDP,在Aurora-Bench上取得与最先进图像编辑模型竞争的性能。