arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-09-01 至 2026-09-01 共收录 438 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 30 篇

2604.22938 2026-09-01 cond-mat.mtrl-sci cs.CL cs.LG 版本更新 91%

Large language model-enabled automated data extraction for concrete materials informatics

基于大语言模型的混凝土材料信息学自动化数据提取

Zhanzhao Li, Kengran Yang, Qiyao He, Kai Gong

机构 * Department of Civil and Environmental Engineering, Rice University(Rice大学土木与环境工程系) Rice Advanced Materials Institute, Rice University(Rice大学先进材料研究所) Ken Kennedy Institute, Rice University(Rice大学肯尼迪研究所) Independent researcher(独立研究员)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出一种基于大语言模型的自动化数据提取方法,用于从非结构化科学文献中提取混凝土材料数据,构建了最大的开放实验室数据库,提升了材料信息学的数据基础设施发展。

Comments 46 pages, including Supplementary Information; accepted for publication in npj Computational Materials

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09115 2026-09-01 cs.CL 版本更新 90%

SinLlama -- A Large Language Model for Sinhala

SinLlama —— 僧伽罗语专用大语言模型

H. W. K. Aravinda, Rashad Sirajudeen, Samith Karunathilake, Nisansa de Silva, Surangika Ranathunga, Rishemjit Kaur

机构 * Central Scientific Instruments Organisation, Academy of Scientific and Innovative Research(中央科学仪器组织,科学与创新研究院) School of Mathematical and Computational Sciences, Massey University(数学与计算科学学院,梅西大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究针对僧伽罗语这类低资源语言被开源大模型忽视的问题,扩展Llama-3-8B得到支持僧伽罗语的SinLlama,其在文本分类任务中性能显著优于原模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24080 2026-09-01 cs.CL cs.AI 版本更新 90%

When Less Is More: An Empirical Study of Minimal Responses in Counseling Dialogues and the Behavior of LLMs

少即是多:心理咨询对话中极简回应与大语言模型(LLM)行为的实证研究

Zhiyang Qi

机构 * The University of Tokyo(东京大学)

专题命中 预训练与数据 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过实证研究发现,心理咨询对话中常见的极简回应在LLM生成内容中占比极低,商业LLM可按指令生成此类回应但难判断适用时机,专用模型表现差且基于LLM的评估易低估其价值。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15052 2026-09-01 cs.CL cs.AI 版本更新 90%

SGM: Safety Glasses for Multimodal Large Language Models via Neuron-Level Detoxification

SGM: 通过神经层面的净化为多模态大语言模型提供安全眼镜

Hongbo Wang, AprilPyone MaungMaung, Isao Echizen

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 SGM通过神经层面的净化技术,有效降低多模态大语言模型的毒性,同时保持生成流畅性和推理能力。

Comments Accepted to the EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15236 2026-09-01 cs.CL 版本更新 89%

MAPLE: Metadata Conditioned LLM Pretraining for Locale-Aware Question Answering

具有元数据条件的大型语言模型用于本地化

Anjishnu Mukherjee, Ziwei Zhu, Antonios Anastasopoulos

机构 * Department of Computer Science, George Mason University(计算机科学系,乔治·马歇尔大学)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出通过元数据条件来提升大型语言模型的本地化能力,通过预训练和实验验证了其在不同区域表现的提升效果和效率优势。

Comments Published as a conference paper at EMNLP 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30407 2026-09-01 cs.CL cs.AI cs.IR cs.LG 版本更新 89%

Exploring Autonomous Agentic Data Engineering for Model Specialization

探索用于模型专业化的自主智能体数据工程

Yujie Luo, Xiangyuan Ru, Jingsheng Zheng, Jingjing Wang, Yuqi Zhu, Jintian Zhang, Runnan Fang, Kewei Xu, Ye Liu, Zheng Wei, Jiang Bian, Zang Li, Shumin Deng

机构 * Zhejiang University(浙江大学) Platform and Content Group, Tencent(腾讯平台与内容部)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出自主智能体数据工程任务,让LLM作为自主数据工程师,通过端到端数据策划驱动模型专业化,实验显示GPT-5.2通过迭代数据适应使学生模型性能提升57.29%。

Comments Accepted by EMNLP 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10690 2026-09-01 cs.CL 版本更新 89%

Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?

已发布的大语言模型词汇表能否支持隐藏语料库的词元级估计?

Qingjie Zhang, Xingzhang Ren, Zixuan Chen, Jinfeng Li, YueFeng Chen, Yitong Yang, Hui Xue, Dayiheng Liu, Han Qiu

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团)

专题命中 预训练与数据 :LLM(title,summary_cn);pretraining(abstract);分类 cs.CL

AI总结 该研究针对隐藏语料库的词元级估计问题,提出分位数引导密度估计(QGDE)方法,利用已发布的LLM分词器词汇表实现了低误差的细粒度语料估计,为相关任务提供了新的有效信号来源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04483 2026-09-01 cs.CL 版本更新 86%

Voices Across Registers: Corpus-Conditioned Vernacular Jailbreaks against Aligned LLMs via Fanfiction Subgenres

分布外声音:同人小说子类型作为对齐LLM的通用白话越狱

Zhongze Luo, Ruihe Shi, Zhenshuai Yin, Haoyue Liu, Weixuan Wan, Xiaoying Tang

机构 * School of Science and Engineering, The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)科学与工程学院) The Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来网络智能研究院) The Guangdong Provincial Key Laboratory of Future Networks of Intelligence(广东省未来网络智能重点实验室) School of Microelectronics, Xi’an Jiaotong University(西安交通大学微电子学院)

专题命中 预训练与数据 :LLM(title_cn,summary_cn);分类 cs.CL

AI总结 本文发现安全训练覆盖不足的自然人类写作语域是对齐LLM的真正失败模式,并提出首个利用真实同人小说子类型作为通用攻击载体的越狱方法,显著提升攻击成功率。

Comments Accepted by EMNLP 2026 Main Conference, 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27954 2026-09-01 cs.CR cs.AI cs.LG 版本更新 86%

Not to Break, but to Attest: Adversarial Probes for Privacy-Preserving LLM Verification

不破坏,而是验证:用于隐私保护大语言模型验证的对抗探针

Cameron Wilding, Mina Shaker, Fatemeh Ganji

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出基于zk-SNARK的隐私保护审计框架,构建三类互补探针验证大语言模型,实验表明黑盒场景下的基于token的探针灵敏度最优,且Groth16 zk-SNARK工作流具备良好实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11290 2026-09-01 cs.CL 版本更新 85%

Polyglot Teachers: Evaluating Language Models for Multilingual Synthetic Data Generation

多语言教师:评估语言模型用于多语言合成数据生成

Lester James V. Miranda, Ivan Vulić, Anna Korhonen

机构 * Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室)

专题命中 预训练与数据 :language model(title,abstract);SFT(abstract,abstract_cn);分类 cs.CL

AI总结 本文评估了多语言教师模型的有效性,通过Polyglot Score衡量数据质量和学生模型表现,发现Gemma 3和Aya Expanse在不同学生模型家族中表现优异,数据质量如提示多样性、长度和响应流畅度对教学效果影响显著。

Comments Accepted to EMNLP 2026 Main Track. Website is in https://ljvmiranda921.github.io/polyglot-teachers/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14086 2026-09-01 cs.CV cs.AI cs.CL 版本更新 85%

Error-Driven Scene Editing for 3D Grounding in Large Language Models

面向大语言模型中3D grounding的错误驱动场景编辑

Yue Zhang, Zun Wang, Han Lin, Jialu Li, Jianing Yang, Yonatan Bitton, Idan Szpektor, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) University of Michigan(密歇根大学) Google Research(谷歌研究)

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 针对3D大语言模型的空间grounding偏差问题,提出错误驱动框架DEER-3D,通过结构化循环生成针对性反事实训练示例,在多基准上实现4%-6%的性能增益。

Comments Accepted by ECCV 2026. Code: https://github.com/zhangyuejoslin/Deer-3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20371 2026-09-01 cs.CY cs.AI cs.CL cs.LG 版本更新 85%

Gender, Race, and Intersectional Bias in Resume Screening via Language Model Retrieval

通过语言模型检索的简历筛选中的性别、种族及交叉性偏见

Kyra Wilson, Aylin Caliskan

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过模拟求职者选拔的文档检索框架,发现Massive Text Embedding(MTE)模型在简历筛选中存在性别、种族及交叉性偏见,偏向白人姓名,黑人男性在所有案例中均受不利影响,为相关AI工具的公平性改进提供了依据。

Comments Proceedings of the 2024 AAAI/ACM Conference on AI, Ethics, and Society; code available at https://github.com/kyrawilson/Resume-Screening-Bias Revised 8/29/2026 to include errata description Revised 8/29/2026 to include description of errata

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26178 2026-09-01 cs.CL 版本更新 84%

DuplexGen: Adaptive Synthesis of Human-AI Turn-Taking Dialogues

DuplexGen:人机交替对话的自适应合成

Takyoung Kim, Kang-wook Kim, Sang Hoon Woo, Julia Hirschberg, Gunhee Kim, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Seoul National University(首尔大学) Columbia University(哥伦比亚大学) University of California, Berkeley(加州大学伯克利分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 预训练与数据 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.CL

AI总结 DuplexGen框架通过将LLM预测与少量槽级人类偏好标注校准,生成场景自适应交替发言对话,契合人类偏好的效果优于未校准方法,证明人类校准对交替发言合成场景特定性的关键作用。

Comments EMNLP 2026; Project website: https://duplexgen.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00613 2026-09-01 cs.CL cs.AI 版本更新 84%

Linguistics-Aware Non-Distortionary LLM Watermarking

语言学感知的无失真LLM水印

Shinwoo Park, Hyejin Park, Hyeseon An, Yo-Sub Han

机构 * Yonsei University(延世大学) Rensselaer Polytechnic Institute(罗切斯特理工学院)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出LUNA水印方法,通过语言自适应非失真二元锦标赛采样器,在保持文本质量的同时实现高检测性能,在12种设置中AUROC达0.9959且中位困惑度偏移仅0.045。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26576 2026-09-01 cs.CL 版本更新 83%

Double Trouble: Bilingual Pretraining Leaves Language-Conditioned Effects in Shared-Language Representations

双重麻烦:双语预训练会在共享语言表征中留下语言条件效应

Anjishnu Mukherjee, Ziwei Zhu, Antonios Anastasopoulos

机构 * George Mason University(乔治梅森大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL

AI总结 该研究发现仅解码器多语言模型中,双语预训练会使共享语言的深层隐藏状态表征存在差异,嵌入对齐无法掩盖该差异,这对依赖对齐模型的下游研究有重要影响。

Comments Published as a conference paper at EMNLP 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06892 2026-09-01 cs.LG 版本更新 83%

GRASP: Geometry-aware Residual Alignment for Scalable Pretraining Data Attribution

GRASP:面向可扩展预训练数据归因的几何感知残差对齐

Yue Min, Ruining Chen, Yujun Li

机构 * Wizard Quant University of Science and Technology of China(中国科学技术大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.LG

AI总结 提出GRASP方法,通过二次几何惩罚建模子集交互,结合低维特征草图与有限置信度选择协议,实现可扩展的预训练数据归因,显著提升反事实子集保真度并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07571 2026-09-01 cs.CL cs.MM 版本更新 83%

A Simple Method to Enhance Pre-trained Language Models with Speech Tokens for Classification

一种通过语音标记增强预训练语言模型用于分类的简单方法

Nicolas Calbucura, Jose Guillen, Valentin Barriere

机构 * Universidad de Chile, DCC(智利大学计算机科学系) Universidad Tecnica Santa Maria(圣玛利亚理工大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文提出一种简单方法,通过语音信息增强预训练语言模型以提高分类任务性能,采用多模态词袋表示和自监督语言建模目标,实验证明在论证谬误检测和情感计算任务中效果显著。

Comments Findings of ACL, EMNLP26

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22343 2026-09-01 stat.ML cs.CL cs.LG stat.ME 版本更新 82%

Optimal Estimation of Watermark Proportions in Hybrid AI-Human Texts

混合AI-人类文本中水印比例的最优估计

Xiang Li, Garrett Wen, Weiqing He, Jiayuan Wu, Qi Long, Weijie J. Su

机构 * University of Pennsylvania(宾夕法尼亚大学) Yale University(耶鲁大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文针对混合AI-人类文本的水印比例估计问题,基于核心统计量构建混合模型,提出高效估计量,证明其达到极小极大下界,在合成数据与开源模型生成的混合文本上均实现高估计精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08698 2026-09-01 cs.LG q-bio.GN 版本更新 79%

EvoLen: Evolution-Guided Tokenization for DNA Language Model

EvoLen:基于进化的标记化方法用于DNA语言模型

Nan Huang, Xiaoxiao Zhou, Junxia Cui, Mario Tapia-Pacheco, Tiffany Amariuta, Yang Li, Jingbo Shang

机构 * University of California, San Diego(加州大学圣地亚哥分校) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.LG

AI总结 EvoLen通过整合进化信息优化DNA标记化,优先保留功能序列模式,提升基因组上下文区分和进化约束对齐,优于标准BPE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07120 2026-09-01 cs.CL 版本更新 79%

Anchored Decoding: Provably Reducing Copyright Risk for Any Language Model

锚定解码:可证明降低任何语言模型的版权风险

Jacqueline He, Jonathan Hayase, Wen-tau Yih, Sewoong Oh, Luke Zettlemoyer, Pang Wei Koh

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 提出锚定解码,一种即插即用的推理时方法,通过将生成内容约束在许可训练的安全模型附近,可证明地抑制语言模型逐字复制受版权保护的内容,实现可调的风险-效用权衡。

Comments Accepted to ICML 2026. 53 pages, 14 figures, 22 tables. Code is publicly available at https://github.com/jacqueline-he/anchored-decoding

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28308 2026-09-01 cs.LG cs.AI 版本更新 79%

Deriving Scaling Laws for OpenEuroLLM Models: Learning Rate, Batch Size and Loss

推导OpenEuroLLM模型的缩放定律:学习率、批量大小与损失

Niccolò Ajroldi, Diana Alexandra Onutu, Haider Al-Tahan, Jörg Franke, Sampo Pyysalo, Jenia Jitsev, Aaron Klein

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对OpenEuroLLM模型,探究预训练时学习率与批量大小的缩放规律,开发相关模型并评估损失的缩放形式,建立基线与缩放程序并开源预训练运行集合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06022 2026-09-01 cs.CL cs.AI 版本更新 79%

AdaFuse: Adaptive Ensemble Decoding with Test-Time Scaling for LLMs

AdaFuse: 用于大语言模型的自适应集成解码与测试时缩放

Chengming Cui, Tianxin Wei, Ziyi Chen, Ruizhong Qiu, Zhichen Zeng, Zhining Liu, Xuying Ning, Duo Zhou, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 AdaFuse通过自适应集成解码与测试时缩放,提升大语言模型在多种任务上的生成性能。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23648 2026-09-01 cs.CL 版本更新 77%

EmoTrace: An Emotion Trajectory-Centered Framework for Psychological Support Dialogue Generation

EmoTrace:一种以情感轨迹为中心的心理支持对话生成框架

Kaitong Weng, Lixin Liu, Zihao Liu, Bo Wang, Shiguang Ni

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对现有心理支持对话数据生成方法的局限,提出EmoTrace框架,通过构建求助者认知概况及相关模块,以模拟其情感轨迹,增强情感表达层次性,实验证明该方法在情感丰富度和共情质量上优于现有方法。

Comments 36 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08025 2026-09-01 cs.CL 版本更新 77%

Arabic Sentence Segmentation Across Genres and Punctuation Conditions

跨体裁与标点条件下的阿拉伯语句子分割

Mohammed Elkholy, Khalid N. Elmadani, Nizar Habash, Bashar Alhafni

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·泽德人工智能大学) New York University Abu Dhabi(纽约大学阿布扎比分校)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 针对阿拉伯语标点歧义和不一致导致的句子分割难题,构建跨8种体裁的语料库AraSEG,评估LLM、轻量编码器和依存解析器,发现轻量模型在困难设置下优于LLM,且准确分割能显著提升下游依存解析。

Comments Accepted to EMNLP Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08289 2026-09-01 cs.CR 版本更新 75%

MIRAGE: Misleading Retrieval-Augmented Generation via Black-box and Query-agnostic Poisoning Attacks

MIRAGE: 通过黑盒与查询无关的投毒攻击误导检索增强生成

Tailun Chen, Yu He, Yan Wang, Shuo Shao, Haolun Zheng, Zhihao Liu, Jinfeng Li, Zhizhen Qin, Yuefeng Chen, Zhixuan Chu, Zhan Qin, Kui Ren

专题命中 预训练与数据 :LLM(abstract,abstract_cn);preference optimization(abstract)

AI总结 提出MIRAGE,一种在黑盒和查询无关场景下通过多阶段投毒管道攻击RAG系统的方法,利用代理模型反馈、人物驱动查询合成、语义锚定和对抗性TPO优化,显著提升攻击效果和隐蔽性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20873 2026-09-01 cs.LG 版本更新 74%

In-Cell Learning: Language Models That Update Their Own Weights in Sequence Without Changing the File They Ship

除模型外一切未变:CellFill——针对量化大语言模型的比特一致、可撤销更新的单元内受限学习

Zifeng Liu, Yaxin Lu, Xuanhan Wu, Zhiyong Du, Yiming Mao, Zhenhe Wang, Wenqi Shi, Zhengkun Jing, Linwei Liu

机构 * Institute for Frontier Interdisciplinary Research in Health Sciences and Technology, Sun Yat-sen University(中山大学健康科学与技术前沿交叉研究院) Guangdong Engineering Research Center of Medical Artificial Intelligence Multimodal System(广东省医学人工智能多模态系统工程研究中心) Sun Yat-sen University(中山大学) School of Business, Sun Yat-sen University(中山大学商学院) School of Computer Science, China University of Geosciences (Wuhan)(中国地质大学(武汉)计算机学院) School of Public Health, Sun Yat-sen University(中山大学公共卫生学院) Hospital of Stomatology, Sun Yat-sen University(中山大学口腔医院) Big Data and Artificial Intelligence Center, The Third Affiliated Hospital of Sun Yat-sen University(中山大学附属第三医院大数据与人工智能中心)

专题命中 预训练与数据 :language model(title);分类 cs.LG

AI总结 CellFill方法通过在量化决策单元内写入残差实现量化大语言模型的比特一致、可撤销更新,实验显示其在召回率接近基准的同时降低跨域遗忘,且可迁移至27B混合线性注意力模型。

Comments 94 pages, 14 figures, 22 tables. Technical Report, version 3. Code and archived artifacts: https://github.com/sumsliu/in-cell-learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11660 2026-09-01 cs.LG 版本更新 70%

Bergson: An Open Source Library for Data Attribution

Bergson:一个用于数据归因的开源库

Lucia Quirke, Louis Jaburi, David Johnston, William Z. Li, Gonçalo Paulo, Guillaume Martres, Girish Gupta, Stella Biderman, Nora Belrose

机构 * EleutherAI Independent

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出Bergson开源库,支持大规模语言模型和预训练数据集的多种数据归因方法,提供磁盘梯度存储和多节点分布式训练,首次开源实现MAGIC、SOURCE和TrackStar三种方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12335 2026-09-01 cs.CV cs.LG 版本更新 70%

SynMulti: Synthetic-to-Real Learning for Multimodal Video Understanding

一站式:一个多模态视频理解统一合成数据管道

Tanzila Rahman, Renjie Liao, Leonid Sigal

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute for AI(向量人工智能研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出统一合成数据管道,用于生成多模态视频数据,支持多种任务格式,提升模型推理能力,并在视频物体计数、视觉问答和分割任务中验证了其有效性。

Comments 14 Pages, 4 Tables, 4 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12165 2026-09-01 cs.CL 版本更新 57%

QAQ: Bidirectional Semantic Coherence for Selecting High-Quality Synthetic Code Instructions

QAQ:双向语义一致性用于选择高质量的合成代码指令

Jiayin Lei, Ming Ma, Yunxi Duan, Chenxi Li, Tianming Yang

专题命中 预训练与数据 :LLM(abstract_cn);分类 cs.CL

AI总结 本文提出QAQ框架,通过双向语义一致性评估合成数据质量,利用反向互信息量化答案对查询的信息增益,实验表明选择25%数据可达到全数据训练效果,提升数据筛选效率。

Comments 14 pages, 5 figures. EMNLP 2026 (Main track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00418 2026-09-01 cs.LG math-ph math.MP nlin.PS physics.flu-dyn 版本更新 57%

Structure-Preserving Physics-Informed Neural Network for the Korteweg--de Vries (KdV) Equation

用于Korteweg - de Vries(KdV)方程的结构保持物理信息神经网络

Victory Obieke, Emmanuel Oguadimma

机构 * Oregon State University(俄勒冈州立大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 针对KdV方程,提出结构保持物理信息神经网络框架,将质量和能量守恒嵌入损失函数,采用正弦激活函数,经案例和消融研究表明该方法能有效再现KdV动力学行为,加速收敛,提高稳定性,无需多阶段预训练。

Comments 9 Pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏