Towards End-to-end Speech-to-text Summarization
专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted to the 26th International Conference of Text, Speech and Dialogue (TSD2023)
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted to the 26th International Conference of Text, Speech and Dialogue (TSD2023)
专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments ICML 2023
专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)
专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 10 pages
专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
Comments BlackboxNLP Workshop at EMNLP 2022
专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted at NeurIPS 2022 (Oral). Code is available at: https://github.com/deepmind/emergent_in_context_learning
专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments V2 has updated references/related work
专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted to AACL-IJCNLP 2022: The 2nd Conference of the Asia-Pacific Chapter of the Association for Computational Linguistics and the 12th International Joint Conference on Natural Language Processing, November 20-23, 2022. See https://www.aacl2022.org/
专题命中 预训练与数据 :large language model(abstract);language model(abstract);prompting(abstract)
Comments This work will appear in the 35th Annual ACM Symposium on User Interface Software and Technology (UIST '22)
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)
专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
Comments ICLR 2022 Spotlight. Github repo: https://github.com/ysymyth/ec-nl
专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted at EMNLP 2020
机构 * University of Freiburg(弗赖堡大学) ; ELLIS Institute Tübingen(图宾根ELLIS研究所) ; Open-Sci Collective(开放科学集体) ; LAION ; Prior Labs(Prior实验室)
专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG;foundation model(comments)
Comments Presented at 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop on Continual and Compatible Foundation Model Updates (CCFM)
专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG;foundation model(comments)
Comments Accepted by the Foundation Models for Decision Making workshop at NeurIPS 2023
专题命中 预训练与数据 :pretraining(abstract,comments);language model(abstract);分类 cs.CL、cs.AI
Comments Code is available at https://github.com/amazon-science/prompt-pretraining
双重麻烦:双语预训练会在共享语言表征中留下语言条件效应
机构 * George Mason University(乔治梅森大学)
专题命中 预训练与数据 :pretraining(title);分类 cs.CL
AI总结 该研究发现仅解码器多语言模型中,双语预训练会使共享语言的深层隐藏状态表征存在差异,嵌入对齐无法掩盖该差异,这对依赖对齐模型的下游研究有重要影响。
Comments Published as a conference paper at EMNLP 2026 (Main)
从假到真:基于平衡合成图像的预训练以防止图像识别中的虚假相关性
专题命中 预训练与数据 :pretraining(title);分类 cs.LG
AI总结 针对图像识别模型易受虚假相关性影响的问题,提出从假到真(FFR)两步训练流程,先在平衡合成数据预训练,再用真实数据微调,在三个数据集上使最差组准确率较SOTA提升最高20%
Comments Accepted at ECCV 2024
基于LeJEPA自监督预训练的仅注意力白盒Transformer
专题命中 预训练与数据 :pretraining(title);分类 cs.LG
AI总结 本研究提出基于LeJEPA自监督预训练的仅注意力白盒Transformer,减少约31%参数,在CIFAR-10、CIFAR-100上实现与原模型相当的准确率,还发现标准ViT中MLP模块存在冗余。
在调用图上进行预训练:当二进制分析任务从上下文获益时
专题命中 预训练与数据 :pretraining(title);分类 cs.LG
AI总结 本研究探究调用图对二进制分析任务的影响,发现结合过程间上下文可提升嵌入鲁棒性但未必泛化到下游任务,且对命名空间相关函数更有益。
Comments 12 pages, 5 figures. Accepted at ICPC '26
Journal ref Proceedings of the 34th IEEE/ACM International Conference on Program Comprehension, pp. 14-25, 2026
聆听、调用与理解:面向大型音频语言模型的技能调用多模态智能体
专题命中 预训练与数据 :language model(title);分类 cs.AI
AI总结 本研究针对工具交互型音频推理问题,开发了SpeechAgent-R智能体,构建了HIU-Corpus与HIU-Bench,经实验验证其在分布内外任务上均较基础模型有显著性能提升。
面向泰米尔语语言模型的形态学感知可逆语义分词与分层词组合
专题命中 预训练与数据 :language model(title);分类 cs.CL
AI总结 该研究针对泰米尔语,提出结合ThamizhiMorph的形态系统与分层词组合方法,在固定小模型预算下提升翻译性能,同时大幅降低序列长度与推理成本。
ChainMark:具有闭式校准的无模型大语言模型水印
专题命中 预训练与数据 :LLM(title);分类 cs.AI
AI总结 研究针对合成文本标记需求,提出ChainMark无模型大语言模型水印方法,通过特定方式划分词汇表状态并强制马尔可夫转移,检测器无需访问语言模型,推导相关闭式,证明鲁棒性阈值,在多模型和领域中优于其他方法,可恢复目标误报率。
回溯:重放预测市场以评估大语言模型预测器
机构 * School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院)
专题命中 预训练与数据 :LLM(title);分类 cs.CL
AI总结 研究针对大语言模型预测器评估中答案泄露问题,提出Hindcast方法,通过设定特定过去日期评分,重放预测市场与Reddit快照,让模型读取特定时间前帖子并评分,解决泄露问题,且能随模型改进在新市场重新评估,明确检索在不同情况的作用。
模块化预训练实现访问控制
专题命中 预训练与数据 :pretraining(title);分类 cs.LG
AI总结 针对人工智能两用困境及多模型部署成本高问题,提出梯度路由辅助模块(GRAM)预训练方法,能在推理时消融模块功能。实验显示其可有效禁用目标功能且抗微调恢复,训练成本低,紧密跟踪数据过滤。
DuplexChat:大规模构建用于口语对话语言建模的分离说话者全双工对话语音
机构 * The University of Tokyo, Japan(东京大学,日本) ; National Institute of Advanced Industrial Science and Technology, Japan(日本国家先进工业科学与技术研究院)
专题命中 预训练与数据 :language model(title);分类 cs.CL
AI总结 针对现有大规模公共语音语料库不适用于全双工口语对话模型训练的问题,提出DuplexChat及DuplexChat-Pipe,通过特定流程构建分离说话者全双工对话语音,产出多语言语料库。
Comments 4 pages, 1 figures, submitted to SLT demo track
通过占据覆盖最大化进行强化学习的无奖励预训练
机构 * Computational Statistics and Machine Learning - Istituto Italiano di Tecnologia(计算统计与机器学习 - 意大利技术研究院) ; AI Centre, Computer Science Department, University College London(人工智能中心,计算机科学系,伦敦大学学院)
专题命中 预训练与数据 :pretraining(title);分类 cs.LG
AI总结 提出一种无奖励预训练方法ROVER,通过最大化状态占据测度的覆盖来学习可迁移探索策略,在稀疏奖励下游任务中快速适应。
Nemotron-CLIMB: 基于聚类的迭代数据混合自助法用于语言模型预训练
机构 * NVIDIA ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 预训练与数据 :language model(title);分类 cs.CL
AI总结 本文提出Nemotron-CLIMB方法,通过聚类和迭代优化提升预训练数据混合效果,实验显示其在预训练性能上优于现有模型,同时提供了一个大规模数据集用于研究。
Comments Accepted to NeurIPS 2025
面向可控催化剂逆向设计的大规模自回归预训练
机构 * Department of Chemical and Biomolecular Engineering, Institute of Emergent Materials, Sogang University(化学与生物分子工程系,新兴材料研究所,首尔大学) ; Department of Chemical Engineering and Materials Science, Ewha Womans University(化学工程与材料科学系,成实女子大学) ; Department of Chemical Engineering, Graduate Program in System Health Science and Engineering, Ewha Womans University(化学工程系,系统健康科学与工程研究生院,成实女子大学) ; Institute for Multiscale Matter and Systems (IMMS), Ewha Womans University(多尺度物质与系统研究所(IMMS),成实女子大学) ; KU-KIST Graduate School of Converging Science and Technology, Korea University(KU-KIST融合科学与技术研究生院,韩国大学) ; Department of Integrated Energy Engineering, Korea University(整合能源工程系,韩国大学) ; Center for Hydrogen and Fuel Cells, Korea Institute of Science and Technology(KIST)(氢气与燃料电池中心,韩国科学技术院(KIST))
专题命中 预训练与数据 :pretraining(title);分类 cs.LG
AI总结 提出基于生成式预训练Transformer的条件催化剂生成模型,通过大规模预训练和微调实现高结构有效性和条件匹配率,显著提升筛选效率。