Guided scenarios with simulated expert personae: a remarkable strategy to perform cognitive work
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
Comments 11 pages, 3 figures, 1 listing
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
Comments 11 pages, 3 figures, 1 listing
专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL
Comments ICLR 2023 (Notable-top-5%)
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
Comments ACL 2023
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
Comments 10 pages, 7 figures, link to text corpora and source code available
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL
专题命中 预训练与数据 :large language model(abstract);language model(abstract);small language model(abstract);分类 cs.CL
Comments 14 pages, 2 figures
专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL
专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL
Comments IJCAI 2022
专题命中 预训练与数据 :language model(abstract);foundation model(abstract);pretraining(abstract);分类 cs.CL
Comments CVPR 2022
专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL
Comments AKBC 2021
专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL
Comments ACL-IJCNLP 2021 main conference. The first three authors contribute equally to this work
专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG
Comments Machine Learning in Computational Biology (MLCB) 2020
专题命中 预训练与数据 :language model(abstract,comments);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments NeurIPS Workshop on Socially Responsible Language Modelling Research (SoLaR) 2023. Best Paper Award
大语言模型世界模型中的信念传播:用预测市场测量战略信息偏差
机构 * Future Principle(未来原理) ; Aarhus University(奥胡斯大学)
专题命中 预训练与数据 :LLM(title);分类 cs.CL、cs.LG
AI总结 研究大语言模型结合预测市场测量信息偏差,通过消融特定文本偏差贡献,应用于乌克兰相关预测市场发现英语新闻背景致偏差,主要源于文本,补充乌军事分析源可减偏差,此偏差在多架构中会持续并影响下游决策。
Comments Accepted at UNLP 2026. 12 pages, 8 figures, 11 tables. Dataset available at https://huggingface.co/datasets/OpenBabylon/unlp-ukraine-forecasting
紧凑的基于示例的语言模型解释
机构 * Faculty of Computer Science, University of Vienna(维也纳大学计算机科学学院) ; UniVie Doctoral School Computer Science, University of Vienna(维也纳大学计算机科学博士学院) ; Faculty of Philological and Cultural Studies, University of Vienna(维也纳大学语言文化研究学院)
专题命中 预训练与数据 :language model(title);分类 cs.CL、cs.LG
AI总结 本文提出一种无需重新训练的选例相关性评分,用于评估示例集对模型输出解释的有效性,并展示了其在选择策略中的应用,提升解释质量。
Comments ACL 2026 Findings. 9 pages
GPC:面向可迁移运动控制的大规模生成式预训练
专题命中 预训练与数据 :pretraining(title);分类 cs.AI、cs.LG
AI总结 提出生成式预训练控制器(GPC),通过令牌化和下一令牌建模从大规模运动数据集中学习通用控制器,结合有限标量量化(FSQ)和自回归Transformer,实现高成功率运动复现和鲁棒的下游适应。
Journal ref SIGGRAPH 2026 Conference Proceedings
ParaSpeechCLAP:面向丰富风格语言-音频预训练的双编码器语音-文本模型
机构 * Department of Computer Science, The University of Texas at Austin, USA(德克萨斯大学奥斯汀分校计算机科学系) ; Computer Science and Data Science, New York University, USA(纽约大学计算机科学与数据科学系)
专题命中 预训练与数据 :pretraining(title);分类 cs.CL、cs.AI
AI总结 提出ParaSpeechCLAP双编码器模型,将语音与文本风格描述映射到共享嵌入空间,支持丰富内在和情境风格描述,在风格描述检索、属性分类及TTS奖励模型中优于基线。
Comments Interspeech 2026
Spokes: 优化多样化预训练数据选择
机构 * DSO National Laboratories(DSO国家实验室) ; Stanford University(斯坦福大学) ; University of Washington(华盛顿大学)
专题命中 预训练与数据 :pretraining(title);分类 cs.CL、cs.AI
AI总结 提出基于G-Vendi分数的概率多样化框架,通过指数梯度下降直接优化数据多样性,在FineWeb和DCLM上提升下游性能1.5和1.4个点。
Comments 9 pages, 4 figures
当数据稀缺时:通过重复训练扩展稀疏语言模型
机构 * Eindhoven University of Technology(埃因霍温理工大学) ; University of Luxembourg(卢森堡大学) ; University of Twente(埃因霍温大学) ; ETH Zürich(苏黎世联邦理工学院)
专题命中 预训练与数据 :language model(title);分类 cs.AI、cs.LG
AI总结 研究数据受限下稀疏训练的可扩展性,提出包含活跃参数、唯一标记、数据重复和稀疏度的缩放定律,发现稀疏训练可延迟数据饱和并改善资源权衡。
Comments Accepted at ICML2026
MambaNetBurst:无需分词或预训练的直接字节级网络流量分类
机构 * University of Queensland, Brisbane, Australia(昆士兰大学,布里斯班,澳大利亚)
专题命中 预训练与数据 :pretraining(title);分类 cs.AI、cs.LG
AI总结 MambaNetBurst基于Mamba-2架构,直接对原始字节进行分类,无需分词或预训练,实现了高效的网络流量分类。
Comments 16 pages, 2 figures. Pareto-optimal frontier. Transformer vs Mamba vs Mamba-2 scaling performance. Code and data available on request
大语言模型文本生态系统中的漂移与选择
机构 * Queen Mary University of London(伦敦玛丽女王大学)
专题命中 预训练与数据 :LLM(title);分类 cs.CL、cs.AI
AI总结 本文提出一个可解的数学框架,分析递归过程中的漂移与选择作用,揭示文本生态系统的稳定分布与选择过滤对结构的影响。
并非所有预训练都同等有效:低资源环境下不平衡极化任务中的阈值调节与类别加权
机构 * African Institute of Mathematical Sciences(非洲数学科学研究所)
专题命中 预训练与数据 :pretraining(title);分类 cs.CL、cs.LG
AI总结 本文针对SemEval-2025极化任务,开发基于Transformer的系统,通过多语言和非洲语言专用模型、类别加权损失函数等方法,解决极化检测与分类问题,取得较高宏F1值。
可证明的视觉-语言排序与连续性在通用化具身体验代理中的预训练
机构 * The University of Queensland(昆士兰大学) ; Tongji University(同济大学) ; University of Technology Sydney(悉尼科技大学)
专题命中 预训练与数据 :pretraining(title);分类 cs.AI、cs.LG
AI总结 本文提出AcTOL方法,通过对比帧间语义差异和局部布朗桥约束,实现有序且连续的视觉-语言表示,提升具身体验代理在不同指令风格下的鲁棒性。
Comments NeurIPS 2025 Poster
ARCANE:一种多智能体框架,用于可解释和可配置的对齐
专题命中 预训练与数据 :large language model(abstract,comments);language model(abstract,comments);分类 cs.CL、cs.AI
AI总结 ARCANE是一种多智能体框架,通过动态规则生成实现可解释和可配置的对齐,适用于复杂长期任务。
Comments Accepted to the AAAI 2026 LLAMAS Workshop (Large Language Model Agents for Multi-Agent Systems)
什么推动跨语言排序?具有多语言语言模型的检索方法
机构 * The Alan Turing Institute(艾伦·图灵研究所) ; Queen Mary University of London(伦敦女王学院) ; University College London(伦敦大学学院)
专题命中 预训练与数据 :language model(title);分类 cs.CL、cs.AI
AI总结 本文研究了跨语言检索中影响排序的因素,发现专门训练的密集检索模型和对比学习在低资源和跨脚本场景中表现更优,优于传统的翻译和单语言检索方法。
专题命中 预训练与数据 :language model(title);分类 cs.CL、cs.AI
机构 * Faculty of Computer Science and Mathematics, University of Passau, Germany(计算机科学与数学学院,帕绍大学) ; Taub Faculty for Computer Science, Technion - Israel Institute of Technology, Israel(计算机科学系,技术ion-以色列理工学院)
专题命中 预训练与数据 :language model(title);分类 cs.CL、cs.LG
Journal ref Transactions on Machine Learning Research (06/2025)
机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology, Hong Kong SAR, China(电子与计算机工程系,香港科学与技术大学) ; Division of Paediatric Dentistry and Orthodontics, Faculty of Dentistry, The University of Hong Kong, Hong Kong SAR, China(牙科学院儿童牙科与正畸学系,香港大学)
专题命中 预训练与数据 :foundation model(title);分类 cs.AI、cs.LG
Comments MICCAI 2025
机构 * Department of Surgery(外科部) ; Hamad Medical Corporation(哈马德医疗集团) ; Department of Computer Science and Engineering(计算机科学与工程系) ; Qatar University(卡塔尔大学)
专题命中 预训练与数据 :pretraining(title);分类 cs.AI、cs.LG