Exploiting Asymmetry for Synthetic Training Data Generation: SynthIE and the Case of Information Extraction
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted at EMNLP 2023
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted at EMNLP 2023
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments EMNLP 2023
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)
Comments arXiv admin note: text overlap with arXiv:2306.13781
Journal ref Annual International ACM SIGIR Conference on Research and Development in Information Retrieval in the Asia Pacific Region (SIGIR-AP '23), November 26--28, 2023, Beijing, China
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 6 pages, 1 figure, 3 tables
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)
专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 9 main pages (119 with appendix), 16 figures and 11 tables
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Code, data, and demo at https://selfrefine.info/
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 10 pages, 8 tables, 4 figures
专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
基于属性意识的LLM电商产品生成控制
机构 * Amazon Spain(亚马逊西班牙分公司) ; Amazon Germany(亚马逊德国分公司)
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出基于LLM的属性意识电商产品生成方法,通过三种策略生成高质量合成数据,提升电商数据集的准确率与实用性。
Comments AAAI'26 Workshop on Shaping Responsible Synthetic Data in the Era of Foundation Models (RSD)
机构 * BITS, Pilani(比哈尔理工学院) ; Georgia Institute of Technology(佐治亚理工学院) ; Stanford University(斯坦福大学) ; Emory University(埃默里大学)
专题命中 预训练与数据 :language model(abstract,comments);large language model(abstract);prompting(abstract);分类 cs.CL、cs.AI
Comments Conference on Language Modeling 2025
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
Comments To Appear in NeurIPS 2024 Workshops on Evaluating Evaluations (EvalEval) and Statistical Foundations of LLMs and Foundation Models (SFLLM)
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
Comments Published at ICML 2024 Workshop on Foundation Models in the Wild
除模型外一切未变:CellFill——针对量化大语言模型的比特一致、可撤销更新的单元内受限学习
机构 * Institute for Frontier Interdisciplinary Research in Health Sciences and Technology, Sun Yat-sen University(中山大学健康科学与技术前沿交叉研究院) ; Guangdong Engineering Research Center of Medical Artificial Intelligence Multimodal System(广东省医学人工智能多模态系统工程研究中心) ; Sun Yat-sen University(中山大学) ; School of Business, Sun Yat-sen University(中山大学商学院) ; School of Computer Science, China University of Geosciences (Wuhan)(中国地质大学(武汉)计算机学院) ; School of Public Health, Sun Yat-sen University(中山大学公共卫生学院) ; Hospital of Stomatology, Sun Yat-sen University(中山大学口腔医院) ; Big Data and Artificial Intelligence Center, The Third Affiliated Hospital of Sun Yat-sen University(中山大学附属第三医院大数据与人工智能中心)
专题命中 预训练与数据 :language model(title,abstract);分类 cs.LG
AI总结 CellFill方法通过在量化决策单元内写入残差实现量化大语言模型的比特一致、可撤销更新,实验显示其在召回率接近基准的同时降低跨域遗忘,且可迁移至27B混合线性注意力模型。
Comments 35 pages, 3 figures, 9 tables
在翻译语中训练模型显示了词汇多样性与源-目标句法相似性如何塑造学习
机构 * Department of Computer and Information Science(计算机与信息科学系) ; Linköping University(林雪平大学)
专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL
AI总结 本文研究了在不同源语言翻译的机器翻译数据上训练模型,探讨词汇多样性和源-目标句法相似性如何影响模型学习与语言建模。
Comments To appear at the Findings of EMNLP 2026
GraphPFN:一种先验数据拟合的图基础模型
机构 * HSE University(莫斯科国立高等经济学院) ; Yandex Research(Yandex研究院)
专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG
AI总结 针对图基础模型的可迁移性和数据稀缺问题,提出GraphPFN,基于先验数据拟合网络框架,设计多级随机块模型和优先连接过程生成合成图,结合图感知结构化因果模型生成属性,并扩展LimiX模型以融合图邻域聚合层,在节点级任务上实现上下文学习和微调的最优性能。
MemCatalyst:通过数据投毒增强视觉-语言模型的数据审计
专题命中 预训练与数据 :language model(title,abstract);分类 cs.LG
AI总结 本研究提出MemCatalyst数据投毒工具,通过文本与图像投毒策略增强视觉-语言模型的成员推断审计性能,在黑盒设置下投毒样本可跨架构迁移,仅需少量投毒样本即可提升审计效果且不影响模型性能。
儿童在词汇学习中表现出加速回报,而语言模型则不然
专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL
AI总结 该研究对比儿童与语言模型的词汇学习,发现儿童词汇学习呈加速积累特征,而语言模型则呈现恒定比例回报,且儿童学习所需训练数据远少于语言模型。
QuantumNovelty:用于量子论文与专利的评审式审查及可专利性筛选的技能编排语言智能体
专题命中 预训练与数据 :language agent(title,abstract);分类 cs.AI
AI总结 QuantumNovelty是一款开源技能编排语言智能体,可生成量子计算产物并通过含确定性门的审计层审查,在对抗语料库及真实手稿、专利的测试中表现出审查保守性,属于量子论文与专利审查的决策支持工具。
语言模型的交叉熵风险估计:不一致性必然是稠密的,留出法也不例外
机构 * University of California, Davis(加利福尼亚大学戴维斯分校)
专题命中 预训练与数据 :language model(title,abstract);分类 cs.LG
AI总结 该研究指出语言模型的每词交叉熵风险无法被一致估计,即使采用留出法也存在稠密的不一致状态,提出两种需付出代价的解决途径。
CytoBERT:用于细胞计数数据的基础模型
机构 * University of Rostock(罗斯托克大学) ; Marburg University(马尔堡大学) ; Hessian Center for Artificial Intelligence(黑森人工智能中心)
专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG
AI总结 针对细胞计数数据异质性与非标准化导致机器学习难以应用的问题,推出开源基础模型CytoBERT,经5000万细胞数据预训练后可实现跨数据集迁移学习,为通用细胞计数分析提供新方案。
冻结的脑MRI基础模型是站点指纹
机构 * University of British Columbia(不列颠哥伦比亚大学)
专题命中 预训练与数据 :foundation model(title);pretraining(abstract);分类 cs.AI
AI总结 该研究发现冻结脑MRI基础模型的嵌入包含采集站点的指纹,该指纹可线性解码且与预训练无关,可通过特定方法移除,同时指出其对共享嵌入的影响及密集分割的代价,并发布了审计工具包。
Comments 15 pages, 5 figures, 7 tables. Code: https://github.com/saman-rahbar/scanner-fingerprints
OATS: 用于时间序列基础模型的在线数据增强
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Microsoft Research(微软研究院) ; Griffith University(格里菲斯大学) ; Datadog AI Research(Datadog AI研究院)
专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG
AI总结 OATS通过动态生成合成数据提升时间序列基础模型的性能,采用探索-利用机制和扩散框架,在多个数据集上优于传统方法。
从对齐到合成:用于文本到CT生成的对比体 grounding
机构 * Unit of Artificial Intelligence and Computer Systems, Department of Engineering, Università Campus Bio-Medico di Roma(人工智能与计算机系统单位,工程系,罗马生物医学大学) ; Department of Diagnostics and Intervention, Biomedical Engineering and Radiation Physics, Umeå University(诊断与干预部门,生物医学工程与放射物理学,乌梅拉大学)
专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI
AI总结 该研究针对文本到CT生成的视觉-语言对齐瓶颈,提出带结构化难负样本的3D-CLIP编码器,结合端到端潜在扩散模型,在CT-RATE数据集上实现了优于现有方法的性能。
Comments Accepted at BMVC 2026
测量跨语言理解差距:证据语言如何影响语言模型的理解能力
机构 * Eastern University(东方大学)
专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL
AI总结 该研究定义跨语言理解差距(CLCG),通过ParallelQA-18评估5种模型,发现英语能力无法同等迁移,低资源语言用户的模型质量可能被英语中心评估高估。
Comments 55 pages, 17 figures. Submitted to Computational Linguistics (MIT Press / ACL). Supplementary Material: 55 pages, 4 figures
SkillCorpus:整合与评估面向现实世界大语言模型智能体的开放技能生态系统
专题命中 预训练与数据 :LLM(title,abstract);分类 cs.CL
AI总结 研究针对大语言模型智能体技能文件碎片化等问题,提出SkillCorpus框架,通过多阶段管道过滤技能并与检索选择堆栈配对,经多基准端到端评估,整合该框架能带来一致收益,明确了其对实际智能体任务的作用边界。
Agogic:适用于大语言模型原生文本到符号音乐生成的性能计时音乐 token
专题命中 预训练与数据 :LLM(title);language model(abstract);分类 cs.CL
AI总结 该研究固定模型规模、数据等变量,发现音乐 token 化的表示形式而非模型规模是影响文本到符号音乐生成分布保真度的关键,发布了相关工具链、模型及语料库,为该领域提供了可测量的表示形式研究基础。
Comments Project Page: https://yisuanwang.github.io/Agogic
解耦语言建模与边界
专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL
AI总结 该研究提出字节级语言模型可解耦下一字节分布与边界位置分布,设计实验验证该假设,主张采用字节级接口作为共享标准以实现模型间低成本的能力传递与边界重塑。
ED-DiT:用于从电子密度学习可迁移分子表示的物理引导扩散预训练
专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG
AI总结 本研究提出ED-DiT,一种物理引导的扩散Transformer,通过电子密度点云自监督预训练学习可迁移分子表示,在6项EDBench任务及低监督场景下均优于基线,展现出良好效果。
Comments 16 pages, 9 figures, 7 tables, including supplementary material
重新思考针对专业设计数据的预训练:来自JONES-19文化设计数据集的证据
专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG
AI总结 该研究以JONES-19文化设计数据集为对象,对比两种CNN训练策略,发现小型高质量设计数据集结合多裁剪采样,可替代大规模通用预训练,为专业设计领域的ML研究提供新思路。
Comments 2026 Design Computing and Cognition Conference