Open-Universe Indoor Scene Generation using LLM Program Synthesis and Uncurated Object Databases
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)
Comments See ancillary files for link to supplemental material
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)
Comments See ancillary files for link to supplemental material
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)
Comments Accepted in the ICSE 2024 Research Track with a different title "Out of Sight, Out of Mind: Better Automatic Vulnerability Repair by Broadening Input Ranges and Sources"
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments ICLR 2024
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 10 pages, 5 figures, 1 table
专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 16 pages, 5 figures
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)
Comments ICASSP 2024 camera-ready paper. Winner of the DCASE 2023 Challenge Task 6A: Automated Audio Captioning (AAC)
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);prompting(abstract)
Comments 12 pages
专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract)
专题命中 预训练与数据 :prompting(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted to EMNLP 2023 Findings
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments accepted at WMT 2023
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Published in ICML 2023. Project page: https://jykoh.com/fromage
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments To be published in the KDD 2023 proceedings as a full paper
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
Comments ICLR 2023
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Third Workshop on Simple and Efficient Natural Language Processing, EMNLP 2022
专题命中 预训练与数据 :prompting(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted by COLING 2022
专题命中 预训练与数据 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG
Comments EMNLP 2022
专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);pretraining(abstract)
Comments To appear at NeurIPs 2022, Camera Ready with Typos fixed
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
Comments ACL 2021 Findings. Code and data: https://github.com/ruiqi-zhong/acl2021-instance-level
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
Comments This version is the camera-ready version for ICLR 2021. Main changes include a detailed discussion about natural tasks, more detailed proof sketch and updated experimental evaluations
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments NAACL 2021 camera-ready version
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Findings of EMNLP 2020
训练公平表格基础模型
机构 * ÉTS Montréal(蒙特利尔高等技术学院) ; Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) ; Layer 6 AI(第六层人工智能公司) ; University of Calgary(卡尔加里大学) ; CIFAR(加拿大高级研究所)
专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 针对表格基础模型(TFMs)公平性未被充分探索的问题,本研究提出FairTFM训练策略,将公平约束融入TFMs训练,在132个公平任务上实现公平性提升且保持竞争力准确性。
Comments Spotlight paper at the ICML 2026 Workshop on Foundation Models for Structured Data
NumLeak: 基础模型中的公开数值基准作为潜在标签
机构 * Princeton University(普林斯顿大学)
专题命中 预训练与数据 :foundation model(title,comments);LLM(abstract_cn);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 提出NumLeak框架,通过API边界探测和开源因果模型的白盒验证,揭示基础模型在预训练中记忆公开数值基准,导致评估高估泛化能力。
Comments 23 pages, 12 figures, 17 tables. Accepted at the ICML 2026 Workshop on the Impact of Memorization on Trustworthy Foundation Models (MemFM)
迈向多语言预训练数据选择的跨语言质量分类器
机构 * Machine Learning Optimization Lab(机器学习优化实验室) ; Ecole Polytechnique Fédérale de Lausanne(洛桑联邦理工学院)
专题命中 预训练与数据 :pretraining(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文探讨了通过跨语言迁移、第三四分位采样和保留率调整策略,提升多语言数据筛选效果,证明大规模多语言池化在稳定性与准确率上优于单语基线,尤其对低资源语言有显著提升。
Comments Accepted at the 3rd Workshop on Navigating and Addressing Data Problems for Foundation Models (DATA-FM @ ICLR 2026). 31 pages, 4 figures
机构 * Université Paris-Saclay, Inria, CEA(巴黎萨克雷大学、法国国家信息与自动化研究所、法国原子能委员会) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG
Journal ref NeurIPS 2025 Workshop "Recent Advances in Time Series Foundation Models Have We Reached the 'BERT Moment'?"