FootGPT : A Large Language Model Development Experiment on a Minimal Setting
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
Comments 10 pages, 3 figures
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
Comments 10 pages, 3 figures
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG
Comments ICML 2023 Camera Ready Version
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG
Comments 6 pages, 5 figures, LaTeX; added a related work section
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
Comments 5 pages, 3 Figures, ACL 2023
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
Comments Earlier version (Nov 2, 2022) available at http://www.faculty.ucr.edu/~eschwitz/SchwitzPapers/GPT-3-Dennett-221102.pdf; stable URL for updated versions http://faculty.ucr.edu/~eschwitz/SchwitzAbs/GPT3Dennett.htm
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.AI
专题命中 预训练与数据 :language model(title,abstract);large language model(title);pretraining(abstract);分类 cs.CL、cs.LG
Comments 31 pages; update ethics statement to clarify benefits and potential long-term harms
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.LG
Comments First Version
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.LG
Comments Published at ICLR 2022
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.LG
专题命中 预训练与数据 :language model(title,abstract);large language model(title);prompting(abstract);分类 cs.CL、cs.AI
Comments Accepted to 4th Workshop on NLP for Conversational AI, ACL 2022
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.LG
Comments Published at ACL 2022. Code, data, and pretrained models are available at https://github.com/michiyasunaga/LinkBERT
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.LG
Comments NeurIPS 2021. (Code and Models: https://github.com/microsoft/COCO-LM)
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.LG
Comments ACM Transactions on Computing for Healthcare (HEALTH)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.AI
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.LG
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.LG
Comments 8 pages, 7 figures. Accepted paper at the International Society for Music Information Retrieval Conference (ISMIR) 2020
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.LG
Comments ACL 2020
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.LG
Comments Accepted at EMNLP 2018
机构 * Department of Computer Science(计算机科学系) ; Center for Data Science, School of Nursing(数据科学中心、护理学院) ; Department of Religion(宗教系) ; Emory University(埃默里大学)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL;LLM(journal_ref)
Comments 9 pages including appendix; 5 figures; 5 tables
Journal ref in Proceedings of KDD 2025 SciSoc LLM Workshop
CausalMix: 数据混合作为语言模型训练的因果推断
机构 * Tsinghua University(清华大学) ; Ant Group(蚂蚁集团) ; Renmin University of China(中国人民大学)
专题命中 预训练与数据 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出CausalMix框架,将数据混合优化视为因果推断问题,通过条件平均处理效应估计最优混合比例,在7B模型上提升多任务性能,并具备可解释性。
Comments 22 pages, 3 figures
HumanScale: 以自我为中心的人类视频在具身预训练中可超越真实机器人数据
机构 * PKU(北京大学) ; NUS(新加坡国立大学) ; MIT(麻省理工学院) ; UCSB(加州大学圣塔芭芭拉分校) ; NVIDIA(英伟达)
专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)
AI总结 本文通过系统比较发现,经过精心设计的过滤和标注流程,以自我为中心的人类视频在具身基础模型预训练中不仅可行,而且性能优于遥操作真实机器人数据,验证了“预训练于人类视频+少量机器人数据适配”的可扩展范式。
Comments Github: https://github.com/DAGroup-PKU/HumanNet/
MotionGPT-2:用于运动生成与理解的通用运动-语言模型
机构 * Tsinghua University(清华大学) ; The University of Sydney(悉尼大学) ; University of Science and Technology of China(中国科学技术大学) ; The Chinese University of Hong Kong(香港中文大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Intime Department Store(Intime百货) ; Deepeleph ; HKUST(香港科技大学)
专题命中 预训练与数据 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);pretraining(abstract)
AI总结 提出MotionGPT-2,一种统一的大规模运动-语言模型,通过预训练大语言模型支持多模态控制条件,实现运动生成、描述和补全等多种任务,并引入Part-Aware VQVAE实现细粒度身体和手部运动表示。
DOMBA: 通过最小有界聚合实现访问控制语言模型的双模型平衡
机构 * Ben-Gurion University(本·古里安大学)
专题命中 预训练与数据 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出DOMBA方法,通过最小有界平均函数聚合两个不同访问级别文档训练的语言模型的概率分布,在保证安全性的同时实现高效用。
Comments Code: https://github.com/ppo1/DOMBA 11 pages, 3 figures
Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, Vol. 39, pp. 25101-25109, 2025
你批准即执行:黑盒LLM代理的同意完整性
专题命中 预训练与数据 :LLM(title,title_cn);prompting(abstract)
AI总结 针对黑盒LLM代理的批准对话框存在摘要伪造漏洞,本文引入同意完整性概念,通过可信中介确保人类看到的动作与真实执行的动作一致,并分析了该机制的局限性与权衡。
Comments Preprint. IEEE conference format. Proof-of-concept; artifact at https://github.com/zjnbwxq/agentguard-ci
LLMs更倾向于哪种英语?通过结构偏见的角度探讨基础模型中对美式英语的偏向
机构 * University of Alberta(阿尔伯塔大学)
专题命中 预训练与数据 :foundation model(title);LLM(abstract);large language model(abstract);language model(abstract)
AI总结 本文通过分析基础模型开发各阶段的数据倾向,揭示LLMs在英语方言上的结构性偏见,发现美式英语被优先采用,引发语言同质化和全球AI部署不公的担忧。
Comments Preprint