arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 140189 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12486 篇

2505.24241 2026-08-26 cs.CL 版本更新 89%

Advantageous Parameter Expansion Training Makes Better Large Language Models

优势参数扩展训练可打造更优的大语言模型

Naibin Gu, Yilong Chen, Zhenyu Zhang, Peng Fu, Zheng Lin, Shuohuan Wang, Yu Sun, Hua Wu, Weiping Wang, Haifeng Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Baidu Inc.(百度公司)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);分类 cs.CL

AI总结 该研究提出APEX方法,通过在总参数不变时扩展优势参数占比,在指令调优和持续预训练的五款基础模型实验中,仅用部分参数或数据就实现了更优性能。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.11771 2026-08-11 cs.CL 89%

InforMask: Unsupervised Informative Masking for Language Model Pretraining

Nafis Sadeq, Canwen Xu, Julian McAuley

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);large language model(abstract);分类 cs.CL

Journal ref Proceedings of the 2022 Conference on Empirical Methods in Natural Language Processing (EMNLP 2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25857 2026-08-05 cs.LG 版本更新 89%

In-Context Molecular Property Prediction with LLMs: A Blinding Study on Memorization and Knowledge Conflicts

基于LLM的上下文分子性质预测:关于记忆与知识冲突的盲化研究

Matthias Busch, Marius Tacke, Sviatlana V. Lamaka, Mikhail L. Zheludkevich, Christian J. Cyron, Christian Feiler, Roland C. Aydin

机构 * Institute for Continuum and Material Mechanics, Technical University of Hamburg(持续与材料力学研究所,汉堡技术大学) Institute of Material Systems Modeling, Helmholtz-Zentrum Hereon(材料系统建模研究所,海德堡-这里恩研究中心) Institute of Surface Science, Helmholtz-Zentrum Hereon(表面科学研究所,海德堡-这里恩研究中心) German Center for Artificial Intelligence (DFKI), Saarland, Germany(德国人工智能中心(DFKI),萨尔兰州,德国) Saarland University(萨尔兰州大学)

专题命中 预训练与数据 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 通过渐进盲化实验和上下文样本量控制,研究LLM在分子性质预测中是否真正进行上下文回归,还是依赖记忆值,并分析预训练知识与上下文信息的冲突。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11389 2026-08-04 cs.CL 版本更新 89%

Curriculum-Guided Layer Scaling for Language Model Pretraining

用于语言模型预训练的课程引导层缩放

Karanpartap Singh, Neil Band, Ehsan Adeli

机构 * Stanford University(斯坦福大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);large language model(abstract);分类 cs.CL

AI总结 受人类认知发展启发,提出课程引导层缩放框架,通过渐进式层堆叠使数据难度与模型增长同步,在不同参数规模预训练并分层数据,提升模型泛化及零样本性能。

Comments Accepted to ICML 2026. Code available at https://github.com/su-karanps/cgls

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02464 2026-07-30 cs.CL 版本更新 89%

Will Scaling Improve Social Simulation with LLMs?

扩展规模会改善基于LLM的社会模拟吗?

Caleb Ziems, William Held, Su Doga Karaca, David Grusky, Tatsunori Hashimoto, Diyi Yang

机构 * Stanford University(斯坦福大学) Open Athena(开放雅典娜)

专题命中 预训练与数据 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究LLM规模扩展对社会模拟保真度的影响,发现多数任务随规模提升而改善,但存在例外,如纵向预测和低资源领域改进缓慢。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22114 2026-07-27 cs.LG 新提交 89%

Pretraining EHR Foundation Models with Patient-Aware Sampling

基于患者感知采样的电子健康记录基础模型预训练

Joshua Placidi, Yuxuan Liu, Jinpei Han, Marek Rei, A. Aldo Faisal

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);language model(abstract);分类 cs.LG

AI总结 研究针对电子健康记录自回归基础模型预训练方法存在的问题,提出患者采样方法,通过控制训练信号分布来构建序列,实验表明该方法在真实EHR数据上提升了性能,凸显训练和验证序列构建对相关模型的重要性。

Comments Accepted at the Workshop on Structured Data for Health at the 43rd International Conference on Machine Learning (ICML 2026). 7 pages, 4 figures

Journal ref ICML 2026 Workshop on Structured Data for Health (SD4H)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11961 2026-07-21 cs.CL 版本更新 89%

Scaling Model and Data for Multilingual Machine Translation with Open Large Language Models

基于开放大语言模型的多语言机器翻译模型与数据扩展

Yuzhe Shang, Pengzhi Gao, Wei Liu, Jian Luan, Jinsong Su

机构 * School of Informatics, Xiamen University, China(厦门大学信息学院) MiLM Plus, Xiaomi Inc., Beijing, China(小米公司)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 本文提出MiLMMT-46模型,通过模型和数据扩展提升多语言机器翻译性能,超越现有SOTA模型并接近Google Translate等强 proprietary 系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12429 2026-07-17 cs.LG 版本更新 89%

Stabilizing Native Low-Rank LLM Pretraining

稳定原生低秩大语言模型预训练

Paul Janson, Edouard Oyallon, Eugene Belilovsky

机构 * Concordia University, Montreal, Canada(Concordia 大学) Mila Quebec AI Institute, Montreal, Canada(Quebec AI 研究院) Sorbonne University, CNRS , Paris , France(Sorbonne 大学)

专题命中 预训练与数据 :LLM(title);pretraining(title);large language model(abstract);language model(abstract)

AI总结 本文提出Spectron方法,通过谱归一化实现稳定原生低秩大语言模型预训练,显著提升推理效率并优化计算资源使用。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10159 2026-07-14 cs.AI 新提交 89%

UNIT: Unleash Large Language Models Potential for Graph Continual Learning

UNIT:释放大语言模型在图连续学习中的潜力

Tairan Huang, Yili Wang, Beibei Hu, Yiting Shi, Qiutong Li, Changlong He, Jianliang Gao

机构 * Central South University(中南大学) Hongkong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hunan Institute of Engineering(湖南工程学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 针对图连续学习面临的语义-结构分离和知识转移不平衡问题,提出UNIT框架,通过微调大语言模型、引入不确定感知锚点生成机制和结构融合建模,提升模型适应性与跨任务知识保留能力,在图连续学习任务中达最优性能。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08186 2026-07-10 cs.CL 新提交 89%

Hidden Decoding at Scale: Latent Computation Scaling for Large Language Models

大规模隐藏解码:大语言模型的潜在计算扩展

Aiwei Liu, Cheng Shi, Chuhan Wu, Ci Lei, Di Lu, Donald He, Fan Zhang, Fanhao Kong, Feifei Zhang, Guan Wang, Haicheng Wang, Haoyu Liu, Houjin Yu, Jiachen Ding, Jiayi Feng, Jie Zhou, Jijun Chi, Jindi Shi, Jing Lei, Junjie Zhang, Laiyi Li, Le Tian, Linhao Zhang, Miao Fan, Sijun Zhang, Wei Jia, Weiwei Shi, Wenhan Li, Wentao Zhao, Wenteng Liang, Xiao Zhou, Xiaojin Zhou, Xihuai Wang, Xinyu Gao, Xuanliang Wang, Xuyang Ao, Yang Yu, Yangxiu You, Yinuo Zhao, Yufei Kuang, Yufei Wang, Yuan Liu, Yuan Liu, Yuwen Chen, Zhencong Tian, Zhongyin Zhao, Zilin Yu, Zitao Wang

机构 * WeChat AI Team(微信人工智能团队)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 研究在Transformer主干固定时,通过为token分配更多计算改进大语言模型,提出隐藏解码方法,将token扩展为n个流并结合流分解注意力,实验验证该方法在前沿规模的有效性及跨扩展因子时收益随n增加。

Comments 30 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24752 2026-06-24 cs.AI 新提交 89%

Can Scale Save Us From Plasticity Loss in Large Language Models?

规模能拯救大型语言模型的可塑性丧失吗?

J. Fernando Hernandez-Garcia, Tomás Figliolia, Beren Millidge

机构 * Zyphra

专题命中 预训练与数据 :language model(title,abstract);large language model(title);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究GPT风格Transformer模型在持续学习中的可塑性丧失问题,发现可塑性丧失随模型规模呈亚线性增长,表明增大模型只能延缓而非阻止该现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18767 2026-06-18 cs.CL 新提交 89%

Output Vector Editing for Memorization Mitigation in Large Language Models

输出向量编辑:缓解大型语言模型中的记忆化问题

Ahmad Dawar Hakimi, Kaiwei Lei, Isabelle Augenstein, Hinrich Schütze

机构 * Center for Information and Language Processing, LMU Munich(慕尼黑大学语言与信息处理中心) Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系) Munich Center for Machine Learning(慕尼黑机器学习中心) Pioneer Centre for AI(人工智能先锋中心)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 提出输出向量编辑方法,通过约束优化修改MLP神经元输出向量引入干扰项,在不改变激活值的情况下抑制记忆化序列,在OLMo-7B上实现87.9%抑制率,并揭示MLP编辑的机制边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07298 2026-06-02 cs.IR cs.AI 89%

Principled Synthetic Data Enables the First Scaling Laws for LLMs in Recommendation

原则性合成数据使推荐系统中的LLM首次出现缩放定律

Benyu Zhang, Qiang Zhang, Jianpeng Cheng, Hong-You Chen, Qifei Wang, Wei Sun, Shen Li, Jia Li, Jiahao Wu, Qunshu Zhang, Neeraj Bhatia, Xiangjun Fan, Hong Yan

机构 * Meta

专题命中 预训练与数据 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种分层框架生成高质量合成数据,通过避免原始数据噪声,首次在推荐领域实现LLM的稳健幂律缩放,并显著提升下游排序任务性能。

Comments update according to icml reviewers feedback

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18902 2026-05-20 cs.CL 89%

SLoW: Select Low-frequency Words! Automatic Dictionary Selection for Translation on Large Language Models

SLoW: 选择低频词!大型语言模型翻译上的自动词典选择

Hongyuan Lu, Zixuan Li, Zefan Zhang, Wai Lam

机构 * The Chinese University of Hong Kong(香港中文大学) Southeast University(东南大学) FaceMind Corporation(FaceMind公司) College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出了一种名为自动词典选择(ADS)的新任务,通过SLoW方法选择低频词典以提升翻译性能,无需访问训练数据,且在100种语言上显著节省token消耗并提升翻译效果。

Comments EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15615 2026-05-18 cs.CV cs.LG 89%

Neutral-Reference Prompting for Vision-Language Models

视觉-语言模型的中性参考提示

Senmao Tian, Xiang Wei, Shunli Zhang

机构 * Beijing Jiaotong University(北京交通大学)

专题命中 预训练与数据 :language model(title,abstract);prompting(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出NeRP策略,通过中性提示和参考图像提升模型对未知类别的判别能力,同时保持对已知类别的准确性。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14544 2026-05-15 cs.AI 89%

Complacent, Not Sycophantic: Reframing Large Language Models and Designing AI Literacy for Complacent Machines

自满而非阿谀:重新界定大语言模型并为自满机器设计AI素养

Federico Germani, Giovanni Spitale

机构 * Institute for Data Science and Artificial Intelligence, Boğaziçi University(数据科学与人工智能研究所,博科尼大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 本文重新界定大语言模型的行为特性,指出其自满倾向而非阿谀,强调需通过AI素养教育对抗确认偏误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26961 2026-05-12 cs.SE cs.AI cs.PL 89%

Static Program Slicing Using Language Models With Dataflow-Aware Pretraining and Constrained Decoding

基于语言模型的数据流感知静态程序切片

Pengfei He, Shaowei Wang, Tse-Hsun Chen, Muhammad Asaduzzaman

机构 * Department of Computer Science, University of Manitoba(曼尼托巴大学计算机科学系) School of Engineering and Computer Science, Concordia University(Concordia大学工程与计算机科学学院) School of Computer Science, University of Windsor(温莎大学计算机科学学院)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);small language model(abstract);分类 cs.AI

AI总结 本文提出Sliceformer,通过数据流感知预训练和约束解码改进静态程序切片,提升依赖建模精度和减少生成幻觉,实验显示在Java和Python基准上精确匹配提升22%。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08415 2026-05-12 cs.AI 89%

Political Plasticity: An Analysis of Ideological Adaptability in Large Language Models

政治可塑性:对大型语言模型中意识形态适应性的一种分析

Bruno Bianchi, Diego Tiscornia, Matias Travizano, Ariel Futoransky

机构 * Lab. de Inteligencia Artificial Aplicada, Instituto de Ciencias de la Computación(应用人工智能实验室,计算机科学研究所) Dpto. de Computación, Facultad de Cs. Exactas y Naturales, UBA-Argentina(计算系,精确自然科学学院,UBA-阿根廷)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 本文研究了大型语言模型在政治语境下的意识形态适应性,通过实验框架发现用户提示能显著影响模型响应,尤其在经济自由轴上表现更明显,而较新模型展现出稳定的适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27415 2026-05-01 cs.LG 89%

ChipLingo: A Systematic Training Framework for Large Language Models in EDA

ChipLingo: 一种面向电子设计自动化的大语言模型系统化训练框架

Lei Li, Xingwen Yu, Jianguo Ni, Junxuan Zhu, Jieqiong Zhang, Jian Zhao, Zhi Liu

机构 * Ickylin AI Team(Ickylin AI团队)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出ChipLingo系统化训练框架,通过多源数据构建、预训练优化和指令对齐,提升大语言模型在EDA领域的性能,实验表明其在EDA-Bench上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18027 2026-04-21 cs.SE cs.CL 89%

CodePivot: Bootstrapping Multilingual Transpilation in LLMs via Reinforcement Learning without Parallel Corpora

CodePivot: 通过强化学习无需平行语料库提升LLM的多语言转译

Shangyu Li, Juyong Jiang, Meibo Ren, Sizhe Zhong, Huiri Tan, Yunhao Gou, Xu Han, Chun Yong Chong, Yun Peng, Jiasi Shen

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Monash University(莫纳什大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 预训练与数据 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 CodePivot通过Python作为中间表示和Aggressive-Partial-Functional奖励机制,无需平行语料库提升LLM的多语言转译能力,在10种编程语言上实验显示其在通用和低资源语言转译任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07248 2026-04-21 cs.CL 89%

Don't Adapt Small Language Models for Tools; Adapt Tool Schemas to the Models

不要为小型语言模型适应工具;而是将工具模式适应模型

Jonggeun Lee, Woojung Song, Jongwook Han, Haesung Pyun, Yohan Jo

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学)

专题命中 预训练与数据 :language model(title,abstract);small language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 本文提出PA-Tool方法,通过调整工具模式以匹配预训练知识,提升小型语言模型在工具使用任务中的准确性,实验显示性能提升达17%。

Comments Accepted at ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16275 2026-04-20 cs.CL 89%

No Universal Courtesy: A Cross-Linguistic, Multi-Model Study of Politeness Effects on LLMs Using the PLUM Corpus

无普遍礼貌:基于PLUM语料库的跨语言、多模型研究,探讨礼貌对LLM的影响

Hitesh Mehta, Arjit Saxena, Garima Chhikara, Rohit Kumar

机构 * Department of Computer Science Engineering(计算机科学与工程系) Department of Electronics and Communication Engineering(电子与通信工程系)

专题命中 预训练与数据 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究不同礼貌程度的用户提示对LLM响应的影响,发现礼貌程度对模型性能有显著影响,但这种影响因语言和模型而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19090 2026-04-06 cs.CL 89%

Debating Truth: Debate-driven Claim Verification with Multiple Large Language Model Agents

辩论真相:基于多个大语言模型代理的辩论驱动声明验证

Haorui He, Yupeng Li, Dacheng Wen, Yang Chen, Reynold Cheng, Donglong Chen, Francis C. M. Lau

机构 * Department of Interactive Media, Hong Kong Baptist University(香港浸会大学互动媒体系) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港浸会大学联合国际学院) Shenzhen Institute of Advanced Technology(深圳先进技术研究院)

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);post-training(abstract)

AI总结 本文提出DebateCV框架,通过多代理辩论和调解提升复杂声明验证的准确性与说服力。

Comments Accepted by the ACM Web Conference 2026 (WWW 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11737 2026-04-02 cs.AI 89%

Auto-Formulating Dynamic Programming Problems with Large Language Models

利用大语言模型自动生成动态规划问题

Chenyu Zhou, Jingyuan Yang, Linwei Xin, Yitian Chen, Ziyan He, Dongdong Ge

机构 * Antai College of Economics and Management, Shanghai Jiao Tong University(上海交通大学安泰经济与管理学院) Booth School of Business, University of Chicago(芝加哥大学布斯商学院) School of Operations Research and Information Engineering, Cornell University(康奈尔大学运筹学与信息工程学院) Cardinal Operations(杉数科技) Shanghai University of Finance and Economics(上海财经大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出DP-Bench基准和DPLM模型,通过DualReflect生成合成数据,实现动态规划问题的自动化建模,展现了在低数据环境下后向生成的优势及大规模下前向生成的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10932 2026-03-31 cs.CV cs.AI 89%

BabyVLM-V2: Toward Developmentally Grounded Pretraining and Benchmarking of Vision Foundation Models

BabyVLM-V2:迈向基于发展基础的视觉基础模型预训练与基准测试

Shengao Wang, Wenqi Wang, Zecheng Wang, Max Whitton, Michael Wakeham, Arjun Chandra, Joey Huang, Pengyue Zhu, Helen Chen, David Li, Jeffrey Li, Shawn Li, Andrew Zagula, Amy Zhao, Andrew Zhu, Sayaka Nakamura, Yuki Yamamoto, Jerry Jun Yokono, Aaron Mueller, Bryan A. Plummer, Kate Saenko, Venkatesh Saligrama, Boqing Gong

机构 * Boston University(波士顿大学) Sony Group Corporation(索尼集团公司)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);language model(abstract);分类 cs.AI

AI总结 BabyVLM-V2通过纵向多维预训练集、灵活模型和DevCV工具箱,提升婴儿启发式视觉语言模型性能,实验证明其在基准测试中表现优异。

Comments Accepted to CVPR 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19269 2026-03-23 cs.CL 89%

From Tokens To Agents: A Researcher's Guide To Understanding Large Language Models

从标记到代理:研究者理解大型语言模型的指南

Daniele Barolo

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文探讨了如何有效使用大型语言模型,分析了预训练数据、标记化、Transformer架构等六个关键组成部分,通过案例研究展示如何评估LLM在特定研究中的适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07632 2026-03-20 cs.CV cs.AI 89%

GeoMotionGPT: Geometry-Aligned Motion Understanding with Large Language Models

GeoMotionGPT:基于大语言模型的几何对齐运动理解

Zhankai Ye, Bofan Li, Yukai Jin, Shuoqiu Li, Wei Wang, Yanfu Zhang, Shangqian Gao, Xin Liu

机构 * Florida State University(佛罗里达州立大学) Texas Tech University(德克萨斯技术大学) William & Mary University(威廉与玛丽大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出GeoMotionGPT框架,通过几何对齐提升运动理解与运动-语言推理能力,实验表明在HumanML3D和KIT-ML上性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20623 2026-03-20 cs.AI 89%

Copyright Detection in Large Language Models: An Ethical Approach to Generative AI Development

在大型语言模型中的版权检测:生成式AI发展的伦理方法

David Szczecina, Senan Gaffori, Edmond Li

机构 * University of Waterloo(滑铁卢大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出一个开源平台,帮助内容创作者验证其作品是否被用于LLM训练数据集,通过提升易用性、改进相似性检测和优化数据集验证,减少计算开销,促进AI开发的透明度和伦理合规。

Comments 4 pages, 3 figures

Journal ref Canadian Undergraduate Conference on Artificial Intelligence, 4 (2025) 75-78

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05369 2026-03-06 cs.CL 89%

Progressive Residual Warmup for Language Model Pretraining

逐步残差预热用于语言模型预训练

Tianhao Chen, Xin Xu, Lu Yin, Hao Chen, Yang Wang, Shizhe Diao, Can Yang

机构 * The Hong Kong University of Science(香港科学与技术大学) NVIDIA, Santa Clara, US(NVIDIA公司) The University of Hong Kong, Hong Kong, China(香港大学) University of Surrey, Guildford, UK(萨里大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);large language model(abstract);分类 cs.CL

AI总结 ProRes通过逐步残差预热方法提升语言模型预训练的稳定性与收敛速度,实现更快的收敛和更好的性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22760 2026-02-27 cs.DC cs.AI 89%

Distributed LLM Pretraining During Renewable Curtailment Windows: A Feasibility Study

分布式LLM预训练期间可再生能源削减窗口:可行性研究

Philipp Wiesner, Soeren Becker, Brett Cornick, Dominik Scheinert, Alexander Acker, Odej Kao

机构 * TU Berlin(柏林技术大学)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title);large language model(abstract);language model(abstract)

AI总结 本研究探讨在可再生能源削减窗口期间利用清洁廉价电力进行分布式LLM预训练的可行性,通过联邦学习框架实现跨地理分布集群的弹性训练,降低碳排放。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏