arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-10 至 2026-02-10 共收录 33 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 33 篇

2602.07030 2026-02-10 cs.LG 89%

Neural Sabermetrics with World Model: Play-by-play Predictive Modeling with Large Language Model

基于世界模型的神经棒球统计学:利用大语言模型进行逐局预测建模

Young Jin Ahn, Yiyang Du, Zheyuan Zhang, Haisen Kang

专题命中 其他LLM :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 本文提出基于世界模型的神经棒球统计学,利用大语言模型预测棒球比赛发展,实验证明其在预测投球和挥棒决策上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08004 2026-02-10 cs.SE cs.SI 89%

Agent Skills: A Data-Driven Analysis of Claude Skills for Extending Large Language Model Functionality

Agent Skills: 一种数据驱动的Claude技能分析,用于扩展大型语言模型功能

George Ling, Shanshan Zhong, Richard Huang

专题命中 其他LLM :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文通过分析Claude技能的数据,揭示了技能在软件工程中的集中使用及安全风险,为技能重用和标准化提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13147 2026-02-10 cs.LG cs.AI cs.CV 88%

AgentDrug: Utilizing Large Language Models in An Agentic Workflow for Zero-Shot Molecular Editing

AgentDrug: 利用大语言模型在代理工作流中进行零样本分子编辑

Khiem Le, Ting Hua, Nitesh V. Chawla

机构 * University of Notre Dame(诺丁汉大学)

专题命中 其他LLM :large language model(title);language model(title);LLM(abstract);prompting(abstract)

AI总结 AgentDrug通过代理工作流利用大语言模型,在分子编辑任务中实现更高准确性,特别是在单属性和多属性编辑任务中表现出显著性能提升。

Comments EMNLP'25 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07838 2026-02-10 math.NA cs.NA 88%

Deep Energy Method with Large Language Model assistance: an open-source Streamlit-based platform for solving variational PDEs

基于大语言模型的深度能量方法:一种用于求解变分偏微分方程的开源Streamlit平台

Yizheng Wang, Cosmin Anitescu, Mohammad Sadegh Eshaghi, Xiaoying Zhuang, Timon Rabczuk, Yinghua Liu

专题命中 其他LLM :large language model(title,abstract);language model(title,abstract)

AI总结 LM-DEM是一种基于大语言模型的开源平台,用于求解变分偏微分方程,通过简化几何建模和并行计算提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07211 2026-02-10 cs.CL cs.SD 87%

Equipping LLM with Directional Multi-Talker Speech Understanding Capabilities

为LLM配备方向性多说话人语音理解能力

Ju Lin, Jing Pan, Ruizhi Li, Ming Sun, Yuzong Liu, Alaa Hassan, Jing Zheng, Florian Metze

机构 * Meta, USA(Meta公司)

专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出两种方法,通过多麦克风阵列和级联系统,使LLM具备方向性多说话人语音理解能力,提升了语音识别和翻译性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08009 2026-02-10 cs.AI cs.CL 86%

Towards Adaptive, Scalable, and Robust Coordination of LLM Agents: A Dynamic Ad-Hoc Networking Perspective

面向自适应、可扩展和鲁棒的LLM代理协调:动态即插即用网络视角

Rui Li, Zeyu Zhang, Xiaohe Bo, Quanyu Dai, Chaozhuo Li, Feng Wen, Xu Chen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Huawei Technologies Ltd.(华为技术有限公司) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RAPS范式,通过动态即插即用网络方法实现LLM代理的自适应、可扩展和鲁棒协调,通过反应性订阅和贝叶斯声誉机制提升多代理协作的适应性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08276 2026-02-10 cs.AI 85%

Toward Formalizing LLM-Based Agent Designs through Structural Context Modeling and Semantic Dynamics Analysis

通过结构上下文建模和语义动态分析正式化基于大语言模型的智能体设计

Haoyu Jia, Kento Kawaharazuka, Kei Okada

专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出结构上下文模型和语义动态分析工作流,旨在通过形式化方法提升大语言模型智能体设计的可分析性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08636 2026-02-10 cs.HC 85%

Supporting Effective Goal Setting with LLM-Based Chatbots

基于大语言模型的聊天机器人辅助有效目标设定

Michel Schimpf, Sebastian Maier, Anton Wyrowski, Lara Christoforakos, Stefan Feuerriegel, Thomas Bohné

专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本研究探讨了基于大语言模型的聊天机器人如何通过结合指导和反馈来帮助用户更有效地设定行为目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10566 2026-02-10 cs.LG 83%

ASIDE: Architectural Separation of Instructions and Data in Language Models

ASIDE: 语言模型中指令与数据的架构分离

Egor Zverev, Evgenii Kortukov, Alexander Panfilov, Alexandra Volkova, Soroush Tabesh, Sebastian Lapuschkin, Wojciech Samek, Christoph H. Lampert

机构 * Institute of Science and Technology Austria (ISTA)(奥地利科学与技术研究所) Fraunhofer Heinrich Hertz Institute(弗劳恩霍夫海因里希·赫兹研究所) ELLIS Institute Tübingen(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心) Centre of eXplainable Artificial Intelligence(可解释人工智能中心) Technische Universität Berlin(柏林技术大学) Berlin Institute for the Foundations of Learning and Data (BIFOLD)(柏林学习与数据基础研究所)

专题命中 其他LLM :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 ASIDE通过在令牌嵌入层面实现指令与数据的分离,提升了语言模型的安全性和性能

Comments ICLR 2026 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18727 2026-02-10 cs.LG 83%

LogSyn: A Few-Shot LLM Framework for Structured Insight Extraction from Unstructured General Aviation Maintenance Logs

LogSyn: 一种基于少样本学习的LLM框架,用于从非结构化通用航空维护日志中提取结构化洞察

Devansh Agarwal, Maitreyi Chatterjee, Biplab Chatterjee

专题命中 其他LLM :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 LogSyn通过少样本学习利用LLM将非结构化航空维护日志转化为结构化数据,实现故障模式识别与事件分类,提升航空维护流程和预测分析能力。

Comments Accepted in Proceedings of the 3rd INCOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07891 2026-02-10 cs.CV cs.AI 79%

Scalable Adaptation of 3D Geometric Foundation Models via Weak Supervision from Internet Video

通过互联网视频弱监督实现3D几何基础模型的可扩展适应

Zihui Gao, Ke Liu, Donny Y. Chen, Duochao Shi, Guosheng Lin, Hao Chen, Chunhua Shen

机构 * Zhejiang University, State Key Lab of CAD \& CG Nanyang Technological University Independent Researcher Zhejiang University of Technology

专题命中 其他LLM :foundation model(title,abstract);分类 cs.AI

AI总结 SAGE通过互联网视频弱监督实现几何基础模型的可扩展适应,提升零样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11195 2026-02-10 cs.CR 78%

SoK: The Security-Safety Continuum of Multimodal Foundation Models through Information Flow and Global Game-Theoretic Analysis of Asymmetric Threats

SoK:通过信息流和不对称威胁的全局博弈论分析,多模态基础模型的安全-安全性连续体

Ruoxi Sun, Jiamin Chang, Hammond Pearce, Chaowei Xiao, Bo Li, Qi Wu, Surya Nepal, Minhui Xue

专题命中 其他LLM :foundation model(title,abstract)

AI总结 本文通过信息流和博弈论分析,探讨多模态基础模型的安全与安全性连续体,提出系统级防护优于模型级防护,并定义自我破坏阈值以触发终止机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11261 2026-02-10 cs.CL 77%

Kahaani: A Multimodal Co-Creative Storytelling System

Kahaani:一种多模态协同创作叙事系统

Samee Arif, Muhammad Saad Haroon, Aamina Jamal Khan, Taimoor Arif, Agha Ali Raza, Awais Athar

机构 * Lahore University of Management Sciences(拉瓦尔大学管理科学学院) University of Michigan(密歇根大学) Strategize Labs(战略实验室)

专题命中 其他LLM :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Kahaani通过多模态技术帮助儿童提升英语能力、学习生活教训并理解故事结构,采用协同创作方式提供沉浸式教育体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23261 2026-02-10 cs.SE 75%

The Matthew Effect of AI Programming Assistants: A Hidden Bias in Software Evolution

AI编程助手的马太效应:软件演化的隐藏偏见

Fei Gu, Zi Liang, Jiahao MA, Hongzong LI

专题命中 其他LLM :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了AI编程助手对软件生态系统的影响,发现主流语言和框架因数据丰富而获得更优支持,揭示了软件演化的隐藏偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18588 2026-02-10 cs.AI cs.CL cs.LG 75%

Stability as a Liability:Systematic Breakdown of Linguistic Structure in LLMs

稳定性作为负债:在大语言模型中语言结构的系统性崩溃

Xianzhe Meng, Qiangsheng Zeng, Ling Luo, Qinghan Yang, Jiarui Hao, Wenbo Wu, Qinyu Wang, Rui Yin, Lin Qi, Renzhi Lu

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology, Wuhan, China(人工智能与自动化学院,华中科技大学,武汉,中国) National Institute for Data Science in Health and Medicine, Xiamen University, Xiamen, China(数据科学与医学研究院,厦门大学,厦门,中国) School of Mathematics and Statistics, Huazhong University of Science and Technology, Wuhan, China(数学与统计学院,华中科技大学,武汉,中国) School of Computer Science and Technology, Huazhong University of Science and Technology, Wuhan, China(计算机科学与技术学院,华中科技大学,武汉,中国) School of Electronic Information and Communications, Huazhong University of Science and Technology, Wuhan, China(电子信息与通信学院,华中科技大学,武汉,中国) School of Electrical and Electronic Engineering, Huazhong University of Science and Technology, Wuhan, China(电气与电子工程学院,华中科技大学,武汉,中国) School of Physics, Huazhong University of Science and Technology, Wuhan, China(物理学院,华中科技大学,武汉,中国)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究揭示了大语言模型中训练稳定性与生成表达性之间的不一致性,指出稳定性可能带来系统性退化,而非保证生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19611 2026-02-10 cs.HC 75%

Scene2Hap: Generating Scene-Wide Haptics for VR from Scene Context with Multimodal LLMs

Scene2Hap: 从场景上下文生成VR场景中的全域触觉反馈

Arata Jingu, Easa AliAbbasi, Sara Safaee, Paul Strohmeier, Jürgen Steimle

专题命中 其他LLM :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 Scene2Hap通过多模态大语言模型生成VR场景中的触觉反馈,提升沉浸感与真实感。

Comments Accepted at CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01401 2026-02-10 cs.CL cs.AI 73%

From Pragmas to Partners: A Symbiotic Evolution of Agentic High-Level Synthesis

从语义到伙伴:代理高层综合的共生进化

Niansong Zhang, Sunwoo Kim, Shreesha Srinath, Zhiru Zhang

机构 * Cornell University(康奈尔大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了在代理时代高层综合(HLS)的重要性,提出HLS作为代理优化的自然层次,并提出HLS工具的局限性及代理在其中的潜在作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03041 2026-02-10 cs.LG cs.AI 73%

Optimas: Optimizing Compound AI Systems with Globally Aligned Local Rewards

Optimas: 通过全局对齐的局部奖励优化复合AI系统

Shirley Wu, Parth Sarthi, Shiyu Zhao, Aaron Lee, Herumb Shandilya, Adrian Mladenic Grobelnik, Nurendra Choudhary, Eddie Huang, Karthik Subbian, Linjun Zhang, Diyi Yang, James Zou, Jure Leskovec

机构 * Stanford University(斯坦福大学) Amazon(亚马逊) Jožef Stefan Institute(乔泽夫·斯蒂芬研究所) Rutgers University(罗格斯大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 Optimas通过全局对齐的局部奖励优化复合AI系统,有效提升复合系统的性能。

Comments Accepted to ICLR 2026. 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07338 2026-02-10 cs.CL cs.AI 73%

Intent Mismatch Causes LLMs to Get Lost in Multi-Turn Conversation

意图不匹配导致大语言模型在多轮对话中迷失

Geng Liu, Fei Zhu, Rong Feng, Changyi Ma, Shiqi Wang, Gaofeng Meng

机构 * College of Computing, City University of Hong Kong(香港城市大学计算机学院) Centre for Artificial Intelligence and Robotics, HKISI, CAS(中国科学院香港中文大学人工智能与机器人中心) School of Artificial Intelligence, Jilin University(吉林大学人工智能学院)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出调解员-助手架构,通过解耦意图理解和任务执行,解决大语言模型在多轮对话中因意图不匹配导致的性能下降问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08901 2026-02-10 cs.LG 70%

GSS: Gated Subspace Steering for Selective Memorization Mitigation in LLMs

GSS:门控子空间定向用于LLM中的选择性记忆抑制

Xuanqi Zhang, Haoyang Shang, Xiaoxiao Li

机构 * University of British Columbia Vector Institute Independent Researcher

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 GSS通过门控子空间定向方法,有效缓解LLM中的选择性记忆问题,比优化方法节省大量计算资源并提升性能。

Comments 34 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08695 2026-02-10 cs.LG 70%

Trapped by simplicity: When Transformers fail to learn from noisy features

陷入简单性:当Transformer无法从噪声特征中学习时

Evan Peters, Ando Deng, Matheus H. Zambianco, Devin Blankespoor, Achim Kempf

机构 * University of Waterloo(滑铁卢大学) Perimeter Institute for Theoretical Physics(理论物理研究所)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究了Transformer在噪声特征下的学习能力,发现其在某些布尔函数上表现优异,但在随机k-junta函数上因简单性偏见和敏感度差异而失效。

Comments 13+12 pages, 7 figures. Accepted at ICLR 2026

Journal ref International Conference on Learning Representations, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08208 2026-02-10 cs.CL cs.HC 70%

LLMs and people both learn to form conventions -- just not with each other

大语言模型和人类都学会形成惯例——但并不是彼此之间

Cameron R. Jones, Agnese Lombardi, Kyle Mahowald, Benjamin K. Bergen

机构 * Department of Psychology, Stony Brook University(心理学系,石溪大学) Department of Cognitive Science, University of California San Diego(认知科学系,加州圣地亚哥大学) Department of Philology, Literature, and Linguistics, University of Pisa(philology、文学与语言学系,比萨大学) Department of Linguistics, University of Texas at Austin(语言学系,德克萨斯大学奥斯汀分校)

专题命中 其他LLM :LLM(abstract);prompting(abstract);分类 cs.CL

AI总结 研究发现人类和AI在同类型对话中能形成惯例,但人机对话效果较差,表明对话协调需要共同的解释偏见。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16545 2026-02-10 cond-mat.mtrl-sci cs.LG 70%

Predictive Inorganic Synthesis based on Machine Learning using Small Data sets: a case study of size-controlled Cu Nanoparticles

基于机器学习的预测无机合成(小数据集应用):铜纳米颗粒尺寸控制的案例研究

Brent Motmans, Digvijay Ghogare, Thijs G. I. van Wijk, Joren Van Herck, Pieter De Meyer, Berend Smit, An Hardy, Danny E. P. Vanpoucke

机构 * Hasselt University, Institute for Materials Research (IUMAT), Quantum \& Artificial inTelligence design Of Materials (QuATOMs), Martelarenlaan 42, B-3500 Hasselt, Belgium Hasselt University, Institute for Materials Research (IUMAT), Hybrid Materials Design (HyMaD), Martelarenlaan 42, B-3500 Hasselt, Belgium Hasselt University, Institute for Materials Research (IUMAT), Design Electrochemistry Excellence Centre (ELEC), Materials \& Chemistry Unit, Flemish Institute for Technological Research (VITO), Boeretang 200, Mol, 2400 Belgium Laboratory of Molecular Simulation (LSMO), Institut des Sciences et Ingénierie Chimiques, École Polytechnique Fédérale de Lausanne (EPFL), Rue de l’Industrie 17, CH-1951 Sion, Switzerland

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究利用小数据集和传统机器学习方法,成功预测了铜纳米颗粒的尺寸,展示了在数据有限条件下,传统ML方法在合成控制中的有效性。

Comments 23 pages, 17 figures, 13 tables (including SI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07433 2026-02-10 cs.CL 70%

From Token to Line: Enhancing Code Generation with a Long-Term Perspective

从标记到行:通过长期视角增强代码生成

Tingwei Lu, Yangning Li, Liyuan Wang, Binghuai Lin, Qingsong Lv, Zishan Xu, Hai-Tao Zheng, Yinghui Li, Hong-Gee Kim

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出LSR-MCTS算法,通过MCTS逐行生成代码并引入自我修正机制,提升代码生成质量与多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01465 2026-02-10 cs.AI cs.SE 70%

Agyn: A Multi-Agent System for Team-Based Autonomous Software Engineering

Agyn:基于团队的自主软件工程多智能体系统

Nikita Benkovich, Vitalii Valkov

机构 * Mila – Quebec AI Institute (e-Lab)(魁北克AI研究所(e-Lab)) Tel-Aviv, Israel(特拉维夫,以色列)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Agyn提出了一种基于团队结构的多智能体系统,通过模拟工程团队的组织过程和协作方法,实现自主软件工程任务的高效处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00612 2026-02-10 cs.CL 70%

Lookahead-then-Verify: Reliable Constrained Decoding for Diffusion LLMs under Context-Free Grammars

前瞻性验证:用于扩散大语言模型在无上下文自由文法下的可靠约束解码

Yitong Zhang, Yongmin Li, Yuetong Liu, Jia Li, Xiaoran Jia, Zherui Li, Ge Li

机构 * College of AI, Tsinghua University(清华大学人工智能学院) School of Computer Science, Peking University(北京大学计算机学院) School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 LAVE通过并行预测标记分布实现可靠的约束解码,提升扩散大语言模型在上下文无关文法下的生成准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01918 2026-02-10 cs.HC 67%

When Workout Buddies Are Virtual: AI Agents and Human Peers in a Longitudinal Physical Activity Study

当训练伙伴是虚拟的:AI代理与人类同伴在长期身体活动研究中的应用

Alessandro Silacci, Mauro Cherubini, Arianna Boldi, Amon Rapp, Maurizio Caon

专题命中 其他LLM :large language model(abstract);language model(abstract)

AI总结 本文研究了AI代理与人类同伴在长期身体活动中的影响,发现AI能提供更稳定的鼓励,而人类同伴则增强社会存在感,两者互补促进持续锻炼。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14745 2026-02-10 cs.SE 67%

On the Use of Agentic Coding: An Empirical Study of Pull Requests on GitHub

关于代理编码的使用:对GitHub拉取请求的实证研究

Miku Watanabe, Hao Li, Yutaro Kashiwa, Brittany Reid, Hajimu Iida, Ahmed E. Hassan

专题命中 其他LLM :large language model(abstract);language model(abstract)

AI总结 本文研究了GitHub上代理编码生成的拉取请求的接受情况,发现83.8%的PR被合并,其中54.9%无需修改,剩余需人类修订。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03231 2026-02-10 cs.RO 67%

Exploring persuasive interactions with generative social robots: An experimental framework

探索生成社交机器人中的说服互动:一个实验框架

Stephan Vonschallen, Larissa Julia Corina Finsler, Theresa Schmiedel, Friederike Eyssel

专题命中 其他LLM :large language model(abstract);language model(abstract)

AI总结 本研究通过实验框架探讨生成社交机器人在说服互动中的表现,发现其说服效果受情境和机器人行为影响,需进一步优化以提升说服力。

Comments A shortened version of this paper was accepted as poster for the Thirteenth International Conference on Human-Agent Interaction (HAI2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19870 2026-02-10 cs.LG cs.AI 62%

DeMo: Decoupled Momentum Optimization

DeMo:解耦动量优化

Bowen Peng, Lizhang Chen, Baiyu Su, Jeffrey Quesnelle, Diederik P. Kingma, Qiang Liu

专题命中 其他LLM :language model(abstract);分类 cs.AI、cs.LG

AI总结 DeMo通过解耦动量更新、快速变换和稀疏化,显著减少通信带宽,实现高效多数据中心训练。

详情

展开后加载摘要…

URL PDF HTML 收藏