arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4847 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 4847 篇

2602.05366 2026-02-06 cs.IR cs.CL 70%

Multi-Field Tool Retrieval

多领域工具检索

Yichen Tang, Weihang Su, Yiqun Liu, Qingyao Ai

机构 * DCST, Tsinghua University(清华大学北京研究院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出多领域工具检索框架,通过细粒度多字段建模解决工具检索中的文档不完整、语义不匹配和多方面效用问题,实现更高效的任务解决。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04764 2026-02-05 cs.CL 70%

Beyond Many-Shot Translation: Scaling In-Context Demonstrations For Low-Resource Machine Translation

超越多示例翻译:为低资源机器翻译扩展上下文演示

Luis Frentzen Salim, Esteban Carlin, Alexandre Morinvil, Xi Ai, Lun-Wei Ku

机构 * Institute of Information Science, Academia Sinica(台湾“中央研究院”信息科学研究所) National Taiwan University of Science and Technology(台湾科技大学) Ecole Centrale de Marseille(马赛中央理工学院) National University of Singapore(新加坡国立大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究探索了通过扩展上下文长度来改进低资源机器翻译的ICL方法,发现增加上下文可提升性能但存在饱和点,且不同语料库类型对结果影响显著。

Comments 8 pages, 18 figures, EACL 2026 Conference - LoResMT workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02499 2026-02-05 cs.CL 70%

ROSA-Tuning: Enhancing Long-Context Modeling via Suffix Matching

ROSA-Tuning: 通过后缀匹配增强长上下文建模

Yunao Zheng, Xiaojie Wang, Lei Ren, Wei Chen

机构 * Beijing University of Posts and Telecommunications (BUPT)(北京邮电大学) Li Auto Inc.(Li Auto公司)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ROSA-Tuning通过结合CPU的ROSA检索模块与范围受限注意力,提升长上下文建模能力,实现高效处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03200 2026-02-04 cs.CV cs.AI 70%

Hand3R: Online 4D Hand-Scene Reconstruction in the Wild

Hand3R: 在线4D手-场景重建

Wendi Hu, Haonan Zhou, Wenhao Hu, Gaoang Wang

机构 * Zhejiang University(浙江大学)

专题命中 长上下文与记忆 :foundation model(abstract);prompting(abstract);分类 cs.AI

AI总结 Hand3R通过结合预训练手专家和4D场景基础模型,实现了在线4D手-场景重建,无需离线优化,提升了手部和场景的联合重建性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12992 2026-02-04 cs.CL 70%

MemoryFormer: Minimize Transformer Computation by Removing Fully-Connected Layers

MemoryFormer: 通过移除全连接层来减少Transformer计算

Ning Ding, Yehui Tang, Haochen Qin, Zhenli Zhou, Chao Xu, Lin Li, Kai Han, Heng Liao, Yunhe Wang

机构 * State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(人工智能国家重点实验室,智能科学与技术学院,北京大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Huawei HiSilicon(华为海思)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MemoryFormer通过移除全连接层,利用内存查找表和哈希算法替代线性投影,显著降低Transformer计算复杂度并提升效率。

Comments NeurIPS 2024. Code available at https://github.com/ningding-o/MemoryFormer

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01683 2026-02-03 cs.CV cs.AI 70%

FreshMem: Brain-Inspired Frequency-Space Hybrid Memory for Streaming Video Understanding

FreshMem: 基于大脑的频率-空间混合内存用于流视频理解

Kangcong Li, Peng Ye, Lin Zhang, Chao Wang, Huafeng Qin, Tao Chen

机构 * College of Future Information Technology, Fudan University, Shanghai, China(复旦大学未来信息科技学院) Shanghai Innovation Institute, Shanghai, China(上海创新研究院) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) The Chinese University of Hong Kong, Hong Kong, China(香港中文大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 FreshMem通过频率-空间混合内存网络,提升流视频理解的连续感知能力,实现短期保真与长期一致性的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01362 2026-02-03 cs.CL 70%

Balancing Understanding and Generation in Discrete Diffusion Models

在离散扩散模型中实现理解和生成的平衡

Yue Liu, Yuzhong Zhao, Zheyong Xie, Qixiang Ye, Jianbin Jiao, Yao Hu, Shaosheng Cao, Yunfan Liu

机构 * Xiaohongshu Inc.(小红书公司)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 XDLM通过平稳噪声核平衡理解和生成能力,实现MDLM和UDLM的理论统一并提升生成质量与理解能力。

Comments 32 pages, Code is available at https://github.com/MzeroMiko/XDLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23654 2026-02-03 cs.CL 70%

ARC: Argument Representation and Coverage Analysis for Zero-Shot Long Document Summarization with Instruction Following LLMs

ARC:用于遵循指令的LLM在零样本长文档摘要中的论点表示与覆盖分析

Mohamed Elaraby, Diane Litman

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ARC通过评估摘要对关键论点的保留情况,揭示了LLM在长文档摘要中的覆盖不足问题,并为改进摘要策略提供指导。

Journal ref EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23188 2026-02-02 cs.CL 70%

Deep Search with Hierarchical Meta-Cognitive Monitoring Inspired by Cognitive Neuroscience

受认知神经科学启发的深度搜索与分层元认知监控

Zhongxiang Sun, Qipeng Wang, Weijie Yu, Jingxuan Yang, Haolang Lu, Jun Xu

机构 * Gaoling School of Artificial Intelligence\ University of China Beijing China School of Information Technology Search Applications Department, Tencent Beijing China Beijing University of Posts Gaoling School of Artificial Intelligence\ University of China Search Applications Department, Tencent

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出DS-MCM框架,通过分层元认知监控机制提升深度搜索的性能和鲁棒性。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22966 2026-02-02 cs.CL 70%

A Unified View of Attention and Residual Sinks: Outlier-Driven Rescaling is Essential for Transformer Training

注意力与残差汇流的统一视角:异常驱动的重缩放对变换器训练至关重要

Zihan Qiu, Zeyu Huang, Kaiyue Wen, Peng Jin, Bo Zheng, Yuxin Zhou, Haofeng Huang, Zekun Wang, Xiao Li, Huaqing Zhang, Yang Xu, Haoran Lian, Siqi Zhang, Rui Men, Jianwei Zhang, Ivan Titov, Dayiheng Liu, Jingren Zhou, Junyang Lin

机构 * Qwen Team(Qwen团队) University of Edinburgh(爱丁堡大学) Stanford University(斯坦福大学) Tsinghua University(清华大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出异常驱动重缩放对变换器训练的重要性,通过统一注意力与残差汇流的起源,展示了异常值在训练稳定性与性能提升中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22570 2026-02-02 cs.CV cs.LG 70%

Leveraging Data to Say No: Memory Augmented Plug-and-Play Selective Prediction

利用数据说不:基于记忆的插拔式选择预测

Aditya Sarkar, Yi Li, Jiacheng Cheng, Shlok Mishra, Nuno Vasconcelos

机构 * University of Maryland, College Park(马里兰大学) University of California, San Diego(加州大学圣地亚哥分校) Qualcomm AI(高通人工智能) Yale University(耶鲁大学) Meta AI

专题命中 长上下文与记忆 :language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 本文提出基于记忆的插拔式选择预测方法,通过增强视觉语言嵌入来减少方差并改进分数校准,提升图像描述、匹配和细粒度分类性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22528 2026-02-02 cs.AI 70%

Darwinian Memory: A Training-Free Self-Regulating Memory System for GUI Agent Evolution

达尔文记忆:一种无训练的自调节记忆系统用于GUI代理进化

Hongze Mi, Yibo Feng, WenJie Lu, Song Cao, Jinyuan Li, Yanming Li, Xuelin Zhang, Haotian Luo, Songyang Peng, He Cui, Tengfei Tian, Jun Fang, Hua Chai, Naiqiang Tan

机构 * Didichuxing Co. Ltd(滴滴出行有限公司) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tianjin University(天津大学) Sun Yat-sen University(中山大学) Fudan University(复旦大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 达尔文记忆系统通过自进化架构提升GUI代理的执行稳定性与成功率,无需额外训练或架构开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21609 2026-01-30 cs.AI 70%

RecNet: Self-Evolving Preference Propagation for Agentic Recommender Systems

RecNet: 为代理推荐系统设计的自进化偏好传播

Bingqian Li, Xiaolei Wang, Junyi Li, Weitao Li, Long Zhang, Sheng Chen, Wayne Xin Zhao, Ji-Rong Wen

机构 * GSAI, Renmin University of China(清华大学) Department of Data Science, City University of Hong Kong(城市大学数据科学系)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 RecNet通过自进化机制实现代理推荐系统的实时偏好传播,利用路由代理和反馈驱动优化提升偏好传播的准确性和持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20282 2026-01-29 cs.LG 70%

Memory Retrieval in Transformers: Insights from The Encoding Specificity Principle

Transformer中的记忆检索:来自编码特异性原理的见解

Viet Hung Dinh, Ming Ding, Youyang Qu, Kanchana Thilakarathna

机构 * University of Sydney(悉尼大学) Data61 CSIRO(Data61澳大利亚联邦科学与工业研究组织)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究基于编码特异性原理,探讨了Transformer中注意力层的记忆机制,并通过实验验证了关键词作为提示的假设,为隐私保护机器无学习提供了新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19578 2026-01-28 cs.CL 70%

Yunque DeepResearch Technical Report

Yunque DeepResearch 技术报告

Yuxuan Cai, Xinyi Lai, Peng Yuan, Weiting Liu, Huajian Li, Mingda Li, Xinghua Wang, Shengxie Zheng, Yanchao Hao, Yuyang Yin, Zheng Wei

机构 * Tencent BAC(腾讯BAC) Tsinghua University(清华大学) Fudan University(复旦大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Yunque DeepResearch提出了一种分层、模块化且稳健的框架,通过多代理协调、动态上下文管理和主动监督模块解决深度研究中的关键挑战,实现先进性能并开源支持社区发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19096 2026-01-28 cs.CL 70%

PsyProbe: Proactive and Interpretable Dialogue through User State Modeling for Exploratory Counseling

PsyProbe: 通过用户状态建模实现探索性辅导的主动与可解释对话

Sohhyung Park, Hyunji Kang, Sungzoon Cho, Dongil Kim

机构 * Department of Industrial Engineering, Seoul National University(工业工程系,首尔国立大学) Department of Education, Seoul National University(教育系,首尔国立大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PsyProbe通过系统性用户状态建模和主动提问提升探索性辅导的互动效果和专业性。

Comments In Findings of the Association for Computational Linguistics: EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07713 2026-01-27 cs.CL 70%

MemWeaver: A Hierarchical Memory from Textual Interactive Behaviors for Personalized Generation

MemWeaver: 一种从文本交互行为构建的分层记忆用于个性化生成

Shuo Yu, Mingyue Cheng, Daoyu Wang, Qi Liu, Zirui Liu, Ze Guo, Xiaoyu Tao

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MemWeaver通过构建分层记忆模型,利用文本交互行为捕捉用户兴趣的时间演变和语义关系,实现深度个性化内容生成。

Comments Accepted by The Web Conference 2026 (WWW'26) 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16649 2026-01-26 cs.AI 70%

LUMINA: Long-horizon Understanding for Multi-turn Interactive Agents

LUMINA:多轮交互智能体的长视图理解

Amin Rakhsha, Thomas Hehn, Pietro Mazzaglia, Fabio Valerio Massoli, Arash Behboodi, Tribhuvanesh Orekondy

机构 * University of Toronto(多伦多大学) Qualcomm AI Research(高通人工智能研究)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LUMINA研究通过oracle反事实框架分析多轮交互智能体中各基础能力的重要性,揭示了不同技能在不同环境下的有效性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15300 2026-01-23 cs.CL 70%

Intelligence Degradation in Long-Context LLMs: Critical Threshold Determination via Natural Length Distribution Analysis

长上下文大语言模型中的智能退化:通过自然长度分布分析确定关键阈值

Weiwei Wang, Jiyong Min, Weijie Zou

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过自然长度分布分析确定长上下文LLM的关键阈值,揭示智能退化机制并提出统一框架以指导缓解策略。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13753 2026-01-23 cs.CL 70%

SCALAR: Scientific Citation-based Live Assessment of Long-context Academic Reasoning

SCALAR: 基于科学引用的长上下文学术推理实时评估

Renxi Wang, Honglin Mu, Liqun Ma, Lizhi Lin, Yunlong Feng, Timothy Baldwin, Xudong Han, Haonan Li

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SCALAR通过基于学术引用的长上下文推理评估框架,评估模型在学术写作中的推理能力,发现多项选择任务能有效区分模型性能,而填空式引用预测任务更具挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19699 2026-01-22 cs.NI cs.AI cs.MA 70%

A Layered Protocol Architecture for the Internet of Agents

面向智能体的分层协议架构

Charles Fleming, Luca Muscariello, Vijoy Pandey, Ramana Kompella

机构 * Cisco Research(思科研究)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出分层协议架构,通过智能体通信层和语义层实现智能体协作,解决LLMs在内存和计算能力上的限制,推动多智能体系统的扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12030 2026-01-21 cs.AI 70%

ARC: Active and Reflection-driven Context Management for Long-Horizon Information Seeking Agents

ARC:面向长周期信息检索代理的主动与反思驱动上下文管理

Yilun Yao, Shan Huang, Elsie Dai, Zhewen Tan, Zhenyu Duan, Shousheng Jia, Yanbing Jiang, Tong Yang

机构 * Peking University(北京大学) Beihang University(北京航空航天大学) Qiyuan Tech(启元科技)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ARC 通过主动和反思驱动的上下文管理方法,提升了长周期信息检索代理的性能,显著提高了准确性。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03285 2026-01-15 cs.AI 70%

Memory Mosaics at scale

大规模记忆马赛克

Jianyu Zhang, Léon Bottou

机构 * New York University, New York(纽约大学) FAIR, Meta Inc.(FAIR、Meta公司)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究展示了大规模记忆马赛克在扩展到大语言模型规模和真实数据集后,在训练知识学习和新任务执行方面优于transformers。

Comments Oral @ NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09113 2026-01-15 cs.AI 70%

The AI Hippocampus: How Far are We From Human Memory?

人工智能海马体:我们离人类记忆还有多远?

Zixia Jia, Jiaqi Li, Yipeng Kang, Yuxuan Wang, Tong Wu, Quansen Wang, Xiaobo Wang, Shuyi Zhang, Junzhe Shen, Qing Li, Siyuan Qi, Yitao Liang, Di He, Zilong Zheng, Song-Chun Zhu

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文综述了大语言模型和多模态大语言模型中记忆机制的分类与研究进展,探讨了隐性、显性和代理记忆框架,以及多模态场景下的记忆整合与挑战。

Journal ref Transactions on Machine Learning Research (11/2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08435 2026-01-14 cs.CL 70%

Fine-Mem: Fine-Grained Feedback Alignment for Long-Horizon Memory Management

细粒度反馈对齐的长期记忆管理:Fine-Mem

Weitao Ma, Xiaocheng Feng, Lei Huang, Xiachong Feng, Zhanyu Ma, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Meituan(美团) Peng Cheng Laboratory(鹏城实验室) The University of Hong Kong(香港大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Fine-Mem通过细粒度反馈对齐提升长周期内存管理,通过块级奖励和证据锚定奖励分配优化策略,实现更高效的内存操作与长期效用对齐。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06842 2026-01-13 cs.AI 70%

Seeing through the Conflict: Transparent Knowledge Conflict Handling in Retrieval-Augmented Generation

通过冲突看见:在检索增强生成中实现透明的知识冲突处理

Hua Ye, Siyuan Chen, Ziqi Zhong, Canran Xiao, Haoliang Zhang, Yuhan Wu, Fei Shen

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 TCR通过透明冲突解决框架提升检索增强生成中的冲突检测与知识恢复能力,减少误导性上下文影响。

Comments 9 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06562 2026-01-13 cs.LG 70%

Mosaic: Unlocking Long-Context Inference for Diffusion LLMs via Global Memory Planning and Dynamic Peak Taming

Mosaic: 通过全局内存规划和动态峰值镇压解锁扩散语言模型的长上下文推理

Liang Zheng, Bowen Shi, Yitao Hu, Jiawei Zhang, Ruofan Li, Sheng Chen, Wenxin Li, Keqiu Li

机构 * Tianjin University, China(天津大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 Mosaic通过全局内存规划和动态峰值镇压,提升扩散语言模型的长上下文推理能力,实现内存效率和推理长度的显著提升。

Comments 11 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05107 2026-01-09 cs.AI 70%

Controllable Memory Usage: Balancing Anchoring and Innovation in Long-Term Human-Agent Interaction

可控的记忆使用:在长期人机交互中平衡锚定与创新

Muzhao Tian, Zisu Huang, Xiaohua Wang, Jingwen Xu, Zhengkang Guo, Qi Qian, Yuanzhe Shen, Kaitao Song, Jiakang Yuan, Changze Lv, Xiaoqing Zheng

机构 * College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学)

专题命中 长上下文与记忆 :LLM(abstract);prompting(abstract);分类 cs.AI

AI总结 SteeM通过动态调节记忆依赖程度,在长期人机交互中平衡锚定与创新,提升个性化协作效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13197 2026-01-08 cs.CL 70%

Text Anomaly Detection with Simplified Isolation Kernel

基于简化隔离核的文本异常检测

Yang Cao, Sikun Yang, Yujiu Yang, Lianyong Qi, Ming Liu

机构 * School of Computing and Information Technology, Great Bay University(大湾大学计算机与信息科技学院) Great Bay Institute for Advanced Study, Great Bay University(大湾大学先进研究学院) Guangdong Provincial Key Laboratory of Mathematical and Neural Dynamical Systems(广东省数学与神经动力系统重点实验室) Dongguan Key Laboratory for Intelligence and Information Technology, China(东莞智能与信息技术重点实验室) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) China University of Petroleum (East China), China(中国石油大学(华东)) School of IT, Deakin University(德肯大学信息科技学院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出简化隔离核(SIK)方法,通过将高维嵌入转换为低维稀疏表示,提升文本异常检测的性能与效率。

Comments EMNLP Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02311 2026-01-06 cs.DC cs.AI 70%

Placement Semantics for Distributed Deep Learning: A Systematic Framework for Analyzing Parallelism Strategies

分布式深度学习中的放置语义:一种分析并行策略的系统框架

Deep Pankajbhai Mehta

机构 * Adobe Inc(Adobe公司)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出放置语义框架,通过分析不同并行策略在设备上的状态放置方式,统一了多种分布式训练方法,实现了对内存和通信成本的准确预测。

Comments 8 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏