arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-01 至 2026-01-01 共收录 193 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 50 篇

2509.23105 2026-01-01 cs.CV 67%

Towards Comprehensive Interactive Change Understanding in Remote Sensing: A Large-scale Dataset and Dual-granularity Enhanced VLM

迈向遥感中全面交互变化理解:一个大规模数据集和双粒度增强VLM

Junxiao Xue, Quan Deng, Xuecheng Wu, Kelu Yao, Xinyi Yin, Fei Yu, Wei Zhou, Yanfei Zhong, Yang Liu, Dingkang Yang

机构 * Research Center for Space Computing System, Zhejiang Lab(浙江省实验室空间计算系统研究中心) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) School of Cyber Science and Engineering, Zhengzhou University(郑州大学网络科学与工程学院) Liaoning University of Technology(辽宁科技学院) School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing (LIESMARS), Wuhan University(武汉测绘遥感与信息工程国家重点实验室(LIESMARS)) College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院)

专题命中 评测与基准 :language model(abstract);instruction tuning(abstract)

AI总结 本文提出ChangeIMTI数据集和ChangeVG模型,通过双粒度增强方法提升遥感图像变化理解的准确性和交互性。

Comments Junxiao Xue, Quan Deng, and Xuecheng Wu deserve equal contributions

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12605 2026-01-01 cs.HC 67%

The Rise of AI Companions: How Human-Chatbot Relationships Influence Well-Being

AI伴侣的崛起:人类与聊天机器人关系如何影响幸福感

Yutong Zhang, Dora Zhao, Jeffrey T. Hancock, Robert Kraut, Diyi Yang

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究探讨了AI伴侣对幸福感的影响,发现依赖聊天机器人寻求陪伴的人群幸福感较低,尤其在高互动和高自我披露情况下,且无法完全替代人类社交。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23837 2026-01-01 cs.CL cs.AI cs.LG 67%

Adversarial Lens: Exploiting Attention Layers to Generate Adversarial Examples for Evaluation

对抗性镜头:利用注意力层生成对抗性示例用于评估

Kaustubh Dhole

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过注意力层生成对抗性示例,用于评估大型语言模型的鲁棒性,发现其在保持语义相似性的同时可降低评估性能,但也存在语法退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01560 2026-01-01 cs.CL cs.AI 62%

In-N-Out: A Parameter-Level API Graph Dataset for Tool Agents

In-N-Out: 一个用于工具代理的参数级API图数据集

Seungkyu Lee, Nalim Kim, Yohan Jo

机构 * Department of Industrial Engineering, Seoul National University(首尔国立大学工业工程系) Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 In-N-Out通过构建参数级API图数据集,提升工具代理在复杂任务中识别和调用API的能力,显著改善了多工具查询生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23813 2026-01-01 cs.CL cs.AI 62%

StressRoBERTa: Cross-Condition Transfer Learning from Depression, Anxiety, and PTSD to Stress Detection

StressRoBERTa:从抑郁症、焦虑和PTSD到压力检测的跨条件迁移学习

Amal Alqahtani, Efsun Kayi, Mona Diab

机构 * The George Washington University(乔治华盛顿大学) King Saud University(沙特国王大学) Johns Hopkins University Applied Physics Laboratory(约翰霍普金斯大学应用物理实验室) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 StressRoBERTa通过跨条件迁移学习提升英文推文中的压力检测性能,其在SMM4H 2022任务8上取得82% F1分数,优于现有系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24492 2026-01-01 eess.IV cs.AI cs.CV 57%

Automated Classification of First-Trimester Fetal Heart Views Using Ultrasound-Specific Self-Supervised Learning

利用超声特定自监督学习实现早孕期胎儿心脏视图的自动化分类

Youssef Megahed, Aylin Erman, Robin Ducharme, Mark C. Walker, Steven Hawken, Adrian D. C. Chan

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 本研究提出了一种基于自监督学习的超声基础模型USF-MAE,用于早孕期胎儿心脏视图的自动化分类,实现了优于传统模型的性能。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24294 2026-01-01 cs.CV cs.AI 57%

Virtual-Eyes: Quantitative Validation of a Lung CT Quality-Control Pipeline for Foundation-Model Cancer Risk Prediction

虚拟眼睛:一种用于基础模型癌症风险预测的肺CT质量控制流水线的定量验证

Md. Enamul Hoq, Linda Larson-Prior, Fred Prior

机构 * Department of Biomedical Informatics College of Medicine University of Arkansas for Medical Sciences(生物医学信息学系医学院美国亚拉巴马医学科学大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 Virtual-Eyes通过提升基础模型性能,验证了肺CT质量控制对癌症风险预测的积极影响,但可能影响专业模型的性能。

Comments 23 pages, and Under Review-MIDL-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16881 2026-01-01 cs.RO cs.LG 57%

PolaRiS: Scalable Real-to-Sim Evaluations for Generalist Robot Policies

PolaRiS:面向通用机器人策略的可扩展真实-仿真评估

Arhan Jain, Mingtong Zhang, Kanav Arora, William Chen, Marcel Torne, Muhammad Zubair Irshad, Sergey Zakharov, Yue Wang, Sergey Levine, Chelsea Finn, Wei-Chiu Ma, Dhruv Shah, Abhishek Gupta, Karl Pertsch

机构 * University of Washington(华盛顿大学) Princeton University(普林斯顿大学) University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) Toyota Research Institute(丰田研究中心) University of Southern California(南加州大学) Cornell University(康奈尔大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 PolaRiS通过神经重建和数据协同训练,实现高保真度的机器人策略真实-仿真评估,提升仿真与现实的关联性并简化环境构建。

Comments Website: https://polaris-evals.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24636 2026-01-01 cs.SE 50%

How Do Agentic AI Systems Deal With Software Energy Concerns? A Pull Request-Based Study

代理AI系统如何处理软件能耗问题?基于拉取请求的研究

Tanjum Motin Mitul, Md. Masud Mazumder, Md Nahidul Islam Opu, Shaiful Chowdhury

专题命中 评测与基准 :language model(abstract)

AI总结 本文研究了代理AI系统在生成软件时对能耗问题的意识,通过分析拉取请求发现,尽管构建和运行这些系统耗能高,但生成的软件制品表现出一定的能耗意识,但优化相关的PR因影响可维护性而被接受较少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24630 2026-01-01 cs.SE 50%

How Do Agentic AI Systems Address Performance Optimizations? A BERTopic-Based Analysis of Pull Requests

代理AI系统如何解决性能优化问题?基于BERTopic的拉取请求分析

Md Nahidul Islam Opu, Shahidul Islam, Muhammad Asaduzzaman, Shaiful Chowdhury

专题命中 评测与基准 :LLM(abstract)

AI总结 本文通过BERTopic分析,揭示了代理AI系统在软件开发中处理性能优化的方式及影响因素。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 35 篇

2507.02002 2026-01-01 cs.MA 89%

Dynamic Strategy Adaptation in Multi-Agent Environments with Large Language Models

多智能体环境中基于大语言模型的动态策略适应

Shaurya Mallampati, Rashed Shelim, Walid Saad, Naren Ramakrishnan

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出基于大语言模型和博弈论的动态策略适应框架,提升多智能体协作效率和灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24044 2026-01-01 cs.CR cs.AI cs.CL 86%

Jailbreaking Attacks vs. Content Safety Filters: How Far Are We in the LLM Safety Arms Race?

对抗攻击与内容安全过滤:我们在LLM安全竞赛中走了多远?

Yuan Xin, Dingfan Chen, Linyi Yang, Michael Backes, Xiao Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA 欧洲信息安全中心) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Southern University of Science and Technology(南方科技大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文系统评估了针对LLM安全对齐的劫持攻击,发现大多数攻击可被安全过滤器检测到,同时指出需优化召回率和精确度以提升安全系统性能。

Comments 26 pages,11 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23765 2026-01-01 cs.CL cs.AI 86%

Entropy-Aware Speculative Decoding Toward Improved LLM Reasoning

基于熵的推测解码:改进大语言模型推理

Tiancheng Su, Meicong Zhang, Guoxiu He

机构 * School of Economics and Management(经济管理学院)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 基于熵的推测解码通过动态熵惩罚提升大语言模型推理性能,实验表明其在多数情况下优于目标模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24739 2026-01-01 cs.SD 86%

SLM-TTA: A Framework for Test-Time Adaptation of Generative Spoken Language Models

SLM-TTA: 生成式语音语言模型的测试时适应框架

Yuan-Kuei Wu, Yang Liu, Yiteng Huang, Zhaojun Yang, Haibin Wu, Ruizhe Huang, Yi-Te, Hsu, Shuyu Kong, Ming Sun, Florian Metze, Li Wan

机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taiwan(台湾国立台湾大学通信工程研究所) Meta, USA(Meta公司)

专题命中 效率与部署 :language model(title,abstract);SLM(title)

AI总结 SLM-TTA框架通过测试时适应提升生成式语音语言模型在复杂语音环境中的鲁棒性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24750 2026-01-01 cs.NI 85%

Analyzing Communication Predictability in LLM Training

分析在LLM训练中的通信可预测性

Wenxue Li, Xiangzhou Liu, Yuxuan Li, Yilun Jin, Zhenghang Ren, Xudong Liao, Han Tian, Bo Ren, Zhizhen Zhong, Guyue Liu, Ying Zhang, Kai Chen

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本研究系统分析了LLM训练中的通信可预测性,提出ConfigTuner工具,通过优化配置提升了训练吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24511 2026-01-01 cs.DC 82%

Understanding LLM Checkpoint/Restore I/O Strategies and Patterns

理解LLM检查点/恢复I/O策略和模式

Mikaila J. Gossman, Avinash Maurya, Bogdan Nicolae, Jon C. Calhoun

专题命中 效率与部署 :LLM(title,abstract);foundation model(abstract)

AI总结 本文研究了LLM检查点/恢复I/O策略,通过微基准测试发现聚合和合并策略能显著提升写入吞吐量,比现有方法提高3.9至7.6倍。

Comments SCA/HPCAsia 2026 Workshops: Supercomputing Asia and International Conference on High Performance Computing in the Asia Pacific Region Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24473 2026-01-01 cs.CV cs.AI eess.IV 79%

F2IDiff: Real-world Image Super-resolution using Feature to Image Diffusion Foundation Model

F2IDiff: 利用特征到图像扩散基础模型进行现实世界图像超分辨率

Devendra K. Jangid, Ripon K. Saha, Dilshan Godaliyadda, Jing Li, Seok-Jun Lee, Hamid R. Sheikh

机构 * MPI Lab, Samsung Research America(Samsung Research America研究院)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI

AI总结 F2IDiff通过使用低层次特征条件的扩散模型提升现实世界图像超分辨率性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08151 2026-01-01 cs.AI 79%

Foundation Models Knowledge Distillation For Battery Capacity Degradation Forecast

基础模型知识蒸馏用于电池容量退化预测

Joey Chan, Zhen Chen, Ershun Pan

机构 * Department of Industrial Engineering and Management, School of Mechanical Engineering, Shanghai Jiao Tong University, Shanghai 200240, China(工业工程与管理系,机械工程学院,上海交通大学,上海200240,中国)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于基础模型和知识蒸馏的电池容量退化预测方法,通过微调和蒸馏提升模型的泛化能力和部署效率。

Journal ref Reliability Engineering & System Safety, Volume 270, 2026, 112139, ISSN 0951-8320,

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18785 2026-01-01 cs.LG 79%

ALF: Advertiser Large Foundation Model for Multi-Modal Advertiser Understanding

ALF:多模态广告商基础模型用于多模态广告商理解

Santosh Rajagopalan, Jonathan Vronsky, Songbai Yan, S. Alireza Golestaneh, Shubhra Chandra, Min Zhou

机构 * Google(谷歌)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 ALF通过多模态Transformer架构和多任务优化,实现了广告商行为理解的高精度和高召回率,显著提升了欺诈检测和政策识别的性能。

Comments KDD 2026 ADS Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23858 2026-01-01 cs.LG cs.PL 79%

Yggdrasil: Bridging Dynamic Speculation and Static Runtime for Latency-Optimal Tree-Based LLM Decoding

Yggdrasil:连接动态推测与静态运行时以实现延迟最优的树基LLM解码

Yue Guan, Changming Yu, Shihan Fang, Weiming Hu, Zaifeng Pan, Zheng Wang, Zihan Liu, Yangjie Zhou, Yufei Ding, Minyi Guo, Jingwen Leng

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Qizhi Institute(上海启智研究院) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.LG

AI总结 Yggdrasil通过上下文感知的树起草和编译友好的执行,实现延迟最优的树基LLM解码,支持未经修改的LLM并在多种硬件上实现3.98倍速度提升。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24939 2026-01-01 cs.HC cs.CL 77%

Vibe Coding, Interface Flattening

vibe coding作为界面扁平化的现象

Hongrui Jin

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文探讨了vibe coding作为界面扁平化的现象,分析了大型语言模型如何通过重新配置编程界面,改变人机交互的政治经济结构。

Comments 16 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24614 2026-01-01 cs.NI cs.AI 77%

Chat-Driven Optimal Management for Virtual Network Services

基于聊天的虚拟网络服务最优管理

Yuya Miyaoka, Masaki Inoue, Kengo Urata, Shigeaki Harada

机构 * Department of Applied Physics and Physico-Informatics, Keio University(应用物理与物理信息学系,庆应大学) Network Service Laboratories, NTT, Inc.(网络服务实验室,NTT公司) IOWN Product Design Center, NTT, Inc.(IOWN产品设计中心,NTT公司)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种结合NLP与优化的聊天驱动虚拟网络管理框架,通过意图提取和优化算法实现网络配置的动态更新与高可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24545 2026-01-01 cs.LG cs.AI cs.CL stat.ML 75%

More Than Bits: Multi-Envelope Double Binary Factorization for Extreme Quantization

超越比特:用于极低比特量化的大规模语言模型的多包双二进制分解

Yuma Ichikawa, Yoshihiko Fujisawa, Yudai Fujimoto, Akira Sakai, Katsuki Fujisawa

机构 * Fujitsu Limited(富士通株式会社) RIKEN Center for AIP(理化学研究所AIP中心) Institute of Science Tokyo(东京科学研究所) Tokai University(立命馆大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出多包双二进制分解(MDBF)以提升大规模语言模型在极低比特量化下的性能,通过共享符号基和优化初始化方法,在保持部署友好性的同时提高准确性和效率。

Comments 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20290 2026-01-01 cs.CR 75%

APT-CGLP: Advanced Persistent Threat Hunting via Contrastive Graph-Language Pre-Training

APT-CGLP: 通过对比图-语言预训练实现高级持续威胁狩猎

Xuebo Qiu, Mingqi Lv, Yimei Zhang, Tieming Chen, Tiantian Zhu, Qijie Song, Shouling Ji

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 APT-CGLP通过对比图-语言预训练实现高级持续威胁狩猎,提升跨模态语义匹配的准确性和效率。

Comments Accepted by SIGKDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25059 2026-01-01 cs.DC cs.LG cs.NI 74%

Reliable and Resilient Collective Communication Library for LLM Training and Serving

用于LLM训练和服务的可靠且容错的集体通信库

Wei Wang, Nengneng Yu, Sixian Xiong, Zaoxing Liu

专题命中 效率与部署 :LLM(title);分类 cs.LG

AI总结 R$^2$CCL通过多NIC硬件实现无损低开销故障转移,提升LLM训练和推断的可靠性与容错能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13886 2026-01-01 cs.LG cs.AI cs.PF 73%

OPTIMA: Optimal One-shot Pruning for LLMs via Quadratic Programming Reconstruction

通过二次规划重构实现LLM的最优单次剪枝:OPTIMA

Mohammad Mozaffari, Samuel Kushnir, Maryam Mehri Dehnavi, Amir Yazdanbakhsh

机构 * University of Toronto(多伦多大学) Google DeepMind(谷歌DeepMind)

专题命中 效率与部署 :LLM(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 OPTIMA通过二次规划重构实现LLM的高效单次剪枝,提升零样本性能达3.97%,在单加速器上实现大规模剪枝。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08990 2026-01-01 cs.CR cs.AI cs.CL 73%

Effective and Efficient Jailbreaks of Black-Box LLMs with Cross-Behavior Attacks

对黑盒大语言模型进行高效有效的跨行为攻击

Vasudev Gohil

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种高效的黑盒LLM劫持方法,通过跨行为攻击显著提高攻击效率和成功率,同时减少查询次数并展示良好的迁移能力。

Comments Code is at https://github.com/gohil-vasudev/JCB

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00414 2026-01-01 cs.CL 70%

Semantic Parsing with Candidate Expressions for Knowledge Base Question Answering

基于候选表达式的语义解析用于知识库问答

Daehwan Nam, Gary Geunbae Lee

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于候选表达式增强的语义解析器,用于知识库问答,通过引入子类型推断和联合类型规则提升解析效率和准确性。

Journal ref Expert Syst. Appl. 306 (2026) 130564

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24687 2026-01-01 quant-ph cs.CL 70%

Quantum Visual Word Sense Disambiguation: Unraveling Ambiguities Through Quantum Inference Model

量子视觉词义消歧:通过量子推理模型解开歧义

Wenbo Qiao, Peng Zhang, Qinghua Hu

机构 * School of New Media and Communication, Tianjin University(天津大学新媒体与传播学院) College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出量子推理模型用于视觉词义消歧,通过量子叠加态缓解语义偏见,实验显示优于经典方法,尤其利用大语言模型非专业词义提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24157 2026-01-01 cs.CL 70%

Training Report of TeleChat3-MoE

TeleChat3-MoE训练报告

Xinzhang Liu, Chao Wang, Zhihao Yang, Zhuo Jiang, Xuncheng Zhao, Haoran Wang, Lei Li, Dongdong He, Luobin Liu, Kaizhe Yuan, Han Gao, Zihan Wang, Yitong Yao, Sishi Xiong, Wenmin Deng, Haowei He, Kaidong Yu, Yu Zhao, Ruiyu Fang, Yuhao Jiang, Yingyan Li, Xiaohui Hu, Xi Yu, Jingqi Li, Yanwei Liu, Qingli Li, Xinyu Shi, Junhao Niu, Chengnuo Huang, Yao Xiao, Ruiwen Wang, Fengkai Li, Luwen Pu, Kaipeng Jia, Fubei Yao, Yuyao Huang, Xuewei He, Zhuoru Jiang, Ruiting Song, Rui Xue, Qiyi Xie, Jie Zhang, Zilu Huang, Zhaoxi Zhang, Zhilong Lu, Yanhan Zhang, Yin Zhang, Yanlei Xue, Zhu Yuan, Teng Su, Xin Jiang, Shuangyong Song, Yongxiang Li, Xuelong Li

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 TeleChat3-MoE通过混合专家架构和优化的并行化框架,实现了大规模语言模型的高效训练与扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏