arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-21 至 2025-11-21 共收录 2 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 2 篇

2503.16356 2025-11-21 cs.CL cs.AI cs.CV cs.IR cs.LG 75%

CaKE: Circuit-aware Editing Enables Generalizable Knowledge Learners

CaKE:电路感知编辑实现通用知识学习

Yunzhi Yao, Jizhan Fang, Jia-Chen Gu, Ningyu Zhang, Shumin Deng, Huajun Chen, Nanyun Peng

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) University of California, Los Angeles(美国加州大学洛杉矶分校)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CaKE通过电路感知编辑提升LLMs对更新知识的多跳推理能力,实现20%的准确率提升并降低内存消耗

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07067 2025-11-21 cs.LG cs.DC 70%

MoE-CAP: Benchmarking Cost, Accuracy and Performance of Sparse Mixture-of-Experts Systems

MoE-CAP:稀疏专家混合系统成本、准确率和性能的基准测试

Yinsicheng Jiang, Yao Fu, Yeqi Huang, Ping Nie, Zhan Lu, Leyang Xue, Congjie He, Man-Kit Sit, Jilong Xue, Li Dong, Ziming Miao, Dayou Du, Tairan Xu, Kai Zou, Edoardo Ponti, Luo Mai

机构 * University of Edinburgh(爱丁堡大学) Microsoft Research(微软研究院) Peking University(北京大学) NVIDIA Co-leading authors(NVIDIA)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 MoE-CAP通过引入CAP雷达图和稀疏性能指标,系统性地评估稀疏混合专家系统在成本、准确率和性能之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏