arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-24 至 2025-12-24 共收录 20 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 20 篇

2507.11181 2025-12-24 cs.LG cs.AI 90%

Mixture of Experts in Large Language Models

大语言模型中的专家混合架构

Danyang Zhang, Junhao Song, Ziqian Bi, Xinyuan Song, Yingfang Yuan, Tianyang Wang, Joe Yeong, Junfeng Hao

机构 * Department of Research(研究部) ByteDance Inc(字节跳动公司) Department of CS(计算机科学系) Imperial College London(伦敦帝国理工学院) Purdue University(普渡大学) Emory University(埃默里大学) Department of Computer Science(计算机科学系) Heriot-Watt University(赫罗特-瓦特大学) AI Agent Lab(AI代理实验室) Vokram Group(Vokram集团) Department of Anatomical Pathology(解剖病理学系) Singapore General Hospital(新加坡中央医院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了大语言模型中专家混合架构的性能提升与应用挑战,分析了其核心机制与优化方法,探讨了MoE在任务特定性能和模型扩展方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20612 2025-12-24 cs.IR cs.CL 89%

Making Large Language Models Efficient Dense Retrievers

使大语言模型成为高效密集检索器

Yibin Lei, Shwai He, Ang Li, Andrew Yates

机构 * University of Amsterdam(阿姆斯特丹大学) University of Maryland, College Park(马里兰大学 College Park 分校) Johns Hopkins University, HLTCOE(约翰霍普金斯大学 HLTCOE)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 EffiR通过粗到细的MLP压缩策略和检索特定微调,使大语言模型在保持性能的同时显著减少模型大小和推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11671 2025-12-24 cs.AI cs.CY cs.LG econ.GN q-fin.EC 86%

Computational Basis of LLM's Decision Making in Social Simulation

大语言模型在社会模拟中的决策机制计算基础

Ji Ma

机构 * LBJ School of Public Affairs, University of Texas at Austin(德克萨斯大学奥斯汀分校公共事务学院LBJ学院) Gradel Institute of Charity, New College, University of Oxford(牛津大学格拉德尔慈善研究所)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过独裁者游戏探索LLM内部表示的变量变化,揭示社会概念在Transformer模型中的编码机制,为社会模拟和AI对齐提供新方法。

Comments Forthcoming: Sociological Methodology; USPTO patent pending

Journal ref Sociological Methodology, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19682 2025-12-24 cs.CL 85%

GenEnv: Difficulty-Aligned Co-Evolution Between LLM Agents and Environment Simulators

GenEnv:LLM代理与环境模拟器之间的难度对齐共进化

Jiacheng Guo, Ling Yang, Peter Chen, Qixin Xiao, Yinjie Wang, Xinzhe Juan, Jiahao Qiu, Ke Shen, Mengdi Wang

机构 * Princeton University(普林斯顿大学) Columbia University(哥伦比亚大学) University of Michigan(密歇根大学) University of Chicago(芝加哥大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 GenEnv通过动态生成任务与代理能力对齐的共进化机制,在减少数据使用量的同时显著提升代理性能。

Comments Our codes are available at https://github.com/Gen-Verse/GenEnv

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23649 2025-12-24 cs.LG cs.AI 85%

Efficient Low Rank Attention for Long-Context Inference in Large Language Models

高效低秩注意力用于大语言模型长上下文推断

Tenghui Li, Guoxu Zhou, Xuyang Zhao, Yuning Qiu, Qibin Zhao

机构 * Guangdong University of Technology(广东工业大学) RIKEN AIP(理化学研究所AIP) Key Laboratory of Intelligent Detection and the Internet of Things in Manufacturing, Ministry of Education, Guangzhou, CHINA(教育部智能制造智能化检测与物联网重点实验室) RIKEN iTHEMS(理化学研究所iTHEMS) RIKEN IMS(理化学研究所IMS) Chiba University(千叶大学)

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.AI、cs.LG

AI总结 LRQK通过低秩分解和混合缓存机制,实现大语言模型长上下文推断中的高效低秩注意力,减少内存使用并保持高精度。

Comments https://neurips.cc/virtual/2025/loc/san-diego/poster/118451

Journal ref 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20550 2025-12-24 cs.GR 85%

LLM-Based Authoring of Agent-Based Narratives through Scene Descriptions

基于大语言模型的通过场景描述生成基于代理的叙事

Vinayak Regmi, Christos Mousas

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种基于大语言模型生成基于代理的叙事的系统,通过场景描述自动生成代理行为并支持动态交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05594 2025-12-24 cs.CR cs.CL 77%

SoK: Are Watermarks in LLMs Ready for Deployment?

SoK: LLMs中的水印是否已准备好部署?

Kieu Dang, Phung Lai, NhatHai Phan, Yelong Shen, Ruoming Jin, Abdallah Khreishah, My T. Thai

机构 * SUNY-Albany(SUNY-阿尔巴尼) New Jersey Institute of Technology(新泽西理工学院) Microsoft(微软) Kent State University(肯特州立大学) University of Florida(佛罗里达大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文系统分析了LLMs中水印技术的现状,揭示了其在安全性和实用性上的挑战,并提出改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20210 2025-12-24 cs.DC 75%

Predictive-LoRA: A Proactive and Fragmentation-Aware Serverless Inference System for LLMs

Predictive-LoRA: 一种面向大语言模型的前瞻性且内存感知的无服务器推理系统

Yinan Ni, Xiao Yang, Yuqi Tang, Zhimin Qiu, Chen Wang, Tingzhou Yuan

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 Predictive-LoRA通过前瞻性适配器预取和内存管理机制,显著降低LLM推理的冷启动延迟和内存碎片化问题,提升吞吐量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20276 2025-12-24 cs.AI cs.RO 74%

ActionFlow: A Pipelined Action Acceleration for Vision Language Models on Edge

ActionFlow:面向边缘设备的视觉语言模型流水线动作加速

Yuntao Dai, Hang Gu, Teng Wang, Qianyu Cheng, Yifei Zheng, Zhiyong Qiu, Lei Gong, Wenqi Lou, Xuehai Zhou

机构 * School of Computer Science and Technology, University of Science and Technology of China(计算机科学与技术学院,中国科学技术大学) Suzhou Institute for Advanced Research, University of Science and Technology of China(苏州市先进研究院,中国科学技术大学) IEIT SYSTEMS Co., Ltd.(IEIT SYSTEMS公司)

专题命中 效率与部署 :language model(title);分类 cs.AI

AI总结 ActionFlow通过跨请求流水线策略提升边缘设备上VLA模型的推理速度,实现2.55倍的FPS提升,无需重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19879 2025-12-24 cs.LG cs.AI 73%

Fine-Tuned In-Context Learners for Efficient Adaptation

针对特定下游任务的微调上下文学习者

Jorg Bornschein, Clare Lyle, Yazhe Li, Amal Rannen-Triki, Xu Owen He, Razvan Pascanu

机构 * Google DeepMind(谷歌DeepMind) Microsoft AI(微软AI)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种结合上下文学习与微调的方法,通过在任务数据中加入上下文示例,提升模型在低数据环境下的适应性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09343 2025-12-24 cs.DC cs.AI cs.AR 70%

Insights into DeepSeek-V3: Scaling Challenges and Reflections on Hardware for AI Architectures

深入探讨DeepSeek-V3:扩展挑战与人工智能架构的硬件反思

Chenggang Zhao, Chengqi Deng, Chong Ruan, Damai Dai, Huazuo Gao, Jiashi Li, Liyue Zhang, Panpan Huang, Shangyan Zhou, Shirong Ma, Wenfeng Liang, Ying He, Yuqing Wang, Yuxuan Liu, Y. X. Wei

机构 * DeepSeek-AI(深Seek人工智能)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DeepSeek-V3通过硬件感知的模型协同设计,解决了大规模LLM扩展中的硬件限制,展示了内存效率、计算优化和网络拓扑改进的创新方法。

Comments This is the author's version of the work. It is posted here for your personal use. Not for redistribution. The definitive version appeared as part of the Industry Track in Proceedings of the 52nd Annual International Symposium on Computer Architecture (ISCA '25)

Journal ref Proceedings of the 52nd Annual International Symposium on Computer Architecture (ISCA '25), June 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20176 2025-12-24 cs.CR 67%

Optimistic TEE-Rollups: A Hybrid Architecture for Scalable and Verifiable Generative AI Inference on Blockchain

乐观TEE-rollups:一种混合架构,用于在区块链上可扩展且可验证的生成AI推理

Aaron Chan, Alex Ding, Frank Chen, Alan Wu, Bruce Zhang, Arther Tian

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出OTR,一种混合验证协议,通过结合可信执行环境和乐观欺诈证明,实现区块链上高吞吐量、低延迟且可验证的生成AI推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17601 2025-12-24 cs.CV 67%

HeadHunt-VAD: Hunting Robust Anomaly-Sensitive Heads in MLLM for Tuning-Free Video Anomaly Detection

HeadHunt-VAD: 在MLLM中寻找鲁棒的异常敏感头部以实现无调优视频异常检测

Zhaolin Cai, Fan Li, Ziwei Zheng, Haixia Bi, Lijun He

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 HeadHunt-VAD通过直接在冻结的MLLM中寻找鲁棒的异常敏感头部,实现高效的无调优视频异常检测。

Comments AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03289 2025-12-24 cs.LG cs.AI cs.CL 67%

Why mask diffusion does not work

为何掩码扩散无法工作

Haocheng Sun, Cynthia Xin Wen, Edward Hong Wang

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了掩码扩散模型在实现并行生成和双向注意力方面的固有困难,并提出了有效的训练和推理策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20569 2025-12-24 cs.CL cs.AI 62%

Distilling to Hybrid Attention Models via KL-Guided Layer Selection

通过KL引导的层选择 distilling 到混合注意力模型

Yanhong Li, Songlin Yang, Shawn Tan, Mayank Mishra, Rameswar Panda, Jiawei Zhou, Yoon Kim

机构 * Allen Institute for AI(艾伦人工智能研究所) MIT(麻省理工学院) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) Stony Brook University(石溪大学)

专题命中 效率与部署 :pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过KL引导的层选择方法,将预训练的softmax注意力Transformer distilling 到混合架构中,以提高LLM推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19729 2025-12-24 cs.LG cs.AI 62%

High-Performance Self-Supervised Learning by Joint Training of Flow Matching

通过联合训练流匹配实现高性能自监督学习

Kosuke Ukita, Tsuyoshi Okita

机构 * Kyushu Institute of Technology(九州工业技术大学)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 通过联合训练流匹配生成器和编码器,FlowFM在提升自监督学习效率和生成质量方面取得显著进展。

Comments 10 pages, 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06865 2025-12-24 cs.LG cs.AI 62%

FP=xINT:Representing Neural Networks via Low-Bit Series Basis Functions

FP=xINT:通过低比特级数基函数表示神经网络

Boyang Zhang, Daning Cheng, Yunquan Zhang, Jiake Tian, Jing Li, Fangming Liu

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Pengcheng Laboratory(鹏城实验室) University of Chinese Academy of Sciences(中国科学院大学) Harbin Institute of Technology(哈尔滨工业大学) South China University of Technology(华南理工大学)

专题命中 效率与部署 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过低比特级数基函数表示神经网络的方法,实现无需校准集的高精度量化,实验表明在4比特设置下ResNet-50的精度达到77.03%。

Comments AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19720 2025-12-24 cs.LG 61%

Per-Axis Weight Deltas for Frequent Model Updates

针对频繁模型更新的每轴权重delta

Stefan Kuyumdzhiev, Radostin Cholakov

机构 * High School "Vasil Drumev" Veliko Tarnovo(维多利亚·德鲁梅夫高中) Stanford University(斯坦福大学)

专题命中 效率与部署 :LLM(abstract);分类 cs.LG;foundation model(comments)

AI总结 提出一种1位delta方案,通过每轴FP16缩放因子压缩权重差异,提升重建质量并减少冷启动延迟和存储开销。

Comments 10 pages, 2 figures, AI That Keeps Up: Workshop on Continual and Compatible Foundation Model Updates (CCFM), Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20188 2025-12-24 cs.RO cs.AI 57%

Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation

异步快速-慢速视觉-语言-动作策略用于全身机器人操作

Teqiang Zou, Hongliang Zeng, Yuxuan Nong, Yifan Li, Kehui Liu, Haotian Yang, Xinyang Ling, Xin Li, Lianyang Ma

机构 * AstriBot Team(AstriBot团队)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 DuoCore-FS通过异步快速-慢速框架提升全身机器人操作的实时性能与任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20561 2025-12-24 cs.CV 50%

FlashVLM: Text-Guided Visual Token Selection for Large Multimodal Models

FlashVLM: 大规模多模态模型中的文本引导视觉令牌选择

Kaitong Cai, Jusheng Zhang, Jing Yang, Yijia Fan, Pengtao Xie, Jian Wang, Keze Wang

机构 * Sun Yat-sen University(中山大学) University of California, San Diego(加州大学圣地亚哥分校) Snap Inc.(Snap公司)

专题命中 效率与部署 :language model(abstract)

AI总结 FlashVLM通过文本引导的视觉令牌选择,实现了高效压缩和高准确率,在大规模多模态模型中表现出色。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏