arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-02 至 2025-12-02 共收录 313 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 48 篇

2512.00719 2025-12-02 cs.DC 82%

SIMPLE: Disaggregating Sampling from GPU Inference into a Decision Plane for Faster Distributed LLM Serving

SIMPLE: 将采样从GPU推理中分解到决策平面以实现更快的分布式LLM服务

Bohan Zhao, Zane Cao, Yongchao He

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)

AI总结 SIMPLE通过将采样分解到CPU侧,结合序列并行和热点词汇采样,显著提升分布式LLM服务的吞吐量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01181 2025-12-02 cs.LG cs.AI cs.CV 81%

First On-Orbit Demonstration of a Geospatial Foundation Model

地球观测基础模型的首次在轨演示

Andrew Du, Roberto Del Prete, Alejandro Mousist, Nick Manser, Fabrice Marre, Andrew Barton, Carl Seubert, Gabriele Meoni, Tat-Jun Chin

机构 * SmartSat CRC Thales Alenia Space(泰雷兹阿莱尼亚空间)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种紧凑的地球观测基础模型,通过模型压缩和领域适应,在国际空间站实现了可靠的在轨推理,展示了在资源受限环境下高效执行地球观测任务的可能性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05179 2025-12-02 cs.LG cs.AI cs.NI 81%

Evaluating Spatio-Temporal Forecasting Trade-offs Between Graph Neural Networks and Foundation Models

评估图神经网络与基础模型在时空预测中的权衡

Ragini Gupta, Naman Raina, Bo Chen, Li Chen, Claudiu Danilov, Josh Eckhardt, Keyshla Bernard, Klara Nahrstedt

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Louisiana at Lafayette(路易斯安那州立大学拉斐特分校) Boeing Research and Technology(波音研究与技术)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了不同模型在时空预测中的表现,发现STGNNs在稀疏部署中有效,而TSFMs在高频下表现良好,但空间覆盖减少时退化,Moirai模型表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06349 2025-12-02 cs.LG cs.AI cs.MA 81%

Flexible Swarm Learning May Outpace Foundation Models in Essential Tasks

灵活的群体学习可能在关键任务上超越基础模型

Moein E. Samadi, Andreas Schuppert

机构 * Institute for Computational Biomedicine, RWTH Aachen University(计算生物医学研究所,亚琛工业大学) Center for Computational Life Sciences, RWTH Aachen University(计算生命科学中心,亚琛工业大学)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种去中心化的群体学习架构,通过多个小代理网络实现自我适应,以在动态环境中超越传统基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01649 2025-12-02 eess.AS cs.LG cs.SD 79%

Safeguarding Privacy in Edge Speech Understanding with Tiny Foundation Models

在边缘语音理解中利用小型基础模型保护隐私

Afsara Benazir, Felix Xiaozhu Lin

机构 * Department of Computer Science(计算机科学系) University of Virginia(弗吉尼亚大学)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 SpeechShield通过在边缘设备上利用小型基础模型实现语音隐私保护,有效过滤敏感信息并提升转录性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00207 2025-12-02 cs.LG cs.AI 79%

Constructing Efficient Fact-Storing MLPs for Transformers

构建高效的事实存储MLP用于Transformer

Owen Dugan, Roberto Garcia, Ronny Junkins, Jerry Liu, Dylan Zinsley, Sabri Eyuboglu, Atri Rudra, Chris Ré

机构 * Computer Science Department, Stanford University(斯坦福大学计算机科学系) Institute for Computational & Mathematical Engineering, Stanford University(斯坦福大学计算与数学工程研究所) Computer Science Department, University of Wisconsin–Madison(威斯康星大学麦迪逊分校计算机科学系) Computer Science and Engineering Department, University at Buffalo(布法罗大学计算机科学与工程系)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种改进的MLP构造框架,提升了事实存储效率和实用性,并揭示了MLP事实存储能力与Transformer实用性之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14450 2025-12-02 cs.DC 78%

Hyperion: Hierarchical Scheduling for Parallel LLM Acceleration in Multi-tier Networks

Hyperion:多级网络中并行大语言模型加速的分层调度

Mulei Ma, Xinyi Xu, Minrui Xu, Zihan Chen, Yang Yang, Tony Q. S. Quek

专题命中 效率与部署 :LLM(title,abstract)

AI总结 Hyperion通过分层调度优化多级网络中大语言模型的并行加速,显著降低延迟并提升GPU利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00948 2025-12-02 cs.HC 78%

Graph Queries from Natural Language using Constrained Language Models and Visual Editing

通过约束语言模型和视觉编辑进行自然语言图形查询

Benedikt Kantz, Kevin Innerebner, Peter Waldert, Stefan Lengauer, Elisabeth Lex, Tobias Schreck

专题命中 效率与部署 :language model(title,abstract)

AI总结 本文提出了一种通过自然语言和视觉编辑生成知识图谱查询的方法,利用约束语言模型生成原型图,并在本体约束下生成有效SPARQL查询。

Comments 8 pages, 3 figures, 3 tables, accepted and presented at ICKG 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01980 2025-12-02 cs.LG 77%

Low-Rank Prehab: Preparing Neural Networks for SVD Compression

低秩预准备:为SVD压缩准备神经网络

Haoran Qin, Shansita Sharma, Ali Abbasi, Chayne Thrash, Soheil Kolouri

机构 * Department of Computer Science, Vanderbilt University(计算机科学系,范德比尔特大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 低秩预准备通过在SVD压缩前优化权重结构,提升压缩后模型性能和恢复效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01953 2025-12-02 cs.LG 77%

KV Pareto: Systems-Level Optimization of KV Cache and Model Compression for Long Context Inference

KV Pareto: 系统层面优化KV缓存与模型压缩以实现长上下文推理

Sai Gokhale, Devleena Das, Rajeev Patwari, Ashish Sirasao, Elliott Delaye

机构 * Georgia Institute of Technology(佐治亚理工学院) Advanced Micro Devices (AMD)(先进微器件(AMD))

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 KV Pareto通过系统层面优化KV缓存与模型压缩,实现长上下文推理中的内存效率与准确率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01939 2025-12-02 cs.SE cs.AI 77%

An Empirical Study of Agent Developer Practices in AI Agent Frameworks

关于AI代理框架中代理开发者实践的实证研究

Yanlin Wang, Xinyi Xu, Jiachi Chen, Tingting Bi, Wenchao Gu, Zibin Zheng

机构 * Sun Yat-sen University(中山大学) Zhejiang University(浙江大学) The University of Melbourne(墨尔本大学) Technical University of Munich(慕尼黑技术大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过实证研究分析了基于LLM的代理框架在开发效率、功能抽象、学习成本、性能优化和可维护性方面的差异,揭示了开发者在选择和使用框架时的挑战与需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21669 2025-12-02 cs.LG cs.DC 77%

DSD: A Distributed Speculative Decoding Solution for Edge-Cloud Agile Large Model Serving

DSD:一种用于边缘-云敏捷大模型服务的分布式推测解码方案

Fengze Yu, Leshu Li, Brad McDanel, Sai Qian Zhang

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 DSD提出了一种分布式推测解码框架,通过自适应窗口控制策略提升边缘-云环境下大模型服务的性能和扩展性。

Comments Correct to author's name from 'Saiqian Zhang' to 'Sai Qian Zhang'

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20285 2025-12-02 cs.AI 77%

Schema Matching on Graph: Iterative Graph Exploration for Efficient and Explainable Data Integration

图谱匹配:用于高效且可解释的数据整合的迭代图探索

Mingyu Jeon, Jaeyoung Suh, Suwan Cho

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SMoG通过迭代执行简单1跳SPARQL查询,实现高效且可解释的图谱匹配,适用于医疗数据整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00010 2025-12-02 cs.HC cs.AI 77%

Leveraging LLMs for Design Ideation: An AI Tool to Assist Creativity

利用LLMs进行设计构思:一种辅助创造力的AI工具

Rutvik Kokate, Pranati Kompella, Prasad Onkar

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种名为ALIA的AI工具,利用LLMs通过语音交互提升设计构思阶段的创造性潜力。

Comments 9 pages, 4 figures

Journal ref Responsible and Resilient Design for Society, Volume 4. ICoRD 2025, pp 579 to 589

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11679 2025-12-02 cs.CR cs.AI 77%

LLMs on support of privacy and security of mobile apps: state of the art and research directions

大型语言模型在支持移动应用隐私和安全中的作用:现状与研究方向

Tran Thanh Lam Nguyen, Barbara Carminati, Elena Ferrari

机构 * Department of Theoretical and Applied Science (DISTA)(理论与应用科学系) University of Insubria(因斯布里亚大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了大型语言模型在移动应用安全和隐私保护中的应用,分析了其在缓解常见安全风险中的潜力及面临的挑战。

Comments I am writing to respectfully request the withdrawal of my recent submission to arXiv due to an authorship issue. The paper was submitted without the explicit consent of two co-authors. After internal discussion, they have expressed clear disagreement with the submission and raised concerns about unresolved academic inaccuracies in the current version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01546 2025-12-02 stat.ML cs.AI cs.CL cs.LG 75%

LPCD: Unified Framework from Layer-Wise to Submodule Quantization

LPCD:从层到子模块的统一框架

Yuma Ichikawa, Yudai Fujimoto, Akira Sakai

机构 * Fujitsu Limited(富士通株式会社) RIKEN Center for AIP(理化学研究所AIP研究中心) Institute of Science Tokyo(东京科学研究所) Tokai University(东海大学)

专题命中 效率与部署 :LLM(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LPCD提出了一种统一的后训练量化框架,通过优化子模块和投影层量化器,提升复杂子模块的量化效率和兼容性。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01147 2025-12-02 cs.LG 74%

Projection-Free CNN Pruning via Frank-Wolfe with Momentum: Sparser Models with Less Pretraining

基于动量的Frank-Wolfe方法的CNN剪枝:更稀疏的模型需更少预训练

Hamza ElMokhtar Shili, Natasha Patnaik, Isabelle Ruble, Kathryn Jarjoura, Daniel Suarez Aguirre

机构 * Rice University, Computer Science Department(Rice大学计算机科学系) Rice University, Computational Applied Math & Operations Research Department(Rice大学计算应用数学与运筹学系)

专题命中 效率与部署 :pretraining(title);分类 cs.LG

AI总结 本文提出基于动量的Frank-Wolfe方法用于CNN剪枝,发现该方法能生成更稀疏且更准确的模型,且预训练需求较低。

Comments Preliminary preprint; numerical experiments are still being validated and may be updated in future revisions

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01252 2025-12-02 cs.LG cs.CV 70%

Efficient Training of Diffusion Mixture-of-Experts Models: A Practical Recipe

扩散混合专家模型的高效训练:一种实用配方

Yahui Liu, Yang Yue, Jingyuan Zhang, Chenxi Sun, Yang Zhou, Wencong Zeng, Ruiming Tang, Guorui Zhou

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种高效训练扩散混合专家模型的方法,通过优化架构配置提升模型性能,提供实用且高效的训练方案。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00722 2025-12-02 cs.AI 70%

SpeContext: Enabling Efficient Long-context Reasoning with Speculative Context Sparsity in LLMs

SpeContext: 通过推测上下文稀疏性在LLMs中实现高效的长上下文推理

Jiaming Xu, Jiayi Pan, Hanzhen Wang, Yongkang Zhou, Jiancai Ye, Yu Wang, Guohao Dai

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 效率与部署 :LLM(abstract);language model(abstract);分类 cs.AI

AI总结 SpeContext通过推测上下文稀疏性,在LLMs中实现高效的长上下文推理,显著提升云和边缘环境的吞吐量和速度,同时保持精度。

Comments Accepted by ASPLOS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00630 2025-12-02 cs.LG q-fin.CP 70%

Financial Text Classification Based On rLoRA Finetuning On Qwen3-8B model

基于Qwen3-8B模型的金融文本分类研究:rLoRA微调

Zhiming Lian

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出基于rLoRA微调的Qwen3-8B模型,用于金融文本分类,展示了其在准确率和训练效率上的优势。

Comments This paper has been accepted to the 2025 2nd International Conference on Digital Economy and Computer Science (DECS 2025) and is awaiting publication in the ACM International Conference Proceeding Series

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00395 2025-12-02 cs.CV 67%

Better, Stronger, Faster: Tackling the Trilemma in MLLM-based Segmentation with Simultaneous Textual Mask Prediction

更优、更强、更快:在基于多模态大语言模型的分割中解决三重困境

Jiazhen Liu, Mingkuan Feng, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 STAMP通过同时预测文本和分割掩码,解决了多模态大语言模型在保持对话能力、高分割性能和快速推理间的三重困境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00326 2025-12-02 cs.HC 67%

Behavioral Indicators of Loneliness: Predicting University Students' Loneliness Scores from Smartphone Sensing Data

孤独的行为指标:从智能手机感知数据预测大学生孤独量表分数

Qianjie Wu, Tianyi Zhang, Hong Jia, Simon D'Alfonso

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本研究利用智能手机感知数据与机器学习模型,通过分析屏幕使用、位置移动等行为指标,预测大学生孤独量表分数,提升数字心理健康中的孤独检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01278 2025-12-02 cs.LG cs.AI 62%

Accelerating Large-Scale Reasoning Model Inference with Sparse Self-Speculative Decoding

通过稀疏自推测解码加速大规模推理模型推理

Yilong Zhao, Jiaming Tang, Kan Zhu, Zihao Ye, Chi-Chih Chang, Chaofan Lin, Jongseok Park, Guangxuan Xiao, Mohamed S. Abdelfattah, Mingyu Gao, Baris Kasikci, Song Han, Ion Stoica

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 SparseSpec通过自推测解码框架和稀疏注意力机制,显著提升了大规模推理模型的推理效率和内存利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.10805 2025-12-02 cs.AI cs.LG 62%

EPLKG: Efficient Prompt Learning with Knowledge Graph

EPLKG:基于知识图谱的高效提示学习

YongTaek Lim, Suho Kang, Yewon Kim, Dokyung Yoon, KyungWoo Song

机构 * DATUMO, Seoul, South Korea(DATUMO, 首尔, 韩国) Department of Statistics and Data Science, Yonsei University(统计与数据科学系,延世大学) Department of Artificial Intelligence, University of Seoul(人工智能系,首尔大学)

专题命中 效率与部署 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 EPLKG通过结合知识图谱与LLM生成的视觉描述,实现高效提示学习,提升模型适应效率的同时保持性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02974 2025-12-02 cs.LG cs.CL cs.CR 62%

InvisibleInk: High-Utility and Low-Cost Text Generation with Differential Privacy

InvisibleInk: 基于差分隐私的高效低成本文本生成

Vishnu Vinod, Krishna Pillutla, Abhradeep Guha Thakurta

机构 * CeRAI, IIT Madras(CeRAI,IIT马德拉斯) WSAI, IIT Madras(WSAI,IIT马德拉斯) Google DeepMind(谷歌DeepMind)

专题命中 效率与部署 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 InvisibleInk通过差分隐私保证,在降低计算成本的同时生成高质量隐私保护的长文本。

Comments Published at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12899 2025-12-02 cs.SE cs.CL cs.LG 62%

A Semantic-based Optimization Approach for Repairing LLMs: Case Study on Code Generation

基于语义的优化方法用于修复大语言模型:代码生成的案例研究

Jian Gu, Aldeida Aleti, Chunyang Chen, Hongyu Zhang

机构 * Monash University(墨尔本大学) Technical University of Munich(慕尼黑技术大学) Chongqing University(重庆大学)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出STAR方法,通过基于语义的优化修复大语言模型,提升代码生成的准确性和效率。

Comments 13 pages, 6 figure, 8 tables, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01439 2025-12-02 cs.CL 57%

Multilingual Conversational AI for Financial Assistance: Bridging Language Barriers in Indian FinTech

多语言对话AI用于金融服务:弥合印度金融科技中的语言障碍

Bharatdeep Hazarika, Arya Suneesh, Prasanna Devadiga, Pawan Kumar Rajpoot, Anshuman B Suresh, Ahmed Ifthaquar Hussain

机构 * TIFIN India(TIFIN印度)

专题命中 效率与部署 :language model(abstract);分类 cs.CL

AI总结 本研究提出了一种多语言对话AI系统,用于支持印度多样化的语言环境,提升金融服务的可及性与用户参与度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00614 2025-12-02 cs.MA cs.AI 57%

Hierarchical Decentralized Multi-Agent Coordination with Privacy-Preserving Knowledge Sharing: Extending AgentNet for Scalable Autonomous Systems

分层去中心化多智能体协调与隐私保护知识共享:扩展AgentNet以实现可扩展的自主系统

Goutham Nalagatla

专题命中 效率与部署 :LLM(abstract);分类 cs.AI

AI总结 AgentNet++通过分层去中心化框架和隐私保护技术,提升多智能体系统的可扩展性和隐私保障,实现更高的任务完成率和更低的通信开销。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21829 2025-12-02 cs.LG 57%

In Search of Adam's Secret Sauce

寻找亚当的神秘配方

Antonio Orvieto, Robert M. Gower

机构 * ELLIS Institute Tübingen(图宾根埃利斯研究所) MPI-IS Tübingen(图宾根马克斯·普朗克研究所) AI Center, Germany(德国人工智能中心) CCM, Flatiron Institute, Simons Foundation(CCM,Flatiron研究所,Simons基金会) New York, US(美国纽约)

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 本研究发现,将亚当的动量参数设为相等可保持性能,同时提供新的理论见解和统计解释。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01960 2025-12-02 cs.CV cs.HC 50%

SpriteHand: Real-Time Versatile Hand-Object Interaction with Autoregressive Video Generation

SpriteHand: 实时多样的手-物体交互与自回归视频生成

Zisu Li, Hengye Lyu, Jiaxin Shi, Yufeng Zeng, Mingming Fan, Hanwang Zhang, Chen Liang

机构 * HKUST (Guangzhou)(香港科技大学(广州)) XMax.AI Ltd.(XMax人工智能有限公司) Nanyang Technological University(南洋理工大学)

专题命中 效率与部署 :post-training(abstract)

AI总结 SpriteHand通过自回归视频生成框架实现实时高质量手-物体交互视频合成,支持多种物体和运动模式,具有高视觉真实性和物理合理性。

详情

展开后加载摘要…

URL PDF HTML 收藏