arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-31 至 2026-03-31 共收录 404 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 62 篇

2603.01499 2026-03-31 cs.CR cs.AI 85%

Towards Privacy-Preserving LLM Inference via Covariant Obfuscation (Technical Report)

通过协变混淆实现隐私保护的大语言模型推断(技术报告)

Yu Lin, Qizhi Zhang, Wenqiang Ruan, Daode Zhang, Jue Hong, Ye Wu, Hanning Xia, Yunlong Mao, Sheng Zhong

机构 * ByteDance(字节跳动) Nanjing University(南京大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AloePri,首个适用于工业应用的隐私保护大语言模型推断方法,通过协变混淆同时保护输入输出数据,实现高准确性和隐私性,兼容现有基础设施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27138 2026-03-31 cs.LG 85%

ScoutAttention: Efficient KV Cache Offloading via Layer-Ahead CPU Pre-computation for LLM Inference

ScoutAttention:通过层前CPU预计算实现高效的KV缓存卸载以用于LLM推理

Qiuyang Zhang, Kai Zhou, Ding Tang, Kai Lu, Cheng Li, Zhenyu Yang, Peng Xu, Jiguang Wan

机构 * Huazhong University of Science and Technology(华中科技大学) Huawei Technologies(华为技术有限公司)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出ScoutAttention框架,通过GPU-CPU协作计算加速LLM推理,采用层前CPU预计算和异步召回机制,减少CPU负载,实验表明在保持2.4%准确率的同时,比现有方法快2.1倍。

Comments Accepted at the 63rd Design Automation Conference (DAC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14903 2026-03-31 cs.CL 85%

ExPosST: Explicit Positioning with Adaptive Masking for LLM-Based Simultaneous Machine Translation

ExPosST:基于自适应掩码的LLM同时机器翻译显式定位

Yuzhe Shang, Pengzhi Gao, Yazheng Yang, Jiayao Ma, Wei Liu, Jian Luan, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus团队) The University of Hong Kong(香港大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 ExPosST通过显式位置分配解决LLM在同时机器翻译中的位置不匹配问题,实现高效解码与位置一致性,支持多种策略下的同时翻译。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26797 2026-03-31 cs.LG 85%

MemGuard-Alpha: Detecting and Filtering Memorization-Contaminated Signals in LLM-Based Financial Forecasting via Membership Inference and Cross-Model Disagreement

MemGuard-Alpha:通过成员推断和跨模型分歧检测和过滤受记忆污染的信号在基于LLM的金融预测中

Anisha Roy, Dip Roy

机构 * Jaypee Institute of Information Technology(贾伊皮信息技术学院) Indian Institute of Technology Patna(印度理工学院巴特那分校)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 MemGuard-Alpha通过成员推断和跨模型分歧方法,检测并过滤LLM生成的受记忆污染的信号,提升金融预测的准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28018 2026-03-31 eess.SP 85%

Low-Latency Edge LLM Handover via Joint KV Cache Transfer and Token Prefill

通过联合KV缓存传输和令牌预填充实现低延迟边缘LLM切换

Seunghun Lee, Jihong Park, Ce Zheng, Hyuncheol Park

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种联合选择预填充长度和调度回传KV缓存传输的统一切换设计,以最小化多用户设备的LLM切换延迟,通过仿真验证其在不同回传容量、预填充速度和上下文大小下的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10079 2026-03-31 cs.LG cs.AI cs.CL 85%

Sparse-RL: Breaking the Memory Wall in LLM Reinforcement Learning via Stable Sparse Rollouts

稀疏强化学习:通过稳定稀疏回放突破大语言模型强化学习的内存瓶颈

Sijia Luo, Xiaokang Zhang, Yuxuan Hu, Bohan Zhang, Ke Wang, Jinbo Su, Mengshu Sun, Lei Liang, Jing Zhang

机构 * School of Information, Renmin University of China(中国人民大学信息学院) Key Laboratory of Data Engineering and Knowledge Engineering(数据工程与知识工程重点实验室) Ant Group(蚂蚁集团)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出稀疏强化学习方法,通过稳定稀疏回放解决大语言模型强化学习中的内存瓶颈问题,采用稀疏采样和重要性重加权技术减少计算开销并提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26716 2026-03-31 eess.SP cs.LG 83%

FEMBA on the Edge: Physiologically-Aware Pre-Training, Quantization, and Deployment of a Bidirectional Mamba EEG Foundation Model on an Ultra-low Power Microcontroller

FEMBA在边缘:一种生理感知的预训练、量化和在超低功耗微控制器上部署双向Mamba EEG基础模型

Anna Tegon, Nicholas Lehmann, Yawei Li, Andrea Cossettini, Luca Benini, Thorir Mar Ingolfsson

机构 * Integrated Systems Laboratory, ETH Zürich(苏黎世联邦理工学院集成系统实验室) DEI, University of Bologna(博洛尼亚大学电气、电子与信息工程系)

专题命中 效率与部署 :foundation model(title,abstract);post-training(abstract);分类 cs.LG

AI总结 本文提出FEMBA,通过生理感知预训练、量化和部署,实现基于Mamba的EEG基础模型在超低功耗微控制器上的高效应用,提升长期神经监测性能。

Comments 10 pages, 9 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28119 2026-03-31 cs.SE 82%

Compressing Code Context for LLM-based Issue Resolution

基于LLM的问题解决的代码上下文压缩

Haoxiang Jia, Earl T. Barr, Sergey Mechtaev

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出OCD算法和SWEzze模型,通过遗传搜索和delta调试压缩代码上下文,提升问题解决效率,实现6倍压缩率,减少51.8%-71.3%的token预算,提高5.0%-9.2%的问题解决率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13191 2026-03-31 cs.CV cs.AI cs.CL 81%

CoPE-VideoLM: Leveraging Codec Primitives For Efficient Video Language Modeling

CoPE-VideoLM:利用编解码器原语实现高效的视频语言建模

Sayan Deb Sarkar, Rémi Pautrat, Ondrej Miksik, Marc Pollefeys, Iro Armeni, Mahdi Rad, Mihai Dusmanu

机构 * Microsoft Spatial AI Lab(微软空间人工智能实验室) Stanford University(斯坦福大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CoPE-VideoLM,通过利用视频编解码器原语(如运动矢量和残差)减少计算开销,提升视频语言模型的效率和性能。

Comments Project Page: https://microsoft.github.io/CoPE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26675 2026-03-31 cs.CL cs.LG 81%

GeoBlock: Inferring Block Granularity from Dependency Geometry in Diffusion Language Models

GeoBlock:从扩散语言模型中的依赖几何推断块粒度

Lipeng Wan, Junjie Ma, Jianhui Gu, Zeyang Liu, Xuyang Lu, Xuguang Lan

机构 * Xi'an Jiaotong University(西安交通大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 GeoBlock通过分析依赖几何推断块粒度,提升扩散语言模型的并行效率与依赖一致性。

Comments 13 pages, 4 figures, Code available upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28060 2026-03-31 cs.SE 80%

DAInfer+: Neurosymbolic Inference of API Specifications from Documentation via Embedding Models

DAInfer+: 通过嵌入模型从文档中推断API规范的神经符号推理

Maryam Masoudian, Anshunkang Zhou, Chengpeng Wang, Charles Zhang

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出DAInfer+,利用NLP和嵌入模型从库文档推断API规范,通过神经符号优化提高数据流和别名关系推断的精度与效率。

Comments 35 pages, Under submission to ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28534 2026-03-31 cs.CL physics.data-an 79%

Compressing Transformer Language Models via Matrix Product Operator Decomposition: A Case Study on PicoGPT

通过矩阵积算符分解压缩变换器语言模型:以PicoGPT为例

Younes Javanmard, Tanmoy Pandit, Masoud Mardani

机构 * Institut für Theoretische Physik, Leibniz Universität Hannover(莱布尼茨汉诺威大学理论物理研究所) VTT Technical Research Centre of Finland(芬兰VTT技术研究中心) National High Magnetic Field Laboratory(国家高磁场实验室)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL

AI总结 本文研究了通过矩阵积算符分解压缩变换器语言模型的方法,以PicoGPT为例,展示了在不同bond维度下参数压缩效果及模型精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27385 2026-03-31 cs.LG 79%

Active In-Context Learning for Tabular Foundation Models

基于表格的上下文学习主动学习

Wilailuck Treerath, Fabrizio Pittorino

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出Tab-AICL方法,通过四种获取规则提升表格基础模型的冷启动样本效率,实验显示其在20个分类基准上优于梯度提升基线。

Comments 8 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24143 2026-03-31 cs.CL 79%

Activation Steering for Masked Diffusion Language Models

激活引导用于掩码扩散语言模型

Adi Shnaidman, Erin Feiglin, Osher Yaari, Efrat Mentel, Amit Levi, Raz Lapid

机构 * Deepkeep Technion—Israel Institute of Technology(以色列理工学院)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL

AI总结 本文提出激活引导方法,通过提取对比提示集的低维方向,实现对MDLMs推理过程的控制,展示了在安全拒绝任务中的有效性及跨语言迁移能力。

Comments Accepted at ReALM-GEN @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26769 2026-03-31 cs.CV cs.AI 79%

Edge Reliability Gap in Vision-Language Models: Quantifying Failure Modes of Compressed VLMs Under Visual Corruption

视觉-语言模型边缘可靠性差距:压缩VLM在视觉损坏下的失败模式量化

Mehmet Kaan Erol

机构 * Marmara University, Institute of Pure and Applied Sciences(马尔马拉大学纯科学与应用科学研究所)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 本文比较了压缩的视觉-语言模型在视觉损坏下的失败模式,发现紧凑模型在COCO上表现出更高的语义漂移和对象盲区,且置信度校准存在显著差异。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26731 2026-03-31 cs.CV cs.AI 79%

Contextual inference from single objects in Vision-Language models

从单个物体中推断上下文在视觉-语言模型中的研究

Martina G. Vilas, Timothy Schaumlöffel, Gemma Roig

机构 * Goethe University Frankfurt(法兰克福大学) The Hessian Center for AI(黑森州人工智能中心)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 本文研究了视觉-语言模型中单个物体推断场景上下文的能力,发现物体属性影响推断性能,且不同层次的推断存在解耦现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26823 2026-03-31 cs.LG cs.AI cs.PF 79%

Throughput Optimization as a Strategic Lever in Large-Scale AI Systems: Evidence from Dataloader and Memory Profiling Innovations

通过吞吐量优化在大规模AI系统中的战略杠杆作用:来自数据加载器和内存分析创新的证据

Mayank Jha

机构 * Amazon Robotics(亚马逊机器人)

专题命中 效率与部署 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过数据加载器和内存优化创新,探讨吞吐量优化在大规模AI系统中的战略作用,分析架构改进、内存优化及编译器优化对训练效率的影响。

Comments 5 pages double sided

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26770 2026-03-31 cs.CV 78%

Quantized Vision-Language Models for Damage Assessment: A Comparative Study of LLaVA-1.5-7B Quantization Levels

量化视觉-语言模型用于损伤评估:LLaVA-1.5-7B量化级别的比较研究

Takato Yasuno

专题命中 效率与部署 :language model(title,abstract)

AI总结 本文研究了量化视觉-语言模型在桥梁损伤评估中的应用,比较了不同量化级别在描述质量、推理速度和资源需求之间的平衡,发现Q5_K_M在质量、速度和效率上达到最佳平衡。

Comments 16 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28062 2026-03-31 cs.AI 77%

SLOW: Strategic Logical-inference Open Workspace for Cognitive Adaptation in AI Tutoring

SLOW:面向AI辅导的认知适应战略逻辑推理开放工作区

Yuang Wei, Ruijia Li, Bo Jiang

机构 * Shanghai Institute of Artificial Intelligence for Education(上海人工智能教育研究院)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SLOW框架通过透明决策工作区实现学习者状态推理与教学决策分离,提升个性化、情感敏感性和清晰度。

Comments 15 pages,3 figures. The 27th International Conference on Artificial Intelligence in Education

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27850 2026-03-31 cs.SE cs.CL 77%

EffiSkill: Agent Skill Based Automated Code Efficiency Optimization

EffiSkill:基于代理技能的自动代码效率优化

Zimu Wang, Yuling Shi, Mengfan Li, Zijun Liu, Jie M. Zhang, Chengcheng Wan, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学) University of California, Berkeley(加州大学伯克利分校) Columbia University(哥伦比亚大学) King's College London(伦敦国王学院) East China Normal University(华东师范大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 EffiSkill通过构建可移植的优化工具箱,利用代码效率优化机制,实现无运行反馈的代码优化,提升了优化成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27423 2026-03-31 cs.AI cs.SE 77%

AstraAI: LLMs, Retrieval, and AST-Guided Assistance for HPC Codebases

AstraAI:基于LLM、检索与AST引导的HPC代码库辅助系统

Mahesh Natarajan, Xiaoye Li, Weiqun Zhang

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AstraAI通过整合LLM、RAG和AST分析,实现对复杂科学代码库的上下文感知代码生成,支持HPC环境中的代码修改与结构保持。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27414 2026-03-31 math.ST cs.AI stat.TH 77%

Multiple-Prediction-Powered Inference

多预测驱动推断

Charlie Cowen-Breen, Alekh Agarwal, Stephen Bates, William W. Cohen, Jacob Eisenstein, Amir Globerson, Adam Fisch

机构 * Massachusetts Institute of Technology(麻省理工学院) Google Research(谷歌研究院) Google DeepMind(谷歌DeepMind)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出多预测驱动推断框架,通过优化分配资源于不同数据源,实现统计高效估计。理论证明其最小最大最优性、有限样本性能和渐近正态性,并在三个大语言模型评估场景中验证了其优于现有基线的估计误差。

Comments ICLR 2026, 45 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03548 2026-03-31 cs.CL 77%

SEAD: Self-Evolving Agent for Multi-Turn Service Dialogue

SEAD:多轮服务对话的自演化代理

Yuqin Dai, Ning Gao, Wei Zhang, Jie Wang, Zichen Luo, Jinpeng Wang, Yujie Wang, Ruiyuan Wu, Chaozheng Wang

机构 * Meituan(美团)

专题命中 效率与部署 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL

AI总结 SEAD通过自演化机制提升服务对话性能,无需大规模人工标注,实验显示其任务完成率和对话效率均优于开源和商用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28430 2026-03-31 cs.LG cs.CL 76%

IsoQuant: Hardware-Aligned SO(4) Isoclinic Rotations for LLM KV Cache Compression

IsoQuant: 基于硬件对齐的 SO(4) 等倾旋转用于 LLM KV 缓存压缩

Zhongping Ji

专题命中 效率与部署 :LLM(title);分类 cs.CL、cs.LG

AI总结 IsoQuant 基于四元数代数和 SO(4) 的等倾分解,通过块级旋转框架实现低比特在线向量量化,减少存储和计算成本,提升 KV 缓存压缩效率。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28366 2026-03-31 cs.CV 75%

AutoCut: End-to-end advertisement video editing based on multimodal discretization and controllable generation

AutoCut:基于多模态离散化和可控生成的端到端广告视频编辑

Milton Zhou, Sizhong Qin, Yongzhi Li, Quan Chen, Peng Jiang

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技)

专题命中 效率与部署 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出AutoCut框架,通过多模态离散化和可控生成实现广告视频编辑,提升一致性和可控性,降低生产成本和迭代时间。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22590 2026-03-31 cs.SE 75%

Small is Beautiful: A Practical and Efficient Log Parsing Framework

小即是美:一种实用且高效的日志解析框架

Minxing Wang, Yintong Huo

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出EFParser,一种基于LLM的日志解析器,通过架构创新提升小型模型性能,实验证明其在小型模型上优于现有方法12.5%。

Comments Accepted by FSE'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28028 2026-03-31 cs.CV cs.LG 74%

Efficient Domain Adaptation for Text Line Recognition via Decoupled Language Models

通过解耦语言模型实现文本行识别的高效领域适应

Arundhathi Dev, Justin Zhan

机构 * University of Cincinnati(辛辛那提大学)

专题命中 效率与部署 :language model(title);分类 cs.LG

AI总结 本文提出一种模块化检测-校正框架,利用预训练序列模型实现高效领域适应,减少计算量95%,在现代手写体、连笔字和历史文档上均表现优异。

Comments Accepted to the International Conference on Machine Intelligence Theory and Applications (MiTA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02711 2026-03-31 cs.CL cs.LG 73%

CREST: Universal Safety Guardrails Through Cluster-Guided Cross-Lingual Transfer

CREST:通过聚类引导的跨语言迁移实现通用安全性防护

Lavish Bansal, Naman Mishra

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出CREST模型,通过跨语言迁移有效提升低资源语言的安全性防护,展示其在六个安全基准上的优越表现。

Comments 9 Pages, 5 Figures, Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03616 2026-03-31 cs.CL cs.AI 73%

Multilingual Retrieval-Augmented Generation for Knowledge-Intensive Task

多语言检索增强生成用于知识密集型任务

Leonardo Ranaldi, Barry Haddow, Alexandra Birch

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究多语言检索增强生成在开放域问答中的有效性,提出tRAG和MultiRAG方法,发现tRAG覆盖有限,MultiRAG效率高但存在不一致,CrossRAG通过翻译文档到共同语言提升性能。

Journal ref 2026.findings-eacl.35

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26683 2026-03-31 cs.IR cs.AI cs.CL cs.CV 73%

LITTA: Late-Interaction and Test-Time Alignment for Visually-Grounded Multimodal Retrieval

LITTA:晚期交互与测试时对齐用于视觉接地多模态检索

Seonok Kim

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LITTA通过查询扩展提升多模态文档检索,利用晚期交互评分和反向排名融合提高检索鲁棒性,适用于计算机科学、制药和工业手册等多领域。

详情

展开后加载摘要…

URL PDF HTML 收藏