arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22497 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22497 篇

2409.18664 2024-09-30 cs.LG 80%

How green is continual learning, really? Analyzing the energy consumption in continual training of vision foundation models

Tomaso Trinci, Simone Magistri, Roberto Verdecchia, Andrew D. Bagdanov

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

Comments This manuscript has been accepted at the Green FOundation MOdels (GreenFOMO) ECCV 2024 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07249 2024-06-27 q-bio.BM cs.AI 80%

Are Protein Language Models Compute Optimal?

Yaiza Serrano, Álvaro Ciudad, Alexis Molina

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI;foundation model(comments)

Comments Proceedings of the ICML 2024 Workshop on Accessible and Efficient Foundation Models for Biological Discovery, Vienna, Austria. 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.05057 2024-02-06 eess.IV cs.AI cs.CV 80%

SFT-KD-Recon: Learning a Student-friendly Teacher for Knowledge Distillation in Magnetic Resonance Image Reconstruction

Matcha Naga Gayathri, Sriprabha Ramanarayanan, Mohammad Al Fahim, Rahul G S, Keerthi Ram, Mohanasankar Sivaprakasam

专题命中 效率与部署 :SFT(title,abstract);分类 cs.AI

Comments 18 pages, 8 figures. Accepted for publication at MIDL 2023. Code for our proposed method is available at https://github.com/GayathriMatcha/SFT-KD-Recon

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26213 2026-08-28 cs.SD cs.CV eess.AS 新提交 80%

Attention-Guided Reliability Scaling for Contrastive Decoding in Robust Audio-Visual Speech Recognition

用于鲁棒视听语音识别中对比解码的注意力引导可靠性缩放

YoungChae Kim, Da-Hee Yang, Joon-Hyuk Chang

机构 * Hanyang University(汉阳大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究针对鲁棒视听语音识别问题,提出注意力引导的对比解码可靠性缩放方法,在LRS3数据集上实现了干净与低信噪比条件下的性能提升。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26049 2026-08-27 cs.CR cs.AR 新提交 80%

RTLGuard: A Lightweight Teacher-Student Defense for Poisoned RTL Code Generation Models

RTLGuard:一种针对中毒RTL代码生成模型的轻量级师生防御方法

Mahshid Rezakhani, Kimia Azar, Hadi Kamali

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 RTLGuard是一种轻量级师生防御方法,通过小规模干净教师模型、复合师生目标及特征对齐等,降低中毒RTL代码生成模型的攻击成功率,同时保留代码功能正确性与可综合性。

Comments 8 pages, 4 figures, 7 tables. Accepted at the IEEE/ACM International Conference on Computer-Aided Design (ICCAD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25332 2026-08-27 cs.CV 新提交 80%

Not All Attention Heads Contribute to Critical Visual Token Selection: Head-Aware Pruning Matters More

并非所有注意力头都有助于关键视觉标记选择:头感知剪枝更重要

Chaofang Ma, Lin Jiang, Carol Jingyi Li, Xingyu Liu, Zeyu Li, Jiang Xu, Wei Zhang

机构 * The Hong Kong University of Science and Technology(香港科技大学) Northeastern University(东北大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文针对视觉-语言模型推理效率问题,提出无需训练的渐进式视觉标记剪枝框架ProViP,利用关键注意力头提升剪枝效果,在LLaVA-1.5-7B上实现高剪枝率下的性能保留与推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22932 2026-08-27 eess.SP 版本更新 80%

AirMoE: Realizing Over-the-Air Distributed Mixture-of-Experts Inference at the Wireless Edge

AirMoE:在无线边缘实现无线分布式混合专家(Mixture-of-Experts,MoE)推理

Huiling Yang, Zhanwei Wang, Kaibin Huang

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 AirMoE是利用AirComp实现无线分布式MoE推理的框架,通过双时间尺度策略解决AirComp带来的挑战,在ARC-Easy基准上显著提升了E2E推理准确性,尤其适用于强设备异构场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23880 2026-08-26 cs.CV 新提交 80%

LG-GER: Language-Guided Group Emotion Recognition via Multimodal Evidence Distillation

LG-GER:基于多模态证据蒸馏的语言引导群体情绪识别

Ahmed Shehab Khan, Zhiyuan Li, Yan Tong

机构 * University of South Carolina(南卡罗来纳大学)

专题命中 效率与部署 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 该研究提出LG-GER框架,通过MLLM生成结构化证据并蒸馏至VLM骨干,无需检测器等即可实现高效群体情绪识别,在GroupEmoW和GAF 3.0数据集上取得了有竞争力或更优的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09473 2026-08-26 cs.LG cs.AI cs.CL 版本更新 80%

NeuronTune: Fine-Grained Neuron Modulation for Balanced Safety-Utility Alignment in LLMs

NeuronTune:用于大语言模型中安全-效用平衡对齐的细粒度神经元调制

Birong Pan, Jianhao Chen, Mayi Xu, Qiankun Pi, Yuanyuan Zhu, Ming Zhong, Tieyun Qian

机构 * Birong Pan, Mayi Xu, Qiankun Pi, Jianhao Chen, Yuanyuan Zhu, Ming Zhong, Tieyun Qian(作者)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 NeuronTune是一种细粒度神经元调制框架,通过定位安全关键与效用保留神经元并动态控制干预范围,实现了大语言模型安全与效用的平衡优化,性能优于现有最先进技术。

Comments This work was accepted by WISE2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28147 2026-08-25 cs.CR 版本更新 80%

Agent Harness Distillation: Inference-Time Harness Extraction and Exploitation in Autonomous Multi-Agent Systems

智能体调控蒸馏:自主多智能体系统中的推理时调控提取与利用

Yu Cui, Wuli Yang, Yirui Shi, Junhao Xia, Hui Jiang, Lei Gao, Chenfu Bao

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出AHD框架,将AMAS推理时调控提取形式化为新安全问题,实验证实其可提取调控致IP泄露,还提出对应欺骗防御,揭示AMAS新安全威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14537 2026-08-25 cs.CV 版本更新 80%

LanGuSTE: Language-Guided Coarse-to-Fine Patch Selection for Efficient Whole Slide Image Analysis

LanGuSTE:用于高效全切片图像分析的语言引导粗到细补丁选择

Yonghan Shin, Gangsu Kim, Won-Ki Jeong

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对全切片图像分析的高计算成本问题,提出LanGuSTE框架,通过跨尺度视觉提示调优和粗到细补丁选择,在保持诊断性能的同时将处理时间降至约3倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19628 2026-08-21 cs.AR 新提交 80%

A Thread-Register Decoupled GPU Execution Model for Efficient Tensor Computation

用于高效张量计算的线程-寄存器解耦GPU执行模型

Zihan Liu, Jingwen Leng, Yangjie Zhou, Yitong Ding, Guanlin Zhu, Yilu Huang, Chiheng Jin, Chen Zhang, Shixuan Sun, Yu Feng, Anbang Wu, Minyi Guo, Jian Weng, Jiajin Tu, Junsong Wang

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 针对GPU张量计算流水线的固定并行度与粗粒度调度瓶颈,提出扩展SIMT模型的FIBER架构,通过线程-寄存器解耦实现动态并行缩放与细粒度调度,在LLM服务场景下获显著加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18524 2026-08-20 cs.CL cs.AI cs.LG cs.MA 新提交 80%

DART-SD: Diamond-topology Aware Retrieval and Tuning for Self-Distillation of Multi-Turn Tool-Calling Agents

DART-SD:面向多轮工具调用智能体自蒸馏的钻石拓扑感知检索与微调

Hangrui Xu, Jiarui Wang, Yang Yang, Chuanbo Zhu, Fangda Chen, Ziqi Wu, Jingming Cai, Yan Song

机构 * ByteDance(字节跳动) University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文针对多轮工具调用智能体训练中的拓扑崩溃问题,提出DART-SD框架,通过建模拓扑、检索恢复参考与渐进自蒸馏提升策略多样性,性能优于传统全轨迹基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18009 2026-08-19 cs.CV 新提交 80%

Memory Tree Guided Key Frame Querying for Efficient 3D Question Answering

基于记忆树引导的关键帧查询的高效三维问答

Hsiang-Wei Huang, Fu-Chen Chen, Li-Wu Tsao, Cheng-Han Lee, Che-Chun Su, Lu Xia, Ronghui Peng, Jenq-Neng Hwang, Min Sun, Cheng-Hao Kuo

机构 * University of Washington(华盛顿大学) Amazon(亚马逊公司) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究针对具身场景三维问答的效率问题,提出MemTree3D记忆树引导的关键帧选择方法,在OpenEQA数据集上显著提升GPT-4o与LLaVA-OneVision-7B的问答性能,优于现有视觉搜索方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14783 2026-08-18 cs.CV cs.GR 新提交 80%

MegaParts: Scaling Part-Aware 3D Object Generation to 300 Parts via Token-Efficient Autoregressive Modeling

MegaParts:通过令牌高效自回归建模将部件感知三维物体生成扩展至300个部件

Manwen Liao, Xinyu Lian, Jian Mao, Kaixu Chen, Li Luo, Jinghao Yan, Wanshui Gan, Qiao Yu, Weitian Zhang, Chunhua Shen, Guang Chen, Bo Dai, Xudong Xu, Zhaoyang Lyu

机构 * The University of Hong Kong(香港大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Tongji University(同济大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 MegaParts提出结合结构化序列建模与令牌高效矢量量化形状令牌化器的自回归框架,将部件感知3D生成扩展至300个部件,性能优于基线模型,为大规模部件感知3D生成提供新方案。

Comments 12 pages, 6 pages appendix, 13 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14561 2026-08-18 cs.DC cs.OS cs.PF 新提交 80%

A Biophysically-Inspired Feedback Controller for Multi-Class Cache Fairness

受生物物理启发的多类缓存公平性反馈控制器

Matt R. Flax

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 针对多租户LLM服务的缓存公平性问题,提出受生物物理启发的多类缓存替换策略,在合成工作负载上缩小了LRU与Belady的未命中率差距,实现公平性与吞吐量的可调权衡。

Comments 24 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24312 2026-08-18 cs.CR 版本更新 80%

Five Queries Are Enough: Query-Efficient and Surrogate-Free Membership Inference Attacks on RAG via Entailment

五个查询就足够了:基于蕴含的查询高效且无替代模型的RAG成员推断攻击

Nguyen Linh Bao Nguyen, Wanlun Ma, Viet Vo, Alsharif Abuadbba, Minghong Fang, Jun Zhang, Yang Xiang

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出MEntA攻击方法,利用自然语言蕴含在少量查询下高效推断RAG系统中的文档成员关系,无需替代模型,成本低且难以检测。

Comments Accepted by USENIX Security 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16864 2026-08-18 cs.DC cs.AR 版本更新 80%

HieraSparse: Hierarchical Semi-Structured Sparse KV Attention

HieraSparse: 分层半结构化稀疏KV注意力

Haoxuan Wang, Chen Wang

专题命中 效率与部署 :LLM(summary_cn);large language model(abstract);language model(abstract)

AI总结 本文提出HieraSparse,通过分层KV缓存压缩框架和GPU稀疏张量核心,提升LLM的KV缓存效率与注意力计算速度,实现稀疏性与效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13723 2026-08-17 cs.RO 新提交 80%

Graph-MambaNav: Spatial-Temporal Graph Mamba Leveraging Object-Relation Knowledge for Object-Goal Navigation

Graph-MambaNav:利用对象关系知识的时空图Mamba用于目标对象导航

Leyuan Sun, Genxin Chen, Linwei Ye, Yan Zhang, Xi Kan, Yanfei Sun

机构 * School of Internet of Things Engineering, Wuxi University(无锡大学物联网工程学院) School of Communications and Information Engineering, Nanjing University of Posts and Telecommunications(南京邮电大学通信与信息工程学院)

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 本研究提出Graph-MambaNav,一种结合LLM常识对象关系的目标感知时空图编码框架,通过节点排序与Mamba建模实现高效导航,在仿真环境表现优异且泛化性好,经真实机器人部署验证有效。

Comments Accepted by IEEE Robotics and Automation Letters (IEEE RA-L), will transfer to 2027 IEEE International Conference on Robotics & Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09075 2026-08-17 cs.CR cs.AR 版本更新 80%

SLAC: Access-Driven CPU-to-GPU Side-channel Attacks via System-Level Cache on Apple Silicon

SLAC:基于Apple Silicon系统级缓存的访问驱动CPU到GPU侧信道攻击

Tianhong Xu, Saion K. Roy, Ruyi Ding, Aidong Adam Ding, Yunsi Fei

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 本研究针对Apple Silicon异构SoC发现GPU内存访问会在共享SLC留下可被CPU观测的集合级足迹,提出CPrime+CProbe及加速变体GPrime+CProbe侧信道技术,实现GNN图边重构与LLM隐私攻击,揭示Apple Silicon的微架构漏洞。

Comments Accepted to ACM CCS 2026. 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12209 2026-08-13 cs.CV 新提交 80%

Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction

作为辅助监督的生成:通过解耦嵌入预测以零推理开销增强视觉理解

Zhongbin Guo, Jiahao Xie, Dongling Xiao, Qianle Wang, Ruiqi Lu, Xiaomin He, Wanxuan Sun, Cheng Yang

机构 * ByteDance(字节跳动)

专题命中 效率与部署 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 本研究提出GAS框架,将视觉生成作为辅助监督,通过解耦MoT架构的NEP实现零推理开销,提升了多模态理解尤其是感知与空间理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11820 2026-08-13 cs.CV 新提交 80%

TD-VAD: Breaking Visual Dependence in Video Anomaly Detection with Text-Driven Learning

TD-VAD:通过文本驱动学习打破视频异常检测中的视觉依赖

Shuangqing Zhang, Lei-Lei Ma, Zhao Wang, Wen Dong, Xinyi Xu, Guo-Sen Xie, Caifeng Shan, Fang Zhao

机构 * School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) School of Artificial Intelligence Engineering, Hefei Institute of Technology(合肥工业大学人工智能工程学院) China Mobile Zijin Innovation Institute(中国移动紫金创新研究院) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院)

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 针对现有视频异常检测依赖视觉数据的问题,提出TD-VAD方法,利用LLM生成的文本描述训练模型,结合事件演化因果注意力模块与CLIP编码器,在XD-Violence和UCF-Crime上性能大幅优于现有方法。

Comments Accepted to ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10139 2026-08-12 cs.DB 新提交 80%

AI Query Compilation for Unified and Optimized Execution

用于统一且优化执行的AI查询编译

Yeounoh Chung, Helena Caminal, Fatma Ozcan

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 该研究提出统一编译执行架构范式,将SQL与LLM整合为张量计算图消除PCIe瓶颈,在SemBench数据集的TPU实验获最高5.3倍延迟、9.8倍吞吐量加速,还给出相关研究路线图。

Comments Proceedings of the VLDB Endowment, Vol. 14, No. 1 ISSN 2150-8097

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09290 2026-08-12 cs.SE 版本更新 80%

OpenCodeReview: Determinism over Non-Determinism for Cost-Effective Agent-Based Code Review

OpenCodeReview:面向成本效益型智能体代码评审的非确定性转确定性方案

Zhengfeng Li, Lei Zhang, Xianwei Wu, Zhengqi Zhuang, Yingjie Xu, Boge Wang, Shaofei Zhu, Chuan Wang, Peng Zhao, Xinyu Zheng, Guoping Rong

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 OpenCodeReview针对LLM代码评审智能体的非确定性与上下文局部性缺陷,通过在三个流水线节点注入确定性,在AACR-Bench上实现SEM-F1提升且大幅降低令牌消耗,性能优于主流编码智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08352 2026-08-11 cs.PL 新提交 80%

SimP: Unifying Syntax- and Semantic-Guided Techniques for Efficient Program Reduction

SimP:统一语法与语义引导技术的高效程序缩减方法

Ye Xiong, Xiangyu Gao, Qiaochu Chen, Mingyu Li, Haibo Chen

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 SimP框架结合传统与LLM式缩减技术,兼顾缩减效率与质量,且LLM成本可忽略,解决编译器漏洞调试中测试程序过大的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16598 2026-08-11 cs.CV 版本更新 80%

VisionSelector: End-to-End Learnable Visual Token Compression for Efficient Multimodal LLMs

VisionSelector:用于高效多模态大语言模型的端到端可学习视觉令牌压缩

Jiaying Zhu, Yurui Zhu, Xin Lu, Wenrui Yan, Dong Li, Kunlin Liu, Xueyang Fu, Zheng-Jun Zha

专题命中 效率与部署 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 针对多模态大语言模型的视觉令牌压缩瓶颈,提出端到端可学习的VisionSelector框架,通过可微Top-K与课程退火策略实现高效自适应令牌选择,在压缩时保持优异性能并提升预填充速度。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06677 2026-08-10 cs.DB 新提交 80%

From Interpretation to Compilation: A Compilation-Based Execution Engine for Semantic Operator Systems

从解释到编译:面向语义算子系统的基于编译的执行引擎

Wenkai Dong, Yifan Wang

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 提出SemBaker编译式执行引擎,通过生成Python函数本地执行替代逐项LLM调用,支持多工具,在200查询的问答工作负载中获4.8-6.3倍加速与5.4-10.7倍成本降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02909 2026-08-05 econ.EM stat.ML 新提交 80%

When Predictions Become Regressors: A Split-Sample Correction for Biases in Downstream Inference

当预测成为回归元:针对下游推断偏差的拆分样本校正方法

Nathan Canen, Ted Enamorado

专题命中 效率与部署 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 本文针对预测生成测度用作回归元的偏差问题,提出基于独立拆分样本构建工具变量的校正方法,经模拟及两个实证案例验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03223 2026-08-05 cs.LG cs.AI cs.CL 新提交 80%

Agentic Reinforcement Learning with Self-Distilled Reward Shaping

具有自提炼奖励塑造的智能体强化学习

Ranxu Zhang, Guinan Chen, Chenshaodong, Jinghao Lin, Xiaozhou Xu, Sunzhe, Yanyong Zhang, Chao Wang

专题命中 效率与部署 :LLM(abstract,abstract_cn);language agent(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对智能体强化学习中稀疏奖励无法分配中间决策信用的问题,提出ADRS框架,通过校准教师分数等提升多轮语言智能体在长时域任务的性能,且增益稳定。

Comments 17 pages,10 figures,11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03065 2026-08-05 cs.SE 新提交 80%

Efficient Grammar-Constrained Decoding via Parser Stack Classification

基于解析器栈分类的高效语法约束解码

Yongmin Li, Yihong Dong, Jia Li, Ge Li

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 本文提出PSC方法,通过解析器栈分类实现高效语法约束解码,其计算掩码速度远快于基线,可提升LLM的端到端吞吐量。

Comments accepted by ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏