arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2014 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 2014 篇

2606.21833 2026-06-23 eess.SY cs.SY 新提交 80%

Inference as Flexibility: Ramp Management for Transmission-Connected AI Data Centres

推理即灵活性:面向输电连接AI数据中心的管理

Zhirui Liang

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对AI数据中心快速爬坡等挑战,提出利用大语言模型推理作为内生灵活性资源,与电池储能协调控制,减少71%储能放电能量和51%峰值放电功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06530 2026-06-23 cs.AR 新提交 80%

RTLScout: Joint Agentic Code and Synthesis Optimization for Efficient Digital Circuits

RTLScout:面向高效数字电路的联合智能体代码与综合优化

Felix Arnold, Ryan Amaudruz, Dimitrios Tsaras, Renzo Andri, Lukas Cavigelli

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 提出RTLScout系统,结合LLM驱动智能体设计与电路级综合优化及算术架构扫描,通过多轮精英池框架迭代优化RTL设计,在浮点乘法器上实现面积减少35%、延迟减少45%。

Comments Updated Appendix Table 4: corrected three Verilog baseline values. Conclusions unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20254 2026-06-19 cs.CR 新提交 80%

Quantization as a Malicious Task: Removing Quantization-Conditioned Backdoors via Task Arithmetic

量化作为恶意任务:通过任务算术移除量化条件后门

Kaihsun Yang, Min-Yan Tsai, Chia-Mu Yu

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出QVec方法,通过将量化引起的权重变化视为恶意任务向量,在部署前进行参数校正,无需重训练或触发样本即可防御量化条件后门。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19235 2026-06-18 cs.CR 新提交 80%

CodeSentinel: A Three-Layer Defense Against Indirect Prompt Injection in Code Contexts

CodeSentinel:代码上下文中针对间接提示注入的三层防御

Po-Han Cheng, Chia-Mu Yu, Ying-Dar Lin, Yu-Sung Wu, Wei-Bin Lee

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对代码大语言模型在检索外部代码时面临的间接提示注入攻击,提出CodeSentinel三层推理时净化器,结合语法引导预过滤、CST引导动态Min-K%评分和节点扰动分析,实现0.80节点级F1,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18710 2026-06-18 cs.CR 新提交 80%

Image Prompt Reconstruction Attacks on Distributed MLLM Inference Frameworks

分布式多模态大模型推理框架上的图像提示重建攻击

Xinjian Luo, Hongyan Chang, Jianxin Wei, Yuncheng Wu, Xiaofeng Gao, Meikang Qiu, Ting Yu, Xue Liu

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究分布式MLLM推理中中间嵌入泄露图像提示的风险,提出两种被动黑盒攻击方法MPAA和IEDA,实现像素级和语义级图像重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17669 2026-06-17 cs.SD 新提交 80%

DeSRPA: Decoupled Speech Role-Playing Agent via Inference-Time Intervention

DeSRPA: 通过推理时干预的解耦语音角色扮演智能体

Wenqiu Tang, Zhen Wan, Takahiro Komamizu, Ichiro Ide

机构 * Nagoya University(名古屋大学) National Institute of Informatics(国立情报学研究所)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出DeSRPA框架,通过推理时干预冻结骨干模型,利用双层控制向量机制解耦认知推理与副语言表达,在语音角色扮演中实现个性与情感一致性,超越端到端微调方法。

Comments Accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17068 2026-06-17 physics.plasm-ph physics.flu-dyn 新提交 80%

Electrohydrodynamic coupling and stochastic branching in a miniaturized ns-pulsed He plasma jet

微型纳秒脉冲氦等离子体射流中的电流体耦合与随机分支

Y Agha, K Giotis, D Stefas, N Fagnon, G P Vafakos, V Vavourakis, H Höft, P Svarnas, G Lombardi, K Gazeli

专题命中 效率与部署 :SLM(summary_cn,abstract)

AI总结 通过实验与CFD模拟,研究微米级大气压氦等离子体射流中放电与流动的耦合,发现0.3 slm流量下放电能量最高、射流准直最佳,并首次定量分析了随机分支现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15255 2026-06-16 cs.RO 新提交 80%

OSDAG: Online Scheduling for Efficient Multi-Robot Collaboration

OSDAG: 面向高效多机器人协作的在线调度

Thanh Nguyen Canh, Thang Tran Viet, Phuc Van Dinh, Xiem HoangVan, Nak Young Chong

机构 * Japan Advanced Institute of Science and Technology(日本北陆先端科学技术大学院大学) University of Engineering and Technology, Vietnam National University(越南国立大学工程技术大学) Hanyang University(汉阳大学)

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 提出OSDAG框架,结合LLM任务推理与DAG在线调度,通过一次性分解指令为依赖图并实时分配任务,相比对话式方法推理速度提升5-15倍,调度时间缩短38%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15210 2026-06-16 cs.DC 新提交 80%

Generation Quality-Latency Tradeoff-Aware Inference Offloading for Multimodal LLMs in Cloud-Edge Continuum

云边连续体中多模态大模型的生成质量-延迟权衡感知推理卸载

Zhongxiao Wang, Yueshen Xu, Xinkui Zhao, Wei Shao, Rui Li

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对云边协同多模态大模型推理,提出QLMIO框架以优化生成质量与响应延迟的权衡,并构建MIOBench基准,实验表明延迟降低58.14%且任务完成率不变。

Comments This manuscript was submitted to IEEE Transactions on Mobile Computing on June 3, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11718 2026-06-15 cs.AR 新提交 80%

Making Locality-aware GEMM Compatible with Page-Granularity Placement on Chiplet GPUs

使局部感知的GEMM与Chiplet GPU上的页粒度放置兼容

Euijun Chung, Jae Hyung Ju, Hyesoon Kim

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对多芯片GPU非均匀内存系统中局部感知数据放置与固定页粒度交错不兼容的问题,提出Chiplet-Contiguous Layout,通过全局内存布局存储芯片局部连续数据,无需修改操作系统或硬件即可兼容页粒度放置,显著降低远程HBM流量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13450 2026-06-12 eess.AS cs.SD 新提交 80%

Endpoint Anticipation for Low-Latency Spoken Dialogue

低延迟口语对话的端点预测

Sathvik Udupa, Shinji Watanabe, Petr Schwarz, Jan Cernocky

机构 * Brno University of Technology(布拉格技术大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 提出端点预测方法,通过提前预测对话结束信号实现低延迟,在部分上下文中投机执行LLM和TTS流水线,平均延迟降低505毫秒。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13175 2026-06-12 cs.SE 新提交 80%

The End of Code Review: Coding Agents Supersede Human Inspection

代码审查的终结:编码代理取代人工审查

Martin Monperrus

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文论证基于大型语言模型的编码代理已超越传统人工代码审查的能力阈值,能以更低成本、更高吞吐量实现审查目标,并指出人工审查与AI协作的路径不可持续。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13089 2026-06-12 cs.NE 新提交 80%

Multi-Objective Coevolution of Prompts and Templates for Circuit Approximation

电路近似的提示与模板多目标协同进化

Martin Tomasovic, Lukas Sekanina

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出一种协同进化算法,利用现成大语言模型自动设计优化的8位近似乘法器,无需领域特定训练,通过同时进化候选电路和提示模板,实现了比EvoApproxLib库更优的误差-面积权衡。

Comments To appear at Parallel Problem Solving From Nature (PPSN), Trento, IT, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11290 2026-06-11 cs.LG cs.AI cs.CL 新提交 80%

FlowBank: Query-Adaptive Agentic Workflows Optimization through Precompute-and-Reuse

FlowBank: 通过预计算与复用实现查询自适应智能体工作流优化

Lingzhi Yuan, Chenghao Deng, Fangxu Yu, Souradip Chakraborty, Mohammad Rostami, Furong Huang

机构 * University of Maryland, College Park(马里兰大学哥伦比亚公园分校) Amazon(亚马逊)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出FlowBank框架,通过预计算多样化工作流并压缩为紧凑组合,在推理时自适应选择最优工作流,平衡性能与成本,在五个基准上平均得分最高且成本可控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10974 2026-06-10 cs.RO 新提交 80%

Language-Driven Cost Optimization for Autonomous Driving

语言驱动的自动驾驶成本优化

Diego Martinez-Baselga, Khaled Mustafa, Javier Alonso-Mora

机构 * TU Delft(代尔夫特理工大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出语言驱动框架,利用大语言模型解释场景和用户查询,生成风险感知MPPI控制器的参数,并通过人机交互验证和反馈迭代优化自动驾驶行为。

Comments Paper accepted at IEEE Intelligent Transportation Systems Conference (ITSC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09167 2026-06-09 cs.CV 新提交 80%

Vision-Language Guided Hyperspectral Object Tracking via Semantics Fusion and Contextual Template Updating

视觉-语言引导的高光谱目标跟踪:语义融合与上下文模板更新

Rui Yao, Yuhong Zhang, Kunyang Sun, Hancheng Zhu, Jiaqi Zhao, Zhiwen Shao, Abdulmotaleb El Saddik

机构 * China University of Mining and Technology(中国矿业大学) University of Ottawa(渥太华大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出VLHTrack框架,通过语言引导波段选择模块缓解光谱冗余,利用多模态融合模块整合视觉与语言特征,并采用动态模板更新策略应对目标形变,在HOT2023/2024上超越现有方法。

Comments 14 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08853 2026-06-09 econ.EM stat.ME 新提交 80%

AI-Assisted Variance Reduction in Randomized Experiments

AI辅助的随机实验方差缩减

David Arbour, Eli Ben-Michael, Avi Feller, Apoorva Lal, Lo-Hua Yuan

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出将AI预测作为协变量纳入标准回归调整,以降低随机实验方差,具有“无害”特性,并通过模拟和三个实证应用验证了效率提升。

Comments camera ready for KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19662 2026-08-21 cs.CL 新提交 79%

ReCache: Efficient KV Cache Reuse and Compression for Tool-Augmented LLM Agents

ReCache:面向工具增强型大语言模型智能体的高效键值缓存复用与压缩

Yichu Fang, Sitong Wei, Haozhe Hu, Xiaoyu Shen

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology(东方理工学院) Xi’an Jiaotong University(西安交通大学)

专题命中 效率与部署 :LLM(title);language model(abstract);分类 cs.CL

AI总结 ReCache是面向工具增强型大语言模型智能体的框架,通过资源级注意力与剪枝实现KV缓存复用压缩,在性能损失极小的情况下大幅降低推理计算与内存开销,已在多工具数据集基准上验证有效。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17325 2026-08-19 cs.CL 新提交 79%

What Tokens are Learned when Tokenization is Optimized Jointly with Language Modeling?

当分词与语言建模联合优化时,会学习到哪些词元?

Saketh Reddy Vemula, Parameswari Krishnamurthy

机构 * IIIT Hyderabad(印度国际信息技术研究院(海得拉巴))

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL

AI总结 本研究对比无分词器方法(SSLMs、H-Nets)与固定分词器在18种语言上的效果,发现联合优化分词与语言建模可生成高效且有效的差异化词汇,为下游NLP提供新方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15939 2026-08-18 cs.CL 新提交 79%

Aborted but Not Forgotten: KV-Cache Retention Breaks Rollback Consistency in Language Agents

已中止但未被遗忘:KV缓存保留破坏语言智能体的回滚一致性

Guijia Zhang, Harry Yang

专题命中 效率与部署 :language agent(title,abstract);分类 cs.CL

AI总结 研究发现语言智能体中止分支时若保留KV缓存会破坏回滚一致性,引入同token/不同缓存审计方法验证该问题,提出事务局部缓存恢复方案可解决该结构性缺陷。

Comments 21 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15549 2026-08-18 cs.RO cs.AI 新提交 79%

MistyPilot: Enabling Social-Robot Control through Multi-Agent LLM Skill Orchestration

MistyPilot:通过多智能体大语言模型技能编排实现社交机器人控制

Xiao Wang, Lu Dong, Ifeoma Nwogu, Srirangaraj Setlur, Venu Govindaraju

机构 * State University of New York at Buffalo(纽约州立大学布法罗分校)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI

AI总结 该研究提出多智能体大语言模型框架MistyPilot,可解释自然语言指令并编排Misty社交机器人技能,经评估其在多项任务上准确率高、方差低,用户反馈积极,代码将公开。

Comments Accepted at the ECCV 2026 ACVR Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15454 2026-08-18 cs.AI 新提交 79%

Dynamic Multi-Byte Prediction With Hierarchical Language Models

基于分层语言模型的动态多字节预测

Abraham Toluwase Owodunni, Chibuzor Okocha, Christan Grant, Tomasz Limisiewicz, Sachin Kumar

机构 * The Ohio State University(俄亥俄州立大学) University of Florida(佛罗里达大学) University of Washington(华盛顿大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 本文针对分层语言模型逐字节生成推理速度慢的问题,提出多字节预测方法,通过可变长度预测窗口与因果注意力掩码实现并行字节预测,在多任务中达成性能与吞吐量的最优权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13932 2026-08-17 cs.LG 新提交 79%

Post-training Quantization for Hybrid Iterative Generative Models

混合迭代生成模型的训练后量化

Jing Gao, Junyi Wu, Wei Wang, Yan Yan, Yao Zhao

机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学研究所) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 效率与部署 :post-training(title,abstract);分类 cs.LG

AI总结 针对混合迭代生成模型训练后量化易引发模型崩溃的问题,提出HyGenQ框架,通过分层聚类解耦与缩放重校准,成功将其量化至8位精度且性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13316 2026-08-14 eess.SP cs.LG 新提交 79%

Foundation models for movement data: Are they ready for prime-time?

面向运动数据的基础模型:它们是否已准备好投入实际应用?

Alexander Bräuer, Benjamin Cauchi, Nils Strodthoff

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 本文评估四种开源加速度计基础模型与监督基线在19项运动相关任务的表现,发现其性能具任务依赖性,UniMTS表现最优,还提出活动轮廓推断是有前景的研究方向。

Comments 14 pages, 6 figures, 8 tables, code is available at https://github.com/AI4HealthUOL/movement-fm-benchmarking

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13141 2026-08-14 cs.CV cs.LG 新提交 79%

MergeOver: Post-Training Token Merging for Recursive Vision Transformers

MergeOver:面向递归视觉Transformer的训练后令牌合并方法

Junseo Kim, Uraz Odyurt, Amirreza Yousefzadeh

机构 * University of Twente(特文特大学) Faculty of Engineering Technology, University of Twente(特文特大学工程技术学院) Computer Architecture for Embedded Systems, University of Twente(特文特大学嵌入式系统计算机架构实验室)

专题命中 效率与部署 :post-training(title,abstract);分类 cs.LG

AI总结 MergeOver是将令牌合并集成到递归权重共享Transformer的训练后方法,在ImageNet-1K上实现了GPU和树莓派5上的内存、延迟优化,为两类技术结合提供基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12259 2026-08-13 cs.LG q-fin.ST 新提交 79%

Calibration Bets on the Past: Post-Training Quantization for Financial Time-Series Forecasting

对过去的校准赌注:面向金融时间序列预测的训练后量化

Junyi Ye, Ivy Gateri Wanjiku

机构 * School of Computing, Montclair State University(蒙特克莱尔州立大学计算机学院)

专题命中 效率与部署 :post-training(title,abstract);分类 cs.LG

AI总结 该研究针对S&P 500的波动率预测,探究PTQ中激活校准对4位量化的影响,发现百分位校准可缓解4位量化的性能下降,为金融预测的低精度部署提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11937 2026-08-13 cs.LG 新提交 79%

Distillation of Foundation Models for Time-dependent PDEs

面向时变偏微分方程的基础模型蒸馏

Daniel Musekamp, Boshra Ariguib, Andrei Manolache, Mathias Niepert

机构 * University of Stuttgart(斯图加特大学) University of Cologne(科隆大学) Bitdefender(比特 Defender(比特Defender,一家网络安全公司))

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出面向时变PDE的知识蒸馏框架TREX,将预训练基础模型的预测能力迁移至紧凑高效的学生模型,在多PDE基准上实现精度相当或超越教师模型,且参数大幅减少、推理速度显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11676 2026-08-13 cs.AI 新提交 79%

XBridge: Entity-Grounded Latent Bridge for Heterogeneous LLM Communication

XBridge:面向异构大语言模型通信的实体锚定隐空间桥接器

Wooseong Yang, Wei-Chieh Huang, Weizhi Zhang, Yu Wang, Philip S. Yu, Junhyun Lee

机构 * Hankuk University of Foreign Studies(韩国外国语大学) Noah’s Farm(诺亚农场) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Capital One AI Foundations(Capital One AI 基金会)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI

AI总结 XBridge是免解码的异构大语言模型通信协议,通过词汇锚定映射和隐空间丰富桥接器解决跨架构通信的实体身份丢失问题,在多模型、多基准测试中表现优于现有方法,参数开销低。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11235 2026-08-13 cs.AI 新提交 79%

CORA-Diff: Confidence-Oriented Residual Acceptance for Efficient Diffusion Language Model Inference

CORA-Diff:面向高效扩散语言模型推理的置信导向残差接受

Yifan Wu, Yufeng Zhang, Kenli Li

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 本文提出无需训练的CORA-Diff方法,利用原生置信度与持久性门控识别残差位置,在多基准测试中显著降低扩散语言模型推理的重复计算,同时保持任务性能。

Comments 9 pages, 2 figures, 3 tables. Code: https://github.com/wyffffff/cora-diff-llada

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09227 2026-08-11 cs.AI 新提交 79%

Omni2LoRA: Coherence-Preserving Parametric Memory for Efficient Omni Language Models

Omni2LoRA:用于高效全模态语言模型的保持一致性的参数化存储器

Puneet Mathur, Manan Suri, Dinesh Manocha

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 Omni2LoRA是一种保持一致性的参数化存储器压缩框架,通过优化秩分配策略提升全模态语言模型效率,在视听问答任务中优于多种基线,大幅缩短推理时间。

详情

展开后加载摘要…

URL PDF HTML 收藏