arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22496 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22496 篇

2606.23255 2026-06-23 cs.NI 新提交 80%

Wireless Personal Agent: Extending Wireless Intelligence from Networks to Terminals

无线个人代理:将无线智能从网络扩展到终端

Jiedan Tan, Fang Liu, Jingwen Tong, Shengli Zhang, Jun Zhang, Wing Shing Wong

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出WISPA框架,利用基于大语言模型的智能体实现终端侧资源自动化管理,通过解耦在线执行与离线反思克服终端资源限制,在校园通勤场景中验证了其学习用户偏好并自适应接入决策的能力。

Comments 7 pages, 5 figures, submit to a possible journal for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21833 2026-06-23 eess.SY cs.SY 新提交 80%

Inference as Flexibility: Ramp Management for Transmission-Connected AI Data Centres

推理即灵活性:面向输电连接AI数据中心的管理

Zhirui Liang

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对AI数据中心快速爬坡等挑战,提出利用大语言模型推理作为内生灵活性资源,与电池储能协调控制,减少71%储能放电能量和51%峰值放电功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06530 2026-06-23 cs.AR 新提交 80%

RTLScout: Joint Agentic Code and Synthesis Optimization for Efficient Digital Circuits

RTLScout:面向高效数字电路的联合智能体代码与综合优化

Felix Arnold, Ryan Amaudruz, Dimitrios Tsaras, Renzo Andri, Lukas Cavigelli

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 提出RTLScout系统,结合LLM驱动智能体设计与电路级综合优化及算术架构扫描,通过多轮精英池框架迭代优化RTL设计,在浮点乘法器上实现面积减少35%、延迟减少45%。

Comments Updated Appendix Table 4: corrected three Verilog baseline values. Conclusions unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20254 2026-06-19 cs.CR 新提交 80%

Quantization as a Malicious Task: Removing Quantization-Conditioned Backdoors via Task Arithmetic

量化作为恶意任务:通过任务算术移除量化条件后门

Kaihsun Yang, Min-Yan Tsai, Chia-Mu Yu

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出QVec方法,通过将量化引起的权重变化视为恶意任务向量,在部署前进行参数校正,无需重训练或触发样本即可防御量化条件后门。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19235 2026-06-18 cs.CR 新提交 80%

CodeSentinel: A Three-Layer Defense Against Indirect Prompt Injection in Code Contexts

CodeSentinel:代码上下文中针对间接提示注入的三层防御

Po-Han Cheng, Chia-Mu Yu, Ying-Dar Lin, Yu-Sung Wu, Wei-Bin Lee

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对代码大语言模型在检索外部代码时面临的间接提示注入攻击,提出CodeSentinel三层推理时净化器,结合语法引导预过滤、CST引导动态Min-K%评分和节点扰动分析,实现0.80节点级F1,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18710 2026-06-18 cs.CR 新提交 80%

Image Prompt Reconstruction Attacks on Distributed MLLM Inference Frameworks

分布式多模态大模型推理框架上的图像提示重建攻击

Xinjian Luo, Hongyan Chang, Jianxin Wei, Yuncheng Wu, Xiaofeng Gao, Meikang Qiu, Ting Yu, Xue Liu

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究分布式MLLM推理中中间嵌入泄露图像提示的风险,提出两种被动黑盒攻击方法MPAA和IEDA,实现像素级和语义级图像重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17669 2026-06-17 cs.SD 新提交 80%

DeSRPA: Decoupled Speech Role-Playing Agent via Inference-Time Intervention

DeSRPA: 通过推理时干预的解耦语音角色扮演智能体

Wenqiu Tang, Zhen Wan, Takahiro Komamizu, Ichiro Ide

机构 * Nagoya University(名古屋大学) National Institute of Informatics(国立情报学研究所)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出DeSRPA框架,通过推理时干预冻结骨干模型,利用双层控制向量机制解耦认知推理与副语言表达,在语音角色扮演中实现个性与情感一致性,超越端到端微调方法。

Comments Accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17068 2026-06-17 physics.plasm-ph physics.flu-dyn 新提交 80%

Electrohydrodynamic coupling and stochastic branching in a miniaturized ns-pulsed He plasma jet

微型纳秒脉冲氦等离子体射流中的电流体耦合与随机分支

Y Agha, K Giotis, D Stefas, N Fagnon, G P Vafakos, V Vavourakis, H Höft, P Svarnas, G Lombardi, K Gazeli

专题命中 效率与部署 :SLM(summary_cn,abstract)

AI总结 通过实验与CFD模拟,研究微米级大气压氦等离子体射流中放电与流动的耦合,发现0.3 slm流量下放电能量最高、射流准直最佳,并首次定量分析了随机分支现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15255 2026-06-16 cs.RO 新提交 80%

OSDAG: Online Scheduling for Efficient Multi-Robot Collaboration

OSDAG: 面向高效多机器人协作的在线调度

Thanh Nguyen Canh, Thang Tran Viet, Phuc Van Dinh, Xiem HoangVan, Nak Young Chong

机构 * Japan Advanced Institute of Science and Technology(日本北陆先端科学技术大学院大学) University of Engineering and Technology, Vietnam National University(越南国立大学工程技术大学) Hanyang University(汉阳大学)

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 提出OSDAG框架,结合LLM任务推理与DAG在线调度,通过一次性分解指令为依赖图并实时分配任务,相比对话式方法推理速度提升5-15倍,调度时间缩短38%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15210 2026-06-16 cs.DC 新提交 80%

Generation Quality-Latency Tradeoff-Aware Inference Offloading for Multimodal LLMs in Cloud-Edge Continuum

云边连续体中多模态大模型的生成质量-延迟权衡感知推理卸载

Zhongxiao Wang, Yueshen Xu, Xinkui Zhao, Wei Shao, Rui Li

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对云边协同多模态大模型推理,提出QLMIO框架以优化生成质量与响应延迟的权衡,并构建MIOBench基准,实验表明延迟降低58.14%且任务完成率不变。

Comments This manuscript was submitted to IEEE Transactions on Mobile Computing on June 3, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00774 2026-06-16 cs.DB 版本更新 80%

SCOPE: Cost-Efficient Model Selection for Compound AI Systems under Quality Constraints

SCOPE: 质量约束下复合AI系统的成本高效模型选择

Yiqian Huang, Shiqi Zhang, Tianyuan Jin, Xiaokui Xiao

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 针对复合AI系统中各模块LLM选择问题,提出SCOPE算法,通过利用每查询结果估计成本和质量,构建置信界指导搜索,在满足质量阈值下最小化平均成本,理论保证质量达标和成本近似最优。

Comments Technical report for the paper accepted at KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29796 2026-06-16 cs.AI cs.CL cs.LG 版本更新 80%

SAAS: Self-Aware Reinforcement Learning for Over-Search Mitigation in Agentic Search

SAAS:面向智能体搜索中过度搜索缓解的自我感知强化学习

Yunbo Tang, Chengyi Yang, Shiyu Liu, Zhishang Xiang, Zerui Chen, Qinggang Zhang, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) School of Artificial Intelligence, Jilin University(吉林大学人工智能学院)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SAAS强化学习框架,通过搜索边界建模、边界感知奖励和分阶段优化策略,使LLM智能体具备动态自我感知能力,在不降低准确率的前提下显著减少过度搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17103 2026-06-16 cs.DC 版本更新 80%

Distributed Load Balancing with Workload-Dependent Service Rates

具有工作负载相关服务速率的分布式负载均衡

Wenxin Zhang, Santiago R. Balseiro, Robert Kleinberg, Vahab Mirrokni, Balasubramanian Sivan, Bartek Wydrowski

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对服务速率随工作负载变化的分布式系统,提出最大边际服务速率(GMSR)策略,通过仅依赖局部信息的分散决策实现全局最优延迟性能,并证明其收敛性和吞吐量最优性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11718 2026-06-15 cs.AR 新提交 80%

Making Locality-aware GEMM Compatible with Page-Granularity Placement on Chiplet GPUs

使局部感知的GEMM与Chiplet GPU上的页粒度放置兼容

Euijun Chung, Jae Hyung Ju, Hyesoon Kim

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对多芯片GPU非均匀内存系统中局部感知数据放置与固定页粒度交错不兼容的问题,提出Chiplet-Contiguous Layout,通过全局内存布局存储芯片局部连续数据,无需修改操作系统或硬件即可兼容页粒度放置,显著降低远程HBM流量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15496 2026-06-15 cs.HC cs.RO 80%

Fast Multi-Party Open-Ended Conversation with a Social Robot

快速多方开放性对话与社交机器人

Giulio Antonio Abbo, Maria Jose Pinto-Bernal, Martijn Catrycke, Tony Belpaeme

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出一种结合多模态感知与大语言模型的多方对话系统,评估结果显示其在平行对话和小组讨论中表现出高参与度和准确率,但存在语音识别误差和响应延迟等技术限制。

Comments 15 pages, 5 figures, 4 tables; 2 appendices

Journal ref Front. Robot. AI 13:1766383 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13450 2026-06-12 eess.AS cs.SD 新提交 80%

Endpoint Anticipation for Low-Latency Spoken Dialogue

低延迟口语对话的端点预测

Sathvik Udupa, Shinji Watanabe, Petr Schwarz, Jan Cernocky

机构 * Brno University of Technology(布拉格技术大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 提出端点预测方法,通过提前预测对话结束信号实现低延迟,在部分上下文中投机执行LLM和TTS流水线,平均延迟降低505毫秒。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13175 2026-06-12 cs.SE 新提交 80%

The End of Code Review: Coding Agents Supersede Human Inspection

代码审查的终结:编码代理取代人工审查

Martin Monperrus

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文论证基于大型语言模型的编码代理已超越传统人工代码审查的能力阈值,能以更低成本、更高吞吐量实现审查目标,并指出人工审查与AI协作的路径不可持续。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13089 2026-06-12 cs.NE 新提交 80%

Multi-Objective Coevolution of Prompts and Templates for Circuit Approximation

电路近似的提示与模板多目标协同进化

Martin Tomasovic, Lukas Sekanina

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出一种协同进化算法,利用现成大语言模型自动设计优化的8位近似乘法器,无需领域特定训练,通过同时进化候选电路和提示模板,实现了比EvoApproxLib库更优的误差-面积权衡。

Comments To appear at Parallel Problem Solving From Nature (PPSN), Trento, IT, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11290 2026-06-11 cs.LG cs.AI cs.CL 新提交 80%

FlowBank: Query-Adaptive Agentic Workflows Optimization through Precompute-and-Reuse

FlowBank: 通过预计算与复用实现查询自适应智能体工作流优化

Lingzhi Yuan, Chenghao Deng, Fangxu Yu, Souradip Chakraborty, Mohammad Rostami, Furong Huang

机构 * University of Maryland, College Park(马里兰大学哥伦比亚公园分校) Amazon(亚马逊)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出FlowBank框架,通过预计算多样化工作流并压缩为紧凑组合,在推理时自适应选择最优工作流,平衡性能与成本,在五个基准上平均得分最高且成本可控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10974 2026-06-10 cs.RO 新提交 80%

Language-Driven Cost Optimization for Autonomous Driving

语言驱动的自动驾驶成本优化

Diego Martinez-Baselga, Khaled Mustafa, Javier Alonso-Mora

机构 * TU Delft(代尔夫特理工大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出语言驱动框架,利用大语言模型解释场景和用户查询,生成风险感知MPPI控制器的参数,并通过人机交互验证和反馈迭代优化自动驾驶行为。

Comments Paper accepted at IEEE Intelligent Transportation Systems Conference (ITSC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09167 2026-06-09 cs.CV 新提交 80%

Vision-Language Guided Hyperspectral Object Tracking via Semantics Fusion and Contextual Template Updating

视觉-语言引导的高光谱目标跟踪:语义融合与上下文模板更新

Rui Yao, Yuhong Zhang, Kunyang Sun, Hancheng Zhu, Jiaqi Zhao, Zhiwen Shao, Abdulmotaleb El Saddik

机构 * China University of Mining and Technology(中国矿业大学) University of Ottawa(渥太华大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出VLHTrack框架,通过语言引导波段选择模块缓解光谱冗余,利用多模态融合模块整合视觉与语言特征,并采用动态模板更新策略应对目标形变,在HOT2023/2024上超越现有方法。

Comments 14 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08853 2026-06-09 econ.EM stat.ME 新提交 80%

AI-Assisted Variance Reduction in Randomized Experiments

AI辅助的随机实验方差缩减

David Arbour, Eli Ben-Michael, Avi Feller, Apoorva Lal, Lo-Hua Yuan

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出将AI预测作为协变量纳入标准回归调整,以降低随机实验方差,具有“无害”特性,并通过模拟和三个实证应用验证了效率提升。

Comments camera ready for KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23294 2026-06-08 eess.SY cs.SY 版本更新 80%

Agentic AI-Enhanced Semantic Communications: Foundations, Architecture, and Applications

基于代理AI的语义通信:基础、架构与应用

Haixiao Gao, Mengying Sun, Ruichen Zhang, Yanhan Wang, Xiaodong Xu, Nan Ma, Dusit Niyato, Ping Zhang

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文探讨代理AI如何赋能语义通信,提出统一框架并展示多场景应用,通过案例研究验证其有效性。

Comments This version is being withdrawn because we need to further reevaluate the attribution of contributions among the authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06467 2026-06-05 cs.CL cs.AI cs.LG 80%

You Only Index Once: Cross-Layer Sparse Attention with Shared Routing

仅索引一次:具有共享路由的跨层稀疏注意力

Yutao Sun, Yanqi Zhang, Li Dong, Jianyong Wang, Furu Wei

机构 * Microsoft Research(微软研究院) Tsinghua University(清华大学)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出跨层稀疏注意力(CLSA),通过共享KV缓存和路由索引,在保持token稀疏注意力精度的同时减少路由开销,显著提升长上下文LLM的解码效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06139 2026-06-05 cs.RO 80%

MotionDisco: Motion Discovery for Extreme Humanoid Loco-Manipulation

MotionDisco: 用于极端人形机器人移动操作的运动发现

Ilyass Taouil, Michal Ciebelski, Shafeef Omar, Haizhou Zhao, Angela Dai, Aaron M. Johnson, Majid Khadiv

机构 * Technical University of Munich, Germany(慕尼黑技术大学) New York University, USA(纽约大学) Carnegie Mellon University, USA(卡内基梅隆大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出MotionDisco框架,通过大语言模型引导的进化搜索和顺序运动动力学轨迹优化,从零开始自动发现长时域、接触丰富的人形机器人移动操作技能,并在真实机器人上部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06080 2026-06-05 cs.LG cs.AI cs.CL 80%

On Advantage Estimates for Max@K Policy Gradients

关于 Max@K 策略梯度的优势估计

Shota Takashiro, Soichiro Nishimori, Paavo Parmas, Yongmin Kim, Kohsei Matsutani, Gouki Minegishi, Yusuke Iwasawa, Takeshi Kojima, Yutaka Matsuo

机构 * The University of Tokyo(东京大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对稀疏奖励下推理模型后训练困难,提出一种新的优势估计方法 MaxPO,通过 Leave-Two-Out 基线实现中心化优势,降低梯度方差并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13081 2026-06-04 cs.HC cs.CY 80%

Chuck, Wilson and the emergence of artificial minds in human-AI conversations

Chuck, Wilson 与人机对话中人工心智的出现

Geoff Keeling, Winnie Street

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文反驳了 Birch 的幻觉主义观点,提出对话中出现的角色(characters)作为有心理连续性的实体真实存在,并基于解释主义实在论论证其心智状态是预测对话动态所需的“真实模式”。

Comments 21 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03771 2026-06-03 cs.CR 80%

$π$Creds: Privately Inferred Credentials

$\pi$Creds: 私有推断凭证

Samuel Breckenridge, Dani Vilardell, Derek Leung, Andrés Fábrega, James Austgen, Farinaz Koushanfar, Ari Juels

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 本文提出$\pi$Creds,一种利用可信LLM推理生成隐私保护、兼容遗留系统的去中心化可验证凭证,扩展了凭证可认证的声明范围,并形式化了源受限对抗样本和认证隐蔽谓词投毒两类新威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31035 2026-06-01 cs.AR 80%

MixFP4: Enhancing NVFP4 with Adaptive FP4/INT4 Block Representations

MixFP4:通过自适应FP4/INT4块表示增强NVFP4

Jiaxiang Zou, Yonghao Chen, Ruilong Wu, Xinyu Chen

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出MixFP4,通过为每个块选择两种FP4微格式(E2M1和E1M2)并复用NVFP4的缩放层级,在不改变标准块缩放MMA/GEMM执行路径的情况下,提升FP4量化的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26074 2026-05-29 cs.CR 80%

Not All Entities are Created Equal: A Dynamic Anonymization Framework for Privacy-Preserving RAG

并非所有实体都生而平等:一种面向隐私保护RAG的动态匿名化框架

Xinyuan Zhu, Zekun Fei, Enye Wang, Ruiqi He, Jia Guo, Ruijie Wang, Zheli Liu, Qingkai Zeng

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对检索增强生成中敏感实体“一刀切”匿名化导致效用下降的问题,提出基于上下文感知实体量化的动态匿名化框架TRIP-RAG,通过评估边际隐私风险、知识分歧和主题相关性实现变强度隐私保护,在保持隐私保护的同时显著提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏