arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1111 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1111 篇

2602.03846 2026-06-17 cs.LG cs.AI 版本更新 73%

PLATE: Plasticity-Tunable Efficient Adapters for Geometry-Aware Continual Learning

PLATE: 可塑性可调的几何感知持续学习高效适配器

Romain Cosentino

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 效率与部署 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出无需旧任务数据的持续学习方法PLATE,利用预训练网络的几何冗余性,通过结构化低秩更新显式控制可塑性-保留权衡,提升最坏情况保留保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16738 2026-06-16 cs.CL cs.AI cs.SD eess.AS 版本更新 73%

LM-SPT: LM-Aligned Semantic Distillation for Speech Tokenization

LM-SPT:面向语音标记化的LM对齐语义蒸馏

Daejin Jo, Jeeyoung Yun, Byungseok Roh, Sungwoong Kim

机构 * Department of Artificial Intelligence, Korea University(韩国大学人工智能系) Multi-modal Model Training, Kakao Corp(Kakao公司多模态模型训练部)

专题命中 效率与部署 :language model(abstract);SLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 提出LM-SPT方法,通过语义语音重合成蒸馏,在不降低帧率的情况下生成与语言模型更对齐的离散语音标记,在ASR和TTS任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01476 2026-06-15 cs.LG cs.CL 版本更新 73%

OmniOPD: Logit-Free On-Policy Distillation via Speculative Verification

OmniOPD:通过推测性验证实现无Logit的在线策略蒸馏

Yuhang Zhou, Lizhu Zhang, Yifan Wu, Mingyi Wang, Bo Peng, Jiayi Liu, Xiangjun Fan, Zhuokai Zhao

机构 * Meta AI

专题命中 效率与部署 :SFT(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 提出OmniOPD框架,通过基于蒙特卡洛展开的块级语义相似度替代token级logit匹配,结合峰值熵调度器和贝叶斯先验,解决在线策略蒸馏中logit不可获取和信号脆弱问题,在数学任务上超越标准OPD达28.64%。

Comments 26 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02230 2026-06-15 cs.LG cs.AI 版本更新 73%

Generalized Discrete Diffusion with Self-Correction

广义离散扩散与自校正

Linxuan Wang, Ziyi Wang, Yikun Bai, Wei Deng, Guang Lin, Qifan Song

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :pretraining(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 提出自校正离散扩散模型(SCDD),通过显式状态转移和离散时间学习,简化训练噪声调度,消除冗余重掩码步骤,在GPT-2规模上实现高效并行解码并保持生成质量。

Comments 40 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16430 2026-06-12 cs.LG cs.AI 版本更新 73%

A Theory of Training Profit-Optimal LLMs

训练利润最优大语言模型的理论

Sophie Hao, William Merrill

机构 * Boston University(波士顿大学) Allen Institute for AI(人工智能研究院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出一个经济模型,结合扩展定律与微观经济学理论,分析大语言模型训练的利润最大化问题,探讨模型规模与训练成本的关系及对利润的影响。

Comments Minor edits for preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14738 2026-06-11 cs.LG cs.AI 版本更新 73%

TAPIOCA: Why Task- Aware Pruning Improves OOD model Capability

TAPIOCA: 为什么任务感知剪枝能提升模型对分布外数据的能力

Krish Sharma, Omar Naim, Soumadeep Saha, Vinija Jain, Aman Chadha, Nicholas Asher

机构 * ANITI Meta Apple

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了任务感知剪枝在分布外数据上的改进机制,通过实验发现剪枝能提升OOD准确性,其核心贡献是通过几何解释说明任务感知剪枝如何调整模型表示以适应任务需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05746 2026-06-11 cs.LG cs.AI 版本更新 73%

Learning to Inject: Automated Prompt Injection via Reinforcement Learning

学习注入:通过强化学习实现自动化提示注入

Xin Chen, Jie Zhang, Florian Tramèr

机构 * ETH Zürich(苏黎世联邦理工学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出AutoInject,一种基于强化学习的黑盒框架,自动学习对抗性后缀进行提示注入,在AgentDojo上优于模板攻击和多种自适应攻击,并突破专门防御模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23278 2026-06-11 cs.LG cs.AR cs.CL 版本更新 73%

FOCUS: DLLMs Know How to Tame Their Compute Bound

FOCUS: DLLMs 知道如何驯服它们的计算瓶颈

Kaihua Liang, Xin Tan, An Zhong, Hong Xu, Marco Canini

机构 * University of California, Berkeley(加州大学伯克利分校) University of Toronto(多伦多大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 针对扩散大语言模型解码中大部分计算浪费在不可解码令牌上的问题,提出 FOCUS 推理系统,通过动态聚焦可解码令牌并驱逐不可解码令牌,提升有效批大小,实现高达 3.52 倍的吞吐量提升。

Comments ICML 2026 camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14725 2026-06-10 cs.LG cs.AI 版本更新 73%

GRID: Scaling Task-Agnostic Inference in Continual Prompt Tuning

GRID:持续提示调优中任务无关推理的规模化

Anushka Tiwari, Sayantan Pal, Rohini K. Srihari, Kaiyi Ji

机构 * State University of New York at Buffalo(纽约州立大学布法罗分校) Department of Computer Science and Engineering(计算机科学与工程系) Institute for Artificial Intelligence and Data Science(人工智能与数据科学研究院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出GRID框架,通过输出空间感知解码和梯度引导提示选择,解决持续学习中任务无关推理的性能退化与可扩展性问题,在长序列和负迁移基准上提升后向迁移并减少提示内存。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01279 2026-06-09 econ.TH cs.AI cs.CE cs.CL cs.GT 版本更新 73%

Supracompetitive Pricing Under AI Monoculture

人工智能单一群体下的超竞争定价

Shengyu Cao, Ming Hu

机构 * Rotman School of Management, University of Toronto(多伦多大学罗特曼管理学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在共享AI模型下,竞争卖家委托定价时可能产生的超竞争定价问题,通过双寡头模型分析发现,AI模型的鲁棒性和可重复性配置可能导致超竞争定价现象,且市场结果取决于初始定价倾向。

Comments 46 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06649 2026-06-09 cs.LG cs.AI 版本更新 73%

Revisiting Training Scale: An Empirical Study of Token Count, Power Consumption, and Parameter Efficiency

重新审视训练规模:关于令牌计数、功耗和参数效率的实证研究

Joe Dwyer

机构 * ECPI University(ECPI大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 通过固定硬件和训练条件的重复测量实验,发现增加训练令牌数会导致训练效率严格单调下降,即使性能有边际提升,也表明能耗效率低下。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03002 2026-06-08 cs.LG cs.AI 版本更新 73%

Perplexity Can Miss SAE Feature Damage Under Quantization

量化如何改变可解释特征:语言模型的稀疏自编码器分析

Evan Duan

机构 * University of Michigan(密歇根大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 通过稀疏自编码器分析,发现量化导致语言模型中的可解释特征逐渐退化,且任务指标无法完全反映这种损伤,量化与幅度剪枝共享相似的损伤模式。

Comments 12 Pages of Content, Submitted to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05225 2026-06-08 cs.LG cs.AI 版本更新 73%

MACS: Modality-Aware Capacity Scaling for Efficient Multimodal MoE Inference

MACS: 模态感知容量缩放用于高效多模态MoE推理

Bo Li, Chuan Wu, Shaolin Zhu

机构 * School of Software, Tsinghua University, Beijing, China(清华大学软件学院,北京,中国) TJUNLP Lab, School of Computer Science and Technology, Tianjin University, China(天津大学计算机科学与技术学院,中国) School of New Media and Communication, Tianjin University, China(天津大学新媒体与传播学院,中国)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对多模态MoE大模型在专家并行推理中因信息异质性和模态动态性导致的效率瓶颈,提出无需训练的MACS框架,通过熵加权负载和动态模态自适应容量机制优化资源分配,显著提升多模态基准性能。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05220 2026-06-08 cs.LG cs.AI 版本更新 73%

MidSteer: Optimal Affine Framework for Steering Generative Models

MidSteer:用于引导生成模型的最优仿射框架

Tatiana Gaintseva, Andrew Stepanov, Ziquan Liu, Martin Benning, Gregory Slabaugh, Jiankang Deng, Ismail Elezi

机构 * University of Basel(巴塞尔大学) University of California, Berkeley(加州大学伯克利分校) ETH Zurich(苏黎世联邦理工学院) University of Cambridge(剑桥大学) University of Washington(华盛顿大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MidSteer,一种基于仿射变换的最优概念引导框架,通过最小干扰实现生成模型中的概念切换,并在视觉扩散模型和大型语言模型上验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00527 2026-06-08 cs.LG cs.CL 版本更新 73%

PolarQuant: Leveraging Polar Transformation for Efficient Key Cache Quantization and Decoding Acceleration

PolarQuant: 利用极坐标变换实现高效键缓存量化和解码加速

Songhao Wu, Ang Lv, Xiao Feng, Yufei Zhang, Xun Zhang, Guojun Yin, Wei Lin, Rui Yan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) ShanghaiTech University(上海科技大学) Meituan(美团)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出PolarQuant方法,通过将键向量分组为二维子向量并编码为量化半径和极角,解决键缓存量化中的异常值问题,同时通过查表加速解码,保持全精度模型性能。

Comments NeurIPS 2025 version with minor revisions to the methodology

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20957 2026-08-05 cs.IR 版本更新 71%

Fast and Efficient Approximate Nearest Neighbor Search for High-Dimensional LLM Embeddings

面向高维语言模型嵌入的快速高效近似最近邻搜索

Nico Hezel, Kai Uwe Barthel, Bruno Schilling, Konstantin Schall, Andre Moelle, Klaus Jung

专题命中 效率与部署 :LLM(title)

AI总结 本文针对2026年SISAP索引挑战赛,介绍在高维语言模型嵌入上的近似最近邻搜索方法。利用EVP量化、重排策略及维度扩充等优化算法,通过FLAS预排序机制减少查询延迟和优化内存访问,提升空间局部性与缓存命中率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10726 2026-08-04 cs.CV 版本更新 71%

WorldMirror: Universal 3D World Reconstruction with Any-Prior Prompting

WorldMirror:基于任意先验提示的通用三维世界重建

Yifan Liu, Zhiyuan Min, Zhenwei Wang, Junta Wu, Tengfei Wang, Yixuan Yuan, Yawei Luo, Chunchao Guo

机构 * Zhejiang University(浙江大学) Chinese University of Hong Kong(香港中文大学) Tencent Hunyuan(腾讯混元)

专题命中 效率与部署 :prompting(title)

AI总结 本研究提出WorldMirror这一统一前馈模型,可整合多种几何先验并生成多种三维表示,在多类三维几何任务的基准测试中达到最优性能且推理效率高。

Comments Accepted to ICML 2026. Code: https://github.com/Tencent-Hunyuan/HunyuanWorld-Mirror Project page: https://3d-models.hunyuan.tencent.com/world/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12571 2026-06-12 cs.CV 版本更新 71%

Measurement Plasticity: Sensor-Level Adaptation for Vision-Language Models

测量塑性:面向视觉-语言模型的传感器级自适应

Boyeong Im, Wooseok Lee, Yoojin Kwon, Hyung-Sin Kim

机构 * University of Seoul(首尔大学)

专题命中 效率与部署 :language model(title)

AI总结 提出多视角物理提示(MVP)用于测试时自适应,通过将相机曝光三角(ISO、快门速度、光圈)作为物理提示,在传感器层面进行自适应,无需梯度或模型修改,在ImageNet-ES上优于数字方法。

Comments Accepted to the ICML 2026 Workshop on Continual Adaptation at Scale

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23740 2026-08-24 cs.CL 版本更新 70%

ZenGen: Social Mind for LLMs

Zing:大语言模型的社交智能

ZenGen Team, Ao Xiang, Bi Jingping, Chen Jiahui, Chen Lehan, Chen Yilin, Cheng Xueqi, Fan Yixing, Gan Kairong, Gao Haowen, Gao Jinhua, Gao Shuxuan, Gong Chang, Guo Jiafeng, Guo Ruijie, Han Zhouyu, He Guangfu, He Yichun, Jiang Shuo, Jing Shaoling, Jing Ya, Lei Chenhao, Lei Yan, Li Anqi, Li Chengao, Li Haoyu, Li Shitian, Liang Xinjian, Liu Zhaoge, Lyu Xingyu, Nie Zhuwei, Pang Liang, Quan Zeping, Shan Shiguang, Shen Huawei, Tang Xinran, Tian Feng, Wang Qian, Wang Ruiping, Wang Xiaohong, Xia Zaiyu, Xiao Yi, Xu Jiayuan, Xu Kehan, Xu Qianqian, Xu Tianyu, Xu Yongjun, Yang Haoming, Yang Jun, Yao Di, Yu Xiaoming, Zhang Futong, Zhang Jie, Zhang Shixuan, Zhang Yuxuan, Zhao Xinyu, Zhao Zhuoran, Zhong Yunfei, Zhu Shengyu

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究大语言模型社交智能,提出Zijing框架,含测量基准SoMBench、训练方法Zing及推理架构Actio,通过实验证明社交智能大语言模型在评估、内化和落地方面需协同发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00424 2026-08-24 cs.AI 版本更新 70%

Weak Critics Make Strong Learners: On-Policy Critique Distillation for Scalable Oversight

弱批评者造就强学习者:用于可扩展监督的在策略批评蒸馏

Can Jin, Jiakang Li, Rui Wu, Eddy Z. Zhang, Dimitris N. Metaxas

机构 * University of Cambridge(剑桥大学) University of California, Berkeley(加州大学伯克利分校) UC Berkeley AI Lab(加州大学伯克利分校人工智能实验室)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出在策略批评蒸馏(OPCD)方法,利用弱模型作为批评者提供修订方向,通过自适应自教师信号蒸馏批评引导的行为,提升强模型在推理和对齐基准上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15018 2026-08-20 cs.AI 版本更新 70%

S2-MoE: Enabling Efficient Self-Speculative Decoding for Mixture-of-Experts on Edge Devices

S2-MoE:在边缘设备上实现混合专家模型的高效自推测解码

Haochen Huang, Shengxuan Qiu, Meng Li

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) School of Integrated Circuits, Peking University(北京大学集成电路学院) School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 S2-MoE是面向边缘设备MoE推理的高效自推测解码框架,通过路由感知自适应扩展、复用感知门控等设计,使MoE推理在边缘设备上最高获5.3倍加速,平均约2.0倍。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12745 2026-08-20 cs.LG cs.DC 版本更新 70%

A Cloud-Edge System for Multimodal Clinical Screening in Resource-Constrained Rural Settings

面向资源受限农村地区多模态临床筛查的云边协同系统

Hei Ting, Chan, Chenwei Wu, Xueshen Liu, Zesen Zhao, Boyuan Zheng, Luis Filipe Nakayama, Michael G. Morley, Liyue Shen, Jiasi Chen, Z. Morley Mao

机构 * University of Michigan(密歇根大学) Massachusetts Institute of Technology(麻省理工学院) Harvard Medical School(哈佛医学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 该研究针对资源受限农村地区的多模态临床筛查问题,提出云边协同架构,经实验验证其诊断性能优异且成本更低,可适配部署约束。

Comments 31 pages, 3 figures. In Proceedings of Machine Learning Research, Volume 340, 2026 (Machine Learning for Healthcare Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01832 2026-08-19 cs.CL 版本更新 70%

SCRIBES: Web-Scale Script-Based Semi-Structured Data Extraction with Reinforcement Learning

SCRIBES:基于脚本的网页级半结构化数据强化学习提取框架

Shicheng Liu, Kai Sun, Lisheng Fu, Xilun Chen, Xinyuan Zhang, Zhaojiang Lin, Rulin Shao, Yue Liu, Anuj Kumar, Wen-tau Yih, Xin Luna Dong

机构 * Stanford University(斯坦福大学) Meta Reality Labs(Meta现实实验室) FAIR at Meta(Meta的FAIR) University of Washington(华盛顿大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 SCRIBES是一种新型强化学习框架,利用同一网站内网页布局相似性生成可复用提取脚本,在脚本质量和下游问答准确率上均优于基线,实现高效网页级半结构化数据提取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12385 2026-08-18 cs.AI 版本更新 70%

Decode-Branch Transformers: Decoupling the Primary Prefill Path from Additional Decode Computation

双流式Transformer:将主预填路径与额外解码计算解耦

Liming Liu, Mingze Wang, Tuo Zhao

机构 * Georgia Institute of Technology(佐治亚理工学院) Peking University(北京大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出双流式Transformer,将主预填路径与额外解码计算解耦,通过共享权重与缓存降低推理成本,在多架构与数据配置下实现更低验证损失,且可灵活分配MoE专家预算。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01926 2026-08-18 cs.CL 版本更新 70%

Mitigating Bias in Locally Constrained Decoding via Tractable Proposals

通过可处理提议缓解局部约束解码中的偏差

Meihua Dang, Linxin Song, Honghua Zhang, Jieyu Zhao, Guy Van den Broeck, Stefano Ermon

机构 * Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对局部约束解码中因短视掩码导致的采样偏差,提出基于张量化有限自动机的全局约束解码提议和概率全局约束解码提议,结合序贯蒙特卡洛方法实现无偏采样,在函数调用、关键词生成和SQL生成任务中显著减少所需粒子数并加速收敛。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03897 2026-08-18 cs.LG stat.ME stat.ML 版本更新 70%

Leveraging Generative Artificial Intelligence for Causal Inference with Unstructured Data

生成式人工智能驱动的推断

Kosuke Imai, Kentaro Nakamura

机构 * Harvard University(哈佛大学) John F. Kennedy School of Government(约翰·F·肯尼迪政府学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究人员提出GPI统计框架,利用开源GenAI模型提取非结构化数据的低维表示,无需微调生成模型,通过三个应用验证其可用于因果与预测推断,开源软件包可实现该框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28642 2026-08-17 cs.AI 版本更新 70%

Parameter- and Bandwidth-Efficient Edge--cloud Many-to-Many Speech-to-Text Translation

带宽高效且隐私保护的边缘-云多对多语音翻译

Yexing Du, Kaiyuan Liu, Youcheng Pan, Bo Yang, Lei Chen, Ming Liu, Bing Qin, Yang Xiang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出边缘-云协同框架ESRT,通过分割推理架构压缩中间特征实现带宽降低10倍和语音隐私保护,并采用多任务加权课程学习策略实现45种语言的多对多语音翻译。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25194 2026-08-17 cs.LG 版本更新 70%

Localization then Neutralization: Gradient-guided Token Suppression against Visual Prompt Injection Attack

先定位再中和:梯度引导的令牌抑制对抗视觉提示注入攻击

Dongpeng Zhang, Ke Ma, Yangbangyan Jiang, Gaozheng Pei, Longtao Huang, Qianqian Xu, Qingming Huang

机构 * School of Advanced Interdisciplinary Sciences, UCAS(UCAS交叉学科研究院) School of Electronic, Electrical and Communication Engineering, UCAS(UCAS电子电气与通信工程学院) State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室) Alibaba Group(阿里巴巴集团) School of Computer Science and Technology, UCAS(UCAS计算机科学与技术学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Key Laboratory of Big Data Mining and Knowledge Management, UCAS(UCAS大数据挖掘与知识管理重点实验室)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对多模态大语言模型的视觉提示注入攻击,提出梯度令牌掩码(GTM)方法,通过梯度分析定位关键图像令牌并掩码中和,将攻击成功率降至接近零且计算开销极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09430 2026-08-17 cs.RO cs.AI 版本更新 70%

AtomBridge: Agentic VLA Inference Plugin for Long-Horizon Tasks in Scientific Experiments

Sci-VLA:用于科学实验中长周期任务的代理VLA推理插件

Yiwen Pang, Bo Zhou, Changjin Li, Xuanhao Wang, Shengxiang Xu, Deng-Bao Wang, Peng Cheng, Shimin Di, Jingkuan Song, Min-Ling Zhang

机构 * School of Computer Science and Engineering & School of Software Engineering & School of Artificial Intelligence, Southeast University, Nanjing, China(计算机科学与工程学院、软件工程学院、人工智能学院,东南大学,南京,中国) Pattern Learning and Mining Lab, Southeast University, Nanjing, China(模式学习与挖掘实验室,东南大学,南京,中国)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出了一种基于大语言模型的代理VLA推理插件,用于提升科学实验中长周期任务的执行效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00573 2026-08-13 cs.NI cs.CL 版本更新 70%

TrimMoE A communication aware and adaptive depth framework for distributed edge inference

TrimMoE:面向分布式边缘推理的通信感知自适应深度框架

Ning Li, Shuting Bai, Xin Yuan, Wenchao Xu, Song Guo, Haijun Zhang

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 TrimMoE是一种面向分布式边缘MoE大模型推理的通信感知自适应深度框架,通过层跳跃、提前退出等技术,在保证任务质量退化不超2%的前提下,将平均延迟降低最多62.8%,减少跨服务器流量与远程执行比例并提升吞吐量。

Comments 17 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏