arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1111 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1111 篇

2602.09611 2026-07-29 cs.CV cs.AI cs.CR 版本更新 79%

AGMark: Attention-Guided Dynamic Watermarking for Large Vision-Language Models

AGMark:基于注意力的动态水印技术用于大视觉-语言模型

Yue Li, Xin Yi, Dongsheng Shi, Yongyi Cui, Gerard de Melo, Linlin Wang

机构 * East China Normal University(华东师范大学) Hasso Plattner Institute(哈索普拉特纳研究所) University of Potsdam(波茨坦大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 AGMark通过动态注意力机制提升大视觉-语言模型的水印可靠性,实现高质量生成和强视觉语义保真度。

Comments KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18218 2026-07-24 cs.CV cs.AI 版本更新 79%

GigaPath-Flash and GigaTIME-Flash: Efficient Pathology Foundation Models for Whole-Slide and Tumor Microenvironment Analysis

GigaPath-Flash和GigaTIME-Flash:用于全切片和肿瘤微环境分析的高效病理学基础模型

Naoto Usuyama, Jeya Maria Jose Valanarasu, Sicong Yao, Hanwen Xu, Jaspreet Bagga, Guanghui Qin, Robert E. Kramer, Cliff Wong, Soohee Lee, Hao Qiu, Theodore Zhengde Zhao, Racheli Ben Shimol, Angela Crabtree, Kevin Matlock, Eduardo Alejandro Lozano Garcia, Naiteek Sangani, Alberto Santamaria-Pang, Maximilian Rokuss, Yashna Hasija, Naisargi Manishkumar Patel, Jason Entenmann, Alexandra Q. Bartlett, Bill J. Wright, Bernard A. Fox, Brian Piening, Sheng Zhang, Sheng Wang, Tristan Naumann, Carlo Bifulco, Hoifung Poon

机构 * Microsoft Research(微软研究院) Paul G. Allen School of Computer Science and Engineering, University of Washington(华盛顿大学保罗·G·艾伦计算机科学与工程学院) Providence Genomics(普罗维登斯基因组学公司) Earle A. Chiles Research Institute, Providence Cancer Institute(普罗维登斯癌症研究所厄尔·A·奇尔斯研究所) Providence Research Network(普罗维登斯研究网络)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI

AI总结 研究针对计算病理学中模型局限,提出GigaPath-Flash和GigaTIME-Flash模型用于全切片和肿瘤微环境分析。前者结合特定编码器,计算量少性能优;后者扩展架构预测肿瘤免疫微环境,速度快内存省,共同为相关领域提供开放许可模型及权重。

Comments Models: https://aka.ms/gigapath-flash (GigaPath-Flash) and https://aka.ms/gigatime-flash (GigaTIME-Flash)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14751 2026-07-22 cs.LG 版本更新 79%

HERAKLES: Hierarchical Skill Compilation for Open-ended LLM Agents

HERAKLES:用于开放式语言模型智能体的分层技能编译

Thomas Carta, Clément Romac, Loris Gaven, Pierre-Yves Oudeyer, Olivier Sigaud, Sylvain Lamprier

机构 * Inria(Flowers)(Inria) University of Bordeaux(波尔多大学) Sorbonne Université (ISIR)(索邦大学) Univ Angers (LERIA) SFR MATHSTIC(昂格斯大学)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.LG

AI总结 研究部分可观测、稀疏奖励且目标空间大的环境中目标条件强化学习,提出HERAKLES分层智能体,联合学习高级语言模型策略与低级控制器,通过同时训练实现可扩展技能组合,提升开放式组合环境下的效率和适应性。

Comments 42 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14119 2026-07-21 cs.CL 版本更新 79%

Semantic Register Compression in Multi-Agent LLM Cascades

多智能体大语言模型级联中的语义寄存器压缩

Manuele Tele Junior Fernandez

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL

AI总结 研究多智能体大语言模型级联中的语义寄存器压缩现象,用三智能体管道量化压缩,通过五个架构变体分析驱动因素,发现压缩在不同领域强度不同且可泛化,提示级回归可解释大部分方差,对高风险领域安全评估有意义。

Comments 16 pages, 2 figures, 4 tables. Revised version with corrected English-prompt experiments and updated cross-domain and prompt-gradient results

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20730 2026-07-21 cs.LG 版本更新 79%

Rethinking Efficiency in Neural Combinatorial Optimization: Batched Preference Optimization with Mamba

重新思考神经组合优化中的效率:基于Mamba的批量偏好优化

Zhenxing Xu, Zeyuan Ma, Weidong Bao, Yan Zheng, Chongshuang Hu, Ji Wang, Zhiguang Cao

机构 * National Key Laboratory of Big Data and Decision, National University of Defense Technology(大数据与决策国家重点实验室,国防科技大学) School of Computer Science, South China University of Technology(华南理工大学计算机科学学院) School of Computing and Information Systems, Singapore Management University(新加坡管理学院计算机与信息系统学院)

专题命中 效率与部署 :preference optimization(title,abstract);分类 cs.LG

AI总结 本文提出ECO框架,通过分阶段的监督预热和批量偏好优化,提升神经组合优化的效率,实现更优的内存使用和吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02924 2026-07-21 cs.CL 版本更新 79%

AutoNeural: Co-Designing Vision-Language Models for NPU Inference

AutoNeural:为 NPU 推理协同设计视觉语言模型

Wei Chen, Liangmin Wu, Yunhai Hu, Zhiyuan Li, Zhiyuan Cheng, Yicheng Qian, Lingyue Zhu, Zhipeng Hu, Luoyi Liang, Qiang Tang, Zhen Liu, Han Yang

机构 * Nexa AI Geely Auto

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL

AI总结 研究针对 NPU 推理的视觉语言模型硬件与模型不匹配问题,提出 AutoNeural 架构,用深度可分离卷积骨干替换 ViT 编码器,结合状态空间模型与 Transformer 层,提升效率,降低量化误差与延迟,验证了在实际应用中的实时性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15518 2026-07-21 cs.CL 版本更新 79%

Squid: Long Context as a New Modality for Energy-Efficient On-Device Language Models

Squid:长上下文作为节能设备端语言模型的新模态

Wei Chen, Zhiyuan Li, Shuo Xin, Yihao Wang

机构 * Nexa AI

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL

AI总结 研究针对设备端语言模型处理长上下文能耗高、延迟大的问题,提出Dolphin架构,用紧凑解码器提炼上下文信息,结合图像嵌入投影仪编码长文本,经实证评估,该方法提升了能源效率,降低了延迟,为设备端语言模型发展做贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09776 2026-07-16 cs.RO cs.AI 版本更新 79%

HELP: Human-Efficient Large-Scale Robot Post-Training with Rollout Segmentation

通过 VLAC-Cut 引导的管道最大化大规模机器人训练后人类效率

Shaopeng Zhai, Qi Zhang, Tianyi Zhang, Haoran Zhang, Fuxian Huang, Zhanhui Lin, Zijun Xu, Weinan Zhang

机构 * Shanghai AI Lab(上海人工智能实验室)

专题命中 效率与部署 :post-training(title,abstract);分类 cs.AI

AI总结 研究旨在最大化机器人训练后人类效率,提出含专门分工的高效训练后管道,引入 VLAC-CUT 工具提高数据利用效率,经四个实际任务验证,最终策略成功率达 80% - 95%,吞吐量提升 1.7 倍至 4.2 倍,优于仅人工参与训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00927 2026-07-16 cs.CV cs.AI 版本更新 79%

Post-Training Pruning for Diffusion Transformers

扩散变换器的训练后剪枝

Chengzhi Hu, Xuewen Liu, Jing Zhang, Mengjuan Chen, Zhikai Li, Qingyi Gu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 效率与部署 :post-training(title,abstract);分类 cs.AI

AI总结 针对扩散变换器(DiTs)计算开销大的问题,提出DiT-Pruning方法,通过能量感知的显著性度量与聚类感知的剪枝粒度,在50%稀疏度下仅损失0.001 CLIP分数。

Comments 15 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15133 2026-07-14 cs.LG 版本更新 79%

Causal Foundation Models with Continuous Treatments

具有连续处理的因果基础模型

Christopher Stith, Medha Barath, Vahid Balazadeh, Jesse C. Cresswell, Rahul G. Krishnan

机构 * Layer 6 AI University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出首个连续处理因果基础模型,通过设计连续处理变量的数据生成先验,生成丰富因果训练语料,并利用Transformer重建个体治疗响应曲线,实现无需额外训练的因果效应预测。

Comments 21 pages, 9 figures; added link to inference code

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16514 2026-07-14 cs.CV cs.LG 版本更新 79%

BARD: Bridging AutoRegressive and Diffusion Vision-Language Models Via Highly Efficient Progressive Block Merging and Stage-Wise Distillation

BARD:通过高效渐进性块合并和分阶段蒸馏桥接自回归与扩散视觉-语言模型

Baoyou Chen, Hanchen Xia, Peng Tu, Haojun Shi, Liwei Zhang, Yuxuan Yao, Weihao Yuan, Siyu Zhu

机构 * Shanghai Academy of AI for Science(上海人工智能科学研究院) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Nanjing University(南京大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.LG

AI总结 BARD通过高效渐进块合并与分阶段蒸馏将预训练自回归视觉-语言模型转换为解码高效的扩散视觉-语言模型,实现在大块规模下性能恢复与解码效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11530 2026-07-10 cs.CV cs.AI 版本更新 79%

Beyond Attention Scores: SVD-Based Vision Token Pruning for Efficient Vision-Language Models

超越注意力分数:基于SVD的视觉令牌修剪用于高效视觉-语言模型

Yvon Apedo, Martyna Poreba, Michal Szczepanski, Samia Bouchafa

机构 * anoncvlab(匿名计算机视觉实验室)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 本文提出SVD-Prune方法,通过SVD分解视觉令牌特征矩阵并利用统计杠杆分数选择顶级令牌,以在极端视觉令牌预算下保持高性能,优于现有修剪方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29431 2026-07-08 cs.AI 版本更新 79%

FADE: Mitigating Hallucinations by Reducing Language-Prior Dominance in Large Vision-Language Models

FADE: 通过减少大型视觉语言模型中的语言先验主导性来缓解幻觉

Yichen Guo, Kai Tang, Fenglai Lin, Yiding Sun, Dongxu Zhang, Wenya Wang, Lin William Cong, Shanghang Zhang

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 本文通过分析信息流,发现FFN模块在关键层引入语言先验,主导视觉证据,导致幻觉;提出无需训练的FADE方法衰减FFN输出,有效缓解幻觉并保持推理效率。

Comments 18 pages, 5 figures, 27 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21637 2026-07-07 cs.CL cs.CY 版本更新 79%

Multilinguality at the Edge: Developing Language Models for the Global South

边缘侧多语言性:为全球南方开发语言模型

Lester James V. Miranda, Songbo Hu, Roi Reichart, Anna Korhonen

机构 * Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室) Technion – Israel Institute of Technology(技术学院——以色列理工学院)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL

AI总结 针对全球南方非英语、硬件受限社区的语言模型落地难题,调研232篇相关文献,梳理多语言与边缘部署交叉领域进展,提出面向NLP生态各方的可行建议。

Comments Updated formatting and improved spacing. Project website is in https://ljvmiranda921.github.io/multilinguality-at-the-edge/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01790 2026-07-07 cs.SD cs.AI 版本更新 79%

Shao: Scaling Acoustic Token Language Models Toward High-Fidelity Music Generation

Shao:将声学令牌语言模型扩展至高保真音乐生成

Jiafeng Liu, Yuanliang Dong, Hongjia Liu, Yuqing Cheng, Zhancheng Guo, Huijing Liang, Wenbo Zhan, Yuming Sun, Xiaobing Li, Feng Yu, Maosong Sun

机构 * Central Conservatory of Music(中央音乐学院) Tsinghua University(清华大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 该研究提出单一声学令牌层级内渐进建模音乐结构与保真度的框架,通过双阶段生成与混合注意力训练,无需异构空间即可实现高质量音乐生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07447 2026-07-07 cs.PF cs.AI 版本更新 79%

Saving GPU Hours in LLM Inference System Development and Online Workloads with Simulation and DBMS-Inspired Cache Replacement Policies

通过模拟和受数据库管理系统启发的缓存替换策略在大语言模型推理系统开发和在线工作负载中节省GPU时间

Kyoungmin Kim, Jiacheng Li, Kijae Hong, Qunyou Liu, Darong Huang, Anastasia Ailamaki

机构 * EPFL, Switzerland(苏黎世联邦理工学院) NUS, Singapore(新加坡国立大学) POSTECH, South Korea(POSTECH大学)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI

AI总结 研究大语言模型推理系统,通过模拟和受数据库管理系统启发的缓存替换策略,节省GPU时间,提出新缓存替换策略并证明其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18315 2026-07-03 cs.RO cs.AI cs.CV 版本更新 79%

DriveVLM-RL: Neuroscience-Inspired Reinforcement Learning with Vision-Language Models for Safe and Deployable Autonomous Driving

DriveVLM-RL:受神经科学启发的强化学习与视觉语言模型用于安全可部署的自动驾驶

Zilin Huang, Zihao Sheng, Zhengyang Wan, Yansong Qu, Junwei You, Sicong Jiang, Sikai Chen

机构 * Department of Civil and Environmental Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校土木与环境工程系) Lyles School of Civil and Construction Engineering, Purdue University(普渡大学莱尔斯土木与建设工程学院) Department of Civil Engineering, McGill University(麦吉尔大学土木工程系)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 提出DriveVLM-RL框架,通过双通路架构将VLM集成到RL中,实现安全可部署的自动驾驶,在CARLA中显著优于基线。

Comments 33 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00757 2026-06-29 cs.CV cs.AI 版本更新 79%

IWP: Token Pruning as Implicit Weight Pruning in Large Vision Language Models

IWP:大型视觉语言模型中的隐式权重剪枝与令牌剪枝

Dong-Jae Lee, Sunghyun Baek, Junmo Kim

机构 * KAIST(韩国科学技术院)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 提出基于注意力对偶形式的无训练令牌剪枝框架,通过度量令牌的信息量和冗余度,结合渐进式分块最大边际相关性选择子集,在保持性能的同时提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11625 2026-06-26 cs.CV cs.AI 版本更新 79%

MedPruner: Training-Free Hierarchical Token Pruning for Efficient 3D Medical Image Understanding in Vision-Language Models

MedPruner: 面向高效3D医学图像理解的免训练层次化令牌剪枝框架

Shengyuan Liu, Zanting Ye, Yunrui Lin, Chen Hu, Wanting Geng, Xu Han, Bulat Ibragimov, Yefeng Zheng, Yixuan Yuan

机构 * Chinese University of Hong Kong(香港中文大学) Westlake University(西湖大学) Southern Medical University(南方医科大学) Jiangnan University(江南大学) Dalian University of Technology(大连理工大学) Shanghai Jiao Tong University(上海交通大学) University of Copenhagen(哥本哈根大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 提出MedPruner,一种免训练、模型无关的层次化令牌剪枝框架,通过帧间锚点过滤和动态信息核选择,在保留不到5%视觉令牌时保持甚至提升模型性能,显著降低计算开销。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14972 2026-06-26 cs.LG 版本更新 79%

Use What You Know: Causal Foundation Models with Partial Graphs

利用已知信息:带有部分图结构的因果基础模型

Arik Reuter, Anish Dhir, Cristiana Diaconu, Jake Robertson, Ole Ossen, Frank Hutter, Adrian Weller, Mark van der Wilk, Bernhard Schölkopf

机构 * University of Cambridge(剑桥大学) Gatsby Computational Neuroscience Unit(加布特计算神经科学单位) Prior Labs(Prior实验室) University of Freiburg(弗赖堡大学) The Alan Turing Institute(艾伦·图灵研究所) University of Oxford(牛津大学)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 提出在因果基础模型中注入因果图或祖先信息的方法,利用图卷积编码器和注意力机制有效利用部分因果信息,使通用模型匹配专用模型性能。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31286 2026-06-17 cs.RO cs.AI 版本更新 79%

DeMaVLA: A Vision-Language-Action Foundation Model for Generalizable Deformable Manipulation

DeMaVLA:面向可泛化可变形物体操作的视觉-语言-动作基础模型

Taiyi Su, Jian Zhu, Tianjian Wang, Youzhang He, Zitai Huang, Jianjun Zhang, Chong Ma, Hanyang Wang, Tianjiao Zhang, Munan Yin, Weihao Ding, Yi Xu

机构 * Tongji University(同济大学)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI

AI总结 提出DeMaVLA模型,采用VLM骨干与动作专家结合流匹配生成连续动作,通过剪枝Transformer层提升效率,并利用大规模真实世界数据和人类反馈数据聚合训练,实现可变形物体折叠操作的多类别泛化。

Comments 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05014 2026-06-16 cs.CL 版本更新 79%

Depth-Attention: Cross-Layer Value Mixing for Language Models

深度注意力:语言模型的跨层值混合

Boyi Zeng, Yiqin Hao, Zitong Wang, Shixiang Song, He Li, Feichen Song, Yifan Liu, Ziwei He, Xinbing Wang, Zhouhan Lin

机构 * LUMIA Lab(LUMIA实验室) School of Artificial Intelligence(人工智能学院) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Sun Yat-sen University(中山大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 效率与部署 :language model(title);LLM(abstract_cn);分类 cs.CL

AI总结 提出深度注意力机制,在注意力模块内部实现跨层值混合,无需额外参数和推理状态,提升语言模型性能。

Comments 21 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20710 2026-06-16 cs.CV cs.AI cs.CR 版本更新 79%

Are Neuro-Inspired Multi-Modal Vision-Language Models Resilient to Membership Inference Privacy Leakage?

受神经启发的多模态视觉-语言模型对成员推断隐私泄露是否具有弹性?

David Amebley, Sayanton Dibbo

机构 * The University of Alabama(阿拉巴马大学) Alabama Center for the Advancement of AI(阿拉巴马人工智能 advancement 中心) Trustworthy AI Lab(可信人工智能实验室) Department of Computer Science, The University of Alabama(计算机科学系)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 研究受神经启发的多模态视觉-语言模型(VLM)对基于图像-文本的成员推断攻击的弹性,提出拓扑正则化框架,实验表明神经VLM在保持模型效用同时显著降低攻击成功率。

Comments Accepted at USENIX WOOT '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10743 2026-06-11 cs.LG 版本更新 79%

Kalman Linear Attention: Parallel Bayesian Filtering For Efficient Language Modelling and State Tracking

Kalman线性注意力:用于高效语言建模和状态跟踪的并行贝叶斯滤波

Vaisakh Shaj, Cameron Barker, Aidan Scannell, Andras Szecsenyi, Elliot J. Crowley, Amos Storkey

机构 * University of Cambridge(剑桥大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.LG

AI总结 提出Kalman线性注意力层,将序列混合重写为信息形式的精确贝叶斯滤波,实现时间并行推理,在相同计算成本下比GLA更具表达力,并在状态跟踪任务中超越线性SSM和注意力。

Comments Accepted at ICML 2026. An earlier version of this work was presented at the 1st Workshop on Epistemic Intelligence in Machine Learning (EIML) at EurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03933 2026-06-11 cs.CV cs.AI 版本更新 79%

Diffusion-based Cumulative Adversarial Purification for Vision Language Models

基于扩散的累积对抗净化方法用于视觉语言模型

Jia Fu, Yongtao Wu, Yihang Chen, Kunyu Peng, Xiao Zhang, Volkan Cevher, Sepideh Pashami, Anders Holst

机构 * KTH Royal Institute of Technology(皇家理工学院) Swiss Federal Institute of Technology Lausanne(洛桑联邦理工学院) University of California, Los Angeles(加州大学洛杉矶分校) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) CISPA Helmholtz Center for Information Security(信息安全赫尔姆霍兹中心) RISE Research Institutes of Sweden(瑞典RISE研究机构) Halmstad University(哈马碧大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 提出DiffCAP,一种基于扩散的对抗净化策略,通过理论证明对抗效应随扩散单调衰减,并利用噪声注入与VLM嵌入相似度阈值自适应净化,显著提升防御效果并加速去噪。

Comments Accepted to Transactions on Machine Learning Research (TMLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16349 2026-06-09 cs.CV cs.AI 版本更新 79%

Collaborative Edge-to-Server Inference for Vision-Language Models

面向视觉-语言模型的协作式边缘到服务器推理

Soochang Song, Yongjune Kim

机构 * Department of Electrical Engineering, Pohang University of Science and Technology (POSTECH)(电气工程系,波扬科学技术大学(POSTECH))

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 提出一种协作式边缘到服务器推理框架,通过两阶段选择性重传策略,在降低通信成本的同时保持视觉-语言模型的推理精度。

Comments 12 pages, 15 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20950 2026-06-08 cs.CV cs.AI 版本更新 79%

Focus-then-Context: Subject-Centric Progressive Visual Token Reduction for Vision-Language Models

聚焦-然后-上下文:面向视觉-语言模型的主体导向渐进视觉标记缩减

Yulin Zhao, Zheng Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳学院) ShenZhen Loop Area Institute(深圳河套学院)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 本文提出了一种主体导向的渐进视觉标记缩减方法SPpruner,通过模拟人类视觉感知系统的'聚焦-然后-上下文'机制,有效减少视觉标记数量,提升视觉-语言模型的推理效率,实验表明其在速度和资源消耗上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19436 2026-08-12 cs.CV cs.AI cs.LG cs.MM 版本更新 79%

VDC-Agent: When Video Detailed Captioners Evolve Themselves via Agentic Self-Reflection

VDC-Agent:当视频详细描述器通过代理自我反思而自我进化

Qiang Wang, Xinyuan Gao, Yuhang He, Jizhou Han, Jiangyang Li, SongLin Dong, Zhiheng Ma, Yihong Gong

机构 * Xi’an Jiaotong University(西安交通大学) Kuaishou Technology(快手科技) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 VDC-Agent通过自我反思机制实现视频详细描述的自我进化,利用自动生成的(描述,评分)对提升描述准确性与评分表现。

Comments Accepted to ECCV 2026. Project Page: https://vdcagent.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11505 2026-08-11 cs.LG cs.AI 版本更新 79%

Proxy OPD: On-Policy Distillation with Transferable Relative Proxy Update

代理探索与可重用引导:基于代理引导更新信号的模块化大语言模型训练后范式

Daocheng Fu, Rong Wu, Yu Yang, Jianbiao Mei, Licheng Wen, Pinlong Cai, Xuemeng Yang, Yong Liu, Botian Shi, Yu Qiao

专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型训练后优化信号耦合问题,提出PUST框架,通过代理模型探索、提取并传输相对改进信号,解耦更新信号探索与分布对齐,减少计算开销,支持异步处理与跨模型转移,提升训练后范式的模块化、可重用性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02047 2026-08-11 cs.CL cs.AI 版本更新 79%

Goose: Anisotropic Speculation Trees for Training-Free Speculative Decoding

Goose:用于无训练推测解码的各向异性推测树

Tao Jin, Phuong Minh Nguyen, Naoya Inoue

机构 * Japan Advanced Institute of Science and Technology (JAIST)(日本先端科学技术大学院大学)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Goose通过构建适应性脊柱树,利用高接受率的上下文匹配令牌和低接受率的替代分支,实现无训练推测解码的各向异性树结构,提升解码速度。

详情

展开后加载摘要…

URL PDF HTML 收藏