arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 13234 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 2232 篇

2608.15410 2026-08-18 cs.DC cs.AI cs.CV cs.RO cs.SY eess.SY 新提交 57%

FloodReasonBench: Benchmarking VLM Reasoning Segmentation for Embodied Flood Response at the Edge

FloodReasonBench:面向边缘端具身洪水响应的VLM推理分割基准

Rajat Bhattacharjya, Yoomee Jung, Minwoo Kim, Sing-Yao Wu, Eli Bozorgzadeh, Nalini Venkatasubramanian, Nikil Dutt

机构 * University of California, Irvine(加州大学欧文分校) Kookmin University(国民大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 FloodReasonBench针对边缘端具身洪水响应,构建专用数据集并刻画推理分割流水线的性能权衡,为资源受限场景提供任务与系统层面的基准支持。

Comments Paper is currently under review. The code and dataset will be made public upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15383 2026-08-18 cs.LG 新提交 57%

Every Expert Counts: ExactMoE for Memory-Efficient W4A16 Inference

每个专家都重要:用于内存高效W4A16推理的ExactMoE

Amjad Saab

机构 * Appendture(阿彭彻(Appendture))

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 ExactMoE仅量化路由专家并结合缓存与融合内核,大幅降低MoE模型推理的GPU内存占用,同时保留高吞吐量与准确率,达成内存效率与性能的良好平衡。

Comments 12 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15080 2026-08-18 cs.CL 新提交 57%

A Pilot Study of Autocompleting Tokenizers

自动补全分词器的试点研究

Samuel Wexler, Mark Hopkins

机构 * Williams College(威廉姆斯学院)

专题命中 效率与部署 :language model(abstract);分类 cs.CL

AI总结 该研究受自动补全书写系统启发,提出用轻量级自回归字节语言模型压缩Transformer输入的方案,在多语言机器翻译任务上验证其可减少序列长度且不降低翻译质量,适用于不同书写系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13793 2026-08-17 stat.ML cs.LG stat.ME 新提交 57%

On the Brittleness of Maximum Likelihood Estimation for Gaussian Process Hyperparameter Optimization

高斯过程超参数优化的最大似然估计的脆弱性

Tyler R. Johnson, Kian Ben-Jacob, Christopher P. Muller, Ramin Bostanabad

机构 * University of California, Irvine(加州大学欧文分校)

专题命中 效率与部署 :foundation model(abstract);分类 cs.LG

AI总结 本文针对高斯过程超参数优化场景,评估最大似然估计的脆弱性,提出实用解决方案,其在贝叶斯优化等任务中有效,构建的高斯过程可在多方面超越表格基础模型。

Comments 26 pages, 10 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14379 2026-08-17 cs.RO cs.AI 新提交 57%

Reflex: Enabling Fast and Predictive Vision-Language-Action Models for Reaction-Critical Manipulation

Reflex:面向反应关键型操作的快速且可预测的视觉-语言-动作模型

Yuxuan Chen, Wanruo Zhang, Xiao Li

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :pretraining(abstract);分类 cs.AI

AI总结 针对现有VLA模型忽略动态交互场景的问题,提出面向反应关键型操作的ReflexBench基准与无需大规模机器人数据预训练的ReflexVLA模型,其可提升动态操作性能并保持静态操作精度。

Comments 8 pages, 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14149 2026-08-17 cs.AI cs.CR 新提交 57%

QuaSAR: Quantization Compensation via Stable Activation-Aware Rank Truncation

QuaSAR: 基于稳定激活感知秩截断的量化补偿

Lin-Fa Lee, Yi-Yu Chang, Kuo-Hei Yeh

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 效率与部署 :post-training(abstract);分类 cs.AI

AI总结 本文针对低比特量化后训练方法中门控机制误删可补偿层的问题,提出无参数截断伪逆求解器,在ViT-B模型上实现了优于现有方法的精度,且在模型规模与精度间取得良好平衡。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13524 2026-08-14 cs.LG 新提交 57%

DARTree: Speculative Diffusion Decoding with Autoregressive Draft Trees

DARTree:基于自回归草稿树的推测式扩散解码

Tianyi Li, Yaxin Luo, Xinyi Shang, Zhiqiang Shen

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 DARTree是无需训练的推测式解码方法,将AR修正头从链扩展至树,在7个数学、代码、聊天基准的4种模型-温度配置下,实现最高平均接受长度与加速比,达9.73倍无损加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13293 2026-08-14 cs.AI 新提交 57%

NAS-Driven Hardware Accelerator Exploration for Edge AI and Quantization Effects on the Pareto Space

面向边缘AI的NAS驱动硬件加速器探索及量化对帕累托空间的影响

Eleftherios Mylonas, Angelos Kouprizas, Michael Birbas, Alexios Birbas

机构 * University of Patras(帕特雷大学)

专题命中 效率与部署 :post-training(abstract);分类 cs.AI

AI总结 本文针对边缘AI部署需求,提出结合NAS、量化与可重构加速器探索的三阶段流水线,实证分析INT4 PTQ对NAS帕累托空间的影响,发现FP32零样本代理覆盖度更优。

Comments 6 pages, 6 figures, accepted for presentation to the 39th IEEE International System-on-Chip Conference, Heidelberg, Germany, September 30 - October 2, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13226 2026-08-14 cs.CV cs.AI 新提交 57%

CoverPrune: Coverage-Driven Token Pruning for 3D VLMs via Optimal Transport

CoverPrune:基于最优传输的3D视觉语言模型的覆盖驱动型令牌剪枝

Peng Ling, Yingda Yin, Lingting Zhu, Weikai Chen, Shengju Qian, Zeyu Hu, Xin Wang, Wenming Yang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) LIGHTSPEED

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 针对3D VLMs因大量视觉令牌导致的计算瓶颈,提出CoverPrune框架,将剪枝转化为最优传输问题,结合FST成本与SGS算法,实现高效剪枝且性能优异。

Comments Accepted to ECCV 2026 as an Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12989 2026-08-14 cs.LG 新提交 57%

Balanced Adaptive Prototype Selection for Scalable TabPFN Inference on Large-Scale Tabular Data

面向大规模表格数据的可扩展TabPFN推理的平衡自适应原型选择

Mahboobe Jadid, Melika Rezaye Garkani, Ali Mousavi

机构 * Islamic Azad University(伊斯兰阿扎德大学)

专题命中 效率与部署 :foundation model(abstract);分类 cs.LG

AI总结 本文提出BAPS框架,无需修改预训练TabPFN模型,可将百万级表格数据集的上下文压缩约1953倍,用512个原型保留预测性能,实现其在大规模表格数据上的可扩展推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12611 2026-08-14 cs.CV cs.LG 新提交 57%

From Visual Widgets to UI Code: Efficient Tool-Grounded Generation

从视觉控件到UI代码:高效的基于工具的生成

Houston H. Zhang, Tao Zhang, Li Gu, Linfeng Ye, Yuanhao Yu, Xinxin Zuo, Yang Wang, Zhixiang Chi

机构 * McMaster University(麦克马斯特大学) University of Toronto(多伦多大学) Concordia University(康考迪亚大学)

专题命中 效率与部署 :prompting(abstract);分类 cs.LG

AI总结 本研究提出轻量级工具框架WidgetGen,在6个多模态模型和1000个控件上,其视觉重建指标优于直接提示和Widget2Code,且重建的图像-代码对可提升Qwen系列模型性能

Comments ECCV2026 (MUCG Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11605 2026-08-13 cs.AI 新提交 57%

Foresight Without Seeing: Latent Futures for World Action Models

无视觉前瞻:面向世界动作模型的潜在未来

Jiakai Huang, Zhongbo Wu, Zheng Zhang, Zihan Wang, Shan You, Tao Huang

机构 * Shanghai Jiao Tong University(上海交通大学) ACE Robotics(ACE机器人公司) Nanyang Technological University(南洋理工大学)

专题命中 效率与部署 :pretraining(abstract);分类 cs.AI

AI总结 本文提出ForeWAM,一种动力学条件下的直接策略WAM,通过Future-KV和动力学寄存器在无需显式生成未来视频的情况下,使直接策略WAMs兼具高效动作预测与预测动力学暴露能力,在LIBERO和LIBERO-Plus上取得高成功率。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11204 2026-08-12 cs.RO cs.AI cs.CV 新提交 57%

Surgical WAM: A World-Action Model for Data-Efficient Surgical Robot Learning

Surgical WAM:面向数据高效型手术机器人学习的世界-动作模型

Wenrui Bao, Tianyun Jiang, Zhiben Chen, Ser-Nam Lim, Peter D. Peng, Yuzhang Shang

专题命中 效率与部署 :pretraining(abstract);分类 cs.AI

AI总结 本文提出Surgical WAM模型,通过无动作视频预训练结合带动作标注数据微调,在四项模拟手术操纵任务中将平均成功率从63.5%提至77.8%,为数据高效的手术机器人学习提供了可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10775 2026-08-12 cs.AI 新提交 57%

SkillLens: Visual Skill Cards for Retrieval-Augmented GUI Action Prediction and On-Policy Distillation

SkillLens:用于检索增强型GUI动作预测与在线策略蒸馏的可视化技能卡片

Zhou Liu, Ligang Huang, Zeli Su, Zewei Pan, Zhaoyang Han, Xing Chen, Yuanfeng Song, Wentao Zhang

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 SkillLens提出可视化技能卡片(VSCs),结合轨迹转卡片方法与检索增强机制,在两个多模态网页基准上提升了冻结GPT-5.4-mini执行器及Qwen3-VL-2B学生模型的GUI动作预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10360 2026-08-12 cs.HC cs.AI eess.AS 新提交 57%

MazzikaAI: A knowledge-based performance-to-prompt compiler for real-time Arabic maqam accompaniment with a streaming text-to-music model

MazzikaAI:一种基于知识的性能到提示编译器,用于结合流式文本到音乐模型的实时阿拉伯maqam伴奏

Jiaxin Du, Boulbaba Abdeljaouad, Yong Zhuang, Haoyu Li

机构 * Grand Valley State University(大峡谷州立大学)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI

AI总结 本文提出基于知识的MazzikaAI系统,通过编译实时输入生成文本提示,引导未微调的Google Lyria RealTime实现实时阿拉伯maqam伴奏,可精准控制微分音生成,为文化包容性生成音频提供了可扩展范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09176 2026-08-11 cs.CV cs.AI 新提交 57%

Not All Visual Tokens Are Equally Safe to Remove:Consequence-Sensitive Visual Token Compression

并非所有视觉 token 都可安全移除:后果敏感型视觉 token 压缩

Jingbo Wen, Liang He, Mingyu Cao, Haoyu Wang, Minxuan Hu, Kangning Cui, Xilu Wang

机构 * The University of Sydney(悉尼大学) Tongji University(同济大学) University of Surrey(萨里大学) Nankai University(南开大学) Cornell University(康奈尔大学) City University of Hong Kong(香港城市大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 该研究针对视觉语言模型提出后果敏感型视觉 token 压缩方法,可在相同总 token 预算下降低高风险错误,还能减少代价加权错误并降低延迟,泛化性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08961 2026-08-11 cs.LG 新提交 57%

Gradient Under Microscope: Benchmarking Resource Utilization of Memory-Efficient Gradient Computation Methods

显微镜下的梯度:对内存高效梯度计算方法的资源利用基准测试

Sarthak Mahapatra, Zihan Zhou, Khatoon Khedri, Mehdi Hosseinzadeh, Reza Rawassizadeh

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 该研究针对四种Transformer架构,测试五种梯度优化器在三种内存策略下的资源利用,发现梯度累积效果最优,Adam并非普遍最优,梯度检查点效果依赖架构,为模型训练部署提供实用指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08627 2026-08-11 cs.AI 新提交 57%

UniMoMo: Expert Merging-Based MoE Acceleration for Large Recommendation Models

UniMoMo:基于专家合并的大推荐模型混合专家(MoE)加速方法

Lei Xin, Bin Gu, Peize Li, Zitong Wang, Jianbo Zhao, Changjiang Jiang, Yanyue Xie, Chao Huang, Xuyang Zhao, Zunhai Su, Fanhu Zeng, Zhenglun Kong

机构 * Kuaishou Technology(快手科技) Hohai University(河海大学) Wuhan University(武汉大学) ByteDance, Seed(字节跳动 Seed) Alibaba, Ant Group(阿里巴巴蚂蚁集团) ByteDance, Douyin(字节跳动抖音) The University of Hong Kong(香港大学) Harvard University(哈佛大学)

专题命中 效率与部署 :post-training(abstract);分类 cs.AI

AI总结 UniMoMo是一种后训练压缩框架,通过功能相似性合并MoE专家并引入层自适应保护,在Amazon Beauty等三个数据集上实现推荐MoE的高效压缩与加速,且性能损失极小。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07727 2026-08-11 cs.CL 新提交 57%

Evaluating Dedicated Monolingual and Joint Multilingual Causal Models for Dravidian Languages

评价达罗毗荼语的专用单语与联合多语因果模型

Venkata Naga Sai Vishnu Rohit Pulipaka

专题命中 效率与部署 :language model(abstract);分类 cs.CL

AI总结 本文训练5个GPT-2架构模型对比达罗毗荼语的单语与多语模型,发现单语模型在情感分类等任务上优于mGPT,分词器效率也更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06916 2026-08-10 cs.LG 新提交 57%

MiCoPro: End-to-End Mixed Precision HW/SW Co-design with HW-aware Proxy Model

MiCoPro:面向硬件感知代理模型的端到端混合精度硬件/软件协同设计

Zijun Jiang, Yangdi Lyu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 效率与部署 :post-training(abstract);分类 cs.LG

AI总结 MiCoPro是面向边缘AI的混合精度硬件/软件协同设计框架,通过硬件感知代理模型实现延迟约束下的最优量化配置,在两类硬件上达成最高40%延迟降低、精度下降不足3%的效果。

Comments 14 pages, 9 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06880 2026-08-10 cs.LG 新提交 57%

SkillAligner: Treating Retrieved Skills as Adaptable Drafts at Execution Time

SkillAligner:在执行时将检索到的技能视为可调整的草稿

Qinfeng Li, Dalin He, Yuntai Bao, Ying Yang, Ruoxi Chen, Xinyan Yu, Lizhou Liang, Ge Su, Wenqi Zhang, Xuhong Zhang

机构 * Zhejiang University(浙江大学)

专题命中 效率与部署 :language agent(abstract);分类 cs.LG

AI总结 SkillAligner是无训练的执行时技能适配框架,将检索技能视为可调整草稿,经联合适配整合为执行指南,在多基准实验中提升任务性能、降低退化与推理成本。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06612 2026-08-10 cs.CV cs.AI 新提交 57%

SLED: Scalable Location Encoding via Distillation

SLED:通过知识蒸馏实现可扩展位置编码

Kevin Lane, Zhongying Wang, Esther Rolf, Morteza Karimzadeh

专题命中 效率与部署 :pretraining(abstract);分类 cs.AI

AI总结 针对现有位置编码器计算成本高、扩展性差等问题,提出基于蒸馏的SLED,可灵活融入多模态地理空间数据,在19项基准任务上性能优于或媲美现有模型,大幅降低预训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06177 2026-08-07 cs.LG cs.NE 新提交 57%

Threshold-Based Early Stopping of Accumulations in Neural Networks with Binary Activation

基于阈值的二值激活神经网络累积量早停机制

Quentin Luquet de Saint-Germain, Massil Ait Abdeslam, Jean Pierre David

专题命中 效率与部署 :post-training(abstract);分类 cs.LG

AI总结 本文提出一种训练后早停机制,通过预测二值神经网络累积量的最终符号,可减少VGG11在CIFAR-10上的运算量,仅造成小幅准确率下降。

Comments 9 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05778 2026-08-07 cs.AI 新提交 57%

When Do Prompt-Side Agent Playbooks Transfer? Accuracy, Cost, and Runtime Shift in Agent Deployment

提示侧智能体剧本何时可迁移?智能体部署中的准确性、成本与运行时偏移

Weihong Lin, Lin Sun, Xiangzheng Zhang

机构 * Beijing Qiyuan Technology Co., Ltd.(北京奇源科技有限公司)

专题命中 效率与部署 :language agent(abstract);分类 cs.AI

AI总结 该研究在蒸馏-验证-迁移协议下探究提示侧智能体剧本的可迁移性,在ALFWorld、TAU2-Bench、XBench-DeepSearch等基准上测试发现其为有条件的冷启动选项,需目标侧验证相关指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06107 2026-08-07 cs.LG cs.NA math.NA 新提交 57%

Kastor: An efficient fine-tuning strategy for generative emulation of PDE simulations

Kastor:一种用于生成式模拟偏微分方程(PDE)仿真的高效微调策略

Guillaume Couairon, Alexis Jacq, Yu-Han Wu, Renu Singh, Yana Hasson, Quentin Berthet, Romuald Elie

专题命中 效率与部署 :foundation model(abstract);分类 cs.LG

AI总结 本研究提出Kastor微调策略,通过两阶段推理、均值预测正则化等方法改进物理基础模型,在The Well数据集上实现比Walrus更优的PDE仿真性能,降低预测误差并提升效率。

Comments 34 pages, 32 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04502 2026-08-06 cs.DC cs.AI 新提交 57%

AFD-Ledger: Deployment Provisioning for Attention--FFN Disaggregation

AFD-Ledger:注意力-前馈网络(FFN)拆分的部署配置

Chengyu Qiu, Xiao Fu, Fengcun Li, Yulei Qian, Yuchen Xie, Xunliang Cai, Yingdi Shan, Yongwei Wu, Mingxing Zhang

机构 * Tsinghua University(清华大学) Meituan(美团)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 AFD-Ledger是离线分析配置系统,可优化AFD与同置部署的硬件分配,减少部署评估量,预测吞吐量偏差小,揭示同构/异构AFD及角色硬件改进的部署规律。

Comments 14 pages, 14 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03319 2026-08-05 eess.SP cs.LG 新提交 57%

Task-Oriented Candidate-Latent Feedback for Coarse-to-Fine Sensing in Distributed OFDM-ISAC Networks

面向任务的候选隐变量反馈:分布式OFDM-ISAC网络中的粗到细感知

Shiv Shankar, Radha Krishna Ganti, J Klutto Milleth

机构 * Indian Institute of Technology (IIT), Madras(印度马德拉斯理工学院) Centre of Excellence in Wireless Technology (CEWiT)(无线技术卓越中心)

专题命中 效率与部署 :post-training(abstract);分类 cs.LG

AI总结 该研究针对分布式OFDM-ISAC网络的SE-SF接口,提出基于学习的粗到细感知流水线与候选隐变量反馈方法,实现高检测率与低传输速率,且跨场景泛化性能良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03920 2026-08-05 cs.SD cs.AI 新提交 57%

Equivariant Music Transformer

等变音乐Transformer

Zixun Guo, Simon Dixon

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 针对标准音乐Transformer等变性不足的问题,提出EMT模型,通过自蒸馏联合优化预测与等变正则化损失,在等变性和生成能力上优于现有方法。

Journal ref ISMIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03918 2026-08-05 cs.CV cs.AI 新提交 57%

When and Where to Look: Adaptive Visual Evidence Scheduling for Efficient Long Video Understanding

何时与何地查看:用于高效长视频理解的自适应视觉证据调度

Ke Li, Jiayu Chen, Maoliang Li, Zihao Zheng, Hailong Zou, Hengyi Zhang, Xuanzhe Liu, Xiang Chen

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 提出无需训练的EcoFrame框架,通过熵门控预算调度和注意力引导候选提议实现高效视觉证据调度,在多个长视频理解基准上实现精度与效率的更优权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02674 2026-08-05 cs.CR cs.AI 新提交 57%

Moving the Safety Barrier: Dynamic Routing Adaptive Alignment Against White-Box Attacks

移动安全屏障:针对白盒攻击的动态路由自适应对齐

Shangze Li, Chuancheng Shi, Simiao Xie, Lingzhi He, Cheng Ji, Zifeng Cheng, Fei Shen, Chao Wu, Tat-Seng Chua

机构 * Nanjing University of Science and Technology(南京理工大学) The University of Sydney(悉尼大学) National University of Singapore(新加坡国立大学) University of New South Wales(新南威尔士大学) Nanjing University(南京大学)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI

AI总结 针对大型基础模型易受路由级白盒攻击的问题,提出动态路由自适应对齐框架,通过引入动态补偿路由提升模型安全稳健性且保留通用实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏