arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2049 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 2049 篇

2608.13293 2026-08-14 cs.AI 新提交 57%

NAS-Driven Hardware Accelerator Exploration for Edge AI and Quantization Effects on the Pareto Space

面向边缘AI的NAS驱动硬件加速器探索及量化对帕累托空间的影响

Eleftherios Mylonas, Angelos Kouprizas, Michael Birbas, Alexios Birbas

机构 * University of Patras(帕特雷大学)

专题命中 效率与部署 :post-training(abstract);分类 cs.AI

AI总结 本文针对边缘AI部署需求,提出结合NAS、量化与可重构加速器探索的三阶段流水线,实证分析INT4 PTQ对NAS帕累托空间的影响,发现FP32零样本代理覆盖度更优。

Comments 6 pages, 6 figures, accepted for presentation to the 39th IEEE International System-on-Chip Conference, Heidelberg, Germany, September 30 - October 2, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13226 2026-08-14 cs.CV cs.AI 新提交 57%

CoverPrune: Coverage-Driven Token Pruning for 3D VLMs via Optimal Transport

CoverPrune:基于最优传输的3D视觉语言模型的覆盖驱动型令牌剪枝

Peng Ling, Yingda Yin, Lingting Zhu, Weikai Chen, Shengju Qian, Zeyu Hu, Xin Wang, Wenming Yang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) LIGHTSPEED

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 针对3D VLMs因大量视觉令牌导致的计算瓶颈,提出CoverPrune框架,将剪枝转化为最优传输问题,结合FST成本与SGS算法,实现高效剪枝且性能优异。

Comments Accepted to ECCV 2026 as an Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12989 2026-08-14 cs.LG 新提交 57%

Balanced Adaptive Prototype Selection for Scalable TabPFN Inference on Large-Scale Tabular Data

面向大规模表格数据的可扩展TabPFN推理的平衡自适应原型选择

Mahboobe Jadid, Melika Rezaye Garkani, Ali Mousavi

机构 * Islamic Azad University(伊斯兰阿扎德大学)

专题命中 效率与部署 :foundation model(abstract);分类 cs.LG

AI总结 本文提出BAPS框架,无需修改预训练TabPFN模型,可将百万级表格数据集的上下文压缩约1953倍,用512个原型保留预测性能,实现其在大规模表格数据上的可扩展推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12925 2026-08-14 cs.LG 新提交 57%

Momentum as Residual-Driven Multiplier Correction for Deep Learning Optimization

深度学习优化中作为残差驱动乘子校正的动量

Zhixin Ren, Yau Lyu, Congrong Li, Liping Zhang, Shengbo Eben Li

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 本研究提出AIM框架将动量解释为残差驱动乘子校正,并基于此开发RADAR优化器,经多任务实验验证其性能优于现有强自适应优化器基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12611 2026-08-14 cs.CV cs.LG 新提交 57%

From Visual Widgets to UI Code: Efficient Tool-Grounded Generation

从视觉控件到UI代码:高效的基于工具的生成

Houston H. Zhang, Tao Zhang, Li Gu, Linfeng Ye, Yuanhao Yu, Xinxin Zuo, Yang Wang, Zhixiang Chi

机构 * McMaster University(麦克马斯特大学) University of Toronto(多伦多大学) Concordia University(康考迪亚大学)

专题命中 效率与部署 :prompting(abstract);分类 cs.LG

AI总结 本研究提出轻量级工具框架WidgetGen,在6个多模态模型和1000个控件上,其视觉重建指标优于直接提示和Widget2Code,且重建的图像-代码对可提升Qwen系列模型性能

Comments ECCV2026 (MUCG Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11605 2026-08-13 cs.AI 新提交 57%

Foresight Without Seeing: Latent Futures for World Action Models

无视觉前瞻:面向世界动作模型的潜在未来

Jiakai Huang, Zhongbo Wu, Zheng Zhang, Zihan Wang, Shan You, Tao Huang

机构 * Shanghai Jiao Tong University(上海交通大学) ACE Robotics(ACE机器人公司) Nanyang Technological University(南洋理工大学)

专题命中 效率与部署 :pretraining(abstract);分类 cs.AI

AI总结 本文提出ForeWAM,一种动力学条件下的直接策略WAM,通过Future-KV和动力学寄存器在无需显式生成未来视频的情况下,使直接策略WAMs兼具高效动作预测与预测动力学暴露能力,在LIBERO和LIBERO-Plus上取得高成功率。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11204 2026-08-12 cs.RO cs.AI cs.CV 新提交 57%

Surgical WAM: A World-Action Model for Data-Efficient Surgical Robot Learning

Surgical WAM:面向数据高效型手术机器人学习的世界-动作模型

Wenrui Bao, Tianyun Jiang, Zhiben Chen, Ser-Nam Lim, Peter D. Peng, Yuzhang Shang

专题命中 效率与部署 :pretraining(abstract);分类 cs.AI

AI总结 本文提出Surgical WAM模型,通过无动作视频预训练结合带动作标注数据微调,在四项模拟手术操纵任务中将平均成功率从63.5%提至77.8%,为数据高效的手术机器人学习提供了可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10775 2026-08-12 cs.AI 新提交 57%

SkillLens: Visual Skill Cards for Retrieval-Augmented GUI Action Prediction and On-Policy Distillation

SkillLens:用于检索增强型GUI动作预测与在线策略蒸馏的可视化技能卡片

Zhou Liu, Ligang Huang, Zeli Su, Zewei Pan, Zhaoyang Han, Xing Chen, Yuanfeng Song, Wentao Zhang

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 SkillLens提出可视化技能卡片(VSCs),结合轨迹转卡片方法与检索增强机制,在两个多模态网页基准上提升了冻结GPT-5.4-mini执行器及Qwen3-VL-2B学生模型的GUI动作预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10360 2026-08-12 cs.HC cs.AI eess.AS 新提交 57%

MazzikaAI: A knowledge-based performance-to-prompt compiler for real-time Arabic maqam accompaniment with a streaming text-to-music model

MazzikaAI:一种基于知识的性能到提示编译器,用于结合流式文本到音乐模型的实时阿拉伯maqam伴奏

Jiaxin Du, Boulbaba Abdeljaouad, Yong Zhuang, Haoyu Li

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI

AI总结 本文提出基于知识的MazzikaAI系统,通过编译实时输入生成文本提示,引导未微调的Google Lyria RealTime实现实时阿拉伯maqam伴奏,可精准控制微分音生成,为文化包容性生成音频提供了可扩展范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09176 2026-08-11 cs.CV cs.AI 新提交 57%

Not All Visual Tokens Are Equally Safe to Remove:Consequence-Sensitive Visual Token Compression

并非所有视觉 token 都可安全移除:后果敏感型视觉 token 压缩

Jingbo Wen, Liang He, Mingyu Cao, Haoyu Wang, Minxuan Hu, Kangning Cui, Xilu Wang

机构 * The University of Sydney(悉尼大学) Tongji University(同济大学) University of Surrey(萨里大学) Nankai University(南开大学) Cornell University(康奈尔大学) City University of Hong Kong(香港城市大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 该研究针对视觉语言模型提出后果敏感型视觉 token 压缩方法,可在相同总 token 预算下降低高风险错误,还能减少代价加权错误并降低延迟,泛化性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08961 2026-08-11 cs.LG 新提交 57%

Gradient Under Microscope: Benchmarking Resource Utilization of Memory-Efficient Gradient Computation Methods

显微镜下的梯度:对内存高效梯度计算方法的资源利用基准测试

Sarthak Mahapatra, Zihan Zhou, Khatoon Khedri, Mehdi Hosseinzadeh, Reza Rawassizadeh

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 该研究针对四种Transformer架构,测试五种梯度优化器在三种内存策略下的资源利用,发现梯度累积效果最优,Adam并非普遍最优,梯度检查点效果依赖架构,为模型训练部署提供实用指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08627 2026-08-11 cs.AI 新提交 57%

UniMoMo: Expert Merging-Based MoE Acceleration for Large Recommendation Models

UniMoMo:基于专家合并的大推荐模型混合专家(MoE)加速方法

Lei Xin, Bin Gu, Peize Li, Zitong Wang, Jianbo Zhao, Changjiang Jiang, Yanyue Xie, Chao Huang, Xuyang Zhao, Zunhai Su, Fanhu Zeng, Zhenglun Kong

机构 * Kuaishou Technology(快手科技) Hohai University(河海大学) Wuhan University(武汉大学) ByteDance, Seed(字节跳动 Seed) Alibaba, Ant Group(阿里巴巴蚂蚁集团) ByteDance, Douyin(字节跳动抖音) The University of Hong Kong(香港大学) Harvard University(哈佛大学)

专题命中 效率与部署 :post-training(abstract);分类 cs.AI

AI总结 UniMoMo是一种后训练压缩框架,通过功能相似性合并MoE专家并引入层自适应保护,在Amazon Beauty等三个数据集上实现推荐MoE的高效压缩与加速,且性能损失极小。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07727 2026-08-11 cs.CL 新提交 57%

Evaluating Dedicated Monolingual and Joint Multilingual Causal Models for Dravidian Languages

评价达罗毗荼语的专用单语与联合多语因果模型

Venkata Naga Sai Vishnu Rohit Pulipaka

专题命中 效率与部署 :language model(abstract);分类 cs.CL

AI总结 本文训练5个GPT-2架构模型对比达罗毗荼语的单语与多语模型,发现单语模型在情感分类等任务上优于mGPT,分词器效率也更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06916 2026-08-10 cs.LG 新提交 57%

MiCoPro: End-to-End Mixed Precision HW/SW Co-design with HW-aware Proxy Model

MiCoPro:面向硬件感知代理模型的端到端混合精度硬件/软件协同设计

Zijun Jiang, Yangdi Lyu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 效率与部署 :post-training(abstract);分类 cs.LG

AI总结 MiCoPro是面向边缘AI的混合精度硬件/软件协同设计框架,通过硬件感知代理模型实现延迟约束下的最优量化配置,在两类硬件上达成最高40%延迟降低、精度下降不足3%的效果。

Comments 14 pages, 9 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06880 2026-08-10 cs.LG 新提交 57%

SkillAligner: Treating Retrieved Skills as Adaptable Drafts at Execution Time

SkillAligner:在执行时将检索到的技能视为可调整的草稿

Qinfeng Li, Dalin He, Yuntai Bao, Ying Yang, Ruoxi Chen, Xinyan Yu, Lizhou Liang, Ge Su, Wenqi Zhang, Xuhong Zhang

机构 * Zhejiang University(浙江大学)

专题命中 效率与部署 :language agent(abstract);分类 cs.LG

AI总结 SkillAligner是无训练的执行时技能适配框架,将检索技能视为可调整草稿,经联合适配整合为执行指南,在多基准实验中提升任务性能、降低退化与推理成本。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06612 2026-08-10 cs.CV cs.AI 新提交 57%

SLED: Scalable Location Encoding via Distillation

SLED:通过知识蒸馏实现可扩展位置编码

Kevin Lane, Zhongying Wang, Esther Rolf, Morteza Karimzadeh

专题命中 效率与部署 :pretraining(abstract);分类 cs.AI

AI总结 针对现有位置编码器计算成本高、扩展性差等问题,提出基于蒸馏的SLED,可灵活融入多模态地理空间数据,在19项基准任务上性能优于或媲美现有模型,大幅降低预训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06177 2026-08-07 cs.LG cs.NE 新提交 57%

Threshold-Based Early Stopping of Accumulations in Neural Networks with Binary Activation

基于阈值的二值激活神经网络累积量早停机制

Quentin Luquet de Saint-Germain, Massil Ait Abdeslam, Jean Pierre David

专题命中 效率与部署 :post-training(abstract);分类 cs.LG

AI总结 本文提出一种训练后早停机制,通过预测二值神经网络累积量的最终符号,可减少VGG11在CIFAR-10上的运算量,仅造成小幅准确率下降。

Comments 9 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05778 2026-08-07 cs.AI 新提交 57%

When Do Prompt-Side Agent Playbooks Transfer? Accuracy, Cost, and Runtime Shift in Agent Deployment

提示侧智能体剧本何时可迁移?智能体部署中的准确性、成本与运行时偏移

Weihong Lin, Lin Sun, Xiangzheng Zhang

机构 * Beijing Qiyuan Technology Co., Ltd.(北京奇源科技有限公司)

专题命中 效率与部署 :language agent(abstract);分类 cs.AI

AI总结 该研究在蒸馏-验证-迁移协议下探究提示侧智能体剧本的可迁移性,在ALFWorld、TAU2-Bench、XBench-DeepSearch等基准上测试发现其为有条件的冷启动选项,需目标侧验证相关指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06107 2026-08-07 cs.LG cs.NA math.NA 新提交 57%

Kastor: An efficient fine-tuning strategy for generative emulation of PDE simulations

Kastor:一种用于生成式模拟偏微分方程(PDE)仿真的高效微调策略

Guillaume Couairon, Alexis Jacq, Yu-Han Wu, Renu Singh, Yana Hasson, Quentin Berthet, Romuald Elie

专题命中 效率与部署 :foundation model(abstract);分类 cs.LG

AI总结 本研究提出Kastor微调策略,通过两阶段推理、均值预测正则化等方法改进物理基础模型,在The Well数据集上实现比Walrus更优的PDE仿真性能,降低预测误差并提升效率。

Comments 34 pages, 32 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04502 2026-08-06 cs.DC cs.AI 新提交 57%

AFD-Ledger: Deployment Provisioning for Attention--FFN Disaggregation

AFD-Ledger:注意力-前馈网络(FFN)拆分的部署配置

Chengyu Qiu, Xiao Fu, Fengcun Li, Yulei Qian, Yuchen Xie, Xunliang Cai, Yingdi Shan, Yongwei Wu, Mingxing Zhang

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 AFD-Ledger是离线分析配置系统,可优化AFD与同置部署的硬件分配,减少部署评估量,预测吞吐量偏差小,揭示同构/异构AFD及角色硬件改进的部署规律。

Comments 14 pages, 14 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03319 2026-08-05 eess.SP cs.LG 新提交 57%

Task-Oriented Candidate-Latent Feedback for Coarse-to-Fine Sensing in Distributed OFDM-ISAC Networks

面向任务的候选隐变量反馈:分布式OFDM-ISAC网络中的粗到细感知

Shiv Shankar, Radha Krishna Ganti, J Klutto Milleth

专题命中 效率与部署 :post-training(abstract);分类 cs.LG

AI总结 该研究针对分布式OFDM-ISAC网络的SE-SF接口,提出基于学习的粗到细感知流水线与候选隐变量反馈方法,实现高检测率与低传输速率,且跨场景泛化性能良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03920 2026-08-05 cs.SD cs.AI 新提交 57%

Equivariant Music Transformer

等变音乐Transformer

Zixun Guo, Simon Dixon

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 针对标准音乐Transformer等变性不足的问题,提出EMT模型,通过自蒸馏联合优化预测与等变正则化损失,在等变性和生成能力上优于现有方法。

Journal ref ISMIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03918 2026-08-05 cs.CV cs.AI 新提交 57%

When and Where to Look: Adaptive Visual Evidence Scheduling for Efficient Long Video Understanding

何时与何地查看:用于高效长视频理解的自适应视觉证据调度

Ke Li, Jiayu Chen, Maoliang Li, Zihao Zheng, Hailong Zou, Hengyi Zhang, Xuanzhe Liu, Xiang Chen

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 提出无需训练的EcoFrame框架,通过熵门控预算调度和注意力引导候选提议实现高效视觉证据调度,在多个长视频理解基准上实现精度与效率的更优权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02674 2026-08-05 cs.CR cs.AI 新提交 57%

Moving the Safety Barrier: Dynamic Routing Adaptive Alignment Against White-Box Attacks

移动安全屏障:针对白盒攻击的动态路由自适应对齐

Shangze Li, Chuancheng Shi, Simiao Xie, Lingzhi He, Cheng Ji, Zifeng Cheng, Fei Shen, Chao Wu, Tat-Seng Chua

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI

AI总结 针对大型基础模型易受路由级白盒攻击的问题,提出动态路由自适应对齐框架,通过引入动态补偿路由提升模型安全稳健性且保留通用实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02351 2026-08-04 cs.AI 新提交 57%

KC-Agent: A Dual-Process Cognitive Architecture for Efficient ML Model Improvement

KC-Agent:用于高效机器学习模型改进的双进程认知架构

Gusseppe Bravo-Rocca, Jordi Guitart, Ajay Dholakia, David Ellison, Puneet Jain

专题命中 效率与部署 :LLM(abstract_cn);分类 cs.AI

AI总结 KC-Agent是一种双进程认知架构,结合快速模式识别与审慎增量更新,在五组数据集评估中,以最优效率和领先性能优于现有认知架构,可高效应对真实世界数据漂移场景。

Comments Accepted at IEEE COMPSAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02032 2026-08-04 cs.LG 新提交 57%

DART: Decoded Attention over Recurrent States for Efficient Long-Context Sequence Modeling

DART:用于高效长上下文序列建模的循环状态解码注意力

Yixiao Qian, Song Chen, Pengkai Wang, Jiaxu Liu, Shengze Cai, Chao Xu

机构 * College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) National University of Singapore(新加坡国立大学) Hong Kong Polytechnic University(香港理工大学) School of Science, Huzhou Normal University(湖州师范学院理学院)

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 DART基于Mamba-2的状态空间对偶性,通过保留分块状态记忆并解码键值执行状态-记忆注意力,减少长上下文推理缓存,同时提升关联召回与检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01998 2026-08-04 cs.DC cs.AI cs.NI 新提交 57%

TALSC: Timeliness-Aware Large-Small VLM Collaboration for Infrastructure-Assisted Autonomous Driving

TALSC:面向基础设施辅助自动驾驶的时效性感知大小视觉语言模型协作

Mengmeng Zhu, Yuxuan Sun, Wei Chen, Bo Ai

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 针对基础设施辅助自动驾驶中VLM协作的时效性问题,提出TALSC框架,通过李雅普诺夫漂移加估计惩罚算法优化调度,在nuScenes仿真中较最优基线实现Micro-F1最高12.6%的归一化提升。

Comments This paper has been accepted by IEEE GLOBECOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01359 2026-08-04 cs.CL 新提交 57%

EviSD: Evidence-Conditioned Self-Distillation for Search-Augmented Agents

EviSD:面向搜索增强智能体的证据条件自蒸馏

Jianan Xie, Xin Sun, Zhongqi Chen, Xing Zheng, Shu Wu, Bowen Song, Liang Wang

机构 * Ant Group(蚂蚁集团) NLPR, MAIS, CASIA(中国科学院自动化研究所模式识别国家重点实验室、多模态人工智能系统实验室)

专题命中 效率与部署 :language agent(abstract);分类 cs.CL

AI总结 该研究针对搜索增强智能体的轨迹级信用问题,提出EviSD证据条件自蒸馏框架,在7个问答基准及3种骨干模型上,其宏观平均精确匹配优于最强对比方法1.3-2.3个百分点。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01185 2026-08-04 cs.CV cs.LG 新提交 57%

3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering

3DZip:面向3D视觉问答的空间感知特征多样性引导的Token压缩方法

Changwoo Baek, Kyeongbo Kong

机构 * Pusan National University(釜山国立大学)

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 本文针对3D视觉问答中Token压缩忽略空间特性的问题,提出三阶段框架3DZip,在三个基准上以128个Token保留94.7%性能、提速1.92倍,优于现有方法。

Comments Accepted to ECCV 2026. Project page: https://cvsp-lab.github.io/3DZip

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00714 2026-08-04 cs.CV cs.AI 新提交 57%

Coverage-Driven Adaptive Keyframe Selection for Video Understanding

面向视频理解的覆盖驱动型自适应关键帧选择

Junyang Zhang, Puhan Luo, Chen Tang, Yuxi Shi, Xiang-Yang Li

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 本文针对视频理解中LVLM处理大量帧计算开销大的问题,提出无需训练的CSES关键帧选择器,通过覆盖驱动的自适应策略减少需评分和选择的帧数量,同时保持准确率并提升选择速度。

详情

展开后加载摘要…

URL PDF HTML 收藏