arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12698 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 2145 篇

2608.20026 2026-08-21 cs.CV cs.LG 新提交 57%

From Street View Imagery to Street Quality Indicators: Vision Language Inference for the Suburban 15-minute City

从街景图像到街道质量指标:面向郊区15分钟城市的视觉语言推理

Joan Perez, Giovanni Fusco

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 本文以法国尼斯东北部郊区为研究对象,采用开源的SAGAI工作流,利用视觉语言模型从街景图像评估街景质量,发现理想街景仅存在于部分郊区区域,证明了VLM可支持郊区城市诊断,助力循证规划。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19891 2026-08-21 cs.AI 新提交 57%

EXIMO: VLM Guided Exploration of VLA Policies

EXIMO:基于视觉语言模型引导的视觉语言动作策略探索

Bhavya Sukhija, Oliver Groth, Mohit Shridhar, Tim Hertweck, Michael Bloesch, Markus Wulfmeier, Abbas Abdolmaleki, Martin Riedmiller

机构 * Google DeepMind(谷歌DeepMind)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 本研究提出EXIMO算法,通过VLM引导的探索、模仿、优化三阶段微调VLA策略,解决了VLA策略微调样本效率低的问题,性能显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19536 2026-08-21 cs.CV cs.AI cs.RO 新提交 57%

CVSD-Reg: Cross-Modal Visual Semantic Prior Distillation for Robust LiDAR Registration

CVSD-Reg:用于鲁棒激光雷达配准的跨模态视觉语义先验蒸馏

Eunsoo Im, Junghun Suh, Gyeonggwan Lee, Seunghwan Hong

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI

AI总结 本文提出CVSD-Reg框架,通过蒸馏视觉基础模型的语义先验提升激光雷达配准的鲁棒性,在多数据集上的成功率优于现有方法,且无需相机输入或事后ICP精修。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18386 2026-08-20 cs.CV cs.AI 新提交 57%

TTSD-FAR: Test-Time Self-Distillation with Fisher-Anchored Restoration for Missing-Modality Emotion Recognition in LVLMs

TTSD-FAR:用于大视频语言模型中缺失模态情感识别的带Fisher锚定恢复的测试时自蒸馏

Muhammad Haseeb Aslam, Alessandro Koerich, Marco Pedersoli, Ali Etemad, Eric Granger

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 针对大视频语言模型测试时的模态缺失问题,提出带Fisher锚定恢复的测试时自蒸馏框架,在多数据集模态缺失场景下性能优于基线方法且保持稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16837 2026-08-18 cs.RO cs.AI 新提交 57%

HAF: Adapting Generalist VLAs to Humanoid Whole-Body Loco-manipulation via Hierarchical Action Flow and Spectral Latent RL

HAF:通过分层动作流与谱潜在线性RL将通用VLAs适配至人形机器人全身运动操作

Langzhe Gu, Chengkai Hou, Meng Li, Xinhua Wang, Jiaming Liu, Xinyuan Lv, Bowei Zhang, Shuanghao Bai, Guangrun Li, Jingyang He, Gaole Dai, Ziluo Ding, Zhiyuan Xu, Kuan Cheng, Jian Tang, Zhengping Che, Shanghang Zhang

机构 * Xi’an Jiaotong University(西安交通大学) Peking University(北京大学) Nankai University(南开大学)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI

AI总结 研究针对通用VLAs难以适配人形机器人全身运动操作的问题,提出HAF框架,通过分层动作流生成器与潜空间RL流水线实现高效迁移优化,在7项任务上性能优于单阶段VLA基线。

Comments Project page: https://grange007.github.io/HAF

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15972 2026-08-18 cs.CV cs.AI 新提交 57%

CM-MAE: A Physics-Guided Cross-Modal Self-Supervised Learning Framework for Vision-Wireless Applications

CM-MAE:面向视觉-无线应用的物理引导跨模态自监督学习框架

Yubo Zhang, Yiyao Liu

专题命中 效率与部署 :pretraining(abstract);分类 cs.AI

AI总结 本文提出CM-MAE框架,通过软对比对齐损失等技术实现视觉-无线跨场景表征迁移,在DeepSense 6G数据集上提升了跨场景任务的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15580 2026-08-18 cs.AI cs.CV 新提交 57%

From Generalist to Specialist: A Context-Fusion Framework for Endoscopic Polyp Reporting with a Frozen VLM

从通用到专用:基于冻结视觉语言模型(VLM)的内窥镜息肉报告上下文融合框架

Ruijie Yang, Yan Zhu, Peiyao Fu, Siyuan Li, Te Luo, Zhihua Wang, Quanlin Li, Pinghong Zhou, Xian Yang, Shuo Wang

机构 * Zhejiang University(浙江大学) Shanghai Institute for Advanced Study, Zhejiang University(浙江大学上海高等研究院) Shanghai Key Laboratory of MICCAI(上海市MICCAI重点实验室) Digital Medical Research Center, School of Basic Medical Sciences, Fudan University(复旦大学基础医学院数字医学研究中心) Endoscopy Center and Endoscopy Research Institute, Zhongshan Hospital, Fudan University(复旦大学附属中山医院内镜中心及内镜研究所) Shanghai Collaborative Innovation Center of Endoscopy(上海市内镜协同创新中心) Alliance Manchester Business School, The University of Manchester(曼彻斯特大学联盟曼彻斯特商学院)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 本研究针对内窥镜息肉报告需求,提出一种不修改预训练权重的上下文融合框架,通过隐式指令与显式转换上下文对冻结通用VLM专用化,在2056张标注图像实验中实现最优性能且参数量仅为冻结VLM的0.006%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15410 2026-08-18 cs.DC cs.AI cs.CV cs.RO cs.SY eess.SY 新提交 57%

FloodReasonBench: Benchmarking VLM Reasoning Segmentation for Embodied Flood Response at the Edge

FloodReasonBench:面向边缘端具身洪水响应的VLM推理分割基准

Rajat Bhattacharjya, Yoomee Jung, Minwoo Kim, Sing-Yao Wu, Eli Bozorgzadeh, Nalini Venkatasubramanian, Nikil Dutt

机构 * University of California, Irvine(加州大学欧文分校) Kookmin University(国民大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 FloodReasonBench针对边缘端具身洪水响应,构建专用数据集并刻画推理分割流水线的性能权衡,为资源受限场景提供任务与系统层面的基准支持。

Comments Paper is currently under review. The code and dataset will be made public upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15383 2026-08-18 cs.LG 新提交 57%

Every Expert Counts: ExactMoE for Memory-Efficient W4A16 Inference

每个专家都重要:用于内存高效W4A16推理的ExactMoE

Amjad Saab

机构 * Appendture(阿彭彻(Appendture))

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 ExactMoE仅量化路由专家并结合缓存与融合内核,大幅降低MoE模型推理的GPU内存占用,同时保留高吞吐量与准确率,达成内存效率与性能的良好平衡。

Comments 12 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15080 2026-08-18 cs.CL 新提交 57%

A Pilot Study of Autocompleting Tokenizers

自动补全分词器的试点研究

Samuel Wexler, Mark Hopkins

机构 * Williams College(威廉姆斯学院)

专题命中 效率与部署 :language model(abstract);分类 cs.CL

AI总结 该研究受自动补全书写系统启发,提出用轻量级自回归字节语言模型压缩Transformer输入的方案,在多语言机器翻译任务上验证其可减少序列长度且不降低翻译质量,适用于不同书写系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13793 2026-08-17 stat.ML cs.LG stat.ME 新提交 57%

On the Brittleness of Maximum Likelihood Estimation for Gaussian Process Hyperparameter Optimization

高斯过程超参数优化的最大似然估计的脆弱性

Tyler R. Johnson, Kian Ben-Jacob, Christopher P. Muller, Ramin Bostanabad

机构 * University of California, Irvine(加州大学欧文分校)

专题命中 效率与部署 :foundation model(abstract);分类 cs.LG

AI总结 本文针对高斯过程超参数优化场景,评估最大似然估计的脆弱性,提出实用解决方案,其在贝叶斯优化等任务中有效,构建的高斯过程可在多方面超越表格基础模型。

Comments 26 pages, 10 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14379 2026-08-17 cs.RO cs.AI 新提交 57%

Reflex: Enabling Fast and Predictive Vision-Language-Action Models for Reaction-Critical Manipulation

Reflex:面向反应关键型操作的快速且可预测的视觉-语言-动作模型

Yuxuan Chen, Wanruo Zhang, Xiao Li

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :pretraining(abstract);分类 cs.AI

AI总结 针对现有VLA模型忽略动态交互场景的问题,提出面向反应关键型操作的ReflexBench基准与无需大规模机器人数据预训练的ReflexVLA模型,其可提升动态操作性能并保持静态操作精度。

Comments 8 pages, 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14149 2026-08-17 cs.AI cs.CR 新提交 57%

QuaSAR: Quantization Compensation via Stable Activation-Aware Rank Truncation

QuaSAR: 基于稳定激活感知秩截断的量化补偿

Lin-Fa Lee, Yi-Yu Chang, Kuo-Hei Yeh

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 效率与部署 :post-training(abstract);分类 cs.AI

AI总结 本文针对低比特量化后训练方法中门控机制误删可补偿层的问题,提出无参数截断伪逆求解器,在ViT-B模型上实现了优于现有方法的精度,且在模型规模与精度间取得良好平衡。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13524 2026-08-14 cs.LG 新提交 57%

DARTree: Speculative Diffusion Decoding with Autoregressive Draft Trees

DARTree:基于自回归草稿树的推测式扩散解码

Tianyi Li, Yaxin Luo, Xinyi Shang, Zhiqiang Shen

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 DARTree是无需训练的推测式解码方法,将AR修正头从链扩展至树,在7个数学、代码、聊天基准的4种模型-温度配置下,实现最高平均接受长度与加速比,达9.73倍无损加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13293 2026-08-14 cs.AI 新提交 57%

NAS-Driven Hardware Accelerator Exploration for Edge AI and Quantization Effects on the Pareto Space

面向边缘AI的NAS驱动硬件加速器探索及量化对帕累托空间的影响

Eleftherios Mylonas, Angelos Kouprizas, Michael Birbas, Alexios Birbas

机构 * University of Patras(帕特雷大学)

专题命中 效率与部署 :post-training(abstract);分类 cs.AI

AI总结 本文针对边缘AI部署需求,提出结合NAS、量化与可重构加速器探索的三阶段流水线,实证分析INT4 PTQ对NAS帕累托空间的影响,发现FP32零样本代理覆盖度更优。

Comments 6 pages, 6 figures, accepted for presentation to the 39th IEEE International System-on-Chip Conference, Heidelberg, Germany, September 30 - October 2, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13226 2026-08-14 cs.CV cs.AI 新提交 57%

CoverPrune: Coverage-Driven Token Pruning for 3D VLMs via Optimal Transport

CoverPrune:基于最优传输的3D视觉语言模型的覆盖驱动型令牌剪枝

Peng Ling, Yingda Yin, Lingting Zhu, Weikai Chen, Shengju Qian, Zeyu Hu, Xin Wang, Wenming Yang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) LIGHTSPEED

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 针对3D VLMs因大量视觉令牌导致的计算瓶颈,提出CoverPrune框架,将剪枝转化为最优传输问题,结合FST成本与SGS算法,实现高效剪枝且性能优异。

Comments Accepted to ECCV 2026 as an Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12989 2026-08-14 cs.LG 新提交 57%

Balanced Adaptive Prototype Selection for Scalable TabPFN Inference on Large-Scale Tabular Data

面向大规模表格数据的可扩展TabPFN推理的平衡自适应原型选择

Mahboobe Jadid, Melika Rezaye Garkani, Ali Mousavi

机构 * Islamic Azad University(伊斯兰阿扎德大学)

专题命中 效率与部署 :foundation model(abstract);分类 cs.LG

AI总结 本文提出BAPS框架,无需修改预训练TabPFN模型,可将百万级表格数据集的上下文压缩约1953倍,用512个原型保留预测性能,实现其在大规模表格数据上的可扩展推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12925 2026-08-14 cs.LG 新提交 57%

Momentum as Residual-Driven Multiplier Correction for Deep Learning Optimization

深度学习优化中作为残差驱动乘子校正的动量

Zhixin Ren, Yau Lyu, Congrong Li, Liping Zhang, Shengbo Eben Li

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 本研究提出AIM框架将动量解释为残差驱动乘子校正,并基于此开发RADAR优化器,经多任务实验验证其性能优于现有强自适应优化器基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12611 2026-08-14 cs.CV cs.LG 新提交 57%

From Visual Widgets to UI Code: Efficient Tool-Grounded Generation

从视觉控件到UI代码:高效的基于工具的生成

Houston H. Zhang, Tao Zhang, Li Gu, Linfeng Ye, Yuanhao Yu, Xinxin Zuo, Yang Wang, Zhixiang Chi

机构 * McMaster University(麦克马斯特大学) University of Toronto(多伦多大学) Concordia University(康考迪亚大学)

专题命中 效率与部署 :prompting(abstract);分类 cs.LG

AI总结 本研究提出轻量级工具框架WidgetGen,在6个多模态模型和1000个控件上,其视觉重建指标优于直接提示和Widget2Code,且重建的图像-代码对可提升Qwen系列模型性能

Comments ECCV2026 (MUCG Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11605 2026-08-13 cs.AI 新提交 57%

Foresight Without Seeing: Latent Futures for World Action Models

无视觉前瞻:面向世界动作模型的潜在未来

Jiakai Huang, Zhongbo Wu, Zheng Zhang, Zihan Wang, Shan You, Tao Huang

机构 * Shanghai Jiao Tong University(上海交通大学) ACE Robotics(ACE机器人公司) Nanyang Technological University(南洋理工大学)

专题命中 效率与部署 :pretraining(abstract);分类 cs.AI

AI总结 本文提出ForeWAM,一种动力学条件下的直接策略WAM,通过Future-KV和动力学寄存器在无需显式生成未来视频的情况下,使直接策略WAMs兼具高效动作预测与预测动力学暴露能力,在LIBERO和LIBERO-Plus上取得高成功率。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11204 2026-08-12 cs.RO cs.AI cs.CV 新提交 57%

Surgical WAM: A World-Action Model for Data-Efficient Surgical Robot Learning

Surgical WAM:面向数据高效型手术机器人学习的世界-动作模型

Wenrui Bao, Tianyun Jiang, Zhiben Chen, Ser-Nam Lim, Peter D. Peng, Yuzhang Shang

专题命中 效率与部署 :pretraining(abstract);分类 cs.AI

AI总结 本文提出Surgical WAM模型,通过无动作视频预训练结合带动作标注数据微调,在四项模拟手术操纵任务中将平均成功率从63.5%提至77.8%,为数据高效的手术机器人学习提供了可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10775 2026-08-12 cs.AI 新提交 57%

SkillLens: Visual Skill Cards for Retrieval-Augmented GUI Action Prediction and On-Policy Distillation

SkillLens:用于检索增强型GUI动作预测与在线策略蒸馏的可视化技能卡片

Zhou Liu, Ligang Huang, Zeli Su, Zewei Pan, Zhaoyang Han, Xing Chen, Yuanfeng Song, Wentao Zhang

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 SkillLens提出可视化技能卡片(VSCs),结合轨迹转卡片方法与检索增强机制,在两个多模态网页基准上提升了冻结GPT-5.4-mini执行器及Qwen3-VL-2B学生模型的GUI动作预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10360 2026-08-12 cs.HC cs.AI eess.AS 新提交 57%

MazzikaAI: A knowledge-based performance-to-prompt compiler for real-time Arabic maqam accompaniment with a streaming text-to-music model

MazzikaAI:一种基于知识的性能到提示编译器,用于结合流式文本到音乐模型的实时阿拉伯maqam伴奏

Jiaxin Du, Boulbaba Abdeljaouad, Yong Zhuang, Haoyu Li

机构 * Grand Valley State University(大峡谷州立大学)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI

AI总结 本文提出基于知识的MazzikaAI系统,通过编译实时输入生成文本提示,引导未微调的Google Lyria RealTime实现实时阿拉伯maqam伴奏,可精准控制微分音生成,为文化包容性生成音频提供了可扩展范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09176 2026-08-11 cs.CV cs.AI 新提交 57%

Not All Visual Tokens Are Equally Safe to Remove:Consequence-Sensitive Visual Token Compression

并非所有视觉 token 都可安全移除:后果敏感型视觉 token 压缩

Jingbo Wen, Liang He, Mingyu Cao, Haoyu Wang, Minxuan Hu, Kangning Cui, Xilu Wang

机构 * The University of Sydney(悉尼大学) Tongji University(同济大学) University of Surrey(萨里大学) Nankai University(南开大学) Cornell University(康奈尔大学) City University of Hong Kong(香港城市大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 该研究针对视觉语言模型提出后果敏感型视觉 token 压缩方法,可在相同总 token 预算下降低高风险错误,还能减少代价加权错误并降低延迟,泛化性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08961 2026-08-11 cs.LG 新提交 57%

Gradient Under Microscope: Benchmarking Resource Utilization of Memory-Efficient Gradient Computation Methods

显微镜下的梯度:对内存高效梯度计算方法的资源利用基准测试

Sarthak Mahapatra, Zihan Zhou, Khatoon Khedri, Mehdi Hosseinzadeh, Reza Rawassizadeh

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 该研究针对四种Transformer架构,测试五种梯度优化器在三种内存策略下的资源利用,发现梯度累积效果最优,Adam并非普遍最优,梯度检查点效果依赖架构,为模型训练部署提供实用指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08627 2026-08-11 cs.AI 新提交 57%

UniMoMo: Expert Merging-Based MoE Acceleration for Large Recommendation Models

UniMoMo:基于专家合并的大推荐模型混合专家(MoE)加速方法

Lei Xin, Bin Gu, Peize Li, Zitong Wang, Jianbo Zhao, Changjiang Jiang, Yanyue Xie, Chao Huang, Xuyang Zhao, Zunhai Su, Fanhu Zeng, Zhenglun Kong

机构 * Kuaishou Technology(快手科技) Hohai University(河海大学) Wuhan University(武汉大学) ByteDance, Seed(字节跳动 Seed) Alibaba, Ant Group(阿里巴巴蚂蚁集团) ByteDance, Douyin(字节跳动抖音) The University of Hong Kong(香港大学) Harvard University(哈佛大学)

专题命中 效率与部署 :post-training(abstract);分类 cs.AI

AI总结 UniMoMo是一种后训练压缩框架,通过功能相似性合并MoE专家并引入层自适应保护,在Amazon Beauty等三个数据集上实现推荐MoE的高效压缩与加速,且性能损失极小。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07727 2026-08-11 cs.CL 新提交 57%

Evaluating Dedicated Monolingual and Joint Multilingual Causal Models for Dravidian Languages

评价达罗毗荼语的专用单语与联合多语因果模型

Venkata Naga Sai Vishnu Rohit Pulipaka

专题命中 效率与部署 :language model(abstract);分类 cs.CL

AI总结 本文训练5个GPT-2架构模型对比达罗毗荼语的单语与多语模型,发现单语模型在情感分类等任务上优于mGPT,分词器效率也更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06916 2026-08-10 cs.LG 新提交 57%

MiCoPro: End-to-End Mixed Precision HW/SW Co-design with HW-aware Proxy Model

MiCoPro:面向硬件感知代理模型的端到端混合精度硬件/软件协同设计

Zijun Jiang, Yangdi Lyu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 效率与部署 :post-training(abstract);分类 cs.LG

AI总结 MiCoPro是面向边缘AI的混合精度硬件/软件协同设计框架,通过硬件感知代理模型实现延迟约束下的最优量化配置,在两类硬件上达成最高40%延迟降低、精度下降不足3%的效果。

Comments 14 pages, 9 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06880 2026-08-10 cs.LG 新提交 57%

SkillAligner: Treating Retrieved Skills as Adaptable Drafts at Execution Time

SkillAligner:在执行时将检索到的技能视为可调整的草稿

Qinfeng Li, Dalin He, Yuntai Bao, Ying Yang, Ruoxi Chen, Xinyan Yu, Lizhou Liang, Ge Su, Wenqi Zhang, Xuhong Zhang

机构 * Zhejiang University(浙江大学)

专题命中 效率与部署 :language agent(abstract);分类 cs.LG

AI总结 SkillAligner是无训练的执行时技能适配框架,将检索技能视为可调整草稿,经联合适配整合为执行指南,在多基准实验中提升任务性能、降低退化与推理成本。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06612 2026-08-10 cs.CV cs.AI 新提交 57%

SLED: Scalable Location Encoding via Distillation

SLED:通过知识蒸馏实现可扩展位置编码

Kevin Lane, Zhongying Wang, Esther Rolf, Morteza Karimzadeh

专题命中 效率与部署 :pretraining(abstract);分类 cs.AI

AI总结 针对现有位置编码器计算成本高、扩展性差等问题,提出基于蒸馏的SLED,可灵活融入多模态地理空间数据,在19项基准任务上性能优于或媲美现有模型,大幅降低预训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏