arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Huawei(华为)

2026-05-08 至 2026-05-08 共收录 11
2605.06665 2026-05-08 cs.LG cs.AI

UniPool: A Globally Shared Expert Pool for Mixture-of-Experts

UniPool: 一种全局共享专家池的混合专家架构

Minbin Huang, Han Shi, Chuanyang Zheng, Yimeng Wu, Guoxuan Chen, Xintong Yu, Yichun Yin, Hong Cheng

机构 * The Chinese University of Hong Kong(香港中文大学) Huawei Technologies(华为技术有限公司) The University of Hong Kong(香港大学)

AI总结 UniPool通过全局共享专家池替代传统每层独立专家资源,减少专家参数线性增长需求,提升模型效率和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06611 2026-05-08 cs.LG cs.AI stat.ML

The Structural Origin of Attention Sink: Variance Discrepancy, Super Neurons, and Dimension Disparity

注意力陷阱的结构起源:方差差异、超级神经元和维度不均等

Siquan Li, Kaiqi Jiang, Jiacheng Sun, Tianyang Hu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Huawei Foundation Model Department(华为基础模型部门)

AI总结 本文揭示了大语言模型中注意力陷阱现象的结构成因,通过分析自注意力机制中的方差差异和前馈网络中超级神经元的激活,证明了维度不均等导致注意力陷阱的形成,并提出head-wise RMSNorm架构改进以稳定值聚合。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06111 2026-05-08 cs.SE cs.AI

Schedule-and-Calibrate: Utility-Guided Multi-Task Reinforcement Learning for Code LLMs

调度与校准:面向代码LLM的实用导向多任务强化学习

Yujia Chen, Yang Ye, Xiao Chu, Yuchi Ma, Cuiyun Gao

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Huawei Cloud Computing Technologies Co., Ltd.(华为云计算技术有限公司)

AI总结 本文提出ASTOR框架,通过任务实用性驱动的协调机制,提升多任务强化学习在代码LLM中的效果,实验显示其在多个编码任务中优于专用专家和基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21623 2026-05-08 cs.LG cs.NA math.NA

LAMP: Look-Ahead Mixed-Precision Inference of Large Language Models

LAMP:大型语言模型的前瞻性混合精度推理

Stanislav Budzinskiy, Marian Gloser, Tolunay Yilmaz, Ying Hong Tham, Yuanyi Lin, Wenyi Fang, Fan Wu, Philipp Petersen

机构 * Faculty of Mathematics University of Vienna(维也纳大学数学系) Huawei Technologies(华为技术)

AI总结 本文提出了一种前瞻性混合精度推理方法,通过选择性提高部分组件的计算精度,提升Transformer推理的准确性,实验证明在GPT-2模型上精度提升达两个数量级。

Comments Major revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12635 2026-05-08 cs.AI

Memory as Action: Autonomous Context Curation for Long-Horizon Agentic Tasks

记忆作为行动:面向长周期智能任务的自主上下文编纂

Yuxiang Zhang, Jiangming Shu, Ye Ma, Xueyuan Lin, Shangxi Wu, Jitao Sang

机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) Hithink Research(慧思科技) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Huawei Noah’s Ark Lab(华为诺亚实验室) Peng Cheng Lab(鹏城实验室)

AI总结 本文提出MemAct框架,将工作记忆管理作为可学习的策略动作,通过端到端强化学习优化信息保留与任务表现,实验显示其在保持准确性的同时显著减少上下文长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00106 2026-05-08 cs.SE cs.AI

LicenseGPT: A Fine-tuned Foundation Model for Publicly Available Dataset License Compliance

LicenseGPT:一种针对公开数据集许可合规的微调基础模型

Jingwen Tan, Gopi Krishnan Rajbahadur, Zi Li, Xiangfu Song, Jianshan Lin, Dan Li, Zibin Zheng, Ahmed E. Hassan

机构 * Sun Yat-Sen University(中山大学) Huawei(华为) Queen's University(女王大学)

AI总结 本文提出LicenseGPT,一种专门用于数据集许可合规分析的微调基础模型,通过提升预测准确率和减少分析时间,为法律从业者提供高效工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09125 2026-05-08 cs.AI cs.DB cs.LO

Goal-Driven Query Answering over First- and Second-Order Dependencies with Equality

面向第一和第二阶依赖及等式的目标驱动查询回答

Efthymia Tsamoura, Boris Motik

机构 * Huawei Labs(华为实验室) Department of Computer Science, Oxford University(牛津大学计算机科学系)

AI总结 本文提出了一种针对第一和第二阶依赖及等式的首个目标驱动查询回答技术,通过转换输入依赖以避免无关推断,提高了查询效率。

Comments 47 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05940 2026-05-08 cs.LG cs.CL

Near-Policy: Accelerating On-Policy Distillation via Asynchronous Generation and Selective Packing

近策略:通过异步生成与选择性打包加速 on-policy 知识蒸馏

Miao Rang, Zhenni Bi, Hang Zhou, Kai Han, Xuechun Wang, An Xiao, Xinghao Chen, Yunhe Wang, Hanting Chen

机构 * Huawei Technologies(华为技术有限公司) Tianjin University(天津大学)

AI总结 本文提出近策略蒸馏(NPD),通过异步生成与选择性打包减少 on-policy 知识蒸馏的计算开销,实现 8.1 倍加速,并在 RL 中取得更优表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00292 2026-05-08 cs.LG cs.AI

Caracal: Causal Architecture via Spectral Mixing

Caracal:通过频谱混合实现因果架构

Bingzheng Gan, Tianyi Zhang, Yusu Li, Jing Huang, Wei Shi, Yangkai Ding, Tao Yu

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司)

AI总结 Caracal通过频谱混合替代传统注意力机制,解决长序列建模中的计算和位置编码限制,提供高效可扩展的解决方案。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14594 2026-05-08 cs.CV

LFS: Learnable Frame Selector for Event-Aware and Temporally Diverse Video Captioning

LFS: 用于事件感知和时间多样化的视频描述生成的可学习帧选择器

Lianying Chao, Linfeng Yin, Peiyu Ren, Yifan Jiang, Qiaoyu Ren, Dingcheng Shan, Jing-cheng Pang, Sijie Wu, Xubin Li, Kai Zhang, Xin Chen

机构 * GTS, AI Data Department, Huawei Technologies Co., Ltd.(华为技术有限公司人工智能数据部)

AI总结 本文提出LFS,通过学习选择时间多样且事件相关的帧,提升视频描述的细节质量,在两个基准和ICH-CC上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09298 2026-05-08 cs.CV

Multi-Modal LLM based Image Captioning in ICT: Bridging the Gap Between General and Industry Domain

基于多模态LLM的ICT图像描述:弥合通用与行业领域之间的差距

Lianying Chao, Kai Zhang, Haoran Cai, Sijie Wu, Xubin Li, Xin Chen

机构 * GTS, Huawei Technologies Co., Ltd.(华为技术有限公司GTS部门)

AI总结 本文提出多阶段训练策略,构建ICT领域图像描述模型DICModel,通过合成图像文本对提升模型性能,实验表明其在BLEU指标和准确率上均优于现有模型。

Journal ref 2025 CCF BigData

详情

展开后加载摘要…

URL PDF HTML 收藏