arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Huawei(华为)

2026-05-12 至 2026-05-12 共收录 15
2605.10622 2026-05-12 cs.MM cs.CV

Vocabulary Hijacking in LVLMs: Unveiling Critical Attention Heads by Excluding Inert Tokens to Mitigate Hallucination

LVLMs中的词汇劫持:通过排除惰性标记来揭示关键注意力头以缓解幻觉

Yangneng Chen, Junlin Li, Weijun Yao, Xilai Ma, Guodong Du, Wenya Wang, Jing Li

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Huawei Technologies Co., Ltd.(华为技术有限公司) The Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学)

AI总结 本文通过分析LVLMs的注意力机制,揭示了词汇劫持现象,提出HABI方法定位惰性标记,并引入NHAR指标评估其影响,最终提出HAVAE方法增强关键注意力头以减少幻觉。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00539 2026-05-12 cs.CL cs.DC

AGoQ: Activation and Gradient Quantization for Memory-Efficient Distributed Training of LLMs

AGoQ:激活与梯度量化用于低内存分布式训练大语言模型

Wenxiang Lin, Juntao Huang, Luhan Zhang, Laili Li, Xiang Bao, Mengyang Zhang, Bing Wang, Shaohuai Shi

机构 * School of Computer Science(计算机科学学院) Technology, Harbin Institute of Technology, Shenzhen(技术学院,哈尔滨工业大学,深圳) Huawei Technologies Ltd(华为技术有限公司)

AI总结 AGoQ通过层感知激活量化和梯度量化技术,实现近4位激活存储和8位梯度存储,降低内存使用并提升训练速度,实验表明在不同规模LLM上内存减少达52%,训练速度提升1.34倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06527 2026-05-12 cs.AI

HyPER: Bridging Exploration and Exploitation for Scalable LLM Reasoning with Hypothesis Path Expansion and Reduction

HyPER:通过假设路径扩展与缩减实现可扩展的大语言模型推理中的探索与利用平衡

Shengxuan Qiu, Haochen Huang, Shuzhang Zhong, Pengfei Zuo, Meng Li

机构 * Institute for Artificial Intelligence, Peking University, Beijing(北京大学人工智能研究院) Huawei(华为) School of Integrated Circuits, Peking University, Beijing(北京大学集成电路学院)

AI总结 HyPER通过动态扩展-缩减控制问题优化多路径解码,提升推理准确性与计算效率,实验显示在不同基准上准确率提升8-10%,token使用减少25-40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13813 2026-05-12 cs.LG cs.AI

Assessing Trustworthiness of AI Training Dataset using Subjective Logic -- A Use Case on Bias

基于主观逻辑评估AI训练数据集的可信度——一个偏见用例

Koffi Ismael Ouattara, Ioannis Krontiris, Theo Dimitrakos, Frank Kargl

机构 * Huawei Technologies(华为技术有限公司) Ulm Universität(乌尔姆大学)

AI总结 本文提出首个评估AI训练数据集可信度的框架,通过主观逻辑处理不确定性和偏见等全局属性,实验表明方法能有效识别类别不平衡并在集中式和联邦学习中保持可解释性和鲁棒性。

Comments Accepted at ECML PKDD Bias Workshop '25

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19741 2026-05-12 cs.RO cs.AI

ROS-LLM: A ROS framework for embodied AI with task feedback and structured reasoning

ROS-LLM:一个用于具身AI的ROS框架,具有任务反馈和结构化推理

Christopher E. Mower, Yuhui Wan, Hongzhan Yu, Antoine Grosnit, Jonas Gonzalez-Billandon, Matthieu Zimmer, Jinlong Wang, Xinyu Zhang, Yao Zhao, Anbang Zhai, Puze Liu, Daniel Palenicek, Davide Tateo, Cesar Cadena, Marco Hutter, Jan Peters, Guangjian Tian, Yuzheng Zhuang, Kun Shao, Xingyue Quan, Jianye Hao, Jun Wang, Haitham Bou-Ammar

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) University of Leeds(利兹大学) Technical University of Darmstadt(达姆施塔特技术大学) East China Normal University(华东师范大学) Huawei Technologies(华为技术有限公司) ETH Zurich(苏黎世联邦理工学院) University College London(伦敦大学学院)

AI总结 本文提出一种基于ROS的框架,允许非专家通过自然语言提示和上下文信息编程机器人,结合大语言模型实现任务描述和行为模式控制,实验验证了其在多样化场景中的鲁棒性和扩展性。

Comments This document contains 26 pages and 13 figures

Journal ref Nature Machine Intelligence 8, 313-325 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10043 2026-05-12 cs.CL cs.AI

Personalizing LLMs with Binary Feedback: A Preference-Corrected Optimization Framework

通过二元反馈个性化大语言模型:一种偏好校正的优化框架

Xilai Ma, Liye Zhao, Weijun Yao, Haibing Di, Wenya Wang, Jing Li

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Huawei Technologies Co., Ltd.(华为技术有限公司) Nanyang Technological University(南洋理工大学)

AI总结 本文提出C-BPO框架,通过偏好校正的二元信号实现LLM个性化,解决用户间差异问题,实验表明其在多种任务中优于基线方法。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09932 2026-05-12 cs.CL

FocuSFT: Bilevel Optimization for Dilution-Aware Long-Context Fine-Tuning

FocuSFT:基于稀释意识的长上下文微调的双层优化

Zehua Pei, Hui-Ling Zhen, Xianzhi Yu, Sinno Jialin Pan, Mingxuan Yuan, Bei Yu

机构 * The Chinese University of Hong Kong(香港中文大学) Huawei Technologies Co., Ltd(华为技术有限公司)

AI总结 FocuSFT通过双层优化框架解决长上下文微调中注意力稀释问题,提升模型在长上下文下的准确性和表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09449 2026-05-12 cs.CV

SpaceMind++: Toward Allocentric Cognitive Maps for Spatially Grounded Video MLLMs

SpaceMind++:迈向空间感知认知地图的视频多模态大语言模型

Bo Gu, Zhikang Zhang, Zizhuang Wei, Zhenyuan Chen, Lingyun Li, Zhuoyi Song

机构 * Fudan University(复旦大学) Huawei(华为) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 SpaceMind++通过构建体素化认知地图,实现空间一致性的视觉推理,提升视频多模态大语言模型在3D环境中的表现。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09410 2026-05-12 cs.RO cs.AI

RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models

RePO-VLA:面向视觉-语言-动作模型的恢复驱动策略优化

Weijia Liufu, Xiaoyu Guo, Ruiyi Chen, Jingzhi Liu, Kaidong Zhang, Xiwen Liang, Jianqi Lin, Dawei Sun, Yuze Wang, Rongtao Xu, Bingqian Lin, Bowen Yang, Tongtong Cao, Bowen Peng, Dongyu Zhang, Guangrun Wang, Min Wang, Liang Lin, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) South China University of Technology(华南理工大学) Peng Cheng Laboratory(鹏城实验室) Harbin Institute of Technology(哈尔滨工业大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Huawei Noah’s Ark Lab(华为诺亚实验室)

AI总结 本文提出RePO-VLA框架,通过恢复驱动策略优化提升视觉-语言-动作模型在长时程接触丰富操作中的鲁棒性,通过恢复意识初始化、进度感知语义价值函数和价值条件细化等方法,提高对抗成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09328 2026-05-12 cs.CV

Noise-Started One-Step Real-World Super-Resolution via LR-Conditioned SplitMeanFlow and GAN Refinement

基于LR条件SplitMeanFlow和GAN精炼的噪声启动一步真实世界超分辨率

Wei Zhu, Kai Zhang, Yu Zheng, Lei Luo, Yong Guo, Jian Yang

机构 * Nanjing University of Science and Technology(南京理工大学) Nanjing University(南京大学) Huawei(华为)

AI总结 本文提出SMFSR框架,通过LR条件SplitMeanFlow和GAN精炼实现噪声启动的一步真实世界超分辨率,保留扩散模型的随机噪声起点并提升生成效率与真实感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12812 2026-05-12 cs.AI

DocSeeker: Structured Visual Reasoning with Evidence Grounding for Long Document Understanding

DocSeeker:基于证据 grounding 的结构化视觉推理用于长文档理解

Hao Yan, Yuliang Liu, Xingchen Liu, Yuyi Zhang, Minghui Liao, Jihao Wu, Wei Chen, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Huawei Inc.(华为公司)

AI总结 本文提出DocSeeker,通过结构化分析、定位和推理流程解决长文档理解中的信号噪声比低和监督不足问题,实现对超长文档的鲁棒泛化。

Comments CVPR 2026 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11470 2026-05-12 cs.LG cs.CL

Rethinking Expert Trajectory Utilization in LLM Post-training for Mathematical Reasoning

重新思考在LLM后训练中专家轨迹的利用

Bowen Ding, Yuhan Chen, Jiayang Lyv, Jiyao Yuan, Qi Zhu, Shuangshuang Tian, Dantong Zhu, Futing Wang, Heyuan Deng, Fei Mi, Lifeng Shang, Tao Lin

机构 * Zhejiang University(浙江大学) School of Engineering, Westlake University(西湖大学工程学院) Institute of Advanced Technology, Westlake Institute for Advanced Study(西湖先进研究院技术研究所) Huawei Noah’s Ark Lab(华为诺亚实验室)

AI总结 本文提出Plasticity-Ceiling框架,通过分解最终性能上限,揭示SFT与RL的协同优化方法,建立SFT-然后-RL的流水线,解决同步方法的稳定性问题,并提供精确的缩放指南。

Comments ACL-26, Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05209 2026-05-12 cs.CV

EAM: Enhancing Anything with Diffusion Transformers for Blind Super-Resolution

EAM: 利用扩散变换器提升盲超分辨率

Haizhen Xie, Kunpeng Du, Qiangyu Yan, Sen Lu, Jianhong Han, Hanting Chen, Hailin Hu, Jie Hu

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室)

AI总结 本文提出EAM模型,利用DiT架构提升盲超分辨率,引入Ψ-DiT块和渐进性掩码图像建模策略,实现更优的图像恢复效果。

Comments Revision of Section 4.1

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08527 2026-05-12 cs.DC cs.AI

MARLaaS: Multi-Tenant Asynchronous Reinforcement Learning as a Service

MARLaaS:多租户异步强化学习即服务

Timothy Tin Long Yu, Gursimran Singh, Ge Shi, Hanieh Sadri, Yong Zhang, Zhenan Fan

机构 * Huawei Technologies Canada(华为技术加拿大)

AI总结 MARLaaS通过轻量LoRA适配器共享基础模型和异步架构解耦训练流程,实现多任务并发强化学习细调,提升加速器利用率4.3倍,训练时间缩短85%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06356 2026-05-12 cs.CV

SwiftI2V: Efficient High-Resolution Image-to-Video Generation via Conditional Segment-wise Generation

SwiftI2V: 通过条件分段生成实现高效的高分辨率图像到视频生成

YaoYang Liu, Yuechen Zhang, Wenbo Li, Yufei Zhao, Rui Liu, Long Chen

机构 * HKUST(香港科技大学) CUHK(香港大学) Joy Future Academy(京东探索研究院) HKU(香港大学) HUAWEI Research(华为研究)

AI总结 本文提出SwiftI2V框架,通过分段生成和双向上下文交互,在2K分辨率下实现高效图像到视频生成,相比端到端模型减少GPU时间202倍。

Comments 27 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏