arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Huawei(华为)

共收录 2024
2609.04070 2026-09-04 cs.CV cs.RO 新提交

Continuous Actions from Discrete Minds: Latent-Aligned Planning for End-to-End Autonomous Driving

离散思维到连续动作:面向端到端自动驾驶的隐式对齐规划

Ruoyu Yao, Yusen Xie, Qingzhao Liu, Pei Liu, Zewei Yang, Yipeng Zhu, Xiaolong Wang, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Central Media Technology Institute, Huawei(华为中央媒体技术研究院)

AI总结 该研究提出具备隐式对齐规划的VLA框架LaPla,通过残差VQ-VAE消除量化误差,在nuScenes基准和AlpaSim模拟器上分别实现长时程L2误差降低、驾驶成功率提升的效果。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03906 2026-09-04 cs.RO 新提交

Revisiting Topological Graphs for Macro Action based Closed-loop Reinforcement Learning of Vision Language Navigation in Continuous Environment

重新审视连续环境中基于宏观动作的视觉语言导航闭环强化学习的拓扑图

Shuhao Ye, Sitong Mao, Yuxiang Cui, Yufei Wei, Xuan Yu, Shichao Zhai, Wen Chen, Shunbo Zhou, Rong Xiong, Yue Wang

机构 * Zhejiang University(浙江大学) Huawei Technologies Co., Ltd(华为技术有限公司) Zhejiang Humanoid Robot Innovation Center(浙江人形机器人创新中心)

AI总结 该研究针对连续环境视觉语言导航的模仿学习缺陷,提出分层马尔可夫决策过程结合拓扑图与动作感知价值头的方法,在R2R-CE等基准取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03892 2026-09-04 cs.CV cs.AI cs.RO 新提交

GraFT: A Training-Free Framework for Spatial Reasoning in Multimodal Large Language Models via 3D Scene Graphs

GraFT:一种基于3D场景图的多模态大语言模型空间推理无训练框架

Junqing Du, Fernando Ropero, Erkin Turkoz, Yanfeng Zhang, Lu Liu

机构 * Riemann Lab, Huawei Technologies(华为技术有限公司黎曼实验室)

AI总结 GraFT是一种无训练框架,通过3D场景图为多模态大语言模型提供三类空间推理能力,在ScanQA、VSI-Bench数据集上显著提升了模型空间推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03657 2026-09-04 cs.CV 新提交

Rethinking 3D Noise: Learning 3D-Aware Video Priors via Optimization-Free Morphological Perturbations

重新思考3D噪声:通过无优化形态扰动学习3D感知视频先验

Onat Şahin, Mohammad Altillawi, George Eskandar, Carlos Carbone, Ziyuan Liu

机构 * Technical University of Munich(慕尼黑工业大学) Huawei Heisenberg Research Center(华为海森堡研究中心) Tavus(塔沃斯公司)

AI总结 该研究针对3D场景表示在稀疏视图下的伪影问题,提出无优化的3D形态扰动正则化方法,结合3DGS实现更强几何先验,提升视频模型的3D感知能力及下游机器人操纵任务的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15884 2026-09-04 cs.CV cs.AI cs.LG 版本更新

AnyBox: Efficient Zero-Shot 9DoF Pose Estimation of Boxes for Robotic Manipulation

Box6D : 仓库中零样本类别级6D姿态估计

Yintao Ma, Sajjad Pakdamansavoji, Charles Eret, Rui Heng Yang, Xuan Zhao, Yingxue Zhang, Tongtong Cao, Amir Rasouli

机构 * Huawei Technologies Canada(华为加拿大技术有限公司)

AI总结 Box6D通过类别级CAD模板实现仓库存储箱的零样本6D姿态估计,提升精度并减少76%的推理时间。

Comments accepted to EECV 2026 R6D Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02750 2026-09-03 cs.AI 新提交

Bilevel Coordinated Reflection: A Game-Theoretic Approach to Multi-Agent LLM Systems

双层协调反思:多智能体大语言模型系统的博弈论方法

Yihang Chen, Yuxiang Chen, Yuxuan Huang, Meng Fang, Weilin Luo, Jun Wang

机构 * UCL Centre for Artificial Intelligence(伦敦大学学院人工智能中心) University of Liverpool(利物浦大学) Huawei(华为)

AI总结 该研究针对多智能体LLM系统缺乏统一协调解释的问题,提出博弈论模型并引入SRMA算法,实验显示基于Kimi的系统在SWE-bench上解决率达72.2%,优于基准系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02250 2026-09-03 cs.MA cs.CL cs.ET cs.LG 新提交

RideSkill: A Hierarchical Algorithm for Generalized Ride Sharing with LLM-Driven Automatic Evolution

RideSkill:一种基于大语言模型驱动自动演化的通用拼车分层算法

Zijian Zhao, Sen Li, Xialiang Tong, Mingxuan Yuan

机构 * The Hong Kong University of Science and Technology(香港科技大学) Noah’s Ark Lab, Huawei(华为诺亚方舟实验室) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 针对现有拼车算法泛化性差、推理需频繁调用LLM的问题,本文提出RideSkill分层算法,通过LLM自动演化训练组件,实现支持车辆共享的高效拼车调度,保障实时性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01699 2026-09-03 cs.LG cs.IT math.IT 新提交

Tri-Band Channel Measurement-Enabled Multi-Layer Digital Twin for Terahertz Wireless Data Centers

用于太赫兹无线数据中心的基于三频段信道测量的多层数字孪生

Mingjie Zhu, Ziming Yu, Guangjian Wang, Chong Han

机构 * Terahertz Wireless Communications (TWC) Interdisciplinary Research Center, Shanghai Jiao Tong University(上海交通大学太赫兹无线通信(TWC)跨学科研究中心) Huawei Technologies Company Ltd.(华为技术有限公司) School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学信息科学与工程学院)

AI总结 该研究针对太赫兹无线数据中心,提出基于三频段信道测量的多层数字孪生框架,构建感知视距的AI信道孪生体,实现更低功率重构误差与超90%覆盖范围,支撑高效规划优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00901 2026-09-03 cs.CV 版本更新

HELIOS: From midnight to noon, continuous outdoor urban scene relighting

HELIOS:从午夜到正午,连续户外城市场景重光照

Hala Djeghim, Nathan Piasco, Luis Roldão, Moussab Bennehar, Dzmitry Tsishkou, Céline Loscos, Désiré Sidibé

机构 * Huawei Paris Research Center(华为巴黎研究中心) Université Paris-Saclay(巴黎萨克雷大学) Univ Evry(埃夫里大学) L Research(L研究机构)

AI总结 HELIOS是一种无需配对图像训练的图像重光照方法,通过反照率条件、反照率蒸馏和GPS太阳角度控制,实现昼夜场景连续重光照,性能优于现有方法。

Comments Project page: https://hala-djeghim.github.io/HELIOS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01601 2026-09-02 cs.SE cs.AI cs.CL 新提交

Adaptive Critical Token-Aware Retrieval for Repository-Level Code Generation

面向仓库级代码生成的自适应关键令牌感知检索

Kefeng Duan, Dewu Zheng, Yanlin Wang, Terry Yue Zhuo, Mingwei Liu, Jianxing Yu, Jiachi Chen, Ensheng Shi, Xilin Liu, Yuchi Ma, Zibin Zheng

机构 * Sun Yat-sen University(中山大学) School of Artificial Intelligence, Sun Yat-sen University(中山大学人工智能学院) Monash University(莫纳什大学) CSIRO’s Data61(联邦科学与工业研究组织数据61研究所) Zhejiang University(浙江大学) Huawei Cloud Computing Technologies Co., Ltd.(华为云计算技术有限公司)

AI总结 针对仓库级代码生成中LLM输入长度受限及关键令牌易出错问题,提出ACToR框架,通过识别关键令牌触发针对性检索并采用位置感知加权,在RepoExec和CoderEval上较SOTA方法分别提升8.4%、15.4%

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01068 2026-09-02 cs.CL 新提交

OUTLETS: Output-Length Prediction from Speculative Decoding Backbones

OUTLETS:基于推测解码主干的输出长度预测

Weihuang Wen, Yingying Liu, Yichuan Liu, Wenqi Zeng, Li Zhou, Chumin Sun, Jie Sun, Tianshu Yu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The University of Hong Kong(香港大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

AI总结 针对LLM服务输出长度重尾分布的调度难题,OUTLETS利用推测解码草稿表示构建轻量长度预测器,降低MAE并将短请求P99延迟减少34.8%。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00829 2026-09-02 cs.LG cs.AI 新提交

HarnessEvolve: Learning from Reference Trajectories for Reliable Agent Self-Evolution

HarnessEvolve:利用参考轨迹实现智能体的可靠自进化

Wen Jiang, Mingmin Chu, Yimeng Tian, Qianxin Zhang, Haofei Yang, Rui Yang, Yang Liu, Tao Lv, Fangming Li

机构 * ICT AI Competence Center, Huawei Technologies(华为技术有限公司ICT AI能力中心)

AI总结 HarnessEvolve是一种将执行与进化解耦的智能体自进化框架,通过参考轨迹克服信用分配失败,经质量与性能门控防止捷径学习和灾难性遗忘,在多基准上性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00624 2026-09-02 cs.CL 新提交

Trust Your Guide Only When Certain: Uncertainty-Aware Sparse Alignment at Inference Time

仅在确信时信任你的引导:推理时的不确定性感知稀疏对齐

Zeen Zhu, Zhuo Li, Weiyang Guo, Liye Zhao, Haibing Di, Yequan Wang, Jing Li

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Huawei Technologies Co., Ltd.(华为技术有限公司) Beijing Academy of Artificial Intelligence(北京智源人工智能研究院)

AI总结 针对推理时LLMs密集对齐的低置信度干预问题,提出TUSA方法,通过不确定性感知仲裁器仅在满足条件时授权干预,跳过约50%对齐步骤,同时提升安全与通用偏好。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01804 2026-09-02 eess.AS cs.SD 版本更新

SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing

SpeechEditBench:面向指令引导语音编辑的双语多属性基准

Hanlin Zhang, Daxin Tan, Dehua Tao, Xiao Chen, Haochen Tan, Linqi Song

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) AI Lab, Leibniz Research Center, Huawei(华为莱茵研究院人工智能实验室)

AI总结 提出SpeechEditBench双语多属性基准,通过锚点评估协议衡量语音编辑中目标属性的修改成功与非目标属性的保持,发现现有模型在组合编辑任务上表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03708 2026-09-02 cs.CL cs.PF 版本更新

Beyond Tokens: Semantic-Aware Speculative Decoding for Efficient Inference by Probing Internal States

超越标记:基于语义的推测解码用于通过探测内部状态实现高效的推理

Ximing Dong, Shaowei Wang, Dayi Lin, Boyuan Chen, Ahmed E. Hassan

机构 * Centre for Software Excellence, Huawei, Canada(华为加拿大软件 excellence 中心) Department of Computer Science, University of Manitoba, Canada(曼尼托巴大学计算机科学系) School of Computing, Queen’s University, Canada(皇后大学计算学院)

AI总结 SemanticSpec通过探测模型内部状态,实现基于语义的高效推测解码,提升大型推理模型的推理效率。

Comments EMNLP2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11944 2026-09-02 cs.CL cs.AI 版本更新

TopoAlign: A Framework for Aligning Code to Math via Topological Decomposition

TopoAlign:通过拓扑分解将代码对齐至数学的框架

Yupei Li, Philipp Borchert, Gerasimos Lampouras

机构 * Imperial College London(帝国学院伦敦分校) Huawei Noah’s Ark Lab(华为诺亚方舟实验室)

AI总结 本文提出TopoAlign框架,利用代码仓库作为训练资源,通过分解重组代码适配形式化数学,在DeepSeek-Math等模型上评估,显著提升了自动形式化基准性能。

Comments Accepted to EMNLP 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19935 2026-09-02 cs.LG cs.CV stat.ML 版本更新

Any-Order GPT as Masked Diffusion Model: Decoupling Formulation and Architecture

任意阶GPT作为掩码扩散模型:解耦公式与架构

Shuchen Xue, Tianyu Xie, Tianyang Hu, Zijin Feng, Jiacheng Sun, Kenji Kawaguchi, Zhenguo Li, Zhi-Ming Ma

机构 * University of Chinese Academy of Sciences(中国科学院大学) Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) School of Mathematical Sciences, Peking University(北京大学数学科学学院) National University of Singapore(新加坡国立大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

AI总结 本研究通过在仅解码器框架内评估掩码扩散模型(MDMs),解耦算法与架构因素,对比MDM与自回归范式的权衡,实现约25倍推理加速,为高效基础模型开发提供见解。

Comments ICML 2026 Oral Presentation; updated to the camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31102 2026-09-01 cs.SE cs.AI cs.LG 新提交

LLM Post-Training as Brownfield Maintenance: An Industrial Perspective on Dataware Engineering

大语言模型(LLM)后训练作为棕地维护:数据工程的工业视角

Gopi Krishnan Rajbahadur, Amir M. Ebrahimi, Boyuan Chen, Ahmed E. Hassan

机构 * Queen’s University(女王大学) Centre for Software Excellence, Huawei Technologies(华为技术有限公司软件卓越中心)

AI总结 本文从工业视角探讨LLM后训练的棕地维护挑战,提出数据制品编程的工程规范,通过案例研究表明产出优化补丁可显著提升CodeForces和LiveCodeBench的代码生成性能且无显著退化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30769 2026-09-01 cs.LG 新提交

TrainSDC: Characterizing and Mitigating Silent Data Corruption in Large Language Model Training

TrainSDC:大型语言模型训练中静默数据损坏的特征表征与缓解

Zhipeng Xia, Haotian Xu, Siyu Yun, Liqi Lin, Hu Liu, Yu Li, Cheng Zhuo

机构 * Zhejiang University(浙江大学) Huawei(华为)

AI总结 研究针对LLM训练的SDC问题,系统表征其在Transformer训练中的脆弱性,提出TrainSDC框架,经实验验证可有效缓解SDC且运行时开销较低。

Comments 12 pages, 5 figures, and 6 tables. Includes an appendix with additional experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29577 2026-09-01 cs.CV 新提交

TRINITY: A Multi-Perspective Benchmark for Personal-Style Video Highlight Detection

TRINITY:面向个人风格视频精彩片段检测的多视角基准测试集

Qianqian Chen, Hyun Bin Kim, Denzel Elden Wijaya, Yang Yi, Bo Liu, Yangkai Ding

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司)

AI总结 针对个人风格视频精彩片段检测的传统方法泛化性差的问题,提出TRINITY多视角基准测试集与对应多分支架构,在两个数据集上显著优于现有方法,验证了多视角建模的有效性。

Comments 32 pages, 9 figures. Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01777 2026-09-01 eess.SP cs.AI 版本更新

Scene-Conditioned PINN-GNN for Multipath RF Maps: Cross-Scene Generation and In-Scene Completion

场景条件PINN-GNN用于多径射频地图:跨场景生成与场景内补全

Lizhou Liu, Xiaohui Chen, Zihan Tang, Mengyao Ma, Wenyi Zhang

机构 * Department of Electronic Engineering and Information Science, University of Science and Technology of China(电子工程与信息科学系,中国科学技术大学) Wireless Technology Lab, Huawei(华为无线技术实验室)

AI总结 提出基于物理信息神经网络和图神经网络的统一射频地图构建框架,支持跨场景生成和场景内补全,采用峰值加权动态时间弯曲度量评估多径重建质量,实验表明优于多种基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31378 2026-09-01 cs.CL 版本更新

Unlocking Fine-Grained Translation Quality Estimation in LRMs through Mutually Boosting Implicit and Explicit Reasoning

解锁大型推理模型中细粒度翻译质量评估:通过协同演化隐式和显式推理

Renfei Dang, Xinye Wang, Zhejian Lai, Weilu Xu, Shimin Tao, Daimeng Wei, Min Zhang, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Huawei Translation Services Center, Beijing, China(北京华为翻译服务中心)

AI总结 针对大型推理模型在细粒度翻译质量评估上的困难,提出RIEQE两阶段训练框架,通过非思考监督微调(隐式推理)和思考强化学习(显式推理)协同演化,在WMT测试集上超越基线。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04545 2026-09-01 cs.LG math.ST stat.TH 版本更新

Branch Scaling Manifests as Implicit Architectural Regularization for Improving Generalization in Overparameterized ResNets

分支缩放表现为隐式架构正则化以改善过参数化ResNet的泛化能力

Zixiong Yu, Guhan Chen, Jianfa Lai, Bohan Li, Songtao Tian

机构 * Huawei Large Model Data Technology Lab, Shenzhen(华为大模型数据技术实验室,深圳) Tsinghua University, Beijing(清华大学,北京) Kyoto University, Kyoto(京都大学,京都)

AI总结 本文研究残差网络中分支缩放因子对过参数化ResNet泛化性能的影响,通过理论分析证明快速深度衰减的缩放因子结合早停可实现极小极大最优泛化率,并利用神经正切核(NTK)近似解释其机制。

Comments Accepted by ICML 2026. This version incorporates content from the preprint arXiv:2305.18506. The contributors of the relevant content have consented to its inclusion and have been listed as authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26380 2026-09-01 cs.CL 版本更新

Switch Attention: Towards Dynamic and Fine-grained Hybrid Transformers

切换注意力:面向动态和细粒度的混合变换器

Yusheng Zhao, Hourun Li, Bohan Wu, Yichun Yin, Lifeng Shang, Jingyang Yuan, Meng Zhang, Ming Zhang

机构 * State Key Laboratory for Multimedia Information Processing(多媒体信息处理国家重点实验室) School of Computer Science, PKU-Anker LLM Lab, Peking University(计算机科学学院,PKU-Anker LLM实验室,北京大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

AI总结 本文提出Switch Attention,一种动态路由全注意力与滑动窗口注意力的混合变换器,通过自适应正则化和持续预训练提升长上下文语言模型的效率与性能。

Comments EMNLP 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14211 2026-09-01 cs.NI cs.AI

PRATA: A Framework to Enable Predictive QoS in Vehicular Networks via Artificial Intelligence

Federico Mason, Tommaso Zugno, Matteo Drago, Marco Giordani, Mate Boban, Michele Zorzi

机构 * Department of Information Engineering (DEI) of the University of Padova(帕多瓦大学信息工程系) Huawei Technologies, Munich Research Center(华为技术有限公司慕尼黑研究中心)

Journal ref IEEE Transactions on Communications, vol. 73, no. 11, pp. 10764-10777, Nov. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19634 2026-09-01 cs.CV 版本更新

Keyframe-Centric State-Space Modeling for Burst Image Super-Resolution

面向爆发图像超分辨率的以关键帧为中心的状态空间建模

Ozan Unal, Steven Marty, Dengxin Dai

机构 * Huawei Research Center(华为研究中心)

AI总结 本研究提出BurstMamba架构,通过解耦关键帧超分辨率流与轻量级爆发流,结合GAS机制和小波条件路由,在多个BISR数据集上实现了最先进性能,提升了计算效率与可扩展性。

Comments Accepted at SIGGRAPH Asia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27998 2026-08-31 cs.AI 新提交

Automated Analysis Framework for Multilingual Climate-Health Literature Based on Multi-Agent Large Language Model

基于多智能体大语言模型的多语言气候-健康文献自动分析框架

Yuze Sun, Shihui Zhang, Jiancheng Pan, Yunjia Ye, Wentao Luo, Jiahao Li, Quan Zhang, Wenjia Cai, Xiaomeng Huang

机构 * Tsinghua University(清华大学) Huawei Technologies Co., Ltd(华为技术有限公司) Renmin University of China(中国人民大学) Beijing Forestry University(北京林业大学) National Institute of Natural Hazards, Ministry of Emergency Management of China(中国应急管理部国家自然灾害防治研究院)

AI总结 针对多语言气候-健康文献分析痛点,提出多智能体大语言模型自动分析框架,经双语语料验证核心信息提取F1值达0.92,可支撑该领域大规模证据挖掘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27992 2026-08-31 cs.AI cs.MA 新提交

GOD: Govern, Observe, and Direct - A Real-Time Control Room for Agent Societies

GOD:管控、观测与指挥——智能体群体的实时控制室

Yige Luo, Ran Guan

机构 * Laboratories, Huawei(华为2012实验室)

AI总结 研究针对生成式智能体系统难检查的问题,提出GOD实时控制室,整合多类工具与技术,经15次运行评估验证其干预有效性,可助力智能体群体的管控与观测。

Comments 9 pages, 5 figures. Accepted to the EMNLP 2026 System Demonstrations Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27969 2026-08-31 cs.AI 新提交

openJiuwen: Beyond Static Harnesses for Long-Horizon Coding Agents

openJiuwen:超越静态框架的长程编码智能体

openJiuwen Team, Tao Yu, Xinyu Zhang, Qianqian Chen, Xiaoneng Xiang, Chia Kwangyang, Xingchen Huang, Ran Chen, Yangkai Ding, Zheng Wang, Yeo Boon Hong, Bingzheng Gan, Enrui Hu, Shuo Cheng, Deyang Li, Ruifeng Shi, Hongbo Wang, Qi Ye, Xuefeng Jin, Zhangchun Zhao

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司)

AI总结 openJiuwen是一款开源智能体框架,针对长程编码智能体的结构可组合性与运行时适应性挑战设计,在SWE-bench Verified和Terminal-Bench 2.1上的准确率分别达82.6%、87.19%,性能优于官方排行榜顶尖方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27351 2026-08-31 cs.LG 版本更新

Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO

理解用于大语言模型推理的进化策略:比GRPO更广泛的推理覆盖范围

Yunpeng Ba, Zhi Zheng, Yue Xie, Jiaqing Li, Xialiang Tong, Tao Zhong, Mingxuan Yuan, Zhichao Lu, Xuyang Wu, Zhenkun Wang

机构 * Southern University of Science and Technology(南方科技大学) National University of Singapore(新加坡国立大学) Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海)) Huawei Noah’s Ark Lab(华为诺亚方舟实验室) City University of Hong Kong(香港城市大学)

AI总结 本文研究用于LLM推理的进化策略(ES),发现ES比GRPO有更广泛的推理覆盖范围,开发了结合两者优势的GRPO-ES策略,还揭示了ES的功能稀疏性等特性,确立其为独特的推理后训练范式。

详情

展开后加载摘要…

URL PDF HTML 收藏