arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~
arXiv 2610.02791math.OC

在高阶光滑性下寻找驻点:陷阱算法与一阶下界

Finding Stationary Points under Higher-Order Smoothness: Trapping Algorithms and First-Order Lower Bounds

Huanjian Zhou, Masashi Sugiyama, Taiji Suzuki

首次发表
浏览论文内容

中文总结 AI 辅助

本研究针对高阶光滑目标函数,提出陷阱算法与陷阱或下降框架,给出仅用函数值或梯度的近似驻点查询复杂度上界,并证明高维下仅用梯度的随机化下界。

中文摘要 AI 辅助

我们研究了在高阶光滑性下,仅使用函数值或仅使用梯度来寻找近似驻点的查询复杂度。我们的结果涵盖了不同维度、预言机模型、随机化以及约束条件。对于常数维度 $d$ 和 $C^{p,\beta_p}$ 目标函数,其中 $\nu:=p+\beta_p$,我们给出了确定性的函数值-梯度陷阱算法,在 $\mathbb R^d$ 上的查询复杂度为 $O(\varepsilon^{-(d-1)})$,在 $[0,1]^d$ 上的查询复杂度为 $O(\varepsilon^{-(d-1)/\nu})$。高阶线积分使得仅使用梯度的陷阱成为可能。对于二维 $C^{1,1}$ 目标函数,随机化积分在 $\mathbb R^2$ 上产生 $O(\varepsilon^{-4/3})$ 的梯度查询,打破了确定性仅梯度方法的 $\Theta(\varepsilon^{-2})$ 障碍。对于一般维度,我们引入了一个陷阱或下降框架,该框架惰性地重用边界模型。对于 $p\ge2$ 的 $C^{p,\beta_p}$ 目标函数,它使用函数值实现了确定性查询复杂度 $O(d^p+d^{p-1+\beta_p/(\nu-1)} \varepsilon^{-\nu/(\nu-1)})$,使用梯度实现了 $O(d^{p-1}+d^{p-2+\beta_p/(\nu-1)} \varepsilon^{-\nu/(\nu-1)})$。这些界限适用于 $\mathbb R^d$ 上的近似驻点和 $[0,1]^d$ 上的近似 KKT 点。当 $\beta_p=1$ 时,它们的维度无关精度指数与经典 AR$p$ 指数 $(p+1)/p$ 相匹配。对于足够高的维度,我们证明了仅使用梯度方法的随机化下界。对于 $C^{1,1}\cap C^{p,1}$ 目标函数,我们的下界为 $\Omega(\varepsilon^{-(3/2+1/(2p))})$,与 $p=2$ 的已知上界匹配,并且在 $p=3$ 时达到对数因子。在没有 $C^{1,1}$ 假设的情况下,对于每个固定的 $p\ge3$,我们获得 $\Omega(\varepsilon^{-5/3})$ 的下界。

英文摘要

We study the query complexity of finding approximate stationary points under higher-order smoothness using only function values or only gradients. Our results cover different dimensions, oracle models, randomization, and constraints. For constant dimension $d$ and $C^{p,β_p}$ objectives, with $ν:=p+β_p$, we give deterministic function-value gradient trapping algorithms with query complexities $O(\varepsilon^{-(d-1)})$ on $\mathbb R^d$ and $O(\varepsilon^{-(d-1)/ν})$ on $[0,1]^d$. High-order line integration enables gradient-only trapping. For two-dimensional $C^{1,1}$ objectives, randomized integration yields $O(\varepsilon^{-4/3})$ gradient queries on $\mathbb R^2$, breaking the deterministic gradient-only $Θ(\varepsilon^{-2})$ barrier. For general dimension, we introduce a trapping-or-descent framework that lazily reuses boundary models. For $C^{p,β_p}$ objectives with $p\ge2$, it achieves deterministic query complexities $O(d^p+d^{p-1+β_p/(ν-1)} \varepsilon^{-ν/(ν-1)})$ using function values and $O(d^{p-1}+d^{p-2+β_p/(ν-1)} \varepsilon^{-ν/(ν-1)})$ using gradients. These bounds apply to approximate stationary points on $\mathbb R^d$ and approximate KKT points on $[0,1]^d$. Their dimension-independent accuracy exponent matches the classical AR$p$ exponent $(p+1)/p$ when $β_p=1$. For sufficiently high dimension, we prove randomized lower bounds for gradient-only methods. For $C^{1,1}\cap C^{p,1}$ objectives, our lower bound is $Ω(\varepsilon^{-(3/2+1/(2p))})$, matching known upper bounds for $p=2$ and, up to logarithmic factors, for $p=3$. Without the $C^{1,1}$ assumption, we obtain an $Ω(\varepsilon^{-5/3})$ lower bound for every fixed $p\ge3$.

发表机构

  • The University of Tokyo(东京大学)
  • RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心)

机构由 AI 辅助整理,请以论文原文为准。

补充信息

↑