arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Learning Representations · 会议 · Machine Learning

共收录 9451
2506.12119 2026-05-19 cs.CL cs.AI

Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource

专家混合模型可在严格相等资源下超越密集语言模型

Houyi Li, Ka Man Lo, Shijie Xuyang, Ziqi Wang, Wenzhen Zheng, Haocheng Zhang, Zhao Li, Shuigeng Zhou, Xiangyu Zhang, Daxin Jiang

机构 * Fudan University(复旦大学) StepFun University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学)

AI总结 本文研究在资源相等条件下MoE模型是否能超越密集模型,提出优化框架并验证了在最优激活率下MoE模型性能更优,且该区域在不同模型规模下一致,通过数据重用解决数据量增加的权衡问题。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19590 2026-05-19 cs.LG cs.CL

Learning to Reason without External Rewards

无需外部奖励的学习推理

Xuandong Zhao, Zhewei Kang, Aosong Feng, Sergey Levine, Dawn Song

机构 * UC Berkeley(加州大学伯克利分校) Yale University(耶鲁大学)

AI总结 本文提出Intuitor方法,通过内在反馈实现无需外部奖励的自主学习,实验表明其在数学基准和代码生成等任务中表现优异,为无监督学习提供了新途径。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19950 2026-05-19 cs.LG cs.AI cs.CL

LogQuant: Log-Distributed 2-Bit Quantization of KV Cache with Superior Accuracy Preservation

LogQuant: 一种基于对数分布的2位KV缓存量化技术,具有更优异的精度保持性能

Han Chen, Zicong Jiang, Zining Zhang, Bingsheng He, Pingyi Luo, Mian Lu, Yuqiang Chen

机构 * Paradigm(4Paradigm)

AI总结 LogQuant通过基于对数的过滤机制实现KV缓存的2位量化,减少内存占用的同时保持高性能,实验表明其在吞吐量、批处理大小和准确性上均优于现有方法。

Comments Accepted by ICLR 2025 Workshop on Sparsity in LLMs (SLLM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16292 2026-05-19 cs.CY cs.AI

Evidence of a Cognitive Shift in AI Education: How Students Are Rethinking Human Intelligence?

人工智能教育中认知转变的证据:学生如何重新思考人类智能?

Islem Rekik

机构 * BASIRA Lab, Imperial-X (I-X) and Department of Computing(BASIRA实验室、Imperial-X(I-X)和计算系) Imperial College London, London, United Kingdom(伦敦帝国学院,伦敦,英国)

AI总结 研究通过长期分析发现,学生对人工智能和人类智能的评价随时间推移逐渐转变,从2020年偏爱AI到2026年多数学生更重视人类智能。

Comments ICLR HCAIR Workhop 2026 https://openreview.net/forum?id=chH4gO2tZT

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16054 2026-05-18 cs.LG cs.AI

Ada-Diffuser: Latent-Aware Adaptive Diffusion for Decision-Making

Ada-Diffuser: 面向决策制定的潜在意识自适应扩散模型

Fan Feng, Selena Ge, Minghao Fu, Zijian Li, Yujia Zheng, Zeyu Tang, Yingyao Hu, Biwei Huang, Kun Zhang

机构 * University of California San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学) MBZUAI Stanford University(斯坦福大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出Ada-Diffuser,通过显式建模潜在动态过程,提升决策制定的精度与适应性,实验验证其在模拟控制与机器人基准中的有效性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22151 2026-05-18 cs.CV cs.CL

MultiMat: Multimodal Program Synthesis for Procedural Materials using Large Multimodal Models

MultiMat: 多模态程序合成用于基于过程的材料生成

Jonas Belouadi, Tamy Boubekeur, Adrien Kaiser

机构 * University of Mannheim(曼海姆大学) Adobe Research(Adobe研究)

AI总结 MultiMat利用大规模多模态模型实现多模态程序合成,提升生成过程材料图的效率与视觉质量,优于纯文本基线方法。

Comments Accepted at ICLR 2026 (poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18522 2026-05-18 stat.ML cs.LG

Extrapolation Guarantees for Perturbation Modeling Under the Additive Latent Shift Assumption

在加性潜在位移假设下对扰动建模的外推保证

Julius von Kügelgen, Jakob Ketterer, Michael Vollenweider, Michael Scholkemper, Xinwei Shen, Nicolai Meinshausen, Jonas Peters

机构 * Seminar for Statistics, ETH Zurich(统计系,苏黎世联邦理工学院) ETH Zurich(苏黎世联邦理工学院) DZNE, Bonn, Germany(波恩德国DZNE) Department of Statistics, University of Washington, Seattle, USA(华盛顿大学统计系,美国西雅图)

AI总结 本文研究了在加性潜在位移假设下,通过扰动建模预测新扰动组合的分布,提出PDAE模型并证明了外推保证。

Comments Updated preprint with new material and empirical results; previous version presented at the ICLR'25 Workshop on Learning Meaningful Representations of Life

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19241 2026-05-18 cs.LG cs.AI

ActiveDPO: Active Direct Preference Optimization for Sample-Efficient Alignment

ActiveDPO: 用于高效对齐的主动直接偏好优化

Xiaoqiang Lin, Arun Verma, Zhongxiang Dai, Daniela Rus, See-Kiong Ng, Bryan Kian Hsiang Low

机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系) Singapore-MIT Alliance for Research and Technology Centre(新加坡-麻省理工联盟研究技术中心) The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)) CSAIL, Massachusetts Institute of Technology(麻省理工学院计算机科学与人工智能实验室) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究院)

AI总结 ActiveDPO通过理论支撑的非线性奖励函数选择方法,利用LLM自身参数化奖励模型,提升对齐效率和数据收集效果。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01990 2026-05-18 cs.LG cs.CE

Deep Learning Alternatives of the Kolmogorov Superposition Theorem

Kolmogorov超位置定理的深度学习替代方案

Leonardo Ferreira Guilhoto, Paris Perdikaris

机构 * Graduate Group in Applied Mathematics and Computational Science(应用数学与计算科学联合研究生组) University of Pennsylvania(宾夕法尼亚大学) Department of Mechanical Engineering & Applied Mechanics(机械工程与应用力学系)

AI总结 本文探讨了Kolmogorov超位置定理的替代形式,提出ActNet模型克服原有形式的缺陷,在PINNs框架中表现优异,适用于科学计算和PDE模拟。

Journal ref Guilhoto, Leonardo Ferreira, and Paris Perdikaris. "Deep Learning Alternatives Of The Kolmogorov Superposition Theorem." The Thirteenth International Conference on Learning Representations (ICLR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14984 2026-05-15 cs.CV cs.AI

Sat3DGen: Comprehensive Street-Level 3D Scene Generation from Single Satellite Image

Sat3DGen:从单张卫星图像生成全面的街景3D场景

Ming Qian, Zimin Xia, Changkun Liu, Shuailei Ma, Wen Wang, Zeran Ke, Bin Tan, Hang Zhang, Gui-Song Xia

机构 * LIESMARS & School of Artificial Intelligence, Wuhan University(珞珈实验室与武汉大学人工智能学院) EPFL(苏黎世联邦理工学院) HKUST(香港科技大学) Northeastern University(东北大学) Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Amap, Alibaba Group(高德地图,阿里巴巴集团)

AI总结 本文提出Sat3DGen,通过几何优先方法提升从单张卫星图像生成高精度3D场景的性能,改进几何精度和真实感,并在新基准上验证其效果。

Comments ICLR 2026; code: https://github.com/qianmingduowan/Sat3DGen demo: https://huggingface.co/spaces/qian43/Sat3DGen project page: https://qianmingduowan.github.io/Sat3DGen_project_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11845 2026-05-15 cs.SD cs.AI cs.IR cs.LG

AVEX: What Matters for Animal Vocalization Encoding

AVEX:动物发声编码中什么因素至关重要

Marius Miron, David Robinson, Milad Alizadeh, Ellen Gilsenan-McMahon, Gagan Narula, Emmanuel Chemla, Maddie Cusimano, Felix Effenberger, Masato Hagiwara, Benjamin Hoffman, Sara Keen, Diane Kim, Jane Lawton, Jen-Yu Liu, Aza Raskin, Olivier Pietquin, Matthieu Geist

机构 * Earth Species Project(地球物种项目)

AI总结 本文通过大规模实验研究,探讨了生物声学编码中训练数据多样性、模型架构及评估任务的重要性,发现自监督预训练结合监督后训练在多种任务中表现最佳。

Comments In The Fourteenth International Conference on Learning Representations 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14779 2026-05-15 cs.LG

Peng's Q($λ$) for Conservative Value Estimation in Offline Reinforcement Learning

彭的Q(λ)在离线强化学习中的保守价值估计

Byeongchan Kim, Min-hwan Oh

机构 * Seoul National University(首尔国立大学)

AI总结 本文提出了一种基于离线多步强化学习的算法CPQL,通过保守价值估计替代贝尔曼算子,实现了更优的性能保证和鲁棒性改进。

Comments Accepted in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14553 2026-05-15 cs.LG cs.AI

Efficient Multi-objective Prompt Optimization via Pure-exploration Bandits

通过纯探索老虎机实现高效的多目标提示优化

Donghao Li, Chengshuai Shi, Weijuan Ou, Cong Shen, Jing Yang

机构 * University of Virginia(弗吉尼亚大学) Princeton University(普林斯顿大学) Southern University of Science and Technology(南方科技大学)

AI总结 本文研究多目标提示选择问题,提出基于纯探索老虎机框架的高效方法,通过理论保证和实验验证,改进了提示优化的效率和效果。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14537 2026-05-15 cs.AI

Cattle Trade: A Multi-Agent Benchmark for LLM Bluffing, Bidding, and Bargaining

牛市交易:一种多智能体基准,用于评估大语言模型在战略推理、对抗互动和资源约束下的表现

Robert Müller, Clemens Müller

AI总结 本文提出Cattle Trade基准,用于评估大语言模型在多智能体经济游戏中整合战略推理、对抗互动和资源分配的能力,揭示了智能体在资源管理与对抗策略中的表现差异。

Comments malgai workshop at iclr 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21809 2026-05-15 cs.LG cs.AI q-bio.QM stat.ML

Quotient-Space Diffusion Models

商空间扩散模型

Yixian Xu, Yusong Wang, Shengjie Luo, Kaiyuan Gao, Tianyu He, Di He, Chang Liu

机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Beijing, China(一般人工智能国家重点实验室,北京大学,北京,中国) Huazhong University of Science and Technology, Wuhan, China(华中科技大学,武汉,中国) Microsoft Research Asia, Beijing, China(微软亚洲研究院,北京,中国) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国)

AI总结 本文提出商空间扩散模型,通过处理对称性来提升生成模型性能,优于等变模型和对齐方法,在分子结构生成中表现更佳。

Comments ICLR 2026 Oral Presentation; 43 pages, 5 figures, 6 tables; ICLR 2026 Camera Ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17548 2026-05-15 cs.LG math.AT stat.ML

Contraction and Hourglass Persistence for Learning on Graphs, Simplices, and Cells

收缩与hourglass持久性用于图、单纯形和细胞上的学习

Mattie Ji, Indradyumna Roy, Vikas Garg

机构 * University of Pennsylvania(宾夕法尼亚大学) Aalto University(艾尔沃斯大学) Indian Institute of Technology Bombay(印度班加罗尔理工学院) YaiYai Ltd(YaiYai公司)

AI总结 本文提出收缩同调和hourglass持久性,通过结合包含和收缩操作提升图神经网络的表达能力与稳定性,适用于图、单纯形和细胞网络。

Comments 31 pages, 6 figures, 4 algorithms, 2 tables. Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11871 2026-05-15 cs.CL cs.LG

DMAP: A Distribution Map for Text

DMAP:文本的分布图

Tom Kempton, Julia Rozanova, Parameswaran Kamalaruban, Maeve Madigan, Karolina Wresilo, Yoann L. Launay, David Sutton, Stuart Burrell

机构 * University of Manchester, UK(曼彻斯特大学,英国) Featurespace, a Visa Solution(Visa解决方案的Featurespace) Risk and Security AI Lab, Visa Inc., UK(Visa公司的风险与安全AI实验室,英国) University of Cambridge, UK(剑桥大学,英国)

AI总结 DMAP通过语言模型将文本映射到单位区间内的样本集,编码排名和概率信息,用于高效分析文本并支持多种应用,包括生成参数验证和机器生成文本检测。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11855 2026-05-15 cs.LG cs.AI

Achieving Approximate Symmetry Is Exponentially Easier than Exact Symmetry

实现近似对称性比实现精确对称性要指数级更容易

Behrooz Tahmasebi, Melanie Weber

机构 * Harvard John A. Paulson School of Engineering and Applied Sciences(哈佛大学约翰·A·保罗森工程与应用科学学院) Harvard University(哈佛大学)

AI总结 本文研究了精确对称性和近似对称性在机器学习中的成本差异,提出平均复杂度框架,证明精确对称性需要线性复杂度而近似对称性仅需对数复杂度,首次理论区分了两者。

Comments 33 pages, 2 figures. Published at ICLR 2026

Journal ref International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25240 2026-05-15 stat.ML cs.LG

Generative Bayesian Optimization: Generative Models as Acquisition Functions

生成贝叶斯优化:生成模型作为获取函数

Rafael Oliveira, Daniel M. Steinberg, Edwin V. Bonilla

机构 * CSIRO’s Data61(CSIRO的数据61)

AI总结 本文提出利用生成模型作为批量贝叶斯优化的候选解采样器,通过直接优化偏好信号生成高效的获取函数,适用于高维和组合优化问题。

Comments Published at ICLR 2026. Compared with the proceedings version on OpenReview, this version includes a minor revision to Section 3

Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15982 2026-05-15 cs.LG cs.AI

AMiD: Knowledge Distillation for LLMs with $α$-mixture Assistant Distribution

AMiD: 基于 α-混合助手分布的大型语言模型知识蒸馏

Donghyeok Shin, Yeongmin Kim, Suhyeon Jo, Byeonghu Na, Il-Chul Moon

机构 * Korea Advanced Institute of Science and Technology(韩国先进科学研究院)

AI总结 本文提出AMiD框架,通过引入α-混合助手分布解决LLM知识蒸馏中的容量差距和训练不稳定问题,提供更广泛的理论基础和更稳定的训练效果。

Comments The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13583 2026-05-15 stat.ML cs.LG

On the Identifiability of Causal Graphs with the Invariance Principle

关于基于不变原理的因果图可识别性

Francesco Montagna

机构 * Institute of Science and Technology Austria(奥地利科学与技术研究所) Chan Zuckerberg Initiative(查兰·泽克伯格倡议)

AI总结 本文证明在特定条件下,通过少量环境数据可唯一确定因果图结构,提出放松高斯噪声假设的方法,并扩展独立成分分析与因果发现的对偶性。

Comments Published as ICLR 2026 conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04682 2026-05-15 cs.CL cs.AI

TiTok: Transfer Token-level Knowledge via Contrastive Excess to Transplant LoRA

TiTok: 通过对比超额迁移LoRA

Chanjoo Jung, Jaehyung Kim

机构 * Yonsei University(延世大学)

AI总结 TiTok通过token级知识迁移实现有效LoRA迁移,利用源模型有无LoRA的token对比超额提取任务相关信息,无需额外模型即可选择性过滤合成数据,在多个迁移设置中实现平均+4~10%的性能提升。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01172 2026-05-15 cs.CL

Energy-Regularized Sequential Model Editing on Hyperspheres

超球面能量正则化的序列模型编辑

Qingyuan Liu, Jia-Chen Gu, Yunzhi Yao, Hong Wang, Nanyun Peng

机构 * Columbia University(哥伦比亚大学) University of California, Los Angeles(加州大学洛杉矶分校) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出SPHERE方法,通过超球面能量正则化提升模型在序列编辑中的稳定性与知识保留能力,实验表明其在编辑性能上优于基线方法16.41%。

Comments Accepted by ICLR 2026. The code is available at https://github.com/PlusLabNLP/SPHERE. Project page: https://www.qingyuanliu.net/sphere_projectpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00757 2026-05-15 cs.LG

LEAP: Local ECT-Based Learnable Positional Encodings for Graphs

LEAP: 图形中的基于ECT的可学习位置编码

Juan Amboage, Ernst Röell, Patrick Schnider, Bastian Rieck

机构 * AIDOS Lab, University of Fribourg(弗里堡大学AIDOS实验室) Institute of AI for Health, Helmholtz Munich(慕尼黑亥姆霍兹人工智能与健康研究所) Technical University of Munich(慕尼黑技术大学) Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系) Department of Computer Science, University of Basel(巴塞尔大学计算机科学系)

AI总结 LEAP通过结合可微近似ECT和其局部变体,提出了一种新的端到端可训练的局部结构位置编码方法,用于图神经网络,以提高图表示学习的效果。

Comments Accepted at the International Conference on Learning Representations (ICLR) 2026. Our code is available https://www.github.com/aidos-lab/LEAP

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22746 2026-05-15 cs.AI cs.CV

Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning

视觉思维混合:探索上下文自适应推理模式选择用于通用视觉推理

Zejun Li, Yingxiu Zhao, Jiwen Zhang, Siyuan Wang, Yang Yao, Runzhou Zhao, Jun Song, Bo Zheng, Zhongyu Wei

机构 * Fudan University(复旦大学) Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) Future Living Lab of Alibaba(阿里巴巴未来生活实验室) University of Southern California(南加州大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文提出MoVT框架,通过AdaVaR实现多模式统一学习与上下文自适应选择,提升通用视觉推理能力。

Comments 27 pages, 11 figures, 5 tables, accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01916 2026-05-15 cs.LG cs.AI cs.CL

Decomposing Representation Space into Interpretable Subspaces with Unsupervised Learning

将表示空间分解为可解释的子空间 with 无监督学习

Xinting Huang, Michael Hahn

机构 * Saarland University(萨尔兰大学)

AI总结 本文通过无监督学习方法分解神经网络表示空间,发现不同输入方面在独立子空间中组织,揭示模型内部结构与可解释变量之间的联系。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16608 2026-05-15 cs.LG cs.AI

Distributions as Actions: A Unified Framework for Diverse Action Spaces

分布作为动作:多样化动作空间的统一框架

Jiamin He, A. Rupam Mahmood, Martha White

机构 * Department of Computing Science University of Alberta(计算科学系阿尔伯塔大学) Alberta Machine Intelligence Institute (Amii)(阿尔伯塔机器智能研究所(Amii)) CIFAR AI Chair, Amii(CIFAR人工智能主席,Amii)

AI总结 本文提出了一种新型强化学习框架,将参数化动作分布视为动作,重新定义了智能体与环境的边界。通过这种重新参数化,新的动作空间连续,无论原始动作类型如何。基于此,开发了通用确定性策略梯度估计器DA-PG,并提出DA-AC算法,在多种控制场景中表现优异。

Comments Accepted to ICLR 2026 (camera-ready)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14075 2026-05-15 cs.LG cs.CL

Rethinking Layer Relevance in Large Language Models Beyond Cosine Similarity

重新思考超越余弦相似度的大型语言模型层相关性

Cristian Hinostroza, Rodrigo Toro Icarte, Christ Devia, Andres Carvallo De Ferari, Eugenio Herrera-Berg, Denis Parra, Jorge F Silva

机构 * Pontificia Universidad Católica de Chile(天主教智利大学) National Center for Artificial Intelligence (CENIA)(人工智能国家中心) Universidad de Chile(智利大学)

AI总结 本文指出余弦相似度不适合作为评估层移除影响的指标,提出基于模型准确率下降的实际指标,以更准确地评估层重要性,改进模型压缩策略。

Comments Published at ICLR 2026

Journal ref Proceedings of the International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09115 2026-05-15 cs.CV

SuperF: Neural Implicit Fields for Multi-Image Super-Resolution

SuperF:基于神经隐式场的多图像超分辨率

Sander Riisøen Jyhne, Christian Igel, Morten Goodwin, Per-Arne Andersen, Serge Belongie, Nico Lang

机构 * University of Agder(阿格德大学) University of Copenhagen(哥本哈根大学)

AI总结 本文提出SuperF,一种基于神经隐式场的多图像超分辨率方法,通过共享隐式神经表示并联合优化帧对齐,实现无需高分辨率训练数据的超分辨率提升。

Comments Published at ICLR 2026, Project website: https://sjyhne.github.io/superf/, 23 pages, 13 figures, 8 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07805 2026-05-15 cs.LG cs.AI cs.CL

Group Representational Position Encoding

群表示位置编码

Yifan Zhang, Zixiang Chen, Yifeng Liu, Zhen Qin, Huizhuo Yuan, Kangping Xu, Yang Yuan, Quanquan Gu, Andrew Chi-Chih Yao

机构 * Princeton University(普林斯顿大学) University of California, Los Angeles(加州大学洛杉矶分校) IIIS, Tsinghua University(清华大学人工智能研究院)

AI总结 GRAPE提出了一种基于群作用的位置编码框架,结合乘法旋转和加法logit偏置机制,扩展了RoPE和ALiBi的应用范围,适用于长上下文模型的位置几何设计。

Comments Published in ICLR 2026. Project Page: https://github.com/model-architectures/GRAPE

详情

展开后加载摘要…

URL PDF HTML 收藏