arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Machine Learning · 会议 · Machine Learning

2026-08-31 至 2026-08-31 共收录 5
2606.17399 2026-08-31 cs.LG cs.AI 版本更新

The Discrete-Log Clock: How a Transformer Learns Modular Multiplication

离散对数时钟:Transformer如何学习模乘法

Huu Danh Nguyen

机构 * Stanford University(斯坦福大学)

AI总结 通过乘法特征变换分析,发现Transformer在模乘法任务中学习到稀疏的傅里叶谱,其嵌入和MLP神经元主要编码少数乘法频率,表明模型实现了离散对数空间中的加法运算,即“离散对数时钟”算法。

Comments 5 pages, 5 figures. Accepted to the Mechanistic Interpretability Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21766 2026-08-31 cs.CL cs.AI 版本更新

CoFrGeNet: Continued Fraction Architectures for Language Generation

CoFrGeNet:用于语言生成的连分式架构

Amit Dhurandhar, Vijil Chenthamarakshan, Dennis Wei, Tejaswini Pedapati, Karthikeyan Natesan Ramamurthy, Rahul Nair

机构 * IBM Research(IBM研究院)

AI总结 受连分式启发,提出CoFrGeNet架构,用新函数类替换Transformer中的多头注意力和前馈网络,在参数量减少1/2至2/3的情况下,在下游分类、问答、推理和文本理解任务上达到或超越原模型性能。

Comments Earlier version accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08577 2026-08-31 cs.CL cs.AI cs.LG cs.PF 版本更新

Think-at-Hard: Dynamic Looped Transformers for Improved Reasoning

Think-at-Hard: 选择性潜在迭代以改进推理语言模型

Tianyu Fu, Yichen You, Zekai Chen, Guohao Dai, Huazhong Yang, Yu Wang

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 针对循环变压器中潜在过思考问题,提出Think-at-Hard方法,通过轻量级决策器选择性地在困难令牌上触发潜在迭代,并采用深度感知LoRA和双因果注意力机制,在数学、问答和编码任务上一致提升性能。

Comments Accepted by ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20111 2026-08-31 cs.LG cs.AI 版本更新

Var-JEPA: A Variational Formulation of the Joint-Embedding Predictive Architecture - Bridging Predictive and Generative Self-Supervised Learning

Var-JEPA:联合嵌入预测架构的变分公式——弥合预测性和生成性自监督学习

Moritz Gögl, Christopher Yau

机构 * University(大学) Health Data Research UK(英国健康数据研究)

AI总结 本文提出Var-JEPA,通过优化单个ELBO显式化潜在生成结构,实现有意义的表示并允许潜在空间的不确定性量化,同时在表格数据上取得优于T-JEPA且与强基线模型竞争的性能。

Comments Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04208 2026-08-31 cs.RO cs.AI cs.LG 版本更新

SCALE: Self-uncertainty Conditioned Adaptive Looking and Execution for Vision-Language-Action Models

SCALE: 基于自不确定性条件自适应观察与执行的视觉-语言-动作模型

Hyeonbeom Choi, Daechul Ahn, Youhan Lee, Taewook Kang, Seongwon Cho, Jonghyun Choi

机构 * Seoul National University(首尔国立大学)

AI总结 提出SCALE推理策略,利用自不确定性联合调节视觉感知和动作,无需额外训练或验证器,仅单次前向传播,提升VLA模型在模拟和真实环境中的鲁棒性。

Comments ICML 2026 Spotlight. Project page: this https URL (https://dcahn12.github.io/projects/scale/)

详情

展开后加载摘要…

URL PDF HTML 收藏