arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Machine Learning · 会议 · Machine Learning

2026-08-31 至 2026-08-31 共收录 8
2608.27785 2026-08-31 cs.CL cs.AI 新提交

Compositional Failure in Audio-Visual LLMs: Late-Layer Prior Dominance Under Cross-modal Conflict

音频-视觉大型语言模型中的组合式失效:跨模态冲突下的深层先验主导

Adarsh Sudheer, David Li, Omar Elbanna, Ishaan Kodarapu, Arjun Bahuguna, Vasu Sharma

AI总结 本研究针对AV-LLMs,以音频-视觉冲突为组合泛化测试,发现模型存在先验主导的组合式失效,开展可解释性分析并验证时间对齐无法提升冲突解决能力,提供了相关代码与数据。

Comments Accepted to the 2nd Workshop on Compositional Learning at ICML 2026. 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27504 2026-08-31 cs.CR 新提交

Circuit Discovery Helps Detect LLM Jailbreaking: A Mechanistic Interpretability Study

电路发现助力检测大语言模型越狱:一项机制可解释性研究

Paria Mehrbod, Boris Knyazev, Guy Wolf, Eugene Belilovsky, Geraldin Nanfack

AI总结 本研究通过机制可解释性分析,在LLaMA-2-7B-chat-hf中识别出负责越狱响应的关键计算电路,剪枝这些电路可降低80%攻击成功率,为对齐LLMs的防御提供了可解释的新方向。

Comments Accepted at the 2nd Workshop on Reliable and Responsible Foundation Models of the 42nd International Conference on Machine Learning (ICML) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27460 2026-08-31 cs.CL cs.LG 新提交

Accelerating LLM Inference via Vector Index Based Output Embeddings

基于向量索引的输出嵌入加速大语言模型推理

Martin Loretz, Sepp Hochreiter

AI总结 该研究针对大语言模型推理时的输出嵌入内存瓶颈,提出用基于HNSW的向量索引替代稠密词汇投影,在保持生成质量的同时,使Gemma 3 270M的端到端解码吞吐量提升最高达82%。

Comments ICML 2026 - AdaptFM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17399 2026-08-31 cs.LG cs.AI 版本更新

The Discrete-Log Clock: How a Transformer Learns Modular Multiplication

离散对数时钟:Transformer如何学习模乘法

Huu Danh Nguyen

机构 * Stanford University(斯坦福大学)

AI总结 通过乘法特征变换分析,发现Transformer在模乘法任务中学习到稀疏的傅里叶谱,其嵌入和MLP神经元主要编码少数乘法频率,表明模型实现了离散对数空间中的加法运算,即“离散对数时钟”算法。

Comments 5 pages, 5 figures. Accepted to the Mechanistic Interpretability Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21766 2026-08-31 cs.CL cs.AI 版本更新

CoFrGeNet: Continued Fraction Architectures for Language Generation

CoFrGeNet:用于语言生成的连分式架构

Amit Dhurandhar, Vijil Chenthamarakshan, Dennis Wei, Tejaswini Pedapati, Karthikeyan Natesan Ramamurthy, Rahul Nair

机构 * IBM Research(IBM研究院)

AI总结 受连分式启发,提出CoFrGeNet架构,用新函数类替换Transformer中的多头注意力和前馈网络,在参数量减少1/2至2/3的情况下,在下游分类、问答、推理和文本理解任务上达到或超越原模型性能。

Comments Earlier version accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08577 2026-08-31 cs.CL cs.AI cs.LG cs.PF 版本更新

Think-at-Hard: Dynamic Looped Transformers for Improved Reasoning

Think-at-Hard: 选择性潜在迭代以改进推理语言模型

Tianyu Fu, Yichen You, Zekai Chen, Guohao Dai, Huazhong Yang, Yu Wang

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 针对循环变压器中潜在过思考问题,提出Think-at-Hard方法,通过轻量级决策器选择性地在困难令牌上触发潜在迭代,并采用深度感知LoRA和双因果注意力机制,在数学、问答和编码任务上一致提升性能。

Comments Accepted by ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20111 2026-08-31 cs.LG cs.AI 版本更新

Var-JEPA: A Variational Formulation of the Joint-Embedding Predictive Architecture - Bridging Predictive and Generative Self-Supervised Learning

Var-JEPA:联合嵌入预测架构的变分公式——弥合预测性和生成性自监督学习

Moritz Gögl, Christopher Yau

机构 * University(大学) Health Data Research UK(英国健康数据研究)

AI总结 本文提出Var-JEPA,通过优化单个ELBO显式化潜在生成结构,实现有意义的表示并允许潜在空间的不确定性量化,同时在表格数据上取得优于T-JEPA且与强基线模型竞争的性能。

Comments Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04208 2026-08-31 cs.RO cs.AI cs.LG 版本更新

SCALE: Self-uncertainty Conditioned Adaptive Looking and Execution for Vision-Language-Action Models

SCALE: 基于自不确定性条件自适应观察与执行的视觉-语言-动作模型

Hyeonbeom Choi, Daechul Ahn, Youhan Lee, Taewook Kang, Seongwon Cho, Jonghyun Choi

机构 * Seoul National University(首尔国立大学)

AI总结 提出SCALE推理策略,利用自不确定性联合调节视觉感知和动作,无需额外训练或验证器,仅单次前向传播,提升VLA模型在模拟和真实环境中的鲁棒性。

Comments ICML 2026 Spotlight. Project page: this https URL (https://dcahn12.github.io/projects/scale/)

详情

展开后加载摘要…

URL PDF HTML 收藏