arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Machine Learning · 会议 · Machine Learning

2026-09-01 至 2026-09-01 共收录 7
2608.30295 2026-09-01 cs.LG cs.AI 新提交

CateKV: On Sequential Consistency for Long-Context LLM Inference Acceleration

CateKV:面向长上下文大语言模型推理加速的顺序一致性研究

Haoyun Jiang, Haolin Li, Jianwei Zhang, Fei Huang, Qiang Hu, Minmin Sun, Shuai Xiao, Yong Li, Junyang Lin, Jiangchao Yao

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团) Fudan University(复旦大学)

AI总结 本研究针对长上下文LLM推理的内存与延迟挑战,提出混合KV缓存方法CateKV,利用注意力头的顺序一致性特性减少冗余KV信息,在保持准确率的同时显著降低内存占用、提升解码与批量处理效率。

Comments Published at ICML 2025

Journal ref Proceedings of the 42nd International Conference on Machine Learning (ICML), PMLR 267:27569-27585, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29632 2026-09-01 cs.SE 新提交

InteractBench: Benchmarking LLMs on Competitive Programming under Unrevealed Information

InteractBench:针对未公开信息下的竞赛编程任务评估大语言模型(LLM)

Jiaze Li, Aocheng Shen, Bing Liu, Boyu Zhang, Xiaoxuan Fan, Qiankun Zhang, Xianjun Deng

AI总结 研究针对现有LLM竞赛编程基准的不足,推出含322道题的InteractBench基准,评估LLM在未公开信息交互式竞赛编程任务的表现,发现先进模型存在显著交互差距并提出失败分类法。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29598 2026-09-01 cs.LG 新提交

On the Resilience of Text-to-Video Diffusion Models to Hardware Faults

文本到视频扩散模型对硬件故障的鲁棒性研究

Zachary Coalson, A M Aahad, Stella Doehring, Zane Ma, Sanghyun Hong

机构 * Oregon State University(俄勒冈州立大学)

AI总结 本研究首次系统性探究文本到视频(T2V)扩散模型对硬件故障的鲁棒性,发现单个故障可降低性能、改变语义,内存故障危害更大,揭示了已部署T2V系统的可靠性风险。

Comments Accepted to ICML 2026 Workshop on From Frames to Stories (F2S)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28725 2026-09-01 cs.AI 新提交

Beyond the Answer Key: Robustness Evaluation of Large Language Models for Step-Level Mathematical Verification

超越答案密钥:用于步骤级数学验证的大语言模型鲁棒性评估

Fateme Mazdarani, Carlos Toxtli

AI总结 本研究构建线性方程基准评估大语言模型的步骤级数学验证鲁棒性,发现开源模型对受扰动等价解题过程的错误拒绝率高,微调等方法可部分提升鲁棒性但存在权衡。

Comments Accepted to 2026 IEEE International Conference on Machine Learning and Applications (ICMLA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28648 2026-09-01 cs.AI cs.CL cs.LG 新提交

How Language Models Choose Sides: Internal Representations of Instruction Hierarchy

语言模型如何选择立场:指令层级的内部表征

Enrique Balp-Straffon, Chih-Hao Hsu, Rushiraj Gadhvi, Sunishchal Dev, Callum Stuart McDougall, Anusha Mujumdar

机构 * Amazon(亚马逊) National Taiwan University(国立台湾大学) Plaksha University(普拉卡莎大学) RAND Corporation(兰德公司) Algoverse Google DeepMind(谷歌DeepMind)

AI总结 本研究探究指令微调LLM在系统与用户指令冲突中的仲裁机制,构建含41对约束的基准评估8个模型,发现反层级模型Llama-3.1-8B的冲突结果可从残差流激活线性解码,干预效果取决于读出几何结构。

Comments Published at the ICML 2026 Mechanistic Interpretability workshop, 16 pages (including appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28633 2026-09-01 cs.CL cs.AI cs.CY 新提交

PAUSE: Editable Strategy Artifacts for Long-Form Cultural Story Adaptation

PAUSE:用于长篇文化故事改编的可编辑策略制品

Taaha Kazi, Vasu Sharma, Mohammad Saifullah, Abdur Rahman

AI总结 本研究提出PAUSE可编辑策略制品,用于控制长篇文化故事改编的文化决策,实验显示人类对该策略的编辑可有效传递到章节文本,提升了AI文化改编的可检查性与可争议性。

Comments 6 pages, 1 figure, 3 tables. Accepted at the 1st Workshop on Culture x AI: Evaluating AI as a Cultural Technology, ICML 2026. Project page: https://abdur75648.github.io/pause/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28600 2026-09-01 cs.AI 新提交

SHAPE of Chain-of-Thought in Math Reasoning

数学推理中思维链的SHAPE

Jonghyun Song, Sangjun Song, Minjae Oh, Haesung Pyun, Sungsik Lee, Yohan Jo

AI总结 本研究提出用于分析LLM思维链轨迹的\texttt{SHAPE}框架,发现数学启发式比传统CoT特征更能解释答案正确性,基于此的后训练可提升LLM数学推理准确率。

Comments accepted to The 3rd AI for Math Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏