arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

International Conference on Learning Representations · 会议 · Machine Learning

2026-03-03 至 2026-03-03 共收录 251
2504.03889 2026-03-03 cs.LG

Identifying and Evaluating Inactive Heads in Pretrained LLMs

识别和评估预训练语言模型中的惰性头部

Pedro Sandoval-Segura, Xijun Wang, Ashwinee Panda, Micah Goldblum, Ronen Basri, Tom Goldstein, David Jacobs

机构 * University of Maryland(马里兰大学) Columbia University(哥伦比亚大学) Weizmann Institute of Science(魏茨曼科学研究院)

AI总结 研究识别预训练语言模型中非活动注意力头部,通过评分函数评估其非活动性,并发现模型规模和微调对注意力行为有影响。

Comments Accepted to ICLR 2026. Code available at https://github.com/psandovalsegura/inactive-heads

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24378 2026-03-03 cs.AI

ACPBench Hard: Unrestrained Reasoning about Action, Change, and Planning

ACPBench Hard: 关于行动、变化和规划的无约束推理

Harsha Kokel, Michael Katz, Kavitha Srinivas, Shirin Sohrabi

机构 * IBM Research San Jose(IBM桑 Jose 研究所) IBM Thomas J. Watson Research Center(IBM 托马斯·J·沃森研究中心)

AI总结 ACPBench Hard通过开放性问题测试模型在行动、变化和规划上的推理能力,发现现有模型在复杂任务上表现有限。

Comments Accepted at Proceedings of the Fourteenth International Conference on Learning Representations (ICLR 2026), see https://openreview.net/forum?id=WIXohR7mEo

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22178 2026-03-03 cs.LG cs.AI cs.CV

AdaRank: Adaptive Rank Pruning for Enhanced Model Merging

AdaRank: 适应性秩修剪以提升模型融合

Chanhyuk Lee, Jiho Choi, Chanryeol Lee, Donggyun Kim, Seunghoon Hong

机构 * KAIST(韩国科学技术院)

AI总结 AdaRank通过自适应秩修剪技术,有效减少多任务学习中的任务干扰,提升模型融合性能。

Comments ICLR 2026. Code available at: github.com/david3684/AdaRank

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18950 2026-03-03 cs.CV

Target-Aware Video Diffusion Models

面向目标的视频扩散模型

Taeksoo Kim, Hanbyul Joo

AI总结 本文提出一种面向目标的视频扩散模型,通过引入目标掩码和特殊标记提升视频生成中演员与目标的互动准确性,并在两个下游任务中验证其有效性。

Comments ICLR 2026. The project page is available at https://taeksuu.github.io/tavid/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07392 2026-03-03 cs.CV

SPEED: Scalable, Precise, and Efficient Concept Erasure for Diffusion Models

SPEED:可扩展、精确和高效的扩散模型概念擦除

Ouxiang Li, Yuan Wang, Xinting Hu, Houcheng Jiang, Yanbin Hao, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) Hefei University of Technology(合肥工业大学)

AI总结 SPEED通过直接编辑模型参数,高效精准地擦除扩散模型中的多个概念,同时保护非目标概念的质量。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06764 2026-03-03 cs.CV cs.AI

SemHiTok: A Unified Image Tokenizer via Semantic-Guided Hierarchical Codebook for Multimodal Understanding and Generation

SemHiTok:一种通过语义引导的层次代码本实现的统一图像分词器,用于多模态理解和生成

Zisheng Chen, Chunwei Wang, Runhui Huang, Hongbin Xu, Xiuwei Chen, Jun Zhou, Jianhua Han, Hang Xu, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) Huawei Noah’s Ark Lab(华为诺亚实验室) University of Hong Kong(香港大学) South China University of Technology(华南理工大学)

AI总结 SemHiTok通过语义引导的层次代码本实现统一图像分词器,提升多模态理解和生成性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06749 2026-03-03 cs.CV cs.AI cs.CL cs.LG

Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models

Vision-R1: 促进多模态大语言模型推理能力的激励方法

Wenxuan Huang, Bohan Jia, Zijie Zhai, Shaosheng Cao, Zheyu Ye, Fei Zhao, Zhe Xu, Xu Tang, Yao Hu, Shaohui Lin

机构 * East China Normal University(华东师范大学) The Chinese University of Hong Kong(香港中文大学) Xiaohongshu Inc.(小红书公司)

AI总结 Vision-R1通过构建高质量多模态CoT数据集和渐进性思维抑制训练策略,提升多模态推理能力,在数学推理基准中取得显著成绩。

Comments Accepted to ICLR 2026. Code is available at https://github.com/Osilly/Vision-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06238 2026-03-03 cs.IR cs.AI

Token-Efficient Item Representation via Images for LLM Recommender Systems

通过图像实现高效的物品表示用于LLM推荐系统

Kibum Kim, Sein Kim, Hongseok Kang, Jiwan Kim, Heewoong Noh, Yeonjun In, Kanghoon Yoon, Jinoh Oh, Julian McAuley, Chanyoung Park

机构 * KAIST(韩国科学技术院) Amazon Alexa(亚马逊Alexa) UC San Diego(加州大学圣地亚哥分校)

AI总结 本文提出I-LLMRec方法,通过利用图像替代文本描述,提高LLM推荐系统的效率和有效性,同时增强对噪声的鲁棒性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15021 2026-03-03 cs.CV

Thicker and Quicker: A Jumbo Token for Fast Plain Vision Transformers

更厚更快:一种大token用于快速的纯视觉变换器

Anthony Fuller, Yousef Yassin, Daniel G. Kyrollos, Evan Shelhamer, James R. Green

AI总结 通过引入大token提升ViT速度,保持准确性并兼容现有ViT方法,改进多种任务性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03566 2026-03-03 cs.CV cs.LG

CLIP Behaves like a Bag-of-Words Model Cross-modally but not Uni-modally

CLIP 表现得像一个词袋模型但不是单模态的

Darina Koishigarina, Arnas Uselis, Seong Joon Oh

机构 * Tübingen AI Center, University of Tübingen(图宾根人工智能中心,图宾根大学)

AI总结 CLIP表现出词袋模型特性,但其属性-对象绑定信息已单模态编码,通过简单线性变换可提升性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00054 2026-03-03 cs.LG cs.AI

Expert Divergence Learning for MoE-based Language Models

专家分歧学习用于基于混合专家的语言模型

Jiaang Li, Haibin Chen, Langming Liu, Yujin Yuan, Yadao Wang, Yizhen Zhang, Chengting Yu, Xin Tong, Weidong Zhang, Shilei Liu, Wenbo Su, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

AI总结 专家分歧学习通过促进专家功能专业化,提升MoE模型的语言建模能力及下游任务性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏