arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Learning Representations · 会议 · Machine Learning

共收录 9455
2603.25573 2026-03-27 cs.CV cs.LG

Hierarchy-Guided Multimodal Representation Learning for Taxonomic Inference

层级引导的多模态表示学习用于分类推断

Sk Miraj Ahmed, Xi Yu, Yunqi Li, Yuewei Lin, Wei Xu

机构 * Brookhaven National Laboratory(布鲁克海文国家实验室) Rutgers University(罗格斯大学)

AI总结 本文提出两种端到端的多模态学习方法,通过编码生物分类层级结构提升分类鲁棒性,在大规模生物多样性基准上实现超过14%的准确率提升。

Comments Accepted at the ICLR 2026 Workshop on Foundation Models for Science (FM4Science)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25388 2026-03-27 cs.CV

Multimodal Dataset Distillation via Phased Teacher Models

通过分阶段教师模型进行多模态数据集蒸馏

Shengbin Guo, Hang Zhao, Senqiao Yang, Chenyang Jiang, Yuhang Cheng, Xiangru Peng, Rui Shao, Zhuotao Tian

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出PTM-ST框架,通过分阶段教师建模和快捷路径轨迹构建策略,解决多模态数据集蒸馏中的跨阶段性能差距和教师轨迹不稳定问题,提升蒸馏过程的稳定性和表达性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25284 2026-03-27 cs.AI

SliderQuant: Accurate Post-Training Quantization for LLMs

SliderQuant: 针对LLMs的准确后训练量化

Shigeng Wang, Chao Li, Yangyuxuan Kang, Jiawei Fan, Zhonghong Ou, Anbang Yao

机构 * Intel Labs China(英特尔中国研究院) BUPT(北京邮电大学)

AI总结 本文提出SliderQuant框架,通过分层滑动量化方法优化不同层的量化敏感性,提升LLM在不同位宽下的精度。

Comments This work is accepted to ICLR 2026. Code is available at https://github.com/deep-optimization/SliderQuant

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25155 2026-03-27 cs.CV cs.AI

Photon: Speedup Volume Understanding with Efficient Multimodal Large Language Models

Photon:通过高效多模态大语言模型加速体积理解

Chengyu Fang, Heng Guo, Zheng Jiang, Chunming He, Xiu Li, Minfeng Xu

机构 * Tsinghua University(清华大学) DAMO Academy, Alibaba Group(阿里巴巴集团达摩院) Hupan Lab(湖畔实验室) Duke University(杜克大学)

AI总结 Photon通过高效多模态大语言模型实现3D医学影像的体积理解,采用自适应令牌调度和梯度传播技术降低计算成本,提升模型可靠性与效率。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09929 2026-03-27 cs.CV cs.AI

Monocular Normal Estimation via Shading Sequence Estimation

单目法线估计 via 阴影序列估计

Zongrui Li, Xinhua Ma, Minghui Hu, Yunqing Zhao, Yingchen Yu, Qian Zheng, Chang Liu, Xudong Jiang, Song Bai

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) ByteDance(字节跳动) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) The State Key Lab of Brain-Machine Intelligence, Zhejiang University(浙江大学脑机智能全国重点实验室) MoE Key Laboratory of Interdisciplinary Research of Computation and Economics, Shanghai University of Finance and Economics(上海财经大学计算与经济学交叉学科教育部重点实验室)

AI总结 本文提出通过阴影序列估计改进单目法线估计,通过生成阴影序列并求解普通最小二乘问题生成法线图,在合成数据集MultiShade上训练以增强鲁棒性,实验显示在真实数据集上达到最先进的性能。

Comments ICLR 2026 (Oral), Project page: https://xinhua694.github.io/RoSE.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19102 2026-03-27 cs.LG

OWLEYE: Zero-Shot Learner for Cross-Domain Graph Data Anomaly Detection

OWLEYE:跨域图数据异常检测的零样本学习者

Lecheng Zheng, Dongqi Fu, Zihao Li, Jingrui He

机构 * Virginia Tech(弗吉尼亚理工大学) Meta AI University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 OWLEYE提出一种跨域图数据异常检测框架,通过跨域特征对齐模块、多域多模式字典学习和截断注意力重构模块,实现零样本学习和持续学习能力,提升异常检测性能与泛化能力。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08985 2026-03-27 cs.CV

Verifier Threshold: An Efficient Test-Time Scaling Approach for Image Generation

验证阈值:一种高效的测试时间扩展方法用于图像生成

Vignesh Sundaresha, Akash Haridas, Vikram Appia, Lav R. Varshney

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) AMD(超威半导体公司) Stony Brook University(石溪大学)

AI总结 本文提出Verifier-Threshold方法,通过自动重新分配测试时间计算,提升图像生成模型的效率,在GenEval基准上实现2-4倍的计算时间减少。

Comments ICLR 2026 ReALM-Gen and DeLTa

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22049 2026-03-27 cs.IR cs.LG

Massive Memorization with Hundreds of Trillions of Parameters for Sequential Transducer Generative Recommenders

拥有数十万万亿参数的大规模记忆用于序列转换生成推荐系统

Zhimin Chen, Chenyu Zhao, Ka Chun Mo, Yunjiang Jiang, Jane H. Lee, Khushhall Chandra Mahajan, Ning Jiang, Kai Ren, Jinhui Li, Wen-Yun Yang

机构 * Meta Yale University(耶鲁大学)

AI总结 本文提出VISTA框架,通过将传统目标注意力分解为两个阶段,实现对超长用户历史的记忆压缩,从而在保持训练和推理成本不变的情况下,支持数百万项的长期用户历史。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23768 2026-03-27 cs.AI cs.CL

From What to Why: A Multi-Agent System for Evidence-based Chemical Reaction Condition Reasoning

从何到为何:一个用于基于证据的化学反应条件推理的多智能体系统

Cheng Yang, Jiaxuan Lu, Haiyuan Wan, Junchi Yu, Feiwei Qin

机构 * Hangzhou Dianzi University(杭州电子科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tsinghua University(清华大学) University of Oxford(牛津大学)

AI总结 本文提出ChemMAS多智能体系统,通过机制 grounding、多通道回忆、约束感知辩论和理由聚合,提升化学反应条件推荐的可解释性,实验表明其在准确率和可解释性上优于现有方法。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18768 2026-03-27 stat.ML cs.LG

Efficient Best-of-Both-Worlds Algorithms for Contextual Combinatorial Semi-Bandits

面向上下文组合半带隙的高效双世界最优算法

Mengmeng Li, Philipp J. Schneider, Jelisaveta Aleksić, Daniel Kuhn

AI总结 本文提出首个兼顾对抗性和随机性场景的上下文组合半带隙算法,同时保证对抗环境下O(√T)和随机性环境下O(ln T)的 regrets,并通过改进的FTRL框架实现高效计算。

Comments Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10431 2026-03-27 cs.LG stat.ML

Continuous Diffusion for Mixed-Type Tabular Data

连续扩散用于混合类型表格数据

Markus Mueller, Kathrin Gruber, Dennis Fok

机构 * Econometric Institute, Erasmus University Rotterdam(伊拉斯姆斯大学鹿特丹分校经济计量研究所)

AI总结 本文提出CDTD模型,通过结合分数匹配与分数插值,统一连续和分类特征的噪声分布,提升混合类型表格数据生成性能。

Comments published at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25089 2026-03-27 cs.CV

THEMIS: Towards Holistic Evaluation of MLLMs for Scientific Paper Fraud Forensics

THEMIS:迈向多模态大语言模型在科学论文欺诈取证中的全面评估

Tzu-Yen Ma, Bo Zhang, Zichen Tang, Junpeng Ding, Haolin Tian, Yuanze Li, Zhuodi Hao, Zixin Ding, Zirui Wang, Xinyu Yu, Shiyao Peng, Yizhuo Zhao, Ruomeng Jiang, Yiling Huang, Peizhi Zhao, Jiayuan Chen, Weisheng Tan, Haocheng Gao, Yang Liu, Jiacheng Liu, Zhongjun Yang, Jiayu Huang, Haihong E

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 THEMIS通过真实场景和复杂图像评估多模态大语言模型在学术欺诈推理中的能力,引入了五种欺诈类型和16种细粒度操作,揭示模型在不同核心能力上的优劣。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24883 2026-03-27 cs.LG

Learning to Staff: Offline Reinforcement Learning and Fine-Tuned LLMs for Warehouse Staffing Optimization

学习人员配置:用于仓库人员配置优化的离线强化学习与微调大语言模型

Kalle Kujanpää, Yuying Zhu, Kristina Klinkner, Shervin Malmasi

机构 * Amazon, Fulfillment Technologies & Robotics(亚马逊,物流技术与机器人)

AI总结 本文研究了优化半自动化仓库分拣系统实时人员配置的机器学习方法,通过离线强化学习和微调大语言模型,提升了仓库运营效率。

Comments ICLR 2026 Workshop on AI for Mechanism Design and Strategic Decision Making

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24753 2026-03-27 cs.LG cs.CV

Light Cones For Vision: Simple Causal Priors For Visual Hierarchy

视觉中的光锥:用于视觉层次的简单因果先验

Manglam Kartik, Neel Tushar Shah

机构 * Indian Institute of Technology Bombay(印度理工学院班加罗尔)

AI总结 本文提出Worldline Slot Attention模型,通过时空世界线建模物体轨迹,利用洛伦兹几何实现视觉层次结构发现,优于欧几里得空间和双曲嵌入。

Comments ICLR GRaM Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00079 2026-03-27 cs.LG cs.CV

Embedding Compression via Spherical Coordinates

通过球坐标实现嵌入压缩

Han Xiao

机构 * Jina AI by Elastic(Jina AI 由 Elastic 提供)

AI总结 本文提出一种ε界压缩方法,实现1.5倍压缩,优于现有无损方法25%。利用高维单位向量的球坐标集中在π/2附近,使IEEE 754指数坍缩为单一值,高阶尾数位可预测,从而实现熵编码。重建误差不超过float32机器精度,且在BEIR基准上无检索退化。

Comments Accepted at ICLR 2026 Workshop on Geometry-grounded Representation Learning and Generative Modeling (GRaM). 13 pages, 2 figures. Code: https://github.com/jina-ai/jzip

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14989 2026-03-27 q-bio.BM cs.AI cs.LG

Constrained Diffusion for Protein Design with Hard Structural Constraints

具有硬结构约束的蛋白质设计扩散模型

Jacob K. Christopher, Austin Seamann, Jingyi Cui, Sagar Khare, Ferdinando Fioretto

机构 * University of Virginia(弗吉尼亚大学) Rutgers University(罗格斯大学)

AI总结 本文提出一种受结构指导的蛋白质设计扩散框架,通过整合近可行性更新与ADMM分解,确保严格满足功能需求,同时保持立体化学和几何可行性,在复杂约束集下实现高效生成,取得最佳性能。

Comments Accepted at The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06790 2026-03-27 cs.LG

Get RICH or Die Scaling: Profitably Trading Inference Compute for Robustness

获取鲁棒性或死亡扩展:通过推理计算获利地进行鲁棒性交易

Tavish McDonald, Bo Lei, Stanislav Fort, Bhavya Kailkhura, Brian Bartoldson

机构 * Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) Independent Researcher(独立研究者)

AI总结 研究探讨了推理计算与模型鲁棒性之间的关系,发现初始鲁棒性足以使模型遵循指令时,推理计算能提升对抗鲁棒性,通过强化视觉编码器可进一步增强模型的鲁棒性。

Comments 23 pages

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21385 2026-03-27 cs.CV cs.LG

Debugging Concept Bottleneck Models through Removal and Retraining

通过移除和再训练调试概念瓶颈模型

Eric Enouen, Sainyam Galhotra

机构 * Cornell University(康奈尔大学)

AI总结 本文提出一种可解释调试框架,通过移除和再训练步骤解决CBM与专家推理间的系统性偏差问题,CBDebug通过转换概念反馈为样本标签,减少对不良概念的依赖。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23004 2026-03-27 cs.LG

QLIP: A Dynamic Quadtree Vision Prior Enhances MLLM Performance Without Retraining

QLIP:一种动态四叉树视觉先验增强MLLM性能无需重新训练

Kyle R. Chickering, Bangzheng Li, Muhao Chen

AI总结 QLIP通过动态四叉树视觉先验提升MLLM的粗粒度和细粒度视觉理解能力,无需重新训练,实验显示在LLaVA v1.5系列模型上提升视觉问答准确率,且在V-star基准测试中提升细节理解性能达13.6%。

Comments Accepted as ICLR 2026 poster. 22 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06986 2026-03-27 cs.CV

ConcreTizer: Model Inversion Attack via Occupancy Classification and Dispersion Control for 3D Point Cloud Restoration

ConcreTizer:通过占用分类和分散控制进行模型反向攻击以恢复3D点云

Youngseok Kim, Sunwook Hwang, Hyung-Sin Kim, Saewoong Bahk

机构 * Department of Electrical and Computer Engineering, Seoul National University(首尔国立大学电气与计算机工程系) System LSI, Samsung Electronics(三星电子系统LSI) Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院)

AI总结 针对3D点云数据的模型反向攻击研究,通过占用分类和分散控制技术恢复受损点云场景,实验验证了其有效性及3D数据的脆弱性。

Comments Added acceptance note (ICLR 2025) to the heading

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09623 2026-03-27 cs.CV

Weight Space Representation Learning on Diverse NeRF Architectures

在多样NeRF架构上进行权重空间表示学习

Francesco Ballerini, Pierluigi Zama Ramirez, Luigi Di Stefano, Samuele Salti

机构 * University of Bologna(博洛尼亚大学)

AI总结 本文提出首个能处理多种NeRF架构并进行推理的框架,通过无监督表示学习框架训练图元网络,实现架构无关的潜在空间,实验显示在多种架构上表现稳健。

Comments v5: fixed typo in tabs. 11-13. Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02392 2026-03-26 cs.CL

KnowledgeSmith: Uncovering Knowledge Updating in LLMs with Model Editing and Unlearning

KnowledgeSmith:通过模型编辑和遗忘揭示LLM中的知识更新

Yinyi Luo, Zhexian Zhou, Hao Chen, Kai Qiu, Marios Savvides, Sharon Li, Jindong Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) William & Mary(威廉与玛丽学院) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 本文提出KnowledgeSmith框架,系统研究LLM的知识更新机制,通过结构化干预揭示知识传播、可塑性与鲁棒性等特性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12764 2026-03-26 cs.LG cs.DM

GraphOmni: A Comprehensive and Extensible Benchmark Framework for Large Language Models on Graph-theoretic Tasks

GraphOmni: 一种全面且可扩展的大型语言模型在图论任务上的基准框架

Hao Xu, Xiangru Jian, Xinjian Zhao, Wei Pang, Chao Zhang, Suyuchen Wang, Qixin Zhang, Zhengyuan Dong, Joao Monteiro, Bang Liu, Qiuzhuang Sun, Tianshu Yu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Waterloo(滑铁卢大学) Université de Montréal / Mila - Quebec AI Institute(蒙特利尔大学 / 加拿大魁北克人工智能研究所) City University of Hong Kong(香港城市大学) Autodesk(Autodesk公司) Singapore Management University(新加坡国立大学)

AI总结 本文提出GraphOmni基准框架,用于评估大型语言模型在图论任务上的推理能力,通过系统评估发现不同维度对模型性能有显著影响,且先进模型仍有提升空间。

Comments Published at ICLR 2026. Project Page: https://gai-community.github.io/Graph-Omni/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23889 2026-03-26 cs.LG cs.RO

Off-Policy Safe Reinforcement Learning with Constrained Optimistic Exploration

基于约束乐观探索的非策略安全强化学习

Guopeng Li, Matthijs T. J. Spaan, Julian F. P. Kooij

机构 * Faculty of Mechanical Engineering(机械工程学院) Delft University of Technology(代尔夫特理工大学) Faculty of Electrical Engineering, Mathematics and Computer Science(电气工程、数学和计算机科学学院)

AI总结 本文提出COX-Q算法,通过约束乐观探索和保守离线分布价值学习,解决非策略安全强化学习中的约束违反问题,实现在安全关键应用中的高效样本利用和可控数据收集成本。

Comments 21 pages, 9 figures, accepted by ICLR 2026 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23874 2026-03-26 cs.CV

EnvSocial-Diff: A Diffusion-Based Crowd Simulation Model with Environmental Conditioning and Individual-Group Interaction

EnvSocial-Diff: 一种基于扩散的群体模拟模型,包含环境条件和个体-群体交互

Bingxue Zhao, Qi Zhang, Hui Huang

机构 * VCC, College of Computer Science and Software Engineering, Shenzhen University(VCC,计算机科学与软件工程学院,深圳大学)

AI总结 本文提出EnvSocial-Diff模型,结合社会物理和环境条件,通过环境编码模块和个体-群体交互模块提升群体模拟的现实性,实验表明其优于现有方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23523 2026-03-26 cs.CL cs.RO

Do 3D Large Language Models Really Understand 3D Spatial Relationships?

三维大语言模型真的能理解三维空间关系吗?

Xianzheng Ma, Tao Sun, Shuai Chen, Yash Bhalgat, Jindong Gu, Angel X Chang, Iro Armeni, Iro Laina, Songyou Peng, Victor Adrian Prisacariu

机构 * VGG(视觉信息组) University of Oxford(牛津大学) Stanford University(斯坦福大学) Simon Fraser University(西蒙弗雷泽大学) Google DeepMind(谷歌DeepMind)

AI总结 本文挑战了3D-LLM对三维空间关系的理解能力,提出Real-3DQA基准测试,发现现有模型在去除简单线索后表现不佳,并提出3D重加权训练目标以提升空间推理能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23511 2026-03-26 cs.CL cs.AI cs.CV

DISCO: Document Intelligence Suite for COmparative Evaluation

DISCO:用于比较评估的文档智能套件

Kenza Benkirane, Dan Goldwater, Martin Asenov, Aneiss Ghodsi

机构 * Parexel AI Labs(Parexel人工智能实验室)

AI总结 DISCO通过评估OCR流水线和视觉语言模型在不同文档类型上的表现,揭示了任务和文档特性对性能的影响,为选择文档处理策略提供依据。

Comments Accepted at the ICLR 2026 Workshop on Multimodal Intelligence (MMIntelligence). 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23507 2026-03-26 cs.CL cs.AI cs.LG

Beyond Masks: Efficient, Flexible Diffusion Language Models via Deletion-Insertion Processes

超越掩码:通过删除-插入过程实现高效的、灵活的扩散语言模型

Fangyu Ding, Ding Ding, Sijin Chen, Kaibo Wang, Peng Xu, Zijin Feng, Haoli Bai, Kai Han, Youliang Yan, Binhang Yuan, Jiacheng Sun

机构 * HKUST(香港科技大学) Huawei Foundation Model Dept(华为基础模型部门) CUHK(香港中文大学)

AI总结 本文提出删除-插入扩散语言模型(DID),通过将token删除和插入作为离散扩散过程,提高训练和推理效率,并提供更灵活的生成机制。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23140 2026-03-26 cs.LG

DAK-UCB: Diversity-Aware Prompt Routing for LLMs and Generative Models

DAK-UCB: 为LLMs和生成模型的多样性感知提示路由

Donya Jafari, Farzan Farnia

机构 * Sharif University of Technology(谢赫拉扎德技术大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出DAK-UCB方法,结合保真度与多样性指标,用于在线选择生成模型,以提升生成结果的多样性同时保持保真度。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19178 2026-03-26 cs.AI

CollectiveKV: Decoupling and Sharing Collaborative Information in Sequential Recommendation

CollectiveKV: 在顺序推荐中解耦和共享协作信息

Jingyu Li, Zhaocheng Du, Qianhui Zhu, kaiyuan Li, Zhicheng Zhang, Song-Li Wu, Chaolang Li, Pengwen Dai

机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区计算机科学与技术学院) Huawei Noah’s Ark Lab(华为诺亚实验室) Shenzhen Key Laboratory of Adversarial Artificial Intelligence(深圳对抗人工智能重点实验室) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院)

AI总结 本文提出CollectiveKV,通过学习全局KV池实现跨用户KV共享,有效压缩KV缓存至原大小的0.8%,同时保持或提升模型性能。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏