arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Machine Learning · 会议 · Machine Learning

2026-05-26 至 2026-05-26 共收录 104
2605.26067 2026-05-26 cs.LG cs.AI

Conditional KRR: Injecting Unpenalized Features into Kernel Methods with Applications to Kernel Thresholding

条件KRR:将无惩罚特征注入核方法及其在核阈值处理中的应用

Rustem Takhanov, Zhenisbek Assylbekov

机构 * Department of Mathematics, Nazarbayev University, Astana, Kazakhstan(纳扎尔巴耶夫大学数学系) Nazarbayev University Research Administration, Astana, Kazakhstan(纳扎尔巴耶夫大学研究行政部) Purdue University Fort Wayne, Indiana, USA(普渡大学枫林分校)

AI总结 本文通过将条件KRR简化为带残差核的KRR,理论分析了其统计性质,并展示了在核主成分和随机特征场景下优于标准KRR的条件。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25967 2026-05-26 cs.LG cs.SD

Hidden in Plain Tokens: Simply Robust, Gradient-Free Watermark for Synthetic Audio

隐藏在明文令牌中:简单、鲁棒、无梯度的合成音频水印

Georgios Milis, Yubin Qin, Yihan Wu, Heng Huang

机构 * Department of Computer Science, University of Maryland, College Park, USA(大学马里兰大学计算机科学系)

AI总结 本文利用离散化中的词汇冗余,提出一种无需微调或梯度的合成音频水印方法,通过社区检测缩减词汇表提升检测鲁棒性,在音频修改下仍保持高性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25941 2026-05-26 cs.CV

Where Concept Erasure Should Occur: Concept-Layer Alignment in Text-to-Video Diffusion Models

概念擦除应发生在何处:文本到视频扩散模型中的概念-层对齐

Yiwei Xie, Ping Liu, Zheng Zhang

机构 * The School of Artificial Intelligence and Automation, Huazhong University of Science and Technology, Wuhan 430074, China(人工智能与自动化学院,华中科技大学,武汉430074,中国) Department of Computer Science and Engineering, University of Nevada, Reno, NV, USA(计算机科学与工程系,内华达大学里诺分校,内华达州,美国)

AI总结 本文通过识别概念-层拓扑对齐瓶颈,提出基于可分离性优化的CLEAR框架,在文本到视频扩散模型中实现精确的概念擦除并保持生成质量。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25740 2026-05-26 cs.LG

Latent Representation Alignment for Offline Goal-Conditioned Reinforcement Learning

离线目标条件强化学习中的潜在表示对齐

Hyungkyu Kang, Byeongchan Kim, Min-hwan Oh

机构 * Seoul National University(首尔国立大学)

AI总结 针对离线目标条件强化学习中价值函数错误泛化的瓶颈,提出潜在对齐价值学习(LAVL)算法,通过潜在表示价值泛化与分层规划的统一框架,在OGBench的22个数据集上20个取得最优性能。

Comments Accepted in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25720 2026-05-26 cs.AI

Learning to Search and Searching to Learn for Generalization in Planning

学习搜索与搜索学习以实现规划中的泛化

Michael Aichmüller, Yannik Hesse, Hector Geffner

机构 * Department of Machine Learning and Reasoning, RWTH Aachen University(机器学习与推理部门,亚琛RWTH大学)

AI总结 提出一种结合关系图神经网络值启发式的自改进WA*学习框架,通过搜索引导和Q学习更新启发式,实现零样本泛化,在多个规划任务中优于深度强化学习。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25707 2026-05-26 cs.AI

AgentHijack: Benchmarking Computer Use Agent Robustness to Common Environment Corruptions

AgentHijack:基准测试计算机使用智能体对常见环境干扰的鲁棒性

Jingwei Sun, Jianing Zhu, Yuanyi Li, Tongliang Liu, Xia HU, Bo Han

机构 * TMLR Group, Hong Kong Baptist University(香港 Baptist 大学 TMLR 团体) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Sydney AI Centre, The University of Sydney(悉尼大学 AI 中心) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 提出AgentHijack基准,通过9种可配置的常见环境干扰评估多模态大语言模型驱动的计算机使用智能体的鲁棒性,并设计AgentHijack-Agent框架提升其抗干扰能力。

Comments accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25690 2026-05-26 cs.IR

GCIB: Graph Contrastive Information Bottleneck for Multi-Behavior Recommendation

GCIB:面向多行为推荐的图对比信息瓶颈

Likang Wu, Zihao Chen, Jianxin Zhang, Sangqi Zhu, Yuanyuan Ge, Haipeng Yang, Lei Zhang

AI总结 提出GCIB框架,通过图信息瓶颈去噪辅助行为图,并利用跨行为图对比学习增强目标行为表示,以解决多行为推荐中的数据稀疏和噪声问题。

Comments Accepted at ICML 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25616 2026-05-26 cs.LG stat.ML

Courtroom Analogy: New Perspective on Uncertainty-Aware Classification

法庭类比:不确定性感知分类的新视角

Taeseong Yoon, Heeyoung Kim

机构 * Department of Industrial and Systems Engineering, Korea Advanced Institute of Science and Technology(工业与系统工程系,韩国科学技术院)

AI总结 提出法庭类比框架,通过结构化混合狄利克雷分布建模分类中的不确定性聚合,并设计单次前馈神经网络MoDEX实现高效、可解释的不确定性量化。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25592 2026-05-26 stat.ML cs.LG

Optimal Design for Multinomial Logit Model with Applications to Best Assortment Identification

多项Logit模型的最优设计及其在最佳组合识别中的应用

Joongkyu Lee, Min-hwan Oh

机构 * Seoul National University, Seoul, Korea(首尔国立大学)

AI总结 针对多项Logit(MNL)模型,提出计算高效的最优实验设计框架,通过混合整数线性规划和多项式时间松弛方法实现统计效率与可扩展性,并应用于线性效用和非均匀收益下的最佳组合识别。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25561 2026-05-26 cs.CV

Are We Overconfident in Models and Results for Semi-Supervised 3D Medical Image Segmentation?

我们在半监督3D医学图像分割的模型和结果上是否过于自信?

Jun Li, Ziwei Qin

机构 * Institute of Systems Science and Technology, School of Electrical Engineering, Southwest Jiaotong University, China(系统科学与技术研究院,电气工程学院,西南交通大学,中国)

AI总结 针对半监督医学图像分割中伪标签框架的确认偏差和基准测试集使用不当导致的性能高估问题,提出一种基于双轴可靠性评估的三空间校准分割框架(TCSeg),以解耦置信度与不确定性并协同校正偏差。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25547 2026-05-26 cs.RO cs.CV

TapSampling: Inference-Time Sampling with a Task-Progress-Understanding Verifier for Robotic Manipulation

TapSampling:基于任务进度理解验证器的推理时采样方法用于机器人操作

Sizhe Zhao, Shengping Zhang, Shuo Yang, Weiyu Zhao, Shuigen Wang, Xiangyang Ji

机构 * Harbin Institute of Technology, China(哈尔滨工业大学,中国) Harbin Institute of Technology (Weihai) Qingdao Research Institute, China(哈尔滨工业大学(威海)青岛研究院,中国) Iray Technology co., Ltd., Shandong, China(Iray科技有限公司,山东,中国) Tsinghua University, Beijing, China(清华大学,北京,中国)

AI总结 提出TapSampling框架,通过Action-VAE在低维潜空间采样候选动作,并利用任务进度预测验证器选择最优动作,无需微调即可提升多种通用策略的性能。

Comments ICML 2026. Project Page: https://aipixel.github.io/TapSampling/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25461 2026-05-26 cs.CV

MetaphorVU: Towards Metaphorical Video Understanding

MetaphorVU:迈向隐喻视频理解

Zhuoqun Li, Boxi Cao, Guiping Jiang, Fangrui Lv, Ruotong Pan, Jianan Wang, Xiangyu Wu, Hongyu Lin, Yaojie Lu, Yong Du, Ruyin Jia, Liyan, Tingting Gao, Han Li, Xianpei Han, Le Sun

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学) Department of Automation, Tsinghua University(清华大学自动化系)

AI总结 针对当前多模态大语言模型在隐喻视频理解上的不足,提出首个系统性基准MetaphorVU-Bench,并设计基于隐喻知识图谱的推理增强框架MetaphorBoost,显著提升模型性能。

Comments ICML 2026 spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25460 2026-05-26 stat.ML cs.LG

Mean-Shift PCA by Knockoff Mean

通过Knockoff均值的Mean-Shift PCA

Mengda Li, Zeng Li, Jianfeng Yao

机构 * Department of Statistics and Data Science, Southern University of Science and Technology(统计与数据科学系,南方科技大学) Data Science, Southern University of Science(数据科学,南方科技大学) School of Data Science, The Chinese University of Hong Kong, Shenzhen, China(数据科学学院,香港中文大学(深圳))

AI总结 提出一种通过故意引入knockoff均值扰动来消除PCA中均值偏移噪声的方法,利用随机矩阵理论证明均值偏移尖峰与原始协方差特征值谱可分离,并设计了两阶段PCA算法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25429 2026-05-26 cs.LG

Rethinking Feature Alignment in Generalist Graph Anomaly Detection: A Relational Fingerprint-based Approach

重新思考通用图异常检测中的特征对齐:一种基于关系指纹的方法

Yujing Liu, Yixin Liu, Yu Zheng, Alan Wee-Chung Liew, Xiaofeng Cao, Shirui Pan

机构 * Griffith University, Gold Coast, Australia(格里菲斯大学,澳大利亚黄金海岸) Tongji University, Shanghai, China(同济大学,上海,中国)

AI总结 针对通用图异常检测中特征对齐忽略语义导致负迁移的问题,提出基于关系指纹的通用方法ReFi-GAD,通过编码上下文和结构异常指示线索的语义感知指纹,结合Transformer编码器和SNR引导的领域自适应模块,在14个数据集上显著超越现有方法。

Comments 9 pages, 7 figures. Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25360 2026-05-26 cs.CL

Learning to Route Languages for Multilingual Policy Optimization

学习路由语言以实现多语言策略优化

Geyang Guo, Hiromi Wakaki, Yuki Mitsufuji, Alan Ritter, Wei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院) Sony Group Corporation(索尼集团)

AI总结 提出语言路由策略优化(LRPO)框架,将语言作为可选变量,通过在线策略优化和可训练的语言路由器(多臂老虎机)自适应地选择语言,在固定预算下提升多语言训练信号的多样性和信息量,从而显著提高多语言性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25328 2026-05-26 cs.CV cs.MM

DIVA: Harnessing the Representation Divergence in Unified Multimodal Models for Mutual Reinforcement

DIVA: 利用统一多模态模型中的表示差异实现相互增强

Renjie Lu, Xulong Zhang, Xiaoyang Qu, Shangfei Wang, Jianzong Wang

机构 * Ping An Technology (Shenzhen) Co., Ltd., Shenzhen, China(平安科技(深圳)有限公司,深圳,中国) University of Science and Technology of China(中国科学技术大学)

AI总结 针对统一多模态模型中理解与生成任务因监督信号差异导致相互干扰的问题,提出DIVA框架,通过分解视觉表示为共享和独有成分并利用互信息估计实现内部协同,在理解与生成任务上分别提升7.82%和8.46%。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22365 2026-05-26 cs.CR cs.AI cs.LG

TimeGuard: Channel-wise Pool Training for Backdoor Defense in Time Series Forecasting

TimeGuard: 面向时间序列预测中后门防御的通道式池化训练

Quang Duc Nguyen, Siyuan Liang, Yiming Li, Fushuo Huo, Dacheng Tao

机构 * College of Computing(计算学院) Data Science, Nanyang Technological University, Singapore(数据科学,新加坡南洋理工大学)

AI总结 针对时间序列预测中后门攻击防御难题,提出基于通道式池化训练的TimeGuard方法,通过时间感知池初始化与距离正则化损失选择缓解信号稀释与损失退化,显著提升鲁棒性。

Comments 44 pages, 30 figures. ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20749 2026-05-26 cs.LG cs.AI

The Devil is in the Condition Numbers: Why is GLU Better than non-GLU Structure?

魔鬼在于条件数:为什么GLU优于非GLU结构?

Xingyu Lyu, Qianqian Xu, Zhiyong Yang, Peisong Wen, Qingming Huang

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing 100190, China(人工智能安全国家重点实验室,计算技术研究所,中国科学院,北京100190,中国) School of Computer Science and Technology, University of Chinese Academy of Sciences, Beijing 101408, China(中国科学院大学计算机科学与技术学院,北京101408,中国) Beijing Academy of Artificial Intelligence (BAAI), Beijing, China(北京人工智能研究院(BAAI),北京,中国)

AI总结 通过神经正切核分析,发现门控线性单元(GLU)通过重塑核谱、减小条件数来加速优化收敛,而非主要降低泛化差距。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18745 2026-05-26 stat.ML cs.LG cs.NA math.NA math.PR q-fin.MF stat.CO

SURGE: Approximation and Training Free Particle Filter for Diffusion Surrogate

SURGE: 扩散替代模型的近似与免训练粒子滤波

Lifu Wei, Yinuo Ren, Naichen Shi, Yiping Lu

机构 * Department of Mechanical Engineering, Northwestern University, Evanston, IL, United States Institute for Computational \& Mathematical Engineering, Stanford University, Stanford, CA, United States Department of Industrial Engineering \& Management Sciences, Northwestern University, Evanston, IL, United States

AI总结 提出一种基于扩散模型的无偏粒子滤波方法,通过序列蒙特卡洛对扩散轨迹进行重加权和重采样,融合观测数据与模型模拟,实现状态估计的连续校正。

Comments accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17234 2026-05-26 cs.LG

Active Budget Allocation for Efficient Scaling Law Estimation via Surrogate-Guided Pruning

通过代理引导剪枝实现高效缩放定律估计的主动预算分配

Viktoria Schram, Markus Hiller, Daniel Beck, Trevor Cohn

机构 * The School of Computing and Information Systems, the University of Melbourne, Melbourne, Australia(墨尔本大学计算与信息系统学院) Royal Melbourne Institute of Technology, Melbourne, Australia(皇家墨尔本理工学院) Now at Google Australia(现就职于谷歌澳大利亚)

AI总结 提出结合连续减半与参数/非参数代理模型的主动预算分配方法,在显著降低计算成本(节省高达98.7%)的同时获得更优的损失-计算量前沿,实现精确的缩放定律估计。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13319 2026-05-26 cs.DC

PipeSD: An Efficient Cloud-Edge Collaborative Pipeline Inference Framework with Speculative Decoding

PipeSD:一种基于推测解码的高效云边协同流水线推理框架

Yunhe Han, Yunqi Gao, Bing Hu, Mahdi Boloursaz Mashhadi, Yitong Duan, Pei Xiao, Yanfeng Zhang

AI总结 提出PipeSD框架,通过令牌批处理流水线调度和双阈值非自回归验证触发机制,解决云边协同推测解码中的资源利用率和验证灵活性瓶颈,实现1.16倍至2.16倍加速并降低14.3%-25.3%能耗。

Comments Accepted by ICML 2026. *Equal contribution. Yunhe Han and Yunqi Gao contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12906 2026-05-26 cs.LG cs.AI

Data Difficulty and the Generalization--Extrapolation Tradeoff in LLM Fine-Tuning

数据难度与LLM微调中的泛化-外推权衡

Siyuan Liu, Tinghong Chen, Xinghan Li, Yifei Wang, Jingzhao Zhang

机构 * IIIS, Tsinghua University(清华大学人工智能学院) College of AI, Tsinghua University(清华大学人工智能学院) Shanghai Qi Zhi Institute(上海启智研究院) Amazon AGI SF Lab(亚马逊AGI旧金山实验室)

AI总结 本文通过实证和理论分析,研究了监督微调中数据难度对模型行为的影响,发现数据难度与数据量共同决定泛化与外推之间的权衡,并存在最优难度随数据量增加而向更难数据偏移的规律。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12649 2026-05-26 cs.CV

DIVER:Diving Deeper into Distilled Data via Expressive Semantic Recovery

DIVER: 通过表达性语义恢复深入挖掘蒸馏数据

Qianxin Xia, Zhiyong Shu, Wenbo Jiang, Jiawei Du, Jielei Wang, Guoming Lu

机构 * University of Electronic Science and Technology of China, Chengdu, China(电子科技大学,成都,中国) Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR), Singapore(高性能计算研究所(IHPC),科技研究局(A*STAR),新加坡) Centre for Frontier AI Research (CFAR), Agency for Science, Technology and Research (A*STAR), Singapore(前沿人工智能研究中心(CFAR),科技研究局(A*STAR),新加坡)

AI总结 提出双阶段蒸馏框架DIVER,利用预训练扩散模型通过语义继承、引导和融合恢复蒸馏数据的表达性语义,提升跨架构泛化能力。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04700 2026-05-26 cs.CR cs.AI cs.CL cs.LG cs.SD

Sparse Tokens Suffice: Jailbreaking Audio Language Models via Token-Aware Gradient Optimization

稀疏令牌足矣:通过令牌感知梯度优化越狱音频语言模型

Zheng Fang, Xiaosen Wang, Shenyi Zhang, Shaokang Wang, Zhijin Ge

机构 * Wuhan University Institute for Math \& AI, Wuhan University Huazhong University of Science Shanghai Jiao Tong University Xidian University

AI总结 本文提出令牌感知梯度优化(TAGO)方法,通过仅保留高梯度能量的音频令牌对应的波形梯度,实现稀疏越狱攻击,在保持高成功率的同时大幅减少优化量。

Comments To appear in the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02495 2026-05-26 cs.LG cs.AI stat.ML

Efficient Preference Poisoning Attack on Offline RLHF

高效偏好投毒攻击离线RLHF

Chenye Yang, Weiyu Xu, Lifeng Lai

机构 * Department of Electrical and Computer Engineering, University of California, Davis, Davis, CA, USA(加州大学戴维斯分校电气与计算机工程系) Department of Electrical and Computer Engineering, University of Iowa, Iowa City, IA, USA(爱荷华大学电气与计算机工程系)

AI总结 针对离线RLHF中的偏好投毒攻击,提出基于梯度字典的二进制稀疏近似方法(BAL-A和BMP-A),实现高效标签翻转攻击。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00419 2026-05-26 cs.LG cs.CL

Rethinking LLM Ensembling from the Perspective of Mixture Models

从混合模型的角度重新思考大语言模型集成

Jiale Fu, Yuchu Jiang, Peijun Wu, Chonghan Liu, Joey Tianyi Zhou, Xu Yang

机构 * Key Laboratory of New Generation Artificial Intelligence Technology(新一代人工智能技术关键实验室) Its Interdisciplinary Applications (Southeast University), Ministry of Education(交叉应用(东南大学),教育部) Southeast University(东南大学) Centre for Frontier AI Research (CFAR), Agency for Science, Technology(前沿人工智能研究(CFAR),科技研究局) Research (A STAR), Singapore(研究(A STAR),新加坡) Institute of High Performance Computing (IHPC), Agency for Science, Technology(高性能计算(IHPC),科技研究局)

AI总结 本文提出混合模型式集成(ME),通过将集成重新解释为混合模型,随机选择单个模型生成下一个token,避免显式计算完整集成分布,实现1.78x-2.68x加速,并揭示了集成与token级路由方法的联系。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18970 2026-05-26 cs.LG cs.CR

Mechanistic Anomaly Detection via Functional Attribution

通过功能归因的机制性异常检测

Hugo Lyons Keenan, Christopher Leckie, Sarah Erfani

机构 * School of Computing and Information Systems, The University of Melbourne, Victoria, Australia(计算与信息系统学院,墨尔本大学,维多利亚,澳大利亚)

AI总结 将机制性异常检测重新定义为功能归因问题,利用影响函数测量测试样本与参考集之间的功能耦合,在视觉模型后门检测、大语言模型后门检测以及对抗样本和分布外样本检测中取得最优或显著改进。

Comments ICML '26 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00499 2026-05-26 cs.LG

Scheduling LLM Inference with Uncertainty-Aware Output Length Predictions

具有不确定性感知输出长度预测的LLM推理调度

Haoyu Zheng, Yongqiang Zhang, Fangcheng Fu, Xiaokai Zhou, Hao Luo, Hongchao Zhu, Yuanyuan Zhu, Hao Wang, Xiao Yan, Jiawei Jiang

机构 * School of Computer Science, Wuhan University, Wuhan, China(武汉大学计算机学院) School of Computer Science, Central China Normal University, Wuhan, China(中央财经大学计算机学院) Dameng Database Co., Ltd., Wuhan, China(达梦数据库有限公司) School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China(上海交通大学人工智能学院) Institute for Math and AI, Wuhan University, Wuhan, China(武汉大学数学与人工智能研究院)

AI总结 针对LLM推理调度,提出基于对数t分布的输出长度分布模型,并设计Tail Inflated Expectation (TIE)指标替代点估计,以降低在线推理延迟并提高离线吞吐量。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09581 2026-05-26 cs.LG

Towards Understanding Adam Convergence on Highly Degenerate Polynomials

理解Adam在高度退化多项式上的收敛性

Zhiwei Bai, Jiajie Zhao, Zhangchen Zhou, Zhi-Qin John Xu, Yaoyu Zhang

机构 * Institute of Natural Sciences, MOE-LSC, Shanghai Jiao Tong University(上海交通大学理论科学研究院) School of Mathematical Sciences, Shanghai Jiao Tong University(上海交通大学数学科学学院) Shanghai Seres Information Technology Co., Ltd, Shanghai 200040, China(上海塞瑞斯信息技术有限公司)

AI总结 本文研究Adam优化器在高度退化多项式上的自动收敛性质,推导局部渐近稳定性条件,证明其线性收敛速度优于梯度下降和动量法,并刻画超参数相图。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06687 2026-05-26 cs.CV cs.CL cs.ET cs.MM cs.RO

TimeSpot: Benchmarking Geo-Temporal Understanding in Vision-Language Models in Real-World Settings

TimeSpot: 在真实世界场景中评估视觉语言模型的地理时间理解能力

Azmine Toushik Wasi, Shahriyar Zaman Ridoy, Koushik Ahamed Tonmoy, Kinga Tshering, S. M. Muhtasimul Hasan, Wahid Faisal, Tasnim Mohiuddin, Md Rizwan Parvez

机构 * Computational Intelligence and Operations Laboratory (CIOL), Bangladesh(计算智能与运筹实验室(CIOL),孟加拉国) Shahjalal University of Science and Technology (SUST), Sylhet, Bangladesh(沙赫jalal科学与技术大学(SUST),沙赫里尔,孟加拉国) North South University (NSU), Dhaka, Bangladesh(北南大学(NSU),达卡,孟加拉国) Qatar Computing Research Institute (QCRI), Doha, Qatar(卡塔尔计算研究中心(QCRI),多哈,卡塔尔)

AI总结 提出TimeSpot基准,通过1,455张全球图像评估视觉语言模型在时间属性(季节、月份、时段、日光相位)和地理属性(大洲、国家、气候带、环境类型、经纬度)上的推理能力,发现现有模型性能低下,尤其时间推理不足。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏