arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

2026-05-25 至 2026-05-25 共收录 6
2605.23883 2026-05-25 cs.CV cs.AI

PGT: Procedurally Generated Tasks for improving visual grounding in MLLMs

PGT: 用于提升多模态大语言模型视觉定位的程序化生成任务

Rim Assouel, Amir Bar, Michal Drozdzal, Adriana Romero-Soriano

机构 * Mila - Qu\'ebec AI Institute FAIR at Meta Superintelligence Labs McGill University Canada CIFAR AI Chair

AI总结 提出程序化生成任务(PGT)框架,通过叠加几何基元生成密集监督信号,解耦视觉定位能力与语义先验,显著提升多模态大语言模型在细粒度理解任务上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18214 2026-05-25 cs.CV

EgoInteract: Synthetic Egocentric Videos Generation for Interaction Understanding and Anticipation

EgoInteract: 用于交互理解和预测的合成自我中心视频生成

Rosario Leonardi, Francesco Ragusa, Daniele Materia, Alessandro Passanisi, James Fort, Jakob Engel, Giovanni Maria Farinella

机构 * Department of Mathematics and Computer Science, University of Catania(卡塔尼亚大学数学与计算机科学系) Next Vision s.r.l.(Next Vision公司) Reality Labs Research, Meta(Meta现实实验室)

AI总结 提出EgoInteract可控模拟器,生成带密集时空标注的合成自我中心视频,用于动作分割、下一活动物体检测、交互预测和手物交互检测,在多个真实基准上提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19310 2026-05-25 cs.LG cs.AI

MemReward: Graph-Based Experience Memory for LLM Reward Prediction with Limited Labels

MemReward: 基于图的经验记忆用于有限标签下的LLM奖励预测

Tianyang Luo, Tao Feng, Zhigang Hua, Yan Xie, Shuang Yang, Ge Liu, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta

AI总结 提出MemReward框架,利用图神经网络在少量标签下将奖励从标注样本传播到未标注样本,实现混合奖励获取策略,在数学、问答和代码生成任务上接近Oracle性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10067 2026-05-25 cs.LG cs.AI

HTMuon: Improving Muon via Heavy-Tailed Spectral Correction

HTMuon:通过重尾谱校正改进Muon

Tianyu Pang, Yujie Fang, Zihang Liu, Shenyang Deng, Lei Hsiung, Shuhua Yu, Yaoqing Yang

机构 * Dartmouth College(达特茅斯学院) Microsoft(微软) International Computer Science Institute(国际计算机科学研究所) University of California, Berkeley(加州大学伯克利分校) Meta

AI总结 针对Muon优化器正交化更新规则抑制重尾权重谱并过度强调噪声方向训练的问题,提出HTMuon方法,通过重尾自正则化理论产生更重尾的更新和权重谱,在LLM预训练和图像分类中提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17015 2026-05-25 cs.CV cs.CL

Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models

Multi-SpatialMLLM: 多模态大语言模型的多帧空间理解

Runsen Xu, Weiyao Wang, Hao Tang, Xingyu Chen, Xiaodong Wang, Fu-Jen Chu, Matt Feiszli, Kevin J. Liang

机构 * FAIR, Meta(FAIR,Meta) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出一种框架,通过整合深度感知、视觉对应和动态感知等基本空间技能,使多模态大语言模型具备多帧空间理解能力,并构建MultiSPA数据集和基准测试,模型Multi-SpatialMLLM在多项任务上取得显著提升。

Comments CVPR 2026 Camera Ready. 27 pages. Project page: https://runsenxu.com/projects/Multi-SpatialMLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21306 2026-05-25 cs.LG cs.AI

The Surprising Difficulty of Search in Model-Based Reinforcement Learning

基于模型的强化学习中搜索的惊人困难

Wei-Di Chang, Mikael Henaff, Brandon Amos, Gregory Dudek, Scott Fujimoto

机构 * Meta FAIR McGill University(麦吉尔大学)

AI总结 本文研究基于模型的强化学习中的搜索问题,发现即使模型高度准确,搜索也可能损害性能,而缓解过估计偏差比提高模型或价值函数精度更重要,通过取价值函数集成的最小值可有效解决偏差并实现有效搜索。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏