arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Alibaba(阿里巴巴)

2026-07-24 至 2026-07-24 共收录 5
2607.21595 2026-07-24 cs.CV cs.AI cs.LG 新提交

3D-Aware VLMs with Implicit and Explicit Geometries

具有隐式和显式几何的3D感知视觉语言模型

Wenhao Li, Xueying Jiang, Quanhao Qian, Deli Zhao, Ran Xu, Shijian Lu, Gongjie Zhang

机构 * Nanyang Technological University(南洋理工大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) HuPan Lab(湖畔实验室)

AI总结 研究针对多数2D视觉输入的VLM处理3D任务困难的问题,提出VLM-IE3D框架,通过引入隐式和显式几何令牌及3D感知适配器,融合几何表示与视觉线索,在多种3D任务中表现优异。

Comments Accepted by ECCV 2026, Open Sourced

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21356 2026-07-24 cs.LG 新提交

Emergent Misalignment Recruits a Pre-existing Persona Subspace

新兴的不一致性招募了预先存在的角色子空间

Mohammed Suhail B Nadaf

机构 * Qwen Team(通义团队)

AI总结 研究新兴不一致现象,通过从冻结模型提取角色子空间发现其在微调前就存在,微调第一步提升不一致幅度,投影子空间可防广泛不一致,注入子空间会致模型不一致,多种编辑无效,传播不良数据增加不一致。

Comments 108 pages (19 pages main text, 13 appendices), 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21128 2026-07-24 cs.SD 新提交

TF-MossFormer: Integrating Convolution Gated Local-Global Attentions for Enhanced Time-Frequency Domain Monaural Speech Separation

TF-MossFormer:集成卷积门控局部-全局注意力以增强时频域单声道语音分离

Shengkui Zhao, Zexu Pan, Haoxu Wang, Biao Tian, Bin Ma, Xiangang Li

机构 * Alibaba Group(阿里巴巴集团)

AI总结 研究旨在改进单声道语音分离,提出TF-MossFormer,结合局部与全局注意力,利用内容感知滑动窗口注意力机制及卷积门控,在WSJ0-2Mix数据集上,凭借不同参数设置取得优异的SI-SDRi,性能超越先前方法。

Comments 5 pages, 3 figures, 5 tables, Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21101 2026-07-24 cs.AI 新提交

Can Generative Recommendation Reach Cold Items? A Temporal Perspective on Semantic-ID Generation

生成式推荐能否覆盖冷门商品?基于语义ID生成的时间视角

Jie Peng, Yanping Zheng, Zhewei Zhe, Bin Tong, Guan Wang, Bo Zheng

机构 * Renmin University of China(中国人民大学) Alibaba(阿里巴巴)

AI总结 研究基于语义ID生成的生成式推荐对冷门商品的覆盖情况,采用绝对时间时间协议及多种分析方法,发现当前模型能覆盖部分未来商品,但在未见原子令牌和无支持路径上有困难,揭示其组合但非完全开放式特点并给出未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20922 2026-07-24 cs.CV 新提交

FA-LAM: Focus-Aware Large Avatar Model for One-Shot 4D Animatable Gaussian Head

FA-LAM:用于一次性4D可动画化高斯头部的焦点感知大型头像模型

Yingdong Hu, Yisheng He, Yiming Jiang, Zehong Lin, Steven Hoi, Jun Zhang

机构 * HKUST(香港科技大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) Beihang University(北京航空航天大学) Lingnan University(岭南大学)

AI总结 提出FA-LAM模型用于一次性创建可动画化高斯头部及实现3D、4D全头部恢复。通过分析注意力机制等确定影响因素,采用对称语义注意力正则化等方法解决问题,增强模型支持多视图和流式4D重建,提升了头部重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏