arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-29 至 2026-01-29 共收录 42 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 6 篇

2601.20419 2026-01-29 cs.CV cs.AI 81%

Let's Roll a BiFTA: Bi-refinement for Fine-grained Text-visual Alignment in Vision-Language Models

让我们进行BiFTA:用于视觉语言模型中细粒度文本-视觉对齐的双 refinement

Yuhao Sun, Chengyi Cai, Jiacheng Zhang, Zesheng Ye, Xingliang Yuan, Feng Liu

机构 * School of Computing and Information Systems(计算机与信息系统学院) The University of Melbourne(墨尔本大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 BiFTA通过视图和描述细化方法提升视觉语言模型中细粒度文本-视觉对齐的零样本性能。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20675 2026-01-29 cs.CV 79%

bi-modal textual prompt learning for vision-language models in remote sensing

双模文本提示学习用于遥感图像的视觉-语言模型

Pankhi Kashyap, Mainak Singha, Biplab Banerjee

机构 * Indian Institute of Technology Bombay(印度理工学院班加罗尔分校) University of Trento(特伦托大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 BiMoRS通过双模提示学习框架提升遥感图像视觉-语言模型的适应性与泛化能力。

Comments Accepted in ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19750 2026-01-29 cs.MM cs.CV cs.IR 79%

Benchmarking Multimodal Large Language Models for Missing Modality Completion in Product Catalogues

在电子商务目录中评估多模态大语言模型用于缺失模态补全

Junchen Fu, Wenhao Deng, Kaiwen Zheng, Ioannis Arapakis, Yu Ye, Yongxin Ni, Joemon M. Jose, Xuri Ge

机构 * University of Glasgow(格拉斯哥大学) Telefónica Scientific Research(电信科研机构) National University of Singapore(新加坡国立大学) Shandong University(山东大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 本文研究了多模态大语言模型在电子商务目录中补全缺失模态的能力,通过MMPCBench基准测试发现MLLMs在细粒度对齐上存在不足,并探索了GRPO方法以提升补全效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20075 2026-01-29 cs.CV 70%

Sparse CLIP: Co-Optimizing Interpretability and Performance in Contrastive Learning

稀疏CLIP:在对比学习中协同优化可解释性与性能

Chuan Qin, Constantin Venhoff, Sonia Joseph, Fanyi Xiao, Stefan Scherer

专题命中 VLM训练与架构 :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 稀疏CLIP通过在对比学习中直接整合稀疏性,实现了可解释性与性能的协同优化,保留了多模态能力并提升了下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03001 2026-01-29 cs.CL 67%

LEGO-Eval: Towards Fine-Grained Evaluation on Synthesizing 3D Embodied Environments with Tool Augmentation

LEGO-Eval: 向通过工具增强合成3D具身环境的细粒度评估迈进

Gyeom Hwangbo, Hyungjoo Chae, Minseok Kang, Hyeonjong Ju, Soohyun Oh, Jinyoung Yeo

机构 * Yonsei University(延世大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

AI总结 LEGO-Eval通过工具增强合成3D具身环境,提供细粒度评估框架和基准测试集,提升场景与指令对齐的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20262 2026-01-29 cs.RO 50%

Shallow-π: Knowledge Distillation for Flow-based VLAs

Shallow-π:基于流的视觉-语言-动作模型的知识蒸馏

Boseong Jeon, Yunho Choi, Taehan Kim

机构 * Samsung Research South Korea(三星韩国研究)

专题命中 VLM训练与架构 :VLM(abstract)

AI总结 Shallow-π通过知识蒸馏显著减少基于流的VLA模型的transformer深度,实现更快的推理速度和更高的性能

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他VLM 6 篇

2601.20831 2026-01-29 cs.AI cs.RO 57%

MemCtrl: Using MLLMs as Active Memory Controllers on Embodied Agents

MemCtrl: 使用 MLLMs 作为具身智能体的主动内存控制器

Vishnu Sashank Dorbala, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学 College Park分校)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

AI总结 MemCtrl 通过使用 MLLMs 的可训练内存头 μ 实现在线内存修剪,提升具身智能体在复杂指令下的任务完成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20520 2026-01-29 cs.CV 57%

Context Tokens are Anchors: Understanding the Repetition Curse in dMLLMs from an Information Flow Perspective

上下文标记是锚点:从信息流的角度理解dMLLMs中的重复诅咒

Qiyan Zhao, Xiaofeng Zhang, Shuochen Chang, Qianyu Chen, Xiaosong Yuan, Xuhang Chen, Luoqi Liu, Jiajun Zhang, Xu-Yao Zhang, Da-Han Wang

机构 * SJTU(上海交通大学) CASIA(中国科学院自动化研究所) NTU(国立台湾大学) Meitu (China) Limited(美图公司) XMUT(新疆大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

AI总结 CoTA通过增强上下文标记注意力和引入惩罚项缓解dMLLMs中的重复问题,提升解码性能。

Comments Accepted in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20357 2026-01-29 cs.LG cs.CL 57%

TABED: Test-Time Adaptive Ensemble Drafting for Robust Speculative Decoding in LVLMs

TABED: 为在LVLMs中实现鲁棒性推测解码的测试时间自适应集成草稿

Minjae Lee, Wonjun Kang, Byeongkeun Ahn, Christian Classen, Kevin Galim, Seunghyuk Oh, Minghao Yan, Hyung Il Koo, Kangwook Lee

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

AI总结 TABED通过动态集成多个草稿提高LVLMs在推测解码中的鲁棒性和效率,实现1.74倍的加速和5%的性能提升。

Comments Accepted to Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01091 2026-01-29 cs.GR cs.CV 57%

PromptVFX: Text-Driven Fields for Open-World 3D Gaussian Animation

PromptVFX: 基于文本的场用于开放世界3D高斯动画

Mert Kiray, Paul Uhlenbruck, Nassir Navab, Benjamin Busam

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Obsphera

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 PromptVFX通过文本驱动的场预测技术,实现开放世界3D高斯动画,减少传统VFX制作的高门槛和耗时。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17536 2026-01-29 cs.CL 50%

Multimodal Conversation Structure Understanding

多模态对话结构理解

Kent K. Chang, Mackenzie Hanh Cramer, Anna Ho, Ti Ti Nguyen, Yilin Yuan, David Bamman

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 其他VLM :multimodal large language model(abstract)

AI总结 本文提出多模态对话结构理解任务及TV-MMPC数据集,揭示对话角色匿名化对模型性能的影响,并分析对话中性别角色的参与差异。

Comments accepted to EACL 2026 main conference; 22 pages, 9 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20622 2026-01-29 cs.HC 50%

SketchDynamics: Exploring Free-Form Sketches for Dynamic Intent Expression in Animation Generation

SketchDynamics: 探索自由形式草图用于动画生成中的动态意图表达

Boyu Li, Lin-Ping Yuan, Zeyu Wang, Hongbo Fu

专题命中 其他VLM :vision-language model(abstract)

AI总结 SketchDynamics通过自由形式草图与AI交互,探索动态意图表达在动画生成中的应用,展示草图如何有效传达运动意图并指导视频生成。

Comments conditionally accepted by CHI'26

详情

展开后加载摘要…

URL PDF HTML 收藏