arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-26 至 2026-08-26 共收录 14 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 14 篇

2608.24563 2026-08-26 cs.CV cs.RO 新提交 91%

X-MULTI: VLM-based Imaging Factor Disentanglement for Factor-Aware Image Synthesis

X-MULTI:基于VLM的成像因子解耦用于因子感知图像合成

Sonali Godavarthy, Matthias Neuwirth-Trapp, Tim-Felix Faasch, Maarten Bieshaar, Michael Moeller, Kristof Van Laerhoven, Danda Pani Paudel

机构 * University of Siegen(锡根大学) ETH Zürich(苏黎世联邦理工学院) Bosch Research(博世研究中心) INSAIT(INSAIT(保加利亚的智能与数据科学研究所)) Sofia University “St. Kliment Ohridski”(索非亚大学“圣·克利门特·奥赫里德斯基”)

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 该研究针对文本到图像生成的成像因子解耦问题,提出基于VLM的X-MULTI方法及改进的I-FAA指标,提升了新颖因子组合的因子对齐效果与评估的稳健性。

Comments Accepted to the MUCG Workshop at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24115 2026-08-26 cs.RO cs.AI 新提交 91%

PonderPounce: A Pretrained MLLM as an Episode Context Engine for Robot Control

PonderPounce:作为机器人控制回合上下文引擎的预训练多模态大语言模型(MLLM)

Suhwan Choi, Jaeyoon Jung, Sungkyung Kim, Yunsung Lee, Youngjae Yu

机构 * Seoul National University(首尔大学)

专题命中 VLM训练与架构 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.AI

AI总结 PonderPounce复用预训练MLLM的因果上下文作为机器人记忆,由System2 MLLM(Ponder)和System1 VLA(Pounce)组成,在RoboMME、RoboCasa-DC等数据集上的性能优于现有基线,实现了低延迟的机器人控制。

Comments Project page: this https URL (https://worv-ai.github.io/ponderpounce/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23921 2026-08-26 cs.CV 新提交 84%

HAP: Head-Adaptive Visual Token Pruning via Cross-Modal Alignment

HAP:基于跨模态对齐的头部自适应视觉Token剪枝

Yuanhao Sun, Huawei Ji, Yuan Jin, Cheng Deng, Luoyi Fu, Xinbing Wang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Edinburgh(爱丁堡大学)

专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 该研究针对视觉-语言模型预填充成本过高的问题,提出基于PAQ指标的头部自适应视觉Token剪枝方法,在18个基准上实现最优权衡,在LLaVA-1.5-7B上仅保留5.6% Token即可维持99.1%的原始性能,优于基线AutoPrune。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24063 2026-08-26 cs.CV cs.AI 新提交 73%

VisCache: Visual KV Cache Pruning for Efficient Vision Large Language Model Inference

VisCache:用于高效视觉大语言模型推理的视觉键值缓存剪枝方法

Lyuke Wang, Zhuo Li, Guangxu Zhu

机构 * Shenzhen International Center for Industrial and Applied Mathematics(深圳国际工业与应用数学中心) Shenzhen Research Institute of Big Data(深圳大数据研究院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 VisCache是一种无需训练的即插即用视觉KV缓存剪枝框架,通过两阶段协同操作提升VLLM长上下文推理效率,实现最高2.35倍加速,建立效率与性能的新帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24354 2026-08-26 cs.CR cs.AI cs.CL 新提交 70%

Not All Tokens Are Equal: Region-Aware Consistency Repair of Backdoors in MLLMs

并非所有 token 都平等:多模态大语言模型(MLLMs)中后门的区域感知一致性修复

Jiali Wei, Ming Fan, Mingkun Zhang, Haoyu Wang, Jun Sun, Guoheng Sun, Xiaoning Ren, Haijun Wang, Ting Liu

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对 MLLMs 的后门风险,提出区域感知一致性修复框架 RACER,仅需 100 个干净样本即可有效抑制后门,平均 ASR 降至 1.1%且多数场景达 0%,同时保留模型正常效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23853 2026-08-26 cs.CV 新提交 70%

LUX: A Lesion-Aware Graph-Conditioned Visual - Language Architecture for Explainable Endoscopic Captioning

LUX:一种用于可解释内镜图像描述的病灶感知图条件视觉-语言架构

Alexis Ivan Escamilla-Lopez, Gilberto Ochoa-Ruiz, Salvador Hinojosa, Sharib Ali

机构 * School of Engineering and Sciences, Tecnologico de Monterrey(蒙特雷理工学院工程与科学学院) School of Computer Science, University of Leeds(利兹大学计算机学院)

专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 该研究针对内镜图像解读的主观性问题,提出LUX图条件视觉-语言架构,通过病灶中心场景图实现可解释描述,在多指标上优于现有模型并减少了幻觉与定位误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11048 2026-08-26 cs.RO cs.AI 版本更新 70%

ForceFlow: Learning to Feel and Act via Contact-Driven Flow Matching

ForceFlow: 通过接触驱动的流匹配学习感知与行动

Shuoheng Zhang, Yifu Yuan, Hongyao Tang, Yan Zheng, Qiaojun Yu, Pengyi Li, Guowei Huang, Helong Huang, Xingyue Quan, Jianye Hao

机构 * Tianjin University(天津大学) Huawei Noah's Ark Lab(华为诺亚实验室) Shanghai AI Lab(上海人工智能实验室)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出ForceFlow框架,通过融合力信号与多模态信息,提升机器人在复杂接触任务中的鲁棒性和泛化能力,实验显示其在六个真实任务中成功率提升37%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23970 2026-08-26 cs.AI cs.LG 新提交 62%

Giraffe: A Mapping Architecture from Hidden Text Representations to Visual Embeddings for Efficient Graphic Design

Giraffe:一种用于高效平面设计的从隐藏文本表示到视觉嵌入的映射架构

Nejla Ghaboosi

机构 * Canva Research(Canva研究院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 Giraffe 是一种轻量映射架构,以单 [IMG] token 实现从文本隐藏表示到视觉模型嵌入空间的转换,在平面设计生成任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23807 2026-08-26 cs.AI 新提交 57%

Serving Masked Diffusion LLMs: Characterization and Design Principles from Real Hardware

部署掩码扩散大语言模型:基于真实硬件的特性分析与设计原则

Farhana Amin, Sabiha Afroz, Mona Moghadampanah, Dimitrios S. Nikolopoulos

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文通过真实硬件实验分析LLaDA-8B-Instruct等dLLM的部署特性,发现其请求步数离散、批处理可分摊CPU开销等规律,提出适配dLLM的部署设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15062 2026-08-26 cs.CL cs.LG 版本更新 57%

Gated Recurrent Transformers: Expressive Depth through Recurrent Modulation in Transformers

RecurrentGPT:通过Transformer中的循环调制实现表达性深度

Amr Hegazy, Amr Alanwar, Mostafa Elhoushi

机构 * The German University in Cairo(开罗德国大学) Technical University of Munich(慕尼黑工业大学) Cerebras Systems Inc.(赛布拉斯系统公司)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

AI总结 本文提出RecurrentGPT,通过循环调制解决Transformer语言模型表达性与内存效率的矛盾,在多约束下优于基线模型,实现参数与内存的高效利用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20809 2026-08-26 cs.CV 版本更新 57%

Layer-Aware Video Composition via Split-then-Merge

通过分割后再融合的分层视频合成

Ozgur Kara, Yujia Chen, Ming-Hsuan Yang, James M. Rehg, Wen-Sheng Chu, Du Tran

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google(谷歌)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 StM通过分割未标注视频并融合动态前景与背景层,提升生成视频合成的控制能力和数据效率。

Comments Project Webpage: this https URL (https://split-then-merge.github.io)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18778 2026-08-26 cs.RO cs.AI 版本更新 57%

VGGT-DP: Generalizable Robot Control via Vision Foundation Models

VGGT-DP:基于视觉基础模型的通用机器人控制

Shijia Ge, Yijun Liu, Yinxin Zhang, Shuzhao Xie, Weixiang Zhang, Mingcai Zhou, Zhi Wang

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 该研究提出 VGGT-DP 视觉运动策略框架,采用 VGGT 作为视觉编码器并设计 FTR 机制与随机令牌剪枝,在 MetaWorld 任务上较 DP、DP3 等基线表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24667 2026-08-26 cs.IR 新提交 50%

EviGraph: Towards Verifiable Evidence Construction for Information-Seeking Agents

EviGraph:面向信息检索智能体的可验证证据构建

Jiashun Chen, Yirong Mao, Wenhui Que

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 EviGraph是分离搜索与证据记录的深度搜索框架,在BrowseComp等数据集上显著提升了智能体网络搜索的准确率,每轮生成token更少,验证了结构化证据记录的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23812 2026-08-26 cs.CL 新提交 50%

From Preferences to Principles: Rubric-Based Alignment for Grounded Knowledge Answers

从偏好到原则:基于评分规则的接地知识答案对齐

Aman Saini, Priyanshu Kumar, Eric Peng, Kai Yuan, Harsh Girase, Wanming Chen

机构 * Apple(苹果公司)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 本研究针对开放域问答的奖励信号设计难题,提出基于检索证据生成查询特定多维评分规则的奖励框架,经实验验证其比基线方法有显著性能提升,为复杂开放域问答提供更有效的奖励监督。

Comments 18 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏