arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5095 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5095 篇

2608.24354 2026-08-26 cs.CR cs.AI cs.CL 新提交 70%

Not All Tokens Are Equal: Region-Aware Consistency Repair of Backdoors in MLLMs

并非所有 token 都平等:多模态大语言模型(MLLMs)中后门的区域感知一致性修复

Jiali Wei, Ming Fan, Mingkun Zhang, Haoyu Wang, Jun Sun, Guoheng Sun, Xiaoning Ren, Haijun Wang, Ting Liu

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对 MLLMs 的后门风险,提出区域感知一致性修复框架 RACER,仅需 100 个干净样本即可有效抑制后门,平均 ASR 降至 1.1%且多数场景达 0%,同时保留模型正常效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23853 2026-08-26 cs.CV 新提交 70%

LUX: A Lesion-Aware Graph-Conditioned Visual - Language Architecture for Explainable Endoscopic Captioning

LUX:一种用于可解释内镜图像描述的病灶感知图条件视觉-语言架构

Alexis Ivan Escamilla-Lopez, Gilberto Ochoa-Ruiz, Salvador Hinojosa, Sharib Ali

机构 * School of Engineering and Sciences, Tecnologico de Monterrey(蒙特雷理工学院工程与科学学院) School of Computer Science, University of Leeds(利兹大学计算机学院)

专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 该研究针对内镜图像解读的主观性问题,提出LUX图条件视觉-语言架构,通过病灶中心场景图实现可解释描述,在多指标上优于现有模型并减少了幻觉与定位误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11048 2026-08-26 cs.RO cs.AI 版本更新 70%

ForceFlow: Learning to Feel and Act via Contact-Driven Flow Matching

ForceFlow: 通过接触驱动的流匹配学习感知与行动

Shuoheng Zhang, Yifu Yuan, Hongyao Tang, Yan Zheng, Qiaojun Yu, Pengyi Li, Guowei Huang, Helong Huang, Xingyue Quan, Jianye Hao

机构 * Tianjin University(天津大学) Huawei Noah's Ark Lab(华为诺亚实验室) Shanghai AI Lab(上海人工智能实验室)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出ForceFlow框架,通过融合力信号与多模态信息,提升机器人在复杂接触任务中的鲁棒性和泛化能力,实验显示其在六个真实任务中成功率提升37%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22449 2026-08-25 cs.RO cs.AI 新提交 70%

EMPIRE: Explicit Manipulation Planning as a Learnable Intermediate Representation for Egocentric Hand-Motion Forecasting

EMPIRE:将显式操作规划作为可学习中间表征用于自我中心视角下手运动预测

Wen Wang, Ruibing Hou, Hong Chang, Shiguang Shan, Xilin Chen

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对现有手运动预测方法忽略操作过程、梯度干扰的问题,提出两阶段框架EMPIRE,构建EMPIRE-651K数据集,实现了更优的手运动预测精度。

Comments 14 pages, 10 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20735 2026-08-25 cs.AI cs.RO 版本更新 70%

ForeTime-VLA: Causal Future-Token Distillation from a World Action Model for Conveyor-Belt Manipulation

ForeTime-VLA:面向传送带操作的世界动作模型的因果未来令牌蒸馏

Siyuan Ma, Yutian Zhang, Boshi Zhang, Qinglian Wu, Jiaqi Zhai, Dong Wei, Xiaojin Huang

机构 * Tsinghua University(清华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) Hangzhou Yunshenchu Technology Co., Ltd. (DEEP Robotics)(杭州云深处科技有限公司(深地机器人))

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出ForeTime-VLA策略,通过从冻结Fast-WAM教师模型蒸馏因果未来令牌,在传送带操控任务上降低了MAE和L2误差,提升了抓取成功率,验证了该方法的有效性。

Comments 8 pages, 5 figures. Introduces ForeTime-VLA, a causal future-token distillation method for conveyor-belt manipulation from a frozen world action model teacher

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21596 2026-08-25 cs.CV 版本更新 70%

$ϕ$-Scene: Physically Grounded Image-to-3D Scene Reconstruction

$\phi$-Scene: 物理驱动的图像到3D场景重建

Haodong Li, Lulu Shao, Haolin Lu, Yu Fu, Yen-Ru Chen, Seemandhar Jain, Manmohan Chandraker

机构 * University of California San Diego(加州大学圣地亚哥分校)

专题命中 VLM训练与架构 :VLM(abstract_cn);MLLM(abstract);分类 cs.CV

AI总结 提出$\phi$-Scene方法,将单图像3D场景重建视为拓扑驱动的物理组装过程,通过SDF优化和刚体仿真解决穿透与不稳定接触问题,在3D-Front数据集上取得最优性能。

Comments Project page: https://phi-scene.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17949 2026-08-25 cs.CV 版本更新 70%

SkyNative: A Native Multimodal Architecture for Remote Sensing Vision-Language Understanding

SkyNative: 一种面向遥感视觉证据推理的原生多模态框架

Xiao Yang, Ronghao Fu, Zhiwen Lin, Zhuoran Duan, Lang Sun, Jiaqi Liu, Jiashun Zhu, Jiasen Hu, Xu Na, Bo Yang

机构 * College of Computer Science and Technology, Jilin University, China(吉林大学计算机科学与技术学院) Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education(教育部符号计算与知识工程重点实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出SkyNative,一种原生多模态框架,通过去除预训练视觉骨干,直接在语言模型token空间中表示图像为原始patch tokens,以提升遥感图像的细粒度空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20749 2026-08-24 cs.CV 新提交 70%

Identity-Preserving Text-to-Video Generation via Agentic Enhancement and Semantic Repair

通过智能体增强与语义修复实现身份保留的文本到视频生成

Jiayi Gao, Changcheng Hua, Jiaqi Tang, Yuxin Peng, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对现有商业视频生成模型的身份漂移等缺陷,提出AESR轻量级框架,含智能体提示增强与视觉语义修复模块,搭配混合专家选择策略,其系统MIPL_Video在ACM MM 2026挑战赛赛道1获第一

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20382 2026-08-24 cs.CL cs.CV 新提交 70%

Decoupled Vision-Language System for Multimodal Understanding and Generation

用于多模态理解与生成的解耦式视觉-语言系统

Yifan Xu, Baochen Xiong, Xiaoshan Yang, Donglin Di, Yaowei Wang, Changsheng Xu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Peng Cheng Laboratory(鹏城实验室) Li Auto(理想汽车)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 本研究提出多模态大语言模型Libra的解耦式视觉-语言架构,通过开关注意力与FFN模块实现自模态与跨模态解耦,在理解与生成任务上均取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22240 2026-08-20 cs.CV 版本更新 70%

OccDirector: Language-Guided Behavior and Interaction Generation in 4D Occupancy Space

OccDirector:基于语言的4D占用空间中行为与交互生成

Zhuding Liang, Tianyi Yan, Dubing Chen, Jiasen Zheng, Huan Zheng, Cheng-zhong Xu, Yida Wang, Kun Zhan, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau, Macau, China(SKL-IOTSC、CIS、澳门大学、澳门、中国) Li Auto Inc, Beijing, China(Li Auto Inc、北京、中国)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出OccDirector框架,通过自然语言生成4D占用空间动态,解决复杂多代理交互生成问题,引入多级语言指令数据集和评估基准,实现语言驱动的行为编排。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17423 2026-08-19 cs.RO cs.LG 新提交 70%

Prism-GRPO: Faster VLA Policy Optimization via Splitting Same-outcome Groups

Prism-GRPO:通过拆分相同结果组实现更快的视觉-语言-动作(VLA)策略优化

Zeyun Deng, Yuzhe Lu, Yawei Wang, Linbo Liu, Qing Ping, Han Ding, Guande Wu, Panpan Xu, Jun Huan

机构 * AWS AI(亚马逊云科技人工智能部门)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.LG

AI总结 该研究提出 Prism-GRPO 算法,通过拆分 GRPO 的相同结果组并引入加权执行质量分数,减少机器人 rollout 预算浪费,在四个 RoboTwin 任务中使达到目标成功率的 rollout 最多减少 56%,还抑制了奖励黑客捷径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08024 2026-08-18 cs.CV cs.SE 版本更新 70%

A Highly Efficient Diversity-based Input Selection for DNN Improvement Using VLMs

一种基于多样性的高效输入选择方法用于通过VLMs改进DNN

Amin Abbasishahkoo, Mahboubeh Dadkhah, Lionel Briand

机构 * School of EECS, University of Ottawa(电气与计算机工程系,渥太华大学) Research Ireland Lero centre for software, University of Limerick(软件研究中心,利默里克大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 本文提出基于概念的多样性(CBD)方法,利用视觉语言模型高效改进DNN,通过混合输入选择策略在大规模数据集上实现高效且有效的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14403 2026-08-17 cs.CV 新提交 70%

CRAFT: Constrained Reward via Attention Fine-Tuning for Subject Personalization without Composed Targets

CRAFT:无需组合目标的主题个性化的注意力微调约束奖励

Jihun Park, Kyoungmin Lee, Jongmin Gim, Hyeonseo Jo, Jaeyeul Kim, Han Zou, Zhenpeng Zhan, Yan Zhang, Sunghoon Im

机构 * DGIST(大邱科技研究院) Baidu, Inc.(百度公司) KAIST(韩国科学技术院)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出无需组合目标监督的CRAFT框架,通过LoRA适配器微调参考感知MMDiT,仅用1万张参考样本,在XVerseBench上实现图像主题个性化的最先进性能,且可迁移至其他骨干网络。

Comments 20 pages, 8 figures, ACM SIGGRAPH Asia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12717 2026-08-14 cs.LG cs.CL 新提交 70%

Perturbation-based Regional Interpretability through Subtraction Mapping (PRISM): naming-error dissociations in language models and post-stroke aphasia

基于减法映射的扰动型区域可解释性方法(PRISM):语言模型与卒中后失语症中的命名错误分离现象

Xiang Guan, Roger D. Newman-Norlund, Yong Yang, Saeed Ahmadi, Regan Willis, Nadra Salman, Kalil Warren, Srihari Nelakuditi, Chris Rorden, Leonardo Bonilha, Julius Fridriksson

机构 * University of South Carolina(南卡罗来纳大学) ALLT.AI, LLC(ALLT.AI有限责任公司) USC School of Medicine(南卡罗来纳大学医学院)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.LG

AI总结 本研究开发PRISM方法,将神经成像减法分析适配至Transformer语言模型,对比模型与213名卒中后失语症患者的命名错误模式,验证了音素偏向性分离等结果,为模型功能专业化提供可证伪的空间分辨率测试工具。

Comments 49 pages, 6 figures, 1 table. Supplementary methods, 6 tables and 5 figures included

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16285 2026-08-14 cs.CV 版本更新 70%

EvoTale: Continual Character Customization for Expanding Story Worlds

持久故事世界模拟与连续角色定制

Jinlu Zhang, Qiyun Wang, Baoxiang Du, Jiayi Ji, Jing He, Rongsheng Zhang, Tangjie Lv, Xiaoshuai Sun, Rongrong Ji

机构 * Xiamen University(厦门大学) The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Fuxi AI Lab, Netease Inc.(福克斯AI实验室,网易公司)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出EverTale,通过统一LoRA模块实现连续角色自定义,引入质量门和区域聚焦采样策略,提升多角色视觉叙事的准确性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03880 2026-08-14 cs.CV 版本更新 70%

Exploring Instruction Data Quality for Explainable Image Quality Assessment

探索可解释图像质量评估的指令数据质量

Yunhao Li, Sijing Wu, Jun Jia, Kang Fu, Qi Jia, Yucheng Zhu, Wei Sun, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 该研究针对可解释图像质量评估任务,提出Q-Selector数据选择框架,仅用10%训练数据就达到全数据微调的102.1%和103.7%性能,证明指令数据存在冗余。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12314 2026-08-13 cs.CV 新提交 70%

StateFlow: Building, Evolving, and Accessing 3D World States for Previsualization

StateFlow:用于预可视化的3D世界状态的构建、演化与访问

Yuyang Yin, Zixiang Li, Longxuan Deng, Hongkai Li, Shifang Zhao, Junnan Liu, Weirong Huang, Mengyu Wang, Tianxiao Fu, Yikai Wang, Peng-Shuai Wang, Xiaojie Jin, Yao Zhao, Yunchao Wei

机构 * Beijing Jiaotong University(北京交通大学) Mootion AI Beijing Normal University(北京师范大学) Peking University(北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 StateFlow是一种以状态为中心的预可视化框架,通过构建、演化、访问可编辑3D世界的三阶段方法,提升生成预可视化的可控性与迭代编辑能力,可生成高质量3D世界用于视频创作和游戏原型设计。

Comments Project Page: https://yuyangyin.github.io/StateFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12122 2026-08-13 cs.RO cs.CV 新提交 70%

HandEdit: A Unified Benchmark for Egocentric Human-to-Robot Dexterous Hand Image Editing

HandEdit:用于自我中心视角下人类到机器人灵巧手图像编辑的统一基准

Zhenjie Yang, Xingyu Jiao, Guopeng Zhong, Shuzhe Yang, Shi Che, Chao Wu, Chenyu Jiang, Dongjie Zhang, Yideng Zhang, Zheng Zhang, Muyun Jiang, Haisheng Su, Shuang Jin, Donghang Zhang, Chao Yang, Li Chen, Hongyang Li, Zuxuan Wu, Yu-Gang Jiang, Xiaosong Jia, Junchi Yan

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 HandEdit是含2亿+实例、覆盖26种URDF的统一具身感知图像编辑基准,用于弥合人类与机器人数据差异,可评估11种图像编辑基线,助力具身人工智能发展。

Comments Technical Report. Project Page: https://handedit.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09730 2026-08-13 cs.CV cs.RO 交叉投稿 70%

World Tokens: Enhancing Embodied Policies with Training-Time World Modeling

世界令牌:通过训练时世界建模增强具身策略

Qu Tang, Benhui Zhuang, Bo Yuan, Xue Yu, Longteng Guo, Junlan Feng

机构 * JIUTIAN Research(九天研究院) Zhongguancun Academy(中关村学院)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出World Tokens架构,通过训练时的World Adapter衔接视觉-语言理解、世界动态建模与动作生成,在保持高效部署的同时提升具身策略性能,在多个基准测试中取得优异结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15779 2026-08-12 cs.CV 版本更新 70%

Multimodal Ambivalence and Hesitancy Recognition via Cross-Attention and Gated Fusion

通过交叉注意力和门控融合进行多模态矛盾与犹豫识别

Oussama Berhili, Yassine Ouzar, Larbi Boubchir

机构 * University of Paris 8(巴黎第八大学) LIASD Laboratory(LIASD实验室)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.CV

AI总结 为ECCV 2026的ABAW11挑战赛开发多模态框架,用预训练编码器提取多模态特征,建立单模态基线,在此基础上提出含交叉注意力和门控融合的多模态架构,验证集宏F1达0.7394,提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09931 2026-08-11 cs.CV 新提交 70%

Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots

监督之前的感知:来自反事实盲区的自包含视觉蒸馏

Shravan Venkatraman, Omkar Thawakar, Ritesh Thawkar, Abdelrahman Shaker, Rao Muhammad Anwer

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Aalto University(阿尔托大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 该研究提出首个完全自包含的视觉自蒸馏框架 CVPD,通过识别模型视觉盲区生成密集对比监督,在 Qwen3-VL-8B-Instruct 上的 12 个基准中优于 6 个自进化基线,取得多项指标提升且无性能倒退。

Comments BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09907 2026-08-11 cs.CV 新提交 70%

DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning

DistMoE:用于分布式指令调优的混合专家模型中无需私有数据排练的路由机制

Mainak Singha, Niccolò Biondi, Elisa Ricci, Subhankar Roy

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯塞勒基金会) University of Bergamo(贝加莫大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract,abstract_cn);分类 cs.CV

AI总结 针对多模态大语言模型分布式私有数据场景,提出DistMoE混合专家方法,通过公共锚定专家组合阶段实现无需排练的路由,在视觉-语言基准上取得灵活复用与适配的竞争力性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08418 2026-08-11 cs.CV 新提交 70%

Learning Deep Modality-Shared Self-Expressiveness for Image Clustering with Textual Information

用于结合文本信息的图像聚类的深度模态共享自表达学习

Xianghan Meng, Wei He, Zhiyuan Huang, Chun-Guang Li

专题命中 VLM训练与架构 :vision-language model(abstract,abstract_cn);分类 cs.CV

AI总结 提出DeepMORSE方法,通过模态共享自表达模型学习结合文本信息的图像聚类,在6个基准数据集上聚类性能提升超3%,且所学表示可迁移至下游任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07141 2026-08-10 cs.CV 新提交 70%

Human-AI Perceptual Alignment by Playing Hues and Cues

通过玩Hues and Cues游戏实现人类与AI的感知对齐

Nuria Alabau-Bosque, Jorge Vila-Tomás, Paula Daudén-Oliver, Pablo Hernández-Cámara, Valero Laparra, Jesús Malo

机构 * Universitat de València(瓦伦西亚大学) Image Processing Lab(图像处理实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本研究提出基于Hues and Cues游戏的评估框架,对比162个CVLMs与人类的颜色感知对齐,发现其在抽象领域偏离人类基线,筛选的预训练数据集可缓解错位。

Comments 19 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06429 2026-08-10 cs.CL cs.LG 新提交 70%

Recovering Lesion Parameters from Aphasic Picture Naming Error Profiles in Large Language Models

从大型语言模型中失语症图片命名错误轮廓中恢复损伤参数

Yong Yang, Roger Newman-Norlund, Xiang Guan, Saeed Ahmadi, Regan Willis, Nadra Salman, Kalil Warren, Sophie Arheix-Parras, Srihari Nelakuditi, Leonardo Bonilha, Christopher Rorden, Rutvik H. Desai, Julius Fridriksson

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.LG

AI总结 该研究针对LLM的失语症图片命名错误轮廓,训练多任务神经网络恢复损伤参数,发现除层索引仅邻域可恢复外,修改百分比和噪声sigma可恢复,反事实验证达81.4%,还能泛化到中风幸存者数据,揭示Transformer层功能冗余。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05720 2026-08-07 cs.CV 新提交 70%

PhyLatent: Learning Dynamics-Relevant Representations for JEPA World Models

PhyLatent:为JEPA世界模型学习与动力学相关的表征

Xi Zeng, Haojie Ren, Ziying Song

机构 * School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航天工程学院) School of Artificial Intelligence (School of Software), Yanshan University(燕山大学人工智能学院(软件学院)) The University of Sheffield(谢菲尔德大学)

专题命中 VLM训练与架构 :grounding(abstract,abstract_cn);分类 cs.CV

AI总结 PhyLatent为JEPA世界模型设计训练目标,解决其三类失效模式,在OGBench-Cube等数据集上显著降低失效率、提升MPC成功率,证明全局非坍塌不足以学习可靠的JEPA状态空间。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05485 2026-08-07 cs.CV 新提交 70%

VideoArgus: Agentic Rubric-Grounded Unified Evaluation for Video Generation and Editing

VideoArgus:基于智能体评分规则的视频生成与编辑统一评估框架

Ziyun Zeng, Zixuan Wang, Yongsheng Yu, Hang Hua, Jiebo Luo

机构 * University of Rochester(罗切斯特大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对现有视频评估基准的局限,本文提出VideoArgus框架,构建含1026个实例的VideoArgus-Bench,其在与人类判断的相关性上优于基准特定评估器,且模型排名稳定。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21343 2026-08-06 cs.CV 版本更新 70%

Latent Denoising Improves Visual Alignment in Large Multimodal Models

潜在去噪提升大多模态模型的视觉对齐

Dhruv Parikh, Jacob Fein-Ashley, Rajgopal Kannan, Viktor Prasanna

机构 * University of Southern California(南加州大学) DEVCOM ARL Army Research Office(DEVCOM ARL陆军研究办公室)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出通过潜在去噪框架改进大多模态模型的内部视觉特征对齐和多模态理解,采用掩码和高斯噪声混合腐蚀视觉token,并利用解码器恢复教师特征,提升模型在分布偏移下的鲁棒性。

Comments ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04010 2026-08-05 cs.CV cs.CL 新提交 70%

ParVL: Parallel Scaling and Expandable Compute Allocation for Multimodal LLMs

ParVL:面向多模态大语言模型的并行缩放与可扩展计算分配

Yang Yang, Qinyu Zhao, Mouxiang Chen, Xiaohui Li, Lixin Gu, Wenhai Wang, Hongjie Zhang, Wenwei Zhang

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 本研究针对多模态大语言模型的计算分配僵化问题,提出ParVL框架,通过复用骨干参数扩展并行计算,在13B token上微调后,其多模态性能优于同配置单分支基线,且最优分配随任务变化。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01942 2026-08-04 cs.CV cs.CL cs.MM 新提交 70%

CultureVidBench: Benchmarking Cultural Understanding in Text-to-Video Generation

CultureVidBench:文本到视频生成中的文化理解基准测试

Xianjing Han, Yuhan Su, Yang Deng, Dong Ma, Wee Peng Tay, Bin Zhu

机构 * Nanyang Technological University(南洋理工大学) Centrale Supélec(中央高等电力学院) Singapore Management University(新加坡管理大学) University of Cambridge(剑桥大学)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本研究推出CultureVidBench基准,评估7款T2V模型的文化理解能力,发现现有模型难捕捉细粒度文化细节,尤其针对代表性不足的文化区域与线索。

Comments Project page:https://hanxjing.github.io/CultureVidBench/

详情

展开后加载摘要…

URL PDF HTML 收藏