arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-22 至 2025-12-22 共收录 29 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3 篇

2505.15952 2025-12-22 cs.CV cs.AI 81%

VideoGameQA-Bench: Evaluating Vision-Language Models for Video Game Quality Assurance

VideoGameQA-Bench: 评估用于视频游戏质量保证的视觉-语言模型

Mohammad Reza Taesiri, Abhijay Ghildyal, Saman Zadtootaghaj, Nabajeet Barman, Cor-Paul Bezemer

机构 * University of Alberta(阿尔伯塔大学) Sony Interactive Entertainment(索尼互动娱乐)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 VideoGameQA-Bench是一个用于评估视觉-语言模型在视频游戏质量保证中性能的综合基准,涵盖视觉测试、故障检测和bug报告生成等多种任务。

Comments Project website with code and data: https://asgaardlab.github.io/videogameqa-bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17319 2025-12-22 cs.CV cs.AI cs.MM 73%

A Benchmark for Ultra-High-Resolution Remote Sensing MLLMs

超高分辨率遥感多模态大语言模型基准

Yunkai Dang, Meiyi Zhu, Donghao Wang, Yizhuo Zhang, Jiacheng Yang, Qi Fan, Yuekun Yang, Wenbin Li, Feng Miao, Yang Gao

机构 * School of Artificial Intelligence Science and Technology, Nanjing University(人工智能科学与技术学院,南京大学) School of Physics, Nanjing University(物理学院,南京大学)

专题命中 视觉问答 :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出RSHR-Bench,一个超高分辨率遥感多模态大语言模型基准,通过高分辨率图像和多样化任务评估视觉理解与推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17213 2025-12-22 cs.CV cs.LG 62%

CheXPO-v2: Preference Optimization for Chest X-ray VLMs with Knowledge Graph Consistency

CheXPO-v2:基于知识图谱一致性的胸片视觉-语言模型偏好优化

Xiao Liang, Yuxuan An, Di Wang, Jiawei Hu, Zhicheng Jiao, Bin Jing, Quan Wang

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Warren Alpert Medical School of Brown University(布朗大学沃伦·阿尔珀特医学学院) School of Biomedical Engineering, Capital Medical University(首都医科大学生物医学工程学院)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 CheXPO-v2通过知识图谱一致性奖励机制,提升胸片VLMs的临床可靠性与数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 3 篇

2512.17227 2025-12-22 cs.CV 77%

Learning When to Look: A Disentangled Curriculum for Strategic Perception in Multimodal Reasoning

学习何时观察:一种解耦的课程学习框架,用于多模态推理中的战略感知

Siqi Yang, Zilve Gao, Haibo Qiu, Fanfan Liu, Peng Shi, Zhixiong Zeng, Qingmin Liao, Lin Ma

机构 * Meituan(美团) Tsinghua University(清华大学)

专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出了一种解耦课程学习框架,通过分阶段训练提升多模态推理中的抽象推理与战略视觉感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12218 2025-12-22 cs.CV cs.CL cs.LG 73%

Journey Before Destination: On the importance of Visual Faithfulness in Slow Thinking

目的地之前:视觉忠实性在慢思考中的重要性

Rheeya Uppaal, Phu Mon Htut, Min Bai, Nikolaos Pappas, Zheng Qi, Sandesh Swamy

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) AWS AI Labs(AWS人工智能实验室)

专题命中 视觉推理 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出视觉忠实性评估方法,通过检测并修正不忠实的感知步骤提升多模态推理的可靠性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17532 2025-12-22 cs.CV cs.AI 62%

Robust-R1: Degradation-Aware Reasoning for Robust Visual Understanding

Robust-R1: 为鲁棒视觉理解的退化感知推理

Jiaqi Tang, Jianmin Chen, Wei Wei, Xiaogang Xu, Runtao Liu, Xiangyu Wu, Qipeng Xie, Jiafei Wu, Lei Zhang, Qifeng Chen

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 Robust-R1通过结构化推理链显式建模视觉退化,提升多模态大语言模型在现实世界退化下的鲁棒性与抗干扰能力。

Comments Accepted by AAAI2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 8 篇

2510.16442 2025-12-22 cs.CV cs.AI 81%

EDVD-LLaMA: Explainable Deepfake Video Detection via Multimodal Large Language Model Reasoning

EDVD-LLaMA: 通过多模态大语言模型推理进行可解释的深度伪造视频检测

Haoran Sun, Chen Cai, Huiping Zhuang, Kong Aik Lee, Lap-Pui Chau, Yi Wang

机构 * Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(电子与电气工程系,香港理工大学) School of Electrical and Electronic Engineering, Nanyang Technological University(电子与电气工程学院,南洋理工大学) Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(智能工程学院,华南理工大学)

专题命中 视觉定位与Grounding :multimodal large language model(title);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 EDVD-LLaMA通过多模态大语言模型推理实现深度伪造视频检测的可解释性,结合时空特征提取和细粒度推理机制,提升检测准确性与解释可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17640 2025-12-22 cs.CV 70%

Generative Human-Object Interaction Detection via Differentiable Cognitive Steering of Multi-modal LLMs

通过可微认知引导的多模态大语言模型进行生成式人类-物体交互检测

Zhaolin Cai, Huiyu Duan, Zitong Xu, Fan Li, Zhi Liu, Jing Liu, Wei Shen, Xiongkuo Min, Guangtao Zhai

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(上海交通大学图像通信与网络工程研究所) Xi’an Jiao Tong University(西安交通大学) Shandong University(山东大学) Tianjin University(天津大学)

专题命中 视觉定位与Grounding :grounding(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出GRASP-HO框架,通过可微认知引导的多模态大语言模型实现生成式人类-物体交互检测,解决封闭集分类与开放词汇生成之间的监督不匹配问题,实现判别感知与生成推理的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12146 2025-12-22 cs.CV cs.AI 62%

Multi Anatomy X-Ray Foundation Model

多解剖X光基础模型

Nishank Singla, Krisztian Koos, Farzin Haddadpour, Amin Honarmandi Shandiz, Lovish Chum, Xiaojian Xu, Qing Jin, Erhan Bas

机构 * GE HealthCare(通用电气医疗)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 XR-0通过自监督学习在多解剖X光数据上训练,实现了在多种临床任务中的高性能表现,展示了解剖多样性对构建通用医学视觉模型的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17733 2025-12-22 cs.IR cs.AI 57%

Diversity Recommendation via Causal Deconfounding of Co-purchase Relations and Counterfactual Exposure

通过共购关系和反事实暴露的因果去偏实现多样性推荐

Jingmao Zhang, Zhiting Zhao, Yunqi Lin, Jianghong Ma, Tianjun Wei, Haijun Zhang, Xiaofeng Zhang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 Cadence通过因果去偏共购关系和反事实暴露提升推荐多样性,同时保持准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17661 2025-12-22 cs.RO cs.LG 57%

Vidarc: Embodied Video Diffusion Model for Closed-loop Control

Vidarc:用于闭环控制的具身视频扩散模型

Yao Feng, Chendong Xiang, Xinyi Mao, Hengkai Tan, Zuyue Zhang, Shuhe Huang, Kaiwen Zheng, Haitian Liu, Hang Su, Jun Zhu

机构 * Dept. of Comp. Sci. and Tech., Institute for AI, BNRist Center, THBI Lab, Tsinghua-Bosch Joint ML Center, Tsinghua University(计算机科学与技术系,人工智能研究院,BNRist中心,THBI实验室,清华-博世联合机器学习中心,清华大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 Vidarc 提出了一种基于视频扩散的具身模型,通过掩码反向动力学模型实现快速准确的闭环控制,提升了现实部署中的成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17331 2025-12-22 cs.CV 57%

SynergyWarpNet: Attention-Guided Cooperative Warping for Neural Portrait Animation

SynergyWarpNet:基于注意力的协同形变用于神经肖像动画

Shihang Li, Zhiqiang Gong, Minming Ye, Yue Gao, Wen Yao

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能联合实验室,人工智能研究院,上海交通大学) Defense Innovation Institute, Academy of Military Science(国防创新研究院,军事科学院) Intelligent Game and Decision Laboratory(智能游戏与决策实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 SynergyWarpNet通过基于注意力的协同形变框架,实现了高保真的说话头合成,解决了传统方法在运动转移和几何基础方面的不足。

Comments Submitted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16928 2025-12-22 cs.LG cs.DC 57%

Dion2: A Simple Method to Shrink Matrix in Muon

Dion2: 一种简化矩阵压缩的穆恩方法

Kwangjun Ahn, Noah Amsel, John Langford

机构 * Microsoft Research, AI Frontiers(微软研究院,人工智能前沿)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 Dion2通过稀疏化矩阵更新来简化穆恩优化器的正交化步骤,从而降低计算和通信开销,提升可扩展性。

Comments https://github.com/microsoft/dion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09116 2025-12-22 cs.CV 57%

Zero-shot Hierarchical Plant Segmentation via Foundation Segmentation Models and Text-to-image Attention

零shot分层植物分割:通过基础分割模型和文本到图像注意力

Junhao Xing, Ryohei Miyakawa, Yang Yang, Xinpeng Liu, Risa Shinoda, Hiroaki Santo, Yosuke Toda, Fumio Okura

机构 * The University of Osaka(大阪大学) Phytometrics Nagoya University(名古屋大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 ZeroPlantSeg通过基础分割模型和文本到图像注意力实现零shot分层植物分割,有效提取植物个体,优于现有方法。

Comments WACV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 1 篇

2508.07313 2025-12-22 cs.CV 70%

DocR1: Evidence Page-Guided GRPO for Multi-Page Document Understanding

DocR1: 证据页面引导的GRPO用于多页文档理解

Junyu Xiong, Yonghui Wang, Weichao Zhao, Chenyu Liu, Bing Yin, Wengang Zhou, Houqiang Li

专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 DocR1通过证据页面引导的GRPO框架,提升多页文档理解能力,实现高质量模型训练与多任务性能突破。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 2 篇

2512.15431 2025-12-22 cs.CV 57%

Step-GUI Technical Report

Step-GUI 技术报告

Haolong Yan, Jia Wang, Xin Huang, Yeqing Shen, Ziyang Meng, Zhimin Fan, Kaijun Tan, Jin Gao, Lieyu Shi, Mi Yang, Shiliang Yang, Zhirui Wang, Brian Li, Kang An, Chenyang Li, Lei Lei, Mengmeng Duan, Danxun Liang, Guodong Liu, Hang Cheng, Hao Wu, Jie Dong, Junhao Huang, Mei Chen, Renjie Yu, Shunshan Li, Xu Zhou, Yiting Dai, Yineng Deng, Yingdan Liang, Zelin Chen, Wen Sun, Chengxu Yan, Chunqin Xu, Dong Li, Fengqiong Xiao, Guanghao Fan, Guopeng Li, Guozhen Peng, Hongbing Li, Hang Li, Hongming Chen, Jingjing Xie, Jianyong Li, Jingyang Zhang, Jiaju Ren, Jiayu Yuan, Jianpeng Yin, Kai Cao, Liang Zhao, Liguo Tan, Liying Shi, Mengqiang Ren, Min Xu, Manjiao Liu, Mao Luo, Mingxin Wan, Na Wang, Nan Wu, Ning Wang, Peiyao Ma, Qingzhou Zhang, Qiao Wang, Qinlin Zeng, Qiong Gao, Qiongyao Li, Shangwu Zhong, Shuli Gao, Shaofan Liu, Shisi Gao, Shuang Luo, Xingbin Liu, Xiaojia Liu, Xiaojie Hou, Xin Liu, Xuanti Feng, Xuedan Cai, Xuan Wen, Xianwei Zhu, Xin Liang, Xin Liu, Xin Zhou, Yifan Sui, Yingxiu Zhao, Yukang Shi, Yunfang Xu, Yuqing Zeng, Yixun Zhang, Zejia Weng, Zhonghao Yan, Zhiguo Huang, Zhuoyu Wang, Zihan Yan, Zheng Ge, Jing Li, Yibo Zhu, Binxing Jiao, Xiangyu Zhang, Daxin Jiang

机构 * GELab-Team(GELab团队)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV

AI总结 Step-GUI 是一种先进的 GUI 代理,通过自我进化训练管道和 GUI-MCP 协议,在保持高准确率的同时实现高效隐私保护的 GUI 自动化。

Comments 41 pages, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15258 2025-12-22 cs.RO cs.AI 57%

VLA-AN: An Efficient and Onboard Vision-Language-Action Framework for Aerial Navigation in Complex Environments

VLA-AN:一种用于复杂环境空中导航的高效且机载视觉-语言-动作框架

Yuze Wu, Mo Zhu, Xingxing Li, Yuheng Du, Yuxin Fan, Wenjun Li, Zhichao Han, Xin Zhou, Fei Gao

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 VLA-AN通过高效机载框架提升无人机在复杂环境中的导航能力,实现8.3倍推理吞吐量提升和98.1%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与鲁棒性 5 篇

2406.14862 2025-12-22 cs.LG cs.CL cs.CV 81%

LatentExplainer: Explaining Latent Representations in Deep Generative Models with Multimodal Large Language Models

LatentExplainer: 通过多模态大语言模型解释深度生成模型中的潜在表示

Mengdan Zhu, Raasikh Kanjiani, Jiahui Lu, Andrew Choi, Qirui Ye, Liang Zhao

机构 * Emory University(埃默里大学) University College London(伦敦大学学院)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.CV、cs.LG

AI总结 LatentExplainer通过多模态大语言模型为深度生成模型的潜在变量生成语义解释,提升模型可解释性。

Comments Accepted to CIKM 2025 Full Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17902 2025-12-22 cs.CV cs.AI cs.CR 73%

Adversarial Robustness of Vision in Open Foundation Models

开放基础模型中视觉的对抗鲁棒性

Jonathon Fox, William J Buchanan, Pavlos Papadopoulos

机构 * Blockpass ID Lab(Blockpass ID 实验室) Edinburgh Napier University(爱丁堡纳皮尔大学)

专题命中 幻觉与鲁棒性 :LLaVA(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了LLaVA-1.5-13B和Llama 3.2 Vision-8B-2在视觉输入下的对抗鲁棒性,发现Llama 3.2 Vision在高扰动水平下性能下降更小,表明视觉模态是降级开放权重VLMs的可行攻击向量。

Journal ref IEEE Access, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15528 2025-12-22 cs.CV 70%

EmoCaliber: Advancing Reliable Visual Emotion Comprehension via Confidence Verbalization and Calibration

EmoCaliber: 通过置信度 verbalization 和校准推进可靠的视觉情绪理解

Daiqing Wu, Dongbao Yang, Can Ma, Yu Zhou

机构 * IIE, Chinese Academy of Sciences(中国科学院信息研究所) Nankai University(南开大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 EmoCaliber通过置信度 verbalization 和校准提升视觉情绪理解的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15068 2025-12-22 cs.LG cs.AI cs.CL 62%

The Semantic Illusion: Certified Limits of Embedding-Based Hallucination Detection in RAG Systems

语义幻觉:基于嵌入的幻觉检测在RAG系统中的认证极限

Debu Sinha

机构 * Independent Researcher(独立研究者)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 研究揭示了基于嵌入的幻觉检测在RAG系统中存在语义幻觉问题,通过符合预测方法发现真实幻觉检测的挑战,证明需通过推理而非表面语义解决。

Comments 12 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09814 2025-12-22 cs.CV 57%

On the dynamic evolution of CLIP texture-shape bias and its relationship to human alignment and model robustness

CLIP纹理-形状偏倚的动态演变及其与人类对齐和模型鲁棒性的关系

Pablo Hernández-Cámara, Jose Manuel Jaén-Lorites, Alexandra Gómez-Villa, Jorge Vila-Tomás, Valero Laparra, Jesus Malo

机构 * Image Processing Lab, Universitat de Valencia, Spain(瓦伦西亚大学图像处理实验室) Centro de Biomateriales e Ingenieria Tisular, Universitat Politecnica de Valencia, Spain(瓦伦西亚理工大学生物材料与组织工程中心) Computer Vision Center, Spain(西班牙计算机视觉中心) Universitat Autònoma de Barcelona, Spain(巴塞罗那自治大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文研究CLIP模型在训练过程中纹理-形状偏倚的演变,揭示其与人类感知对齐及模型鲁棒性的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. VLM训练与架构 6 篇

2512.17574 2025-12-22 cs.DC cs.LG 83%

Enabling Disaggregated Multi-Stage MLLM Inference via GPU-Internal Scheduling and Resource Sharing

通过GPU内部调度和资源共享实现解耦的多阶段MLLM推理

Lingxiao Zhao, Haoran Zhou, Yuezhi Che, Dazhao Cheng

机构 * Wuhan University(武汉大学)

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.LG

AI总结 通过GPU内部调度和资源共享实现解耦的多阶段MLLM推理,提升吞吐量和延迟性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17313 2025-12-22 cs.CV 83%

Auxiliary Descriptive Knowledge for Few-Shot Adaptation of Vision-Language Model

辅助描述性知识用于视觉-语言模型的少样本适应

SuBeen Lee, GilHan Park, WonJun Moon, Hyun Seok Seong, Jae-Pil Heo

机构 * Sungkyunkwan University(顺天妇女大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出ADK框架,通过生成丰富的描述性提示提升视觉-语言模型在少样本适应中的性能,提供两种知识类型以增强类别区分能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17292 2025-12-22 cs.CV 83%

Vision-Language Model Guided Image Restoration

基于视觉语言模型的图像修复

Cuixin Yang, Rongkang Dong, Kin-Man Lam

机构 * Department of Electrical and Electronic Engineering(电子与电气工程系)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出VLMIR框架,利用视觉语言模型的先验知识提升图像修复性能,通过两阶段方法结合特征提取与扩散模型实现更高质量的图像恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17189 2025-12-22 cs.CV 57%

Anatomical Region-Guided Contrastive Decoding: A Plug-and-Play Strategy for Mitigating Hallucinations in Medical VLMs

解剖区域引导的对比解码:一种用于缓解医学视觉-语言模型幻觉的即插即用策略

Xiao Liang, Chenxi Liu, Zhi Ma, Di Wang, Bin Jing, Quan Wang, Yuanyuan Shi

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出了解剖区域引导的对比解码策略,通过区域特定指导缓解医学视觉-语言模型的幻觉问题,提升诊断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17121 2025-12-22 cs.LG 57%

The Effect of Negation on CLIP in Medical Imaging: Limitations of Contrastive Language-Image Pretraining

否定对CLIP在医学影像中的影响:对比语言-图像预训练的局限性

Jasmine Vu, Shivanand Sheshappanavar

机构 * Santa Clara University(圣克拉拉大学) University of Wyoming(怀俄明大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG

AI总结 研究探讨CLIP在医学影像中处理否定短语的局限性,并通过调优方法提升其检索准确性与可靠性。

Comments 10 pages, 7 figures, submitted to WACV Pixels to Patients Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17154 2025-12-22 cs.SD 50%

InstructDubber: Instruction-based Alignment for Zero-shot Movie Dubbing

InstructDubber:基于指令的零样本电影配音对齐

Zhedong Zhang, Liang Li, Gaoxiang Cong, Chunshan Liu, Yuhan Gao, Xiaowan Wang, Tao Gu, Yuankai Qi

机构 * VIPL group, ICT, CAS(中国科学院信息科技研究所VIPL小组)

专题命中 VLM训练与架构 :multimodal large language model(abstract)

AI总结 InstructDubber通过指令生成和持续时间蒸馏模块,实现鲁棒的领域内和零样本电影配音对齐。

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 其他VLM 1 篇

2512.17228 2025-12-22 cs.HC 50%

LUMIA: A Handheld Vision-to-Music System for Real-Time, Embodied Composition

LUMIA: 一种用于实时具身创作的手持视觉到音乐系统

Chung-Ta Huang, Connie Cheng, Vealy Lai

专题命中 其他VLM :vision-language model(abstract)

AI总结 LUMIA通过视觉到音乐的实时具身创作系统,将环境互动与生成式AI结合,实现基于感知的即兴音乐创作。

Comments 6 pages, 15 pages with appendix, NeurIPS 2025 Creative AI track

详情

展开后加载摘要…

URL PDF HTML 收藏