arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-03 至 2026-03-03 共收录 12 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 12 篇

2603.00426 2026-03-03 cs.CL cs.CV 83%

LLM-Bootstrapped Targeted Finding Guidance for Factual MLLM-based Medical Report Generation

基于大语言模型的引导式目标发现指导:用于基于事实的多模态大语言模型医疗报告生成

Cunyuan Yang, Dejuan Song, Xiaotao Pang, Qianqian Shen, Wenjie Nie, Yifan Huang, Lei Wu, Wei Han, Haishuai Wang, Jiajun Bu

机构 * Zhejiang University(浙江大学) The Second Affiliated Hospital Zhejiang University School of Medicine(浙江大学医学院附属第二医院) Hangzhou Pu Jian Medical Technology Co., Ltd.(杭州普健医疗科技有限公司)

专题命中 其他VLM :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出Fact-Flow框架,通过引导大语言模型生成事实准确的医疗报告,利用LLM自动生成标注数据集,提升医疗报告生成的事实准确性。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22171 2026-03-03 cs.HC 82%

A Taxonomy of Human--MLLM Interaction in Early-Stage Sketch-Based Design Ideation

早期阶段基于草图的设计构想中人类与大语言模型交互的分类

Weiyan Shi, Kenny Tsu Wei Choo

专题命中 其他VLM :MLLM(title,abstract);multimodal large language model(abstract)

AI总结 本文提出了一种分类方法,用于描述人类与大语言模型在早期阶段基于草图的设计构想中的交互模式,揭示了人类与AI角色的动态变化。

Comments Accepted at CHI 2026 Posters

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19496 2026-03-03 cs.CR cs.AI 79%

Multi-PA: A Multi-perspective Benchmark on Privacy Assessment for Large Vision-Language Models

多视角:面向大视觉-语言模型隐私评估的基准测试

Jie Zhang, Xiangkui Cao, Zhouyu Han, Shiguang Shan, Xilin Chen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.AI

AI总结 Multi-PA是一个多视角的隐私评估基准,用于评估大视觉-语言模型在隐私意识和泄露方面的保护能力,揭示了当前模型在隐私保护方面的风险和漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22975 2026-03-03 cs.CV cs.GR cs.LG 62%

VoMP: Predicting Volumetric Mechanical Property Fields

VoMP:预测体积机械属性场

Rishit Dagli, Donglai Xiang, Vismay Modi, Charles Loop, Clement Fuji Tsang, Anka He Chen, Anita Hu, Gavriel State, David I. W. Levin, Maria Shugrina

机构 * NVIDIA University of Toronto(多伦多大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 VoMP通过训练几何变换器预测3D物体的体积机械属性场,结合多视角特征和现实世界数据集,实现高精度和高速度的属性估计。

Comments Project Page and hi-res paper: https://research.nvidia.com/labs/sil/projects/vomp

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08919 2026-03-03 cs.CV cs.LG 62%

PHyCLIP: $\ell_1$-Product of Hyperbolic Factors Unifies Hierarchy and Compositionality in Vision-Language Representation Learning

PHyCLIP通过$\ell_1$-Product度量结合双曲因子,统一了视觉-语言表示学习中的层次结构与组合性

Daiki Yoshikawa, Takashi Matsubara

机构 * Hokkaido University(北海道大学) CyberAgent

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 PHyCLIP通过$\ell_1$-Product度量结合双曲因子,统一了视觉-语言表示学习中的层次结构与组合性。

Comments 24 pages. Codes are available at https://github.com/tksmatsubara/PHyCLIP

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00159 2026-03-03 cs.CV cs.AI cs.MM cs.SD 62%

FlowPortrait: Reinforcement Learning for Audio-Driven Portrait Video Generation

FlowPortrait:基于强化学习的音频驱动肖像视频生成

Weiting Tan, Andy T. Liu, Ming Tu, Xinghua Qu, Philipp Koehn, Lu Lu

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 FlowPortrait通过强化学习框架结合多模态模型和人类对齐评估系统,提升音频驱动肖像视频生成的质量和表现力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02138 2026-03-03 cs.CV 57%

OmniLottie: Generating Vector Animations via Parameterized Lottie Tokens

OmniLottie:通过参数化Lottie令牌生成向量动画

Yiying Yang, Wei Cheng, Sijin Chen, Honghao Fu, Xianfang Zeng, Yujun Cai, Gang Yu, Xingjun Ma

专题命中 其他VLM :vision language model(abstract);分类 cs.CV

AI总结 OmniLottie通过参数化Lottie令牌生成高质量向量动画,结合多模态指令与大规模数据集提升动画生成能力。

Comments Accepted by CVPR 2026. Project Page: https://openvglab.github.io/OmniLottie/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01725 2026-03-03 cs.CV 57%

Learning Domain-Aware Task Prompt Representations for Multi-Domain All-in-One Image Restoration

学习多领域任务提示表示以实现多领域一体化图像修复

Guanglu Dong, Chunlei Li, Chao Ren, Jingliang Hu, Yilei Shi, Xiao Xiang Zhu, Lichao Mou

机构 * Sichuan University(四川大学) MedAI Technology (Wuxi) Co. Ltd.(MedAI技术(无锡)有限公司) Technical University of Munich(慕尼黑技术大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

AI总结 提出DATPRL-IR,通过多领域任务提示表示学习实现多领域一体化图像修复,优于现有方法并具备强泛化能力

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01590 2026-03-03 cs.IR cs.LG 57%

IDProxy: Cold-Start CTR Prediction for Ads and Recommendation at Xiaohongshu with Multimodal LLMs

IDProxy:小红书广告与推荐中基于多模态大语言模型的冷启动CTR预测

Yubin Zhang, Haiming Xu, Guillaume Salha-Galvan, Ruiyan Han, Feiyang Xiao, Yanhua Huang, Li Lin, Yang Luo, Yao Hu

机构 * Xiaohongshu Inc.(小红书公司) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.LG

AI总结 IDProxy通过多模态大语言模型生成代理嵌入,解决广告和推荐系统中物品冷启动的CTR预测问题,实现与现有嵌入空间的对齐和端到端优化,已在小红书大规模应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00854 2026-03-03 cs.LG cs.IR 57%

GeMi: A Graph-based, Multimodal Recommendation System for Narrative Scroll Paintings

GeMi:基于图的多模态推荐系统用于叙事卷轴绘画

Haimonti Dutta, Pruthvi Moluguri, Jin Dai, Saurabh Amarnath Mahindre

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

AI总结 GeMi是一种基于图的多模态推荐系统,专门用于叙事卷轴绘画,结合多模态内容和用户偏好,为艺术保护和数据存储提供解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00490 2026-03-03 cs.AI 57%

LifeEval: A Multimodal Benchmark for Assistive AI in Egocentric Daily Life Tasks

LifeEval: 一种面向日常生活中自体视角的多模态基准,用于辅助AI

Hengjian Gao, Kaiwei Zhang, Shibo Wang, Mingjie Chen, Qihang Cao, Xianfeng Wang, Yucheng Zhu, Xiongkuo Min, Wei Sun, Dandan Zhu, Guangtao Zhai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Shanghai University of Electric Power(上海电力大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

AI总结 LifeEval 是一个面向日常生活中自体视角的多模态基准,用于评估实时任务导向的人机协作,揭示了在动态环境中实现有效交互的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21029 2026-03-03 cs.LG 57%

FORCE: Transferable Visual Jailbreaking Attacks via Feature Over-Reliance CorrEction

FORCE:通过特征过度依赖校正实现可转移的视觉劫持攻击

Runqi Lin, Alasdair Paren, Suqin Yuan, Muyang Li, Philip Torr, Adel Bibi, Tongliang Liu

机构 * Sydney AI Centre, The University of Sydney(悉尼人工智能中心,悉尼大学) Department of Engineering Science, University of Oxford(工程科学系,牛津大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.LG

AI总结 FORCE方法通过校正特征过度依赖,提升视觉劫持攻击的跨模型可转移性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏