arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-10 至 2026-02-10 共收录 8 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 8 篇

2510.11341 2026-02-10 cs.CV 83%

InternSVG: Towards Unified SVG Tasks with Multimodal Large Language Models

InternSVG:通过多模态大语言模型实现统一的SVG任务

Haomin Wang, Jinhui Yin, Qi Wei, Wenguang Zeng, Lixin Gu, Shenglong Ye, Zhangwei Gao, Yaohui Wang, Yanting Zhang, Yuanqi Li, Yanwen Guo, Wenhai Wang, Kai Chen, Yu Qiao, Hongjie Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) Donghua University(东华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 InternSVG通过多模态大语言模型实现统一的SVG任务建模,结合大规模数据集和两阶段训练策略,提升SVG理解、编辑和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07993 2026-02-10 cs.CV cs.AI 73%

MCIE: Multimodal LLM-Driven Complex Instruction Image Editing with Spatial Guidance

MCIE: 多模态大语言模型驱动的复杂指令图像编辑与空间引导

Xuehai Bai, Xiaoling Gu, Akide Liu, Hangjie Yuan, YiFan Zhang, Jack Ma

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 MCIE通过空间引导和背景一致性模块,提升复杂指令图像编辑的指令合规性,实现23.96%的性能提升。

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08785 2026-02-10 cs.CV cs.AI 62%

DeltaSpace: A Semantic-aligned Feature Space for Flexible Text-guided Image Editing

DeltaSpace: 一种语义对齐的特征空间用于灵活的文本引导图像编辑

Yueming Lyu, Kang Zhao, Bo Peng, Huafeng Chen, Yue Jiang, Yingya Zhang, Jing Dong, Caifeng Shan

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 DeltaSpace通过语义对齐的特征空间实现文本引导图像编辑的灵活训练和推理,支持零样本推理和无需文本的训练。

Comments 18 pages. arXiv admin note: text overlap with arXiv:2303.06285

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07608 2026-02-10 cs.CV 57%

HistoMet: A Pan-Cancer Deep Learning Framework for Prognostic Prediction of Metastatic Progression and Site Tropism from Primary Tumor Histopathology

HistoMet:一种跨癌症深度学习框架,用于从原发肿瘤组织病理学预测转移进展和转移部位

Yixin Chen, Ziyu Su, Lingbin Meng, Elshad Hasanov, Wei Chen, Anil Parwani, M. Khalid Khan Niazi

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 HistoMet通过双模块预测流程,利用预训练的病理学视觉-语言模型,实现了从原发肿瘤组织病理学中预测转移进展和转移部位的稳健预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17321 2026-02-10 cs.RO cs.CL 50%

OpenGVL -- Benchmarking Visual Temporal Progress for Data Curation

OpenGVL -- 视觉时间进程数据整理的基准测试

Paweł Budzianowski, Emilia Wiśnios, Michał Tyrolski, Gracjan Góral, Igor Kulakov, Viktor Petrenko, Krzysztof Walas

机构 * Lute IDEAS Research Institute(IDEAS研究机构) Simple Automation Poznań University of Technology(波兹南技术大学) University of Warsaw(华沙大学)

专题命中 其他VLM :vision-language model(abstract)

AI总结 OpenGVL通过评估开源模型在时序任务预测中的表现,揭示其在机器人数据整理中的局限性,并提供自动化数据筛选的实用工具。

Comments Workshop on Making Sense of Data in Robotics: Composition, Curation, and Interpretability at Scale at CoRL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08444 2026-02-10 cs.HC 50%

GlyphWeaver: Unlocking Glyph Design Creativity with Uniform Glyph DSL and AI

GlyphWeaver: 通过统一的 glyph DSL 和 AI 解锁 glyph 设计创意

Can Liu, Shiwei Chen, Zhibang Jiang, Yong Wang

专题命中 其他VLM :multimodal large language model(abstract)

AI总结 GlyphWeaver 通过统一的 glyph DSL 和 AI 技术,为非程序员提供创建复杂 glyph 可视化的工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19611 2026-02-10 cs.HC 50%

Scene2Hap: Generating Scene-Wide Haptics for VR from Scene Context with Multimodal LLMs

Scene2Hap: 从场景上下文生成VR场景中的全域触觉反馈

Arata Jingu, Easa AliAbbasi, Sara Safaee, Paul Strohmeier, Jürgen Steimle

专题命中 其他VLM :multimodal large language model(abstract)

AI总结 Scene2Hap通过多模态大语言模型生成VR场景中的触觉反馈,提升沉浸感与真实感。

Comments Accepted at CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20030 2026-02-10 cs.SI 50%

Counting How the Seconds Count: Understanding Algorithm-User Interplay in TikTok via ML-driven Analysis of Video Content

秒数如何计数:通过机器学习分析视频内容理解TikTok上的算法-用户互动

Maleeha Masood, Shreya Kannan, Zikun Liu, Deepak Vasisht, Indranil Gupta

专题命中 其他VLM :vision language model(abstract)

AI总结 通过机器学习分析TikTok视频内容,研究算法与用户互动的时间演变及用户体验影响。

Comments To contact, email maleeha2@illinois.edu

详情

展开后加载摘要…

URL PDF HTML 收藏