arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-15 至 2025-12-15 共收录 10 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 10 篇

2506.16396 2025-12-15 cs.LG 83%

GoalLadder: Incremental Goal Discovery with Vision-Language Models

GoalLadder: 基于视觉语言模型的增量目标发现

Alexey Zakharov, Shimon Whiteson

机构 * University of Oxford(牛津大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.LG

AI总结 GoalLadder利用视觉语言模型在视觉环境中通过增量目标发现提升RL智能体性能,实现高成功率。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11275 2025-12-15 cs.RO 82%

Towards Logic-Aware Manipulation: A Knowledge Primitive for VLM-Based Assistants in Smart Manufacturing

面向逻辑感知的操控:一种用于智能制造中基于VLM助手的知识原语

Suchang Chen, Daqiang Guo

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract)

AI总结 本文提出了一种面向智能制造的基于VLM助手的知识原语,通过定义对象为中心的操控-逻辑模式,实现了在制造单元中执行复杂操控任务的逻辑感知和高效规划。

Comments 8 pages, 2 figures, submitted to the 2026 IFAC World Congress

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11350 2025-12-15 cs.CV cs.AI 79%

Surveillance Video-Based Traffic Accident Detection Using Transformer Architecture

基于监控视频的交通事故检测使用变换器架构

Tanu Singh, Pranamesh Chakraborty, Long T. Truong

机构 * Department of Civil Engineering, Indian Institute of Technology Kanpur(印度理工学院坎浦尔分校土木工程系) School of Computing, Engineering and Mathematical Sciences, La Trobe University(拉特罗布大学计算科学与工程数学科学学院)

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于变换器架构的交通事故检测模型,利用预提取的空间视频特征和运动线索,通过卷积与变换器结合提升检测准确率至88.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17982 2025-12-15 cs.CV 70%

Few-Shot Learning from Gigapixel Images via Hierarchical Vision-Language Alignment and Modeling

通过层次化视觉-语言对齐和建模实现高像素图像的少样本学习

Bryan Wong, Jong Woo Kim, Huazhu Fu, Mun Yong Yi

机构 * KAIST(韩国科学技术院) IHPC, A*STAR(A*STAR研究院)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 HiVE-MIL通过层次化视觉-语言对齐和建模,提升高像素图像的少样本学习性能,实现4.1%的宏F1提升。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11567 2025-12-15 cs.CL cs.MM 67%

Extending a Parliamentary Corpus with MPs' Tweets: Automatic Annotation and Evaluation Using MultiParTweet

扩展议会语料库以包含议员的推文:利用MultiParTweet进行自动标注和评估

Mevlüt Bagci, Ali Abusaleh, Daniel Baumartz, Giueseppe Abrami, Maxim Konca, Alexander Mehler

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

AI总结 本文提出MultiParTweet,通过自动标注和人工验证,整合了多语言推文及媒体内容,展示了模型间互为预测性及多模态注释的优越性。

Comments Submitted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05103 2025-12-15 cs.LG cs.AI cs.CL cs.CV 67%

TV2TV: A Unified Framework for Interleaved Language and Video Generation

TV2TV:一种用于交错语言和视频生成的统一框架

Xiaochuang Han, Youssef Emad, Melissa Hall, John Nguyen, Karthik Padthe, Liam Robbins, Amir Bar, Delong Chen, Michal Drozdzal, Maha Elbayad, Yushi Hu, Shang-Wen Li, Sreya Dutta Roy, Jakob Verbeek, XuDong Wang, Marjan Ghazvininejad, Luke Zettlemoyer, Emily Dinan

机构 * Meta FAIR

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 TV2TV通过统一框架实现语言与视频生成的交错过程,提升视频生成的视觉质量和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16979 2025-12-15 cs.CV cs.AI 62%

The Finer the Better: Towards Granular-aware Open-set Domain Generalization

更细的更好:面向粒度感知的开集域泛化

Yunyun Wang, Zheng Duan, Xinyue Liao, Ke-Jia Chen, Songcan Chen

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 SeeCLIP通过细粒度语义增强解决开集域泛化中的结构风险与开放空间风险困境,提升模型对难区分未知类别的判别能力。

Comments 9 pages,3 figures,aaai2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24379 2025-12-15 cs.CV cs.AI 62%

Any2Caption:Interpreting Any Condition to Caption for Controllable Video Generation

Any2Caption:任何条件到字幕以实现可控视频生成

Shengqiong Wu, Weicai Ye, Jiahao Wang, Quande Liu, Xintao Wang, Pengfei Wan, Di Zhang, Kun Gai, Shuicheng Yan, Hao Fei, Tat-Seng Chua

机构 * Kuaishou Technology(快手科技) National University of Singapore(新加坡国立大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 Any2Caption通过多模态大语言模型实现任何条件到字幕的可控视频生成,提升视频生成的可控性和质量。

Comments Project Page: https://sqwu.top/Any2Cap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11251 2025-12-15 cs.LG 57%

Insight Miner: A Time Series Analysis Dataset for Cross-Domain Alignment with Natural Language

Insight Miner: 一个用于跨领域对齐的时间序列分析数据集与自然语言

Yunkai Zhang, Yawen Zhang, Ming Zheng, Kezhen Chen, Chongyang Gao, Ruian Ge, Siyuan Teng, Amine Jelloul, Jinmeng Rao, Xiaoyuan Guo, Chiang-Wei Fang, Zeyu Zheng, Jie Yang

机构 * UC Berkeley(加州大学伯克利分校) Mineral(矿石) Northwestern University(西北大学)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.LG

AI总结 Insight Miner 是一个大规模多模态模型,通过代理工作流生成高质量时间序列描述,提升跨领域时间序列分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11755 2025-12-15 cs.CL 50%

SUMFORU: An LLM-Based Review Summarization Framework for Personalized Purchase Decision Support

SUMFORU: 一种基于LLM的个性化购买决策支持的评论摘要框架

Yuming Feng, Xinrui Jiang

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 SUMFORU通过可调节的多元对齐方法,实现个性化购买决策支持,结合高质量数据管道和两阶段对齐流程,提升摘要的一致性、基础性和偏好对齐性能。

Comments Code available at https://github.com/Harry20030331/SumForU

详情

展开后加载摘要…

URL PDF HTML 收藏