arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5084 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5084 篇

2511.03001 2026-01-29 cs.CL 67%

LEGO-Eval: Towards Fine-Grained Evaluation on Synthesizing 3D Embodied Environments with Tool Augmentation

LEGO-Eval: 向通过工具增强合成3D具身环境的细粒度评估迈进

Gyeom Hwangbo, Hyungjoo Chae, Minseok Kang, Hyeonjong Ju, Soohyun Oh, Jinyoung Yeo

机构 * Yonsei University(延世大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

AI总结 LEGO-Eval通过工具增强合成3D具身环境,提供细粒度评估框架和基准测试集,提升场景与指令对齐的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13247 2026-01-21 cs.CL cs.AI cs.CV cs.LG cs.MM 67%

Aligning Agentic World Models via Knowledgeable Experience Learning

通过知识性经验学习对齐代理世界模型

Baochang Ren, Yunzhi Yao, Rui Sun, Shuofei Qiao, Ningyu Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 WorldMind通过知识性经验学习对齐代理世界模型,解决物理模拟中的幻觉问题,实现跨环境的高效迁移。

Comments Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12174 2026-01-21 eess.IV 67%

A multitask framework for automated interpretation of multi-frame right upper quadrant ultrasound in clinical decision support

多任务框架用于临床决策支持中多帧右上象限超声自动解读

Haiman Guo, Cheng-Yi Li, Yuli Wang, Robin Wang, Yuwei Dai, Qinghai Peng, Danming Cao, Zhusi Zhong, Thao Vu, Linmei Zhao, Chengzhang Zhu, Christopher Tan, Jacob Schick, Stephen Kwak, Farzad Sedaghat, Javad Azadi, James Facciola, Jonathan Feng, Dilek Oncel, Ulrike Hamper, Alex Zhu, Tej Mehta, Melissa Leimkuehler, Cheng Ting Lin, Zhicheng Jiao, Ihab Kamel, Jing Wu, Li Yang, Harrison Bai

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

AI总结 本文提出多任务视觉-语言模型,用于提升右上象限超声波解读的诊断准确性与手术决策支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12898 2025-12-23 cs.LG cs.AI cs.CV cs.RO 67%

Vidar: Embodied Video Diffusion Model for Generalist Manipulation

Vidar:面向通用操作的具身视频扩散模型

Yao Feng, Hengkai Tan, Xinyi Mao, Chendong Xiang, Guodong Liu, Shuhe Huang, Hang Su, Jun Zhu

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 Vidar通过具身视频扩散模型和掩码逆动力学模型,实现了在不同机器人形态上的通用操作,仅需少量人类演示即可超越现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13380 2025-12-16 cs.RO 67%

Universal Dexterous Functional Grasping via Demonstration-Editing Reinforcement Learning

通过演示编辑强化学习实现通用灵巧功能抓取

Chuan Mao, Haoqi Yuan, Ziye Huang, Chaoyi Xu, Kai Ma, Zongqing Lu

机构 * Peking University(北京大学) BeingBeyond

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

AI总结 本研究提出DemoFunGrasp,通过演示编辑强化学习实现通用灵巧功能抓取,提升抓取性能和现实泛化能力。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13080 2025-12-16 cs.RO 67%

Spatial-Aware VLA Pretraining through Visual-Physical Alignment from Human Videos

通过人类视频中的视觉-物理对齐实现空间感知的VLA预训练

Yicheng Feng, Wanpeng Zhang, Ye Wang, Hao Luo, Haoqi Yuan, Sipeng Zheng, Zongqing Lu

机构 * Peking University(北京大学) Renmin University of China(中国人民大学) BeingBeyond

专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract)

AI总结 通过人类视频中的视觉-物理对齐实现空间感知的VLA预训练,提升机器人任务的稳健性和通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11567 2025-12-15 cs.CL cs.MM 67%

Extending a Parliamentary Corpus with MPs' Tweets: Automatic Annotation and Evaluation Using MultiParTweet

扩展议会语料库以包含议员的推文:利用MultiParTweet进行自动标注和评估

Mevlüt Bagci, Ali Abusaleh, Daniel Baumartz, Giueseppe Abrami, Maxim Konca, Alexander Mehler

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

AI总结 本文提出MultiParTweet,通过自动标注和人工验证,整合了多语言推文及媒体内容,展示了模型间互为预测性及多模态注释的优越性。

Comments Submitted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05103 2025-12-15 cs.LG cs.AI cs.CL cs.CV 67%

TV2TV: A Unified Framework for Interleaved Language and Video Generation

TV2TV:一种用于交错语言和视频生成的统一框架

Xiaochuang Han, Youssef Emad, Melissa Hall, John Nguyen, Karthik Padthe, Liam Robbins, Amir Bar, Delong Chen, Michal Drozdzal, Maha Elbayad, Yushi Hu, Shang-Wen Li, Sreya Dutta Roy, Jakob Verbeek, XuDong Wang, Marjan Ghazvininejad, Luke Zettlemoyer, Emily Dinan

机构 * Meta FAIR

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 TV2TV通过统一框架实现语言与视频生成的交错过程,提升视频生成的视觉质量和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06866 2025-12-09 cs.CV cs.AI cs.CL cs.LG 67%

Less Is More, but Where? Dynamic Token Compression via LLM-Guided Keyframe Prior

少即是多,但在哪里?通过LLM引导的关键帧先验实现动态令牌压缩

Yulin Li, Haokun Gui, Ziyang Fan, Junjie Wang, Bin Kang, Bin Chen, Zhuotao Tian

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) University of Chinese Academy of Sciences(中国科学院大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出DyToK方法,通过LLM引导的关键帧先验实现动态令牌压缩,提升视频处理效率和准确性。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06183 2025-12-03 cs.RO 67%

Sampling-Based Model Predictive Control for Dexterous Manipulation on a Biomimetic Tendon-Driven Hand

基于采样的模型预测控制在仿生腱驱动手的灵巧操作中的应用

Adrian Hess, Alexander M. Kübler, Benedek Forrai, Mehmet Dogar, Robert K. Katzschmann

机构 * Soft Robotics Lab, Department of Mechanical and Process Engineering, ETH Zurich(苏黎世联邦理工学院机械与过程工程系软机器人实验室) School of Computer Science, University of Leeds(利兹大学计算机科学学院)

专题命中 VLM训练与架构 :VLM(abstract);visual language model(abstract)

AI总结 本研究提出利用基于采样的模型预测控制实现仿生腱驱动手的灵巧操作,通过结合视觉语言模型与实时优化器,有效生成接触丰富的行为。

Comments For a video, see https://youtu.be/u4d6v3ohsOI

Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08367 2025-11-12 cs.CR 67%

Why does weak-OOD help? A Further Step Towards Understanding Jailbreaking VLMs

Yuxuan Zhou, Yuzhao Peng, Yang Bai, Kuofeng Gao, Yihao Zhang, Yechao Zhang, Xun Chen, Tao Yu, Tao Dai, Shu-Tao Xia

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20819 2025-10-28 cs.CV cs.AI cs.LG 67%

Towards General Modality Translation with Contrastive and Predictive Latent Diffusion Bridge

Nimrod Berman, Omkar Joglekar, Eitan Kosman, Dotan Di Castro, Omri Azencot

机构 * Bosch AI Center(博世人工智能中心) Ben-Gurion University of the Negev(巴伊兰大学) Technical University of Munich(慕尼黑技术大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted as a poster at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21835 2025-10-28 cs.LG cs.AI cs.CL cs.CV 67%

A Multimodal, Multitask System for Generating E Commerce Text Listings from Images

Nayan Kumar Singh

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 24 pages, 10 figures, 11 tables. Code can be found at: https://github.com/SinghNayanKumar/multimodal-product-lister/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12995 2025-10-27 eess.AS cs.SD 67%

Continuous-Token Diffusion for Speaker-Referenced TTS in Multimodal LLMs

Xinlu He, Swayambhu Nath Ray, Harish Mallidi, Jia-Hong Huang, Ashwin Bellur, Chander Chandak, M. Maruf, Venkatesh Ravichandran

机构 * Worcester Polytechnic Institute(沃斯特理工大学) Amazon AGI(亚马逊人工智能实验室)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19201 2025-10-24 cs.CL 67%

DREAM: Drafting with Refined Target Features and Entropy-Adaptive Cross-Attention Fusion for Multimodal Speculative Decoding

Yunhai Hu, Tianhua Xia, Zining Liu, Rahul Raman, Xingyu Liu, Bo Bao, Eric Sather, Vithursan Thangarasa, Sai Qian Zhang

机构 * Courant Institute of Mathematical Sciences, New York University(纽约大学数学科学学院) Tandon School of Engineering, New York University(纽约大学工程学院) Cerebras Systems Inc.(Cerebras Systems公司) University of Pennsylvania(宾夕法尼亚大学)

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17041 2025-10-21 cs.CV cs.AI cs.LG 67%

Free$^2$Guide: Training-Free Text-to-Video Alignment using Image LVLM

Jaemin Kim, Bryan Sangwoo Kim, Jong Chul Ye

机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments ICCV 2025 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11314 2025-10-14 cs.CL 67%

Template-Based Text-to-Image Alignment for Language Accessibility: A Study on Visualizing Text Simplifications

Belkiss Souayed, Sarah Ebling, Yingqiang Gao

机构 * University of Zurich(苏黎世大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23064 2025-10-14 cs.CV cs.AI cs.LG cs.RO 67%

Vision-Language Cross-Attention for Real-Time Autonomous Driving

Santosh Patapati, Trisanth Srinivasan, Murari Ambati

机构 * Cyrion Labs(Cyrion实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23042 2025-10-14 cs.CV cs.AI cs.LG cs.MM cs.RO 67%

Goal-Based Vision-Language Driving

Santosh Patapati, Trisanth Srinivasan

机构 * Dept. of HCI(人机交互系) Cyrion Labs(Cyrion实验室)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26462 2025-10-01 cs.AI cs.CV cs.LG 67%

Zero-Shot Decentralized Federated Learning

Alessio Masano, Matteo Pennisi, Federica Proietto Salanitri, Concetto Spampinato, Giovanni Bellitto

机构 * University of Catania(卡塔尼亚大学) PeRCeiVe Lab, University of Catania(PeRCeiVe实验室,卡塔尼亚大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted at International Joint Conference on Neural Networks (IJCNN) 2025. Code available at https://github.com/perceivelab/ZeroDFL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09372 2025-09-23 cs.RO 67%

VLA-Adapter: An Effective Paradigm for Tiny-Scale Vision-Language-Action Model

Yihao Wang, Pengxiang Ding, Lingxiao Li, Can Cui, Zirui Ge, Xinyang Tong, Wenxuan Song, Han Zhao, Wei Zhao, Pengxu Hou, Siteng Huang, Yifan Tang, Wenhui Wang, Ru Zhang, Jianyi Liu, Donglin Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Westlake University(西湖大学) Zhejiang University(浙江大学) OpenHelix Team(OpenHelix团队) State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

Comments 28 pages; Project page: https://vla-adapter.github.io/; Github: https://github.com/OpenHelix-Team/VLA-Adapter; HuggingFace: https://huggingface.co/VLA-Adapter

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15775 2025-09-22 cs.SD eess.AS 67%

EmoQ: Speech Emotion Recognition via Speech-Aware Q-Former and Large Language Model

Yiqing Yang, Man-Wai Mak

机构 * Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(电子与电气工程系,香港理工大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract)

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13731 2025-09-18 cs.RO 67%

Reinforcement Learning for Robotic Insertion of Flexible Cables in Industrial Settings

Jeongwoo Park, Seabin Lee, Changmin Park, Wonjong Lee, Changjoo Nam

机构 * Dept. of Electronic Engineering, Sogang University(电子工程系,成均馆大学) Dept. of Artificial Intelligence, Sogang University(人工智能系,成均馆大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11620 2025-09-16 cs.CL cs.CY 67%

AesBiasBench: Evaluating Bias and Alignment in Multimodal Language Models for Personalized Image Aesthetic Assessment

Kun Li, Lai-Man Po, Hongzheng Yang, Xuyuan Xu, Kangcheng Liu, Yuzhi Zhao

专题命中 VLM训练与架构 :InternVL(abstract);multimodal large language model(abstract)

Comments Accepted by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10765 2025-09-16 eess.IV 67%

Language-based Color ISP Tuning

Owen Mayer, Shohei Noguchi, Alexander Berestov, Jiro Takatori

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

Comments Accepted to Color and Imaging Conference (CIC) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07436 2025-09-10 eess.SP 67%

SA-OOSC: A Multimodal LLM-Distilled Semantic Communication Framework for Enhanced Coding Efficiency with Scenario Understanding

Feifan Zhang, Yuyang Du, Yifan Xiang, Xiaoyan Liu, Soung Chang Liew

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00351 2025-09-03 cs.CV cs.AI cs.LG 67%

Target-Oriented Single Domain Generalization

Marzi Heidari, Yuhong Guo

机构 * School of Computer Science, Carleton University(计算机科学学院,卡尔顿大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08869 2025-09-03 cs.LG cs.AI cs.CV 67%

Harnessing Vision Models for Time Series Analysis: A Survey

Jingchao Ni, Ziming Zhao, ChengAo Shen, Hanghang Tong, Dongjin Song, Wei Cheng, Dongsheng Luo, Haifeng Chen

机构 * University of Houston(德克萨斯大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Connecticut(康涅狄格大学) NEC Laboratories America(日本 NEC 美国实验室) Florida International University(佛罗里达国际大学)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12458 2025-08-19 cs.CL 67%

M3PO: Multimodal-Model-Guided Preference Optimization for Visual Instruction Following

Ruirui Gao, Emily Johnson, Bowen Tan, Yanfei Qian

机构 * University of Massachusetts, Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11737 2025-08-19 cs.CV cs.AI cs.CL cs.LG 67%

Ovis2.5 Technical Report

Shiyin Lu, Yang Li, Yu Xia, Yuwei Hu, Shanshan Zhao, Yanqing Ma, Zhichao Wei, Yinglun Li, Lunhao Duan, Jianshan Zhao, Yuxuan Han, Haijun Li, Wanying Chen, Junke Tang, Chengkun Hou, Zhixing Du, Tianli Zhou, Wenjie Zhang, Huping Ding, Jiahe Li, Wen Li, Gui Hu, Yiliang Gu, Siran Yang, Jiamang Wang, Hailong Sun, Yibo Wang, Hui Sun, Jinlong Huang, Yuping He, Shengze Shi, Weihong Zhang, Guodong Zheng, Junpeng Jiang, Sensen Gao, Yi-Feng Wu, Sijia Chen, Yuhui Chen, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏