arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-03 至 2026-02-03 共收录 28 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 28 篇

2510.04217 2026-02-03 cs.LG cs.AI 86%

MLLMEraser: Achieving Test-Time Unlearning in Multimodal Large Language Models through Activation Steering

MLLMEraser: 通过激活引导在多模态大语言模型中实现测试时遗忘

Chenlu Ding, Jiancan Wu, Leheng Sheng, Fan Zhang, Yancheng Yuan, Xiang Wang, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学) Huawei(华为)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);MLLM(abstract);分类 cs.AI、cs.LG

AI总结 MLLMEraser通过激活引导实现多模态大语言模型的测试时遗忘,无需训练且有效降低计算成本,同时保持保留知识的效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01915 2026-02-03 cs.LG cs.AI 84%

VLM-Guided Experience Replay

基于VLM的经验回放

Elad Sharony, Tom Jurgenson, Orr Krupnik, Dotan Di Castro, Shie Mannor

机构 * Nvidia Research(英伟达研究)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用VLMs指导经验回放,提升强化学习中样本效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00505 2026-02-03 cs.CV cs.AI 84%

Sparse Shortcuts: Facilitating Efficient Fusion in Multimodal Large Language Models

稀疏快捷键:促进多模态大语言模型中的高效融合

Jingrui Zhang, Feng Liang, Yong Zhang, Wei Wang, Runhao Zeng, Xiping Hu

机构 * Guangdong-Hong Kong-Macao Joint Laboratory for Emotion Intelligence and Pervasive Computing, Artificial Intelligence Research Institute, Shenzhen MSU-BIT University, Shenzhen(粤港澳大湾区情感智能与 pervasive 计算联合实验室,人工智能研究院,深圳MSU-BIT大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 SparseCut通过稀疏快捷连接和多粒度特征融合模块,提升多模态大语言模型在跨模态融合中的效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01148 2026-02-03 cs.CV cs.AI 84%

SocialFusion: Addressing Social Degradation in Pre-trained Vision-Language Models

SocialFusion: 解决预训练视觉-语言模型中的社会退化问题

Hamza Tahboub, Weiyan Shi, Gang Hua, Huaizu Jiang

机构 * Northeastern University(东北大学) Amazon.com, Inc.(亚马逊公司)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 SocialFusion通过统一框架解决预训练视觉-语言模型中的社会退化问题,实现跨社会任务的正迁移并提升整体性能。

Comments 22 pages, 10 figures. Published in Transactions on Machine Learning Research (TMLR)

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15388 2026-02-03 cs.CV cs.AI cs.CL 84%

LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models

LLaVA-PruMerge: 适应性令牌减少用于高效的大多模态模型

Yuzhang Shang, Mu Cai, Bingxin Xu, Yong Jae Lee, Yan Yan

机构 * UCF(佛罗里达大学) UW-Madison(威斯康星大学麦迪逊分校) USC(南加州大学) UIC(伊利诺伊大学香槟分校)

专题命中 VLM训练与架构 :LLaVA(title,abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 LLaVA-PruMerge通过自适应视觉令牌减少策略,显著降低视觉令牌数量而不影响性能,适用于高效的大多模态模型。

Comments Accepted to ICCV 2025. First Version is released in 2024/03

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01574 2026-02-03 cs.CV 83%

SGHA-Attack: Semantic-Guided Hierarchical Alignment for Transferable Targeted Attacks on Vision-Language Models

SGHA-Attack:语义引导的层次对齐用于视觉-语言模型的可迁移定向攻击

Haobo Wang, Weiqi Luo, Xiaojun Jia, Xiaochun Cao

机构 * Guangdong Province Key Lab of Information Security Technology, and School of Computer Science and Engineering, Sun Yat-sen University(广东信息安全技术重点实验室,计算机科学与工程学院,中山大学) Nanyang Technological University(南洋理工大学) School of Cyber Science and Technology, Shenzhen Campus, Sun Yat-sen University(网络安全科学与技术学院,深圳校区,中山大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 SGHA-Attack通过语义引导的层次对齐框架,提升视觉-语言模型的定向转移攻击效果,增强跨异构模型的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00946 2026-02-03 cs.CV 83%

ConsensusDrop: Fusing Visual and Cross-Modal Saliency for Efficient Vision Language Models

ConsensusDrop:融合视觉与跨模态显著性以提高视觉语言模型的效率

Dhruv Parikh, Haoyang Fan, Rajgopal Kannan, Viktor Prasanna

机构 * University of Southern California(南加州大学) DEVCOM Army Research Office(陆军研究办公室)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);LLaVA(abstract);分类 cs.CV

AI总结 ConsensusDrop通过融合视觉与跨模态显著性,提高视觉语言模型的效率和准确性,优于现有token修剪方法。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20198 2026-02-03 cs.CV 83%

A Survey of Token Compression for Efficient Multimodal Large Language Models

多模态大语言模型高效性中的标记压缩综述

Kele Shao, Keda Tao, Kejia Zhang, Sicheng Feng, Mu Cai, Yuzhang Shang, Haoxuan You, Can Qin, Yang Sui, Huan Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Xiamen University(厦门大学) National University of Singapore(新加坡国立大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of Central Florida(佛罗里达大学) Salesforce AI Research(Salesforce AI研究) Rice University(德克萨斯大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文综述了多模态大语言模型中标记压缩技术,分类讨论了图像、视频和音频三种模态的压缩方法及其机制,旨在推动该领域的发展。

Comments For ongoing updates and to track the latest advances in this promising area, we maintain a public repository: https://github.com/cokeshao/Awesome-Multimodal-Token-Compression

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00108 2026-02-03 cs.CV cs.AI 81%

SITUATE -- Synthetic Object Counting Dataset for VLM training

SITUATE -- 合成物体计数数据集用于视觉语言模型训练

René Peinl, Vincent Tischler, Patrick Schröder, Christian Groth

专题命中 VLM训练与架构 :VLM(title);vision language model(abstract);分类 cs.CV、cs.AI

AI总结 SITUATE是一个用于训练视觉语言模型计数任务的数据集,通过控制遮挡和空间组成,提升模型对非分布图像的泛化能力。

Comments accepted at 21st International Conference on Computer Vision Theory and Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01901 2026-02-03 cs.CV 79%

Q Cache: Visual Attention is Valuable in Less than Half of Decode Layers for Multimodal Large Language Model

Q Cache:视觉注意力在少于一半的解码层中具有价值用于多模态大语言模型

Jiedong Zhuang, Lu Lu, Ming Dai, Rui Hu, Jian Chen, Qiang Liu, Haoji Hu

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 Q Cache通过跨层共享相似注意力模式,减少多模态大语言模型中的KV缓存使用量,提升吞吐量并保持性能

Comments Accepted by AAAI26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01346 2026-02-03 cs.AI 79%

Model Specific Task Similarity for Vision Language Model Selection via Layer Conductance

为视觉语言模型选择而基于模型特定任务相似性的层导电性

Wei Yang, Hong Xie, Tao Tan, Xin Li, Defu Lian, Enhong Chen

机构 * School of Computer Science and Technology, University of Science and Technology of China(计算机科学与技术学院,科学技术大学) School of AI and Data Science, University of Science and Technology of China(人工智能与数据科学学院,科学技术大学)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于模型特定任务相似性的视觉语言模型选择方法,通过层导电性分析和方向导电性发散度度量,提升模型选择效果。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00135 2026-02-03 cs.CV 79%

LLaVA-FA: Learning Fourier Approximation for Compressing Large Multimodal Models

LLaVA-FA: 通过傅里叶近似压缩大型多模态模型

Pengcheng Zheng, Chaoning Zhang, Jiarong Mo, GuoHui Li, Jiaquan Zhang, Jiahao Zhang, Sihan Cao, Sheng Zheng, Caiyan Qin, Guoqing Wang, Yang Yang

专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV

AI总结 LLaVA-FA通过频域联合低秩和量化近似,实现高效压缩大型多模态模型,采用极坐标量化和对角校准方案,提升压缩效果与效率。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00123 2026-02-03 cs.HC cs.CV 79%

Visual Affect Analysis: Predicting Emotions of Image Viewers with Vision-Language Models

视觉情感分析:利用视觉-语言模型预测图像观看者的感受

Filip Nowicki, Hubert Marciniak, Jakub Łączkowski, Krzysztof Jassem, Tomasz Górecki, Vimala Balakrishnan, Desmond C. Ong, Maciej Behnke

机构 * Faculty of Mathematics and Computer Science, Adam Mickiewicz University(数学与计算机科学学院,亚当·密茨凯维奇大学) Faculty of Computer Science and Information Technology, Universiti Malaya(计算机科学与信息技术学院,马来亚大学) Department of Computer Science and Engineering, Korea University(计算机科学与工程系,韩国大学) Department of Psychology, University of Texas at Austin(心理学系,德克萨斯大学奥斯汀分校) Cognitive Neuroscience Center, Adam Mickiewicz University(认知神经科学中心,亚当·密茨凯维奇大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文研究了视觉-语言模型在预测图像观众情感方面的性能,发现其在离散情绪分类上表现良好,但在连续评分预测中存在偏差,揭示了其在情感计算中的潜力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01610 2026-02-03 cs.AI cs.LG 73%

ToPT: Task-Oriented Prompt Tuning for Urban Region Representation Learning

为城市区域表示学习设计的任务导向提示微调:ToPT

Zitao Guo, Changyang Jiang, Tianhong Zhao, Jinzhou Cao, Genan Dai, Bowen Zhang

机构 * College of Applied Science, Shenzhen University, Shenzhen, China(深圳大学应用科学学院) School of Artificial Intelligence, Shenzhen Technology University, Shenzhen, China(深圳科技大学人工智能学院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI、cs.LG

AI总结 ToPT通过空间一致融合和任务对齐提升城市区域表示学习,实现任务导向的提示微调,提升多个城市任务的性能。

Comments The paper has been accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10942 2026-02-03 cs.CV 70%

VL-JEPA: Joint Embedding Predictive Architecture for Vision-language

VL-JEPA:面向视觉-语言的联合嵌入预测架构

Delong Chen, Mustafa Shukor, Theo Moutakanni, Willy Chung, Jade Yu, Tejaswi Kasarla, Yejin Bang, Allen Bolourchi, Yann LeCun, Pascale Fung

机构 * Meta FAIR HKUST(香港科技大学) Sorbonne Université(索邦大学) NYU(纽约大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 VL-JEPA通过联合嵌入预测架构,在减少参数的情况下实现更强的视觉-语言性能,支持多种任务且无需架构修改。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01817 2026-02-03 cs.CV 70%

SciTextures: Collecting and Connecting Visual Patterns, Models, and Code Across Science and Art

SciTextures: 收集和连接科学与艺术中的视觉模式、模型和代码

Sagi Eppel, Alona Strugatski

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 SciTextures通过连接视觉模式与生成机制,提供大规模数据集评估VLMs对物理系统多层抽象的理解与模拟能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23208 2026-02-03 cs.CL 67%

A Structured Framework for Evaluating and Enhancing Interpretive Capabilities of Multimodal LLMs in Culturally Situated Tasks

一种评估和增强多模态大语言模型在文化情境任务中解释能力的结构框架

Haorui Yu, Ramon Ruiz-Dolz, Qiufeng Yi

机构 * DJCAD, University of Dundee, United Kingdom(邓迪大学DJCAD部门) ARG-tech, SSEN, University of Dundee, United Kingdom(邓迪大学) School of Computer Science, University of Birmingham, United Kingdom(伯明翰大学计算机科学学院)

专题命中 VLM训练与架构 :VLM(abstract);visual language model(abstract)

AI总结 本研究提出了一种结构框架,用于评估和增强多模态大语言模型在文化情境任务中生成中国绘画批评的能力,通过量化评价特征和人设引导提示,揭示了VLMs在艺术批评领域的表现与局限。

Comments EMNLP 2025 submission, 10 pages, 6 figures, 5 tables

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, pages 1945-1971, Suzhou, China

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01522 2026-02-03 cs.LG cs.CV 62%

When Is Rank-1 Enough? Geometry-Guided Initialization for Parameter-Efficient Fine-Tuning

何时秩-1足够?基于几何的初始化方法用于参数高效微调

Haoran Zhao, Soyeon Caren Han, Eduard Hovy

机构 * School of Computing and Information Systems, University of Melbourne, Melbourne, Australia(计算机与信息系统学院,墨尔本大学,墨尔本,澳大利亚)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出Gap-Init方法,通过几何感知初始化稳定秩-1 LoRA微调,证明初始对齐对训练稳定性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00393 2026-02-03 cs.CV cs.CL cs.LG 62%

Brazilian Portuguese Image Captioning with Transformers: A Study on Cross-Native-Translated Dataset

巴西葡萄牙语图像描述生成:跨原生翻译数据集研究

Gabriel Bromonschenkel, Alessandro L. Koerich, Thiago M. Paixão, Hilário Tomaz Alves de Oliveira

机构 * Instituto Federal do Espírito Santo (IFES)(巴西联邦大学埃斯皮里图圣安东尼奥理工学院) École de Technologie Supérieure (ÉTS)(加拿大超技术学院)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.LG

AI总结 本研究通过跨原生翻译数据集评估Transformer模型在巴西葡萄牙语图像描述生成中的表现,发现Swin-DistilBERTimbau表现优异,GPT-4在CLIP-Score上表现最佳,同时揭示了模型中的系统性偏见。

Comments Accepted to JBCS. 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00340 2026-02-03 cs.CV cs.AI 62%

Bridging the Semantic Chasm: Synergistic Conceptual Anchoring for Generalized Few-Shot and Zero-Shot OOD Perception

弥合语义鸿沟:协同概念锚定用于通用少样本和零样本OOD感知

Alexandros Christoforos, Sarah Jenkins, Michael Brown, Tuan Pham, David Chen

机构 * Boston University(波士顿大学) Suffolk University(苏富比大学) Kyung Hee University, South Korea(韩国庆熙大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 SynerNet通过协同神经代理网络框架,解决视觉语言模型在分布外概念感知中的跨模态对齐退化问题,提升少样本和零样本场景下的精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00105 2026-02-03 cs.CV cs.AI 62%

HYPE-EDIT-1: Benchmark for Measuring Reliability in Frontier Image Editing Models

HYPE-EDIT-1:衡量前沿图像编辑模型可靠性的基准

Wing Chan, Richard Allen

机构 * Sourceful Ltd(源丰有限公司)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 HYPE-EDIT-1是一个评估前沿图像编辑模型可靠性的基准,通过100个任务测试模型通过率和有效成本,揭示了低单价模型在考虑重试和人工审查后的高总成本。

Comments 14 pages, 5 figures, for code and data, see https://github.com/sourceful-official/hype-edit-1-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01723 2026-02-03 cs.CV 57%

FastPhysGS: Accelerating Physics-based Dynamic 3DGS Simulation via Interior Completion and Adaptive Optimization

FastPhysGS: 通过内部补全与自适应优化加速基于物理的动态3DGS仿真

Yikun Ma, Yiqing Li, Jingwen Ye, Zhongkai Wu, Weidong Zhang, Lin Gao, Zhi Jin

机构 * School of Intelligent Systems Engineering, Shenzhen Campus of Sun Yat-sen University(中山大学智能系统工程学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Guangdong Provincial Key Laboratory of Fire Science(广东省消防科学与智能应急技术重点实验室) Guangdong Provincial Key Laboratory of Robotics(广东省机器人与数字智能制造技术重点实验室)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 FastPhysGS通过内部补全与自适应优化,实现了基于物理的动态3DGS仿真的高效与稳健,提升了仿真精度和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16600 2026-02-03 cs.AI 57%

You Only Forward Once: An Efficient Compositional Judging Paradigm

你只需一次转发:一种高效的组合判断范式

Tianlong Zhang, Hongwei Xue, Shilin Yan, Di Wu, Chen Xu, Guannan Zhang, Yunyun Yang

机构 * School of Science, Harbin Institute of Technology, Shenzhen, Guangdong Province, China(哈尔滨工业大学深圳校区科学学院) Accio, Alibaba Group, Hangzhou, Zhejiang Province, China(阿里集团杭州Accio)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI

AI总结 YOFO通过单次前向传递高效判断多模态大语言模型的结构化要求,实现速度与可解释性的平衡,同时支持依赖分析和事后CoT。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00574 2026-02-03 cs.AI 57%

Learning Modal-Mixed Chain-of-Thought Reasoning with Latent Embeddings

通过潜在嵌入学习模态混合的思考链推理

Yifei Shao, Kun Zhou, Ziming Xu, Mohammad Atif Quamar, Shibo Hao, Zhen Wang, Zhiting Hu, Biwei Huang

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.AI

AI总结 本文提出模态混合CoT方法,通过潜在嵌入结合视觉与文本信息,提升多模态推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23753 2026-02-03 cs.LG cs.CL 57%

Anchored Supervised Fine-Tuning

锚定监督微调

He Zhu, Junyou Su, Peng Lai, Ren Ma, Wenjia Zhang, Linyi Yang, Guanhua Chen

机构 * Southern University of Science and Technology(南方科技大学) Peking University(北京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

AI总结 本文提出锚定监督微调(ASFT),通过引入KL正则化解决动态微调(DFT)的稳定性问题,在数学推理、医学知识和代码生成等领域取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21033 2026-02-03 cs.SD cs.AI 57%

SupCLAP: Controlling Optimization Trajectory Drift in Audio-Text Contrastive Learning with Support Vector Regularization

SupCLAP:通过支持向量正则化控制音频-文本对比学习中的优化轨迹漂移

Jiehui Luo, Yuguo Yin, Yuxin Xie, Jinghan Ru, Xianwei Zhuang, Minghua He, Aofan Liu, Zihan Xiong, Dongchao Yang

机构 * Peking University(北京大学) Central Conservatory of Music(中央音乐学院) The Chinese University of Hong Kong(香港中文大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI

AI总结 SupCLAP通过支持向量正则化有效控制音频-文本对比学习中的优化轨迹漂移,提升多模态学习的稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01640 2026-02-03 cs.CL 50%

A2Eval: Agentic and Automated Evaluation for Embodied Brain

A2Eval: 基于代理的自动评估用于具身脑

Shuai Zhang, Jiayu Hu, Zijie Chen, Zeyuan Ding, Yi Zhang, Yingji Zhang, Ziyi Zhou, Junwei Liao, Shengjie Zhou, Yong Dai, Zhenzhong Lan, Xiaozhu Ju

机构 * Zhejiang University, China(浙江大学) Westlake University, China(西湖大学) Beijing Innovation Center of Humanoid Robotics, China(北京人形机器人创新中心) University of Manchester, UK(曼彻斯特大学) Southern University of Science(南方科技大学) Xiamen University Malaysia, Malaysia(厦门大学马来西亚分校)

专题命中 VLM训练与架构 :VLM(abstract)

AI总结 A2Eval提出首个基于代理的自动评估框架,通过两个协作代理自动化基准编纂和评估,显著提升评估效率并减少成本,同时保持高保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01067 2026-02-03 cs.RO 50%

A Systematic Study of Data Modalities and Strategies for Co-training Large Behavior Models for Robot Manipulation

对大型行为模型在机器人操作中协同训练数据模态和策略的系统研究

Fanqi Lin, Kushal Arora, Jean Mercat, Haruki Nishimura, Paarth Shah, Chen Xu, Mengchao Zhang, Mark Zolotas, Maya Angeles, Owen Pfannenstiehl, Andrew Beaulieu, Jose Barreiros

机构 * Toyota Research Institute, Cambridge MA(丰田研究院) Tsinghua University, Beijing, China(清华大学)

专题命中 VLM训练与架构 :vision-language model(abstract)

AI总结 本文研究了机器人操作中协同训练不同数据模态和策略对行为模型性能的影响,发现视觉语言和跨身体数据显著提升泛化能力,而离散动作令牌无明显优势。

详情

展开后加载摘要…

URL PDF HTML 收藏