arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5067 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5067 篇

2602.09225 2026-02-11 cs.LG 57%

Barycentric alignment for instance-level comparison of neural representations

实例层面神经表示的重心对齐

Shreya Saha, Zoe Wanying He, Meenakshi Khosla

机构 * Department of XXX, University of YYY, Location, Country(YYY大学XXX系) School of ZZZ, Institute of WWW, Location, Country(WWW研究所ZZZ学院) Department of Electrical and Computer Engineering, UCSD(UCSD电子与计算机工程系) Cognitive Science Department, UCSD(UCSD认知科学系) Department of Computer Science(计算机科学系)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG

AI总结 通过实例层面的神经表示重心对齐,揭示了跨视觉和语言模型的表示收敛与发散特性,并展示了人类对齐的跨模态比较能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22274 2026-02-11 cs.CV cs.CL 57%

Common Objects Out of Context (COOCo): Investigating Multimodal Context and Semantic Scene Violations in Referential Communication

常见物体脱离上下文(COOCo):研究多模态上下文和语义场景违规在指代通信中的作用

Filippo Merlo, Ece Takmaz, Wenkai Chen, Albert Gatt

机构 * Utrecht University(乌特雷赫大学) University of Trento(特伦托大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 COOCo研究了VLMs在指代生成中如何利用场景上下文,发现模型根据语义相关性和噪声水平动态平衡局部与上下文信息。

Comments Accepted to TACL (pre-MIT Press publication version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07915 2026-02-10 cs.CV 57%

MARC: Memory-Augmented RL Token Compression for Efficient Video Understanding

MARC: 用于高效视频理解的记忆增强强化学习令牌压缩

Peiran Wu, Zhuorui Yu, Yunze Liu, Chi-Hao Wu, Enmin Zhou, Junxiao Shen

机构 * University of Bristol(布里斯托大学) Memories.ai Research(Memories.ai研究)

专题命中 VLM训练与架构 :visual language model(abstract);分类 cs.CV

AI总结 MARC通过结合结构化检索和强化学习知识蒸馏,实现高效视频理解,显著减少视觉令牌、GPU内存和延迟。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23278 2026-02-10 cs.CV 57%

UniLiP: Adapting CLIP for Unified Multimodal Understanding, Generation and Editing

UniLiP: 适配CLIP以实现统一的多模态理解、生成与编辑

Hao Tang, Chenwei Xie, Xiaoyi Bao, Tingyu Weng, Pandeng Li, Yun Zheng, Liwei Wang

机构 * Center for Data Science, Peking University(北京大学数据科学中心) Alibaba Group(阿里巴巴集团) CASIA Center for Machine Learning Research, Peking University(北京大学机器学习研究中心) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 UniLIP通过两阶段训练和双条件架构,提升CLIP在多模态理解、生成和编辑任务中的性能,实现高效参数下的高表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07414 2026-02-10 cs.AI cs.CL 57%

Can LLMs Truly Embody Human Personality? Analyzing AI and Human Behavior Alignment in Dispute Resolution

LLMs真的能体现人类个性吗?分析AI与人类行为在纠纷解决中的对齐

Deuksin Kwon, Kaleen Shrestha, Bin Han, Spencer Lin, James Hale, Jonathan Gratch, Maja Matarić, Gale M. Lucas

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文研究LLMs在模拟人类人格驱动的冲突行为方面的有效性,通过评估框架和数据集方法,揭示LLMs在纠纷解决中与人类行为的显著差异。

Comments AAAI 2026 (Special Track: AISI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21266 2026-02-10 cs.AI 57%

Rethinking Explainable Disease Prediction: Synergizing Accuracy and Reliability via Reflective Cognitive Architecture

重新思考可解释疾病预测:通过反思认知架构协同提升准确性和可靠性

Zijian Shao, Haiyang Shen, Mugeng Liu, Gecheng Fu, Yaoqi Guo, Yanfeng Wang, Yun Ma

机构 * Institute for Artificial Intelligence, Peking University School of Software \& Microelectronics, Peking University School of Computer Science, Peking University School of Life Sciences, Peking University Department of Comprehensive Oncology, National Cancer Center/National Clinical Research Center for Cancer/Cancer Hospital, Chinese Academy of Medical Sciences Peking Union Medical College Beijing, China

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出反思认知架构(RCA),通过经验与反思直接从表格数据学习,实现预测精度与解释可靠性的协同提升。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06184 2026-02-09 cs.CV cs.CL 57%

PhenoLIP: Integrating Phenotype Ontology Knowledge into Medical Vision-Language Pretraining

PhenoLIP:将表型本体知识整合到医学视觉-语言预训练中

Cheng Liang, Chaoyi Wu, Weike Zhao, Ya Zhang, Yanfeng Wang, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 PhenoLIP通过整合表型本体知识提升医学视觉-语言模型的表型识别与跨模态检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13928 2026-02-05 cs.CV cs.IR 57%

LoVR: A Benchmark for Long Video Retrieval in Multimodal Contexts

LoVR:一种多模态背景下长视频检索的基准

Qifeng Cai, Hao Liang, Zhaoyang Han, Hejun Dong, Meiyi Qiang, Ruichuan An, Quanqing Xu, Bin Cui, Wentao Zhang

机构 * East China Normal University Shanghai China Peking University \& Zhongguancun Academy Beijing China Huazhong University of Science Beihang University Beijing China Peking University Beijing China East China Normal University Peking University \& Zhongguancun Academy Beihang University Peking University

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 LoVR是一个针对长视频检索的多模态基准,通过高质量标注和细粒度数据提升视频理解挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03615 2026-02-04 cs.CV 57%

KTV: Keyframes and Key Tokens Selection for Efficient Training-Free Video LLMs

KTV: 关键帧与关键令牌选择用于高效无训练视频大语言模型

Baiyang Song, Jun Peng, Yuxin Zhang, Guangyao Chen, Feidiao Yang, Jianyuan Guo

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV

AI总结 KTV通过两阶段框架高效选择关键帧和令牌,提升无训练视频理解的性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03060 2026-02-04 cs.CV 57%

IVC-Prune: Revealing the Implicit Visual Coordinates in LVLMs for Vision Token Pruning

IVC-Prune: 在大型视觉-语言模型中揭示隐式的视觉坐标以进行视觉标记剪枝

Zhichao Sun, Yidong Ma, Gang Liu, Yibo Chen, Xu Tang, Yao Hu, Yongchao Xu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Xiaohongshu Inc(小红书公司)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 IVC-Prune通过揭示LVLMs中隐式的视觉坐标,提出一种无训练、提示感知的视觉标记剪枝方法,有效减少标记数量并保持高性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00508 2026-02-04 cs.CV 57%

DuoGen: Towards General Purpose Interleaved Multimodal Generation

DuoGen:迈向通用的交错多模态生成

Min Shi, Xiaohui Zeng, Jiannan Huang, Yin Cui, Francesco Ferroni, Jialuo Li, Shubham Pachori, Zhaoshuo Li, Yogesh Balaji, Haoxiang Wang, Tsung-Yi Lin, Xiao Fu, Yue Zhao, Chieh-Yun Chen, Ming-Yu Liu, Humphrey Shi

机构 * Georgia Tech(佐治亚理工学院) NVIDIA research.nvidia.com/labs/dir/duogen(NVIDIA 研究所)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

AI总结 DuoGen通过系统性地解决数据整理、架构设计和评估问题,实现了通用的交错多模态生成,提升了文本质量、图像保真度和图像-上下文对齐性能。

Comments Technical Report. Project Page: https://research.nvidia.com/labs/dir/duogen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01723 2026-02-03 cs.CV 57%

FastPhysGS: Accelerating Physics-based Dynamic 3DGS Simulation via Interior Completion and Adaptive Optimization

FastPhysGS: 通过内部补全与自适应优化加速基于物理的动态3DGS仿真

Yikun Ma, Yiqing Li, Jingwen Ye, Zhongkai Wu, Weidong Zhang, Lin Gao, Zhi Jin

机构 * School of Intelligent Systems Engineering, Shenzhen Campus of Sun Yat-sen University(中山大学智能系统工程学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Guangdong Provincial Key Laboratory of Fire Science(广东省消防科学与智能应急技术重点实验室) Guangdong Provincial Key Laboratory of Robotics(广东省机器人与数字智能制造技术重点实验室)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 FastPhysGS通过内部补全与自适应优化,实现了基于物理的动态3DGS仿真的高效与稳健,提升了仿真精度和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16600 2026-02-03 cs.AI 57%

You Only Forward Once: An Efficient Compositional Judging Paradigm

你只需一次转发:一种高效的组合判断范式

Tianlong Zhang, Hongwei Xue, Shilin Yan, Di Wu, Chen Xu, Guannan Zhang, Yunyun Yang

机构 * School of Science, Harbin Institute of Technology, Shenzhen, Guangdong Province, China(哈尔滨工业大学深圳校区科学学院) Accio, Alibaba Group, Hangzhou, Zhejiang Province, China(阿里集团杭州Accio)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI

AI总结 YOFO通过单次前向传递高效判断多模态大语言模型的结构化要求,实现速度与可解释性的平衡,同时支持依赖分析和事后CoT。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00574 2026-02-03 cs.AI 57%

Learning Modal-Mixed Chain-of-Thought Reasoning with Latent Embeddings

通过潜在嵌入学习模态混合的思考链推理

Yifei Shao, Kun Zhou, Ziming Xu, Mohammad Atif Quamar, Shibo Hao, Zhen Wang, Zhiting Hu, Biwei Huang

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.AI

AI总结 本文提出模态混合CoT方法,通过潜在嵌入结合视觉与文本信息,提升多模态推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23753 2026-02-03 cs.LG cs.CL 57%

Anchored Supervised Fine-Tuning

锚定监督微调

He Zhu, Junyou Su, Peng Lai, Ren Ma, Wenjia Zhang, Linyi Yang, Guanhua Chen

机构 * Southern University of Science and Technology(南方科技大学) Peking University(北京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

AI总结 本文提出锚定监督微调(ASFT),通过引入KL正则化解决动态微调(DFT)的稳定性问题,在数学推理、医学知识和代码生成等领域取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21033 2026-02-03 cs.SD cs.AI 57%

SupCLAP: Controlling Optimization Trajectory Drift in Audio-Text Contrastive Learning with Support Vector Regularization

SupCLAP:通过支持向量正则化控制音频-文本对比学习中的优化轨迹漂移

Jiehui Luo, Yuguo Yin, Yuxin Xie, Jinghan Ru, Xianwei Zhuang, Minghua He, Aofan Liu, Zihan Xiong, Dongchao Yang

机构 * Peking University(北京大学) Central Conservatory of Music(中央音乐学院) The Chinese University of Hong Kong(香港中文大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI

AI总结 SupCLAP通过支持向量正则化有效控制音频-文本对比学习中的优化轨迹漂移,提升多模态学习的稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22680 2026-02-02 cs.CV 57%

Visual Personalization Turing Test

视觉个性化图灵测试

Rameen Abdal, James Burgess, Sergey Tulyakov, Kuan-Chieh Jackson Wang

机构 * Snap Research(Snap研究)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 本文提出视觉个性化图灵测试,通过感知不可区分性评估个性化生成模型,引入VPTT框架和评分指标,验证其在人类和VLM判断中的可靠性。

Comments Webpage: https://snap-research.github.io/vptt

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22633 2026-02-02 cs.NI cs.AI 57%

MCP-Diag: A Deterministic, Protocol-Driven Architecture for AI-Native Network Diagnostics

MCP-Diag:一种确定性的、基于协议的架构用于AI原生网络诊断

Devansh Lodha, Mohit Panchal, Sameer G. Kulkarni

机构 * Indian Institute of Technology Gandhinagar(印度理工学院加尔各答分校)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 MCP-Diag通过确定性翻译层和强制性 elicitation循环,实现高精度的AI原生网络诊断,提升实体提取准确性和上下文token使用效率。

Comments Accepted at COMSNETS 2026 Graduate Forum. Best Paper Award (Runner Up). 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21426 2026-01-30 cs.CV 57%

MultiModal Fine-tuning with Synthetic Captions

多模态微调与合成描述

Shohei Enomoto, Shin'ya Yamaguchi

机构 * NTT Tokyo(日本NTT东京)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出通过多模态大语言模型生成合成描述,提升多模态微调效果,尤其在少样本学习中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19850 2026-01-28 cs.CV 57%

EgoHandICL: Egocentric 3D Hand Reconstruction with In-Context Learning

EgoHandICL: 以自身为中心的3D手重建与上下文学习

Binzhu Xie, Shi Qiu, Sicheng Zhang, Yinqiao Wang, Hao Xu, Muzammal Naseer, Chi-Wing Fu, Pheng-Ann Heng

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(计算机科学与工程系,香港中文大学) Institute of Medical Intelligence and XR, The Chinese University of Hong Kong(医学智能与XR研究院,香港中文大学) Department of Computer Science, Khalifa University(计算机科学系,哈利法大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 EgoHandICL通过上下文学习框架提升以自身为中心的3D手重建的鲁棒性和一致性,结合视觉语言模型和掩码自动编码器实现更精确的手-物体交互推理。

Comments Accepted in ICLR 2026, Codebase: https://github.com/Nicous20/EgoHandICL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13126 2026-01-28 eess.IV cs.CV 57%

Knowledge-enhanced Pretraining for Vision-language Pathology Foundation Model on Cancer Diagnosis

基于知识增强的视觉语言病理基础模型用于癌症诊断

Xiao Zhou, Luoyi Sun, Dexuan He, Wenbin Guan, Ge Wang, Ruifen Wang, Lifeng Wang, Xiaojun Yuan, Xin Sun, Ya Zhang, Kun Sun, Yanfeng Wang, Weidi Xie

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Xinhua Hospital Affiliated to Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属新华医院) School of Artificial Intelligence(人工智能学院) Department of Pathology(病理学部) Department of Oral Pathology(口腔病理学部) Department of Pediatric Hematology/Oncology(儿科血液肿瘤科) Clinical Research and Innovation Unit(临床研究与创新单元) Department of Pediatric Cardiology(儿童心脏病科)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出KEEP模型,通过整合疾病知识图谱提升癌症诊断的视觉语言基础模型性能,显著优于现有方法。

Comments V2: fixed typos, updated experimental results, added ablation

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05270 2026-01-27 cs.CV 57%

CLIP's Visual Embedding Projector is a Few-shot Cornucopia

CLIP的视觉嵌入投影器是少样本宝库

Mohammad Fahes, Tuan-Hung Vu, Andrei Bursuc, Patrick Pérez, Raoul de Charette

机构 * Inria(法国国家信息与自动化技术研究所) Kyutai

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 ProLIP通过正则化投影矩阵提升CLIP在少样本分类及跨领域迁移中的性能,提供更高效的替代方案。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17697 2026-01-27 cs.CV 57%

StyleDecoupler: Generalizable Artistic Style Disentanglement

StyleDecoupler: 可泛化艺术风格解耦

Zexi Jia, Jinchao Zhang, Jie Zhou

机构 * Wechat AI, Tencent, China(腾讯微信AI,腾讯,中国)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 StyleDecoupler通过信息论方法分离多模态视觉模型中的纯风格特征,实现艺术风格的可泛化解耦,并在大规模艺术数据集上展示出强大的风格检索和生成模型评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16065 2026-01-23 cs.CV cs.RO 57%

DTP: A Simple yet Effective Distracting Token Pruning Framework for Vision-Language Action Models

DTP: 一种简单而有效的干扰令牌修剪框架用于视觉-语言动作模型

Chenyang Li, Jieyuan Liu, Bin Li, Bo Gao, Yilin Yuan, Yangfan He, Yuchen Li, Jingqun Tang

机构 * Australian National University(澳大利亚国立大学) University of California, San Diego(加州大学圣地亚哥分校) Chinese Academy of Sciences(中国科学院) Beijing Institute of Graphic Communication(北京印刷学院) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Baidu Search(百度搜索) Bytedance(字节跳动)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 DTP框架通过动态修剪干扰令牌提升视觉-语言动作模型的任务成功率,适用于多种新型VLA模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14978 2026-01-22 cs.CV 57%

Unified Multi-Dataset Training for TBPS

多数据集统一训练用于TBPS

Nilanjana Chatterjee, Sidharatha Garg, A V Subramanyam, Brejesh Lall

机构 * IIIT Delhi(德里印度理工学院) IIT Delhi(德里理工学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出Scale-TBPS方法,通过统一数据集编纂和可扩展身份学习框架,在多个数据集上训练出单一TBPS模型,提升了行人检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14774 2026-01-22 cs.CV 57%

Does medical specialization of VLMs enhance discriminative power?: A comprehensive investigation through feature distribution analysis

医学专业性是否增强VLMs的判别能力?:通过特征分布分析的全面研究

Keita Takeda, Tomoya Sakai

机构 * Graduate School of Integrated Science and Technology(整合科学与技术研究生院) Nagasaki University(长崎大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本研究通过特征分布分析,探讨医学专业性对VLMs判别能力的影响,发现增强文本编码器比大量医学图像训练更关键,且非医学模型易受图像文本偏见影响。

Comments A short version paper of this research has been accepted for The IEEE International Symposium on Biomedical Imaging (ISBI) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13664 2026-01-22 cs.CV 57%

VIAFormer: Voxel-Image Alignment Transformer for High-Fidelity Voxel Refinement

VIAFormer:用于高保真体素细化的体素-图像对齐变换器

Tiancheng Fang, Bowen Pan, Lingxi Chen, Jiangjing Lyu, Chengfei Lyu, Chaoyue Niu, Fan Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 VIAFormer通过体素-图像对齐变换器实现高保真体素细化,结合图像索引、校正流目标和混合流变换器,提升多视角条件下体素修复的精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17160 2026-01-22 cs.CV 57%

Can Synthetic Images Serve as Effective and Efficient Class Prototypes?

合成图像能否作为有效的高效类别原型?

Dianxing Shi, Dingjie Fu, Yuqiao Liu, Jun Wang

机构 * Beijing Research Institute of Uranium Geology(铀矿北京研究机构) Huazhong University of Science and Technology(华中科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Great Bay University(大湾大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 LGCLIP通过大语言模型生成类别特定提示,利用扩散模型合成参考图像,以实现高效的零样本分类。

Comments Accepted by IEEE ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19699 2026-01-22 cs.NI cs.AI cs.MA 57%

A Layered Protocol Architecture for the Internet of Agents

面向智能体的分层协议架构

Charles Fleming, Luca Muscariello, Vijoy Pandey, Ramana Kompella

机构 * Cisco Research(思科研究)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出分层协议架构,通过智能体通信层和语义层实现智能体协作,解决LLMs在内存和计算能力上的限制,推动多智能体系统的扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09598 2026-01-22 cs.CV 57%

GAIA: A Global, Multi-modal, Multi-scale Vision-Language Dataset for Remote Sensing Image Analysis

GAIA: 一个全球性的多模态、多尺度遥感图像分析数据集

Angelos Zavras, Dimitrios Michail, Xiao Xiang Zhu, Begüm Demir, Ioannis Papoutsis

机构 * Orion Lab, School of Rural, Surveying and Geoinformatics Engineering, National Technical University of Athens(奥里昂实验室,农村测绘与地理信息工程学院,希腊雅典国家技术大学) Institute of Astronomy, Astrophysics, Space Applications and Remote Sensing, National Observatory of Athens(天文、天体物理、空间应用与遥感研究所,希腊雅典国家天文台) Department of Informatics and Telematics, Harokopio University of Athens(信息与电信技术系,雅典霍罗科皮欧大学) Chair of Data Science in Earth Observation, Technical University of Munich(地球观测数据科学教授职位,慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Faculty of Electrical Engineering and Computer Science, Technische Universität Berlin(电气工程与计算机科学系,柏林技术大学) BIFOLD - Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 GAIA是一个全球性的多模态遥感图像分析数据集,通过精心构建的图像-文本对提升遥感任务的性能。

Comments 26 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏