arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-28 至 2026-01-28 共收录 63 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 8 篇

2601.19613 2026-01-28 cs.CL cs.AI 62%

Up to 36x Speedup: Mask-based Parallel Inference Paradigm for Key Information Extraction in MLLMs

最高36倍提速:面向MLLMs关键信息提取的基于掩码的并行推断范式

Xinzhong Wang, Ya Guo, Jing Li, Huan Chen, Yi Tu, Yijie Hong, Gongshen Liu, Huijia Zhu

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Info Security Lab, Ant Group(蚂蚁集团信息安全部实验室) Inner Mongolia Research Institute, Shanghai Jiao Tong University(内蒙古研究院,上海交通大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于掩码的并行推断范式,通过并行生成提升MLLMs关键信息提取的效率,实现最高36倍的提速。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12529 2026-01-28 cs.HC cs.AI cs.CL 62%

Accepted with Minor Revisions: Value of AI-Assisted Scientific Writing

接受修改后:人工智能辅助科学写作的价值

Sanchaita Hazra, Doeun Lee, Bodhisattwa Prasad Majumder, Sachin Kumar

机构 * The University of Utah(犹他大学) The Ohio State University(俄亥俄州立大学) Allen Institute for AI(人工智能研究院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了AI辅助科学写作的有效性,发现AI生成摘要在披露来源信息后可达到与人工摘要相当的可接受性,且作者编辑行为受对AI作者身份的感知驱动。

Comments Published in ACM IUI 2026 (Paphos, Cyprus)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19484 2026-01-28 cs.CV 57%

Dynamic Worlds, Dynamic Humans: Generating Virtual Human-Scene Interaction Motion in Dynamic Scenes

动态世界,动态人类:生成动态场景中的虚拟人类-场景交互动作

Yin Wang, Zhiying Leng, Haitian Liu, Frederick W. B. Li, Mu Li, Xiaohui Liang

机构 * Beihang University(北航大学) University of Durham(达勒姆大学) State Key Laboratory of Virtual Reality Technology and Systems(虚拟现实技术与系统国家重点实验室) Zhongguancun Laboratory(中关村实验室)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Dyn-HSI架构,通过动态视觉导航、分层经验记忆和人-场景交互扩散模型,生成高质量的动态场景中人-场景交互动作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18997 2026-01-28 cs.CV cs.LG 57%

Anatomically-aware conformal prediction for medical image segmentation with random walks

解剖学感知的符合预测用于带有随机游走的医学图像分割

Mélanie Gaillochet, Christian Desrosiers, Hervé Lombaert

机构 * École de Technologie Supérieure Mila - Quebec AI Institute Polytechnique Montréal

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出RW-CP方法,通过随机游走扩散不确定性,提升医学图像分割的解剖学一致性与预测稳定性。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19504 2026-01-28 q-fin.CP 50%

Generating Alpha: A Hybrid AI-Driven Trading System Integrating Technical Analysis, Machine Learning and Financial Sentiment for Regime-Adaptive Equity Strategies

生成Alpha:一种融合技术分析、机器学习和金融情绪的混合AI驱动交易系统,用于适应性股票策略

Varun Narayan Kannan Pillai, Akshay Ajith, Sumesh K J

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出一种融合技术分析、机器学习和金融情绪的混合AI交易系统,通过多模态AI实现适应性股票策略,取得135.49%的回报率。

Comments Preprint. Full version of an accepted conference paper (ComSIA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 16 篇

2512.14961 2026-01-28 cs.CV cs.SD eess.AS eess.IV 84%

Adaptive Multimodal Person Recognition: A Robust Framework for Handling Missing Modalities

自适应多模态人物识别:一种处理缺失模态的稳健框架

Aref Farhadipour, Teodora Vukovic, Volker Dellwo, Petr Motlicek, Srikanth Madikeri

机构 * Department of Computational Linguistics, University of Zurich(苏黎世大学计算语言学系) Faculty of Information Technology, Brno University of Technology(布拉格技术大学信息学院) Idiap Research Institute(Idiap研究机构)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、eess.AS

AI总结 本文提出一种自适应多模态人物识别框架,通过融合上半身运动、面孔和语音信息,提升在缺失模态下的识别准确率,达到99.51%的Top-1准确率。

Comments 9 pages and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07295 2026-01-28 cs.CL 83%

CCFQA: A Benchmark for Cross-Lingual and Cross-Modal Speech and Text Factuality Evaluation

CCFQA:跨语言和跨模态语音与文本事实性评估基准

Yexing Du, Kaiyuan Liu, Youcheng Pan, Zheng Chu, Bo Yang, Xiaocheng Feng, Ming Liu, Yang Xiang

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CL

AI总结 CCFQA是一个用于评估多模态大语言模型跨语言和跨模态事实性能力的基准,通过少样本迁移学习策略在多语言语音问答任务中取得与GPT-4o-mini-Audio相当的性能。

Comments Accepted in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19702 2026-01-28 eess.AS cs.AI 81%

SAM Audio Judge: A Unified Multimodal Framework for Perceptual Evaluation of Audio Separation

SAM音频裁判:一种用于音频分离感知评估的统一多模态框架

Helin Wang, Bowen Shi, Andros Tjandra, John Hoffman, Yi-Chiao Wu, Apoorv Vyas, Najim Dehak, Ann Lee, Wei-Ning Hsu

机构 * Johns Hopkins University(约翰霍普金斯大学) Meta

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI、eess.AS

AI总结 SAM Audio Judge 提出了一种多模态细粒度参考自由客观指标,用于评估音频分离的感知性能,支持多种音频领域和输入类型,具有高一致性与实际应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19898 2026-01-28 cs.CV 79%

DuwatBench: Bridging Language and Visual Heritage through an Arabic Calligraphy Benchmark for Multimodal Understanding

DuwatBench: 通过阿拉伯书法基准桥接语言与视觉遗产以实现多模态理解

Shubham Patle, Sara Ghaboura, Hania Tariq, Mohammad Usman Khan, Omkar Thawakar, Rao Muhammad Anwer, Salman Khan

机构 * Mohamed bin Zayed University of AI(Mohamed bin Zayed人工智能大学) NUCES(努赛斯大学) NUST(努斯特大学) Australian National University(澳大利亚国立大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 DuwatBench通过阿拉伯书法基准推动多模态研究,揭示多模态模型在处理书法变体和艺术扭曲时的局限性。

Comments Accepted to EACL-2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19557 2026-01-28 cs.CV cs.RO 79%

The S3LI Vulcano Dataset: A Dataset for Multi-Modal SLAM in Unstructured Planetary Environments

S3LI Vulcano数据集:用于无结构行星环境多模态SLAM的数据集

Riccardo Giubilato, Marcus Gerhard Müller, Marco Sewtz, Laura Alejandra Encinar Gonzalez, John Folkesson, Rudolph Triebel

机构 * German Aerospace Center (DLR) Institute of Robotics and Mechatronics(德国航空航天中心(DLR)机器人与机电研究所) KTH Royal Institute of Technology(皇家理工学院) Deptartment of Intelligent Systems(智能系统部门)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 S3LI Vulcano数据集为无结构行星环境中的多模态SLAM和场景识别算法提供多模态数据及开源工具支持。

Comments Accepted submission to the 2026 IEEE Aerospace Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19193 2026-01-28 cs.AI 79%

CoReTab: Improving Multimodal Table Understanding with Code-driven Reasoning

CoReTab:通过代码驱动推理提升多模态表格理解

Van-Quang Nguyen, Takayuki Okatani

机构 * RIKEN AIP(日本理化学研究所AIP) GSIS, Tohoku University/RIKEN AIP(东京东京大学GSIS/日本理化学研究所AIP)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 CoReTab通过代码驱动推理框架,提升多模态表格理解的准确性和可解释性,实现显著的性能提升。

Comments accepted to EACL'26 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17644 2026-01-28 cs.CR cs.AI 79%

A Systemic Evaluation of Multimodal RAG Privacy

多模态RAG隐私的系统评估

Ali Al-Lawati, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文系统评估了多模态RAG隐私风险,揭示了推理过程中可能泄露私有信息的问题,并呼吁开发隐私保护机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03660 2026-01-28 cs.CV 79%

MGPC: Multimodal Network for Generalizable Point Cloud Completion With Modality Dropout and Progressive Decoding

MGPC:多模态网络用于通用点云补全与模态丢弃和渐进解码

Jiangyuan Liu, Yuhao Zhao, Hongxuan Ma, Zhe Liu, Jian Wang, Wei Zou

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation of Chinese Academy of Sciences(中国科学院自动化研究所 multimodal 人工智能系统国家重点实验室) Chemical Defense Institute, Academy of Military Sciences(军事科学院化学防御研究院) Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation of Chinese Academy of Sciences(中国科学院自动化研究所 复杂系统认知与决策智能重点实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 MGPC通过多模态融合和渐进生成提升点云补全的泛化能力,构建大规模基准并验证其在现实场景中的有效性。

Comments Code and dataset are available at https://github.com/L-J-Yuan/MGPC

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03785 2026-01-28 cs.LG cs.AI 79%

SoilNet: A Multimodal Multitask Model for Hierarchical Classification of Soil Horizons

SoilNet:一种用于土壤剖面层次分类的多模态多任务模型

Vipin Singh, Teodor Chiaburu, Einar Eberhardt, Stefan Broda, Joey Prüssing, Frank Haußer, Felix Bießmann

机构 * Einstein Center Digital Future(数字未来爱因斯坦中心)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 SoilNet通过多模态多任务模型解决土壤层次分类问题,结合图像数据和地理时间元数据,利用图结构表示实现复杂层次结构的准确分类。

Comments 29 pages, 9 figures, 7 tables

Journal ref Geoderma, Volume 466, 2026, 117684

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07559 2026-01-28 cs.LG cs.AI 79%

Zer0-Jack: A Memory-efficient Gradient-based Jailbreaking Method for Black-box Multi-modal Large Language Models

Zer0-Jack: 一种内存高效的基于梯度的对抗方法用于黑盒多模态大语言模型

Tiejin Chen, Kaishen Wang, Hua Wei

机构 * Arizona State University(亚利桑那州立大学) University of Maryland(马里兰大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 Zer0-Jack通过零阶优化实现高效黑盒对抗,显著降低内存使用并提升攻击成功率。

Comments Accepted to EACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19198 2026-01-28 cs.IR 78%

Propagating Similarity, Mitigating Uncertainty: Similarity Propagation-enhanced Uncertainty for Multimodal Recommendation

传播相似性,缓解不确定性:多模态推荐的相似性传播增强不确定性

Xinzhuo Wu, Hongbo Wang, Yuan Lin, Kan Xu, Liang Yang, Hongfei Lin

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 SPUMR通过构建模态相似性图和协作相似性图,结合不确定性感知的偏好聚合模块,提升多模态推荐系统的特征融合和不确定性估计能力。

Comments Accepted by ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09497 2026-01-28 quant-ph 78%

Quantum mixture-density network for multimodal probabilistic prediction

量子混合密度网络用于多模概率预测

Jaemin Seo

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 量子混合密度网络通过参数化量子电路高效建模多模分布,在双缝实验和混沌分岔任务中优于经典方法,展现量子机器学习在概率回归中的优势。

Journal ref IEEE Access 13 (2025) 199317-199325

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19222 2026-01-28 cs.CV cs.AI 73%

UniPCB: A Unified Vision-Language Benchmark for Open-Ended PCB Quality Inspection

UniPCB: 一个统一的视觉-语言基准用于开放式PCB质量检测

Fuxiang Sun, Xi Jiang, Jiansheng Wu, Haigang Zhang, Feng Zheng, Jinfeng Yang

机构 * Shenzhen Polytechnic University(深圳职业技术大学) Southern University of Science and Technology(南方科技大学) University of Science and Technology Liaoning(辽宁科技大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 UniPCB提出一个统一的视觉-语言基准用于开放式PCB质量检测,通过系统化流程和PCB-GPT模型提升缺陷定位性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16435 2026-01-28 cs.CV cs.CL 62%

Human Cognitive Benchmarks Reveal Foundational Visual Gaps in MLLMs

人类认知基准揭示大规模多模态语言模型中的基础视觉缺陷

Jen-Tse Huang, Dasen Dai, Jen-Yuan Huang, Youliang Yuan, Xiaoyuan Liu, Wenxuan Wang, Wenxiang Jiao, Pinjia He, Zhaopeng Tu, Haodong Duan

机构 * CUHK(香港中文大学) PKU(北京大学) CUHKSZ(香港中文大学深圳分校) RUC(中国人民大学) Tencent(腾讯) SHLab(深圳实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 人类认知基准揭示大规模多模态语言模型在基础视觉能力上的不足,通过VisFactor评估发现模型在关键视觉任务上表现不佳。

Comments Update: Evaluated 23 SOTA MLLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19202 2026-01-28 cs.CL 57%

Do Images Speak Louder than Words? Investigating the Effect of Textual Misinformation in VLMs

图像胜过言语吗?探讨文本误导在VLMs中的影响

Chi Zhang, Wenxuan Ding, Jiale Liu, Mingrui Wu, Qingyun Wu, Ray Mooney

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Pennsylvania State University(宾夕法尼亚州立大学) New York University(纽约大学) University of Chinese Academy of Sciences(中国科学院大学) AG2ai, Inc.(AG2ai公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 研究探讨了文本误导对视觉-语言模型(VLMs)的影响,发现模型易受误导性文本提示影响,导致性能显著下降。

Comments 24 pages, 10 figures. Accepted at EACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19345 2026-01-28 cs.CR 50%

AI-driven Intrusion Detection for UAV in Smart Urban Ecosystems: A Comprehensive Survey

基于人工智能的无人机智能城市生态系统入侵检测:综述

Abdullah Khanfor, Raby Hamadi, Noureddine Lasla, Hakim Ghazzai

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文综述了无人机在智能城市中的应用及安全挑战,探讨了人工智能技术在入侵检测中的作用,并提出了十个关键研究方向。

Comments 68 pages, 13 figures, 6 tables, journal

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态Agent 3 篇

2411.03709 2026-01-28 cs.HC cs.AI 79%

AutoGameUI: Constructing High-Fidelity GameUI via Multimodal Correspondence Matching

AutoGameUI: 通过多模态对应匹配构建高保真的游戏界面

Zhongliang Tang, Qingrong Cheng, Mengchen Tan, Yongxiang Zhang, Fei Xia

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 AutoGameUI通过多模态对应匹配自动构建高保真的游戏界面,提升了游戏界面设计的效率和一致性。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10809 2026-01-28 cs.CR cs.LG 71%

MIP against Agent: Malicious Image Patches Hijacking Multimodal OS Agents

针对代理的恶意图像补丁:多模态操作系统代理劫持

Lukas Aichberger, Alasdair Paren, Guohao Li, Philip Torr, Yarin Gal, Adel Bibi

机构 * Johannes Kepler University Linz(约翰内斯·开普勒大学林茨) University of Oxford(牛津大学)

专题命中 多模态Agent :multimodal(title)

AI总结 本文提出恶意图像补丁(MIPs)攻击,通过篡改屏幕区域使多模态OS代理执行有害操作,揭示了OS代理的安全漏洞。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19507 2026-01-28 cs.CL 57%

Automated Safety Benchmarking: A Multi-agent Pipeline for LVLMs

自动化安全基准测试:一种用于大型视觉语言模型的多代理流程

Xiangyang Zhu, Yuan Tian, Zicheng Zhang, Qi Jia, Chunyi Li, Renrui Zhang, Heng Li, Zongrui Wang, Wei Sun

机构 * Shanghai AI Lab(上海人工智能实验室) PolyU HK(PolyU香港分校) East China Normal University(东华大学)

专题命中 多模态Agent :cross-modal(abstract);分类 cs.CL

AI总结 VLSafetyBencher通过多代理流程自动化构建高质量安全基准,有效区分不同模型的安全性,提升LVLMs的安全评估效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态训练与对齐 6 篇

2601.19325 2026-01-28 cs.CV cs.AI 81%

Innovator-VL: A Multimodal Large Language Model for Scientific Discovery

Innovator-VL:一种用于科学发现的多模态大语言模型

Zichen Wen, Boxue Yang, Shuang Chen, Yaojie Zhang, Yuhang Han, Junlong Ke, Cong Wang, Yicheng Fu, Jiawang Zhao, Jiangchao Yao, Xi Fang, Zhen Wang, Henxing Cai, Lin Yao, Zhifeng Gao, Yanhui Hong, Nang Yuan, Yixuan Li, Guojiang Zhao, Haoyi Tao, Nan Wang, Han Lyu, Guolin Ke, Ning Liao, Xiaoxing Wang, Kai Chen, Zhiyu Li, Feiyu Xiong, Sihan Hu, Kun Chen, Yanfeng Wang, Weinan E, Linfeng Zhang, Linfeng Zhang

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Institute of Theoretical Physics, Chinese Academy of Sciences(中国科学院理论物理研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 Innovator-VL通过高效数据选择和透明训练方法,在科学发现中实现高性能多模态模型。

Comments Innovator-VL tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06832 2026-01-28 cs.AI 70%

Remote Sensing Image Intelligent Interpretation with the Language-Centered Perspective: Principles, Methods and Challenges

遥感图像智能解读的以语言为中心的视角:原理、方法与挑战

Haifeng Li, Wang Guo, Haiyang Wu, Mengwei Wu, Jipeng Zhang, Qing Zhu, Yu Liu, Xin Huang, Chao Tao

机构 * School of Geosciences and Info-Physics, Central South University(中南大学地球科学与信息物理学院) Faculty of Geosciences and Environmental Engineering, Southwest Jiaotong University(西南交通大学地质科学与环境工程学院) School of Earth and Space Sciences, Peking University(北京大学地球与空间科学学院) Institute of Remote Sensing Information Processing (IRSIP), Wuhan University(武汉大学遥感信息处理研究所)

专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);分类 cs.AI

AI总结 本文提出以语言为中心的遥感图像解读框架,探讨LLMs作为认知核心的作用,并总结多模态表示、知识关联等核心挑战,为认知驱动的智能地理空间分析提供理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19112 2026-01-28 cs.AI cs.MM cs.SD 62%

Uncertainty-Aware 3D Emotional Talking Face Synthesis with Emotion Prior Distillation

具有情绪先验蒸馏的不确定性感知3D情感说话面孔合成

Nanhan Shen, Zhilei Liu

机构 * School of Artificial Intelligence, Tianjin University, Tianjin, China(人工智能学院,天津大学,天津,中国)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI、cs.MM

AI总结 UA-3DTalk通过引入情绪先验蒸馏和不确定性感知模块,提升3D情感说话面孔合成的音频-视觉对齐和渲染质量。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19349 2026-01-28 eess.IV cs.CV 57%

AMGFormer: Adaptive Multi-Granular Transformer for Brain Tumor Segmentation with Missing Modalities

AMGFormer: 适应性多粒度变换器用于缺失模态的脑肿瘤分割

Chengxiang Guo, Jian Wang, Junhua Fei, Xiao Li, Chunling Chen, Yun Jin

机构 * 1 Faculty of Information Engineering Automation, Kunming University of Science Technology 2 Hepatobiliary \& Pancreatic Surgery, First People's Hospital of Yunnan/KUST Affiliated Hospital

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 AMGFormer通过三个协同模块提升脑肿瘤分割在缺失模态下的稳定性,实现高精度分割和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19247 2026-01-28 cs.CV 57%

TIGaussian: Disentangle Gaussians for Spatial-Awared Text-Image-3D Alignment

TIGaussian: 解耦高斯分布以实现空间感知的图文-3D对齐

Jiarun Liu, Qifeng Chen, Yiru Zhao, Minghua Liu, Baorui Ma, Sheng Yang

机构 * Unmanned Vehicle Dept., Cainiao Inc., Alibaba Group, Hangzhou, China(阿里巴巴集团 Cainiao 无人机部门,杭州,中国) Hillbot, Sunnyvale, USA(Hillbot,美国 Sunnyvale) Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院,北京,中国)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 TIGaussian通过多分支3DGS分词器和模态特定对齐策略,实现空间感知的图文-3D跨模态对齐,提升3D相关任务的预训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17177 2026-01-28 cs.CV cs.LG 57%

A Genealogy of Foundation Models in Remote Sensing

遥感领域基础模型的谱系

Kevin Lane, Morteza Karimzadeh

机构 * University of Colorado, Boulder(科罗拉多大学博尔德分校)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文探讨了遥感领域基础模型的发展历程,分析了单传感器与多传感器方法的优劣,并提出了未来改进方向。

Comments 28 pages, submitted to ACM SigSpatial, accepted as of January 12th, 2026. This is the second revision from the original 20-page manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏