arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-23 至 2025-12-23 共收录 89 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 6 篇

2510.27261 2025-12-23 cs.CV 57%

RegionRAG: Region-level Retrieval-Augmented Generation for Visual Document Understanding

RegionRAG: 基于区域级别的检索增强生成用于视觉文档理解

Yinglu Li, Zhiying Lu, Zhihang Liu, Yiwei Sun, Chuanbin Liu, Hongtao Xie

机构 * Yinglu Li, Zhiying Lu, Zhihang Liu, Yiwei Sun, Chuanbin Liu, Hongtao Xie(作者)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

AI总结 RegionRAG通过区域级别检索增强生成,提升视觉文档理解的效率和准确性,实现更高的检索和问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18407 2025-12-23 cs.CV 57%

Through the PRISm: Importance-Aware Scene Graphs for Image Retrieval

通过PRISm:面向图像检索的重要性感知场景图

Dimitrios Georgoulopoulos, Nikolaos Chaidos, Angeliki Dimitriou, Giorgos Stamou

机构 * National Technical University of Athens(国家技术大学雅典)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 PRISm通过重要性感知场景图提升图像检索的语义准确性与人类感知一致性。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态生成 12 篇

2505.18947 2025-12-23 cs.CV 83%

OpenHOI: Open-World Hand-Object Interaction Synthesis with Multimodal Large Language Model

OpenHOI: 基于多模态大语言模型的开放世界手-物体交互合成

Zhenhao Zhang, Ye Shi, Lingxiao Yang, Suting Ni, Qi Ye, Jingya Wang

机构 * ShanghaiTech University(上海科技大学) Zhejiang University(浙江大学)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 OpenHOI通过多模态大语言模型实现开放世界手-物体交互合成,能生成长周期操控序列并处理复杂语言指令。

Comments Accepted by NeurIPS 2025 as Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01298 2025-12-23 cs.CV cs.AI 81%

Towards Enhanced Image Generation Via Multi-modal Chain of Thought in Unified Generative Models

通过统一生成模型中的多模态推理链提升图像生成

Yi Wang, Mushui Liu, Wanggui He, Hanyang Yuan, Longxiang Zhang, Ziwei Huang, Guanghao Zhang, Wenkai Fang, Haoze Jiang, Shengxuming Zhang, Dong She, Jinlong Liu, Weilong Dai, Mingli Song, Hao Jiang, Jie Song

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 多模态生成 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文通过引入多模态推理链提升统一生成模型的复杂图像生成能力,提出FoXperts架构和MCoT方法,实现更高效的多模态生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19609 2025-12-23 cs.CV cs.AI 62%

MapTrace: Scalable Data Generation for Route Tracing on Maps

MapTrace: 用于地图路线追踪的可扩展数据生成

Artemis Panagopoulou, Aveek Purohit, Achin Kulshrestha, Soroosh Yazdani, Mohit Goyal

机构 * Google XR(谷歌XR) University of Pennsylvania(宾夕法尼亚大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 MapTrace通过合成数据生成提升地图路线追踪性能,微调模型使成功率提升6.4个百分点,减少路径追踪误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18623 2025-12-23 cs.CL cs.AI 62%

LLM-CAS: Dynamic Neuron Perturbation for Real-Time Hallucination Correction

LLM-CAS: 动态神经元扰动用于实时幻觉修正

Jensen Zhang, Ningyuan Liu, Yijia Fan, Zihao Huang, Qinglin Zeng, Kaitong Cai, Jian Wang, Keze Wang

机构 * Sun Yat-sen University(中山大学) Snap Inc(Snap公司)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 LLM-CAS通过动态神经元扰动实现实时幻觉修正,提升大型语言模型的事实准确性。

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19686 2025-12-23 cs.CV 57%

Visual-Aware CoT: Achieving High-Fidelity Visual Consistency in Unified Models

视觉感知的CoT:在统一模型中实现高保真的视觉一致性

Zixuan Ye, Quande Liu, Cong Wei, Yuanxing Zhang, Xintao Wang, Pengfei Wan, Kun Gai, Wenhan Luo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出视觉感知的CoT方法,通过自适应视觉规划和迭代视觉修正提升统一模型的多模态生成能力,实现更高的视觉一致性。

Comments Project Page: https://zixuan-ye.github.io/VACoT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19680 2025-12-23 cs.CV 57%

VA-$π$: Variational Policy Alignment for Pixel-Aware Autoregressive Generation

VA-$π$: 变分策略对齐用于像素感知自回归生成

Xinyao Liao, Qiyuan He, Kai Xu, Xiaoye Qu, Yicong Li, Wei Wei, Angela Yao

机构 * Huazhong University of Science & Technology(华中科技大学) National University of Singapore(新加坡国立大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 VA-$π$通过变分优化和像素空间目标提升自回归生成的质量和多样性。

Comments 21 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19479 2025-12-23 cs.CV 57%

Emotion-Director: Bridging Affective Shortcut in Emotion-Oriented Image Generation

情绪导演:在情绪导向图像生成中弥合情感捷径

Guoli Jia, Junyao Hu, Xinwei Long, Kai Tian, Kaiyan Zhang, KaiKai Zhao, Ning Ding, Bowen Zhou

机构 * Tsinghua University(清华大学) The Hong Kong Polytechnic University(香港理工大学) China Unicom(中国联合通信) Shanghai Artificial Intelligence Lab(上海人工智能实验室)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 Emotion-Director通过跨模态协作框架,结合MC-Diffusion和MC-Agent,提升情绪导向图像生成的准确性和表现力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19271 2025-12-23 cs.CV 57%

3SGen: Unified Subject, Style, and Structure-Driven Image Generation with Adaptive Task-specific Memory

3SGen: 一种统一的主体、风格和结构驱动的图像生成方法,具有自适应任务特定记忆

Xinyang Song, Libin Wang, Weining Wang, Zhiwei Li, Jianxin Sun, Dandan Zheng, Jingdong Chen, Qi Li, Zhenan Sun

机构 * School of Artificial Intelligence, UCAS(人工智能学院,UCAS) CASIA AntGroup(蚂蚁集团)

专题命中 多模态生成 :MLLM(abstract);分类 cs.CV

AI总结 3SGen通过统一的框架实现主体、风格和结构驱动的图像生成,采用自适应任务特定记忆模块提升生成质量和跨任务迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18814 2025-12-23 cs.CV 57%

EchoMotion: Unified Human Video and Motion Generation via Dual-Modality Diffusion Transformer

EchoMotion: 通过双模态扩散变换器实现统一的人体视频与运动生成

Yuxiao Yang, Hualian Sheng, Sijia Cai, Jing Lin, Jiahao Wang, Bing Deng, Junzhe Lu, Haoqian Wang, Jieping Ye

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) Nanyang Technology University(南阳技术大学) Xi’an Jiaotong University(西安交通大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 EchoMotion通过双模态扩散变换器统一生成人体视频与运动,提升复杂人类动作视频的连贯性与合理性。

Comments 26 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18635 2025-12-23 cs.CV 57%

Uni-Neur2Img: Unified Neural Signal-Guided Image Generation, Editing, and Stylization via Diffusion Transformers

Uni-Neur2Img:通过扩散变换器实现神经信号引导的图像生成、编辑和风格化

Xiyue Bai, Ronghao Yu, Jia Xiu, Pengfei Zhou, Jie Xia, Peng Ji

机构 * Fudan University(复旦大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 Uni-Neur2Img通过扩散变换器实现神经信号引导的图像生成、编辑和风格化,提供统一且高效的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18007 2025-12-23 cs.RO cs.CV 57%

Robotic VLA Benefits from Joint Learning with Motion Image Diffusion

机器人VLA通过与运动图像扩散的联合学习获益

Yu Fang, Kanchana Ranasinghe, Le Xue, Honglu Zhou, Juntao Tan, Ran Xu, Shelby Heinecke, Caiming Xiong, Silvio Savarese, Daniel Szafir, Mingyu Ding, Michael S. Ryoo, Juan Carlos Niebles

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出通过联合学习与运动图像扩散提升机器人VLA模型的运动推理能力,实验表明在多个基准测试中显著提升了性能。

Comments Website: https://vla-motion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04798 2025-12-23 cs.LG 50%

TabRep: Training Tabular Diffusion Models with a Simple and Effective Continuous Representation

TabRep: 通过简单有效的连续表示训练表格扩散模型

Jacob Si, Zijing Ou, Mike Qu, Zhengrui Xiang, Yingzhen Li

机构 * Imperial College London(伦敦帝国学院) Columbia University(哥伦比亚大学)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 TabRep通过统一连续表示训练表格扩散模型,实现高效生成高质量表格数据并保持隐私。

Comments TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态评测 17 篇

2512.18745 2025-12-23 cs.CV cs.CL cs.LG 87%

InSight-o3: Empowering Multimodal Foundation Models with Generalized Visual Search

InSight-o3: 通过通用视觉搜索增强多模态基础模型

Kaican Li, Lewei Yao, Jiannan Wu, Tiezheng Yu, Jierun Chen, Haoli Bai, Lu Hou, Lanqing Hong, Wei Zhang, Nevin L. Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学) Huawei(华为)

专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(title);分类 cs.CV、cs.CL

AI总结 InSight-o3通过通用视觉搜索任务提升多模态基础模型的推理能力,解决复杂视觉信息整合问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17911 2025-12-23 cs.CL cs.AI cs.LG 84%

Towards Reasoning-Preserving Unlearning in Multimodal Large Language Models

面向多模态大语言模型的推理保留反学习

Hongji Li, Junchi yao, Manjiang Yu, Priyanka Singh, Xue Li, Di Wang, Lijie Hu

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(Mohamed bin Zayed人工智能大学) University of Queensland(昆士兰大学) Provable Responsible AI and Data Analytics (PRADA) Lab(可证明责任人工智能与数据分析实验室) King Abdullah University of Science and Technology (KAUST)(卡塔尔科学与技术大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出R-MUSE框架,通过子空间指导和自适应引导,在推理过程中有效消除多模态大语言模型中的推理痕迹,同时保留通用推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18864 2025-12-23 cs.CV cs.MM 81%

Cross-modal Counterfactual Explanations: Uncovering Decision Factors and Dataset Biases in Subjective Classification

跨模态反事实解释:在主观分类中揭示决策因素和数据集偏见

Alina Elena Baia, Andrea Cavallaro

机构 * EPFL(瑞士联邦理工学院)

专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出DeX框架,通过跨模态分解和图像特定概念生成自然语言反事实解释,揭示主观分类中的决策因素和数据集偏见,提升模型公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19675 2025-12-23 econ.GN cs.CV cs.DL q-fin.EC 79%

Multimodal LLMs for Historical Dataset Construction from Archival Image Scans: German Patents (1877-1918)

多模态大语言模型用于从档案图像扫描中构建历史数据集:德国专利(1877-1918)

Niclas Griesshaber, Jochen Streb

机构 * University of Mannheim(曼海姆大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出利用多模态大语言模型构建德国1877-1918年专利数据集,证明其在效率和质量上的优势,并开源相关工具和数据以促进经济史研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19354 2025-12-23 cs.CV 79%

ReasonCD: A Multimodal Reasoning Large Model for Implicit Change-of-Interest Semantic Mining

ReasonCD: 一种用于隐含兴趣语义挖掘的多模态推理大模型

Zhenyang Huang, Xiao Yu, Yi Zhang, Decheng Wang, Hang Ruan

机构 * Beijing Institute of Tracking and Telecommunications Technology(北京跟踪与电信技术研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 ReasonCD通过利用预训练大语言模型的推理能力,挖掘用户隐含任务意图,实现更高效的变化检测与解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19350 2025-12-23 cs.AI 79%

PENDULUM: A Benchmark for Assessing Sycophancy in Multimodal Large Language Models

PENDULUM: 一个用于评估多模态大语言模型顺从性的基准

A. B. M. Ashikur Rahman, Saeed Anwar, Muhammad Usman, Irfan Ahmad, Ajmal Mian

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 PENDULUM基准通过2000个视觉问答对评估多模态大语言模型的顺从性,揭示模型在顺从性和幻觉行为上的显著差异,提出新度量标准以提升模型的事实一致性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19107 2025-12-23 cs.AI 79%

FC-MIR: A Mobile Screen Awareness Framework for Intent-Aware Recommendation based on Frame-Compressed Multimodal Trajectory Reasoning

FC-MIR:一种基于帧压缩多模态轨迹推理的移动屏幕感知框架,用于意图感知推荐

Zhe Yang, Xiaoshuang Sheng, Zhengnan Zhang, Jidong Wu, Zexing Wang, Xin He, Shenghua Xu, Guanjing Xiong

机构 * vivo AI Lab(vivo人工智能实验室) Zhejiang University(浙江大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 FC-MIR框架通过帧压缩多模态轨迹推理,提升移动设备上意图感知推荐的效率与实用性,支持轻量级部署并探索生成操作与建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18947 2025-12-23 cs.AI cs.NE 79%

Clustering-based Transfer Learning for Dynamic Multimodal MultiObjective Evolutionary Algorithm

基于聚类的迁移学习用于动态多模态多目标进化算法

Li Yan, Bolun Liu, Chao Li, Jing Liang, Kunjie Yu, Caitong Yue, Xuzhao Chai, Boyang Qu

机构 * School of Automation and Electrical Engineering, Zhongyuan University of Technology(中原文理大学自动化与电气工程学院) School of Electrical Engineering, Zhengzhou University(郑州大学电气工程学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出基于聚类的自编码器预测机制,用于动态多模态多目标优化,通过构建基准测试函数和自适应尼奇策略,提升种群多样性和收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00086 2025-12-23 cs.CV 79%

Multi-modal On-Device Learning for Monocular Depth Estimation on Ultra-low-power MCUs

多模态设备端学习用于超低功耗MCU上的单目深度估计

Davide Nadalini, Manuele Rusci, Elia Cereda, Luca Benini, Francesco Conti, Daniele Palossi

机构 * Department of Electrical, Electronic, and Information Engineering (DEI), University of Bologna(电气电子与信息工程系,博洛尼亚大学) Department of Control and Computer Engineering (DAUIN), Politecnico di Torino(控制与计算机工程系,托斯卡纳理工学院) Department of Electrical Engineering (ESAT) at KU Leuven(根特大学电子工程系) Dalle Molle Institute for Artificial Intelligence (IDSIA), USI-SUPSI(达勒莫人工智能研究所(IDSIA),USI-SUPSI) Department of Information Technology and Electrical Engineering (D-ITET), ETH Zurich(信息科技与电气工程系,苏黎世联邦理工学院) Integrated Systems Laboratory, ETH Zurich(集成系统实验室,苏黎世联邦理工学院)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本研究提出了一种多模态设备端学习技术,用于在超低功耗MCU上实现单目深度估计,通过减少内存消耗和优化训练过程,显著提升精度和效率。

Comments 14 pages, 9 figures, 3 tables. Associated open-source release available at: https://github.com/idsia-robotics/ultralow-power-monocular-depth-ondevice-learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.02543 2025-12-23 cs.CV cs.HC cs.LG 79%

A Deep Learning-based Multimodal Depth-Aware Dynamic Hand Gesture Recognition System

基于深度学习的多模态深度感知动态手部姿态识别系统

Hasan Mahmud, Mashrur M. Morshed, Md. Kamrul Hasan

机构 * Systems \& Software Lab (SSL), Department of Computer Science

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于深度学习的多模态深度感知动态手部姿态识别系统,通过量化深度值和改进多模态融合CRNN架构,提高了识别准确性和参数效率。

Journal ref The Visual Computer, Springer Nature, January 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19021 2025-12-23 cs.CV cs.RO 57%

VLNVerse: A Benchmark for Vision-Language Navigation with Versatile, Embodied, Realistic Simulation and Evaluation

VLNVerse: 一个用于视觉语言导航的基准,具备多用途、具身体验、逼真模拟和评估

Sihao Lin, Zerui Li, Xunyi Zhao, Gengze Zhou, Liuyi Wang, Rong Wei, Rui Tang, Juncheng Li, Hanqing Wang, Jiangmiao Pang, Anton van den Hengel, Jiajun Liu, Qi Wu

机构 * Adelaide University(阿德莱德大学) Responsible AI Research Centre, Australian Institute for Machine Learning(负责任人工智能研究中心、澳大利亚机器学习研究所) Tongji University(同济大学) ManyCore Zhejiang University(浙江大学) Shanghai AI Lab(上海人工智能实验室) CSIRO Data61

专题命中 多模态评测 :MLLM(abstract);分类 cs.CV

AI总结 VLNVerse是一个大规模、可扩展的视觉语言导航基准,通过多用途、具身体验和逼真模拟提升导航任务的泛化能力与研究效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12826 2025-12-23 cs.RO cs.CV 57%

UncAD: Towards Safe End-to-end Autonomous Driving via Online Map Uncertainty

UncAD: 向通过在线地图不确定性实现安全端到端自动驾驶迈进

Pengxuan Yang, Yupeng Zheng, Qichao Zhang, Kefei Zhu, Zebin Xing, Qiao Lin, Yun-Fu Liu, Zhiguo Su, Dongbin Zhao

机构 * Key Laboratory of Safety Intelligent Mining in Non-coal Open-pit Mines, National Mine safety Administration, Guangdong Guangzhou, 510000, China(安全智能采矿非煤矿山重点实验室,国家矿山安全监察局,广东广州,510000,中国) The State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(人工智能学院,中国科学院大学,北京,中国) EACON, Fujian, China(福建中国EACON)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 UncAD通过引入在线地图不确定性,提升自动驾驶安全性,减少碰撞和冲突率。

Journal ref 2025 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05277 2025-12-23 cs.CV 57%

Text to Blind Motion

文本到盲人运动

Hee Jae Kim, Kathakoli Sengupta, Masaki Kuribayashi, Hernisa Kacorri, Eshed Ohn-Bar

机构 * Boston University(波士顿大学) Waseda University(早稻田大学) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出BlindWays,首个针对盲人行人的多模态运动基准,通过收集盲人真实环境中的3D运动数据及文本描述,评估现有3D运动模型在处理盲人独特运动模式时的不足,以提升自动驾驶等系统对多样化人类运动的推理能力。

Comments Accepted at NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18563 2025-12-23 cs.CV 57%

OpenView: Empowering MLLMs with Out-of-view VQA

OpenView: 通过视图外视觉问答增强大规模语言模型

Qixiang Chen, Cheng Zhang, Chi-Wing Fu, Jingwen Ye, Jianfei Cai

机构 * Monash University(墨尔本大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 OpenView通过全景图像生成多选VQA,提升大规模语言模型在视图外视觉问答任务中的性能。

Comments Code: https://github.com/q1xiangchen/OpenView

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18197 2025-12-23 q-bio.QM cs.CV eess.IV 57%

Standardized Evaluation of Automatic Methods for Perivascular Spaces Segmentation in MRI -- MICCAI 2024 Challenge Results

自动方法在MRI中血管周围空间分割标准化评估——MICCAI 2024挑战结果

Yilei Wu, Yichi Zhang, Zijian Dong, Fang Ji, An Sen Tan, Gifford Tan, Sizhao Tang, Huijuan Chen, Zijiao Chen, Eric Kwun Kei Ng, Jose Bernal, Hang Min, Ying Xia, Ines Vati, Liz Cooper, Xiaoyu Hu, Yuchen Pei, Yutao Ma, Victor Nozais, Ami Tsuchida, Pierre-Yves Hervé, Philippe Boutinaud, Marc Joliot, Junghwa Kang, Wooseung Kim, Dayeon Bak, Rachika E. Hamadache, Valeriia Abramova, Xavier Lladó, Yuntao Zhu, Zhenyu Gong, Xin Chen, John McFadden, Pek Lan Khong, Roberto Duarte Coello, Hongwei Bran Li, Woon Puay Koh, Christopher Chen, Joanna M. Wardlaw, Maria del C. Valdés Hernández, Juan Helen Zhou

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出MICCAI 2024 EPVS分割挑战,评估多种深度学习方法在多中心数据上的性能,揭示了跨站点泛化中的域转移问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20162 2025-12-23 cs.CV 57%

TOMCAT: Test-time Comprehensive Knowledge Accumulation for Compositional Zero-Shot Learning

TOMCAT:测试时综合知识积累用于组合零样本学习

Xudong Yan, Songhe Feng

机构 * School of Computer Science and Technology, Beijing Jiaotong University(计算机科学与技术学院,北京交通大学) Key Laboratory of Big Data and Artificial Intelligence in Transportation (Beijing Jiaotong University), Ministry of Education(交通运输大数据与人工智能重点实验室(北京交通大学),教育部)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 TOMCAT通过测试时积累文本和视觉知识,结合多模态协作学习,提升组合零样本学习的性能。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏