arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4959 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4959 篇

2506.16594 2026-02-18 cs.CL 57%

A Scoping Review of Synthetic Data Generation by Language Models in Biomedical Research and Application: Data Utility and Quality Perspectives

基于语言模型生成合成数据在生物医学研究与应用中的综述:数据效用和质量视角

Hanshu Rao, Weisi Liu, Haohan Wang, I-Chan Huang, Zhe He, Xiaolei Huang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 本文综述了语言模型在生物医学领域生成合成数据的应用,分析了不同模态下的数据效用与质量挑战,指出需建立标准化评估框架以提升生物医学研究的应用效果。

Journal ref Journal of Healthcare Informatics Research (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11526 2026-02-17 cs.RO cs.AI 57%

Foundation Models in Autonomous Driving: A Survey on Scenario Generation and Scenario Analysis

自动驾驶中的基础模型:场景生成与场景分析的综述

Yuan Gao, Mattia Piccinini, Yuchen Zhang, Dingrui Wang, Korbinian Moller, Roberto Brusnicki, Baha Zarrouki, Alessio Gambi, Jan Frederik Totz, Kai Storms, Steven Peters, Andrea Stocco, Bassam Alrifaee, Marco Pavone, Johannes Betz

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文综述了基础模型在自动驾驶场景生成与分析中的应用,探讨了相关模型、方法及挑战。

Comments IEEE Open Journal of Intelligent Transportation Systems

Journal ref IEEE Open Journal of Intelligent Transportation Systems, 03 February 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14534 2026-02-17 cs.CV 57%

MoRL: Reinforced Reasoning for Unified Motion Understanding and Generation

MoRL: 用于统一运动理解与生成的强化推理

Hongpeng Wang, Zeyu Zhang, Wenhao Li, Hao Tang

机构 * The University of Sydney(悉尼大学) Peking University(北京大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 MoRL通过结合监督微调和强化学习,提升运动理解与生成的推理能力和现实感,并引入链式运动方法和大规模CoT数据集以增强推理效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14186 2026-02-17 cs.CV 57%

UniRef-Image-Edit: Towards Scalable and Consistent Multi-Reference Image Editing

UniRef-Image-Edit: 向可扩展和一致的多参考图像编辑迈进

Hongyang Wei, Bin Wen, Yancheng Long, Yankai Yang, Yuhang Hu, Tianke Zhang, Wei Chen, Haonan Fan, Kaiyu Jiang, Jiankang Chen, Changyi Liu, Kaiyu Tang, Haojie Ding, Xiao Yang, Jia Sun, Huaiqing Wang, Zhenyu Yang, Xinyu Wei, Xianglong He, Yangguang Li, Fan Yang, Tingting Gao, Lei Zhang, Guorui Zhou, Han Li

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技) Hong Kong Polytechnic University(香港理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) CUHK MMLab(香港中文大学MMLab)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 UniRef-Image-Edit通过统一的输入表示和两阶段训练框架,提升多参考图像编辑的一致性和保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05039 2026-02-17 cs.CV 57%

Semantic-Guided Two-Stage GAN for Face Inpainting with Hybrid Perceptual Encoding

基于语义引导的两阶段GAN用于面部修复的混合感知编码

Abhigyan Bhattacharya, Hiranmoy Roy, Debotosh Bhattacharjee

机构 * RCC Institute of Information Technology(RCC信息科技学院) Jadavpur University(贾瓦德普尔大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出一种基于语义引导的两阶段GAN模型,通过混合感知编码提升面部修复的语义一致性和图像质量。

Comments The paper is under consideration at Elsevier journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12160 2026-02-13 cs.CV 57%

DreamID-Omni: Unified Framework for Controllable Human-Centric Audio-Video Generation

DreamID-Omni: 一体化框架用于可控的人-centric音频视频生成

Xu Guo, Fulong Ye, Qichao Sun, Liyang Chen, Bingchuan Li, Pengze Zhang, Jiawei Liu, Songtao Zhao, Qian He, Xiangwang Hou

机构 * Tsinghua University(清华大学) Intelligent Creation Lab, ByteDance(字节跳动智能创作实验室)

专题命中 多模态生成 :audio-visual(abstract);分类 cs.CV

AI总结 DreamID-Omni提出了一种统一框架,通过双层解耦策略和多任务训练方案,实现对可控人-centric音频视频生成的高效控制。

Comments Project: https://guoxu1233.github.io/DreamID-Omni/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11980 2026-02-13 cs.CV 57%

Spatial Chain-of-Thought: Bridging Understanding and Generation Models for Spatial Reasoning Generation

空间链式思考:连接理解与生成模型以实现空间推理生成

Wei Chen, Yancheng Long, Mingqiao Liu, Haojie Ding, Yankai Yang, Hongyang Wei, Yi-Fan Zhang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SCoT框架,通过结合MLLMs的推理能力与扩散模型的生成能力,提升空间推理生成任务的性能。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10891 2026-02-12 cs.NE cs.AI 57%

Interactive LLM-assisted Curriculum Learning for Multi-Task Evolutionary Policy Search

多任务策略搜索中的交互式LLM辅助课程学习

Berfin Sakallioglu, Giorgia Nadizar, Eric Medvet

机构 * MIGe - University of Trieste(MIGe - 乌迪内大学) University Toulouse Capitole, IRIT - CNRS UMR5505(图卢兹大学,IRIT - CNRS UMR5505) DIA - University of Trieste(DIA - 乌迪内大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出了一种交互式LLM辅助的在线课程生成框架,通过多模态反馈提升多任务策略搜索的性能,展示其与专家设计课程的竞争力。

Comments 8 pages, 7 figures, with Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10113 2026-02-11 cs.CV 57%

ConsID-Gen: View-Consistent and Identity-Preserving Image-to-Video Generation

ConsID-Gen:视图一致且身份保持的图像到视频生成

Mingyang Wu, Ashirbad Mishra, Soumik Dey, Shuo Xing, Naveen Ravipati, Hansi Wu, Binbin Li, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯大学) eBay Inc.(eBay公司)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 ConsID-Gen通过视图辅助生成框架提升图像到视频生成的视图一致性和身份保持性。

Comments Project page: https://myangwu.github.io/ConsID-Gen

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09775 2026-02-11 cs.CV 57%

Where Do Images Come From? Analyzing Captions to Geographically Profile Datasets

图像来自哪里?通过分析描述词地理上剖析数据集

Abhipsa Basu, Yugam Bahl, Kirti Bhagat, Preethi Seshadri, R. Venkatesh Babu, Danish Pruthi

机构 * Indian Institute of Science, Bangalore(印度科学研究院,班加罗尔) TNSQ AI(TNSQ人工智能) University of California, Irvine(加州大学尔湾分校)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 研究通过分析图像描述词地理分布,发现训练数据严重偏向欧美国家,且代表性与GDP正相关,但生成图像的多样性不足。

Comments 41 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09432 2026-02-11 cs.CV 57%

SceneReVis: A Self-Reflective Vision-Grounded Framework for 3D Indoor Scene Synthesis via Multi-turn RL

SceneReVis: 一种基于多轮强化学习的视觉 grounding 框架,用于通过多轮强化学习进行 3D 室内场景合成

Yang Zhao, Shizhao Sun, Meisheng Zhang, Yingdong Shi, Xubo Yang, Jiang Bian

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Microsoft Research Asia, Beijing, China(微软亚洲研究院) Peking University, Beijing, China(北京大学) ShanghaiTech University, Shanghai, China(上海科技大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 SceneReVis 通过多轮强化学习和多模态反馈,实现高保真 3D 室内场景合成,提升空间规划能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02380 2026-02-11 cs.CV 57%

Unified Personalized Reward Model for Vision Generation

面向视觉生成的统一个性化奖励模型

Yibin Wang, Yuhang Zang, Feng Han, Jiazi Bu, Yujie Zhou, Cheng Jin, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiaotong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出UnifiedReward-Flex,一种面向视觉生成的统一个性化奖励模型,通过结合奖励建模与灵活上下文适应的推理,提升视觉生成的准确性与对人类偏好的对齐性。

Comments Website: https://codegoat24.github.io/UnifiedReward/flex

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08701 2026-02-11 q-bio.QM cs.CV 57%

Automated Lesion Segmentation of Stroke MRI Using nnU-Net: A Comprehensive External Validation Across Acute and Chronic Lesions

利用nnU-Net实现脑卒中MRI病变自动分割:在急性与慢性病变上的全面外部验证

Tammar Truzman, Matthew A. Lambon Ralph, Ajay D. Halai

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文利用nnU-Net框架对脑卒中MRI病变进行自动分割,验证了模型在急性与慢性病变中的泛化能力,发现病变体积和图像质量是影响分割准确性的关键因素。

Comments 32 pages, 7 figures. Submitted to Brain. Code and trained models available

Journal ref 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06133 2026-02-10 cs.LG cs.AI cs.RO 57%

A Review of Online Diffusion Policy RL Algorithms for Scalable Robotic Control

在线扩散策略强化学习算法综述:可扩展机器人控制

Wonhyeok Choi, Shutong Ding, Minwoo Choi, Jungwan Woo, Kyumin Hwang, Jaeyeul Kim, Ye Shi, Sunghoon Im

机构 * Daegu Gyeongbuk Institute of Science and Technology(大邱庆尚科学技术院) ShanghaiTech University(上海科技大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文综述了在线扩散策略强化学习算法,分析了其在可扩展机器人控制中的性能、挑战及未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09777 2026-02-10 cs.CV cs.RO 57%

EgoFSD: Ego-Centric Fully Sparse Paradigm with Uncertainty Denoising and Iterative Refinement for Efficient End-to-End Self-Driving

EgoFSD:面向端到端自动驾驶的以自我为中心的完全稀疏范式,结合不确定性去噪和迭代细化

Haisheng Su, Wei Wu, Zhenjie Yang, Isabel Guan

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) SenseAuto The Hong Kong University of Science and Technology(香港理工大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 EgoFSD通过引入稀疏感知、分层交互和迭代运动规划,提升端到端自动驾驶的效率和性能,减少误差和碰撞,提高训练稳定性。

Comments Accepted to ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07564 2026-02-10 cs.CV 57%

SIGMA: Selective-Interleaved Generation with Multi-Attribute Tokens

SIGMA: 带多属性标记的选择性交错生成

Xiaoyan Zhang, Zechen Bai, Haofan Wang, Yiren Song

机构 * Creatly AI University of Michigan(密歇根大学) Lovart AI National University of Singapore(新加坡国立大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 SIGMA通过引入多属性标记实现多条件生成,提升可控性、一致性和视觉质量,优于Bagel在组合任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07243 2026-02-10 cs.RO cs.AI cs.GR 57%

Realistic Synthetic Household Data Generation at Scale

大规模生成逼真合成家庭数据

Siddharth Singh, Ifrah Idrees, Abraham Dauhajre

机构 * Siddharth Singh(1 西雅图)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出了一种大规模生成逼真合成家庭数据的方法,通过松耦合生成人机交互与环境数据,实现双向影响建模,提升家庭智能设备的开发与测试能力。

Comments Accepted at Agentic AI Benchmarks and Applications for Enterprise Tasks workshop at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06494 2026-02-09 cs.CV 57%

DreamHome-Pano: Design-Aware and Conflict-Free Panoramic Interior Generation

DreamHome-Pano: 基于设计意识和无冲突的全景室内生成

Lulu Chen, Yijiang Hu, Yuanqing Liu, Yulong Li, Yue Yang

机构 * Beike(贝克)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 DreamHome-Pano通过引入Prompt-LLM和无冲突控制架构,实现了高保真的全景室内生成,平衡了美学质量和结构一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06419 2026-02-09 cs.CV 57%

Learning Human Visual Attention on 3D Surfaces through Geometry-Queried Semantic Priors

通过几何查询的语义先验学习人类在3D表面上的视觉注意

Soham Pahari, Sandeep C. Kumain

机构 * UPES Dehradun(德里敦大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出SemGeo-AttentionNet,通过几何查询语义先验,有效建模人类在3D表面的视觉注意,实现了显著性检测与扫描路径生成的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05998 2026-02-06 cs.CV 57%

VisRefiner: Learning from Visual Differences for Screenshot-to-Code Generation

VisRefiner: 从视觉差异中学习以实现截图到代码生成

Jie Deng, Kaichun Yao, Libo Zhang

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 VisRefiner通过学习视觉差异提升截图到代码生成的准确性和自我完善能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05339 2026-02-06 cs.CV cs.LG 57%

Consistency-Preserving Concept Erasure via Unsafe-Safe Pairing and Directional Fisher-weighted Adaptation

通过不安全-安全配对和方向性Fisher加权适应进行一致性保持的概念擦除

Yongwoo Kim, Sungmin Cha, Hyunsoo Kim, Jaewon Lee, Donghyun Kim

机构 * Korea University(韩国大学) New York University(纽约大学) Korea Institute of Science(韩国科学技术院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出PAIR框架,通过不安全-安全配对和方向性Fisher加权适应,实现对有害概念的精细化擦除,保持生成内容的结构和语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05013 2026-02-06 cs.GR cs.CV 57%

Untwisting RoPE: Frequency Control for Shared Attention in DiTs

解开RoPE:多模态和共享注意力中的频率控制

Aryan Mikaeili, Or Patashnik, Andrea Tagliasacchi, Daniel Cohen-Or, Ali Mahdavi-Amiri

机构 * Simon Fraser University(西蒙弗雷泽大学) Tel Aviv University(特拉维夫大学) University of Toronto(多伦多大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文通过分析RoPE的频率结构,提出方法调节RoPE频率带以实现更符合语义的共享注意力,从而有效控制风格迁移与内容复制的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04886 2026-02-06 cs.LG cs.AI cs.CE stat.ML 57%

Denoising diffusion networks for normative modeling in neuroimaging

去噪扩散网络在神经影像规范建模中的应用

Luke Whitbread, Lyle J. Palmer, Mark Jenkinson

机构 * Australian Institute for Machine Learning (AIML), Adelaide University(澳大利亚机器学习研究所(AIML),阿德莱德大学) South Australian Health and Medical Research Institute (SAHMRI)(南澳大利亚健康与医学研究机构(SAHMRI)) School of Computer Science and Information Technology, Adelaide University(计算机科学与信息技术学院,阿德莱德大学) School of Public Health, Adelaide University(公共卫生学院,阿德莱德大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出基于去噪扩散概率模型(DDPMs)的神经影像规范建模方法,通过统一条件密度估计器实现多变量依赖关系建模,提升高维数据下的校准性能和可扩展性。

Comments 55 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03215 2026-02-04 stat.ML cs.AI cs.LG 57%

Latent Neural-ODE for Model-Informed Precision Dosing: Overcoming Structural Assumptions in Pharmacokinetics

隐式神经微分方程用于模型指导的精准给药:克服药代动力学中的结构假设

Benjamin Maurel, Agathe Guilloux, Sarah Zohar, Moreno Ursino, Jean-Baptiste Woillard

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出基于隐式神经ODE的模型,用于精准给药中的他克莫司AUC预测,通过模拟和临床验证展示了其在复杂生物动态建模中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01756 2026-02-03 cs.CV 57%

Mind-Brush: Integrating Agentic Cognitive Search and Reasoning into Image Generation

Mind-Brush: 将代理认知搜索与推理整合到图像生成中

Jun He, Junyan Ye, Zilong Huang, Dongzhi Jiang, Chenjue Zhang, Leqi Zhu, Renrui Zhang, Xiang Zhang, Weijia Li

机构 * Sun Yat-sen University(中山大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 Mind-Brush通过整合代理认知搜索与推理,提升图像生成模型对复杂知识推理和动态适应能力,实现性能显著跃升。

Comments 36 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18623 2026-02-03 cs.CV 57%

Adaptive Domain Shift in Diffusion Models for Cross-Modality Image Translation

扩散模型中自适应域偏移用于跨模态图像翻译

Zihao Wang, Yuzhou Chen, Shaogang Ren

机构 * Laplace Lab at University of Tennessee(田纳西大学Laplace实验室) University of California Riverside(加州大学河滨分校) University of Tennessee at Chattanooga(田纳西大学查塔努加分校)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种自适应域偏移方法,通过在扩散模型生成过程中嵌入域偏移动态,提升跨模态图像翻译的结构保真度和语义一致性。

Comments Paper accepted as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01352 2026-02-03 cs.CV 57%

T2M Mamba: Motion Periodicity-Saliency Coupling Approach for Stable Text-Driven Motion Generation

T2M Mamba:基于运动周期性与显著性耦合的稳定文本驱动运动生成方法

Xingzu Zhan, Chen Xie, Honghang Chen, Yixun Lin, Xiaochun Mai

机构 * Shenzhen University(深圳大学) Jinan University(济南大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 T2M Mamba通过周期性-显著性耦合方法,解决文本驱动运动生成中的周期性漂移和语义脆弱性问题,实现更稳定的运动生成。

Comments 8 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01305 2026-02-03 cs.CV 57%

StoryState: Agent-Based State Control for Consistent and Editable Storybooks

StoryState: 基于代理的状态控制用于一致且可编辑的故事书

Ayushman Sarkar, Zhenyu Yu, Wei Tang, Chu Chen, Kangning Cui, Mohd Yamani Idna Idris

机构 * Birbhum Institute of Engineering and Technology(比尔布尔工程科技学院) Universiti Malaya(马来亚大学) City University of Hong Kong(香港城市大学) Wake Forest University(威克森林大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 StoryState通过基于代理的状态控制实现多页故事书的一致性与编辑优化

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01046 2026-02-03 cs.CV 57%

ReLayout: Versatile and Structure-Preserving Design Layout Editing via Relation-Aware Design Reconstruction

ReLayout: 通过关系感知的设计重建实现多功能且结构保持的设计布局编辑

Jiawei Lin, Shizhao Sun, Danqing Huang, Ting Liu, Ji Li, Jiang Bian

机构 * Xi'an Jiaotong University, Xi'an, China(西安交通大学) Microsoft Research(微软研究院)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 ReLayout通过关系感知设计重建实现多功能且结构保持的设计布局编辑,无需三元组数据,提升编辑质量和结构保持性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00516 2026-02-03 cs.CV 57%

SPARK: Stochastic Propagation via Affinity-guided Random walK for training-free unsupervised segmentation

SPARK: 基于亲和力引导的随机游走进行无监督分割的随机传播

Kunal Mahatha, Jose Dolz, Christian Desrosiers

机构 * International Laboratory on Learning Systems (ILLS)(学习系统国际实验室)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 SPARK通过随机传播和亲和力引导的随机游走,实现无监督分割的高效且稳定的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏