arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4959 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4959 篇

2411.16804 2026-04-03 cs.CV 57%

InTraGen: Trajectory-controlled Video Generation for Object Interactions

InTraGen:基于轨迹的视频生成用于物体交互

Zuhao Liu, Aleksandar Yanev, Ahmad Mahmood, Ivan Nikolov, Saman Motamed, Wei-Shi Zheng, Xi Wang, Lei Sun, Luc Van Gool, Danda Pani Paudel

机构 * ETH Zurich(苏黎世联邦理工学院) Sun Yat-sen University(中山大学) Aalborg University(奥尔堡大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出InTraGen,通过引入四个新数据集和轨迹质量度量指标,改进多物体交互场景的轨迹引导视频生成,提升视觉真实性和定量性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00382 2026-04-02 cs.CV eess.SP 57%

mmAnomaly: Leveraging Visual Context for Robust Anomaly Detection in the Non-Visual World with mmWave Radar

mmAnomaly:利用视觉上下文在非视觉世界中实现鲁棒的异常检测

Tarik Reza Toha, Shao-Jung, Lu, Mahathir Monjur, Shahriar Nirjon

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 mmAnomaly结合毫米波雷达与RGBD输入,通过语义线索和生成模型实现鲁棒的异常检测,应用于隐蔽武器、穿墙入侵和穿墙跌倒检测,达到94%的F1分数和亚米定位精度。

Comments Accepted at the 24th ACM/IEEE International Conference on Embedded Artificial Intelligence and Sensing Systems (SenSys 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00323 2026-04-02 cs.CL cs.CY 57%

Large Language Models in the Abuse Detection Pipeline

大语言模型在滥用检测流水线中的应用

Suraj Kath, Sanket Badhe, Preet Shah, Ashwin Sampathkumar, Shivani Gupta

机构 * Google LLC(谷歌有限责任公司)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CL

AI总结 本文探讨大语言模型在滥用检测生命周期中的应用,分析其在标签生成、检测、审核及审计等阶段的作用,并讨论其面临的挑战与未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00319 2026-04-02 cs.AI cs.MA 57%

Collaborative AI Agents and Critics for Fault Detection and Cause Analysis in Network Telemetry

协同AI代理与批评者用于网络遥测中的故障检测与原因分析

Syed Eqbal Alam, Zhan Shu

机构 * Department of Electrical and Computer Engineering, University of Alberta(阿尔伯塔大学电气与计算机工程系) SheQAI Research(SheQAI研究)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种多代理联邦系统,通过AI代理与批评者协作完成网络遥测中的故障检测、严重性和原因分析等多模态任务,利用多时间尺度随机逼近技术保证收敛性,通信开销低且隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15713 2026-04-01 cs.CV 57%

DiffusionVL: Translating Any Autoregressive Models into Diffusion Vision Language Models

DiffusionVL: 将任意自回归模型转化为扩散视觉语言模型

Lunbin Zeng, Jingfeng Yao, Bencheng Liao, Hongyuan Tao, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出DiffusionVL,通过高效扩散微调将预训练自回归模型转化为扩散视觉语言模型,实现高效生成和性能提升。

Comments 12 pages, 4 figures, conference or other essential info

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19114 2026-04-01 cs.CV 57%

CreatiDesign: A Unified Multi-Conditional Diffusion Transformer for Creative Graphic Design

CreatiDesign: 一种统一的多条件扩散变换器用于创意图形设计

Hui Zhang, Dexiang Hong, Maoke Yang, Yutao Cheng, Zhao Zhang, Weidong Chen, Jie Shao, Xinglong Wu, Zuxuan Wu, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Shanghai Key Laboratory of Multimodal Embodied AI(上海市多模态具身人工智能重点实验室) Bytedance Intelligent Creation(字节跳动智能创作) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学技术学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出CreatiDesign,一种统一的多条件扩散变换器,解决多条件控制问题,通过多模态注意力掩码机制和自动化数据集构建,提升图形设计生成的准确性和和谐度。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16205 2026-04-01 cs.CV eess.IV 57%

Generative AI Enables Structural Brain Network Construction from fMRI via Symmetric Diffusion Learning

生成式AI通过对称扩散学习从fMRI构建结构脑网络

Qiankun Zuo, Bangjun Lei, Wanyu Qiu, Changhong Jing, Jin Hong, Shuqiang Wang

机构 * Department of Computing, Hong Kong Polytechnic University(香港理工大学计算学系) School of Information Engineering, Nanchang University(南昌大学信息工程学院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出DiffGAN-F2S模型,通过统一框架从fMRI预测结构连接,利用对称扩散生成对抗网络和自适应学习生成高保真结构连接,测试表明其在结构连接预测上优于其他模型,并能识别重要脑区和连接,为多模态脑网络融合提供新方法。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29492 2026-04-01 cs.CL 57%

Calibrated Confidence Expression for Radiology Report Generation

放射报告生成中的校准置信度表达

David Bani-Harouni, Chantal Pellegrini, Julian Lüers, Su Hwan Kim, Markus Baalmann, Benedikt Wiestler, Rickmer Braren, Nassir Navab, Matthias Keicher

机构 * Computer Aided Medical Procedures, Technical University of Munich, Germany(德国慕尼黑工业大学计算机辅助医疗程序) Munich Center for Machine Learning (MCML), Germany(德国慕尼黑机器学习中心) Department of Diagnostic and Interventional Radiology, TUM Klinikum rechts der Isar, Germany(德国慕尼黑工业大学伊萨尔河右岸医院诊断与介入放射科) Department of Diagnostic and Interventional Neuroradiology, TUM Klinikum rechts der Isar, Germany(德国慕尼黑工业大学伊萨尔河右岸医院诊断与介入神经放射科) Department of Diagnostic and Interventional Radiology and Nuclear Medicine, University Medical Center Hamburg-Eppendorf, Germany(德国汉堡-埃彭多夫大学医学中心诊断与介入放射学及核医学科) AI for Image-Guided Diagnosis and Therapy, Technical University of Munich, Germany(德国慕尼黑工业大学人工智能图像引导诊断与治疗)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 本文提出ConRad框架,通过强化学习提升医学大视觉-语言模型的置信度校准,以生成更可靠的放射报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29239 2026-04-01 cs.CV 57%

Diffusion Mental Averages

扩散心理平均

Phonphrm Thawatdamrongkit, Sukit Seripanitkarn, Supasorn Suwajanakorn

机构 * VISTEC(泰国威斯泰克科学技术研究院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出扩散心理平均(DMA),通过在扩散模型语义空间内平均生成样本,解决传统方法在生成相同提示下的模糊问题,实现一致且逼真的概念平均。

Comments CVPR 2026. Project page: https://diffusion-mental-averages.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28068 2026-04-01 cs.CV 57%

AIBench: Evaluating Visual-Logical Consistency in Academic Illustration Generation

AIBench:评估学术示意图生成中的视觉-逻辑一致性

Zhaohe Liao, Kaixun Jiang, Zhihang Liu, Yujie Wei, Junqiu Yu, Quanhao Li, Hong-Tao Yu, Pandeng Li, Yuzheng Wang, Zhen Xing, Shiwei Zhang, Chen-Wei Xie, Yun Zheng, Xihui Liu

机构 * Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) SJTU(上海交通大学) FDU(复旦大学) USTC(中国科学技术大学) SEU(东南大学) HKU(香港大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出AIBench,首个通过VQA评估学术示意图逻辑正确性及VLM评估美观性的基准,通过四层问题验证生成示意图与论文的一致性,发现模型在该任务上的性能差异显著,且逻辑与美观难以同时优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28508 2026-03-31 cs.CV 57%

Generalizable Detection of AI Generated Images with Large Models and Fuzzy Decision Tree

基于大模型和模糊决策树的AI生成图像通用检测

Fei Wu, Guanghao Ding, Zijian Niu, Zhenrui Wang, Lei Yang, Zhuosheng Zhang, Shilin Wang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出结合轻量级特征感知检测器与大模型的模糊决策树框架,提升AI生成图像检测的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28082 2026-03-31 cs.CV cs.MA 57%

LogiStory: A Logic-Aware Framework for Multi-Image Story Visualization

LogiStory: 一个多图像故事可视化逻辑感知框架

Chutian Meng, Fan Ma, Chi Zhang, Jiaxu Miao, Yi Yang, Yueting Zhuang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出LogiStory框架,通过显式建模视觉逻辑提升多图像故事可视化中的叙事逻辑与视觉质量,引入多智能体系统和LogicTale基准测试集进行评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09094 2026-03-31 cs.CV 57%

Chain of Event-Centric Causal Thought for Physically Plausible Video Generation

基于事件中心因果推理的物理合理视频生成

Zixuan Wang, Yixin Hu, Haolan Wang, Feng Chen, Yan Liu, Wen Li, Yinjie Lei

机构 * Sichuan University(四川大学) The University of Adelaide(阿德莱德大学) Hong Kong Polytechnic University(香港理工大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出基于事件链的因果推理和跨模态提示模块,用于生成物理合理视频,通过物理公式约束和时间对齐提示提升视频生成的因果连贯性与物理合理性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26794 2026-03-31 cs.CV 57%

The Quest for Generalizable Motion Generation: Data, Model, and Evaluation

可泛化动作生成的探索:数据、模型与评估

Jing Lin, Ruisi Wang, Junzhe Lu, Ziqi Huang, Guorui Song, Ailing Zeng, Xian Liu, Chen Wei, Wanqi Yin, Qingping Sun, Zhongang Cai, Lei Yang, Ziwei Liu

机构 * Nanyang Technological University(南洋理工大学) SenseTime Research(商汤科技研究院) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) NVIDIA Research(英伟达研究院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一个综合框架,通过数据、建模和评估三大支柱将视频生成知识迁移至动作生成,引入大规模数据集和改进模型,提升动作生成的泛化能力。

Comments Homepage: https://motrixlab.github.io/2026_iclr_vimogen

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21545 2026-03-31 cs.CV cs.LG 57%

Corruption-Aware Training of Latent Video Diffusion Models for Robust Text-to-Video Generation

面向鲁棒文本到视频生成的潜变量视频扩散模型腐蚀感知训练

Chika Maduabuchi, Hao Chen, Yujin Han, Jindong Wang

机构 * William & Mary(威廉与玛丽学院) Carnegie Mellon University(卡内基梅隆大学) The University of Hong Kong(香港大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出CAT-LVDM框架,通过结构化噪声注入提升视频扩散模型的鲁棒性,实验显示其在多个数据集上优于传统方法,且能扩展至自回归生成和多模态视频理解模型。

Comments ICLR 2026 ReALM-GEN

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26378 2026-03-30 cs.LG cs.AI 57%

Generative Modeling in Protein Design: Neural Representations, Conditional Generation, and Evaluation Standards

蛋白质设计中的生成建模:神经表示、条件生成与评估标准

Senura Hansaja Wanasekara, Minh-Duong Nguyen, Xiaochen Liu, Nguyen H. Tran, Ken-Tye Yong

机构 * The University of Sydney(悉尼大学) VinUniversity

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文系统综述了蛋白质研究中的生成AI,涵盖序列、几何和多模态表示,生成架构如SE(3)等价扩散、流匹配和混合预测生成系统,以及从结构预测到蛋白质-配体相互作用的任务设置,并提出评估最佳实践和开放挑战。

Comments 20 pages, 7 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26128 2026-03-30 cs.CV 57%

TaxaAdapter: Vision Taxonomy Models are Key to Fine-grained Image Generation over the Tree of Life

TaxaAdapter:视觉分类模型是生命树上细粒度图像生成的关键

Mridul Khurana, Amin Karimi Monsefi, Justin Lee, Medha Sawhney, David Carlyn, Julia Chae, Jianyang Gu, Rajiv Ramnath, Sara Beery, Wei-Lun Chao, Anuj Karpatne, Cheng Zhang

机构 * Virginia Tech(弗吉尼亚理工大学) The Ohio State University(俄亥俄州立大学) MIT(麻省理工学院) Boston University(波士顿大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出TaxaAdapter,通过整合视觉分类模型提升细粒度物种生成的精度与一致性,实验表明其在形态学和物种识别准确性上优于现有方法,且具备良好的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25711 2026-03-27 cs.CV 57%

Seeing to Ground: Visual Attention for Hallucination-Resilient MDLLMs

视觉注意:用于抗幻觉的MDLLMs

Vishal Narnaware, Animesh Gupta, Kevin Zhai, Zhenyi Wang, Mubarak Shah

机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出VISAGE框架,通过校准解码器目标来减少多模态幻觉,通过空间熵分析提升视觉基础性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25462 2026-03-27 cs.RO cs.AI 57%

Temporally Decoupled Diffusion Planning for Autonomous Driving

时间解耦的扩散规划用于自动驾驶

Xiang Li, Bikun Wang, John Zhang, Jianjun Wang

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出时间解耦扩散模型(TDDM),通过噪声掩码方法解决动态城市环境中即时安全与长期目标的平衡问题,改进轨迹生成并提升复杂场景下的规划性能。

Comments icaps

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25118 2026-03-27 cs.CV 57%

AnyDoc: Enhancing Document Generation via Large-Scale HTML/CSS Data Synthesis and Height-Aware Reinforcement Optimization

AnyDoc:通过大规模HTML/CSS数据合成和高度感知强化优化提升文档生成

Jiawei Lin, Wanrong Zhu, Vlad I Morariu, Christopher Tensmeyer

机构 * Xi’an Jiaotong University(西安交通大学) Adobe Research(Adobe研究院)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 AnyDoc通过大规模HTML/CSS数据合成和高度感知强化优化,实现多文档生成任务,包含265206个样本,覆盖111类和32种风格,提升文档生成性能。

Comments CVPR 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12200 2026-03-27 cs.CV 57%

CompBench: Benchmarking Complex Instruction-guided Image Editing

CompBench:复杂指令引导图像编辑的基准测试

Bohan Jia, Wenxuan Huang, Yuntian Tang, Junbo Qiao, Jincheng Liao, Shaosheng Cao, Fei Zhao, Zhaopeng Feng, Zhouhong Gu, Zhenfei Yin, Lei Bai, Wanli Ouyang, Lin Chen, Fei Zhao, Yao Hu, Zihan Wang, Yuan Xie, Shaohui Lin

机构 * East China Normal University(华东师范大学) Xiaohongshu Inc.(小红书) KLATASDS, MOE, China(中国教育部统计与数据科学重点实验室) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Fudan University(复旦大学) University of Oxford(牛津大学) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学)

专题命中 多模态生成 :MLLM(abstract);分类 cs.CV

AI总结 CompBench旨在解决现有图像编辑基准测试对任务复杂度简化的问题,通过引入复杂指令引导的图像编辑基准,评估模型在精细操控能力上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24938 2026-03-27 cs.CV 57%

Infinite Gaze Generation for Videos with Autoregressive Diffusion

视频无限 gaze 生成的自回归扩散模型

Jenna Kang, Colin Groth, Tong Wu, Finley Torrens, Patsorn Sangkloy, Gordon Wetzstein, Qi Sun

机构 * New York University(纽约大学) Stanford University(斯坦福大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种自回归扩散模型,用于生成任意长度视频的无限 horizon 原始 gaze,通过在 saliency-aware 视觉潜在空间中条件化,提升长程时空准确性和轨迹真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20012 2026-03-26 cs.CV 57%

Diffusion-Based Makeup Transfer with Facial Region-Aware Makeup Features

基于扩散模型的化妆转移与面部区域感知化妆特征

Zheng Gao, Debin Meng, Yunqi Miao, Zhensong Zhang, Songcen Xu, Ioannis Patras, Jifei Song

机构 * Queen Mary University of London(伦敦女王学院) Huawei London Research Center(华为伦敦研发中心)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

AI总结 本文提出FRAM方法,通过微调化妆CLIP和区域感知化妆注入,提升扩散模型在面部区域特定化妆转移中的可控性与效果。

Comments Accepted by CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23500 2026-03-25 cs.CV 57%

UniGRPO: Unified Policy Optimization for Reasoning-Driven Visual Generation

UniGRPO:用于推理驱动视觉生成的统一策略优化

Jie Liu, Zilyu Ye, Linxiao Yuan, Shenhan Zhu, Yu Gao, Jie Wu, Kunchang Li, Xionghui Wang, Xiaonan Nie, Weilin Huang, Wanli Ouyang

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出UniGRPO框架,通过统一强化学习方法优化文本和图像生成策略,解决多轮交错生成问题,提升生成质量与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16740 2026-03-25 cs.CV 57%

Task-Oriented Data Synthesis and Control-Rectify Sampling for Remote Sensing Semantic Segmentation

面向任务的数据合成与控制-校正采样用于遥感语义分割

Yunkai Yang, Yudong Zhang, Kunquan Zhang, Jinxiao Zhang, Xinying Chen, Haohuan Fu, Runmin Dong

机构 * Sun Yat-Sen University(中山大学) Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出TODSynth框架,结合多模态扩散变换器和任务反馈驱动的采样策略,提升遥感语义分割数据合成效果,尤其在少样本和复杂场景中表现优异。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20644 2026-03-25 cs.CV 57%

ScaleEdit-12M: Scaling Open-Source Image Editing Data Generation via Multi-Agent Framework

ScaleEdit-12M:通过多智能体框架实现开源图像编辑数据生成的规模化

Guanzhou Chen, Erfei Cui, Changyao Tian, Danni Yang, Ganlin Yang, Yu Qiao, Hongsheng Li, Gen Luo, Hongjie Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) CUHK MMLab(香港中文大学多模态实验室) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Xiamen University(厦门大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出ScaleEditor框架,通过多智能体方法构建大规模高质量图像编辑数据集,生成ScaleEdit-12M,涵盖23类任务,提升多种编辑模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20996 2026-03-25 cs.CV 57%

From Inpainting to Layer Decomposition: Repurposing Generative Inpainting Models for Image Layer Decomposition

从修复到层分解:重新利用生成修复模型进行图像层分解

Jingxi Chen, Yixiao Zhang, Xiaoye Qian, Zongxia Li, Cornelia Fermuller, Caren Chen, Yiannis Aloimonos

机构 * University of Maryland(马里兰大学) Amazon(亚马逊)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出利用生成修复模型进行图像层分解,通过轻量级微调和多模态上下文融合模块,实现更精确的物体移除和遮挡恢复,提升下游编辑和创意应用的可能性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14315 2026-03-25 cs.GR cs.CV 57%

ImmerseGen: Agent-Guided Immersive World Generation with Alpha-Textured Proxies

ImmerseGen:基于代理的沉浸式世界生成与Alpha纹理代理

Jinyan Yuan, Bangbang Yang, Keke Wang, Panwang Pan, Lin Ma, Xuehai Zhang, Xiao Liu, Zhaopeng Cui, Yuewen Ma

机构 * Bytedance(字节跳动) Zhejiang University(浙江大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 ImmerseGen通过轻量级几何代理和合成RGBA纹理实现高效沉浸式VR场景生成,结合地形条件纹理和上下文感知纹理生成多样且视觉一致的世界,提升真实感和渲染效率。

Comments Accepted by IEEE VR 2026 and TVCG Special Issue. Project webpage: https://immersegen.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22027 2026-03-24 cs.CV 57%

Tuning Real-World Image Restoration at Inference: A Test-Time Scaling Paradigm for Flow Matching Models

在推理过程中调整现实世界图像恢复:一种适用于流匹配模型的测试时间缩放范式

Purui Bai, Junxian Duan, Pin Wang, Jinhua Hao, Ming Sun, Chao Zhou, Huaibo Huang

机构 * MAIS \& NLPR, Institute of Automation, Chinese Academy of Sciences, China Kuaishou Tech, China

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出ResFlow-Tuner框架,基于FLUX.1-dev模型,结合多模态融合与测试时间缩放,实现高质量图像恢复。通过奖励模型动态调整去噪方向,提升性能并控制计算开销,实验表明其在多个基准上达到最优。

Comments 27 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19575 2026-03-24 cs.CV 57%

MagicSeg: Open-World Segmentation Pretraining via Counterfactural Diffusion-Based Auto-Generation

MagicSeg: 通过反事实扩散模型自动生成实现开放世界分割预训练

Kaixin Cai, Pengzhen Ren, Jianhua Han, Yi Zhu, Hang Xu, Jianzhuang Liu, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) PengCheng Laboratory(鹏城实验室) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

AI总结 MagicSeg通过反事实扩散模型自动生成数据集,提升开放世界语义分割性能,实验在PASCAL VOC等数据集上取得SOTA结果。

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence 2026

详情

展开后加载摘要…

URL PDF HTML 收藏