arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4959 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4959 篇

2511.07260 2026-01-21 cs.AI cs.LG 57%

PADiff: Predictive and Adaptive Diffusion Policies for Ad Hoc Teamwork

PADiff: 预测性与自适应扩散策略用于即兴团队合作

Hohei Chan, Xinzhi Zhang, Antao Xiang, Weinan Zhang, Mengchen Zhao

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 PADiff通过整合队友预测信息,提升在非平稳即兴团队合作场景中的预测与适应能力,实现多模态协作模式的多样化。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16869 2026-01-21 cs.GR cs.CV 57%

Controllable Video Generation: A Survey

可控视频生成:综述

Yue Ma, Kunyu Feng, Zhongyuan Hu, Xinyu Wang, Yucheng Wang, Mingzhe Zheng, Bingyuan Wang, Qinghe Wang, Xuanhua He, Hongfa Wang, Chenyang Zhu, Hongyu Liu, Yingqing He, Zeyu Wang, Zhifeng Li, Xiu Li, Sirui Han, Yike Guo, Wei Liu, Dan Xu, Linfeng Zhang, Qifeng Chen

机构 * Hong Kong University of Science and Technology(香港科技大学) Hong Kong University of Science and Technology(Guang Zhou)(香港科技大学(广州)) Tsinghua University(清华大学) Dalian University of Technology(大连理工大学) Tencent(腾讯)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文综述了可控视频生成领域,探讨了视频扩散模型中的控制机制及不同控制信号类型的方法分类。

Comments project page: https://github.com/mayuelala/Awesome-Controllable-Video-Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11522 2026-01-19 cs.CV 57%

UniX: Unifying Autoregression and Diffusion for Chest X-Ray Understanding and Generation

UniX: 统一自回归与扩散以实现胸部X光理解与生成

Ruiheng Zhang, Jingfeng Yao, Huangxuan Zhao, Hao Yan, Xiao He, Lei Chen, Zhou Wei, Yong Luo, Zengmao Wang, Lefei Zhang, Dacheng Tao, Bo Du

机构 * Wuhan University(武汉大学) Huazhong University of Science and Technology(华中科技大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 UniX通过统一自回归与扩散模型,实现了胸部X光的高效理解和生成,显著提升了性能并减少了参数使用。

Comments Codes and models are available at https://github.com/ZrH42/UniX

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11194 2026-01-19 cs.CV 57%

ATATA: One Algorithm to Align Them All

ATATA:一切对齐的统一算法

Boyi Pang, Savva Ignatyev, Vladimir Ippolitov, Ramil Khafizov, Yurii Melnik, Oleg Voynov, Maksim Nakhodnov, Aibek Alanov, Xiaopeng Fan, Peter Wonka, Evgeny Burnaev

机构 * Harbin Institute of Technology(哈尔滨工业大学) Applied AI Institute(应用人工智能研究所) AXXX FusionBrain Lab(融合大脑实验室) MSU(莫斯科州立大学) Constructor University(建设大学) HSE University(高等经济大学) Peng Cheng Laboratory(鹏城实验室) HIT Suzhou Research Institute(哈尔滨工业大学苏州研究 institute) KAUST(科威特大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 ATATA提出一种基于Rectified Flow模型的多模态算法,实现高效结构对齐的样本生成,提升图像、视频和3D生成的质量与速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10781 2026-01-19 cs.CV 57%

Future Optical Flow Prediction Improves Robot Control & Video Generation

未来光流预测改进机器人控制与视频生成

Kanchana Ranasinghe, Honglu Zhou, Yu Fang, Luyu Yang, Le Xue, Ran Xu, Caiming Xiong, Silvio Savarese, Michael S Ryoo, Juan Carlos Niebles

机构 * Salesforce AI Research(Salesforce AI研究院) Stony Brook University(石溪大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 FOFPred通过统一的视觉-语言模型和扩散架构,实现高效的未来光流预测,提升机器人控制与视频生成的性能。

Comments Project Site (Code, Models, Demo): https://fofpred.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02358 2026-01-19 cs.CV 57%

VINO: A Unified Visual Generator with Interleaved OmniModal Context

VINO:一个具有交错多模态上下文的统一视觉生成器

Junyi Chen, Tong He, Zhoujie Fu, Pengfei Wan, Kun Gai, Weicai Ye

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 VINO通过统一的视觉生成框架实现图像和视频的生成与编辑,利用交错多模态上下文条件处理,提升多任务视觉创作能力。

Comments Project page: https://sotamak1r.github.io/VINO-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14981 2026-01-16 cs.CV 57%

SPATIALGEN: Layout-guided 3D Indoor Scene Generation

SPATIALGEN: 布局引导的3D室内场景生成

Chuan Fang, Heng Li, Yixun Liang, Jia Zheng, Yongsen Mao, Yuan Liu, Rui Tang, Zihan Zhou, Ping Tan

机构 * Hong Kong University of Science and Technology(香港科技大学) Manycore Tech Inc(Manycore科技公司)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 SPATIALGEN通过布局引导的多视角多模态扩散模型生成高质量3D室内场景,解决现有方法在视觉质量、多样性及语义一致性方面的不足。

Comments 3D scene generation; diffusion model; Scene reconstruction and understanding

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22974 2026-01-16 cs.CV 57%

RealCamo: Boosting Real Camouflage Synthesis with Layout Controls and Textual-Visual Guidance

RealCamo: 通过布局控制和文本-视觉引导提升真实伪装合成

Chunyuan Chen, Yunuo Cai, Shujuan Li, Weiyun Liang, Bin Wang, Jing Xu

机构 * College of Artificial Intelligence, Nankai University, Tianjin, China(人工智能学院,南开大学,天津,中国) School of Data Science, Fudan University, Shanghai, China(数据科学学院,复旦大学,上海,中国)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 RealCamo通过布局控制和文本-视觉引导提升真实伪装合成,解决现有方法在伪装效果和背景一致性上的不足。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09255 2026-01-15 cs.CV 57%

PhyRPR: Training-Free Physics-Constrained Video Generation

PhyRPR: 无训练物理约束视频生成

Yibo Zhao, Hengjia Li, Xiaofei He, Boxi Wu

机构 * State Key Lab of CAD\&CG, Zhejiang University(CAD与CG国家重点实验室,浙江大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 PhyRPR提出一种无训练的三阶段视频生成方法,通过解耦物理理解和视觉合成,提升生成视频的物理合理性和运动可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08388 2026-01-14 cs.AI 57%

Creativity in AI as Emergence from Domain-Limited Generative Models

人工智能中的创造力作为领域受限生成模型的涌现

Corina Chutaux

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出从生成模型角度研究人工智能创造力,将其视为领域受限模型在受限制信息环境中的涌现属性,通过分解四个组成部分探讨创造力的生成机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08095 2026-01-14 cs.CV 57%

From Prompts to Deployment: Auto-Curated Domain-Specific Dataset Generation via Diffusion Models

从提示到部署:通过扩散模型实现自动定制的领域特定数据集生成

Dongsik Yoon, Jongeun Kim

机构 * HDC LABS(HDC实验室)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出通过扩散模型生成领域特定合成数据集的方法,解决预训练模型与现实部署间的分布偏移问题,通过三阶段框架高效构建高质量可部署数据集。

Comments To appear in the Workshop on Synthetic & Adversarial ForEnsics (SAFE), WACV 2026 (oral presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07221 2026-01-13 cs.CV 57%

Language-Grounded Multi-Domain Image Translation via Semantic Difference Guidance

基于语义差异指导的多领域图像翻译

Jongwon Ryu, Joonhyung Park, Jaeho Han, Yeong-Seok Kim, Hye-rin Kim, Sunjae Yoon, Junyeong Kim

机构 * Department of Artificial Intelligence, Chung-Ang University(人工智能系, Chung-Ang 大学) Hyundai Mobis Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 LACE通过语义差异指导实现多领域图像翻译,结合全局语义与局部结构特征融合及多领域控制机制,提升视觉翻译的保真度和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07219 2026-01-13 cs.CV 57%

VENUS: Visual Editing with Noise Inversion Using Scene Graphs

VENUS: 使用场景图进行视觉编辑的噪声反演

Thanh-Nhan Vo, Trong-Thuan Nguyen, Tam V. Nguyen, Minh-Triet Tran

机构 * University of Science, VNU-HCM(越南胡志明市科学大学) Vietnam National University(越南国家大学) University of Dayton(戴维森大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 VENUS是一种无需训练的场景图引导图像编辑框架,通过噪声反演和拆分提示策略提升图像编辑的保真度和语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06965 2026-01-13 cs.CV 57%

Unified Personalized Understanding, Generating and Editing

统一的个性化理解、生成与编辑

Yu Zhong, Tianwei Lin, Ruike Zhu, Yuqian Yuan, Haoyu Zheng, Liang Liang, Wenqiao Zhang, Feifei Shao, Haoyuan Li, Wanggui He, Hao Jiang, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 OmniPersona是首个统一LMMs的端到端个性化框架,通过结构解耦的概念标记和显式知识重播机制,实现个性化理解、生成和图像编辑的一致可控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06605 2026-01-13 cs.CV 57%

Sissi: Zero-shot Style-guided Image Synthesis via Semantic-style Integration

Sissi:通过语义-风格整合实现零样本风格引导图像合成

Yingying Deng, Xiangyu He, Fan Tang, Weiming Dong, Xucheng Yin

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 Sissi通过语义-风格整合实现零样本风格引导图像合成,采用上下文学习框架提升风格化效果与语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05546 2026-01-12 cs.CV 57%

MoGen: A Unified Collaborative Framework for Controllable Multi-Object Image Generation

MoGen:一种用于可控多对象图像生成的统一协作框架

Yanfeng Li, Yue Sun, Keren Fu, Sio-Kei Im, Xiaoming Liu, Guangtao Zhai, Xiaohong Liu, Tao Tan

机构 * Faculty of Applied Sciences, Macao Polytechnic University(澳门理工学院) College of Computer Science, Sichuan University(四川大学计算机学院) Department of Computer Science and Engineering, Michigan State University(密歇根州立大学计算机科学与工程系) School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学信息科学与电子工程学院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 MoGen通过区域语义锚和自适应多模态引导模块,实现了对多对象图像生成的可控性和灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14367 2026-01-12 cs.CV 57%

Hallucination Score: Towards Mitigating Hallucinations in Generative Image Super-Resolution

幻觉分数:朝着减轻生成图像超分辨率中的幻觉

Weiming Ren, Raghav Goyal, Zhiming Hu, Tristan Ty Aumentado-Armstrong, Iqbal Mohomed, Alex Levinshtein

机构 * University of Waterloo(多伦多大学) AI Center – Toronto, Samsung Electronics(三星电子人工智能中心)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出幻觉分数以衡量和减轻生成图像超分辨率中的幻觉问题,通过多模态大语言模型生成 HS 并用于模型微调。

Comments 31 pages, 21 figures, and 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05397 2026-01-12 cs.CV 57%

Neural-Driven Image Editing

神经驱动的图像编辑

Pengfei Zhou, Jie Xia, Xiaopeng Peng, Wangbo Zhao, Zilong Ye, Zekai Li, Suorong Yang, Jiadong Pan, Yuanxiang Chen, Ziqiao Wang, Kai Wang, Qian Zheng, Hao Jin, Xiaojun Chang, Gang Pan, Shurong Dong, Kaipeng Zhang, Yang You

机构 * NUS(国立新加坡大学) ZJU(浙江大学) RIT(罗切斯特理工学院) NJU(南京大学) USTC(中国科学技术大学) Shanghai AI Lab(上海人工智能实验室) SII(上海信息所) Hangzhou RongNao Tech(杭州融纳科技)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 LoongX通过多模态神经信号驱动图像编辑,结合扩散模型和对比学习实现高性能图像编辑任务。

Comments 22 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04359 2026-01-09 cs.CV 57%

PackCache: A Training-Free Acceleration Method for Unified Autoregressive Video Generation via Compact KV-Cache

PackCache: 一种无需训练的统一自回归视频生成加速方法通过紧凑的KV缓存

Kunyang Li, Mubarak Shah, Yuzhang Shang

机构 * Institute of Artificial Intelligence, University of Central Florida(人工智能学院,中央佛罗里达大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 PackCache通过动态压缩KV缓存提升统一自回归视频生成效率,显著加速长序列生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02356 2026-01-09 cs.CV 57%

Talk2Move: Reinforcement Learning for Text-Instructed Object-Level Geometric Transformation in Scenes

Talk2Move: 基于强化学习的文本指令下场景中物体级几何变换

Jing Tan, Zhaoyang Zhang, Yantao Shen, Jiarui Cai, Shuo Yang, Jiajun Wu, Wei Xia, Zhuowen Tu, Stefano Soatto

机构 * AWS Agentic AI(AWS智能AI) Amazon Web Services(亚马逊网络服务) Amazon Robotics(亚马逊机器人技术) CUHK(香港中文大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 Talk2Move通过强化学习实现文本指令下的场景中物体级几何变换,利用组相对策略优化和空间奖励引导模型,提升学习效率并实现精确且一致的物体变换。

Comments Project page: https://sparkstj.github.io/talk2move

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03993 2026-01-08 cs.CV 57%

PosterVerse: A Full-Workflow Framework for Commercial-Grade Poster Generation with HTML-Based Scalable Typography

PosterVerse: 一个用于商业级海报生成的全流程框架,基于HTML的可扩展字体

Junle Liu, Peirong Zhang, Yuyi Zhang, Pengyu Yan, Hui Zhou, Xinyue Zhou, Fengjun Guo, Lianwen Jin

专题命中 多模态生成 :MLLM(abstract);分类 cs.CV

AI总结 PosterVerse通过全流程框架和HTML驱动技术,实现商业级海报的高密度文本渲染与灵活设计。

Journal ref AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03482 2026-01-08 cs.AI cs.LG stat.AP 57%

Personalization of Large Foundation Models for Health Interventions

为健康干预个性化设计大型基础模型

Stefan Konigorski, Johannes E. Vedder, Babajide Alamu Owoyele, İbrahim Özkan

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出混合框架,结合LFMs和N-of-1试验,以实现个性化医疗中的因果推断与责任AI整合。

Comments Accepted to the AAAI 2026 Workshop on Personalization in the Era of Large Foundation Models (PerFM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15002 2026-01-07 cs.CV 57%

How Many Images Does It Take? Estimating Imitation Thresholds in Text-to-Image Models

需要多少张图片?文本到图像模型中模仿阈值的估计

Sahil Verma, Royi Rassin, Arnav Das, Gantavya Bhatt, Preethi Seshadri, Chirag Shah, Jeff Bilmes, Hannaneh Hajishirzi, Yanai Elazar

机构 * University of Washington, Seattle(华盛顿大学) Bar-Ilan University(巴伊兰大学) University of California, Irvine(加州大学伊文斯顿分校) Allen Institute of AI(人工智能研究院)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

AI总结 研究通过评估文本到图像模型的模仿阈值,探讨其在版权和隐私合规中的应用。

Comments Accepted at TMLR 2025, ATTRIB, RegML, and SafeGenAI workshops at NeurIPS 2024 and NLLP Workshop 2024. https://openreview.net/forum?id=x0qJo7SPhs

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01915 2026-01-06 cs.CV 57%

TalkPhoto: A Versatile Training-Free Conversational Assistant for Intelligent Image Editing

TalkPhoto: 一种多功能的无需训练的对话式智能图像编辑助手

Yujie Hu, Zecheng Tang, Xu Jiang, Weiqi Li, Jian Zhang

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 TalkPhoto通过对话交互实现无需训练的多功能图像编辑,利用提示模板分层调用现有高级编辑方法,提升编辑精度与质量。

Comments a Conversational Assistant for Intelligent Image Editing

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17984 2026-01-06 cs.CV 57%

RS-vHeat: Heat Conduction Guided Efficient Remote Sensing Foundation Model

RS-vHeat:基于热传导的高效远程传感基础模型

Huiyang Hu, Peijin Wang, Hanbo Bi, Boyuan Tong, Zhaozhi Wang, Wenhui Diao, Hao Chang, Yingchao Feng, Ziqi Zhang, Yaowei Wang, Qixiang Ye, Kun Fu, Xian Sun

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 RS-vHeat通过热传导运算符和自监督策略,实现高效多模态遥感基础模型,提升效率和性能。

Comments 19 pages, 8 figures and 10 tables

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01507 2026-01-06 cs.CV 57%

DiffKD-DCIS: Predicting Upgrade of Ductal Carcinoma In Situ with Diffusion Augmentation and Knowledge Distillation

DiffKD-DCIS:基于扩散增强与知识蒸馏的导管癌原位癌升级预测

Tao Li, Qing Li, Na Li, Hui Xie

机构 * School of Medical Imaging, Laboratory Medicine and Rehabilitation, Xiangnan University(医学影像学院、实验室医学与康复学院,湘南大学) Department of Radiotherapy, Affiliated Hospital (Clinical College) of Xiangnan University(放疗科,湘南大学附属医院(临床学院)) Faculty of Applied Sciences, Macao Polytechnic University(应用科学学院,澳门 polytechnic 大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 DiffKD-DCIS通过扩散增强与知识蒸馏方法,实现对导管癌原位癌升级的准确预测,提升诊断效率与临床价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01181 2026-01-06 cs.CV 57%

GenCAMO: Scene-Graph Contextual Decoupling for Environment-aware and Mask-free Camouflage Image-Dense Annotation Generation

GenCAMO: 基于场景图的环境感知与无掩码伪装图像密集标注生成

Chenglizhao Chen, Shaojiang Yuan, Xiaoxue Lu, Mengke Song, Jia Song, Zhenyu Wu, Wenfeng Song, Shuai Li

机构 * China University of Petroleum (East China)(中国石油大学(华东)) Southwest Jiaotong University(西南交通大学) Beijing Information Science and Technology University(北京信息科技大学) Beihang University(北航)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 GenCAMO通过生成模型合成高质量伪装数据,提升复杂伪装场景的密集预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14681 2026-01-06 eess.IV cs.CV 57%

Virtual Multiplex Staining for Histological Images using a Marker-wise Conditioned Diffusion Model

使用标记条件扩散模型进行虚拟多标记染色

Hyun-Jic Oh, Junsik Kim, Zhiyi Shi, Yichen Wu, Yu-An Chen, Peter K Sorger, Hanspeter Pfister, Won-Ki Jeong

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种基于条件扩散模型的虚拟多标记染色方法,利用预训练模型生成多标记图像,提升了H&E图像的分子层面分析能力。

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02043 2026-01-06 cs.CV 57%

Conditional Diffusion Model with Anatomical-Dose Dual Constraints for End-to-End Multi-Tumor Dose Prediction

具有解剖剂量双约束的条件扩散模型用于端到端多肿瘤剂量预测

Hui Xie, Haiqin Hu, Lijuan Ding, Qing Li, Yue Sun, Tao Tan

机构 * Faculty of Applied Sciences, Macao Polytechnic University(澳门理工大学应用科学学院) Affiliated Hospital of Xiangnan University(湘南大学附属医院) Jiangxi Cancer Hospital(江西省肿瘤医院) Chenzhou Third People's Hospital(郴州第三人民医院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 ADDiff-Dose通过条件扩散模型实现多肿瘤剂量预测,结合解剖和剂量约束,提升预测精度与临床适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17168 2026-01-05 cs.GR cs.CV 57%

StyGazeTalk: Learning Stylized Generation of Gaze and Head Dynamics

StyGazeTalk: 学习风格化的 gaze 和 head 动态生成

Chengwei Shi, Chong Cao

机构 * Beihang University(北京航空航天大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 StyGazeTalk 通过多模态框架生成风格化的 gaze 和 head 动态,提升 3D 面部生成的现实感。

Comments arXiv submission

详情

展开后加载摘要…

URL PDF HTML 收藏