PADiff: Predictive and Adaptive Diffusion Policies for Ad Hoc Teamwork
PADiff: 预测性与自适应扩散策略用于即兴团队合作
专题命中 多模态生成 :multimodal(abstract);分类 cs.AI
AI总结 PADiff通过整合队友预测信息,提升在非平稳即兴团队合作场景中的预测与适应能力,实现多模态协作模式的多样化。
Comments Accepted by AAAI 2026
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
PADiff: 预测性与自适应扩散策略用于即兴团队合作
专题命中 多模态生成 :multimodal(abstract);分类 cs.AI
AI总结 PADiff通过整合队友预测信息,提升在非平稳即兴团队合作场景中的预测与适应能力,实现多模态协作模式的多样化。
Comments Accepted by AAAI 2026
可控视频生成:综述
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Hong Kong University of Science and Technology(Guang Zhou)(香港科技大学(广州)) ; Tsinghua University(清华大学) ; Dalian University of Technology(大连理工大学) ; Tencent(腾讯)
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV
AI总结 本文综述了可控视频生成领域,探讨了视频扩散模型中的控制机制及不同控制信号类型的方法分类。
Comments project page: https://github.com/mayuelala/Awesome-Controllable-Video-Generation
UniX: 统一自回归与扩散以实现胸部X光理解与生成
机构 * Wuhan University(武汉大学) ; Huazhong University of Science and Technology(华中科技大学) ; Nanyang Technological University(南洋理工大学)
专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV
AI总结 UniX通过统一自回归与扩散模型,实现了胸部X光的高效理解和生成,显著提升了性能并减少了参数使用。
Comments Codes and models are available at https://github.com/ZrH42/UniX
ATATA:一切对齐的统一算法
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Applied AI Institute(应用人工智能研究所) ; AXXX ; FusionBrain Lab(融合大脑实验室) ; MSU(莫斯科州立大学) ; Constructor University(建设大学) ; HSE University(高等经济大学) ; Peng Cheng Laboratory(鹏城实验室) ; HIT Suzhou Research Institute(哈尔滨工业大学苏州研究 institute) ; KAUST(科威特大学)
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV
AI总结 ATATA提出一种基于Rectified Flow模型的多模态算法,实现高效结构对齐的样本生成,提升图像、视频和3D生成的质量与速度。
未来光流预测改进机器人控制与视频生成
机构 * Salesforce AI Research(Salesforce AI研究院) ; Stony Brook University(石溪大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 FOFPred通过统一的视觉-语言模型和扩散架构,实现高效的未来光流预测,提升机器人控制与视频生成的性能。
Comments Project Site (Code, Models, Demo): https://fofpred.github.io
VINO:一个具有交错多模态上下文的统一视觉生成器
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 VINO通过统一的视觉生成框架实现图像和视频的生成与编辑,利用交错多模态上下文条件处理,提升多任务视觉创作能力。
Comments Project page: https://sotamak1r.github.io/VINO-web/
SPATIALGEN: 布局引导的3D室内场景生成
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Manycore Tech Inc(Manycore科技公司)
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV
AI总结 SPATIALGEN通过布局引导的多视角多模态扩散模型生成高质量3D室内场景,解决现有方法在视觉质量、多样性及语义一致性方面的不足。
Comments 3D scene generation; diffusion model; Scene reconstruction and understanding
RealCamo: 通过布局控制和文本-视觉引导提升真实伪装合成
机构 * College of Artificial Intelligence, Nankai University, Tianjin, China(人工智能学院,南开大学,天津,中国) ; School of Data Science, Fudan University, Shanghai, China(数据科学学院,复旦大学,上海,中国)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 RealCamo通过布局控制和文本-视觉引导提升真实伪装合成,解决现有方法在伪装效果和背景一致性上的不足。
Comments 25 pages
PhyRPR: 无训练物理约束视频生成
机构 * State Key Lab of CAD\&CG, Zhejiang University(CAD与CG国家重点实验室,浙江大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 PhyRPR提出一种无训练的三阶段视频生成方法,通过解耦物理理解和视觉合成,提升生成视频的物理合理性和运动可控性。
人工智能中的创造力作为领域受限生成模型的涌现
专题命中 多模态生成 :multimodal(abstract);分类 cs.AI
AI总结 本文提出从生成模型角度研究人工智能创造力,将其视为领域受限模型在受限制信息环境中的涌现属性,通过分解四个组成部分探讨创造力的生成机制。
从提示到部署:通过扩散模型实现自动定制的领域特定数据集生成
机构 * HDC LABS(HDC实验室)
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV
AI总结 本文提出通过扩散模型生成领域特定合成数据集的方法,解决预训练模型与现实部署间的分布偏移问题,通过三阶段框架高效构建高质量可部署数据集。
Comments To appear in the Workshop on Synthetic & Adversarial ForEnsics (SAFE), WACV 2026 (oral presentation)
基于语义差异指导的多领域图像翻译
机构 * Department of Artificial Intelligence, Chung-Ang University(人工智能系, Chung-Ang 大学) ; Hyundai Mobis ; Korea Advanced Institute of Science and Technology(韩国科学技术院)
专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV
AI总结 LACE通过语义差异指导实现多领域图像翻译,结合全局语义与局部结构特征融合及多领域控制机制,提升视觉翻译的保真度和可控性。
VENUS: 使用场景图进行视觉编辑的噪声反演
机构 * University of Science, VNU-HCM(越南胡志明市科学大学) ; Vietnam National University(越南国家大学) ; University of Dayton(戴维森大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 VENUS是一种无需训练的场景图引导图像编辑框架,通过噪声反演和拆分提示策略提升图像编辑的保真度和语义一致性。
统一的个性化理解、生成与编辑
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 OmniPersona是首个统一LMMs的端到端个性化框架,通过结构解耦的概念标记和显式知识重播机制,实现个性化理解、生成和图像编辑的一致可控。
Sissi:通过语义-风格整合实现零样本风格引导图像合成
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 Sissi通过语义-风格整合实现零样本风格引导图像合成,采用上下文学习框架提升风格化效果与语义一致性。
MoGen:一种用于可控多对象图像生成的统一协作框架
机构 * Faculty of Applied Sciences, Macao Polytechnic University(澳门理工学院) ; College of Computer Science, Sichuan University(四川大学计算机学院) ; Department of Computer Science and Engineering, Michigan State University(密歇根州立大学计算机科学与工程系) ; School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学信息科学与电子工程学院) ; School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV
AI总结 MoGen通过区域语义锚和自适应多模态引导模块,实现了对多对象图像生成的可控性和灵活性。
幻觉分数:朝着减轻生成图像超分辨率中的幻觉
机构 * University of Waterloo(多伦多大学) ; AI Center – Toronto, Samsung Electronics(三星电子人工智能中心)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 本文提出幻觉分数以衡量和减轻生成图像超分辨率中的幻觉问题,通过多模态大语言模型生成 HS 并用于模型微调。
Comments 31 pages, 21 figures, and 10 tables
神经驱动的图像编辑
机构 * NUS(国立新加坡大学) ; ZJU(浙江大学) ; RIT(罗切斯特理工学院) ; NJU(南京大学) ; USTC(中国科学技术大学) ; Shanghai AI Lab(上海人工智能实验室) ; SII(上海信息所) ; Hangzhou RongNao Tech(杭州融纳科技)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 LoongX通过多模态神经信号驱动图像编辑,结合扩散模型和对比学习实现高性能图像编辑任务。
Comments 22 pages, 14 figures
PackCache: 一种无需训练的统一自回归视频生成加速方法通过紧凑的KV缓存
机构 * Institute of Artificial Intelligence, University of Central Florida(人工智能学院,中央佛罗里达大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 PackCache通过动态压缩KV缓存提升统一自回归视频生成效率,显著加速长序列生成。
Talk2Move: 基于强化学习的文本指令下场景中物体级几何变换
机构 * AWS Agentic AI(AWS智能AI) ; Amazon Web Services(亚马逊网络服务) ; Amazon Robotics(亚马逊机器人技术) ; CUHK(香港中文大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 Talk2Move通过强化学习实现文本指令下的场景中物体级几何变换,利用组相对策略优化和空间奖励引导模型,提升学习效率并实现精确且一致的物体变换。
Comments Project page: https://sparkstj.github.io/talk2move
PosterVerse: 一个用于商业级海报生成的全流程框架,基于HTML的可扩展字体
专题命中 多模态生成 :MLLM(abstract);分类 cs.CV
AI总结 PosterVerse通过全流程框架和HTML驱动技术,实现商业级海报的高密度文本渲染与灵活设计。
Journal ref AAAI 2026 Oral
为健康干预个性化设计大型基础模型
专题命中 多模态生成 :multimodal(abstract);分类 cs.AI
AI总结 本文提出混合框架,结合LFMs和N-of-1试验,以实现个性化医疗中的因果推断与责任AI整合。
Comments Accepted to the AAAI 2026 Workshop on Personalization in the Era of Large Foundation Models (PerFM)
需要多少张图片?文本到图像模型中模仿阈值的估计
机构 * University of Washington, Seattle(华盛顿大学) ; Bar-Ilan University(巴伊兰大学) ; University of California, Irvine(加州大学伊文斯顿分校) ; Allen Institute of AI(人工智能研究院)
专题命中 多模态生成 :image-text(abstract);分类 cs.CV
AI总结 研究通过评估文本到图像模型的模仿阈值,探讨其在版权和隐私合规中的应用。
Comments Accepted at TMLR 2025, ATTRIB, RegML, and SafeGenAI workshops at NeurIPS 2024 and NLLP Workshop 2024. https://openreview.net/forum?id=x0qJo7SPhs
TalkPhoto: 一种多功能的无需训练的对话式智能图像编辑助手
机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 TalkPhoto通过对话交互实现无需训练的多功能图像编辑,利用提示模板分层调用现有高级编辑方法,提升编辑精度与质量。
Comments a Conversational Assistant for Intelligent Image Editing
RS-vHeat:基于热传导的高效远程传感基础模型
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV
AI总结 RS-vHeat通过热传导运算符和自监督策略,实现高效多模态遥感基础模型,提升效率和性能。
Comments 19 pages, 8 figures and 10 tables
Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), 2025
DiffKD-DCIS:基于扩散增强与知识蒸馏的导管癌原位癌升级预测
机构 * School of Medical Imaging, Laboratory Medicine and Rehabilitation, Xiangnan University(医学影像学院、实验室医学与康复学院,湘南大学) ; Department of Radiotherapy, Affiliated Hospital (Clinical College) of Xiangnan University(放疗科,湘南大学附属医院(临床学院)) ; Faculty of Applied Sciences, Macao Polytechnic University(应用科学学院,澳门 polytechnic 大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 DiffKD-DCIS通过扩散增强与知识蒸馏方法,实现对导管癌原位癌升级的准确预测,提升诊断效率与临床价值。
GenCAMO: 基于场景图的环境感知与无掩码伪装图像密集标注生成
机构 * China University of Petroleum (East China)(中国石油大学(华东)) ; Southwest Jiaotong University(西南交通大学) ; Beijing Information Science and Technology University(北京信息科技大学) ; Beihang University(北航)
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV
AI总结 GenCAMO通过生成模型合成高质量伪装数据,提升复杂伪装场景的密集预测性能。
使用标记条件扩散模型进行虚拟多标记染色
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 本文提出了一种基于条件扩散模型的虚拟多标记染色方法,利用预训练模型生成多标记图像,提升了H&E图像的分子层面分析能力。
Comments Accepted at AAAI 2026
具有解剖剂量双约束的条件扩散模型用于端到端多肿瘤剂量预测
机构 * Faculty of Applied Sciences, Macao Polytechnic University(澳门理工大学应用科学学院) ; Affiliated Hospital of Xiangnan University(湘南大学附属医院) ; Jiangxi Cancer Hospital(江西省肿瘤医院) ; Chenzhou Third People's Hospital(郴州第三人民医院)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 ADDiff-Dose通过条件扩散模型实现多肿瘤剂量预测,结合解剖和剂量约束,提升预测精度与临床适用性。
StyGazeTalk: 学习风格化的 gaze 和 head 动态生成
机构 * Beihang University(北京航空航天大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 StyGazeTalk 通过多模态框架生成风格化的 gaze 和 head 动态,提升 3D 面部生成的现实感。
Comments arXiv submission