Beyond Content: How Grammatical Gender Shapes Visual Representation in Text-to-Image Models
超越内容:语法性别如何塑造文本到图像模型中的视觉表示
专题命中 多模态生成 :multimodal(abstract);分类 cs.CL
AI总结 研究揭示语法性别对文本到图像模型中视觉表示的显著影响,通过跨语言实验展示不同语法性别对性别表示的系统性影响。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
超越内容:语法性别如何塑造文本到图像模型中的视觉表示
专题命中 多模态生成 :multimodal(abstract);分类 cs.CL
AI总结 研究揭示语法性别对文本到图像模型中视觉表示的显著影响,通过跨语言实验展示不同语法性别对性别表示的系统性影响。
PSGS:通过高斯点划法实现文本驱动的全景滑动场景生成
机构 * East China University of Science and Technology(东华大学) ; Zhejiang University(浙江大学) ; Beijing Institute of Technology(北京理工大学)
专题命中 多模态生成 :MLLM(abstract);分类 cs.CV
AI总结 PSGS通过高斯点划法和双阶段框架实现高质量文本驱动全景场景生成,提升3D场景的真实感和细节保真度。
Comments Accepted to ICASSP2026
JSR-GFNet: 针对未来认知全球导航卫星系统干扰分类的干扰-信号比感知动态门控
机构 * National Key Laboratory of Wireless Communications, University of Electronic Science and Technology of China(中国电子科技大学无线通信国家重点实验室) ; University of Electronic Science and Technology of China(中国电子科技大学) ; Shanghai Aerospace Electronic Technology Institute(上海航天电子技术研究所) ; Shanghai Key Laboratory of Collaborative Computing in Spacial Heterogeneous Networks (CCSN)(上海空间异构网络协同计算重点实验室) ; Anhui Science and Technology University(安徽科技大学) ; University of Oxford(牛津大学) ; Shanghai Xiaoyuan Innovation center(上海小元创新中心)
专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI
AI总结 JSR-GFNet通过结合相位敏感的IQ样本与STFT频谱图,利用动态门控机制提升GNSS干扰分类的准确性和鲁棒性。
基于大语言模型的自动 trailers 生成方法
专题命中 多模态生成 :multimodal(abstract);分类 cs.MM
AI总结 本文提出基于大语言模型的自动化 trailers 生成方法,通过多模态策略提升 trailers 的视觉吸引力和叙事体验。
Comments 2024 9th International Conference on Frontiers of Signal Processing (ICFSP)
Journal ref ICFSP, Paris, France, 2024, pp. 93-100
ScribbleSense: 基于生成的涂鸦纹理编辑与意图预测
机构 * School of Computer Science, Beijing Institute of Technology(计算机学院,北京理工大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 ScribbleSense通过结合多模态大语言模型和图像生成模型,实现了基于生成的涂鸦纹理编辑与意图预测,提升交互式编辑性能。
Comments Accepted by IEEE TVCG. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses
Omni-View: 通过多视角图像解锁生成如何促进理解的统一3D模型
机构 * Institute of Medical Technology(医学技术研究所) ; Alibaba International Digital Commerce Group(阿里巴巴国际数字商务集团) ; CASIA ; TeleAI
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 Omni-View通过多视角图像实现3D场景的理解与生成,结合纹理和几何模块,提升3D场景建模性能。
Comments Accepted by ICLR 2026
保持本地化、小巧和现实:面向机电认知系统的边缘计算设备自动化报告生成
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV
AI总结 本文提出了一种基于边缘计算设备的自动化报告生成方法,利用本地模型实现多模态传感器数据处理,以提升机电认知系统在不同环境中的评估效率与隐私保护。
Comments 6 pages, 4 figures, 1 table; accepted for MECATRONICS-REM 2025 International Conference, PARIS, FRANCE December 3-5 2025
预期回报导致强化学习中的结果层面模式崩溃及如何通过逆概率缩放修复它
机构 * National University of Singapore, Singapore(新加坡国立大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.AI
AI总结 本文提出逆概率缩放方法,通过修正预期回报目标来解决强化学习中的结果层面模式崩溃问题,有效提升多模式策略优化的可靠性。
HERS:隐藏模式专家学习用于扩散模型中特定风险车辆损伤适应
专题命中 多模态生成 :image-text(abstract);分类 cs.CV
AI总结 HERS通过领域特定专家学习提升扩散模型中车辆损伤生成的保真度与可控性,提高保险领域应用的安全性与可靠性。
Comments 26 pages
SkyReels-V3 技术报告
机构 * SkyReels Team(SkyReels 团队)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 SkyReels-V3 提出三种视频生成范式,通过多模态上下文学习框架实现高质量视频生成,涵盖图像到视频、视频扩展和音频引导生成,达到接近闭源系统的性能。
MiLDEdit: 基于推理的多层设计文档编辑
机构 * University of California, Davis(加州大学戴维斯分校) ; Adobe(Adobe公司) ; UW-Madison(威斯康星大学麦迪逊分校) ; Princeton University(普林斯顿大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 MiLDEdit通过引入基于推理的多层文档编辑代理,实现了对多层设计文档的精准编辑,显著超越现有方法,建立了该领域的首个强基线。
LaTo:基于地标token化的扩散变换器用于精细的人脸编辑
机构 * Alibaba Cloud Computing(阿里云计算) ; Shanghai Jiao Tong University(上海交通大学) ; Fudan University(复旦大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 LaTo通过地标token化扩散变换器实现精细的人脸编辑,提升身份保持与语义一致性。
上下文标记是锚点:从信息流的角度理解dMLLMs中的重复诅咒
机构 * SJTU(上海交通大学) ; CASIA(中国科学院自动化研究所) ; NTU(国立台湾大学) ; Meitu (China) Limited(美图公司) ; XMUT(新疆大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 CoTA通过增强上下文标记注意力和引入惩罚项缓解dMLLMs中的重复问题,提升解码性能。
Comments Accepted in ICLR 2026
可逆高效扩散用于图像融合
机构 * School of New Media and Communication, Tianjin University(新媒体与传播学院,天津大学) ; School of Artificial Intelligence, Tianjin University(人工智能学院,天津大学) ; Low-Altitude Intelligence Laboratory, Xiong’an National Innovation Center(低空智能实验室,雄安国家创新中心) ; Xiong’an Guochuang Lantian Technology Co., Ltd.(雄安国创蓝天科技有限公司) ; National University of Defense Technology(国防科技大学)
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV
AI总结 本文提出可逆高效扩散模型,通过显式监督提升图像融合的生成能力,解决传统扩散模型在融合任务中的细节损失问题。
TwinFlow: 在大模型上实现一步生成的自对抗流
机构 * Inclusion AI ; Shanghai Innovation Institute(上海创新研究院) ; Westlake University(西湖大学) ; Zhejiang University(浙江大学)
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV
AI总结 TwinFlow 提出了一种无需预训练教师模型和标准对抗网络的一步生成框架,实现了在大模型上高效生成,提升了推理效率并降低了计算成本。
Comments arxiv v1, accepted to ICLR 2026
动态世界,动态人类:生成动态场景中的虚拟人类-场景交互动作
机构 * Beihang University(北航大学) ; University of Durham(达勒姆大学) ; State Key Laboratory of Virtual Reality Technology and Systems(虚拟现实技术与系统国家重点实验室) ; Zhongguancun Laboratory(中关村实验室)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 本文提出Dyn-HSI架构,通过动态视觉导航、分层经验记忆和人-场景交互扩散模型,生成高质量的动态场景中人-场景交互动作。
解剖学感知的符合预测用于带有随机游走的医学图像分割
机构 * École de Technologie Supérieure ; Mila - Quebec AI Institute ; Polytechnique Montréal
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV
AI总结 本文提出RW-CP方法,通过随机游走扩散不确定性,提升医学图像分割的解剖学一致性与预测稳定性。
Comments 13 pages
扁平化复杂:通过组合k-cell粒子进行联合B-Rep生成
机构 * Nanjing University(南京大学)
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV
AI总结 本文提出了一种基于组合k-cell粒子的B-Rep生成方法,通过解耦层次结构实现拓扑与几何的联合生成,提升生成模型的精度和可编辑性。
EvoCUA:通过可扩展的合成经验学习来进化计算机使用代理
机构 * Meituan(美团) ; Fudan University(复旦大学) ; Tongji University(同济大学) ; The Hong Kong University of Science and Technology(香港理工大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.AI
AI总结 EvoCUA通过可扩展的合成经验学习进化计算机使用代理,实现更高性能和通用性。
Comments 26 pages, 8 figures
耦合物理门控适应:在复杂3D打印物体中空间解码体积分子转换
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 提出耦合物理门控适应方法,通过空间解码实现复杂3D打印物体中体积分子转换的预测。
通过表征自编码器扩展文本到图像扩散变换器
机构 * New York University(纽约大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 通过扩展表征自编码器实现更高效的大规模文本到图像生成,RAE在预训练和微调中均优于VAE,且具有更快的收敛速度和更好的生成质量。
Comments website: https://rae-dit.github.io/scale-rae/
PAINT: 用于虚拟免疫组化病理学的路径感知集成下尺度转换
机构 * School of Computer Science and Engineering, Northwestern Polytechnical University(计算机科学与工程学院,西北工业大学) ; Monash University(墨尔本大学)
专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV
AI总结 PAINT通过结构优先的自回归框架,提升虚拟免疫组化合成的结构保真度和临床应用效果。
DualShield: 通过可达性分析实现交互式自动驾驶的安全模型预测扩散
机构 * Robotics and Autonomous Systems Thrust, The Hong Kong University of Science and Technology (Guangzhou)(机器人与自主系统方向,香港科学与技术大学(广州))
专题命中 多模态生成 :multimodal(abstract);分类 cs.AI
AI总结 DualShield通过可达性分析实现交互式自动驾驶的安全模型预测扩散,结合前瞻性指导和反应性安全防护,提升安全性和任务效率。
Comments 8 pages, 5 figures
MapViT:一种基于视觉Transformer的两阶段框架,用于动态环境中实时无线电质量地图预测
机构 * Informatics Institute, University of Amsterdam(阿姆斯特丹大学信息学院) ; NEC Laboratories Europe(NEC欧洲实验室) ; i2CAT Foundation(i2CAT基金会) ; Catalan Institution for Research and Advanced Studies (ICREA)(加泰罗尼亚研究与高级研究机构(ICREA))
专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI
AI总结 MapViT通过两阶段ViT框架实现实时动态环境中无线信号质量预测,结合预训练和微调方法提升准确性和效率,适用于资源受限的移动机器人场景。
Comments This paper has been accepted for publication at IEEE International Conference on Communications (ICC) 2026
谱生成流模型:一种受物理启发的向量大语言模型替代方案
机构 * UC Berkeley(伯克利大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CL
AI总结 谱生成流模型通过物理启发的连续场演化机制,替代传统向量大语言模型,实现长程一致性、多模态通用性和物理结构归纳偏置。
虚拟城市主义:一种基于AI的量化城市身份框架。以东京为基础的试点研究,使用扩散生成的合成环境
专题命中 多模态生成 :multimodal(abstract);分类 cs.AI
AI总结 本文提出虚拟城市主义框架,利用AI生成合成环境量化城市身份,通过东京试点研究验证其有效性,揭示核心身份形成元素。
大规模人工智能模型用于无线物理层
机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学) ; National Mobile Communications Research Laboratory, Southeast University(国家移动通信研究中心,东南大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.AI
AI总结 本文提出利用大规模人工智能模型改进无线物理层通信,通过预训练模型和专用模型策略提升性能与适应性,并探讨未来研究方向。
Comments A collection of paper on Large AI Models for wireless physical layer can be found at https://github.com/AI4Wireless/LAM4PHY_6G
DomainCQA: 从领域特定图表中构建知识密集型问答
专题命中 多模态生成 :multimodal(abstract);分类 cs.CL
AI总结 DomainCQA通过构建领域特定图表问答基准测试,提升多模态大语言模型在视觉理解和知识密集型推理方面的能力。
Comments 83 pages, 59 figures
EmoKGEdit: 无训练情感注入 via 视觉线索转换
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 EmoKGEdit通过构建多模态情感关联知识图谱,实现无训练的精确情感注入,有效分离情感属性与布局特征,提升图像情感编辑的保真度和结构一致性。
Comments 11pages,10figures
评估用于从单个深度图像生成高保真3D形状补全的潜在生成范式
机构 * German Aerospace Center(德国航空航天中心) ; TU Munich(慕尼黑技术大学) ; Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV
AI总结 本文比较了扩散模型和自回归模型在单个深度图像生成高保真3D形状补全任务中的性能,发现扩散模型在连续潜在空间中表现更优,而自回归模型在离散潜在空间中可匹敌或超越扩散模型。
Comments 16 pages, 4 figures, 19 tables. To appear in 3DV 2026. Project page: https://hummat.github.io/2026-3dv-genz/