HunyuanImage 3.0 Technical Report
HunyuanImage 3.0 技术报告
专题命中 图像生成评测 :image generation(abstract);分类 cs.CV
AI总结 HunyuanImage 3.0是一种统一多模态理解与生成的自回归模型,通过精心数据整理、先进架构、原生思维链、渐进预训练和激进后训练,训练出超800亿参数MoE模型(推理时激活130亿),在文本-图像对齐和视觉质量上媲美最先进模型,并开源代码和权重。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
HunyuanImage 3.0 技术报告
专题命中 图像生成评测 :image generation(abstract);分类 cs.CV
AI总结 HunyuanImage 3.0是一种统一多模态理解与生成的自回归模型,通过精心数据整理、先进架构、原生思维链、渐进预训练和激进后训练,训练出超800亿参数MoE模型(推理时激活130亿),在文本-图像对齐和视觉质量上媲美最先进模型,并开源代码和权重。
C3-Bench:一种上下文感知的变化描述基准
机构 * Gwangju Institute of Science and Technology(光州科学技术院)
专题命中 图像生成评测 :image editing(abstract);分类 cs.CV
AI总结 提出C3-Bench基准,包含51种真实变化场景的4996对图像,并首次引入LLM-as-Judge评估框架,揭示现有模型在非训练分布场景下的系统性盲点。
Comments ECCV 2026 Camera-ready version
ABACUS: 自适应统一基础模型,桥接图像计数理解与生成
机构 * University of Surrey(萨里大学) ; Simon Fraser University(西蒙菲莎大学)
专题命中 图像生成评测 :image generation(abstract);分类 cs.CV
AI总结 提出ABACUS统一视觉语言模型,通过密度感知自适应缩放、边界感知计数策略和循环一致性GRPO,无需特定训练即可处理多种计数任务并生成计数忠实图像,在七个基准上达到最优。
Comments Under review, webpage: https://mondalanindya.github.io/ABACUS/
FID 彩票:量化生成模型评估中的隐藏随机性
机构 * Kyutai ; UC Berkeley(加州大学伯克利分校)
专题命中 图像生成评测 :image generation(abstract);分类 cs.CV
AI总结 研究FID作为随机变量在训练和生成种子上的方差,发现重训练比重采样导致更大FID波动,提出新评估协议:使用每类最优引导、报告多个训练种子的误差条。
Comments Website: https://kyutai.org/fid-lottery
当AUC误导:域偏移下深度伪造检测器的极化感知评估
机构 * CVI$^2$(CVI²实验室) ; SnT, University of Luxembourg(SnT,卢森堡大学) ; Cristal Laboratory, National School of Computer Sciences, University of Manouba(Cristal实验室,马努巴国家计算机科学学院)
专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV
AI总结 针对现有AUC评估无法反映真实场景中混合数据源和不同伪影类型的问题,提出Cross-dataset AUC(Cross-AUC)指标,通过平均每域AUC并引入预测极化度量(Wasserstein距离)来评估域偏移鲁棒性,实验证明其有效性。
Qwen-RobotWorld技术报告:通过语言条件视频生成统一具身世界模型
机构 * Qwen Team(Qwen团队)
专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV
AI总结 提出Qwen-RobotWorld,一种以自然语言为统一动作接口的语言条件视频世界模型,通过双流MMDiT、大规模具身世界知识语料和渐进式课程训练,在机器人操作、自动驾驶等任务中实现物理一致的未来视觉轨迹预测,在多个基准上取得最优结果。
生成式图像恢复进展:能力、局限性与评估实践研究
机构 * Fudan University(复旦大学) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) ; University of the Chinese Academy of Sciences(中国科学院大学) ; Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) ; Shenzhen University of Advanced Technology(深圳先进技术大学)
专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV
AI总结 通过多维度评估管道系统比较扩散、GAN等生成式模型与PSNR导向模型,揭示从细节不足到细节质量与语义控制的范式转变,并训练了更符合人类感知的IQA模型。
Comments Accepted by CVPR 2026 Findings
JointEdit3D:统一潜在空间中的前馈3D场景编辑
机构 * East China Normal University(华东师范大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; Tencent(腾讯)
专题命中 图像生成评测 :inpainting(abstract);分类 cs.CV
AI总结 提出JointEdit3D,在统一RGB-几何重建生成潜在空间中通过非对称潜在修复实现前馈3D场景编辑,引入SceneAnchor分支和编辑/背景感知损失,并构建SceneEdit3D-15K数据集和SceneEdit3D-Bench基准,显著提升编辑区域质量和3D结构完整性。
Comments Preprint. Project page: https://xinnan-zhu.github.io/JointEdit3D-Page/
OpenVTON-Bench:用于可控虚拟试穿评估的大规模高分辨率基准
机构 * Renxing Intelligence, Hangzhou, China ; Hangzhou Dianzi University, Hangzhou, China(杭州电子科技大学)
专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV
AI总结 提出OpenVTON-Bench,包含约10万对高分辨率图像,通过DINOv3聚类和Gemini描述构建,并设计多模态评估协议,沿五个维度衡量试穿质量,与人类判断高度一致。
Comments Under review for the NeurIPS 2026 Datasets and Benchmarks Track
SciFlow-Bench:通过逆解析评估结构感知的科学图表生成
机构 * Peking University(北京大学) ; Shanghai Jiao Tong University(上海交通大学) ; Huawei Cloud BU(华为云业务部) ; Zhongguancun Academy(中关村学院) ; Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京数据智能与安全重点实验室(北京大学))
专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV
AI总结 提出SciFlow-Bench基准,通过逆解析将生成的图表图像转换为结构化图进行比较,以结构可恢复性而非视觉相似性评估科学图表生成。
Impostor:一个用于真实AIGC篡改定位的智能体策划基准
机构 * Southeast University(东南大学) ; Xiaohongshu Inc.(小红书公司) ; Tsinghua University(清华大学)
专题命中 图像生成评测 :image editing(abstract);分类 cs.CV
AI总结 为解决现有图像篡改检测与定位基准在视觉真实感、篡改多样性和生成器覆盖方面的局限,提出了Impostor数据集和CraftAgent框架,并设计了PhaseAware-Net方法,在多个基准上取得优异性能。
Comments 10 pages, 3 figures, 5 tables
一步生成模型的漂移偏好优化
机构 * Westlake University(西湖大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV
AI总结 提出 DrPO 方法,通过在线采样和排序构建非参数偶极偏好场及参考漂移,实现一步式生成模型的无梯度偏好微调。
Comments 24 pages, 9 figures
揭示盲点:生成图像模型中的文化偏见评估
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Dongguk University(东国大学) ; Delft University of Technology(代尔夫特理工大学) ; Johns Hopkins University, School of Medicine(约翰霍普金斯大学医学院) ; University of Minnesota–Twin Cities(明尼苏达大学双城分校) ; Lavoro AI
专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV
AI总结 提出一个统一的评估框架,结合自动指标、文化感知VQA和专家人工判断,对文本到图像和图像到图像生成模型进行跨国家、跨时代和跨类别的文化偏见评估,发现模型存在默认全球北方现代描绘、迭代编辑侵蚀文化保真度以及仅应用表面线索等问题。
Comments 28 pages, 8 figures. Accepted at IASEAI 2026. Huichan Seo, Sieun Choi, and Minki Hong contributed equally
TASTE:一个由设计师标注的AI生成图形设计多维偏好数据集
机构 * Lica World(Lica世界) ; Contra.Work Inc.(Contra.Work公司)
专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV
AI总结 针对现有偏好数据集仅提供单一整体评价的不足,本文构建了TASTE多维偏好数据集,由两组专业设计师对四个文本到图像模型的输出按九项标准排序,并提出了无准则信号验证框架和偏好模型基准测试。
TextAlign: 基于层次化奖励的文本渲染偏好对齐
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·穆萨大学人工智能学院) ; Chinese Academy of Sciences Institute of Automation(中国科学院自动化研究所) ; Northeastern University(东北大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV
AI总结 提出TextAlign框架,通过层次化视觉语言模型奖励将文本渲染错误分解为全局、单词和字形级别,并转化为标量偏好信号,利用GRPO或DPO进行后训练对齐,在不改变生成器架构下提升文本渲染准确性。
LL-Bench: 在大规模生成模型时代重新思考低级视觉评估
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 图像生成评测 :image generation(abstract);分类 cs.CV
AI总结 提出LL-Bench基准,包含大量真实退化图像和人工偏好标注,系统评估大规模生成模型在低级视觉任务中的性能,并引入LL-Score评估器以更好对齐人类偏好。
残差解码器适配器:用于自回归文本渲染的身份保持分词器适配
机构 * Central South University(中南大学) ; University of Oxford(牛津大学) ; Microsoft Research(微软研究院)
专题命中 图像生成评测 :image generation(abstract);分类 cs.CV
AI总结 提出残差解码器适配器(RDA),通过引入配对码本和平行分支学习像素空间残差,在不重新训练分词器和自回归模型的情况下显著提升文本渲染性能。
Comments CVPR 2026 poster
CV-Arena: 面向教学计算机视觉问题求解的开放基准与人类-AI协作偏好
机构 * Texas A&M University(德克萨斯A&M大学) ; Worcester Polytechnic Institute(沃斯特理工大学) ; Tohoku University(东北大学) ; Georgia Institute of Technology(佐治亚理工学院) ; NVIDIA(英伟达) ; UCSB(加州大学圣塔芭芭拉分校) ; UC Merced(加州大学默塞德分校)
专题命中 图像生成评测 :image editing(abstract);分类 cs.CV
AI总结 提出CV-Arena基准,包含12K高分辨率真实图像指令对,覆盖16种任务类型,并采用Active Elo协议结合人类与AI偏好评估21个系统,揭示指令遵循、物理推理等方面的差距,同时开发CV-Agent代理模型展示闭环推理的潜力。
Comments 26 pages, 7 figures, 11 tables
脑肿瘤手术中术中超声到MR合成的系统基准测试
机构 * Department of Neurosurgery, Neurovascular Unit Río Hortega University Hospital(里奥霍尔特ega大学医院神经外科部门,神经血管单元) ; Specialized Group in Biomedical Imaging and Computational Analysis (GEIBAC)(生物医学成像与计算分析专项组(GEIBAC)) ; Instituto de Investigación Biosanitaria de Valladolid (IBioVALL)(瓦尔拉多利德生物医学研究 institute(IBioVALL))
专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV
AI总结 针对脑肿瘤手术中术中超声(ioUS)到MR图像合成问题,本研究在公共ReMIND数据集上系统比较了6种生成器、4种推理模式和2种目标,结合图像保真度指标和下游分割评估,发现感知质量(LPIPS)与下游效用最相关,而SSIM与效用负相关,SynDiff-2.5D在下游分割中表现最佳。
视觉说服:什么影响了视觉语言模型的决策?
机构 * Massachusetts Institute of Technology(麻省理工学院) ; MIT Media Lab(MIT媒体实验室)
专题命中 图像生成评测 :image generation(abstract);分类 cs.CV
AI总结 提出一个框架,通过控制图像选择任务并系统性地扰动输入,利用视觉提示优化方法推断视觉语言模型的潜在视觉效用,揭示影响模型决策的视觉偏好。
Comments Accepted to ICML 2026
原型性偏差揭示多模态评估指标中的盲点
机构 * University of Technology Nuremberg(图恩大学)
专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV
AI总结 本文通过构建受控诊断基准PROTOBIAS,发现并验证了多模态评估指标中存在原型性偏差,即倾向于选择视觉或社会原型性高但语义错误的图像,并提出了轻量级对比训练评估器PROTOSCORE作为缓解基线。
超越文本提示:视觉到视觉生成作为统一范式
机构 * City University of Hong Kong(香港城市大学) ; City University of Hong Kong (Dongguan)(香港城市大学(东莞)) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; The Chinese University of Hong Kong(香港中文大学) ; Celia Research HK(Celia研究香港) ; Great Bay University(大湾大学) ; Lingnan University(岭南大学)
专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV
AI总结 提出视觉到视觉(V2V)生成范式及无需训练的V2V-Zero框架,通过利用视觉页面隐藏状态替代文本条件,在多个任务上达到或接近优化后的文本到图像性能。
Comments Project Page: https://yaofang-liu.github.io/V2V_Web
Kandinsky 5.0:图像与视频生成的基础模型系列
机构 * Kandinsky Lab(Kandinsky 实验室)
专题命中 图像生成评测 :image generation(abstract);分类 cs.CV
AI总结 本文介绍Kandinsky 5.0系列模型,通过多阶段训练、自监督微调和强化学习后训练,实现高分辨率图像和10秒视频的高质量生成。
Comments Website: https://kandinskylab.ai/
为混合具身体验中的长时域演化构建世界-自我模型
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Peking University(北京大学)
专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV
AI总结 本文提出了一种新的世界-自我建模范式,通过分解未来演化为世界和自我组件,解决混合任务中长时域具身体验中的退化问题,并通过HTEWorld基准测试验证了其有效性。
MIRO:多奖励条件预训练提升T2I质量和效率
机构 * LIGM, ENPC, IP Paris, CNRS, UGE, France ; LIX, CNRS, \'Ecole Polytechnique, IP Paris, France
专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV
AI总结 MIRO通过在训练过程中对模型施加多个奖励,直接学习用户偏好,从而提升文本到图像生成的质量和效率,同时在GenEval组合基准和用户偏好评分上取得最佳成绩。
Comments Accepted at ICML 2026. Project page: https://nicolas-dufour.github.io/miro
基于反思生成的基准测试与进化
专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV
AI总结 本文提出R^3-Bench基准和R^3-Refiner框架,用于评估和提升反思视觉生成能力,通过改进迭代推理和修正能力,提升文本到图像模型的生成质量。
QQJ: 量化定性判断以实现可扩展且与人类对齐的生成AI评估
机构 * AI Lab, Arioobarzan Engineering Team(艾伊罗巴赞工程团队人工智能实验室) ; Department of Computer Engineering and Information Technology(计算机工程与信息科技系) ; Department of Informatics, Bioengineering, Robotics and Systems Engineering(信息学、生物工程、机器人与系统工程系) ; University of Genoa(热那亚大学)
专题命中 图像生成评测 :image generation(abstract);分类 cs.GR
AI总结 本文提出QQJ框架,通过专家设计的多维评分标准和高质量标注集校准大语言模型评估器,实现与人类判断一致的可扩展评估方法,验证了结构化定性判断在大规模应用中的有效性。
SCOOTER:一种用于无限制对抗示例的人工评估框架
机构 * University of Luxembourg(卢森堡大学) ; CAIMed – Lower Saxony Center for AI & Causal Methods in Medicine(下萨克森人工智能与因果方法医学中心)
专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV
AI总结 本文提出SCOOTER框架,通过大规模人类与模型对比验证无限制对抗示例的不可察觉性,发现部分攻击方法无法生成不可察觉图像,并展示了基于ImageNet的基准数据集。
Comments 42 pages, 16 figures, 11 tables, Under Review, Code: https://github.com/DrenFazlija/Scooter, Data: https://doi.org/10.5281/zenodo.15771501
3DReflecNet:一个大规模数据集,用于反射、透明和低纹理物体的3D重建
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Capital Normal University(首都师范大学) ; University of Southern California(南加州大学)
专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV
AI总结 本文提出3DReflecNet数据集,包含超过700万张多视角图像,用于评估和推动针对反射、透明和低纹理物体的3D视觉方法,揭示现有方法在复杂材料下的局限性。
Comments This paper has been accepted by CVPR 2026 Oral
面向基于视觉的遥控的生成预测显示:一种零样本基准测试的现成视频模型
机构 * Department of Electrical and Computer Engineering, University of Michigan - Dearborn(密歇根大学迪尔伯恩分校电气与计算机工程系)
专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV
AI总结 本文提出一种零样本基准测试,评估现成生成视频模型在短时间预测显示中的性能,发现现有模型无法在低误差、非发散误差行为和实时推断间取得平衡。