arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 3280 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 134 篇

2607.26004 2026-07-29 cs.CV cs.LG 新提交 70%

Parallel Decoding Distillation for Fast Image and Video Generation

用于快速图像和视频生成的并行解码蒸馏

Neta Shaul, Chao Liu, Arash Vahdat, Julius Berner

机构 * NVIDIA(英伟达) Weizmann Institute of Science(魏茨曼科学研究所)

专题命中 效率与蒸馏 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 针对视频扩散或流模型生成计算昂贵问题,提出并行解码蒸馏方法PDD,兼容预训练模型,通过预测多去噪步骤加速生成,在多个数据集上达SOTA性能,提升视频多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14728 2026-07-17 cs.CV cs.RO 新提交 70%

VQ-Touch: A Data-Efficient Tactile Generation Framework Across Sensors and Scenarios

VQ-Touch:一种跨传感器和场景的数据高效触觉生成框架

Kailin Lyu, Long Xiao, Jianing Zeng, Di Wu, Lin Shu, Jie Hao

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 研究旨在解决现有触觉生成方法依赖特定传感器数据集且泛化能力不足的问题。提出VQ-Touch框架,含DM-VQGAN提取特征及离散扩散解码器支持多模态生成,经少样本混合训练增强泛化能力,实验显示其在多任务中超越现有方法。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03524 2026-07-07 cs.CV 新提交 70%

Perceptual Flow Matching for Few-Step Generative Modeling

用于少步生成建模的感知流匹配

Chuyang Zhao, Yifei Song, Hongfa Wang, Jianlong Yuan, Yuan Zhang, Siming Fu, Zhineng Chen, Huilin Deng, Haoyang Huang, Nan Duan

机构 * Joy Future Academy(京东探索研究院) Fudan University(复旦大学) Tsinghua University(清华大学) USTC(中国科学技术大学)

专题命中 效率与蒸馏 :image generation(abstract);image editing(abstract);分类 cs.CV

AI总结 提出感知流匹配框架,在感知特征空间监督流匹配,改进少步生成能力,减少采样步骤,无需教师模型和辅助分数网络,实验表明其能产生高质量结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27371 2026-06-26 cs.CV 新提交 70%

Don't Settle at the Mode! Mitigating Diversity Collapse in Pretrained Flow Models via Feature Self-Guidance

不要停留在众数!通过特征自引导缓解预训练流模型中的多样性坍塌

Pradhaan S Bhat, Rishubh Parihar, Abhijnya Bhat, R. Venkatesh Babu

机构 * Indian Institute of Science(印度科学研究所) Stanford University(斯坦福大学)

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出一种无需训练的自引导机制,通过分散批次生成中的内部特征并施加流形正则化,在几乎不增加推理成本的前提下缓解预训练流模型的多样性坍塌问题。

Comments Accepted by ECCV 2026. Project page: https://dont-settle-at-the-mode.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21030 2026-06-23 eess.IV cs.CV 新提交 70%

FlowCodec: One-Step Flow Prior for Generative Image Compression

FlowCodec: 用于生成式图像压缩的一步流先验

Yinhuan Huang, Hao Cao, Pu chen, Wenqi Guo, Zhijin Qin

机构 * Tsinghua University(清华大学)

专题命中 效率与蒸馏 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出FlowCodec框架,将预训练的大规模文本到图像先验嵌入超低比特率编解码器,通过解耦的潜在压缩和单步潜在传输实现高质量压缩,无需额外条件信号或辅助网络。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23682 2026-06-23 cs.CV 新提交 70%

Keep The Essentials: Efficient Reference Conditioned Generation via Token Dropping

保留精华:通过令牌丢弃实现高效的参考条件生成

Rishubh Parihar, Ayush Raina, R. Venkatesh Babu, Or Patashnik

机构 * IISc Bangalore(印度科学研究所班加罗尔分校) Tel Aviv University(特拉维夫大学)

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出Sparse Context方法,通过丢弃大部分参考令牌并微调模型,实现参考条件生成中4倍(多参考)和2倍(单参考)的推理加速,且不降低视觉质量。

Comments Project Page: https://sparsecontext.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16131 2026-06-16 cs.CV cs.LG 新提交 70%

Shift-and-Sum Quantization for Visual Autoregressive Models

Shift-and-Sum 量化用于视觉自回归模型

Jaehyeon Moon, Bumsub Ham

机构 * Yonsei University(延世大学) Articron

专题命中 效率与蒸馏 :image generation(abstract);inpainting(abstract);分类 cs.CV

AI总结 提出针对视觉自回归模型的训练后量化框架,通过移位求和量化减少注意力值乘积误差,并采用重采样策略校准数据,在图像生成等任务上达到新最优。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01102 2026-08-04 cs.RO 新提交 67%

CAAT: Contact-Aware Attention Scaling and Tactile Masking for Data-Efficient Contact-Rich Manipulation

CAAT:用于数据高效接触丰富型操作的接触感知注意力缩放与触觉掩码方法

Jiaming Jiang, Yuzhe Huang, Hao Liang, Pei Lin, Shengcheng Luo, Fanrong Dong, Jiaping Wu, Chenxi Xiao, Wanlin Li, Ziyuan Jiao

机构 * ShanghaiTech University(上海科技大学) Beihang University(北京航空航天大学) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) Zhejiang University(浙江大学) BUPT(北京邮电大学)

专题命中 效率与蒸馏 :diffusion(abstract,abstract_cn)

AI总结 该研究针对接触丰富型操作中视觉-触觉策略缺乏接触感知先验的问题,提出CAAT框架,通过注意力缩放和动态触觉掩码提升策略性能,在仿真和真实实验中均显著优于现有方法。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27529 2026-07-31 cs.LG 新提交 67%

Latent-Kernel Discrete Flow Maps for Few-Step Generation

用于少步生成的隐核离散流图

Mansoor Ahmed, Yue-Tsz Fan, Hemanth Venkateswara, Murray Patterson

专题命中 效率与蒸馏 :diffusion(abstract,abstract_cn)

AI总结 提出隐核离散流图(LKF)模型,通过共享隐变量绑定分解组件实现少步生成,在两个文本基准上较似然基线提升困惑度2.1-3.3倍,M=8时优于现有少步采样器

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21014 2026-06-23 cs.RO 新提交 67%

BayesFP: Posterior Estimation for Flow-Based Policies via Feynman-Kac Sampling

BayesFP: 基于Feynman-Kac采样的流策略后验估计

Sreevardhan Sirigiri, Weiming Zhi, Fabio Ramos

机构 * School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) Australian Centre For Robotics, The University of Sydney(悉尼大学澳大利亚机器人中心) College of Connected Computing, Vanderbilt University(范德堡大学互联计算学院) NVIDIA(英伟达)

专题命中 效率与蒸馏 :diffusion(abstract,abstract_cn)

AI总结 提出BayesFP框架,将预训练扩散/流匹配策略的约束轨迹生成视为贝叶斯后验采样,利用Feynman-Kac校正器实现无需重训练的推理时采样,在模拟和真实操作任务中提升零样本性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14783 2026-08-18 cs.CV cs.GR 新提交 62%

MegaParts: Scaling Part-Aware 3D Object Generation to 300 Parts via Token-Efficient Autoregressive Modeling

MegaParts:通过令牌高效自回归建模将部件感知三维物体生成扩展至300个部件

Manwen Liao, Xinyu Lian, Jian Mao, Kaixu Chen, Li Luo, Jinghao Yan, Wanshui Gan, Qiao Yu, Weitian Zhang, Chunhua Shen, Guang Chen, Bo Dai, Xudong Xu, Zhaoyang Lyu

机构 * The University of Hong Kong(香港大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Tongji University(同济大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 MegaParts提出结合结构化序列建模与令牌高效矢量量化形状令牌化器的自回归框架,将部件感知3D生成扩展至300个部件,性能优于基线模型,为大规模部件感知3D生成提供新方案。

Comments 12 pages, 6 pages appendix, 13 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12555 2026-07-07 cs.SD cs.CV cs.MM 新提交 62%

AudioX-Turbo: A Unified Framework for Efficient Anything-to-Audio Generation

AudioX-Turbo:高效任意到音频生成的统一框架

Zeyue Tian, Lei Ke, Zhaoyang Liu, Ruibin Yuan, Liumeng Xue, Yujiu Yang, Weijia Chen, Xu Tan, Qifeng Chen, Wei Xue, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学) Noiz AI Independent Researcher(独立研究员)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 提出AudioX-Turbo,基于教师-学生范式的统一高效框架,通过多模态扩散Transformer和分布匹配蒸馏实现文本、视频、音频到音频的生成,仅需4步采样,NFE减少约25倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26744 2026-08-28 cs.CV 新提交 57%

G2D: Generative-to-Discriminative Collaborative Inference for Zero-Shot Image Classification

G2D:用于零样本图像分类的生成式到判别式协同推理框架

Zehua Hao, Fang Liu, Qinliang Wang, Yaoyang Du, Xinyan Huang, Puhua Chen

机构 * Xidian University(西安电子科技大学)

专题命中 效率与蒸馏 :generative vision(abstract);分类 cs.CV

AI总结 G2D是一种无需训练的零样本图像分类框架,通过生成式VLM验证CLIP检索的候选,在8个基准上平均准确率达68.85%,优于CLIP及独立生成式模型,还可迁移至其他模型。

Comments Accepted at ACM MM 2026. 10 pages, 5 figures

Journal ref Proceedings of the 34th ACM International Conference on Multimedia (MM '26), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25575 2026-08-27 cs.CV cs.AI 新提交 57%

MLLMCLIP: Feature-Level Distillation of MLLM for Robust Vision-Language Representations

MLLMCLIP:面向鲁棒视觉-语言表征的多模态大语言模型(MLLM)特征级蒸馏

Jongsuk Kim, Qiyu Wu, Zhuoyuan Mao, Hiromi Wakaki, Junmo Kim, Yuki Mitsufuji

机构 * KAIST(韩国科学技术院) Sony Group Corporation(索尼集团公司)

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV

AI总结 MLLMCLIP是一种异构特征级蒸馏框架,直接将MLLM的多模态知识迁移至CLIP,在组合性任务和通用视觉-语言任务上均实现最优性能。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20208 2026-08-21 cs.CV 新提交 57%

RoMAN-Flow: Taming Autoregressive Normalizing Flows for Offline Reinforcement Learning in Robotic Manipulation

RoMAN-Flow:驯服自回归归一化流用于机器人操作中的离线强化学习

Shaoxuan Wang, Guangting Zheng, Rui Huang, Zhipeng Tang, Sha Zhang, Jiajun Deng, Yanyong Zhang

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对机器人操作离线强化学习中AR-NFs采样开销大的问题,提出RoMAN-Flow框架,通过无采样的优势加权似然目标和策略蒸馏方法,在保证性能的同时大幅降低推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18832 2026-08-20 cs.CV 新提交 57%

EfficientSync: Real-Time Lip Synchronization via Deformation-Based Reference Texture Mixing

EfficientSync:基于变形参考纹理混合的实时唇形同步

Fa-Ting Hong, Runzhen Liu, Luchuan Song, Hongmin Cai, Chuhua Xian

机构 * The Hong Kong University of Science and Technology(香港科技大学) South China University of Technology(华南理工大学) University of Rochester(罗切斯特大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 EfficientSync是一种基于变形的实时唇形同步框架,通过动态纹理混合器等技术保留参考纹理,在HDTF和VFHQ数据集上以166 FPS实现领先的视觉质量与身份保留效果。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17995 2026-08-19 cs.CV 新提交 57%

AViTS: Adaptive Spatiotemporal Token Selection for Efficient Dynamic-Resolution Generation

AViTS:用于高效动态分辨率生成的自适应时空令牌选择

Haoran Qin, Zhengan Yan, Shikang Zheng, Xiaobing Tu, Jiacheng Liu, Yuqi Lin, Chang Zou, JinShan Liu, Peiliang Cai, Xiantao Zhang, Jinkui Ren, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shandong University(山东大学) Terminal Intelligent Computing Division, Alibaba Cloud(阿里云终端智能计算事业部) Jilin University(吉林大学) Xi’an Jiaotong University(西安交通大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对扩散变换器动态分辨率采样的冗余计算问题,提出AViTS框架,通过时空重要性感知的选择性上采样减少冗余,在FLUX等模型上实现显著加速且与其他优化技术兼容

Comments Accepted to ECCV 2026. 20 pages including appendix. Code: https://github.com/QHR69/AViTS

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16585 2026-08-18 cs.CV 新提交 57%

SQuad: Sub-Quadratic Attention Distillation for Efficient Video Generation

SQuad:用于高效视频生成的次二次注意力蒸馏

Animesh Karnewar, Denis Korzhenkov, Amirhossein Habibian, Mohsen Ghafoorian

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对视频扩散Transformer自注意力的二次复杂度瓶颈,提出SQuad次二次注意力蒸馏框架,通过两阶段蒸馏适配预训练模型,在保持生成质量的同时大幅提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15522 2026-08-18 cs.CV 新提交 57%

Efficient Audio-Visual Generation via Synchrony-Aware Cross-Modal Sparse Attention

基于同步感知跨模态稀疏注意力的高效视听生成

Shengchuan Gao, Teng Hu, Bohao Feng, Luchen Li, Wenqiang Wang, Hongqian Deng, Ran Yi

机构 * Alibaba Group(阿里巴巴集团) Alibaba Cloud Computing(阿里巴巴云计算) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出同步感知加速框架,通过受保护的稀疏注意力策略在保留视听生成质量与同步性的同时提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12203 2026-08-13 cs.CV 新提交 57%

GeoFlow: Efficient Driving Video Generation via Geometry-Aligned Priors

GeoFlow:基于几何对齐先验的高效驾驶视频生成

Jiazheng Liu, Hang Li, Jiawei Zhang, Jiahe Li, Xiaohan Yu, Shengyin Fan, Jin Zheng, Xiao Bai

机构 * Beihang University(北京航空航天大学) Macquarie University(麦考瑞大学) Tianyi Transportation Technology Co., Ltd(天宜交通科技有限公司) Jiangxi Research Institute, Beihang University(北京航空航天大学江西研究院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 GeoFlow是一款新型驾驶视频生成框架,通过构建几何对齐先验分布替代标准高斯噪声初始化,可提升生成效率与少步生成质量,减少推理步骤。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09637 2026-08-11 cs.CV cs.AI 新提交 57%

DUET: A Diversity-Quality Duet of Distillation Experts for Two-Step Video Generation

DUET:用于两步视频生成的蒸馏专家的多样性-质量二重奏

Zian Li, Litong Gong, Borui Liao, Pengfei Liu, Xinyu Wang, Xinyuan Wei, Yifan Gao, Tiezheng Ge, Muhan Zhang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出DUET模型,通过噪声级专家二重奏协调两步视频生成中质量与多样性的权衡,经改进的DUET+进一步提升质量并保留多样性优势,效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03218 2026-08-05 cs.CV cs.AI 新提交 57%

Self-Supervised Representation-Guided Generative Dataset Distillation

自监督表示引导的生成式数据集蒸馏

Mingzhuo Li, Guang Li, Linfeng Ye, Jiafeng Mao, Takahiro Ogawa, Konstantinos N. Plataniotis, Miki Haseyama

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出SRG框架,将SSL几何转化为扩散引导,通过分阶段引导策略实现数据集蒸馏,在多数据集和IPC设置下优于生成式基线,可跨预训练表示空间迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02504 2026-08-04 cs.CV 新提交 57%

Token Radius Attention for Efficient Video Generation

用于高效视频生成的 Token 半径注意力机制

Jiayu Chen, Zhikun Jiang, Maoliang Li, Jiayi Luo, Jiawei Yang, Zihao Zheng, Hengyi Zhang, Guojie Luo, Xiang Chen

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对视频扩散 Transformer 自注意力计算成本高的问题,提出 Token 半径注意力机制,在多种视频生成模型配置上实现了高效加速,同时保持了良好的生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01288 2026-08-04 cs.CV 新提交 57%

TurboClear: One-Step Object-Effect Removal via Region-Calibrated Distribution Matching and Fusion

TurboClear:基于区域校准分布匹配与融合的单步对象-效果去除方法

Jiawei Guo, Junxian Li, Yixin Tang, Bingya Zhang, Jiaxin Lu, Yulun Zhang, Shangchen Zhou

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于SDXL的单步对象-效果去除模型TurboClear,通过区域校准分布匹配与可学习空间融合,大幅降低计算开销且保持良好视觉质量,效率优于相关基线方法。

Comments Code: https://github.com/GuoCalix/TurboClear

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00769 2026-08-04 cs.CV 新提交 57%

ChordVideo: One-Step, Training-Free, Temporally Consistent Video Editing via Low-Energy Transport

ChordVideo:基于低能量传输的一步式、无训练、时间一致的视频编辑

Zhiqiang Lao

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV

AI总结 ChordVideo扩展低能量原理到视频时间,通过共享噪声等技术解决ChordEdit的视频编辑时间问题,在TGVE/DAVIS上多指标提升,步数远少于多步编辑器

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00537 2026-08-04 cs.CV 新提交 57%

Hybrid-Domain Posterior Sampling for Inverse Problems via Latent Flow Matching

基于潜在流匹配的混合域后验采样用于逆问题

Hongjie Wu, Yiping Xie, Jiancheng Lv

机构 * College of Computer Science, Sichuan University(四川大学计算机学院)

专题命中 效率与蒸馏 :image synthesis(abstract);分类 cs.CV

AI总结 针对潜在流模型应用于逆问题的一阶流形盲区瓶颈,提出混合域后验采样框架,结合朗之万动力学与潜在对齐,在多类逆问题上取得新的最优性能。

Comments Accepted to ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28144 2026-07-31 eess.IV cs.CV 新提交 57%

ReGenVC: End-to-End Real-Time Generative Video Coding at Ultra-Low Bitrate

ReGenVC:超低位率下的端到端实时生成式视频编码

Zheyuan Zhang, Johnson Wu

机构 * Intel Corporation(英特尔公司)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 ReGenVC是首个结合超低位率编码与实时解码的端到端生成式视频编解码器,通过技术优化实现24 fps输出,内存占用显著降低。

Comments 12 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27755 2026-07-31 cs.CV 新提交 57%

EgoGVAE: Ego-body Mesh Reconstruction via Guided Variational Autoencoder

EgoGVAE:基于引导变分自编码器的自我身体网格重建

Jaehun Jung, Wonjun Kim

机构 * Konkuk University(建国大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对仅用头部姿态重建全身网格的难题,提出EgoGVAE方法,通过引导变分自编码器实现一步采样,推理速度比扩散方法快50倍以上,在基准数据集上提升了重建性能。

Comments 18 pages, 6 figures, Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27113 2026-07-30 cs.CV 新提交 57%

Veritas++: Value-aware On-Policy Distillation for Perception-Enhanced AIGI Detection

Veritas++:面向感知增强的AIGI检测的值感知在线策略蒸馏

Hao Tan, Jun Lan, Zichang Tan, Ajian Liu, Zijian Yu, Chuanbiao Song, Huijia Zhu, Weiqiang Wang, Jun Wan, Zhen Lei

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences (UCAS)(中国科学院大学先进交叉科学学院) Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences (UCAS)(中国科学院大学人工智能学院) Ant Group(蚂蚁集团) Sangfor Technologies Inc.(深信服科技股份有限公司)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 该研究针对现有AIGI检测模型的感知瓶颈,提出Veritas++框架,通过PoRL与VaOPD机制增强感知能力,提升了检测泛化性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24377 2026-07-28 cs.LG cs.AI cs.CV 新提交 57%

MXAttention: Data-Free Optimal Scaling and Pre-Normalization Quantization for MXFP4 Attention

MXAttention:用于MXFP4注意力的数据无关最优缩放和预归一化量化

Jianlin Yu, Jing Lin, Linghui Kong, Aiyue Chen, Weiyi Sun, Chenyu Zeng, Wangli Lan, Jinxi Li, Zhuo Zheng, Ziyang Yue, Danning Ke, Fei Yi, Tianchi Hu, Yuan Ding, Yiwu Yao, Junsong Wang

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对基于扩散的视频生成模型中注意力二次成本的瓶颈,提出MXAttention框架,通过引入通用最优缩放和预归一化量化组件,缩小了MXFP4与FP16的成像质量差距,提升了帧级相似度,且性能与强大基线竞争。

详情

展开后加载摘要…

URL PDF HTML 收藏