GEAR: Guided End-to-End AutoRegression for Image Synthesis
GEAR: 引导式端到端自回归图像合成
机构 * Peking University(北京大学) ; Tencent Hunyuan(腾讯混元)
AI总结 提出GEAR方法,通过表示对齐联合训练VQ分词器和自回归生成器,解决非可微索引导致的梯度问题,实现端到端优化,显著加速ImageNet gFID收敛并提升特征质量。
大厂专区
GEAR: 引导式端到端自回归图像合成
机构 * Peking University(北京大学) ; Tencent Hunyuan(腾讯混元)
AI总结 提出GEAR方法,通过表示对齐联合训练VQ分词器和自回归生成器,解决非可微索引导致的梯度问题,实现端到端优化,显著加速ImageNet gFID收敛并提升特征质量。
Mesh BDF: 用于原生3D网格生成的重心支配场
机构 * HKU(香港大学) ; Shenzhen Loop Area Institute(深圳河套学院) ; Tencent Hunyuan 3D(腾讯混元3D) ; NTU(南洋理工大学)
AI总结 提出重心支配场(BDF),一种在三角网格表面上定义的连续表示,将顶点拓扑连接编码为连续信号,弥合离散网格拓扑与连续扩散生成模型之间的差距,使扩散模型能生成高质量、可扩展且鲁棒的原生网格。
Comments 15 pages, 6 figures
先规划正确,再规划紧凑:面向高效具身推理的符号强化学习
机构 * Tsinghua University(清华大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; Tencent(腾讯) ; University of London(伦敦大学)
AI总结 针对具身任务规划中缺乏低成本确定性验证的问题,提出基于BDDL规范的符号强化学习框架,通过视频解析、LLM验证和轻量符号引擎提供毫秒级密集反馈,并引入难度感知长度调度GroupAdapt,在BEHAVIOR-1000上实现97.3的严格通过率,相对Qwen3-8B提升25.9%。
Comments 18 pages, 10 figures, 14 tables; includes appendix
SyncCache: 利用非对称动力学实现快速音频驱动肖像动画
机构 * Shenzhen Graduate School, Peking University(北京大学深圳研究生院) ; Shanghai AI Laboratory(上海人工智能实验室) ; Tencent Hunyuan(腾讯混元) ; vivo
AI总结 提出SyncCache,一种针对DiT肖像动画的无训练缓存加速方法,通过空间非对称探测和模态解耦缓存利用非对称动力学,实现高达4.12倍加速且保持视觉保真度和音频对齐。
Comments ECCV 2026
PolyFlow: 连续拓扑嵌入流匹配用于艺术家风格网格生成
机构 * ZJU(浙江大学) ; Tencent(腾讯) ; THU(清华大学) ; CUHK(香港中文大学) ; HKUST(香港科技大学) ; HKU(香港大学)
AI总结 提出PolyFlow,通过连续拓扑嵌入将离散网格转换为连续顶点状态空间,结合Transformer流匹配实现并行去噪,在保持高质量拓扑的同时大幅提升生成速度。
ViQ: 任意分辨率下的文本对齐视觉量化表示
机构 * Tencent HY Vision Team(腾讯HY视觉团队) ; Tsinghua University(清华大学) ; Nanyang Technological University(南洋理工大学) ; Chinese Academy of Sciences(中国科学院)
AI总结 提出ViQ框架,通过文本对齐预训练和特征离散化两阶段量化学习,平衡离散表示中的语义与细节,支持原生分辨率输入,在多模态任务中取得与连续高维特征编码器相当的性能,并实现20%-70%的训练加速。
Comments Accepted to ECCV 2026