XMSE-Aware Adaptive Empirical Bayes Estimation
XMSE感知的自适应经验贝叶斯估计
机构 * Tencent Technology(腾讯科技) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
AI总结 提出一种XMSE感知的混合估计器,在ML和EB之间插值,通过闭式最优权重实现二阶风险不劣于两者,并证明其一致性及后悔界。
Comments 16 pages, 1 figure, 14 tables
大厂专区
XMSE感知的自适应经验贝叶斯估计
机构 * Tencent Technology(腾讯科技) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
AI总结 提出一种XMSE感知的混合估计器,在ML和EB之间插值,通过闭式最优权重实现二阶风险不劣于两者,并证明其一致性及后悔界。
Comments 16 pages, 1 figure, 14 tables
HarmVideoBench:大型多模态模型中有害视频理解的基准测试
机构 * Central South University(中南大学) ; Tsinghua University(清华大学) ; South China Normal University(华南师范大学) ; ByteDance Inc(字节跳动公司) ; University of Zaragoza(阿拉维达大学) ; CosmosMind ; Wuhan University(武汉大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Southeast University(东南大学) ; Tencent(腾讯公司) ; Nankai University(南开大学) ; Supermicro Computer Inc(Supermicro计算机公司) ; Huazhong University of Science and Technology(华中科技大学)
AI总结 提出HarmVideoBench,一个包含1379个视频和4137道选择题的多层次诊断基准,从三个维度评估模型对有害视频的深层理解,并引入BCR方法将宏平均准确率从61.7%提升至84.4%。
TMP:面向大规模图像生成与编辑的树结构混合策略剪枝
机构 * Multimodal Model Department, Tencent(腾讯多模态模型部)
AI总结 提出首个树结构混合策略剪枝框架TMP,适用于文本到图像和文本引导图像到图像任务及MoE/DiT架构,以75%压缩比将HunyuanImage 3.0从80B降至20B参数,并在单张4090 GPU上推理。
Comments 10 pages, 3 figures, 3 tables, tech report
通过心理学推理和角色感知策略优化改进通用角色扮演智能体
机构 * Zhejiang University(浙江大学) ; Tencent Youtu Lab(腾讯优图实验室)
AI总结 提出Psy-CoT框架,将角色推理分解为三步,并结合RAPO算法通过互信息加权梯度,提升角色扮演的忠实度和泛化能力。
PortraitGen: 基于示例驱动的双奖励引导GRPO的逼真肖像生成
机构 * Dalian University of Technology(大连理工大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Zhejiang University(浙江大学) ; WeChat, Tencent Inc.(腾讯微信)
AI总结 提出PortraitGen框架,通过将真实图像引入GRPO采样组并设计双奖励机制(OmniReward和AI-Portrait),有效抑制AI伪影,实现逼真肖像生成。
容量控制的多视图3D高斯泼溅风格化
机构 * Guangdong Provincial Key Laboratory of Visual Media and Multidimensional Intelligence, CSSE, Shenzhen University(广东省可视媒体与多维智能重点实验室,计算机科学与软件工程学院,深圳大学) ; Tencent Games(腾讯游戏) ; The Hebrew University of Jerusalem(耶路撒冷希伯来大学) ; Tel Aviv University(特拉维夫大学)
AI总结 提出基于最优传输的容量控制框架,通过半平衡最优传输和列容量约束解决多视图风格分配不稳定问题,实现跨视图一致的3D风格化。
Comments Accepted to ECCV 2026. Project page: https://vcc2310.github.io/SceneStyler/
PhysEditWorld: 一个面向物理可编辑世界模型的大规模数据集
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Beihang University(北京航空航天大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; Independent Researcher(独立研究者) ; Shanghai Jiao Tong University(上海交通大学) ; Sun Yat-sen University(中山大学) ; The Chinese University of Hong Kong(香港中文大学) ; Tencent(腾讯)
AI总结 提出PhysEditWorld数据集,通过UE5重放渲染管线生成多重力配置下的动作条件视频,支持可控物理编辑,用于改进世界模型的动力学建模和一致性。
Comments Project page: https://yizhiqianbi.github.io/physeditworld/
WQ-Fusion: 用于跨域音频表示的动态门控注意力
机构 * School of Electronic Information, Wuhan University(武汉大学电子信息学院) ; Tencent AI Lab Seattle(腾讯AI实验室西雅图) ; CIAIC, Northwestern Polytechnical University(西北工业大学CIAIC) ; INRS-EMT, University of Quebec(魁北克大学INRS-EMT)
AI总结 提出WQ-Fusion双编码器框架,通过自适应特征调制和元素级门控注意力动态融合Whisper与Qwen,在Interspeech 2026音频编码器能力挑战赛中取得0.836总分,显著优于单编码器基线。
Comments Accepted by INTERSPEECH 2026
VoiceTTA: 通过基于强化学习的测试时自适应增强零样本文本到语音
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Tencent(腾讯)
AI总结 提出VoiceTTA,一种基于强化学习的测试时自适应方法,通过优化可学习前缀和风格奖励,提升预训练零样本TTS模型对罕见语音风格的模仿能力。
Comments 5 pages, accepted to Interspeech 2026
语义生成微调用于统一多模态模型
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tencent ARCLab(腾讯ARCLab)
AI总结 本文提出语义生成微调(SGT)方法,通过将高阶语义任务作为生成代理,统一多模态模型的感知与生成能力,提升多模态理解和生成质量。
Comments 14 pages, 13 figures
从猜测到占位:一种基于代价理论的不确定性感知代码补全框架
机构 * Tencent, Shenzhen, China(腾讯深圳公司)
AI总结 针对硬补全范式在不确定上下文中生成错误代码的问题,提出自适应占位补全框架,在高熵位置输出占位符,理论证明其期望代价低于硬补全,实验显示编辑代价降低19%-50%。