arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Tencent(腾讯)

2026-06-26 至 2026-06-26 共收录 11
2606.26975 2026-06-26 stat.ML cs.AI cs.LG cs.SY eess.SY stat.ME 新提交

XMSE-Aware Adaptive Empirical Bayes Estimation

XMSE感知的自适应经验贝叶斯估计

Minghao Chen, Jiale Zheng

机构 * Tencent Technology(腾讯科技) Huawei Noah’s Ark Lab(华为诺亚实验室)

AI总结 提出一种XMSE感知的混合估计器,在ML和EB之间插值,通过闭式最优权重实现二阶风险不劣于两者,并证明其一致性及后悔界。

Comments 16 pages, 1 figure, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27187 2026-06-26 cs.CV cs.CL 新提交

HarmVideoBench: Benchmarking Harmful Video Understanding in Large Multimodal Models

HarmVideoBench:大型多模态模型中有害视频理解的基准测试

Jiajun Wu, Haoyu Kang, Yining Sun, Jiacheng Hou, Heng Zhang, Danyang Zhang, Zhenjun Zhao, Haochi Zhang, Leixin Sun, Eric Hanchen Jiang, Yushan Li, Ruiyu Li, Mengkai Huang, Yan Gao, Xu Zhang, Guancheng Wan

机构 * Central South University(中南大学) Tsinghua University(清华大学) South China Normal University(华南师范大学) ByteDance Inc(字节跳动公司) University of Zaragoza(阿拉维达大学) CosmosMind Wuhan University(武汉大学) University of California, Los Angeles(加州大学洛杉矶分校) Southeast University(东南大学) Tencent(腾讯公司) Nankai University(南开大学) Supermicro Computer Inc(Supermicro计算机公司) Huazhong University of Science and Technology(华中科技大学)

AI总结 提出HarmVideoBench,一个包含1379个视频和4137道选择题的多层次诊断基准,从三个维度评估模型对有害视频的深层理解,并引入BCR方法将宏平均准确率从61.7%提升至84.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27089 2026-06-26 cs.CV 新提交

TMP: Tree-structured Mixed-policy Pruning for Large-scale Image Generation and Editing

TMP:面向大规模图像生成与编辑的树结构混合策略剪枝

Peizhen Zhang, Yang Li, Xunsong Li, Songtao Liu, Zewen Liu, Qiangqiang Hu, Guotong Guo, Jupeng Ding, Yifu Sun, coopersli, Jian Zhang, Zhao Zhong, Liefeng Bo

机构 * Multimodal Model Department, Tencent(腾讯多模态模型部)

AI总结 提出首个树结构混合策略剪枝框架TMP,适用于文本到图像和文本引导图像到图像任务及MoE/DiT架构,以75%压缩比将HunyuanImage 3.0从80B降至20B参数,并在单张4090 GPU上推理。

Comments 10 pages, 3 figures, 3 tables, tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27025 2026-06-26 cs.CL 新提交

Improving General Role-Playing Agents via Psychology-Grounded Reasoning and Role-Aware Policy Optimization

通过心理学推理和角色感知策略优化改进通用角色扮演智能体

Zhenhua Xu, Dongsheng Chen, Jian Li, Yitong Lin, Zhebo Wang, Jiafu Wu, Yizhang Jin, Chengjie Wang, Meng Han, Yabiao Wang

机构 * Zhejiang University(浙江大学) Tencent Youtu Lab(腾讯优图实验室)

AI总结 提出Psy-CoT框架,将角色推理分解为三步,并结合RAPO算法通过互信息加权梯度,提升角色扮演的忠实度和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26930 2026-06-26 cs.CV 新提交

PortraitGen: Exemplar-Driven GRPO with Dual-Reward Guidance for Photorealistic Portrait Generation

PortraitGen: 基于示例驱动的双奖励引导GRPO的逼真肖像生成

Xiaomin Li, Qian Liang, Yinan Li, Ying Zhang, Chen Li, Jing Lyu, Huchuan Lu, Xu Jia

机构 * Dalian University of Technology(大连理工大学) University of Electronic Science and Technology of China(电子科技大学) Zhejiang University(浙江大学) WeChat, Tencent Inc.(腾讯微信)

AI总结 提出PortraitGen框架,通过将真实图像引入GRPO采样组并设计双奖励机制(OmniReward和AI-Portrait),有效抑制AI伪影,实现逼真肖像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26754 2026-06-26 cs.CV 新提交

Capacity-Controlled Multi-View Stylization of 3D Gaussian Splatting

容量控制的多视图3D高斯泼溅风格化

Zhihao Wen, Yixin Yang, Bojian Wu, Yang Zhou, Dani Lischinski, Daniel Cohen-Or, Hui Huang

机构 * Guangdong Provincial Key Laboratory of Visual Media and Multidimensional Intelligence, CSSE, Shenzhen University(广东省可视媒体与多维智能重点实验室,计算机科学与软件工程学院,深圳大学) Tencent Games(腾讯游戏) The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Tel Aviv University(特拉维夫大学)

AI总结 提出基于最优传输的容量控制框架,通过半平衡最优传输和列容量约束解决多视图风格分配不稳定问题,实现跨视图一致的3D风格化。

Comments Accepted to ECCV 2026. Project page: https://vcc2310.github.io/SceneStyler/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26694 2026-06-26 cs.CV 新提交

PhysEditWorld: A Large-Scale Dataset Toward Physics-Editable World Models

PhysEditWorld: 一个面向物理可编辑世界模型的大规模数据集

Bin Hu, Yanwen Ma, Jiehui Huang, Ziliang Zhang, Haoning Wu, Ruicheng Zhang, Yaokun Li, Zijun Wang, Yuechen Zhang, Chun-Mei Tseng, Hanhui Li, Shengju Qian, Jun Zhou, Kaipeng Zhang, Xiaodan Liang, Jiaya Jia, Xiu Li

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Beihang University(北京航空航天大学) The Hong Kong University of Science and Technology(香港科技大学) Independent Researcher(独立研究者) Shanghai Jiao Tong University(上海交通大学) Sun Yat-sen University(中山大学) The Chinese University of Hong Kong(香港中文大学) Tencent(腾讯)

AI总结 提出PhysEditWorld数据集,通过UE5重放渲染管线生成多重力配置下的动作条件视频,支持可控物理编辑,用于改进世界模型的动力学建模和一致性。

Comments Project page: https://yizhiqianbi.github.io/physeditworld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26556 2026-06-26 cs.SD cs.MM eess.AS 新提交

WQ-Fusion: Dynamic Gated Attention for Cross-Domain Audio Representation

WQ-Fusion: 用于跨域音频表示的动态门控注意力

Mingda Lin, Lei Ding, Xinyue Zhou, Tiantian Xiong, Hanchen Pei, Gongping Huang, Hao Zhang, Jingdong Chen, Jacob Benesty

机构 * School of Electronic Information, Wuhan University(武汉大学电子信息学院) Tencent AI Lab Seattle(腾讯AI实验室西雅图) CIAIC, Northwestern Polytechnical University(西北工业大学CIAIC) INRS-EMT, University of Quebec(魁北克大学INRS-EMT)

AI总结 提出WQ-Fusion双编码器框架,通过自适应特征调制和元素级门控注意力动态融合Whisper与Qwen,在Interspeech 2026音频编码器能力挑战赛中取得0.836总分,显著优于单编码器基线。

Comments Accepted by INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26534 2026-06-26 cs.SD cs.AI 新提交

VoiceTTA: Enhancing Zero-Shot Text-to-Speech via Reinforcement Learning-Based Test-Time Adaptation

VoiceTTA: 通过基于强化学习的测试时自适应增强零样本文本到语音

Tianxin Xie, Chenxing Li, Dong Yu, Li Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tencent(腾讯)

AI总结 提出VoiceTTA,一种基于强化学习的测试时自适应方法,通过优化可学习前缀和风格奖励,提升预训练零样本TTS模型对罕见语音风格的模仿能力。

Comments 5 pages, accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18714 2026-06-26 cs.CV cs.AI 版本更新

Semantic Generative Tuning for Unified Multimodal Models

语义生成微调用于统一多模态模型

Songsong Yu, Yuxin Chen, Ying Shan, Yanwei Li

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent ARCLab(腾讯ARCLab)

AI总结 本文提出语义生成微调(SGT)方法,通过将高阶语义任务作为生成代理,统一多模态模型的感知与生成能力,提升多模态理解和生成质量。

Comments 14 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01849 2026-06-26 cs.CL 版本更新

From Guessing to Placeholding: A Cost-Theoretic Framework for Uncertainty-Aware Code Completion

从猜测到占位:一种基于代价理论的不确定性感知代码补全框架

Liang Zhu, Haolin Chen, Lidong Zhao, Xian Wu

机构 * Tencent, Shenzhen, China(腾讯深圳公司)

AI总结 针对硬补全范式在不确定上下文中生成错误代码的问题,提出自适应占位补全框架,在高熵位置输出占位符,理论证明其期望代价低于硬补全,实验显示编辑代价降低19%-50%。

详情

展开后加载摘要…

URL PDF HTML 收藏